{"timestamp_utc": "2026-04-12T15:58:35Z", "mode": "train", "global_step": 1, "epoch": 5.2628809010052104e-05, "loss": 0.1988, "grad_norm": 20.09337043762207, "learning_rate": 1e-05, "num_tokens": 1556.0, "completions/mean_length": 32.5, "completions/min_length": 20.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.5, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.653188943862915, "rewards/meter/std": 0.44728460907936096, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9054144620895386, "rewards/lexical_plausibility/std": 0.1331765353679657, "rewards/judge_quality/mean": 0.27125000953674316, "rewards/judge_quality/std": 0.2713162302970886, "rewards/repeat_penalty/mean": 0.7492251992225647, "rewards/repeat_penalty/std": 0.002191446488723159, "rewards/repeat_floor/mean": 0.9848450422286987, "rewards/repeat_floor/std": 0.0004382850893307477, "rewards/near_duplicate_penalty/mean": 0.9989669322967529, "rewards/near_duplicate_penalty/std": 0.002921935636550188, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2107067108154297, "rewards/total_composite/std": 0.28980186581611633, "reward": 0.2107067108154297, "reward_std": 0.28980186581611633, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22281700372695923, "sampling/sampling_logp_difference/max": 2.2011396884918213, "sampling/importance_sampling_ratio/min": 0.11067695170640945, "sampling/importance_sampling_ratio/mean": 0.9999842643737793, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5754356235265732, "clip_ratio/low_mean": 0.1252038492821157, "clip_ratio/low_min": 0.1252038492821157, "clip_ratio/high_mean": 0.08266128972172737, "clip_ratio/high_max": 0.08266128972172737, "clip_ratio/region_mean": 0.20786513900384307, "reward_total_mean": 0.2107067108154297, "reward_meter_mean": 0.653188943862915, "reward_meter_std": 0.44728460907936096, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9054144620895386, "reward_lexical_plausibility_std": 0.1331765353679657, "reward_repeat_penalty_mean": 0.7492251992225647, "reward_repeat_penalty_std": 0.002191446488723159, "reward_repeat_floor_mean": 0.9848450422286987, "reward_repeat_floor_std": 0.0004382850893307477, "reward_near_duplicate_penalty_mean": 0.9989669322967529, "reward_near_duplicate_penalty_std": 0.002921935636550188, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.27125000953674316, "reward_judge_quality_std": 0.2713162302970886, "reward_total_composite_mean": 0.2107067108154297, "reward_total_composite_std": 0.28980186581611633} {"timestamp_utc": "2026-04-12T15:58:46Z", "mode": "train", "global_step": 2, "epoch": 0.00010525761802010421, "loss": 0.0541, "grad_norm": 9.90222454071045, "learning_rate": 9.996969696969698e-06, "num_tokens": 4696.0, "completions/mean_length": 202.5, "completions/min_length": 195.0, "completions/max_length": 212.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 202.5, "completions/min_terminated_length": 195.0, "completions/max_terminated_length": 212.0, "rewards/meter/mean": 0.40368834137916565, "rewards/meter/std": 0.27416813373565674, "rewards/count_adherence/mean": 0.9583333134651184, "rewards/count_adherence/std": 0.05750546231865883, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.017251653596758842, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.9722908735275269, "rewards/repeat_penalty/std": 0.023187976330518723, "rewards/repeat_floor/mean": 0.996211051940918, "rewards/repeat_floor/std": 0.0025169842410832644, "rewards/near_duplicate_penalty/mean": 0.9787192344665527, "rewards/near_duplicate_penalty/std": 0.008377094753086567, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9933686852455139, "rewards/distinct_2/std": 0.01875614933669567, "rewards/total_composite/mean": 0.14162755012512207, "rewards/total_composite/std": 0.09327300637960434, "reward": 0.14162755012512207, "reward_std": 0.09327300637960434, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18262526392936707, "sampling/sampling_logp_difference/max": 3.432194709777832, "sampling/importance_sampling_ratio/min": 0.0323159396648407, "sampling/importance_sampling_ratio/mean": 0.9920792579650879, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.697647899389267, "clip_ratio/low_mean": 0.0823319898918271, "clip_ratio/low_min": 0.0823319898918271, "clip_ratio/high_mean": 0.06837169267237186, "clip_ratio/high_max": 0.06837169267237186, "clip_ratio/region_mean": 0.15070368256419897, "reward_total_mean": 0.14162755012512207, "reward_meter_mean": 0.40368834137916565, "reward_meter_std": 0.27416813373565674, "reward_count_adherence_mean": 0.9583333134651184, "reward_count_adherence_std": 0.05750546231865883, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.017251653596758842, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9722908735275269, "reward_repeat_penalty_std": 0.023187976330518723, "reward_repeat_floor_mean": 0.996211051940918, "reward_repeat_floor_std": 0.0025169842410832644, "reward_near_duplicate_penalty_mean": 0.9787192344665527, "reward_near_duplicate_penalty_std": 0.008377094753086567, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9933686852455139, "reward_distinct_2_std": 0.01875614933669567, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.14162755012512207, "reward_total_composite_std": 0.09327300637960434} {"timestamp_utc": "2026-04-12T15:58:57Z", "mode": "train", "global_step": 3, "epoch": 0.0001578864270301563, "loss": 0.0513, "grad_norm": 12.573843002319336, "learning_rate": 9.993939393939395e-06, "num_tokens": 6843.0, "completions/mean_length": 84.375, "completions/min_length": 64.0, "completions/max_length": 101.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 84.375, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 101.0, "rewards/meter/mean": 0.6097227334976196, "rewards/meter/std": 0.37561020255088806, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9436274766921997, "rewards/lexical_plausibility/std": 0.10242299735546112, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9936990737915039, "rewards/repeat_penalty/std": 0.003470573341473937, "rewards/repeat_floor/mean": 0.9990548491477966, "rewards/repeat_floor/std": 0.0005205817287787795, "rewards/near_duplicate_penalty/mean": 0.9936990737915039, "rewards/near_duplicate_penalty/std": 0.003470573341473937, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1688469648361206, "rewards/total_composite/std": 0.12597337365150452, "reward": 0.1688469648361206, "reward_std": 0.12597337365150452, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2326127141714096, "sampling/sampling_logp_difference/max": 2.259091377258301, "sampling/importance_sampling_ratio/min": 0.10444534569978714, "sampling/importance_sampling_ratio/mean": 1.0231131315231323, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9617455154657364, "clip_ratio/low_mean": 0.126793647184968, "clip_ratio/low_min": 0.126793647184968, "clip_ratio/high_mean": 0.0766318216919899, "clip_ratio/high_max": 0.0766318216919899, "clip_ratio/region_mean": 0.2034254688769579, "reward_total_mean": 0.1688469648361206, "reward_meter_mean": 0.6097227334976196, "reward_meter_std": 0.37561020255088806, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9436274766921997, "reward_lexical_plausibility_std": 0.10242299735546112, "reward_repeat_penalty_mean": 0.9936990737915039, "reward_repeat_penalty_std": 0.003470573341473937, "reward_repeat_floor_mean": 0.9990548491477966, "reward_repeat_floor_std": 0.0005205817287787795, "reward_near_duplicate_penalty_mean": 0.9936990737915039, "reward_near_duplicate_penalty_std": 0.003470573341473937, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.1688469648361206, "reward_total_composite_std": 0.12597337365150452} {"timestamp_utc": "2026-04-12T15:59:07Z", "mode": "train", "global_step": 4, "epoch": 0.00021051523604020842, "loss": 0.0515, "grad_norm": 14.311335563659668, "learning_rate": 9.990909090909093e-06, "num_tokens": 8345.0, "completions/mean_length": 46.75, "completions/min_length": 29.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.75, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.6345551013946533, "rewards/meter/std": 0.4597727954387665, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9836230278015137, "rewards/lexical_plausibility/std": 0.04632115736603737, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.21999594569206238, "rewards/repeat_penalty/mean": 0.9836134910583496, "rewards/repeat_penalty/std": 0.02421470545232296, "rewards/repeat_floor/mean": 0.9975420236587524, "rewards/repeat_floor/std": 0.0036322178784757853, "rewards/near_duplicate_penalty/mean": 0.9836134910583496, "rewards/near_duplicate_penalty/std": 0.02421470545232296, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.31212854385375977, "rewards/total_composite/std": 0.28672724962234497, "reward": 0.31212854385375977, "reward_std": 0.28672724962234497, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23379011452198029, "sampling/sampling_logp_difference/max": 1.7445611953735352, "sampling/importance_sampling_ratio/min": 0.1747216433286667, "sampling/importance_sampling_ratio/mean": 1.0515234470367432, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7860644608736038, "clip_ratio/low_mean": 0.10407150536775589, "clip_ratio/low_min": 0.10407150536775589, "clip_ratio/high_mean": 0.12573344260454178, "clip_ratio/high_max": 0.12573344260454178, "clip_ratio/region_mean": 0.22980494797229767, "reward_total_mean": 0.31212854385375977, "reward_meter_mean": 0.6345551013946533, "reward_meter_std": 0.4597727954387665, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9836230278015137, "reward_lexical_plausibility_std": 0.04632115736603737, "reward_repeat_penalty_mean": 0.9836134910583496, "reward_repeat_penalty_std": 0.02421470545232296, "reward_repeat_floor_mean": 0.9975420236587524, "reward_repeat_floor_std": 0.0036322178784757853, "reward_near_duplicate_penalty_mean": 0.9836134910583496, "reward_near_duplicate_penalty_std": 0.02421470545232296, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.21999594569206238, "reward_total_composite_mean": 0.31212854385375977, "reward_total_composite_std": 0.28672724962234497} {"timestamp_utc": "2026-04-12T15:59:16Z", "mode": "train", "global_step": 5, "epoch": 0.0002631440450502605, "loss": 0.0456, "grad_norm": 11.538812637329102, "learning_rate": 9.987878787878788e-06, "num_tokens": 10140.0, "completions/mean_length": 64.375, "completions/min_length": 47.0, "completions/max_length": 80.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.375, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.7967674732208252, "rewards/meter/std": 0.34278610348701477, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9899553656578064, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.36625000834465027, "rewards/judge_quality/std": 0.22639645636081696, "rewards/repeat_penalty/mean": 0.999139130115509, "rewards/repeat_penalty/std": 0.002434949856251478, "rewards/repeat_floor/mean": 0.9998708963394165, "rewards/repeat_floor/std": 0.0003652445739135146, "rewards/near_duplicate_penalty/mean": 0.999139130115509, "rewards/near_duplicate_penalty/std": 0.002434949856251478, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3292407989501953, "rewards/total_composite/std": 0.25814321637153625, "reward": 0.3292407989501953, "reward_std": 0.25814321637153625, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18061591684818268, "sampling/sampling_logp_difference/max": 1.6605291366577148, "sampling/importance_sampling_ratio/min": 0.19003839790821075, "sampling/importance_sampling_ratio/mean": 1.0090373754501343, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8136060386896133, "clip_ratio/low_mean": 0.08147293515503407, "clip_ratio/low_min": 0.08147293515503407, "clip_ratio/high_mean": 0.1212398149073124, "clip_ratio/high_max": 0.1212398149073124, "clip_ratio/region_mean": 0.20271275006234646, "reward_total_mean": 0.3292407989501953, "reward_meter_mean": 0.7967674732208252, "reward_meter_std": 0.34278610348701477, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9899553656578064, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.999139130115509, "reward_repeat_penalty_std": 0.002434949856251478, "reward_repeat_floor_mean": 0.9998708963394165, "reward_repeat_floor_std": 0.0003652445739135146, "reward_near_duplicate_penalty_mean": 0.999139130115509, "reward_near_duplicate_penalty_std": 0.002434949856251478, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36625000834465027, "reward_judge_quality_std": 0.22639645636081696, "reward_total_composite_mean": 0.3292407989501953, "reward_total_composite_std": 0.25814321637153625} {"timestamp_utc": "2026-04-12T15:59:25Z", "mode": "train", "global_step": 6, "epoch": 0.0003157728540603126, "loss": 0.0275, "grad_norm": 12.958381652832031, "learning_rate": 9.984848484848485e-06, "num_tokens": 11899.0, "completions/mean_length": 58.875, "completions/min_length": 40.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.875, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.5878450274467468, "rewards/meter/std": 0.46913498640060425, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9604833126068115, "rewards/lexical_plausibility/std": 0.07437513023614883, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.2639264166355133, "rewards/repeat_penalty/mean": 0.9688584804534912, "rewards/repeat_penalty/std": 0.0629393607378006, "rewards/repeat_floor/mean": 0.9958750009536743, "rewards/repeat_floor/std": 0.00793202593922615, "rewards/near_duplicate_penalty/mean": 0.9797113537788391, "rewards/near_duplicate_penalty/std": 0.033393166959285736, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9879807829856873, "rewards/distinct_2/std": 0.03399552404880524, "rewards/total_composite/mean": 0.3447781205177307, "rewards/total_composite/std": 0.37308818101882935, "reward": 0.3447781205177307, "reward_std": 0.37308821082115173, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21205370128154755, "sampling/sampling_logp_difference/max": 2.3066372871398926, "sampling/importance_sampling_ratio/min": 0.09959560632705688, "sampling/importance_sampling_ratio/mean": 1.027489423751831, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.516320526599884, "clip_ratio/low_mean": 0.12161067128181458, "clip_ratio/low_min": 0.12161067128181458, "clip_ratio/high_mean": 0.07525585032999516, "clip_ratio/high_max": 0.07525585032999516, "clip_ratio/region_mean": 0.19686652161180973, "reward_total_mean": 0.3447781205177307, "reward_meter_mean": 0.5878450274467468, "reward_meter_std": 0.46913498640060425, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9604833126068115, "reward_lexical_plausibility_std": 0.07437513023614883, "reward_repeat_penalty_mean": 0.9688584804534912, "reward_repeat_penalty_std": 0.0629393607378006, "reward_repeat_floor_mean": 0.9958750009536743, "reward_repeat_floor_std": 0.00793202593922615, "reward_near_duplicate_penalty_mean": 0.9797113537788391, "reward_near_duplicate_penalty_std": 0.033393166959285736, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9879807829856873, "reward_distinct_2_std": 0.03399552404880524, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.2639264166355133, "reward_total_composite_mean": 0.3447781205177307, "reward_total_composite_std": 0.37308818101882935} {"timestamp_utc": "2026-04-12T15:59:34Z", "mode": "train", "global_step": 7, "epoch": 0.0003684016630703647, "loss": 0.2477, "grad_norm": 14.628622055053711, "learning_rate": 9.981818181818183e-06, "num_tokens": 13575.0, "completions/mean_length": 50.5, "completions/min_length": 32.0, "completions/max_length": 70.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.5, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.6770910024642944, "rewards/meter/std": 0.374254435300827, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.990183413028717, "rewards/repeat_penalty/std": 0.009771591052412987, "rewards/repeat_floor/mean": 0.9985275268554688, "rewards/repeat_floor/std": 0.0014657394494861364, "rewards/near_duplicate_penalty/mean": 0.990183413028717, "rewards/near_duplicate_penalty/std": 0.009771591052412987, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32056713104248047, "rewards/total_composite/std": 0.2870679199695587, "reward": 0.32056713104248047, "reward_std": 0.2870679199695587, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1809655725955963, "sampling/sampling_logp_difference/max": 1.6068577766418457, "sampling/importance_sampling_ratio/min": 0.2005166858434677, "sampling/importance_sampling_ratio/mean": 1.040963888168335, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2859416902065277, "clip_ratio/low_mean": 0.08865558542311192, "clip_ratio/low_min": 0.08865558542311192, "clip_ratio/high_mean": 0.04387405142188072, "clip_ratio/high_max": 0.04387405142188072, "clip_ratio/region_mean": 0.13252963684499264, "reward_total_mean": 0.32056713104248047, "reward_meter_mean": 0.6770910024642944, "reward_meter_std": 0.374254435300827, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.990183413028717, "reward_repeat_penalty_std": 0.009771591052412987, "reward_repeat_floor_mean": 0.9985275268554688, "reward_repeat_floor_std": 0.0014657394494861364, "reward_near_duplicate_penalty_mean": 0.990183413028717, "reward_near_duplicate_penalty_std": 0.009771591052412987, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.32056713104248047, "reward_total_composite_std": 0.2870679199695587} {"timestamp_utc": "2026-04-12T15:59:43Z", "mode": "train", "global_step": 8, "epoch": 0.00042103047208041683, "loss": -0.0288, "grad_norm": 19.75635528564453, "learning_rate": 9.97878787878788e-06, "num_tokens": 15216.0, "completions/mean_length": 41.125, "completions/min_length": 29.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.125, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.7961204648017883, "rewards/meter/std": 0.20362447202205658, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9633767008781433, "rewards/lexical_plausibility/std": 0.1035863608121872, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.2666056752204895, "rewards/repeat_penalty/mean": 0.9952322244644165, "rewards/repeat_penalty/std": 0.0048536453396081924, "rewards/repeat_floor/mean": 0.9992848634719849, "rewards/repeat_floor/std": 0.0007280543795786798, "rewards/near_duplicate_penalty/mean": 0.9952322244644165, "rewards/near_duplicate_penalty/std": 0.0048536453396081924, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.574169933795929, "rewards/total_composite/std": 0.3322398364543915, "reward": 0.574169933795929, "reward_std": 0.3322398364543915, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23442627489566803, "sampling/sampling_logp_difference/max": 1.3025455474853516, "sampling/importance_sampling_ratio/min": 0.2718389332294464, "sampling/importance_sampling_ratio/mean": 1.0258030891418457, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0661709010601044, "clip_ratio/low_mean": 0.12354860082268715, "clip_ratio/low_min": 0.12354860082268715, "clip_ratio/high_mean": 0.1104191280901432, "clip_ratio/high_max": 0.1104191280901432, "clip_ratio/region_mean": 0.23396772891283035, "reward_total_mean": 0.574169933795929, "reward_meter_mean": 0.7961204648017883, "reward_meter_std": 0.20362447202205658, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9633767008781433, "reward_lexical_plausibility_std": 0.1035863608121872, "reward_repeat_penalty_mean": 0.9952322244644165, "reward_repeat_penalty_std": 0.0048536453396081924, "reward_repeat_floor_mean": 0.9992848634719849, "reward_repeat_floor_std": 0.0007280543795786798, "reward_near_duplicate_penalty_mean": 0.9952322244644165, "reward_near_duplicate_penalty_std": 0.0048536453396081924, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.2666056752204895, "reward_total_composite_mean": 0.574169933795929, "reward_total_composite_std": 0.3322398364543915} {"timestamp_utc": "2026-04-12T15:59:53Z", "mode": "train", "global_step": 9, "epoch": 0.0004736592810904689, "loss": 0.1489, "grad_norm": 13.455046653747559, "learning_rate": 9.975757575757577e-06, "num_tokens": 16927.0, "completions/mean_length": 52.875, "completions/min_length": 31.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.875, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.9079039096832275, "rewards/meter/std": 0.11305537074804306, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4587499797344208, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.9866733551025391, "rewards/repeat_penalty/std": 0.014050498604774475, "rewards/repeat_floor/mean": 0.998000979423523, "rewards/repeat_floor/std": 0.0021075811237096786, "rewards/near_duplicate_penalty/mean": 0.9866733551025391, "rewards/near_duplicate_penalty/std": 0.014050498604774475, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.410701185464859, "rewards/total_composite/std": 0.15337826311588287, "reward": 0.410701185464859, "reward_std": 0.15337826311588287, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20689186453819275, "sampling/sampling_logp_difference/max": 1.2887544631958008, "sampling/importance_sampling_ratio/min": 0.27561384439468384, "sampling/importance_sampling_ratio/mean": 1.0080140829086304, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.917743593454361, "clip_ratio/low_mean": 0.1186765506863594, "clip_ratio/low_min": 0.1186765506863594, "clip_ratio/high_mean": 0.09586916491389275, "clip_ratio/high_max": 0.09586916491389275, "clip_ratio/region_mean": 0.21454571560025215, "reward_total_mean": 0.410701185464859, "reward_meter_mean": 0.9079039096832275, "reward_meter_std": 0.11305537074804306, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9866733551025391, "reward_repeat_penalty_std": 0.014050498604774475, "reward_repeat_floor_mean": 0.998000979423523, "reward_repeat_floor_std": 0.0021075811237096786, "reward_near_duplicate_penalty_mean": 0.9866733551025391, "reward_near_duplicate_penalty_std": 0.014050498604774475, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4587499797344208, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.410701185464859, "reward_total_composite_std": 0.15337826311588287} {"timestamp_utc": "2026-04-12T16:00:03Z", "mode": "train", "global_step": 10, "epoch": 0.000526288090100521, "loss": -0.0781, "grad_norm": 15.111937522888184, "learning_rate": 9.972727272727274e-06, "num_tokens": 18909.0, "completions/mean_length": 67.75, "completions/min_length": 49.0, "completions/max_length": 90.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 67.75, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 90.0, "rewards/meter/mean": 0.5851961970329285, "rewards/meter/std": 0.31481993198394775, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9904689788818359, "rewards/lexical_plausibility/std": 0.02695779874920845, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9864856004714966, "rewards/repeat_penalty/std": 0.01194615289568901, "rewards/repeat_floor/mean": 0.997972846031189, "rewards/repeat_floor/std": 0.0017919203964993358, "rewards/near_duplicate_penalty/mean": 0.9864856004714966, "rewards/near_duplicate_penalty/std": 0.01194615289568901, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24945786595344543, "rewards/total_composite/std": 0.14811070263385773, "reward": 0.24945786595344543, "reward_std": 0.14811071753501892, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22759608924388885, "sampling/sampling_logp_difference/max": 2.27805233001709, "sampling/importance_sampling_ratio/min": 0.10248362272977829, "sampling/importance_sampling_ratio/mean": 1.0295257568359375, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0101440995931625, "clip_ratio/low_mean": 0.13846822828054428, "clip_ratio/low_min": 0.13846822828054428, "clip_ratio/high_mean": 0.08745039813220501, "clip_ratio/high_max": 0.08745039813220501, "clip_ratio/region_mean": 0.2259186264127493, "reward_total_mean": 0.24945786595344543, "reward_meter_mean": 0.5851961970329285, "reward_meter_std": 0.31481993198394775, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9904689788818359, "reward_lexical_plausibility_std": 0.02695779874920845, "reward_repeat_penalty_mean": 0.9864856004714966, "reward_repeat_penalty_std": 0.01194615289568901, "reward_repeat_floor_mean": 0.997972846031189, "reward_repeat_floor_std": 0.0017919203964993358, "reward_near_duplicate_penalty_mean": 0.9864856004714966, "reward_near_duplicate_penalty_std": 0.01194615289568901, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.24945786595344543, "reward_total_composite_std": 0.14811070263385773} {"timestamp_utc": "2026-04-12T16:00:13Z", "mode": "train", "global_step": 11, "epoch": 0.0005789168991105732, "loss": 0.1132, "grad_norm": 20.49909210205078, "learning_rate": 9.96969696969697e-06, "num_tokens": 20513.0, "completions/mean_length": 42.5, "completions/min_length": 22.0, "completions/max_length": 78.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.5, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 78.0, "rewards/meter/mean": 0.3109018802642822, "rewards/meter/std": 0.37683284282684326, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.11160357296466827, "rewards/lexical_plausibility/mean": 0.8933573961257935, "rewards/lexical_plausibility/std": 0.15487238764762878, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.24136148393154144, "rewards/repeat_penalty/mean": 0.9677474498748779, "rewards/repeat_penalty/std": 0.026140382513403893, "rewards/repeat_floor/mean": 0.9951621294021606, "rewards/repeat_floor/std": 0.003921049647033215, "rewards/near_duplicate_penalty/mean": 0.9677474498748779, "rewards/near_duplicate_penalty/std": 0.026140382513403893, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.10126905143260956, "rewards/total_composite/std": 0.11812613904476166, "reward": 0.10126905143260956, "reward_std": 0.11812613904476166, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21175774931907654, "sampling/sampling_logp_difference/max": 1.951096534729004, "sampling/importance_sampling_ratio/min": 0.1421181559562683, "sampling/importance_sampling_ratio/mean": 1.0338985919952393, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5531779527664185, "clip_ratio/low_mean": 0.13862179778516293, "clip_ratio/low_min": 0.13862179778516293, "clip_ratio/high_mean": 0.08591545931994915, "clip_ratio/high_max": 0.08591545931994915, "clip_ratio/region_mean": 0.22453725710511208, "reward_total_mean": 0.10126905143260956, "reward_meter_mean": 0.3109018802642822, "reward_meter_std": 0.37683284282684326, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.11160357296466827, "reward_lexical_plausibility_mean": 0.8933573961257935, "reward_lexical_plausibility_std": 0.15487238764762878, "reward_repeat_penalty_mean": 0.9677474498748779, "reward_repeat_penalty_std": 0.026140382513403893, "reward_repeat_floor_mean": 0.9951621294021606, "reward_repeat_floor_std": 0.003921049647033215, "reward_near_duplicate_penalty_mean": 0.9677474498748779, "reward_near_duplicate_penalty_std": 0.026140382513403893, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.24136148393154144, "reward_total_composite_mean": 0.10126905143260956, "reward_total_composite_std": 0.11812613904476166} {"timestamp_utc": "2026-04-12T16:00:21Z", "mode": "train", "global_step": 12, "epoch": 0.0006315457081206252, "loss": 0.1082, "grad_norm": 28.53273582458496, "learning_rate": 9.966666666666667e-06, "num_tokens": 22129.0, "completions/mean_length": 42.0, "completions/min_length": 36.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.6041836738586426, "rewards/meter/std": 0.42832210659980774, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8725000023841858, "rewards/judge_quality/std": 0.1713601052761078, "rewards/repeat_penalty/mean": 0.999159038066864, "rewards/repeat_penalty/std": 0.0021877859253436327, "rewards/repeat_floor/mean": 0.9998738765716553, "rewards/repeat_floor/std": 0.0003281752287875861, "rewards/near_duplicate_penalty/mean": 0.999159038066864, "rewards/near_duplicate_penalty/std": 0.0021877859253436327, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5607736110687256, "rewards/total_composite/std": 0.41370680928230286, "reward": 0.5607736110687256, "reward_std": 0.41370677947998047, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16803176701068878, "sampling/sampling_logp_difference/max": 2.5533061027526855, "sampling/importance_sampling_ratio/min": 0.0778239443898201, "sampling/importance_sampling_ratio/mean": 1.0045020580291748, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5017555598169565, "clip_ratio/low_mean": 0.10567478649318218, "clip_ratio/low_min": 0.10567478649318218, "clip_ratio/high_mean": 0.03419225220568478, "clip_ratio/high_max": 0.03419225220568478, "clip_ratio/region_mean": 0.13986703869886696, "reward_total_mean": 0.5607736110687256, "reward_meter_mean": 0.6041836738586426, "reward_meter_std": 0.42832210659980774, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.999159038066864, "reward_repeat_penalty_std": 0.0021877859253436327, "reward_repeat_floor_mean": 0.9998738765716553, "reward_repeat_floor_std": 0.0003281752287875861, "reward_near_duplicate_penalty_mean": 0.999159038066864, "reward_near_duplicate_penalty_std": 0.0021877859253436327, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8725000023841858, "reward_judge_quality_std": 0.1713601052761078, "reward_total_composite_mean": 0.5607736110687256, "reward_total_composite_std": 0.41370680928230286} {"timestamp_utc": "2026-04-12T16:00:30Z", "mode": "train", "global_step": 13, "epoch": 0.0006841745171306773, "loss": 0.1447, "grad_norm": 19.016687393188477, "learning_rate": 9.963636363636364e-06, "num_tokens": 23838.0, "completions/mean_length": 49.625, "completions/min_length": 33.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.625, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.5367907285690308, "rewards/meter/std": 0.3970416188240051, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.24512389302253723, "rewards/repeat_penalty/mean": 0.9804203510284424, "rewards/repeat_penalty/std": 0.053552690893411636, "rewards/repeat_floor/mean": 0.9976269006729126, "rewards/repeat_floor/std": 0.006438884884119034, "rewards/near_duplicate_penalty/mean": 0.9909669160842896, "rewards/near_duplicate_penalty/std": 0.023752670735120773, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9886877536773682, "rewards/distinct_2/std": 0.031995780766010284, "rewards/total_composite/mean": 0.23786820471286774, "rewards/total_composite/std": 0.1558588743209839, "reward": 0.23786820471286774, "reward_std": 0.15585888922214508, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20183372497558594, "sampling/sampling_logp_difference/max": 1.2698707580566406, "sampling/importance_sampling_ratio/min": 0.3338880240917206, "sampling/importance_sampling_ratio/mean": 1.017527461051941, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8827667981386185, "clip_ratio/low_mean": 0.09016565605998039, "clip_ratio/low_min": 0.09016565605998039, "clip_ratio/high_mean": 0.0960752535611391, "clip_ratio/high_max": 0.0960752535611391, "clip_ratio/region_mean": 0.1862409096211195, "reward_total_mean": 0.23786820471286774, "reward_meter_mean": 0.5367907285690308, "reward_meter_std": 0.3970416188240051, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9804203510284424, "reward_repeat_penalty_std": 0.053552690893411636, "reward_repeat_floor_mean": 0.9976269006729126, "reward_repeat_floor_std": 0.006438884884119034, "reward_near_duplicate_penalty_mean": 0.9909669160842896, "reward_near_duplicate_penalty_std": 0.023752670735120773, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9886877536773682, "reward_distinct_2_std": 0.031995780766010284, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.24512389302253723, "reward_total_composite_mean": 0.23786820471286774, "reward_total_composite_std": 0.1558588743209839} {"timestamp_utc": "2026-04-12T16:00:39Z", "mode": "train", "global_step": 14, "epoch": 0.0007368033261407294, "loss": 0.0354, "grad_norm": 29.63947105407715, "learning_rate": 9.960606060606062e-06, "num_tokens": 25210.0, "completions/mean_length": 24.5, "completions/min_length": 17.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.5, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.7364341616630554, "rewards/meter/std": 0.24760419130325317, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7262499928474426, "rewards/judge_quality/std": 0.2859039604663849, "rewards/repeat_penalty/mean": 0.7446338534355164, "rewards/repeat_penalty/std": 0.015177796594798565, "rewards/repeat_floor/mean": 0.9839267730712891, "rewards/repeat_floor/std": 0.0030355635099112988, "rewards/near_duplicate_penalty/mean": 0.9928451180458069, "rewards/near_duplicate_penalty/std": 0.020237062126398087, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5186588168144226, "rewards/total_composite/std": 0.29185327887535095, "reward": 0.5186588168144226, "reward_std": 0.29185324907302856, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2531023621559143, "sampling/sampling_logp_difference/max": 1.7571344375610352, "sampling/importance_sampling_ratio/min": 0.17253857851028442, "sampling/importance_sampling_ratio/mean": 1.0228863954544067, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8715475499629974, "clip_ratio/low_mean": 0.07210934348404408, "clip_ratio/low_min": 0.07210934348404408, "clip_ratio/high_mean": 0.13814338576048613, "clip_ratio/high_max": 0.13814338576048613, "clip_ratio/region_mean": 0.2102527292445302, "reward_total_mean": 0.5186588168144226, "reward_meter_mean": 0.7364341616630554, "reward_meter_std": 0.24760419130325317, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7446338534355164, "reward_repeat_penalty_std": 0.015177796594798565, "reward_repeat_floor_mean": 0.9839267730712891, "reward_repeat_floor_std": 0.0030355635099112988, "reward_near_duplicate_penalty_mean": 0.9928451180458069, "reward_near_duplicate_penalty_std": 0.020237062126398087, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7262499928474426, "reward_judge_quality_std": 0.2859039604663849, "reward_total_composite_mean": 0.5186588168144226, "reward_total_composite_std": 0.29185327887535095} {"timestamp_utc": "2026-04-12T16:00:47Z", "mode": "train", "global_step": 15, "epoch": 0.0007894321351507816, "loss": 0.0117, "grad_norm": 12.585134506225586, "learning_rate": 9.957575757575757e-06, "num_tokens": 26721.0, "completions/mean_length": 33.875, "completions/min_length": 30.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.875, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.3934001326560974, "rewards/meter/std": 0.44469642639160156, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9656643867492676, "rewards/lexical_plausibility/std": 0.07511628419160843, "rewards/judge_quality/mean": 0.7100000381469727, "rewards/judge_quality/std": 0.3123185336589813, "rewards/repeat_penalty/mean": 0.7492251992225647, "rewards/repeat_penalty/std": 0.002191446488723159, "rewards/repeat_floor/mean": 0.9848450422286987, "rewards/repeat_floor/std": 0.0004382850893307477, "rewards/near_duplicate_penalty/mean": 0.9989669322967529, "rewards/near_duplicate_penalty/std": 0.002921935636550188, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21219727396965027, "rewards/total_composite/std": 0.29582908749580383, "reward": 0.21219727396965027, "reward_std": 0.2958291172981262, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19646772742271423, "sampling/sampling_logp_difference/max": 1.3255577087402344, "sampling/importance_sampling_ratio/min": 0.2656547725200653, "sampling/importance_sampling_ratio/mean": 1.0391937494277954, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.652011975646019, "clip_ratio/low_mean": 0.11778115015476942, "clip_ratio/low_min": 0.11778115015476942, "clip_ratio/high_mean": 0.09087481535971165, "clip_ratio/high_max": 0.09087481535971165, "clip_ratio/region_mean": 0.20865596551448107, "reward_total_mean": 0.21219727396965027, "reward_meter_mean": 0.3934001326560974, "reward_meter_std": 0.44469642639160156, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9656643867492676, "reward_lexical_plausibility_std": 0.07511628419160843, "reward_repeat_penalty_mean": 0.7492251992225647, "reward_repeat_penalty_std": 0.002191446488723159, "reward_repeat_floor_mean": 0.9848450422286987, "reward_repeat_floor_std": 0.0004382850893307477, "reward_near_duplicate_penalty_mean": 0.9989669322967529, "reward_near_duplicate_penalty_std": 0.002921935636550188, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7100000381469727, "reward_judge_quality_std": 0.3123185336589813, "reward_total_composite_mean": 0.21219727396965027, "reward_total_composite_std": 0.29582908749580383} {"timestamp_utc": "2026-04-12T16:00:56Z", "mode": "train", "global_step": 16, "epoch": 0.0008420609441608337, "loss": -0.063, "grad_norm": 23.451108932495117, "learning_rate": 9.954545454545456e-06, "num_tokens": 28371.0, "completions/mean_length": 36.25, "completions/min_length": 31.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.25, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.6007693409919739, "rewards/meter/std": 0.3601871728897095, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9852941036224365, "rewards/lexical_plausibility/std": 0.04159451276063919, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.9692580699920654, "rewards/repeat_penalty/std": 0.04013483226299286, "rewards/repeat_floor/mean": 0.9959830045700073, "rewards/repeat_floor/std": 0.0047417571768164635, "rewards/near_duplicate_penalty/mean": 0.9796303510665894, "rewards/near_duplicate_penalty/std": 0.023277563974261284, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.30315864086151123, "rewards/total_composite/std": 0.25658613443374634, "reward": 0.30315864086151123, "reward_std": 0.25658613443374634, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24032101035118103, "sampling/sampling_logp_difference/max": 1.9858918190002441, "sampling/importance_sampling_ratio/min": 0.1372581422328949, "sampling/importance_sampling_ratio/mean": 1.0078502893447876, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7265100181102753, "clip_ratio/low_mean": 0.11193907726556063, "clip_ratio/low_min": 0.11193907726556063, "clip_ratio/high_mean": 0.06650641094893217, "clip_ratio/high_max": 0.06650641094893217, "clip_ratio/region_mean": 0.1784454882144928, "reward_total_mean": 0.30315864086151123, "reward_meter_mean": 0.6007693409919739, "reward_meter_std": 0.3601871728897095, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9852941036224365, "reward_lexical_plausibility_std": 0.04159451276063919, "reward_repeat_penalty_mean": 0.9692580699920654, "reward_repeat_penalty_std": 0.04013483226299286, "reward_repeat_floor_mean": 0.9959830045700073, "reward_repeat_floor_std": 0.0047417571768164635, "reward_near_duplicate_penalty_mean": 0.9796303510665894, "reward_near_duplicate_penalty_std": 0.023277563974261284, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.30315864086151123, "reward_total_composite_std": 0.25658613443374634} {"timestamp_utc": "2026-04-12T16:01:04Z", "mode": "train", "global_step": 17, "epoch": 0.0008946897531708857, "loss": 0.119, "grad_norm": 24.433513641357422, "learning_rate": 9.951515151515152e-06, "num_tokens": 29750.0, "completions/mean_length": 26.375, "completions/min_length": 16.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.375, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.9241923689842224, "rewards/meter/std": 0.1924278736114502, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.7562500238418579, "rewards/judge_quality/std": 0.31717222929000854, "rewards/repeat_penalty/mean": 0.778178334236145, "rewards/repeat_penalty/std": 0.08223339915275574, "rewards/repeat_floor/mean": 0.9863755106925964, "rewards/repeat_floor/std": 0.004412782844156027, "rewards/near_duplicate_penalty/mean": 0.9966700077056885, "rewards/near_duplicate_penalty/std": 0.006732024718075991, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.709308385848999, "rewards/total_composite/std": 0.3587949275970459, "reward": 0.709308385848999, "reward_std": 0.3587948977947235, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18496766686439514, "sampling/sampling_logp_difference/max": 1.2623233795166016, "sampling/importance_sampling_ratio/min": 0.2829957604408264, "sampling/importance_sampling_ratio/mean": 1.0299561023712158, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4059355482459068, "clip_ratio/low_mean": 0.052264267578721046, "clip_ratio/low_min": 0.052264267578721046, "clip_ratio/high_mean": 0.12383278645575047, "clip_ratio/high_max": 0.12383278645575047, "clip_ratio/region_mean": 0.1760970540344715, "reward_total_mean": 0.709308385848999, "reward_meter_mean": 0.9241923689842224, "reward_meter_std": 0.1924278736114502, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.778178334236145, "reward_repeat_penalty_std": 0.08223339915275574, "reward_repeat_floor_mean": 0.9863755106925964, "reward_repeat_floor_std": 0.004412782844156027, "reward_near_duplicate_penalty_mean": 0.9966700077056885, "reward_near_duplicate_penalty_std": 0.006732024718075991, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7562500238418579, "reward_judge_quality_std": 0.31717222929000854, "reward_total_composite_mean": 0.709308385848999, "reward_total_composite_std": 0.3587949275970459} {"timestamp_utc": "2026-04-12T16:01:15Z", "mode": "train", "global_step": 18, "epoch": 0.0009473185621809378, "loss": 0.0438, "grad_norm": 14.398731231689453, "learning_rate": 9.948484848484849e-06, "num_tokens": 32077.0, "completions/mean_length": 113.875, "completions/min_length": 78.0, "completions/max_length": 140.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 113.875, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 140.0, "rewards/meter/mean": 0.48476648330688477, "rewards/meter/std": 0.35743826627731323, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.10690449178218842, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9700000286102295, "rewards/count_floor/std": 0.03207135200500488, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.4337500035762787, "rewards/judge_quality/std": 0.23868316411972046, "rewards/repeat_penalty/mean": 0.9923823475837708, "rewards/repeat_penalty/std": 0.003096821717917919, "rewards/repeat_floor/mean": 0.998857319355011, "rewards/repeat_floor/std": 0.0004645251319743693, "rewards/near_duplicate_penalty/mean": 0.9923823475837708, "rewards/near_duplicate_penalty/std": 0.003096821717917919, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2512439489364624, "rewards/total_composite/std": 0.25274989008903503, "reward": 0.2512439489364624, "reward_std": 0.25274989008903503, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.250434547662735, "sampling/sampling_logp_difference/max": 3.4623918533325195, "sampling/importance_sampling_ratio/min": 0.03135467693209648, "sampling/importance_sampling_ratio/mean": 1.0127856731414795, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.262481302022934, "clip_ratio/low_mean": 0.16493276320397854, "clip_ratio/low_min": 0.16493276320397854, "clip_ratio/high_mean": 0.06476971507072449, "clip_ratio/high_max": 0.06476971507072449, "clip_ratio/region_mean": 0.22970247827470303, "reward_total_mean": 0.2512439489364624, "reward_meter_mean": 0.48476648330688477, "reward_meter_std": 0.35743826627731323, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.10690449178218842, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9700000286102295, "reward_count_floor_std": 0.03207135200500488, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9923823475837708, "reward_repeat_penalty_std": 0.003096821717917919, "reward_repeat_floor_mean": 0.998857319355011, "reward_repeat_floor_std": 0.0004645251319743693, "reward_near_duplicate_penalty_mean": 0.9923823475837708, "reward_near_duplicate_penalty_std": 0.003096821717917919, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4337500035762787, "reward_judge_quality_std": 0.23868316411972046, "reward_total_composite_mean": 0.2512439489364624, "reward_total_composite_std": 0.25274989008903503} {"timestamp_utc": "2026-04-12T16:01:25Z", "mode": "train", "global_step": 19, "epoch": 0.00099994737119099, "loss": 0.0743, "grad_norm": 20.236949920654297, "learning_rate": 9.945454545454546e-06, "num_tokens": 33593.0, "completions/mean_length": 39.5, "completions/min_length": 32.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.5, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.5016039609909058, "rewards/meter/std": 0.406399667263031, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9754565358161926, "rewards/repeat_penalty/std": 0.04103349521756172, "rewards/repeat_floor/mean": 0.996688723564148, "rewards/repeat_floor/std": 0.005164620000869036, "rewards/near_duplicate_penalty/mean": 0.9823631048202515, "rewards/near_duplicate_penalty/std": 0.023129036650061607, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9926035404205322, "rewards/distinct_2/std": 0.020920326933264732, "rewards/total_composite/mean": 0.19481655955314636, "rewards/total_composite/std": 0.18020491302013397, "reward": 0.19481655955314636, "reward_std": 0.18020489811897278, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24541553854942322, "sampling/sampling_logp_difference/max": 1.647770881652832, "sampling/importance_sampling_ratio/min": 0.1924784928560257, "sampling/importance_sampling_ratio/mean": 1.0177640914916992, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0277532786130905, "clip_ratio/low_mean": 0.12244594004005194, "clip_ratio/low_min": 0.12244594004005194, "clip_ratio/high_mean": 0.0850139930844307, "clip_ratio/high_max": 0.0850139930844307, "clip_ratio/region_mean": 0.20745993312448263, "reward_total_mean": 0.19481655955314636, "reward_meter_mean": 0.5016039609909058, "reward_meter_std": 0.406399667263031, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9754565358161926, "reward_repeat_penalty_std": 0.04103349521756172, "reward_repeat_floor_mean": 0.996688723564148, "reward_repeat_floor_std": 0.005164620000869036, "reward_near_duplicate_penalty_mean": 0.9823631048202515, "reward_near_duplicate_penalty_std": 0.023129036650061607, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9926035404205322, "reward_distinct_2_std": 0.020920326933264732, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.19481655955314636, "reward_total_composite_std": 0.18020491302013397} {"timestamp_utc": "2026-04-12T16:01:34Z", "mode": "train", "global_step": 20, "epoch": 0.001052576180201042, "loss": 0.0393, "grad_norm": 19.540916442871094, "learning_rate": 9.942424242424244e-06, "num_tokens": 35120.0, "completions/mean_length": 40.875, "completions/min_length": 31.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.875, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.4095902442932129, "rewards/meter/std": 0.3453020453453064, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.1642080694437027, "rewards/repeat_penalty/mean": 0.9901515245437622, "rewards/repeat_penalty/std": 0.02066391333937645, "rewards/repeat_floor/mean": 0.9985227584838867, "rewards/repeat_floor/std": 0.003099583787843585, "rewards/near_duplicate_penalty/mean": 0.9901515245437622, "rewards/near_duplicate_penalty/std": 0.02066391333937645, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1880517303943634, "rewards/total_composite/std": 0.15503939986228943, "reward": 0.1880517303943634, "reward_std": 0.15503938496112823, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24018830060958862, "sampling/sampling_logp_difference/max": 1.510390281677246, "sampling/importance_sampling_ratio/min": 0.22082377970218658, "sampling/importance_sampling_ratio/mean": 1.040675163269043, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2183572202920914, "clip_ratio/low_mean": 0.15957853570580482, "clip_ratio/low_min": 0.15957853570580482, "clip_ratio/high_mean": 0.05311078391969204, "clip_ratio/high_max": 0.05311078391969204, "clip_ratio/region_mean": 0.21268931962549686, "reward_total_mean": 0.1880517303943634, "reward_meter_mean": 0.4095902442932129, "reward_meter_std": 0.3453020453453064, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9901515245437622, "reward_repeat_penalty_std": 0.02066391333937645, "reward_repeat_floor_mean": 0.9985227584838867, "reward_repeat_floor_std": 0.003099583787843585, "reward_near_duplicate_penalty_mean": 0.9901515245437622, "reward_near_duplicate_penalty_std": 0.02066391333937645, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.1642080694437027, "reward_total_composite_mean": 0.1880517303943634, "reward_total_composite_std": 0.15503939986228943} {"timestamp_utc": "2026-04-12T16:01:45Z", "mode": "train", "global_step": 21, "epoch": 0.0011052049892110942, "loss": -0.0459, "grad_norm": 11.305293083190918, "learning_rate": 9.939393939393939e-06, "num_tokens": 37183.0, "completions/mean_length": 87.875, "completions/min_length": 60.0, "completions/max_length": 97.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.875, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 97.0, "rewards/meter/mean": 0.5517024993896484, "rewards/meter/std": 0.45141252875328064, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.9992185235023499, "rewards/repeat_penalty/std": 0.0016037474852055311, "rewards/repeat_floor/mean": 0.9998828172683716, "rewards/repeat_floor/std": 0.0002405582636129111, "rewards/near_duplicate_penalty/mean": 0.9992185235023499, "rewards/near_duplicate_penalty/std": 0.0016037474852055311, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24817641079425812, "rewards/total_composite/std": 0.18709984421730042, "reward": 0.24817641079425812, "reward_std": 0.18709984421730042, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1770317554473877, "sampling/sampling_logp_difference/max": 2.3745388984680176, "sampling/importance_sampling_ratio/min": 0.09305738657712936, "sampling/importance_sampling_ratio/mean": 1.0006312131881714, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0936824977397919, "clip_ratio/low_mean": 0.09472911804914474, "clip_ratio/low_min": 0.09472911804914474, "clip_ratio/high_mean": 0.07718820963054895, "clip_ratio/high_max": 0.07718820963054895, "clip_ratio/region_mean": 0.1719173276796937, "reward_total_mean": 0.24817641079425812, "reward_meter_mean": 0.5517024993896484, "reward_meter_std": 0.45141252875328064, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9992185235023499, "reward_repeat_penalty_std": 0.0016037474852055311, "reward_repeat_floor_mean": 0.9998828172683716, "reward_repeat_floor_std": 0.0002405582636129111, "reward_near_duplicate_penalty_mean": 0.9992185235023499, "reward_near_duplicate_penalty_std": 0.0016037474852055311, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.24817641079425812, "reward_total_composite_std": 0.18709984421730042} {"timestamp_utc": "2026-04-12T16:01:53Z", "mode": "train", "global_step": 22, "epoch": 0.0011578337982211463, "loss": 0.0045, "grad_norm": 20.91036605834961, "learning_rate": 9.936363636363638e-06, "num_tokens": 38762.0, "completions/mean_length": 31.375, "completions/min_length": 30.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.375, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.9042378067970276, "rewards/meter/std": 0.16538074612617493, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.831250011920929, "rewards/judge_quality/std": 0.27559998631477356, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 1.0, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7410659790039062, "rewards/total_composite/std": 0.2911670207977295, "reward": 0.7410659790039062, "reward_std": 0.2911670207977295, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10895714163780212, "sampling/sampling_logp_difference/max": 1.3790559768676758, "sampling/importance_sampling_ratio/min": 0.25181618332862854, "sampling/importance_sampling_ratio/mean": 0.9773324131965637, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3513520695269108, "clip_ratio/low_mean": 0.04734848625957966, "clip_ratio/low_min": 0.04734848625957966, "clip_ratio/high_mean": 0.07209188491106033, "clip_ratio/high_max": 0.07209188491106033, "clip_ratio/region_mean": 0.11944037117063999, "reward_total_mean": 0.7410659790039062, "reward_meter_mean": 0.9042378067970276, "reward_meter_std": 0.16538074612617493, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 1.0, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.831250011920929, "reward_judge_quality_std": 0.27559998631477356, "reward_total_composite_mean": 0.7410659790039062, "reward_total_composite_std": 0.2911670207977295} {"timestamp_utc": "2026-04-12T16:02:03Z", "mode": "train", "global_step": 23, "epoch": 0.0012104626072311983, "loss": 0.0812, "grad_norm": 10.112000465393066, "learning_rate": 9.933333333333334e-06, "num_tokens": 41325.0, "completions/mean_length": 133.375, "completions/min_length": 99.0, "completions/max_length": 155.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.375, "completions/min_terminated_length": 99.0, "completions/max_terminated_length": 155.0, "rewards/meter/mean": 0.8597559332847595, "rewards/meter/std": 0.13285112380981445, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9840116500854492, "rewards/lexical_plausibility/std": 0.04522194713354111, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9802836775779724, "rewards/repeat_penalty/std": 0.023504260927438736, "rewards/repeat_floor/mean": 0.9976856708526611, "rewards/repeat_floor/std": 0.002427757252007723, "rewards/near_duplicate_penalty/mean": 0.991152286529541, "rewards/near_duplicate_penalty/std": 0.009577685035765171, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9890313148498535, "rewards/distinct_2/std": 0.02148415334522724, "rewards/total_composite/mean": 0.35202527046203613, "rewards/total_composite/std": 0.07803290337324142, "reward": 0.35202527046203613, "reward_std": 0.07803290337324142, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20107419788837433, "sampling/sampling_logp_difference/max": 1.7424888610839844, "sampling/importance_sampling_ratio/min": 0.17508408427238464, "sampling/importance_sampling_ratio/mean": 1.0296818017959595, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1603490710258484, "clip_ratio/low_mean": 0.10855937749147415, "clip_ratio/low_min": 0.10855937749147415, "clip_ratio/high_mean": 0.06738803535699844, "clip_ratio/high_max": 0.06738803535699844, "clip_ratio/region_mean": 0.1759474128484726, "reward_total_mean": 0.35202527046203613, "reward_meter_mean": 0.8597559332847595, "reward_meter_std": 0.13285112380981445, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9840116500854492, "reward_lexical_plausibility_std": 0.04522194713354111, "reward_repeat_penalty_mean": 0.9802836775779724, "reward_repeat_penalty_std": 0.023504260927438736, "reward_repeat_floor_mean": 0.9976856708526611, "reward_repeat_floor_std": 0.002427757252007723, "reward_near_duplicate_penalty_mean": 0.991152286529541, "reward_near_duplicate_penalty_std": 0.009577685035765171, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9890313148498535, "reward_distinct_2_std": 0.02148415334522724, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.35202527046203613, "reward_total_composite_std": 0.07803290337324142} {"timestamp_utc": "2026-04-12T16:02:11Z", "mode": "train", "global_step": 24, "epoch": 0.0012630914162412505, "loss": 0.046, "grad_norm": 20.005218505859375, "learning_rate": 9.930303030303031e-06, "num_tokens": 43068.0, "completions/mean_length": 54.875, "completions/min_length": 54.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.875, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.7139286994934082, "rewards/meter/std": 0.35483241081237793, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9424999952316284, "rewards/judge_quality/std": 0.013887288980185986, "rewards/repeat_penalty/mean": 0.9425437450408936, "rewards/repeat_penalty/std": 0.023631354793906212, "rewards/repeat_floor/mean": 0.9919066429138184, "rewards/repeat_floor/std": 0.0029942041728645563, "rewards/near_duplicate_penalty/mean": 0.9515388011932373, "rewards/near_duplicate_penalty/std": 0.02329661138355732, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.6711771488189697, "rewards/total_composite/std": 0.3355337381362915, "reward": 0.6711771488189697, "reward_std": 0.3355337381362915, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.06163253262639046, "sampling/sampling_logp_difference/max": 1.5534675121307373, "sampling/importance_sampling_ratio/min": 0.23674805462360382, "sampling/importance_sampling_ratio/mean": 1.0056684017181396, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.20610892679542303, "clip_ratio/low_mean": 0.028719397261738777, "clip_ratio/low_min": 0.028719397261738777, "clip_ratio/high_mean": 0.02050264598801732, "clip_ratio/high_max": 0.02050264598801732, "clip_ratio/region_mean": 0.0492220432497561, "reward_total_mean": 0.6711771488189697, "reward_meter_mean": 0.7139286994934082, "reward_meter_std": 0.35483241081237793, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9425437450408936, "reward_repeat_penalty_std": 0.023631354793906212, "reward_repeat_floor_mean": 0.9919066429138184, "reward_repeat_floor_std": 0.0029942041728645563, "reward_near_duplicate_penalty_mean": 0.9515388011932373, "reward_near_duplicate_penalty_std": 0.02329661138355732, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.9424999952316284, "reward_judge_quality_std": 0.013887288980185986, "reward_total_composite_mean": 0.6711771488189697, "reward_total_composite_std": 0.3355337381362915} {"timestamp_utc": "2026-04-12T16:02:20Z", "mode": "train", "global_step": 25, "epoch": 0.0013157202252513025, "loss": 0.156, "grad_norm": 16.10081672668457, "learning_rate": 9.927272727272728e-06, "num_tokens": 44673.0, "completions/mean_length": 45.625, "completions/min_length": 35.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.625, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.5014105439186096, "rewards/meter/std": 0.308937668800354, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6100000143051147, "rewards/judge_quality/std": 0.3378080725669861, "rewards/repeat_penalty/mean": 0.9912397861480713, "rewards/repeat_penalty/std": 0.013325787149369717, "rewards/repeat_floor/mean": 0.9986859560012817, "rewards/repeat_floor/std": 0.0019988620188087225, "rewards/near_duplicate_penalty/mean": 0.9912397861480713, "rewards/near_duplicate_penalty/std": 0.013325787149369717, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.23511448502540588, "rewards/total_composite/std": 0.16499361395835876, "reward": 0.23511448502540588, "reward_std": 0.16499361395835876, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.250480979681015, "sampling/sampling_logp_difference/max": 1.9168643951416016, "sampling/importance_sampling_ratio/min": 0.1470673829317093, "sampling/importance_sampling_ratio/mean": 1.0359736680984497, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0624225437641144, "clip_ratio/low_mean": 0.1553692352026701, "clip_ratio/low_min": 0.1553692352026701, "clip_ratio/high_mean": 0.0832142885774374, "clip_ratio/high_max": 0.0832142885774374, "clip_ratio/region_mean": 0.2385835237801075, "reward_total_mean": 0.23511448502540588, "reward_meter_mean": 0.5014105439186096, "reward_meter_std": 0.308937668800354, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9912397861480713, "reward_repeat_penalty_std": 0.013325787149369717, "reward_repeat_floor_mean": 0.9986859560012817, "reward_repeat_floor_std": 0.0019988620188087225, "reward_near_duplicate_penalty_mean": 0.9912397861480713, "reward_near_duplicate_penalty_std": 0.013325787149369717, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6100000143051147, "reward_judge_quality_std": 0.3378080725669861, "reward_total_composite_mean": 0.23511448502540588, "reward_total_composite_std": 0.16499361395835876} {"timestamp_utc": "2026-04-12T16:02:30Z", "mode": "train", "global_step": 26, "epoch": 0.0013683490342613546, "loss": 0.0318, "grad_norm": 13.510664939880371, "learning_rate": 9.924242424242425e-06, "num_tokens": 46531.0, "completions/mean_length": 61.25, "completions/min_length": 36.0, "completions/max_length": 105.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.25, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 105.0, "rewards/meter/mean": 0.31675535440444946, "rewards/meter/std": 0.33889898657798767, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9831216335296631, "rewards/lexical_plausibility/std": 0.03366175666451454, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.9987928867340088, "rewards/repeat_penalty/std": 0.0027606007643043995, "rewards/repeat_floor/mean": 0.9998189210891724, "rewards/repeat_floor/std": 0.0004140916280448437, "rewards/near_duplicate_penalty/mean": 0.9987928867340088, "rewards/near_duplicate_penalty/std": 0.0027606007643043995, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14853471517562866, "rewards/total_composite/std": 0.17436335980892181, "reward": 0.14853471517562866, "reward_std": 0.17436335980892181, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.228131502866745, "sampling/sampling_logp_difference/max": 1.9820013046264648, "sampling/importance_sampling_ratio/min": 0.13779319822788239, "sampling/importance_sampling_ratio/mean": 1.0108184814453125, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.186939314007759, "clip_ratio/low_mean": 0.11863413453102112, "clip_ratio/low_min": 0.11863413453102112, "clip_ratio/high_mean": 0.09134547226130962, "clip_ratio/high_max": 0.09134547226130962, "clip_ratio/region_mean": 0.20997960679233074, "reward_total_mean": 0.14853471517562866, "reward_meter_mean": 0.31675535440444946, "reward_meter_std": 0.33889898657798767, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9831216335296631, "reward_lexical_plausibility_std": 0.03366175666451454, "reward_repeat_penalty_mean": 0.9987928867340088, "reward_repeat_penalty_std": 0.0027606007643043995, "reward_repeat_floor_mean": 0.9998189210891724, "reward_repeat_floor_std": 0.0004140916280448437, "reward_near_duplicate_penalty_mean": 0.9987928867340088, "reward_near_duplicate_penalty_std": 0.0027606007643043995, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.14853471517562866, "reward_total_composite_std": 0.17436335980892181} {"timestamp_utc": "2026-04-12T16:02:42Z", "mode": "train", "global_step": 27, "epoch": 0.0014209778432714068, "loss": 0.4783, "grad_norm": 11.73549747467041, "learning_rate": 9.921212121212121e-06, "num_tokens": 48667.0, "completions/mean_length": 90.0, "completions/min_length": 44.0, "completions/max_length": 306.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 90.0, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 306.0, "rewards/meter/mean": 0.36504948139190674, "rewards/meter/std": 0.26965948939323425, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9226248264312744, "rewards/lexical_plausibility/std": 0.16758441925048828, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.15059404075145721, "rewards/repeat_penalty/mean": 0.9928141832351685, "rewards/repeat_penalty/std": 0.010346044786274433, "rewards/repeat_floor/mean": 0.9990363717079163, "rewards/repeat_floor/std": 0.0013709188206121325, "rewards/near_duplicate_penalty/mean": 0.9947412610054016, "rewards/near_duplicate_penalty/std": 0.008094299584627151, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.99805748462677, "rewards/distinct_2/std": 0.005494221113622189, "rewards/total_composite/mean": 0.11421902477741241, "rewards/total_composite/std": 0.09893438965082169, "reward": 0.11421902477741241, "reward_std": 0.09893438965082169, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2172243744134903, "sampling/sampling_logp_difference/max": 1.404275894165039, "sampling/importance_sampling_ratio/min": 0.24554479122161865, "sampling/importance_sampling_ratio/mean": 1.0379116535186768, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.275842383503914, "clip_ratio/low_mean": 0.10809156112372875, "clip_ratio/low_min": 0.10809156112372875, "clip_ratio/high_mean": 0.12825565226376057, "clip_ratio/high_max": 0.12825565226376057, "clip_ratio/region_mean": 0.23634721338748932, "reward_total_mean": 0.11421902477741241, "reward_meter_mean": 0.36504948139190674, "reward_meter_std": 0.26965948939323425, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9226248264312744, "reward_lexical_plausibility_std": 0.16758441925048828, "reward_repeat_penalty_mean": 0.9928141832351685, "reward_repeat_penalty_std": 0.010346044786274433, "reward_repeat_floor_mean": 0.9990363717079163, "reward_repeat_floor_std": 0.0013709188206121325, "reward_near_duplicate_penalty_mean": 0.9947412610054016, "reward_near_duplicate_penalty_std": 0.008094299584627151, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.99805748462677, "reward_distinct_2_std": 0.005494221113622189, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.15059404075145721, "reward_total_composite_mean": 0.11421902477741241, "reward_total_composite_std": 0.09893438965082169} {"timestamp_utc": "2026-04-12T16:02:52Z", "mode": "train", "global_step": 28, "epoch": 0.0014736066522814588, "loss": -0.1519, "grad_norm": 12.113202095031738, "learning_rate": 9.918181818181818e-06, "num_tokens": 50777.0, "completions/mean_length": 96.75, "completions/min_length": 66.0, "completions/max_length": 137.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 96.75, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 137.0, "rewards/meter/mean": 0.4711955189704895, "rewards/meter/std": 0.31360843777656555, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9659777283668518, "rewards/lexical_plausibility/std": 0.044811539351940155, "rewards/judge_quality/mean": 0.23749998211860657, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9891072511672974, "rewards/repeat_penalty/std": 0.019332988187670708, "rewards/repeat_floor/mean": 0.9987300038337708, "rewards/repeat_floor/std": 0.0018919405993074179, "rewards/near_duplicate_penalty/mean": 0.9952554106712341, "rewards/near_duplicate_penalty/std": 0.0035783271305263042, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9937965273857117, "rewards/distinct_2/std": 0.017546070739626884, "rewards/total_composite/mean": 0.11048850417137146, "rewards/total_composite/std": 0.10270975530147552, "reward": 0.11048850417137146, "reward_std": 0.10270974785089493, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.28622543811798096, "sampling/sampling_logp_difference/max": 3.824678897857666, "sampling/importance_sampling_ratio/min": 0.02182544209063053, "sampling/importance_sampling_ratio/mean": 1.0070923566818237, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5282831639051437, "clip_ratio/low_mean": 0.15044707618653774, "clip_ratio/low_min": 0.15044707618653774, "clip_ratio/high_mean": 0.08182669058442116, "clip_ratio/high_max": 0.08182669058442116, "clip_ratio/region_mean": 0.2322737667709589, "reward_total_mean": 0.11048850417137146, "reward_meter_mean": 0.4711955189704895, "reward_meter_std": 0.31360843777656555, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9659777283668518, "reward_lexical_plausibility_std": 0.044811539351940155, "reward_repeat_penalty_mean": 0.9891072511672974, "reward_repeat_penalty_std": 0.019332988187670708, "reward_repeat_floor_mean": 0.9987300038337708, "reward_repeat_floor_std": 0.0018919405993074179, "reward_near_duplicate_penalty_mean": 0.9952554106712341, "reward_near_duplicate_penalty_std": 0.0035783271305263042, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9937965273857117, "reward_distinct_2_std": 0.017546070739626884, "reward_judge_quality_mean": 0.23749998211860657, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.11048850417137146, "reward_total_composite_std": 0.10270975530147552} {"timestamp_utc": "2026-04-12T16:03:01Z", "mode": "train", "global_step": 29, "epoch": 0.001526235461291511, "loss": 0.0238, "grad_norm": 16.65239715576172, "learning_rate": 9.915151515151515e-06, "num_tokens": 52511.0, "completions/mean_length": 53.75, "completions/min_length": 37.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.75, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.6935027241706848, "rewards/meter/std": 0.417043000459671, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9473055601119995, "rewards/lexical_plausibility/std": 0.08244762569665909, "rewards/judge_quality/mean": 0.5424999594688416, "rewards/judge_quality/std": 0.23705033957958221, "rewards/repeat_penalty/mean": 0.9909010529518127, "rewards/repeat_penalty/std": 0.013155777007341385, "rewards/repeat_floor/mean": 0.9986351728439331, "rewards/repeat_floor/std": 0.001973371487110853, "rewards/near_duplicate_penalty/mean": 0.9909010529518127, "rewards/near_duplicate_penalty/std": 0.013155777007341385, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3540693521499634, "rewards/total_composite/std": 0.272655189037323, "reward": 0.3540693521499634, "reward_std": 0.2726552188396454, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20613504946231842, "sampling/sampling_logp_difference/max": 1.5167832374572754, "sampling/importance_sampling_ratio/min": 0.277983695268631, "sampling/importance_sampling_ratio/mean": 1.0124094486236572, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.05456180870533, "clip_ratio/low_mean": 0.09870942868292332, "clip_ratio/low_min": 0.09870942868292332, "clip_ratio/high_mean": 0.10838798806071281, "clip_ratio/high_max": 0.10838798806071281, "clip_ratio/region_mean": 0.20709741674363613, "reward_total_mean": 0.3540693521499634, "reward_meter_mean": 0.6935027241706848, "reward_meter_std": 0.417043000459671, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9473055601119995, "reward_lexical_plausibility_std": 0.08244762569665909, "reward_repeat_penalty_mean": 0.9909010529518127, "reward_repeat_penalty_std": 0.013155777007341385, "reward_repeat_floor_mean": 0.9986351728439331, "reward_repeat_floor_std": 0.001973371487110853, "reward_near_duplicate_penalty_mean": 0.9909010529518127, "reward_near_duplicate_penalty_std": 0.013155777007341385, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5424999594688416, "reward_judge_quality_std": 0.23705033957958221, "reward_total_composite_mean": 0.3540693521499634, "reward_total_composite_std": 0.272655189037323} {"timestamp_utc": "2026-04-12T16:03:10Z", "mode": "train", "global_step": 30, "epoch": 0.0015788642703015632, "loss": -0.0115, "grad_norm": 19.788253784179688, "learning_rate": 9.912121212121213e-06, "num_tokens": 54588.0, "completions/mean_length": 75.625, "completions/min_length": 66.0, "completions/max_length": 99.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 75.625, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 99.0, "rewards/meter/mean": 0.6688518524169922, "rewards/meter/std": 0.295454204082489, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9977678656578064, "rewards/lexical_plausibility/std": 0.006313450634479523, "rewards/judge_quality/mean": 0.45500001311302185, "rewards/judge_quality/std": 0.3097464442253113, "rewards/repeat_penalty/mean": 0.9855921268463135, "rewards/repeat_penalty/std": 0.01247401349246502, "rewards/repeat_floor/mean": 0.9978388547897339, "rewards/repeat_floor/std": 0.0018710998119786382, "rewards/near_duplicate_penalty/mean": 0.9855921268463135, "rewards/near_duplicate_penalty/std": 0.01247401349246502, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22063979506492615, "rewards/total_composite/std": 0.07142075896263123, "reward": 0.22063979506492615, "reward_std": 0.07142075896263123, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24945597350597382, "sampling/sampling_logp_difference/max": 3.091531753540039, "sampling/importance_sampling_ratio/min": 0.04543231055140495, "sampling/importance_sampling_ratio/mean": 0.9944108128547668, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8818572908639908, "clip_ratio/low_mean": 0.14803308434784412, "clip_ratio/low_min": 0.14803308434784412, "clip_ratio/high_mean": 0.06854380294680595, "clip_ratio/high_max": 0.06854380294680595, "clip_ratio/region_mean": 0.21657688729465008, "reward_total_mean": 0.22063979506492615, "reward_meter_mean": 0.6688518524169922, "reward_meter_std": 0.295454204082489, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9977678656578064, "reward_lexical_plausibility_std": 0.006313450634479523, "reward_repeat_penalty_mean": 0.9855921268463135, "reward_repeat_penalty_std": 0.01247401349246502, "reward_repeat_floor_mean": 0.9978388547897339, "reward_repeat_floor_std": 0.0018710998119786382, "reward_near_duplicate_penalty_mean": 0.9855921268463135, "reward_near_duplicate_penalty_std": 0.01247401349246502, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45500001311302185, "reward_judge_quality_std": 0.3097464442253113, "reward_total_composite_mean": 0.22063979506492615, "reward_total_composite_std": 0.07142075896263123} {"timestamp_utc": "2026-04-12T16:03:20Z", "mode": "train", "global_step": 31, "epoch": 0.0016314930793116151, "loss": 0.1996, "grad_norm": 20.691179275512695, "learning_rate": 9.90909090909091e-06, "num_tokens": 56130.0, "completions/mean_length": 28.75, "completions/min_length": 22.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.75, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.8624352812767029, "rewards/meter/std": 0.34842345118522644, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9824293255805969, "rewards/lexical_plausibility/std": 0.049697354435920715, "rewards/judge_quality/mean": 0.6762499809265137, "rewards/judge_quality/std": 0.3651198744773865, "rewards/repeat_penalty/mean": 0.7369969487190247, "rewards/repeat_penalty/std": 0.03434223309159279, "rewards/repeat_floor/mean": 0.9823994040489197, "rewards/repeat_floor/std": 0.006868451833724976, "rewards/near_duplicate_penalty/mean": 0.982662558555603, "rewards/near_duplicate_penalty/std": 0.04578967019915581, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5399028658866882, "rewards/total_composite/std": 0.39929813146591187, "reward": 0.5399028658866882, "reward_std": 0.3992981016635895, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19227752089500427, "sampling/sampling_logp_difference/max": 1.1030511856079102, "sampling/importance_sampling_ratio/min": 0.33185696601867676, "sampling/importance_sampling_ratio/mean": 1.0560588836669922, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8176650553941727, "clip_ratio/low_mean": 0.11976448819041252, "clip_ratio/low_min": 0.11976448819041252, "clip_ratio/high_mean": 0.13372859358787537, "clip_ratio/high_max": 0.13372859358787537, "clip_ratio/region_mean": 0.2534930817782879, "reward_total_mean": 0.5399028658866882, "reward_meter_mean": 0.8624352812767029, "reward_meter_std": 0.34842345118522644, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9824293255805969, "reward_lexical_plausibility_std": 0.049697354435920715, "reward_repeat_penalty_mean": 0.7369969487190247, "reward_repeat_penalty_std": 0.03434223309159279, "reward_repeat_floor_mean": 0.9823994040489197, "reward_repeat_floor_std": 0.006868451833724976, "reward_near_duplicate_penalty_mean": 0.982662558555603, "reward_near_duplicate_penalty_std": 0.04578967019915581, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6762499809265137, "reward_judge_quality_std": 0.3651198744773865, "reward_total_composite_mean": 0.5399028658866882, "reward_total_composite_std": 0.39929813146591187} {"timestamp_utc": "2026-04-12T16:03:30Z", "mode": "train", "global_step": 32, "epoch": 0.0016841218883216673, "loss": -0.0146, "grad_norm": 12.498920440673828, "learning_rate": 9.906060606060607e-06, "num_tokens": 58343.0, "completions/mean_length": 98.625, "completions/min_length": 76.0, "completions/max_length": 131.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 98.625, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 131.0, "rewards/meter/mean": 0.3425254821777344, "rewards/meter/std": 0.3815731108188629, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.1414213478565216, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9850000143051147, "rewards/count_floor/std": 0.04242641106247902, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9930620193481445, "rewards/repeat_penalty/std": 0.005063355900347233, "rewards/repeat_floor/mean": 0.9989593029022217, "rewards/repeat_floor/std": 0.0007595062488690019, "rewards/near_duplicate_penalty/mean": 0.9930620193481445, "rewards/near_duplicate_penalty/std": 0.005063355900347233, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15067604184150696, "rewards/total_composite/std": 0.17259570956230164, "reward": 0.15067604184150696, "reward_std": 0.17259569466114044, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2743317186832428, "sampling/sampling_logp_difference/max": 1.9858273267745972, "sampling/importance_sampling_ratio/min": 0.13726700842380524, "sampling/importance_sampling_ratio/mean": 1.0336440801620483, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.797087222337723, "clip_ratio/low_mean": 0.1716446615755558, "clip_ratio/low_min": 0.1716446615755558, "clip_ratio/high_mean": 0.05666547268629074, "clip_ratio/high_max": 0.05666547268629074, "clip_ratio/region_mean": 0.22831013426184654, "reward_total_mean": 0.15067604184150696, "reward_meter_mean": 0.3425254821777344, "reward_meter_std": 0.3815731108188629, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.1414213478565216, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9850000143051147, "reward_count_floor_std": 0.04242641106247902, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9930620193481445, "reward_repeat_penalty_std": 0.005063355900347233, "reward_repeat_floor_mean": 0.9989593029022217, "reward_repeat_floor_std": 0.0007595062488690019, "reward_near_duplicate_penalty_mean": 0.9930620193481445, "reward_near_duplicate_penalty_std": 0.005063355900347233, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.15067604184150696, "reward_total_composite_std": 0.17259570956230164} {"timestamp_utc": "2026-04-12T16:03:43Z", "mode": "train", "global_step": 33, "epoch": 0.0017367506973317193, "loss": 0.0628, "grad_norm": 5.068249225616455, "learning_rate": 9.903030303030305e-06, "num_tokens": 62874.0, "completions/mean_length": 357.375, "completions/min_length": 248.0, "completions/max_length": 476.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 357.375, "completions/min_terminated_length": 248.0, "completions/max_terminated_length": 476.0, "rewards/meter/mean": 0.5966706275939941, "rewards/meter/std": 0.4446839988231659, "rewards/count_adherence/mean": 0.9659091234207153, "rewards/count_adherence/std": 0.047049909830093384, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9897727370262146, "rewards/count_floor/std": 0.014114963822066784, "rewards/lexical_plausibility/mean": 0.9950504899024963, "rewards/lexical_plausibility/std": 0.009223292581737041, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9939025640487671, "rewards/repeat_penalty/std": 0.005231776740401983, "rewards/repeat_floor/mean": 0.9991873502731323, "rewards/repeat_floor/std": 0.0005345784593373537, "rewards/near_duplicate_penalty/mean": 0.9956123232841492, "rewards/near_duplicate_penalty/std": 0.002133031142875552, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9982829689979553, "rewards/distinct_2/std": 0.004856497049331665, "rewards/total_composite/mean": 0.18759429454803467, "rewards/total_composite/std": 0.1536462903022766, "reward": 0.18759429454803467, "reward_std": 0.15364627540111542, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19716061651706696, "sampling/sampling_logp_difference/max": 1.774923324584961, "sampling/importance_sampling_ratio/min": 0.16949644684791565, "sampling/importance_sampling_ratio/mean": 1.0434120893478394, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7610519528388977, "clip_ratio/low_mean": 0.0867075864225626, "clip_ratio/low_min": 0.0867075864225626, "clip_ratio/high_mean": 0.095170047134161, "clip_ratio/high_max": 0.095170047134161, "clip_ratio/region_mean": 0.1818776335567236, "reward_total_mean": 0.18759429454803467, "reward_meter_mean": 0.5966706275939941, "reward_meter_std": 0.4446839988231659, "reward_count_adherence_mean": 0.9659091234207153, "reward_count_adherence_std": 0.047049909830093384, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9897727370262146, "reward_count_floor_std": 0.014114963822066784, "reward_lexical_plausibility_mean": 0.9950504899024963, "reward_lexical_plausibility_std": 0.009223292581737041, "reward_repeat_penalty_mean": 0.9939025640487671, "reward_repeat_penalty_std": 0.005231776740401983, "reward_repeat_floor_mean": 0.9991873502731323, "reward_repeat_floor_std": 0.0005345784593373537, "reward_near_duplicate_penalty_mean": 0.9956123232841492, "reward_near_duplicate_penalty_std": 0.002133031142875552, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9982829689979553, "reward_distinct_2_std": 0.004856497049331665, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.18759429454803467, "reward_total_composite_std": 0.1536462903022766} {"timestamp_utc": "2026-04-12T16:03:53Z", "mode": "train", "global_step": 34, "epoch": 0.0017893795063417715, "loss": 0.0031, "grad_norm": 9.778609275817871, "learning_rate": 9.9e-06, "num_tokens": 64898.0, "completions/mean_length": 98.0, "completions/min_length": 64.0, "completions/max_length": 116.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 98.0, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 116.0, "rewards/meter/mean": 0.6410538554191589, "rewards/meter/std": 0.39640089869499207, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9977678656578064, "rewards/lexical_plausibility/std": 0.006313450634479523, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.2314550131559372, "rewards/repeat_penalty/mean": 0.9879550933837891, "rewards/repeat_penalty/std": 0.020515216514468193, "rewards/repeat_floor/mean": 0.9985188245773315, "rewards/repeat_floor/std": 0.0022078033071011305, "rewards/near_duplicate_penalty/mean": 0.9935190081596375, "rewards/near_duplicate_penalty/std": 0.00695214094594121, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9943438768386841, "rewards/distinct_2/std": 0.015997890383005142, "rewards/total_composite/mean": 0.2914750277996063, "rewards/total_composite/std": 0.29660576581954956, "reward": 0.2914750277996063, "reward_std": 0.2966057360172272, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2059471756219864, "sampling/sampling_logp_difference/max": 2.3541133403778076, "sampling/importance_sampling_ratio/min": 0.09497768431901932, "sampling/importance_sampling_ratio/mean": 1.0350326299667358, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3347521275281906, "clip_ratio/low_mean": 0.11685441620647907, "clip_ratio/low_min": 0.11685441620647907, "clip_ratio/high_mean": 0.07928240671753883, "clip_ratio/high_max": 0.07928240671753883, "clip_ratio/region_mean": 0.1961368229240179, "reward_total_mean": 0.2914750277996063, "reward_meter_mean": 0.6410538554191589, "reward_meter_std": 0.39640089869499207, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9977678656578064, "reward_lexical_plausibility_std": 0.006313450634479523, "reward_repeat_penalty_mean": 0.9879550933837891, "reward_repeat_penalty_std": 0.020515216514468193, "reward_repeat_floor_mean": 0.9985188245773315, "reward_repeat_floor_std": 0.0022078033071011305, "reward_near_duplicate_penalty_mean": 0.9935190081596375, "reward_near_duplicate_penalty_std": 0.00695214094594121, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9943438768386841, "reward_distinct_2_std": 0.015997890383005142, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.2314550131559372, "reward_total_composite_mean": 0.2914750277996063, "reward_total_composite_std": 0.29660576581954956} {"timestamp_utc": "2026-04-12T16:04:12Z", "mode": "train", "global_step": 35, "epoch": 0.0018420083153518237, "loss": 0.5092, "grad_norm": 16.70918846130371, "learning_rate": 9.896969696969699e-06, "num_tokens": 66565.0, "completions/mean_length": 61.375, "completions/min_length": 38.0, "completions/max_length": 198.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.375, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 198.0, "rewards/meter/mean": 0.692173957824707, "rewards/meter/std": 0.4213980436325073, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.11160357296466827, "rewards/lexical_plausibility/mean": 0.9863764643669128, "rewards/lexical_plausibility/std": 0.038533199578523636, "rewards/judge_quality/mean": 0.4374999701976776, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9922046065330505, "rewards/repeat_penalty/std": 0.010986856184899807, "rewards/repeat_floor/mean": 0.9988306760787964, "rewards/repeat_floor/std": 0.0016480127815157175, "rewards/near_duplicate_penalty/mean": 0.9922046065330505, "rewards/near_duplicate_penalty/std": 0.010986856184899807, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.31467336416244507, "rewards/total_composite/std": 0.21308283507823944, "reward": 0.31467336416244507, "reward_std": 0.21308282017707825, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2405560463666916, "sampling/sampling_logp_difference/max": 2.1018619537353516, "sampling/importance_sampling_ratio/min": 0.12222862988710403, "sampling/importance_sampling_ratio/mean": 1.037939429283142, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.62863227725029, "clip_ratio/low_mean": 0.05899621360003948, "clip_ratio/low_min": 0.05899621360003948, "clip_ratio/high_mean": 0.1803486943244934, "clip_ratio/high_max": 0.1803486943244934, "clip_ratio/region_mean": 0.2393449079245329, "reward_total_mean": 0.31467336416244507, "reward_meter_mean": 0.692173957824707, "reward_meter_std": 0.4213980436325073, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.11160357296466827, "reward_lexical_plausibility_mean": 0.9863764643669128, "reward_lexical_plausibility_std": 0.038533199578523636, "reward_repeat_penalty_mean": 0.9922046065330505, "reward_repeat_penalty_std": 0.010986856184899807, "reward_repeat_floor_mean": 0.9988306760787964, "reward_repeat_floor_std": 0.0016480127815157175, "reward_near_duplicate_penalty_mean": 0.9922046065330505, "reward_near_duplicate_penalty_std": 0.010986856184899807, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4374999701976776, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.31467336416244507, "reward_total_composite_std": 0.21308283507823944} {"timestamp_utc": "2026-04-12T16:04:22Z", "mode": "train", "global_step": 36, "epoch": 0.0018946371243618756, "loss": 0.0688, "grad_norm": 13.143230438232422, "learning_rate": 9.893939393939395e-06, "num_tokens": 68772.0, "completions/mean_length": 90.875, "completions/min_length": 71.0, "completions/max_length": 133.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 90.875, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 133.0, "rewards/meter/mean": 0.722322404384613, "rewards/meter/std": 0.25282078981399536, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9908853769302368, "rewards/lexical_plausibility/std": 0.021876772865653038, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9927700757980347, "rewards/repeat_penalty/std": 0.004573230631649494, "rewards/repeat_floor/mean": 0.9989154934883118, "rewards/repeat_floor/std": 0.0006859906134195626, "rewards/near_duplicate_penalty/mean": 0.9927700757980347, "rewards/near_duplicate_penalty/std": 0.004573230631649494, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27753379940986633, "rewards/total_composite/std": 0.10023543238639832, "reward": 0.27753379940986633, "reward_std": 0.10023541003465652, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2324392944574356, "sampling/sampling_logp_difference/max": 3.417316198348999, "sampling/importance_sampling_ratio/min": 0.0328003466129303, "sampling/importance_sampling_ratio/mean": 1.0347892045974731, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4474022686481476, "clip_ratio/low_mean": 0.0823497623205185, "clip_ratio/low_min": 0.0823497623205185, "clip_ratio/high_mean": 0.13351451978087425, "clip_ratio/high_max": 0.13351451978087425, "clip_ratio/region_mean": 0.21586428210139275, "reward_total_mean": 0.27753379940986633, "reward_meter_mean": 0.722322404384613, "reward_meter_std": 0.25282078981399536, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9908853769302368, "reward_lexical_plausibility_std": 0.021876772865653038, "reward_repeat_penalty_mean": 0.9927700757980347, "reward_repeat_penalty_std": 0.004573230631649494, "reward_repeat_floor_mean": 0.9989154934883118, "reward_repeat_floor_std": 0.0006859906134195626, "reward_near_duplicate_penalty_mean": 0.9927700757980347, "reward_near_duplicate_penalty_std": 0.004573230631649494, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.27753379940986633, "reward_total_composite_std": 0.10023543238639832} {"timestamp_utc": "2026-04-12T16:04:31Z", "mode": "train", "global_step": 37, "epoch": 0.0019472659333719278, "loss": 0.3362, "grad_norm": 22.158899307250977, "learning_rate": 9.890909090909092e-06, "num_tokens": 70327.0, "completions/mean_length": 30.375, "completions/min_length": 17.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.375, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.45229798555374146, "rewards/meter/std": 0.41445446014404297, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.13887302577495575, "rewards/lexical_plausibility/mean": 0.984375, "rewards/lexical_plausibility/std": 0.0289318785071373, "rewards/judge_quality/mean": 0.5887500047683716, "rewards/judge_quality/std": 0.2924496531486511, "rewards/repeat_penalty/mean": 0.8070650696754456, "rewards/repeat_penalty/std": 0.10630100965499878, "rewards/repeat_floor/mean": 0.9879347681999207, "rewards/repeat_floor/std": 0.005706820636987686, "rewards/near_duplicate_penalty/mean": 0.9945650696754456, "rewards/near_duplicate_penalty/std": 0.015372347086668015, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24394118785858154, "rewards/total_composite/std": 0.25945141911506653, "reward": 0.24394118785858154, "reward_std": 0.25945141911506653, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.25791147351264954, "sampling/sampling_logp_difference/max": 2.059619903564453, "sampling/importance_sampling_ratio/min": 0.1275024265050888, "sampling/importance_sampling_ratio/mean": 1.031569242477417, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6196595281362534, "clip_ratio/low_mean": 0.13278313353657722, "clip_ratio/low_min": 0.13278313353657722, "clip_ratio/high_mean": 0.05720588192343712, "clip_ratio/high_max": 0.05720588192343712, "clip_ratio/region_mean": 0.18998901546001434, "reward_total_mean": 0.24394118785858154, "reward_meter_mean": 0.45229798555374146, "reward_meter_std": 0.41445446014404297, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.13887302577495575, "reward_lexical_plausibility_mean": 0.984375, "reward_lexical_plausibility_std": 0.0289318785071373, "reward_repeat_penalty_mean": 0.8070650696754456, "reward_repeat_penalty_std": 0.10630100965499878, "reward_repeat_floor_mean": 0.9879347681999207, "reward_repeat_floor_std": 0.005706820636987686, "reward_near_duplicate_penalty_mean": 0.9945650696754456, "reward_near_duplicate_penalty_std": 0.015372347086668015, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5887500047683716, "reward_judge_quality_std": 0.2924496531486511, "reward_total_composite_mean": 0.24394118785858154, "reward_total_composite_std": 0.25945141911506653} {"timestamp_utc": "2026-04-12T16:04:40Z", "mode": "train", "global_step": 38, "epoch": 0.00199989474238198, "loss": -0.019, "grad_norm": 17.26567268371582, "learning_rate": 9.887878787878789e-06, "num_tokens": 71817.0, "completions/mean_length": 43.25, "completions/min_length": 32.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.25, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.5460525751113892, "rewards/meter/std": 0.4408157765865326, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5887500047683716, "rewards/judge_quality/std": 0.27740830183029175, "rewards/repeat_penalty/mean": 0.9705172181129456, "rewards/repeat_penalty/std": 0.04875211417675018, "rewards/repeat_floor/mean": 0.996078372001648, "rewards/repeat_floor/std": 0.005964566953480244, "rewards/near_duplicate_penalty/mean": 0.9799288511276245, "rewards/near_duplicate_penalty/std": 0.024315785616636276, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.3269811272621155, "rewards/total_composite/std": 0.3435862362384796, "reward": 0.3269811272621155, "reward_std": 0.3435862064361572, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2100449949502945, "sampling/sampling_logp_difference/max": 1.4643468856811523, "sampling/importance_sampling_ratio/min": 0.23122896254062653, "sampling/importance_sampling_ratio/mean": 1.0345838069915771, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8484523594379425, "clip_ratio/low_mean": 0.13420672714710236, "clip_ratio/low_min": 0.13420672714710236, "clip_ratio/high_mean": 0.08962204866111279, "clip_ratio/high_max": 0.08962204866111279, "clip_ratio/region_mean": 0.22382877580821514, "reward_total_mean": 0.3269811272621155, "reward_meter_mean": 0.5460525751113892, "reward_meter_std": 0.4408157765865326, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9705172181129456, "reward_repeat_penalty_std": 0.04875211417675018, "reward_repeat_floor_mean": 0.996078372001648, "reward_repeat_floor_std": 0.005964566953480244, "reward_near_duplicate_penalty_mean": 0.9799288511276245, "reward_near_duplicate_penalty_std": 0.024315785616636276, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.5887500047683716, "reward_judge_quality_std": 0.27740830183029175, "reward_total_composite_mean": 0.3269811272621155, "reward_total_composite_std": 0.3435862362384796} {"timestamp_utc": "2026-04-12T16:04:51Z", "mode": "train", "global_step": 39, "epoch": 0.002052523551392032, "loss": -0.0047, "grad_norm": 12.93870735168457, "learning_rate": 9.884848484848486e-06, "num_tokens": 74018.0, "completions/mean_length": 104.125, "completions/min_length": 61.0, "completions/max_length": 140.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 104.125, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 140.0, "rewards/meter/mean": 0.4005318582057953, "rewards/meter/std": 0.3796837627887726, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 0.9792049527168274, "rewards/lexical_plausibility/std": 0.04006021469831467, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.97029709815979, "rewards/repeat_penalty/std": 0.07485032081604004, "rewards/repeat_floor/mean": 0.9974926710128784, "rewards/repeat_floor/std": 0.00572331715375185, "rewards/near_duplicate_penalty/mean": 0.9961960911750793, "rewards/near_duplicate_penalty/std": 0.0028786661569029093, "rewards/opening_diversity/mean": 0.9821428656578064, "rewards/opening_diversity/std": 0.05050762742757797, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.1474762260913849, "rewards/total_composite/std": 0.1448993980884552, "reward": 0.1474762260913849, "reward_std": 0.1448993980884552, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22583043575286865, "sampling/sampling_logp_difference/max": 2.5910415649414062, "sampling/importance_sampling_ratio/min": 0.07494194060564041, "sampling/importance_sampling_ratio/mean": 1.029626727104187, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.604298412799835, "clip_ratio/low_mean": 0.14363864623010159, "clip_ratio/low_min": 0.14363864623010159, "clip_ratio/high_mean": 0.04995958134531975, "clip_ratio/high_max": 0.04995958134531975, "clip_ratio/region_mean": 0.19359822757542133, "reward_total_mean": 0.1474762260913849, "reward_meter_mean": 0.4005318582057953, "reward_meter_std": 0.3796837627887726, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 0.9792049527168274, "reward_lexical_plausibility_std": 0.04006021469831467, "reward_repeat_penalty_mean": 0.97029709815979, "reward_repeat_penalty_std": 0.07485032081604004, "reward_repeat_floor_mean": 0.9974926710128784, "reward_repeat_floor_std": 0.00572331715375185, "reward_near_duplicate_penalty_mean": 0.9961960911750793, "reward_near_duplicate_penalty_std": 0.0028786661569029093, "reward_opening_diversity_mean": 0.9821428656578064, "reward_opening_diversity_std": 0.05050762742757797, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.1474762260913849, "reward_total_composite_std": 0.1448993980884552} {"timestamp_utc": "2026-04-12T16:05:00Z", "mode": "train", "global_step": 40, "epoch": 0.002105152360402084, "loss": 0.1301, "grad_norm": 12.409218788146973, "learning_rate": 9.881818181818182e-06, "num_tokens": 75996.0, "completions/mean_length": 70.25, "completions/min_length": 50.0, "completions/max_length": 110.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 70.25, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 110.0, "rewards/meter/mean": 0.36916738748550415, "rewards/meter/std": 0.3919422924518585, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4662500023841858, "rewards/judge_quality/std": 0.1743508279323578, "rewards/repeat_penalty/mean": 0.9277639389038086, "rewards/repeat_penalty/std": 0.08746004849672318, "rewards/repeat_floor/mean": 0.9911202192306519, "rewards/repeat_floor/std": 0.010052579455077648, "rewards/near_duplicate_penalty/mean": 0.9647765755653381, "rewards/near_duplicate_penalty/std": 0.029485993087291718, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9600412845611572, "rewards/distinct_2/std": 0.06480267643928528, "rewards/total_composite/mean": 0.19634950160980225, "rewards/total_composite/std": 0.2600710988044739, "reward": 0.19634950160980225, "reward_std": 0.2600710690021515, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19952291250228882, "sampling/sampling_logp_difference/max": 1.2535696029663086, "sampling/importance_sampling_ratio/min": 0.2854839265346527, "sampling/importance_sampling_ratio/mean": 1.0462639331817627, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7411714494228363, "clip_ratio/low_mean": 0.11788088269531727, "clip_ratio/low_min": 0.11788088269531727, "clip_ratio/high_mean": 0.05319135822355747, "clip_ratio/high_max": 0.05319135822355747, "clip_ratio/region_mean": 0.17107224091887474, "reward_total_mean": 0.19634950160980225, "reward_meter_mean": 0.36916738748550415, "reward_meter_std": 0.3919422924518585, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9277639389038086, "reward_repeat_penalty_std": 0.08746004849672318, "reward_repeat_floor_mean": 0.9911202192306519, "reward_repeat_floor_std": 0.010052579455077648, "reward_near_duplicate_penalty_mean": 0.9647765755653381, "reward_near_duplicate_penalty_std": 0.029485993087291718, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9600412845611572, "reward_distinct_2_std": 0.06480267643928528, "reward_judge_quality_mean": 0.4662500023841858, "reward_judge_quality_std": 0.1743508279323578, "reward_total_composite_mean": 0.19634950160980225, "reward_total_composite_std": 0.2600710988044739} {"timestamp_utc": "2026-04-12T16:05:09Z", "mode": "train", "global_step": 41, "epoch": 0.0021577811694121363, "loss": 0.0938, "grad_norm": 22.473737716674805, "learning_rate": 9.87878787878788e-06, "num_tokens": 77486.0, "completions/mean_length": 43.25, "completions/min_length": 37.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.25, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.39646434783935547, "rewards/meter/std": 0.290080189704895, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4675000011920929, "rewards/judge_quality/std": 0.3022179901599884, "rewards/repeat_penalty/mean": 0.9904521107673645, "rewards/repeat_penalty/std": 0.014704611152410507, "rewards/repeat_floor/mean": 0.9985678195953369, "rewards/repeat_floor/std": 0.0022056829184293747, "rewards/near_duplicate_penalty/mean": 0.9904521107673645, "rewards/near_duplicate_penalty/std": 0.014704611152410507, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1848469376564026, "rewards/total_composite/std": 0.1707412749528885, "reward": 0.1848469376564026, "reward_std": 0.1707412749528885, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2598678469657898, "sampling/sampling_logp_difference/max": 1.7882328033447266, "sampling/importance_sampling_ratio/min": 0.1672554761171341, "sampling/importance_sampling_ratio/mean": 1.0375196933746338, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.179448515176773, "clip_ratio/low_mean": 0.10744178667664528, "clip_ratio/low_min": 0.10744178667664528, "clip_ratio/high_mean": 0.1179304700344801, "clip_ratio/high_max": 0.1179304700344801, "clip_ratio/region_mean": 0.22537225671112537, "reward_total_mean": 0.1848469376564026, "reward_meter_mean": 0.39646434783935547, "reward_meter_std": 0.290080189704895, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9904521107673645, "reward_repeat_penalty_std": 0.014704611152410507, "reward_repeat_floor_mean": 0.9985678195953369, "reward_repeat_floor_std": 0.0022056829184293747, "reward_near_duplicate_penalty_mean": 0.9904521107673645, "reward_near_duplicate_penalty_std": 0.014704611152410507, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4675000011920929, "reward_judge_quality_std": 0.3022179901599884, "reward_total_composite_mean": 0.1848469376564026, "reward_total_composite_std": 0.1707412749528885} {"timestamp_utc": "2026-04-12T16:05:18Z", "mode": "train", "global_step": 42, "epoch": 0.0022104099784221883, "loss": 0.0573, "grad_norm": 14.14794635772705, "learning_rate": 9.875757575757576e-06, "num_tokens": 79246.0, "completions/mean_length": 54.0, "completions/min_length": 35.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.4714590013027191, "rewards/meter/std": 0.4398857653141022, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.943163275718689, "rewards/lexical_plausibility/std": 0.1121167242527008, "rewards/judge_quality/mean": 0.5462499856948853, "rewards/judge_quality/std": 0.33312106132507324, "rewards/repeat_penalty/mean": 0.9951434135437012, "rewards/repeat_penalty/std": 0.010327104479074478, "rewards/repeat_floor/mean": 0.9992715120315552, "rewards/repeat_floor/std": 0.0015490736113861203, "rewards/near_duplicate_penalty/mean": 0.9951434135437012, "rewards/near_duplicate_penalty/std": 0.010327104479074478, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19690018892288208, "rewards/total_composite/std": 0.22086982429027557, "reward": 0.19690018892288208, "reward_std": 0.22086982429027557, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20788058638572693, "sampling/sampling_logp_difference/max": 1.6384973526000977, "sampling/importance_sampling_ratio/min": 0.1942717581987381, "sampling/importance_sampling_ratio/mean": 1.048647165298462, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9128017276525497, "clip_ratio/low_mean": 0.1061682146973908, "clip_ratio/low_min": 0.1061682146973908, "clip_ratio/high_mean": 0.07374090049415827, "clip_ratio/high_max": 0.07374090049415827, "clip_ratio/region_mean": 0.17990911519154906, "reward_total_mean": 0.19690018892288208, "reward_meter_mean": 0.4714590013027191, "reward_meter_std": 0.4398857653141022, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.943163275718689, "reward_lexical_plausibility_std": 0.1121167242527008, "reward_repeat_penalty_mean": 0.9951434135437012, "reward_repeat_penalty_std": 0.010327104479074478, "reward_repeat_floor_mean": 0.9992715120315552, "reward_repeat_floor_std": 0.0015490736113861203, "reward_near_duplicate_penalty_mean": 0.9951434135437012, "reward_near_duplicate_penalty_std": 0.010327104479074478, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5462499856948853, "reward_judge_quality_std": 0.33312106132507324, "reward_total_composite_mean": 0.19690018892288208, "reward_total_composite_std": 0.22086982429027557} {"timestamp_utc": "2026-04-12T16:05:28Z", "mode": "train", "global_step": 43, "epoch": 0.0022630387874322403, "loss": 0.0937, "grad_norm": 13.095500946044922, "learning_rate": 9.872727272727274e-06, "num_tokens": 80854.0, "completions/mean_length": 51.0, "completions/min_length": 37.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.0, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.5143081545829773, "rewards/meter/std": 0.4423011243343353, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.5149999856948853, "rewards/judge_quality/std": 0.3022770881652832, "rewards/repeat_penalty/mean": 0.9940285682678223, "rewards/repeat_penalty/std": 0.013220340944826603, "rewards/repeat_floor/mean": 0.9991042613983154, "rewards/repeat_floor/std": 0.001983057940378785, "rewards/near_duplicate_penalty/mean": 0.9940285682678223, "rewards/near_duplicate_penalty/std": 0.013220340944826603, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2419220358133316, "rewards/total_composite/std": 0.3246799111366272, "reward": 0.2419220358133316, "reward_std": 0.3246799111366272, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20194099843502045, "sampling/sampling_logp_difference/max": 2.0696909427642822, "sampling/importance_sampling_ratio/min": 0.12622478604316711, "sampling/importance_sampling_ratio/mean": 1.0088589191436768, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7163867801427841, "clip_ratio/low_mean": 0.10294000897556543, "clip_ratio/low_min": 0.10294000897556543, "clip_ratio/high_mean": 0.06398474518209696, "clip_ratio/high_max": 0.06398474518209696, "clip_ratio/region_mean": 0.1669247541576624, "reward_total_mean": 0.2419220358133316, "reward_meter_mean": 0.5143081545829773, "reward_meter_std": 0.4423011243343353, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9940285682678223, "reward_repeat_penalty_std": 0.013220340944826603, "reward_repeat_floor_mean": 0.9991042613983154, "reward_repeat_floor_std": 0.001983057940378785, "reward_near_duplicate_penalty_mean": 0.9940285682678223, "reward_near_duplicate_penalty_std": 0.013220340944826603, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5149999856948853, "reward_judge_quality_std": 0.3022770881652832, "reward_total_composite_mean": 0.2419220358133316, "reward_total_composite_std": 0.3246799111366272} {"timestamp_utc": "2026-04-12T16:05:38Z", "mode": "train", "global_step": 44, "epoch": 0.0023156675964422927, "loss": 0.0317, "grad_norm": 11.550451278686523, "learning_rate": 9.869696969696971e-06, "num_tokens": 83197.0, "completions/mean_length": 107.875, "completions/min_length": 90.0, "completions/max_length": 135.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 107.875, "completions/min_terminated_length": 90.0, "completions/max_terminated_length": 135.0, "rewards/meter/mean": 0.544021725654602, "rewards/meter/std": 0.39922788739204407, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9986978769302368, "rewards/lexical_plausibility/std": 0.0036828548181802034, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9485529661178589, "rewards/repeat_penalty/std": 0.12392938137054443, "rewards/repeat_floor/mean": 0.9940599203109741, "rewards/repeat_floor/std": 0.013579227030277252, "rewards/near_duplicate_penalty/mean": 0.9828356504440308, "rewards/near_duplicate_penalty/std": 0.027978375554084778, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9626068472862244, "rewards/distinct_2/std": 0.10576383024454117, "rewards/total_composite/mean": 0.1766035556793213, "rewards/total_composite/std": 0.13081301748752594, "reward": 0.1766035556793213, "reward_std": 0.13081301748752594, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22205466032028198, "sampling/sampling_logp_difference/max": 1.7351970672607422, "sampling/importance_sampling_ratio/min": 0.1763654351234436, "sampling/importance_sampling_ratio/mean": 1.0308425426483154, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0413359254598618, "clip_ratio/low_mean": 0.10913269873708487, "clip_ratio/low_min": 0.10913269873708487, "clip_ratio/high_mean": 0.08570929616689682, "clip_ratio/high_max": 0.08570929616689682, "clip_ratio/region_mean": 0.19484199490398169, "reward_total_mean": 0.1766035556793213, "reward_meter_mean": 0.544021725654602, "reward_meter_std": 0.39922788739204407, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9986978769302368, "reward_lexical_plausibility_std": 0.0036828548181802034, "reward_repeat_penalty_mean": 0.9485529661178589, "reward_repeat_penalty_std": 0.12392938137054443, "reward_repeat_floor_mean": 0.9940599203109741, "reward_repeat_floor_std": 0.013579227030277252, "reward_near_duplicate_penalty_mean": 0.9828356504440308, "reward_near_duplicate_penalty_std": 0.027978375554084778, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9626068472862244, "reward_distinct_2_std": 0.10576383024454117, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.1766035556793213, "reward_total_composite_std": 0.13081301748752594} {"timestamp_utc": "2026-04-12T16:05:48Z", "mode": "train", "global_step": 45, "epoch": 0.0023682964054523446, "loss": 0.1632, "grad_norm": 17.604976654052734, "learning_rate": 9.866666666666668e-06, "num_tokens": 85068.0, "completions/mean_length": 51.875, "completions/min_length": 28.0, "completions/max_length": 96.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.875, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 96.0, "rewards/meter/mean": 0.2960636019706726, "rewards/meter/std": 0.32714810967445374, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9284577965736389, "rewards/lexical_plausibility/std": 0.13728460669517517, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.9990079402923584, "rewards/repeat_penalty/std": 0.0028059897013008595, "rewards/repeat_floor/mean": 0.9998512268066406, "rewards/repeat_floor/std": 0.00042089950875379145, "rewards/near_duplicate_penalty/mean": 0.9990079402923584, "rewards/near_duplicate_penalty/std": 0.0028059897013008595, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08450189232826233, "rewards/total_composite/std": 0.08134256303310394, "reward": 0.08450189232826233, "reward_std": 0.08134256303310394, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2405218482017517, "sampling/sampling_logp_difference/max": 1.4257278442382812, "sampling/importance_sampling_ratio/min": 0.24033348262310028, "sampling/importance_sampling_ratio/mean": 1.0540187358856201, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0648261457681656, "clip_ratio/low_mean": 0.13810977526009083, "clip_ratio/low_min": 0.13810977526009083, "clip_ratio/high_mean": 0.06894841324537992, "clip_ratio/high_max": 0.06894841324537992, "clip_ratio/region_mean": 0.20705818850547075, "reward_total_mean": 0.08450189232826233, "reward_meter_mean": 0.2960636019706726, "reward_meter_std": 0.32714810967445374, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9284577965736389, "reward_lexical_plausibility_std": 0.13728460669517517, "reward_repeat_penalty_mean": 0.9990079402923584, "reward_repeat_penalty_std": 0.0028059897013008595, "reward_repeat_floor_mean": 0.9998512268066406, "reward_repeat_floor_std": 0.00042089950875379145, "reward_near_duplicate_penalty_mean": 0.9990079402923584, "reward_near_duplicate_penalty_std": 0.0028059897013008595, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.08450189232826233, "reward_total_composite_std": 0.08134256303310394} {"timestamp_utc": "2026-04-12T16:05:58Z", "mode": "train", "global_step": 46, "epoch": 0.0024209252144623966, "loss": 0.0327, "grad_norm": 10.066476821899414, "learning_rate": 9.863636363636364e-06, "num_tokens": 87623.0, "completions/mean_length": 123.375, "completions/min_length": 92.0, "completions/max_length": 151.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 123.375, "completions/min_terminated_length": 92.0, "completions/max_terminated_length": 151.0, "rewards/meter/mean": 0.47935622930526733, "rewards/meter/std": 0.39885953068733215, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9589699506759644, "rewards/lexical_plausibility/std": 0.10753607749938965, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9956408739089966, "rewards/repeat_penalty/std": 0.004476652015000582, "rewards/repeat_floor/mean": 0.999346137046814, "rewards/repeat_floor/std": 0.0006714908522553742, "rewards/near_duplicate_penalty/mean": 0.9956408739089966, "rewards/near_duplicate_penalty/std": 0.004476652015000582, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1525011956691742, "rewards/total_composite/std": 0.1323809027671814, "reward": 0.1525011956691742, "reward_std": 0.1323809027671814, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21697646379470825, "sampling/sampling_logp_difference/max": 1.9224927425384521, "sampling/importance_sampling_ratio/min": 0.1975652426481247, "sampling/importance_sampling_ratio/mean": 1.0245466232299805, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.017793223261833, "clip_ratio/low_mean": 0.1330940742045641, "clip_ratio/low_min": 0.1330940742045641, "clip_ratio/high_mean": 0.08683452941477299, "clip_ratio/high_max": 0.08683452941477299, "clip_ratio/region_mean": 0.21992860361933708, "reward_total_mean": 0.1525011956691742, "reward_meter_mean": 0.47935622930526733, "reward_meter_std": 0.39885953068733215, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9589699506759644, "reward_lexical_plausibility_std": 0.10753607749938965, "reward_repeat_penalty_mean": 0.9956408739089966, "reward_repeat_penalty_std": 0.004476652015000582, "reward_repeat_floor_mean": 0.999346137046814, "reward_repeat_floor_std": 0.0006714908522553742, "reward_near_duplicate_penalty_mean": 0.9956408739089966, "reward_near_duplicate_penalty_std": 0.004476652015000582, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.1525011956691742, "reward_total_composite_std": 0.1323809027671814} {"timestamp_utc": "2026-04-12T16:06:06Z", "mode": "train", "global_step": 47, "epoch": 0.002473554023472449, "loss": 0.0981, "grad_norm": 19.66780662536621, "learning_rate": 9.860606060606061e-06, "num_tokens": 89279.0, "completions/mean_length": 47.0, "completions/min_length": 34.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.0, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.6978145241737366, "rewards/meter/std": 0.3271360695362091, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.995192289352417, "rewards/lexical_plausibility/std": 0.013598216697573662, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9867098331451416, "rewards/repeat_penalty/std": 0.02383718639612198, "rewards/repeat_floor/mean": 0.9985309839248657, "rewards/repeat_floor/std": 0.0021909738425165415, "rewards/near_duplicate_penalty/mean": 0.9954510927200317, "rewards/near_duplicate_penalty/std": 0.006915302015841007, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.2271214872598648, "rewards/total_composite/std": 0.12039513885974884, "reward": 0.2271214872598648, "reward_std": 0.12039513140916824, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24266086518764496, "sampling/sampling_logp_difference/max": 1.4173450469970703, "sampling/importance_sampling_ratio/min": 0.24235661327838898, "sampling/importance_sampling_ratio/mean": 1.0233699083328247, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.640699565410614, "clip_ratio/low_mean": 0.08001583628356457, "clip_ratio/low_min": 0.08001583628356457, "clip_ratio/high_mean": 0.16471003741025925, "clip_ratio/high_max": 0.16471003741025925, "clip_ratio/region_mean": 0.24472587369382381, "reward_total_mean": 0.2271214872598648, "reward_meter_mean": 0.6978145241737366, "reward_meter_std": 0.3271360695362091, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.995192289352417, "reward_lexical_plausibility_std": 0.013598216697573662, "reward_repeat_penalty_mean": 0.9867098331451416, "reward_repeat_penalty_std": 0.02383718639612198, "reward_repeat_floor_mean": 0.9985309839248657, "reward_repeat_floor_std": 0.0021909738425165415, "reward_near_duplicate_penalty_mean": 0.9954510927200317, "reward_near_duplicate_penalty_std": 0.006915302015841007, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.2271214872598648, "reward_total_composite_std": 0.12039513885974884} {"timestamp_utc": "2026-04-12T16:06:18Z", "mode": "train", "global_step": 48, "epoch": 0.002526182832482501, "loss": 0.0175, "grad_norm": 18.717687606811523, "learning_rate": 9.857575757575758e-06, "num_tokens": 91807.0, "completions/mean_length": 110.0, "completions/min_length": 77.0, "completions/max_length": 174.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 110.0, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 174.0, "rewards/meter/mean": 0.5925639271736145, "rewards/meter/std": 0.2528626024723053, "rewards/count_adherence/mean": 0.9821428656578064, "rewards/count_adherence/std": 0.05050762742757797, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 0.9946428537368774, "rewards/count_floor/std": 0.015152297914028168, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9914956092834473, "rewards/repeat_penalty/std": 0.002611305331811309, "rewards/repeat_floor/mean": 0.9987243413925171, "rewards/repeat_floor/std": 0.0003916955611202866, "rewards/near_duplicate_penalty/mean": 0.9914956092834473, "rewards/near_duplicate_penalty/std": 0.002611305331811309, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.23373478651046753, "rewards/total_composite/std": 0.10138335824012756, "reward": 0.23373478651046753, "reward_std": 0.10138335078954697, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.3012349009513855, "sampling/sampling_logp_difference/max": 2.999422073364258, "sampling/importance_sampling_ratio/min": 0.04981584846973419, "sampling/importance_sampling_ratio/mean": 0.9902380704879761, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4447583556175232, "clip_ratio/low_mean": 0.15489736385643482, "clip_ratio/low_min": 0.15489736385643482, "clip_ratio/high_mean": 0.09630028530955315, "clip_ratio/high_max": 0.09630028530955315, "clip_ratio/region_mean": 0.25119764916598797, "reward_total_mean": 0.23373478651046753, "reward_meter_mean": 0.5925639271736145, "reward_meter_std": 0.2528626024723053, "reward_count_adherence_mean": 0.9821428656578064, "reward_count_adherence_std": 0.05050762742757797, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 0.9946428537368774, "reward_count_floor_std": 0.015152297914028168, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9914956092834473, "reward_repeat_penalty_std": 0.002611305331811309, "reward_repeat_floor_mean": 0.9987243413925171, "reward_repeat_floor_std": 0.0003916955611202866, "reward_near_duplicate_penalty_mean": 0.9914956092834473, "reward_near_duplicate_penalty_std": 0.002611305331811309, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.23373478651046753, "reward_total_composite_std": 0.10138335824012756} {"timestamp_utc": "2026-04-12T16:06:27Z", "mode": "train", "global_step": 49, "epoch": 0.002578811641492553, "loss": 0.3139, "grad_norm": 10.536018371582031, "learning_rate": 9.854545454545456e-06, "num_tokens": 93540.0, "completions/mean_length": 73.625, "completions/min_length": 35.0, "completions/max_length": 144.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 73.625, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 144.0, "rewards/meter/mean": 0.5893219709396362, "rewards/meter/std": 0.42576706409454346, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.13887302577495575, "rewards/lexical_plausibility/mean": 0.9814241528511047, "rewards/lexical_plausibility/std": 0.052540455013513565, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.18077214062213898, "rewards/repeat_penalty/mean": 0.9992559552192688, "rewards/repeat_penalty/std": 0.002104476559907198, "rewards/repeat_floor/mean": 0.9998884201049805, "rewards/repeat_floor/std": 0.00031567990663461387, "rewards/near_duplicate_penalty/mean": 0.9992559552192688, "rewards/near_duplicate_penalty/std": 0.002104476559907198, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20694305002689362, "rewards/total_composite/std": 0.2326822578907013, "reward": 0.20694305002689362, "reward_std": 0.2326822429895401, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2126588523387909, "sampling/sampling_logp_difference/max": 1.9608492851257324, "sampling/importance_sampling_ratio/min": 0.140738844871521, "sampling/importance_sampling_ratio/mean": 1.036598563194275, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3167301416397095, "clip_ratio/low_mean": 0.1291656717658043, "clip_ratio/low_min": 0.1291656717658043, "clip_ratio/high_mean": 0.07552650291472673, "clip_ratio/high_max": 0.07552650291472673, "clip_ratio/region_mean": 0.20469217468053102, "reward_total_mean": 0.20694305002689362, "reward_meter_mean": 0.5893219709396362, "reward_meter_std": 0.42576706409454346, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.13887302577495575, "reward_lexical_plausibility_mean": 0.9814241528511047, "reward_lexical_plausibility_std": 0.052540455013513565, "reward_repeat_penalty_mean": 0.9992559552192688, "reward_repeat_penalty_std": 0.002104476559907198, "reward_repeat_floor_mean": 0.9998884201049805, "reward_repeat_floor_std": 0.00031567990663461387, "reward_near_duplicate_penalty_mean": 0.9992559552192688, "reward_near_duplicate_penalty_std": 0.002104476559907198, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.18077214062213898, "reward_total_composite_mean": 0.20694305002689362, "reward_total_composite_std": 0.2326822578907013} {"timestamp_utc": "2026-04-12T16:06:36Z", "mode": "train", "global_step": 50, "epoch": 0.002631440450502605, "loss": 0.0626, "grad_norm": 14.482155799865723, "learning_rate": 9.851515151515151e-06, "num_tokens": 95434.0, "completions/mean_length": 54.75, "completions/min_length": 40.0, "completions/max_length": 93.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.75, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 93.0, "rewards/meter/mean": 0.8728687167167664, "rewards/meter/std": 0.22255796194076538, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9908762574195862, "rewards/lexical_plausibility/std": 0.02509334124624729, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.26868730783462524, "rewards/repeat_penalty/mean": 0.9907007813453674, "rewards/repeat_penalty/std": 0.013375191949307919, "rewards/repeat_floor/mean": 0.9986051321029663, "rewards/repeat_floor/std": 0.0020062841940671206, "rewards/near_duplicate_penalty/mean": 0.9907007813453674, "rewards/near_duplicate_penalty/std": 0.013375191949307919, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4573856294155121, "rewards/total_composite/std": 0.303283154964447, "reward": 0.4573856294155121, "reward_std": 0.303283154964447, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20837847888469696, "sampling/sampling_logp_difference/max": 1.2507715225219727, "sampling/importance_sampling_ratio/min": 0.28628382086753845, "sampling/importance_sampling_ratio/mean": 1.0178985595703125, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.950836792588234, "clip_ratio/low_mean": 0.1635638177394867, "clip_ratio/low_min": 0.1635638177394867, "clip_ratio/high_mean": 0.05538522079586983, "clip_ratio/high_max": 0.05538522079586983, "clip_ratio/region_mean": 0.21894903853535652, "reward_total_mean": 0.4573856294155121, "reward_meter_mean": 0.8728687167167664, "reward_meter_std": 0.22255796194076538, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9908762574195862, "reward_lexical_plausibility_std": 0.02509334124624729, "reward_repeat_penalty_mean": 0.9907007813453674, "reward_repeat_penalty_std": 0.013375191949307919, "reward_repeat_floor_mean": 0.9986051321029663, "reward_repeat_floor_std": 0.0020062841940671206, "reward_near_duplicate_penalty_mean": 0.9907007813453674, "reward_near_duplicate_penalty_std": 0.013375191949307919, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.26868730783462524, "reward_total_composite_mean": 0.4573856294155121, "reward_total_composite_std": 0.303283154964447} {"timestamp_utc": "2026-04-12T16:08:51Z", "mode": "eval", "global_step": 50, "epoch": 0.002631440450502605, "eval_loss": NaN, "eval_runtime": 134.2424, "eval_samples_per_second": 0.775, "eval_steps_per_second": 0.097, "eval_num_tokens": 95434.0, "eval_completions/mean_length": 177.29807692307693, "eval_completions/min_length": 44.38461538461539, "eval_completions/max_length": 405.7692307692308, "eval_completions/clipped_ratio": 0.019230769230769232, "eval_completions/mean_terminated_length": 170.3804955115685, "eval_completions/min_terminated_length": 44.38461538461539, "eval_completions/max_terminated_length": 369.61538461538464, "eval_rewards/meter/mean": 0.445071117236064, "eval_rewards/meter/std": 0.34558682029063886, "eval_rewards/count_adherence/mean": 0.9169511153147771, "eval_rewards/count_adherence/std": 0.0925693979056982, "eval_rewards/arabic_clean/mean": 0.8942307692307693, "eval_rewards/arabic_clean/std": 0.2573827917759235, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9985576913906977, "eval_rewards/arabic_floor/std": 0.004079461670838869, "eval_rewards/count_floor/mean": 0.9750853272584769, "eval_rewards/count_floor/std": 0.027770821793148152, "eval_rewards/lexical_plausibility/mean": 0.9905767853443439, "eval_rewards/lexical_plausibility/std": 0.02665287284896924, "eval_rewards/judge_quality/mean": 0.40894230283223665, "eval_rewards/judge_quality/std": 0.1612841243354174, "eval_rewards/repeat_penalty/mean": 0.9728505198772137, "eval_rewards/repeat_penalty/std": 0.04411904696518412, "eval_rewards/repeat_floor/mean": 0.9967490618045514, "eval_rewards/repeat_floor/std": 0.00508836470096587, "eval_rewards/near_duplicate_penalty/mean": 0.9845332365769607, "eval_rewards/near_duplicate_penalty/std": 0.025225410219998315, "eval_rewards/opening_diversity/mean": 0.9927884615384616, "eval_rewards/opening_diversity/std": 0.020397310646680687, "eval_rewards/distinct_2/mean": 0.9944640352175786, "eval_rewards/distinct_2/std": 0.010853729497354764, "eval_rewards/total_composite/mean": 0.1737233320107827, "eval_rewards/total_composite/std": 0.1642189031610122, "eval_reward": 0.1737233320107827, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.13728128946744478, "eval_sampling/sampling_logp_difference/max": 1.2141184440025916, "eval_sampling/importance_sampling_ratio/min": 0.3012317717075348, "eval_sampling/importance_sampling_ratio/mean": 1.0408150782951942, "eval_sampling/importance_sampling_ratio/max": 1.6635784644346971, "eval_entropy": 2.2389675012001624, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.1737233320107827, "eval_reward_meter_mean": 0.445071117236064, "eval_reward_meter_std": 0.34558682029063886, "eval_reward_count_adherence_mean": 0.9169511153147771, "eval_reward_count_adherence_std": 0.0925693979056982, "eval_reward_arabic_clean_mean": 0.8942307692307693, "eval_reward_arabic_clean_std": 0.2573827917759235, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9985576913906977, "eval_reward_arabic_floor_std": 0.004079461670838869, "eval_reward_count_floor_mean": 0.9750853272584769, "eval_reward_count_floor_std": 0.027770821793148152, "eval_reward_lexical_plausibility_mean": 0.9905767853443439, "eval_reward_lexical_plausibility_std": 0.02665287284896924, "eval_reward_repeat_penalty_mean": 0.9728505198772137, "eval_reward_repeat_penalty_std": 0.04411904696518412, "eval_reward_repeat_floor_mean": 0.9967490618045514, "eval_reward_repeat_floor_std": 0.00508836470096587, "eval_reward_near_duplicate_penalty_mean": 0.9845332365769607, "eval_reward_near_duplicate_penalty_std": 0.025225410219998315, "eval_reward_opening_diversity_mean": 0.9927884615384616, "eval_reward_opening_diversity_std": 0.020397310646680687, "eval_reward_distinct_2_mean": 0.9944640352175786, "eval_reward_distinct_2_std": 0.010853729497354764, "eval_reward_judge_quality_mean": 0.40894230283223665, "eval_reward_judge_quality_std": 0.1612841243354174, "eval_reward_total_composite_mean": 0.1737233320107827, "eval_reward_total_composite_std": 0.1642189031610122} {"timestamp_utc": "2026-04-12T16:09:03Z", "mode": "train", "global_step": 51, "epoch": 0.0026840692595126573, "loss": -0.0176, "grad_norm": 10.391440391540527, "learning_rate": 9.84848484848485e-06, "num_tokens": 97567.0, "completions/mean_length": 86.625, "completions/min_length": 59.0, "completions/max_length": 129.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 86.625, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 129.0, "rewards/meter/mean": 0.7797682285308838, "rewards/meter/std": 0.2274528443813324, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.932199239730835, "rewards/lexical_plausibility/std": 0.11454705148935318, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9820003509521484, "rewards/repeat_penalty/std": 0.025386661291122437, "rewards/repeat_floor/mean": 0.9980157613754272, "rewards/repeat_floor/std": 0.002557407831773162, "rewards/near_duplicate_penalty/mean": 0.9940996170043945, "rewards/near_duplicate_penalty/std": 0.007026705890893936, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9877868890762329, "rewards/distinct_2/std": 0.022618044167757034, "rewards/total_composite/mean": 0.24208964407444, "rewards/total_composite/std": 0.1124430000782013, "reward": 0.24208964407444, "reward_std": 0.1124429851770401, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21936972439289093, "sampling/sampling_logp_difference/max": 1.5279293060302734, "sampling/importance_sampling_ratio/min": 0.21698451042175293, "sampling/importance_sampling_ratio/mean": 1.0266475677490234, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.54919296503067, "clip_ratio/low_mean": 0.10702678561210632, "clip_ratio/low_min": 0.10702678561210632, "clip_ratio/high_mean": 0.1289989035576582, "clip_ratio/high_max": 0.1289989035576582, "clip_ratio/region_mean": 0.23602568916976452, "reward_total_mean": 0.24208964407444, "reward_meter_mean": 0.7797682285308838, "reward_meter_std": 0.2274528443813324, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.932199239730835, "reward_lexical_plausibility_std": 0.11454705148935318, "reward_repeat_penalty_mean": 0.9820003509521484, "reward_repeat_penalty_std": 0.025386661291122437, "reward_repeat_floor_mean": 0.9980157613754272, "reward_repeat_floor_std": 0.002557407831773162, "reward_near_duplicate_penalty_mean": 0.9940996170043945, "reward_near_duplicate_penalty_std": 0.007026705890893936, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9877868890762329, "reward_distinct_2_std": 0.022618044167757034, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.24208964407444, "reward_total_composite_std": 0.1124430000782013} {"timestamp_utc": "2026-04-12T16:09:12Z", "mode": "train", "global_step": 52, "epoch": 0.0027366980685227093, "loss": 0.1254, "grad_norm": 10.570046424865723, "learning_rate": 9.845454545454546e-06, "num_tokens": 99438.0, "completions/mean_length": 75.875, "completions/min_length": 53.0, "completions/max_length": 112.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 75.875, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 112.0, "rewards/meter/mean": 0.9224824905395508, "rewards/meter/std": 0.14314211905002594, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9236583113670349, "rewards/lexical_plausibility/std": 0.10479297488927841, "rewards/judge_quality/mean": 0.3212500214576721, "rewards/judge_quality/std": 0.2773052752017975, "rewards/repeat_penalty/mean": 0.9874131083488464, "rewards/repeat_penalty/std": 0.02840070240199566, "rewards/repeat_floor/mean": 0.998478889465332, "rewards/repeat_floor/std": 0.003229753579944372, "rewards/near_duplicate_penalty/mean": 0.9938383102416992, "rewards/near_duplicate_penalty/std": 0.010502070188522339, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9933686852455139, "rewards/distinct_2/std": 0.01875614933669567, "rewards/total_composite/mean": 0.2647750675678253, "rewards/total_composite/std": 0.18174003064632416, "reward": 0.2647750675678253, "reward_std": 0.18174003064632416, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.197578564286232, "sampling/sampling_logp_difference/max": 1.3047370910644531, "sampling/importance_sampling_ratio/min": 0.2712438404560089, "sampling/importance_sampling_ratio/mean": 1.0037709474563599, "sampling/importance_sampling_ratio/max": 1.9497319459915161, "entropy": 2.3698359429836273, "clip_ratio/low_mean": 0.11267345305532217, "clip_ratio/low_min": 0.11267345305532217, "clip_ratio/high_mean": 0.08525996468961239, "clip_ratio/high_max": 0.08525996468961239, "clip_ratio/region_mean": 0.19793341774493456, "reward_total_mean": 0.2647750675678253, "reward_meter_mean": 0.9224824905395508, "reward_meter_std": 0.14314211905002594, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9236583113670349, "reward_lexical_plausibility_std": 0.10479297488927841, "reward_repeat_penalty_mean": 0.9874131083488464, "reward_repeat_penalty_std": 0.02840070240199566, "reward_repeat_floor_mean": 0.998478889465332, "reward_repeat_floor_std": 0.003229753579944372, "reward_near_duplicate_penalty_mean": 0.9938383102416992, "reward_near_duplicate_penalty_std": 0.010502070188522339, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9933686852455139, "reward_distinct_2_std": 0.01875614933669567, "reward_judge_quality_mean": 0.3212500214576721, "reward_judge_quality_std": 0.2773052752017975, "reward_total_composite_mean": 0.2647750675678253, "reward_total_composite_std": 0.18174003064632416} {"timestamp_utc": "2026-04-12T16:09:22Z", "mode": "train", "global_step": 53, "epoch": 0.0027893268775327613, "loss": 0.103, "grad_norm": 10.738615036010742, "learning_rate": 9.842424242424243e-06, "num_tokens": 101564.0, "completions/mean_length": 82.75, "completions/min_length": 55.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 82.75, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.6636631488800049, "rewards/meter/std": 0.4369257092475891, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9588133096694946, "rewards/lexical_plausibility/std": 0.07631121575832367, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.25670650601387024, "rewards/repeat_penalty/mean": 0.9947271347045898, "rewards/repeat_penalty/std": 0.004523387644439936, "rewards/repeat_floor/mean": 0.9992091059684753, "rewards/repeat_floor/std": 0.0006784949800930917, "rewards/near_duplicate_penalty/mean": 0.9947271347045898, "rewards/near_duplicate_penalty/std": 0.004523387644439936, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.29524222016334534, "rewards/total_composite/std": 0.292190819978714, "reward": 0.29524222016334534, "reward_std": 0.292190819978714, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2270900309085846, "sampling/sampling_logp_difference/max": 3.872091293334961, "sampling/importance_sampling_ratio/min": 0.020814793184399605, "sampling/importance_sampling_ratio/mean": 1.0320154428482056, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.151434540748596, "clip_ratio/low_mean": 0.1154552698135376, "clip_ratio/low_min": 0.1154552698135376, "clip_ratio/high_mean": 0.10241159051656723, "clip_ratio/high_max": 0.10241159051656723, "clip_ratio/region_mean": 0.21786686033010483, "reward_total_mean": 0.29524222016334534, "reward_meter_mean": 0.6636631488800049, "reward_meter_std": 0.4369257092475891, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9588133096694946, "reward_lexical_plausibility_std": 0.07631121575832367, "reward_repeat_penalty_mean": 0.9947271347045898, "reward_repeat_penalty_std": 0.004523387644439936, "reward_repeat_floor_mean": 0.9992091059684753, "reward_repeat_floor_std": 0.0006784949800930917, "reward_near_duplicate_penalty_mean": 0.9947271347045898, "reward_near_duplicate_penalty_std": 0.004523387644439936, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.25670650601387024, "reward_total_composite_mean": 0.29524222016334534, "reward_total_composite_std": 0.292190819978714} {"timestamp_utc": "2026-04-12T16:09:30Z", "mode": "train", "global_step": 54, "epoch": 0.0028419556865428137, "loss": -0.0546, "grad_norm": 31.716785430908203, "learning_rate": 9.83939393939394e-06, "num_tokens": 102989.0, "completions/mean_length": 23.125, "completions/min_length": 18.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.125, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.8562110662460327, "rewards/meter/std": 0.2180831879377365, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7562500238418579, "rewards/judge_quality/std": 0.31717222929000854, "rewards/repeat_penalty/mean": 0.7398061752319336, "rewards/repeat_penalty/std": 0.028832554817199707, "rewards/repeat_floor/mean": 0.9829612374305725, "rewards/repeat_floor/std": 0.005766510963439941, "rewards/near_duplicate_penalty/mean": 0.9864082336425781, "rewards/near_duplicate_penalty/std": 0.0384434312582016, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6877180337905884, "rewards/total_composite/std": 0.3359270691871643, "reward": 0.6877180337905884, "reward_std": 0.3359270691871643, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15803538262844086, "sampling/sampling_logp_difference/max": 1.237335205078125, "sampling/importance_sampling_ratio/min": 0.29015639424324036, "sampling/importance_sampling_ratio/mean": 1.0263099670410156, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5656054466962814, "clip_ratio/low_mean": 0.04255952499806881, "clip_ratio/low_min": 0.04255952499806881, "clip_ratio/high_mean": 0.13260012725368142, "clip_ratio/high_max": 0.13260012725368142, "clip_ratio/region_mean": 0.17515965225175023, "reward_total_mean": 0.6877180337905884, "reward_meter_mean": 0.8562110662460327, "reward_meter_std": 0.2180831879377365, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7398061752319336, "reward_repeat_penalty_std": 0.028832554817199707, "reward_repeat_floor_mean": 0.9829612374305725, "reward_repeat_floor_std": 0.005766510963439941, "reward_near_duplicate_penalty_mean": 0.9864082336425781, "reward_near_duplicate_penalty_std": 0.0384434312582016, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7562500238418579, "reward_judge_quality_std": 0.31717222929000854, "reward_total_composite_mean": 0.6877180337905884, "reward_total_composite_std": 0.3359270691871643} {"timestamp_utc": "2026-04-12T16:09:38Z", "mode": "train", "global_step": 55, "epoch": 0.0028945844955528656, "loss": 0.0867, "grad_norm": 23.254289627075195, "learning_rate": 9.836363636363637e-06, "num_tokens": 104420.0, "completions/mean_length": 33.875, "completions/min_length": 26.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.875, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.27538812160491943, "rewards/meter/std": 0.2869819700717926, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9988390207290649, "rewards/lexical_plausibility/std": 0.0032837872859090567, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9970964193344116, "rewards/repeat_penalty/std": 0.0052824467420578, "rewards/repeat_floor/mean": 0.9995644688606262, "rewards/repeat_floor/std": 0.0007923676166683435, "rewards/near_duplicate_penalty/mean": 0.9970964193344116, "rewards/near_duplicate_penalty/std": 0.0052824467420578, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.10117396712303162, "rewards/total_composite/std": 0.09911399334669113, "reward": 0.10117396712303162, "reward_std": 0.09911399334669113, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24441500008106232, "sampling/sampling_logp_difference/max": 1.9817352294921875, "sampling/importance_sampling_ratio/min": 0.13782986998558044, "sampling/importance_sampling_ratio/mean": 1.0106151103973389, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6633601784706116, "clip_ratio/low_mean": 0.13752583041787148, "clip_ratio/low_min": 0.13752583041787148, "clip_ratio/high_mean": 0.07858373317867517, "clip_ratio/high_max": 0.07858373317867517, "clip_ratio/region_mean": 0.21610956359654665, "reward_total_mean": 0.10117396712303162, "reward_meter_mean": 0.27538812160491943, "reward_meter_std": 0.2869819700717926, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9988390207290649, "reward_lexical_plausibility_std": 0.0032837872859090567, "reward_repeat_penalty_mean": 0.9970964193344116, "reward_repeat_penalty_std": 0.0052824467420578, "reward_repeat_floor_mean": 0.9995644688606262, "reward_repeat_floor_std": 0.0007923676166683435, "reward_near_duplicate_penalty_mean": 0.9970964193344116, "reward_near_duplicate_penalty_std": 0.0052824467420578, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.10117396712303162, "reward_total_composite_std": 0.09911399334669113} {"timestamp_utc": "2026-04-12T16:09:47Z", "mode": "train", "global_step": 56, "epoch": 0.0029472133045629176, "loss": -0.1011, "grad_norm": 16.747817993164062, "learning_rate": 9.833333333333333e-06, "num_tokens": 106204.0, "completions/mean_length": 51.0, "completions/min_length": 25.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.0, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.541499137878418, "rewards/meter/std": 0.4344416856765747, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.24512389302253723, "rewards/repeat_penalty/mean": 0.964999258518219, "rewards/repeat_penalty/std": 0.08750505745410919, "rewards/repeat_floor/mean": 0.9975624084472656, "rewards/repeat_floor/std": 0.005314696114510298, "rewards/near_duplicate_penalty/mean": 0.996249258518219, "rewards/near_duplicate_penalty/std": 0.010608699172735214, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.31828606128692627, "rewards/total_composite/std": 0.33471304178237915, "reward": 0.31828606128692627, "reward_std": 0.33471301198005676, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20916934311389923, "sampling/sampling_logp_difference/max": 1.670210838317871, "sampling/importance_sampling_ratio/min": 0.18820738792419434, "sampling/importance_sampling_ratio/mean": 1.0528364181518555, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.318334147334099, "clip_ratio/low_mean": 0.09745830856263638, "clip_ratio/low_min": 0.09745830856263638, "clip_ratio/high_mean": 0.06373097561299801, "clip_ratio/high_max": 0.06373097561299801, "clip_ratio/region_mean": 0.16118928417563438, "reward_total_mean": 0.31828606128692627, "reward_meter_mean": 0.541499137878418, "reward_meter_std": 0.4344416856765747, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.964999258518219, "reward_repeat_penalty_std": 0.08750505745410919, "reward_repeat_floor_mean": 0.9975624084472656, "reward_repeat_floor_std": 0.005314696114510298, "reward_near_duplicate_penalty_mean": 0.996249258518219, "reward_near_duplicate_penalty_std": 0.010608699172735214, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.24512389302253723, "reward_total_composite_mean": 0.31828606128692627, "reward_total_composite_std": 0.33471304178237915} {"timestamp_utc": "2026-04-12T16:10:00Z", "mode": "train", "global_step": 57, "epoch": 0.00299984211357297, "loss": 0.0134, "grad_norm": 4.642459869384766, "learning_rate": 9.830303030303032e-06, "num_tokens": 111258.0, "completions/mean_length": 400.75, "completions/min_length": 307.0, "completions/max_length": 474.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 400.75, "completions/min_terminated_length": 307.0, "completions/max_terminated_length": 474.0, "rewards/meter/mean": 0.9013170003890991, "rewards/meter/std": 0.08074897527694702, "rewards/count_adherence/mean": 0.8636363744735718, "rewards/count_adherence/std": 0.04859296977519989, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9590909481048584, "rewards/count_floor/std": 0.014577903784811497, "rewards/lexical_plausibility/mean": 0.983328104019165, "rewards/lexical_plausibility/std": 0.0458899661898613, "rewards/judge_quality/mean": 0.15625, "rewards/judge_quality/std": 0.09425459802150726, "rewards/repeat_penalty/mean": 0.9893382787704468, "rewards/repeat_penalty/std": 0.009818924590945244, "rewards/repeat_floor/mean": 0.9988276958465576, "rewards/repeat_floor/std": 0.0009705271222628653, "rewards/near_duplicate_penalty/mean": 0.9965053200721741, "rewards/near_duplicate_penalty/std": 0.0016852014232426882, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9927985668182373, "rewards/distinct_2/std": 0.00856027565896511, "rewards/total_composite/mean": 0.13366711139678955, "rewards/total_composite/std": 0.08221367001533508, "reward": 0.13366711139678955, "reward_std": 0.08221367001533508, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20859874784946442, "sampling/sampling_logp_difference/max": 2.716672897338867, "sampling/importance_sampling_ratio/min": 0.0660942941904068, "sampling/importance_sampling_ratio/mean": 1.037036657333374, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8429089784622192, "clip_ratio/low_mean": 0.11098390258848667, "clip_ratio/low_min": 0.11098390258848667, "clip_ratio/high_mean": 0.07725444622337818, "clip_ratio/high_max": 0.07725444622337818, "clip_ratio/region_mean": 0.18823834881186485, "reward_total_mean": 0.13366711139678955, "reward_meter_mean": 0.9013170003890991, "reward_meter_std": 0.08074897527694702, "reward_count_adherence_mean": 0.8636363744735718, "reward_count_adherence_std": 0.04859296977519989, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9590909481048584, "reward_count_floor_std": 0.014577903784811497, "reward_lexical_plausibility_mean": 0.983328104019165, "reward_lexical_plausibility_std": 0.0458899661898613, "reward_repeat_penalty_mean": 0.9893382787704468, "reward_repeat_penalty_std": 0.009818924590945244, "reward_repeat_floor_mean": 0.9988276958465576, "reward_repeat_floor_std": 0.0009705271222628653, "reward_near_duplicate_penalty_mean": 0.9965053200721741, "reward_near_duplicate_penalty_std": 0.0016852014232426882, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9927985668182373, "reward_distinct_2_std": 0.00856027565896511, "reward_judge_quality_mean": 0.15625, "reward_judge_quality_std": 0.09425459802150726, "reward_total_composite_mean": 0.13366711139678955, "reward_total_composite_std": 0.08221367001533508} {"timestamp_utc": "2026-04-12T16:10:09Z", "mode": "train", "global_step": 58, "epoch": 0.003052470922583022, "loss": -0.062, "grad_norm": 10.932044982910156, "learning_rate": 9.827272727272729e-06, "num_tokens": 113545.0, "completions/mean_length": 96.875, "completions/min_length": 73.0, "completions/max_length": 110.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 96.875, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 110.0, "rewards/meter/mean": 0.8158788681030273, "rewards/meter/std": 0.2542024850845337, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9748784303665161, "rewards/repeat_penalty/std": 0.05859052762389183, "rewards/repeat_floor/mean": 0.9971906542778015, "rewards/repeat_floor/std": 0.00609612138941884, "rewards/near_duplicate_penalty/mean": 0.9917606115341187, "rewards/near_duplicate_penalty/std": 0.012072098441421986, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.2996920943260193, "rewards/total_composite/std": 0.08764141798019409, "reward": 0.2996920943260193, "reward_std": 0.08764141798019409, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.222623810172081, "sampling/sampling_logp_difference/max": 1.4790148735046387, "sampling/importance_sampling_ratio/min": 0.22786207497119904, "sampling/importance_sampling_ratio/mean": 1.0376818180084229, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.836358606815338, "clip_ratio/low_mean": 0.0490132924169302, "clip_ratio/low_min": 0.0490132924169302, "clip_ratio/high_mean": 0.16877817921340466, "clip_ratio/high_max": 0.16877817921340466, "clip_ratio/region_mean": 0.21779147163033485, "reward_total_mean": 0.2996920943260193, "reward_meter_mean": 0.8158788681030273, "reward_meter_std": 0.2542024850845337, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9748784303665161, "reward_repeat_penalty_std": 0.05859052762389183, "reward_repeat_floor_mean": 0.9971906542778015, "reward_repeat_floor_std": 0.00609612138941884, "reward_near_duplicate_penalty_mean": 0.9917606115341187, "reward_near_duplicate_penalty_std": 0.012072098441421986, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.2996920943260193, "reward_total_composite_std": 0.08764141798019409} {"timestamp_utc": "2026-04-12T16:10:18Z", "mode": "train", "global_step": 59, "epoch": 0.003105099731593074, "loss": 0.1433, "grad_norm": 17.224931716918945, "learning_rate": 9.824242424242425e-06, "num_tokens": 115263.0, "completions/mean_length": 43.75, "completions/min_length": 28.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.75, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.8781561851501465, "rewards/meter/std": 0.13444408774375916, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9930555820465088, "rewards/lexical_plausibility/std": 0.01285861898213625, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.2745385766029358, "rewards/repeat_penalty/mean": 0.9897637367248535, "rewards/repeat_penalty/std": 0.02021852321922779, "rewards/repeat_floor/mean": 0.9984645843505859, "rewards/repeat_floor/std": 0.003032783279195428, "rewards/near_duplicate_penalty/mean": 0.9897637367248535, "rewards/near_duplicate_penalty/std": 0.02021852321922779, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.43237680196762085, "rewards/total_composite/std": 0.22993886470794678, "reward": 0.43237680196762085, "reward_std": 0.22993884980678558, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2185475379228592, "sampling/sampling_logp_difference/max": 2.5989527702331543, "sampling/importance_sampling_ratio/min": 0.07435140013694763, "sampling/importance_sampling_ratio/mean": 1.0197927951812744, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.218057304620743, "clip_ratio/low_mean": 0.13719338364899158, "clip_ratio/low_min": 0.13719338364899158, "clip_ratio/high_mean": 0.07783209532499313, "clip_ratio/high_max": 0.07783209532499313, "clip_ratio/region_mean": 0.21502547897398472, "reward_total_mean": 0.43237680196762085, "reward_meter_mean": 0.8781561851501465, "reward_meter_std": 0.13444408774375916, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9930555820465088, "reward_lexical_plausibility_std": 0.01285861898213625, "reward_repeat_penalty_mean": 0.9897637367248535, "reward_repeat_penalty_std": 0.02021852321922779, "reward_repeat_floor_mean": 0.9984645843505859, "reward_repeat_floor_std": 0.003032783279195428, "reward_near_duplicate_penalty_mean": 0.9897637367248535, "reward_near_duplicate_penalty_std": 0.02021852321922779, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.2745385766029358, "reward_total_composite_mean": 0.43237680196762085, "reward_total_composite_std": 0.22993886470794678} {"timestamp_utc": "2026-04-12T16:10:29Z", "mode": "train", "global_step": 60, "epoch": 0.0031577285406031263, "loss": 0.0639, "grad_norm": 9.0322265625, "learning_rate": 9.821212121212122e-06, "num_tokens": 117897.0, "completions/mean_length": 155.25, "completions/min_length": 115.0, "completions/max_length": 187.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 155.25, "completions/min_terminated_length": 115.0, "completions/max_terminated_length": 187.0, "rewards/meter/mean": 0.9913378953933716, "rewards/meter/std": 0.010462315753102303, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9424874782562256, "rewards/lexical_plausibility/std": 0.110664963722229, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.98736971616745, "rewards/repeat_penalty/std": 0.025898857042193413, "rewards/repeat_floor/mean": 0.9985493421554565, "rewards/repeat_floor/std": 0.002653527772054076, "rewards/near_duplicate_penalty/mean": 0.9949444532394409, "rewards/near_duplicate_penalty/std": 0.005881176795810461, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9923076629638672, "rewards/distinct_2/std": 0.021757129579782486, "rewards/total_composite/mean": 0.39576077461242676, "rewards/total_composite/std": 0.10535090416669846, "reward": 0.39576077461242676, "reward_std": 0.10535089671611786, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1954849362373352, "sampling/sampling_logp_difference/max": 1.7156519889831543, "sampling/importance_sampling_ratio/min": 0.17984643578529358, "sampling/importance_sampling_ratio/mean": 1.0383236408233643, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2503845244646072, "clip_ratio/low_mean": 0.04047378897666931, "clip_ratio/low_min": 0.04047378897666931, "clip_ratio/high_mean": 0.1617762576788664, "clip_ratio/high_max": 0.1617762576788664, "clip_ratio/region_mean": 0.2022500466555357, "reward_total_mean": 0.39576077461242676, "reward_meter_mean": 0.9913378953933716, "reward_meter_std": 0.010462315753102303, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9424874782562256, "reward_lexical_plausibility_std": 0.110664963722229, "reward_repeat_penalty_mean": 0.98736971616745, "reward_repeat_penalty_std": 0.025898857042193413, "reward_repeat_floor_mean": 0.9985493421554565, "reward_repeat_floor_std": 0.002653527772054076, "reward_near_duplicate_penalty_mean": 0.9949444532394409, "reward_near_duplicate_penalty_std": 0.005881176795810461, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9923076629638672, "reward_distinct_2_std": 0.021757129579782486, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.39576077461242676, "reward_total_composite_std": 0.10535090416669846} {"timestamp_utc": "2026-04-12T16:10:38Z", "mode": "train", "global_step": 61, "epoch": 0.0032103573496131783, "loss": 0.0872, "grad_norm": 27.523418426513672, "learning_rate": 9.81818181818182e-06, "num_tokens": 119366.0, "completions/mean_length": 35.625, "completions/min_length": 25.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.625, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.42723244428634644, "rewards/meter/std": 0.40925148129463196, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5250000357627869, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.9827656149864197, "rewards/repeat_penalty/std": 0.019679687917232513, "rewards/repeat_floor/mean": 0.9974148273468018, "rewards/repeat_floor/std": 0.00295194867067039, "rewards/near_duplicate_penalty/mean": 0.9827656149864197, "rewards/near_duplicate_penalty/std": 0.019679687917232513, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.25965416431427, "rewards/total_composite/std": 0.27791792154312134, "reward": 0.25965416431427, "reward_std": 0.27791789174079895, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2621625065803528, "sampling/sampling_logp_difference/max": 2.3092856407165527, "sampling/importance_sampling_ratio/min": 0.09933219105005264, "sampling/importance_sampling_ratio/mean": 0.9767956137657166, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.357659012079239, "clip_ratio/low_mean": 0.10717914719134569, "clip_ratio/low_min": 0.10717914719134569, "clip_ratio/high_mean": 0.13505913875997066, "clip_ratio/high_max": 0.13505913875997066, "clip_ratio/region_mean": 0.24223828595131636, "reward_total_mean": 0.25965416431427, "reward_meter_mean": 0.42723244428634644, "reward_meter_std": 0.40925148129463196, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9827656149864197, "reward_repeat_penalty_std": 0.019679687917232513, "reward_repeat_floor_mean": 0.9974148273468018, "reward_repeat_floor_std": 0.00295194867067039, "reward_near_duplicate_penalty_mean": 0.9827656149864197, "reward_near_duplicate_penalty_std": 0.019679687917232513, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5250000357627869, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.25965416431427, "reward_total_composite_std": 0.27791792154312134} {"timestamp_utc": "2026-04-12T16:10:46Z", "mode": "train", "global_step": 62, "epoch": 0.0032629861586232303, "loss": 0.1218, "grad_norm": 21.601524353027344, "learning_rate": 9.815151515151516e-06, "num_tokens": 120932.0, "completions/mean_length": 34.75, "completions/min_length": 28.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.75, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.3043733835220337, "rewards/meter/std": 0.30216702818870544, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9836230278015137, "rewards/lexical_plausibility/std": 0.04632115736603737, "rewards/judge_quality/mean": 0.7012499570846558, "rewards/judge_quality/std": 0.3290001451969147, "rewards/repeat_penalty/mean": 0.9963341355323792, "rewards/repeat_penalty/std": 0.005656497087329626, "rewards/repeat_floor/mean": 0.9994500875473022, "rewards/repeat_floor/std": 0.0008484762511216104, "rewards/near_duplicate_penalty/mean": 0.9963341355323792, "rewards/near_duplicate_penalty/std": 0.005656497087329626, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18301305174827576, "rewards/total_composite/std": 0.18151044845581055, "reward": 0.18301305174827576, "reward_std": 0.18151043355464935, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2644853889942169, "sampling/sampling_logp_difference/max": 2.5253634452819824, "sampling/importance_sampling_ratio/min": 0.08002921938896179, "sampling/importance_sampling_ratio/mean": 0.9787096381187439, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7581471502780914, "clip_ratio/low_mean": 0.11003666650503874, "clip_ratio/low_min": 0.11003666650503874, "clip_ratio/high_mean": 0.08930934779345989, "clip_ratio/high_max": 0.08930934779345989, "clip_ratio/region_mean": 0.19934601429849863, "reward_total_mean": 0.18301305174827576, "reward_meter_mean": 0.3043733835220337, "reward_meter_std": 0.30216702818870544, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9836230278015137, "reward_lexical_plausibility_std": 0.04632115736603737, "reward_repeat_penalty_mean": 0.9963341355323792, "reward_repeat_penalty_std": 0.005656497087329626, "reward_repeat_floor_mean": 0.9994500875473022, "reward_repeat_floor_std": 0.0008484762511216104, "reward_near_duplicate_penalty_mean": 0.9963341355323792, "reward_near_duplicate_penalty_std": 0.005656497087329626, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7012499570846558, "reward_judge_quality_std": 0.3290001451969147, "reward_total_composite_mean": 0.18301305174827576, "reward_total_composite_std": 0.18151044845581055} {"timestamp_utc": "2026-04-12T16:10:54Z", "mode": "train", "global_step": 63, "epoch": 0.0033156149676332822, "loss": 0.2275, "grad_norm": 26.84090232849121, "learning_rate": 9.812121212121212e-06, "num_tokens": 122192.0, "completions/mean_length": 16.5, "completions/min_length": 12.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.5, "completions/min_terminated_length": 12.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.4654954671859741, "rewards/meter/std": 0.4026661217212677, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.21104755997657776, "rewards/repeat_penalty/mean": 0.7432166337966919, "rewards/repeat_penalty/std": 0.019186342135071754, "rewards/repeat_floor/mean": 0.9836432933807373, "rewards/repeat_floor/std": 0.0038372809067368507, "rewards/near_duplicate_penalty/mean": 0.9909554719924927, "rewards/near_duplicate_penalty/std": 0.025581790134310722, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20217357575893402, "rewards/total_composite/std": 0.1694164276123047, "reward": 0.20217357575893402, "reward_std": 0.1694164276123047, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21298496425151825, "sampling/sampling_logp_difference/max": 1.5629849433898926, "sampling/importance_sampling_ratio/min": 0.20950976014137268, "sampling/importance_sampling_ratio/mean": 0.9909963011741638, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2390024811029434, "clip_ratio/low_mean": 0.06486344616860151, "clip_ratio/low_min": 0.06486344616860151, "clip_ratio/high_mean": 0.11815476510673761, "clip_ratio/high_max": 0.11815476510673761, "clip_ratio/region_mean": 0.18301821127533913, "reward_total_mean": 0.20217357575893402, "reward_meter_mean": 0.4654954671859741, "reward_meter_std": 0.4026661217212677, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7432166337966919, "reward_repeat_penalty_std": 0.019186342135071754, "reward_repeat_floor_mean": 0.9836432933807373, "reward_repeat_floor_std": 0.0038372809067368507, "reward_near_duplicate_penalty_mean": 0.9909554719924927, "reward_near_duplicate_penalty_std": 0.025581790134310722, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.21104755997657776, "reward_total_composite_mean": 0.20217357575893402, "reward_total_composite_std": 0.1694164276123047} {"timestamp_utc": "2026-04-12T16:11:04Z", "mode": "train", "global_step": 64, "epoch": 0.0033682437766433346, "loss": 0.1121, "grad_norm": 14.572439193725586, "learning_rate": 9.809090909090911e-06, "num_tokens": 124051.0, "completions/mean_length": 62.375, "completions/min_length": 48.0, "completions/max_length": 88.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 62.375, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 88.0, "rewards/meter/mean": 0.8821189403533936, "rewards/meter/std": 0.26891547441482544, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9881824254989624, "rewards/repeat_penalty/std": 0.014187062159180641, "rewards/repeat_floor/mean": 0.9982273578643799, "rewards/repeat_floor/std": 0.002128050895407796, "rewards/near_duplicate_penalty/mean": 0.9881824254989624, "rewards/near_duplicate_penalty/std": 0.014187062159180641, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3443075120449066, "rewards/total_composite/std": 0.1484030932188034, "reward": 0.3443075120449066, "reward_std": 0.1484030932188034, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22710561752319336, "sampling/sampling_logp_difference/max": 1.7819933891296387, "sampling/importance_sampling_ratio/min": 0.16830232739448547, "sampling/importance_sampling_ratio/mean": 1.0271949768066406, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0756715685129166, "clip_ratio/low_mean": 0.05536968074738979, "clip_ratio/low_min": 0.05536968074738979, "clip_ratio/high_mean": 0.14837482012808323, "clip_ratio/high_max": 0.14837482012808323, "clip_ratio/region_mean": 0.20374450087547302, "reward_total_mean": 0.3443075120449066, "reward_meter_mean": 0.8821189403533936, "reward_meter_std": 0.26891547441482544, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9881824254989624, "reward_repeat_penalty_std": 0.014187062159180641, "reward_repeat_floor_mean": 0.9982273578643799, "reward_repeat_floor_std": 0.002128050895407796, "reward_near_duplicate_penalty_mean": 0.9881824254989624, "reward_near_duplicate_penalty_std": 0.014187062159180641, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.3443075120449066, "reward_total_composite_std": 0.1484030932188034} {"timestamp_utc": "2026-04-12T16:11:13Z", "mode": "train", "global_step": 65, "epoch": 0.0034208725856533866, "loss": -0.1235, "grad_norm": 25.44385528564453, "learning_rate": 9.806060606060607e-06, "num_tokens": 125739.0, "completions/mean_length": 47.0, "completions/min_length": 34.0, "completions/max_length": 79.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.0, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.7405123710632324, "rewards/meter/std": 0.3356536626815796, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4587499797344208, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.9792635440826416, "rewards/repeat_penalty/std": 0.012044358998537064, "rewards/repeat_floor/mean": 0.9968895316123962, "rewards/repeat_floor/std": 0.0018066534539684653, "rewards/near_duplicate_penalty/mean": 0.9792635440826416, "rewards/near_duplicate_penalty/std": 0.012044358998537064, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3144078254699707, "rewards/total_composite/std": 0.13536033034324646, "reward": 0.3144078254699707, "reward_std": 0.13536033034324646, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24648673832416534, "sampling/sampling_logp_difference/max": 1.7683677673339844, "sampling/importance_sampling_ratio/min": 0.17061124742031097, "sampling/importance_sampling_ratio/mean": 1.0266461372375488, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4860416650772095, "clip_ratio/low_mean": 0.046078432351350784, "clip_ratio/low_min": 0.046078432351350784, "clip_ratio/high_mean": 0.15715246833860874, "clip_ratio/high_max": 0.15715246833860874, "clip_ratio/region_mean": 0.20323090068995953, "reward_total_mean": 0.3144078254699707, "reward_meter_mean": 0.7405123710632324, "reward_meter_std": 0.3356536626815796, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9792635440826416, "reward_repeat_penalty_std": 0.012044358998537064, "reward_repeat_floor_mean": 0.9968895316123962, "reward_repeat_floor_std": 0.0018066534539684653, "reward_near_duplicate_penalty_mean": 0.9792635440826416, "reward_near_duplicate_penalty_std": 0.012044358998537064, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4587499797344208, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.3144078254699707, "reward_total_composite_std": 0.13536033034324646} {"timestamp_utc": "2026-04-12T16:11:21Z", "mode": "train", "global_step": 66, "epoch": 0.0034735013946634386, "loss": -0.0324, "grad_norm": 15.109299659729004, "learning_rate": 9.803030303030304e-06, "num_tokens": 127343.0, "completions/mean_length": 40.5, "completions/min_length": 34.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.5, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.857477605342865, "rewards/meter/std": 0.13007476925849915, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9572981595993042, "rewards/lexical_plausibility/std": 0.08722753822803497, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.9931166172027588, "rewards/repeat_penalty/std": 0.015105213969945908, "rewards/repeat_floor/mean": 0.9989675283432007, "rewards/repeat_floor/std": 0.002265774644911289, "rewards/near_duplicate_penalty/mean": 0.9931166172027588, "rewards/near_duplicate_penalty/std": 0.015105213969945908, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4047844409942627, "rewards/total_composite/std": 0.12278708815574646, "reward": 0.4047844409942627, "reward_std": 0.12278708815574646, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17524486780166626, "sampling/sampling_logp_difference/max": 1.338212013244629, "sampling/importance_sampling_ratio/min": 0.2623142600059509, "sampling/importance_sampling_ratio/mean": 1.0493476390838623, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.170139789581299, "clip_ratio/low_mean": 0.1144349854439497, "clip_ratio/low_min": 0.1144349854439497, "clip_ratio/high_mean": 0.06920644082129002, "clip_ratio/high_max": 0.06920644082129002, "clip_ratio/region_mean": 0.18364142626523972, "reward_total_mean": 0.4047844409942627, "reward_meter_mean": 0.857477605342865, "reward_meter_std": 0.13007476925849915, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9572981595993042, "reward_lexical_plausibility_std": 0.08722753822803497, "reward_repeat_penalty_mean": 0.9931166172027588, "reward_repeat_penalty_std": 0.015105213969945908, "reward_repeat_floor_mean": 0.9989675283432007, "reward_repeat_floor_std": 0.002265774644911289, "reward_near_duplicate_penalty_mean": 0.9931166172027588, "reward_near_duplicate_penalty_std": 0.015105213969945908, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.4047844409942627, "reward_total_composite_std": 0.12278708815574646} {"timestamp_utc": "2026-04-12T16:11:32Z", "mode": "train", "global_step": 67, "epoch": 0.003526130203673491, "loss": 0.0426, "grad_norm": 14.470446586608887, "learning_rate": 9.800000000000001e-06, "num_tokens": 129036.0, "completions/mean_length": 57.625, "completions/min_length": 36.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.625, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.4118611812591553, "rewards/meter/std": 0.4184275269508362, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9930555820465088, "rewards/lexical_plausibility/std": 0.01285861898213625, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121347069740295, "rewards/repeat_penalty/mean": 0.9856113791465759, "rewards/repeat_penalty/std": 0.018535489216446877, "rewards/repeat_floor/mean": 0.9978417158126831, "rewards/repeat_floor/std": 0.002780318958684802, "rewards/near_duplicate_penalty/mean": 0.9856113791465759, "rewards/near_duplicate_penalty/std": 0.018535489216446877, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.17825430631637573, "rewards/total_composite/std": 0.26260918378829956, "reward": 0.17825430631637573, "reward_std": 0.26260918378829956, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2115630805492401, "sampling/sampling_logp_difference/max": 1.5753626823425293, "sampling/importance_sampling_ratio/min": 0.20693248510360718, "sampling/importance_sampling_ratio/mean": 1.0093439817428589, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9403171986341476, "clip_ratio/low_mean": 0.13015037402510643, "clip_ratio/low_min": 0.13015037402510643, "clip_ratio/high_mean": 0.06842435523867607, "clip_ratio/high_max": 0.06842435523867607, "clip_ratio/region_mean": 0.1985747292637825, "reward_total_mean": 0.17825430631637573, "reward_meter_mean": 0.4118611812591553, "reward_meter_std": 0.4184275269508362, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9930555820465088, "reward_lexical_plausibility_std": 0.01285861898213625, "reward_repeat_penalty_mean": 0.9856113791465759, "reward_repeat_penalty_std": 0.018535489216446877, "reward_repeat_floor_mean": 0.9978417158126831, "reward_repeat_floor_std": 0.002780318958684802, "reward_near_duplicate_penalty_mean": 0.9856113791465759, "reward_near_duplicate_penalty_std": 0.018535489216446877, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121347069740295, "reward_total_composite_mean": 0.17825430631637573, "reward_total_composite_std": 0.26260918378829956} {"timestamp_utc": "2026-04-12T16:11:43Z", "mode": "train", "global_step": 68, "epoch": 0.003578759012683543, "loss": 0.1064, "grad_norm": 24.879629135131836, "learning_rate": 9.796969696969698e-06, "num_tokens": 130351.0, "completions/mean_length": 20.375, "completions/min_length": 16.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.375, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.5425297021865845, "rewards/meter/std": 0.4662072956562042, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.706250011920929, "rewards/judge_quality/std": 0.2950030267238617, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3311706781387329, "rewards/total_composite/std": 0.35036519169807434, "reward": 0.3311706781387329, "reward_std": 0.35036519169807434, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18561644852161407, "sampling/sampling_logp_difference/max": 1.0416240692138672, "sampling/importance_sampling_ratio/min": 0.3528811037540436, "sampling/importance_sampling_ratio/mean": 1.0162744522094727, "sampling/importance_sampling_ratio/max": 1.9564259052276611, "entropy": 1.7219845056533813, "clip_ratio/low_mean": 0.05209703976288438, "clip_ratio/low_min": 0.05209703976288438, "clip_ratio/high_mean": 0.10329861473292112, "clip_ratio/high_max": 0.10329861473292112, "clip_ratio/region_mean": 0.1553956544958055, "reward_total_mean": 0.3311706781387329, "reward_meter_mean": 0.5425297021865845, "reward_meter_std": 0.4662072956562042, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.706250011920929, "reward_judge_quality_std": 0.2950030267238617, "reward_total_composite_mean": 0.3311706781387329, "reward_total_composite_std": 0.35036519169807434} {"timestamp_utc": "2026-04-12T16:11:52Z", "mode": "train", "global_step": 69, "epoch": 0.003631387821693595, "loss": 0.0433, "grad_norm": 19.02853012084961, "learning_rate": 9.793939393939394e-06, "num_tokens": 132038.0, "completions/mean_length": 49.875, "completions/min_length": 35.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.875, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.546741247177124, "rewards/meter/std": 0.43295955657958984, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.9810117483139038, "rewards/repeat_penalty/std": 0.022440442815423012, "rewards/repeat_floor/mean": 0.9971517324447632, "rewards/repeat_floor/std": 0.0033660747576504946, "rewards/near_duplicate_penalty/mean": 0.9810117483139038, "rewards/near_duplicate_penalty/std": 0.022440442815423012, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2481343001127243, "rewards/total_composite/std": 0.1825486123561859, "reward": 0.2481343001127243, "reward_std": 0.1825486123561859, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21970173716545105, "sampling/sampling_logp_difference/max": 2.9506092071533203, "sampling/importance_sampling_ratio/min": 0.05230783298611641, "sampling/importance_sampling_ratio/mean": 1.0293940305709839, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1979509592056274, "clip_ratio/low_mean": 0.05561224650591612, "clip_ratio/low_min": 0.05561224650591612, "clip_ratio/high_mean": 0.12462344113737345, "clip_ratio/high_max": 0.12462344113737345, "clip_ratio/region_mean": 0.18023568764328957, "reward_total_mean": 0.2481343001127243, "reward_meter_mean": 0.546741247177124, "reward_meter_std": 0.43295955657958984, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9810117483139038, "reward_repeat_penalty_std": 0.022440442815423012, "reward_repeat_floor_mean": 0.9971517324447632, "reward_repeat_floor_std": 0.0033660747576504946, "reward_near_duplicate_penalty_mean": 0.9810117483139038, "reward_near_duplicate_penalty_std": 0.022440442815423012, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.2481343001127243, "reward_total_composite_std": 0.1825486123561859} {"timestamp_utc": "2026-04-12T16:12:00Z", "mode": "train", "global_step": 70, "epoch": 0.0036840166307036473, "loss": 0.0476, "grad_norm": 14.128938674926758, "learning_rate": 9.790909090909093e-06, "num_tokens": 134009.0, "completions/mean_length": 80.375, "completions/min_length": 68.0, "completions/max_length": 91.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 80.375, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.5790213346481323, "rewards/meter/std": 0.36007389426231384, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9857064485549927, "rewards/lexical_plausibility/std": 0.02878989279270172, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.10350983589887619, "rewards/repeat_penalty/mean": 0.9832158088684082, "rewards/repeat_penalty/std": 0.02878197841346264, "rewards/repeat_floor/mean": 0.9978755116462708, "rewards/repeat_floor/std": 0.0032227092888206244, "rewards/near_duplicate_penalty/mean": 0.9901101589202881, "rewards/near_duplicate_penalty/std": 0.009958839043974876, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9928774833679199, "rewards/distinct_2/std": 0.02014549821615219, "rewards/total_composite/mean": 0.22911961376667023, "rewards/total_composite/std": 0.14408215880393982, "reward": 0.22911961376667023, "reward_std": 0.14408215880393982, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22844818234443665, "sampling/sampling_logp_difference/max": 1.4417133331298828, "sampling/importance_sampling_ratio/min": 0.23652216792106628, "sampling/importance_sampling_ratio/mean": 1.029520869255066, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.37846240401268, "clip_ratio/low_mean": 0.08246947452425957, "clip_ratio/low_min": 0.08246947452425957, "clip_ratio/high_mean": 0.13380922749638557, "clip_ratio/high_max": 0.13380922749638557, "clip_ratio/region_mean": 0.21627870202064514, "reward_total_mean": 0.22911961376667023, "reward_meter_mean": 0.5790213346481323, "reward_meter_std": 0.36007389426231384, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9857064485549927, "reward_lexical_plausibility_std": 0.02878989279270172, "reward_repeat_penalty_mean": 0.9832158088684082, "reward_repeat_penalty_std": 0.02878197841346264, "reward_repeat_floor_mean": 0.9978755116462708, "reward_repeat_floor_std": 0.0032227092888206244, "reward_near_duplicate_penalty_mean": 0.9901101589202881, "reward_near_duplicate_penalty_std": 0.009958839043974876, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9928774833679199, "reward_distinct_2_std": 0.02014549821615219, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.10350983589887619, "reward_total_composite_mean": 0.22911961376667023, "reward_total_composite_std": 0.14408215880393982} {"timestamp_utc": "2026-04-12T16:12:09Z", "mode": "train", "global_step": 71, "epoch": 0.0037366454397136993, "loss": 0.0156, "grad_norm": 20.836307525634766, "learning_rate": 9.787878787878788e-06, "num_tokens": 135523.0, "completions/mean_length": 27.25, "completions/min_length": 19.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.25, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.3806454539299011, "rewards/meter/std": 0.4722149670124054, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9046452045440674, "rewards/lexical_plausibility/std": 0.2059667706489563, "rewards/judge_quality/mean": 0.476250022649765, "rewards/judge_quality/std": 0.38119879364967346, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1801045835018158, "rewards/total_composite/std": 0.303378701210022, "reward": 0.1801045835018158, "reward_std": 0.303378701210022, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20752005279064178, "sampling/sampling_logp_difference/max": 1.965214729309082, "sampling/importance_sampling_ratio/min": 0.1401257961988449, "sampling/importance_sampling_ratio/mean": 1.0337620973587036, "sampling/importance_sampling_ratio/max": 1.8718876838684082, "entropy": 2.0731808096170425, "clip_ratio/low_mean": 0.1582103967666626, "clip_ratio/low_min": 0.1582103967666626, "clip_ratio/high_mean": 0.0467391312122345, "clip_ratio/high_max": 0.0467391312122345, "clip_ratio/region_mean": 0.2049495279788971, "reward_total_mean": 0.1801045835018158, "reward_meter_mean": 0.3806454539299011, "reward_meter_std": 0.4722149670124054, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9046452045440674, "reward_lexical_plausibility_std": 0.2059667706489563, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.476250022649765, "reward_judge_quality_std": 0.38119879364967346, "reward_total_composite_mean": 0.1801045835018158, "reward_total_composite_std": 0.303378701210022} {"timestamp_utc": "2026-04-12T16:12:25Z", "mode": "train", "global_step": 72, "epoch": 0.0037892742487237513, "loss": 0.0315, "grad_norm": 20.252107620239258, "learning_rate": 9.784848484848486e-06, "num_tokens": 137084.0, "completions/mean_length": 43.125, "completions/min_length": 31.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.125, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.5920624732971191, "rewards/meter/std": 0.44187507033348083, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5924999713897705, "rewards/judge_quality/std": 0.25616681575775146, "rewards/repeat_penalty/mean": 0.9964206218719482, "rewards/repeat_penalty/std": 0.009782219305634499, "rewards/repeat_floor/mean": 0.9994630813598633, "rewards/repeat_floor/std": 0.0014673316618427634, "rewards/near_duplicate_penalty/mean": 0.9964206218719482, "rewards/near_duplicate_penalty/std": 0.009782219305634499, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4168849587440491, "rewards/total_composite/std": 0.3681540787220001, "reward": 0.4168849587440491, "reward_std": 0.3681540787220001, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2308512032032013, "sampling/sampling_logp_difference/max": 2.053664207458496, "sampling/importance_sampling_ratio/min": 0.12826405465602875, "sampling/importance_sampling_ratio/mean": 1.0262924432754517, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.046980783343315, "clip_ratio/low_mean": 0.09719309955835342, "clip_ratio/low_min": 0.09719309955835342, "clip_ratio/high_mean": 0.07912491727620363, "clip_ratio/high_max": 0.07912491727620363, "clip_ratio/region_mean": 0.17631801683455706, "reward_total_mean": 0.4168849587440491, "reward_meter_mean": 0.5920624732971191, "reward_meter_std": 0.44187507033348083, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9964206218719482, "reward_repeat_penalty_std": 0.009782219305634499, "reward_repeat_floor_mean": 0.9994630813598633, "reward_repeat_floor_std": 0.0014673316618427634, "reward_near_duplicate_penalty_mean": 0.9964206218719482, "reward_near_duplicate_penalty_std": 0.009782219305634499, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5924999713897705, "reward_judge_quality_std": 0.25616681575775146, "reward_total_composite_mean": 0.4168849587440491, "reward_total_composite_std": 0.3681540787220001} {"timestamp_utc": "2026-04-12T16:12:33Z", "mode": "train", "global_step": 73, "epoch": 0.0038419030577338037, "loss": 0.031, "grad_norm": 12.774842262268066, "learning_rate": 9.781818181818183e-06, "num_tokens": 138820.0, "completions/mean_length": 49.0, "completions/min_length": 36.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.0, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.5381691455841064, "rewards/meter/std": 0.34407538175582886, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9801508188247681, "rewards/lexical_plausibility/std": 0.04595785215497017, "rewards/judge_quality/mean": 0.6462500095367432, "rewards/judge_quality/std": 0.2263333648443222, "rewards/repeat_penalty/mean": 0.9840354919433594, "rewards/repeat_penalty/std": 0.029167495667934418, "rewards/repeat_floor/mean": 0.9976053237915039, "rewards/repeat_floor/std": 0.004375113174319267, "rewards/near_duplicate_penalty/mean": 0.9840354919433594, "rewards/near_duplicate_penalty/std": 0.029167495667934418, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.35036981105804443, "rewards/total_composite/std": 0.2823674976825714, "reward": 0.35036981105804443, "reward_std": 0.282367467880249, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1923993080854416, "sampling/sampling_logp_difference/max": 1.5187273025512695, "sampling/importance_sampling_ratio/min": 0.21899043023586273, "sampling/importance_sampling_ratio/mean": 1.018026351928711, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7377461791038513, "clip_ratio/low_mean": 0.13482744060456753, "clip_ratio/low_min": 0.13482744060456753, "clip_ratio/high_mean": 0.07108242809772491, "clip_ratio/high_max": 0.07108242809772491, "clip_ratio/region_mean": 0.20590986870229244, "reward_total_mean": 0.35036981105804443, "reward_meter_mean": 0.5381691455841064, "reward_meter_std": 0.34407538175582886, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9801508188247681, "reward_lexical_plausibility_std": 0.04595785215497017, "reward_repeat_penalty_mean": 0.9840354919433594, "reward_repeat_penalty_std": 0.029167495667934418, "reward_repeat_floor_mean": 0.9976053237915039, "reward_repeat_floor_std": 0.004375113174319267, "reward_near_duplicate_penalty_mean": 0.9840354919433594, "reward_near_duplicate_penalty_std": 0.029167495667934418, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6462500095367432, "reward_judge_quality_std": 0.2263333648443222, "reward_total_composite_mean": 0.35036981105804443, "reward_total_composite_std": 0.2823674976825714} {"timestamp_utc": "2026-04-12T16:12:43Z", "mode": "train", "global_step": 74, "epoch": 0.0038945318667438556, "loss": 0.1424, "grad_norm": 21.010709762573242, "learning_rate": 9.77878787878788e-06, "num_tokens": 140446.0, "completions/mean_length": 48.25, "completions/min_length": 32.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.25, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.8615536093711853, "rewards/meter/std": 0.25530722737312317, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8962432742118835, "rewards/lexical_plausibility/std": 0.15018872916698456, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9534638524055481, "rewards/repeat_penalty/std": 0.11381767690181732, "rewards/repeat_floor/mean": 0.9959642887115479, "rewards/repeat_floor/std": 0.008830887265503407, "rewards/near_duplicate_penalty/mean": 0.9920052289962769, "rewards/near_duplicate_penalty/std": 0.012510445900261402, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.30540943145751953, "rewards/total_composite/std": 0.1472395956516266, "reward": 0.30540943145751953, "reward_std": 0.1472395807504654, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24463339149951935, "sampling/sampling_logp_difference/max": 1.5558185577392578, "sampling/importance_sampling_ratio/min": 0.21101658046245575, "sampling/importance_sampling_ratio/mean": 1.0142935514450073, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.618894636631012, "clip_ratio/low_mean": 0.09531590715050697, "clip_ratio/low_min": 0.09531590715050697, "clip_ratio/high_mean": 0.15906223095953465, "clip_ratio/high_max": 0.15906223095953465, "clip_ratio/region_mean": 0.2543781381100416, "reward_total_mean": 0.30540943145751953, "reward_meter_mean": 0.8615536093711853, "reward_meter_std": 0.25530722737312317, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8962432742118835, "reward_lexical_plausibility_std": 0.15018872916698456, "reward_repeat_penalty_mean": 0.9534638524055481, "reward_repeat_penalty_std": 0.11381767690181732, "reward_repeat_floor_mean": 0.9959642887115479, "reward_repeat_floor_std": 0.008830887265503407, "reward_near_duplicate_penalty_mean": 0.9920052289962769, "reward_near_duplicate_penalty_std": 0.012510445900261402, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.30540943145751953, "reward_total_composite_std": 0.1472395956516266} {"timestamp_utc": "2026-04-12T16:12:52Z", "mode": "train", "global_step": 75, "epoch": 0.003947160675753908, "loss": -0.0507, "grad_norm": 12.79999828338623, "learning_rate": 9.775757575757576e-06, "num_tokens": 142160.0, "completions/mean_length": 57.25, "completions/min_length": 39.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.25, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.7840166091918945, "rewards/meter/std": 0.372598797082901, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9724822044372559, "rewards/lexical_plausibility/std": 0.0778321623802185, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.2522329092025757, "rewards/repeat_penalty/mean": 0.9930688738822937, "rewards/repeat_penalty/std": 0.012655957601964474, "rewards/repeat_floor/mean": 0.9989603161811829, "rewards/repeat_floor/std": 0.0018983840709552169, "rewards/near_duplicate_penalty/mean": 0.9930688738822937, "rewards/near_duplicate_penalty/std": 0.012655957601964474, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32773613929748535, "rewards/total_composite/std": 0.13446436822414398, "reward": 0.32773613929748535, "reward_std": 0.13446436822414398, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19810864329338074, "sampling/sampling_logp_difference/max": 1.2086148262023926, "sampling/importance_sampling_ratio/min": 0.2986105978488922, "sampling/importance_sampling_ratio/mean": 1.0505841970443726, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4203799813985825, "clip_ratio/low_mean": 0.037847790867090225, "clip_ratio/low_min": 0.037847790867090225, "clip_ratio/high_mean": 0.1543244794011116, "clip_ratio/high_max": 0.1543244794011116, "clip_ratio/region_mean": 0.19217227026820183, "reward_total_mean": 0.32773613929748535, "reward_meter_mean": 0.7840166091918945, "reward_meter_std": 0.372598797082901, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9724822044372559, "reward_lexical_plausibility_std": 0.0778321623802185, "reward_repeat_penalty_mean": 0.9930688738822937, "reward_repeat_penalty_std": 0.012655957601964474, "reward_repeat_floor_mean": 0.9989603161811829, "reward_repeat_floor_std": 0.0018983840709552169, "reward_near_duplicate_penalty_mean": 0.9930688738822937, "reward_near_duplicate_penalty_std": 0.012655957601964474, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.2522329092025757, "reward_total_composite_mean": 0.32773613929748535, "reward_total_composite_std": 0.13446436822414398} {"timestamp_utc": "2026-04-12T16:13:03Z", "mode": "train", "global_step": 76, "epoch": 0.00399978948476396, "loss": 0.0274, "grad_norm": 7.083038330078125, "learning_rate": 9.772727272727273e-06, "num_tokens": 145483.0, "completions/mean_length": 231.375, "completions/min_length": 161.0, "completions/max_length": 280.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 231.375, "completions/min_terminated_length": 161.0, "completions/max_terminated_length": 280.0, "rewards/meter/mean": 0.34000200033187866, "rewards/meter/std": 0.24787180125713348, "rewards/count_adherence/mean": 0.953125, "rewards/count_adherence/std": 0.06469365209341049, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9859374761581421, "rewards/count_floor/std": 0.019408106803894043, "rewards/lexical_plausibility/mean": 0.9986978769302368, "rewards/lexical_plausibility/std": 0.0036828548181802034, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9847592115402222, "rewards/repeat_penalty/std": 0.01706889271736145, "rewards/repeat_floor/mean": 0.9981634616851807, "rewards/repeat_floor/std": 0.0017077922821044922, "rewards/near_duplicate_penalty/mean": 0.9923731684684753, "rewards/near_duplicate_penalty/std": 0.0040103597566485405, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9923049211502075, "rewards/distinct_2/std": 0.015163577161729336, "rewards/total_composite/mean": 0.08127839863300323, "rewards/total_composite/std": 0.06733237206935883, "reward": 0.08127839863300323, "reward_std": 0.06733237206935883, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21238939464092255, "sampling/sampling_logp_difference/max": 1.9760198593139648, "sampling/importance_sampling_ratio/min": 0.13861986994743347, "sampling/importance_sampling_ratio/mean": 1.0330545902252197, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4870296269655228, "clip_ratio/low_mean": 0.13166139274835587, "clip_ratio/low_min": 0.13166139274835587, "clip_ratio/high_mean": 0.08023050799965858, "clip_ratio/high_max": 0.08023050799965858, "clip_ratio/region_mean": 0.21189190074801445, "reward_total_mean": 0.08127839863300323, "reward_meter_mean": 0.34000200033187866, "reward_meter_std": 0.24787180125713348, "reward_count_adherence_mean": 0.953125, "reward_count_adherence_std": 0.06469365209341049, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9859374761581421, "reward_count_floor_std": 0.019408106803894043, "reward_lexical_plausibility_mean": 0.9986978769302368, "reward_lexical_plausibility_std": 0.0036828548181802034, "reward_repeat_penalty_mean": 0.9847592115402222, "reward_repeat_penalty_std": 0.01706889271736145, "reward_repeat_floor_mean": 0.9981634616851807, "reward_repeat_floor_std": 0.0017077922821044922, "reward_near_duplicate_penalty_mean": 0.9923731684684753, "reward_near_duplicate_penalty_std": 0.0040103597566485405, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9923049211502075, "reward_distinct_2_std": 0.015163577161729336, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.08127839863300323, "reward_total_composite_std": 0.06733237206935883} {"timestamp_utc": "2026-04-12T16:13:12Z", "mode": "train", "global_step": 77, "epoch": 0.0040524182937740115, "loss": 0.1016, "grad_norm": 17.043352127075195, "learning_rate": 9.76969696969697e-06, "num_tokens": 147045.0, "completions/mean_length": 47.25, "completions/min_length": 34.0, "completions/max_length": 58.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.25, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.44776201248168945, "rewards/meter/std": 0.3801688253879547, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9914492964744568, "rewards/lexical_plausibility/std": 0.024185042828321457, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9849174618721008, "rewards/repeat_penalty/std": 0.03660213202238083, "rewards/repeat_floor/mean": 0.998343825340271, "rewards/repeat_floor/std": 0.0037844826001673937, "rewards/near_duplicate_penalty/mean": 0.9953689575195312, "rewards/near_duplicate_penalty/std": 0.0075595383532345295, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.16858382523059845, "rewards/total_composite/std": 0.1656939685344696, "reward": 0.16858382523059845, "reward_std": 0.1656939685344696, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.219539076089859, "sampling/sampling_logp_difference/max": 1.158310890197754, "sampling/importance_sampling_ratio/min": 0.3140161335468292, "sampling/importance_sampling_ratio/mean": 1.0317708253860474, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.245242640376091, "clip_ratio/low_mean": 0.1158177200704813, "clip_ratio/low_min": 0.1158177200704813, "clip_ratio/high_mean": 0.09649939276278019, "clip_ratio/high_max": 0.09649939276278019, "clip_ratio/region_mean": 0.2123171128332615, "reward_total_mean": 0.16858382523059845, "reward_meter_mean": 0.44776201248168945, "reward_meter_std": 0.3801688253879547, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9914492964744568, "reward_lexical_plausibility_std": 0.024185042828321457, "reward_repeat_penalty_mean": 0.9849174618721008, "reward_repeat_penalty_std": 0.03660213202238083, "reward_repeat_floor_mean": 0.998343825340271, "reward_repeat_floor_std": 0.0037844826001673937, "reward_near_duplicate_penalty_mean": 0.9953689575195312, "reward_near_duplicate_penalty_std": 0.0075595383532345295, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.16858382523059845, "reward_total_composite_std": 0.1656939685344696} {"timestamp_utc": "2026-04-12T16:13:20Z", "mode": "train", "global_step": 78, "epoch": 0.004105047102784064, "loss": 0.0846, "grad_norm": 15.409075736999512, "learning_rate": 9.766666666666667e-06, "num_tokens": 148889.0, "completions/mean_length": 51.5, "completions/min_length": 36.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.5, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.7258580923080444, "rewards/meter/std": 0.44764217734336853, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9095508456230164, "rewards/lexical_plausibility/std": 0.13177736103534698, "rewards/judge_quality/mean": 0.5137500166893005, "rewards/judge_quality/std": 0.3464488387107849, "rewards/repeat_penalty/mean": 0.9927314519882202, "rewards/repeat_penalty/std": 0.01101653277873993, "rewards/repeat_floor/mean": 0.9989097118377686, "rewards/repeat_floor/std": 0.0016524747479707003, "rewards/near_duplicate_penalty/mean": 0.9927314519882202, "rewards/near_duplicate_penalty/std": 0.01101653277873993, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.46346306800842285, "rewards/total_composite/std": 0.3897399604320526, "reward": 0.46346306800842285, "reward_std": 0.3897399306297302, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21735115349292755, "sampling/sampling_logp_difference/max": 1.364924430847168, "sampling/importance_sampling_ratio/min": 0.2553999722003937, "sampling/importance_sampling_ratio/mean": 1.0262371301651, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2506941705942154, "clip_ratio/low_mean": 0.14349130354821682, "clip_ratio/low_min": 0.14349130354821682, "clip_ratio/high_mean": 0.08258798345923424, "clip_ratio/high_max": 0.08258798345923424, "clip_ratio/region_mean": 0.22607928700745106, "reward_total_mean": 0.46346306800842285, "reward_meter_mean": 0.7258580923080444, "reward_meter_std": 0.44764217734336853, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9095508456230164, "reward_lexical_plausibility_std": 0.13177736103534698, "reward_repeat_penalty_mean": 0.9927314519882202, "reward_repeat_penalty_std": 0.01101653277873993, "reward_repeat_floor_mean": 0.9989097118377686, "reward_repeat_floor_std": 0.0016524747479707003, "reward_near_duplicate_penalty_mean": 0.9927314519882202, "reward_near_duplicate_penalty_std": 0.01101653277873993, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5137500166893005, "reward_judge_quality_std": 0.3464488387107849, "reward_total_composite_mean": 0.46346306800842285, "reward_total_composite_std": 0.3897399604320526} {"timestamp_utc": "2026-04-12T16:13:29Z", "mode": "train", "global_step": 79, "epoch": 0.004157675911794116, "loss": 0.1152, "grad_norm": 18.246423721313477, "learning_rate": 9.763636363636365e-06, "num_tokens": 150407.0, "completions/mean_length": 43.75, "completions/min_length": 36.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.75, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.5016579627990723, "rewards/meter/std": 0.39960169792175293, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9975490570068359, "rewards/lexical_plausibility/std": 0.006932419259101152, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9798001050949097, "rewards/repeat_penalty/std": 0.02479006163775921, "rewards/repeat_floor/mean": 0.9974507689476013, "rewards/repeat_floor/std": 0.002905119676142931, "rewards/near_duplicate_penalty/mean": 0.9878129363059998, "rewards/near_duplicate_penalty/std": 0.018003087490797043, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9919871687889099, "rewards/distinct_2/std": 0.02266368828713894, "rewards/total_composite/mean": 0.24432101845741272, "rewards/total_composite/std": 0.18906839191913605, "reward": 0.24432101845741272, "reward_std": 0.18906840682029724, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22122344374656677, "sampling/sampling_logp_difference/max": 1.349376916885376, "sampling/importance_sampling_ratio/min": 0.2594018280506134, "sampling/importance_sampling_ratio/mean": 1.0465655326843262, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.168430730700493, "clip_ratio/low_mean": 0.10910411970689893, "clip_ratio/low_min": 0.10910411970689893, "clip_ratio/high_mean": 0.11801265180110931, "clip_ratio/high_max": 0.11801265180110931, "clip_ratio/region_mean": 0.22711677150800824, "reward_total_mean": 0.24432101845741272, "reward_meter_mean": 0.5016579627990723, "reward_meter_std": 0.39960169792175293, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9975490570068359, "reward_lexical_plausibility_std": 0.006932419259101152, "reward_repeat_penalty_mean": 0.9798001050949097, "reward_repeat_penalty_std": 0.02479006163775921, "reward_repeat_floor_mean": 0.9974507689476013, "reward_repeat_floor_std": 0.002905119676142931, "reward_near_duplicate_penalty_mean": 0.9878129363059998, "reward_near_duplicate_penalty_std": 0.018003087490797043, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9919871687889099, "reward_distinct_2_std": 0.02266368828713894, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.24432101845741272, "reward_total_composite_std": 0.18906839191913605} {"timestamp_utc": "2026-04-12T16:13:38Z", "mode": "train", "global_step": 80, "epoch": 0.004210304720804168, "loss": 0.0199, "grad_norm": 10.943520545959473, "learning_rate": 9.760606060606062e-06, "num_tokens": 152386.0, "completions/mean_length": 85.375, "completions/min_length": 54.0, "completions/max_length": 111.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 85.375, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 111.0, "rewards/meter/mean": 0.7308220863342285, "rewards/meter/std": 0.29062309861183167, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9831444621086121, "rewards/repeat_penalty/std": 0.024900658056139946, "rewards/repeat_floor/mean": 0.9981099367141724, "rewards/repeat_floor/std": 0.0025812743697315454, "rewards/near_duplicate_penalty/mean": 0.993998110294342, "rewards/near_duplicate_penalty/std": 0.006261636968702078, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.989001989364624, "rewards/distinct_2/std": 0.02037539705634117, "rewards/total_composite/mean": 0.2483464777469635, "rewards/total_composite/std": 0.12048420310020447, "reward": 0.2483464777469635, "reward_std": 0.12048420310020447, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21638713777065277, "sampling/sampling_logp_difference/max": 1.9478286504745483, "sampling/importance_sampling_ratio/min": 0.14258332550525665, "sampling/importance_sampling_ratio/mean": 1.0444848537445068, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8526629209518433, "clip_ratio/low_mean": 0.10550958663225174, "clip_ratio/low_min": 0.10550958663225174, "clip_ratio/high_mean": 0.10242243856191635, "clip_ratio/high_max": 0.10242243856191635, "clip_ratio/region_mean": 0.2079320251941681, "reward_total_mean": 0.2483464777469635, "reward_meter_mean": 0.7308220863342285, "reward_meter_std": 0.29062309861183167, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9831444621086121, "reward_repeat_penalty_std": 0.024900658056139946, "reward_repeat_floor_mean": 0.9981099367141724, "reward_repeat_floor_std": 0.0025812743697315454, "reward_near_duplicate_penalty_mean": 0.993998110294342, "reward_near_duplicate_penalty_std": 0.006261636968702078, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.989001989364624, "reward_distinct_2_std": 0.02037539705634117, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.2483464777469635, "reward_total_composite_std": 0.12048420310020447} {"timestamp_utc": "2026-04-12T16:13:47Z", "mode": "train", "global_step": 81, "epoch": 0.00426293352981422, "loss": 0.126, "grad_norm": 14.844765663146973, "learning_rate": 9.757575757575758e-06, "num_tokens": 154020.0, "completions/mean_length": 49.25, "completions/min_length": 35.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.25, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.610368549823761, "rewards/meter/std": 0.32375213503837585, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9947047233581543, "rewards/repeat_penalty/std": 0.009650482796132565, "rewards/repeat_floor/mean": 0.9992057085037231, "rewards/repeat_floor/std": 0.001447572954930365, "rewards/near_duplicate_penalty/mean": 0.9947047233581543, "rewards/near_duplicate_penalty/std": 0.009650482796132565, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.25115853548049927, "rewards/total_composite/std": 0.14330866932868958, "reward": 0.25115853548049927, "reward_std": 0.14330866932868958, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21455712616443634, "sampling/sampling_logp_difference/max": 1.2710590362548828, "sampling/importance_sampling_ratio/min": 0.28053438663482666, "sampling/importance_sampling_ratio/mean": 1.0214149951934814, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4596636295318604, "clip_ratio/low_mean": 0.09379999339580536, "clip_ratio/low_min": 0.09379999339580536, "clip_ratio/high_mean": 0.11031364649534225, "clip_ratio/high_max": 0.11031364649534225, "clip_ratio/region_mean": 0.2041136398911476, "reward_total_mean": 0.25115853548049927, "reward_meter_mean": 0.610368549823761, "reward_meter_std": 0.32375213503837585, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9947047233581543, "reward_repeat_penalty_std": 0.009650482796132565, "reward_repeat_floor_mean": 0.9992057085037231, "reward_repeat_floor_std": 0.001447572954930365, "reward_near_duplicate_penalty_mean": 0.9947047233581543, "reward_near_duplicate_penalty_std": 0.009650482796132565, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.25115853548049927, "reward_total_composite_std": 0.14330866932868958} {"timestamp_utc": "2026-04-12T16:14:01Z", "mode": "train", "global_step": 82, "epoch": 0.004315562338824273, "loss": 0.1333, "grad_norm": 6.31158447265625, "learning_rate": 9.754545454545455e-06, "num_tokens": 157714.0, "completions/mean_length": 279.75, "completions/min_length": 215.0, "completions/max_length": 392.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 279.75, "completions/min_terminated_length": 215.0, "completions/max_terminated_length": 392.0, "rewards/meter/mean": 0.3813129663467407, "rewards/meter/std": 0.27879804372787476, "rewards/count_adherence/mean": 0.886363685131073, "rewards/count_adherence/std": 0.06428244709968567, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9659091234207153, "rewards/count_floor/std": 0.019284740090370178, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.29374998807907104, "rewards/judge_quality/std": 0.14500615000724792, "rewards/repeat_penalty/mean": 0.9832416772842407, "rewards/repeat_penalty/std": 0.012843562290072441, "rewards/repeat_floor/mean": 0.9980295300483704, "rewards/repeat_floor/std": 0.0013376965653151274, "rewards/near_duplicate_penalty/mean": 0.9924200773239136, "rewards/near_duplicate_penalty/std": 0.004430524539202452, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9907390475273132, "rewards/distinct_2/std": 0.010929741896688938, "rewards/total_composite/mean": 0.11373062431812286, "rewards/total_composite/std": 0.09236416220664978, "reward": 0.11373062431812286, "reward_std": 0.09236415475606918, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2386922985315323, "sampling/sampling_logp_difference/max": 2.0198888778686523, "sampling/importance_sampling_ratio/min": 0.13267020881175995, "sampling/importance_sampling_ratio/mean": 1.0501742362976074, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.024958550930023, "clip_ratio/low_mean": 0.12591862678527832, "clip_ratio/low_min": 0.12591862678527832, "clip_ratio/high_mean": 0.09771881811320782, "clip_ratio/high_max": 0.09771881811320782, "clip_ratio/region_mean": 0.22363744489848614, "reward_total_mean": 0.11373062431812286, "reward_meter_mean": 0.3813129663467407, "reward_meter_std": 0.27879804372787476, "reward_count_adherence_mean": 0.886363685131073, "reward_count_adherence_std": 0.06428244709968567, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9659091234207153, "reward_count_floor_std": 0.019284740090370178, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9832416772842407, "reward_repeat_penalty_std": 0.012843562290072441, "reward_repeat_floor_mean": 0.9980295300483704, "reward_repeat_floor_std": 0.0013376965653151274, "reward_near_duplicate_penalty_mean": 0.9924200773239136, "reward_near_duplicate_penalty_std": 0.004430524539202452, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9907390475273132, "reward_distinct_2_std": 0.010929741896688938, "reward_judge_quality_mean": 0.29374998807907104, "reward_judge_quality_std": 0.14500615000724792, "reward_total_composite_mean": 0.11373062431812286, "reward_total_composite_std": 0.09236416220664978} {"timestamp_utc": "2026-04-12T16:14:09Z", "mode": "train", "global_step": 83, "epoch": 0.004368191147834324, "loss": -0.0137, "grad_norm": 18.539670944213867, "learning_rate": 9.751515151515152e-06, "num_tokens": 159231.0, "completions/mean_length": 36.625, "completions/min_length": 28.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.625, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.6339971423149109, "rewards/meter/std": 0.38485148549079895, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6512500047683716, "rewards/judge_quality/std": 0.2503390908241272, "rewards/repeat_penalty/mean": 0.9952200651168823, "rewards/repeat_penalty/std": 0.010680274106562138, "rewards/repeat_floor/mean": 0.9992830157279968, "rewards/repeat_floor/std": 0.0016020411858335137, "rewards/near_duplicate_penalty/mean": 0.9952200651168823, "rewards/near_duplicate_penalty/std": 0.010680274106562138, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4572411775588989, "rewards/total_composite/std": 0.3553715944290161, "reward": 0.4572411775588989, "reward_std": 0.3553715646266937, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20119155943393707, "sampling/sampling_logp_difference/max": 1.817361831665039, "sampling/importance_sampling_ratio/min": 0.32714101672172546, "sampling/importance_sampling_ratio/mean": 1.04038667678833, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0735863745212555, "clip_ratio/low_mean": 0.062157207168638706, "clip_ratio/low_min": 0.062157207168638706, "clip_ratio/high_mean": 0.1074504666030407, "clip_ratio/high_max": 0.1074504666030407, "clip_ratio/region_mean": 0.1696076737716794, "reward_total_mean": 0.4572411775588989, "reward_meter_mean": 0.6339971423149109, "reward_meter_std": 0.38485148549079895, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9952200651168823, "reward_repeat_penalty_std": 0.010680274106562138, "reward_repeat_floor_mean": 0.9992830157279968, "reward_repeat_floor_std": 0.0016020411858335137, "reward_near_duplicate_penalty_mean": 0.9952200651168823, "reward_near_duplicate_penalty_std": 0.010680274106562138, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6512500047683716, "reward_judge_quality_std": 0.2503390908241272, "reward_total_composite_mean": 0.4572411775588989, "reward_total_composite_std": 0.3553715944290161} {"timestamp_utc": "2026-04-12T16:14:18Z", "mode": "train", "global_step": 84, "epoch": 0.004420819956844377, "loss": 0.1023, "grad_norm": 20.06077766418457, "learning_rate": 9.74848484848485e-06, "num_tokens": 161106.0, "completions/mean_length": 45.375, "completions/min_length": 37.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.375, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.6297622919082642, "rewards/meter/std": 0.38552671670913696, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9930555820465088, "rewards/lexical_plausibility/std": 0.01285861898213625, "rewards/judge_quality/mean": 0.492499977350235, "rewards/judge_quality/std": 0.2796298861503601, "rewards/repeat_penalty/mean": 0.9873254299163818, "rewards/repeat_penalty/std": 0.01144490484148264, "rewards/repeat_floor/mean": 0.9980988502502441, "rewards/repeat_floor/std": 0.0017167360056191683, "rewards/near_duplicate_penalty/mean": 0.9873254299163818, "rewards/near_duplicate_penalty/std": 0.01144490484148264, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.36389321088790894, "rewards/total_composite/std": 0.32425564527511597, "reward": 0.36389321088790894, "reward_std": 0.32425564527511597, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20729809999465942, "sampling/sampling_logp_difference/max": 1.8689308166503906, "sampling/importance_sampling_ratio/min": 0.15428853034973145, "sampling/importance_sampling_ratio/mean": 1.006610631942749, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.140326365828514, "clip_ratio/low_mean": 0.12810066901147366, "clip_ratio/low_min": 0.12810066901147366, "clip_ratio/high_mean": 0.07445101346820593, "clip_ratio/high_max": 0.07445101346820593, "clip_ratio/region_mean": 0.20255168247967958, "reward_total_mean": 0.36389321088790894, "reward_meter_mean": 0.6297622919082642, "reward_meter_std": 0.38552671670913696, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9930555820465088, "reward_lexical_plausibility_std": 0.01285861898213625, "reward_repeat_penalty_mean": 0.9873254299163818, "reward_repeat_penalty_std": 0.01144490484148264, "reward_repeat_floor_mean": 0.9980988502502441, "reward_repeat_floor_std": 0.0017167360056191683, "reward_near_duplicate_penalty_mean": 0.9873254299163818, "reward_near_duplicate_penalty_std": 0.01144490484148264, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.492499977350235, "reward_judge_quality_std": 0.2796298861503601, "reward_total_composite_mean": 0.36389321088790894, "reward_total_composite_std": 0.32425564527511597} {"timestamp_utc": "2026-04-12T16:14:29Z", "mode": "train", "global_step": 85, "epoch": 0.004473448765854429, "loss": -0.0317, "grad_norm": 19.909093856811523, "learning_rate": 9.745454545454547e-06, "num_tokens": 162453.0, "completions/mean_length": 24.375, "completions/min_length": 19.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.375, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.8942579030990601, "rewards/meter/std": 0.18176580965518951, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8967865109443665, "rewards/lexical_plausibility/std": 0.2128681242465973, "rewards/judge_quality/mean": 0.38374999165534973, "rewards/judge_quality/std": 0.24076886475086212, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.343386709690094, "rewards/total_composite/std": 0.2046266794204712, "reward": 0.343386709690094, "reward_std": 0.2046266794204712, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2179541289806366, "sampling/sampling_logp_difference/max": 2.4439144134521484, "sampling/importance_sampling_ratio/min": 0.0868203341960907, "sampling/importance_sampling_ratio/mean": 1.0402379035949707, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2473599910736084, "clip_ratio/low_mean": 0.16301407292485237, "clip_ratio/low_min": 0.16301407292485237, "clip_ratio/high_mean": 0.046408251859247684, "clip_ratio/high_max": 0.046408251859247684, "clip_ratio/region_mean": 0.20942232478410006, "reward_total_mean": 0.343386709690094, "reward_meter_mean": 0.8942579030990601, "reward_meter_std": 0.18176580965518951, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8967865109443665, "reward_lexical_plausibility_std": 0.2128681242465973, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38374999165534973, "reward_judge_quality_std": 0.24076886475086212, "reward_total_composite_mean": 0.343386709690094, "reward_total_composite_std": 0.2046266794204712} {"timestamp_utc": "2026-04-12T16:14:36Z", "mode": "train", "global_step": 86, "epoch": 0.0045260775748644805, "loss": 0.0513, "grad_norm": 24.302440643310547, "learning_rate": 9.742424242424244e-06, "num_tokens": 164038.0, "completions/mean_length": 34.125, "completions/min_length": 29.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.125, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.596794843673706, "rewards/meter/std": 0.4008859395980835, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.2512255907058716, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 1.0, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.37639322876930237, "rewards/total_composite/std": 0.2644297480583191, "reward": 0.37639322876930237, "reward_std": 0.2644297480583191, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24157695472240448, "sampling/sampling_logp_difference/max": 2.1380763053894043, "sampling/importance_sampling_ratio/min": 0.1178813949227333, "sampling/importance_sampling_ratio/mean": 0.9839524626731873, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9065810143947601, "clip_ratio/low_mean": 0.070782121270895, "clip_ratio/low_min": 0.070782121270895, "clip_ratio/high_mean": 0.10850926674902439, "clip_ratio/high_max": 0.10850926674902439, "clip_ratio/region_mean": 0.1792913880199194, "reward_total_mean": 0.37639322876930237, "reward_meter_mean": 0.596794843673706, "reward_meter_std": 0.4008859395980835, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 1.0, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.2512255907058716, "reward_total_composite_mean": 0.37639322876930237, "reward_total_composite_std": 0.2644297480583191} {"timestamp_utc": "2026-04-12T16:14:45Z", "mode": "train", "global_step": 87, "epoch": 0.004578706383874533, "loss": 0.1047, "grad_norm": 17.62166404724121, "learning_rate": 9.739393939393941e-06, "num_tokens": 165884.0, "completions/mean_length": 58.75, "completions/min_length": 46.0, "completions/max_length": 81.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.75, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.42708075046539307, "rewards/meter/std": 0.293794184923172, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9741393327713013, "rewards/lexical_plausibility/std": 0.05264858156442642, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9964795112609863, "rewards/repeat_penalty/std": 0.005044713616371155, "rewards/repeat_floor/mean": 0.99947190284729, "rewards/repeat_floor/std": 0.0007567146676592529, "rewards/near_duplicate_penalty/mean": 0.9964795112609863, "rewards/near_duplicate_penalty/std": 0.005044713616371155, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18397322297096252, "rewards/total_composite/std": 0.13547933101654053, "reward": 0.18397322297096252, "reward_std": 0.13547933101654053, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2125231772661209, "sampling/sampling_logp_difference/max": 2.169562816619873, "sampling/importance_sampling_ratio/min": 0.1142275482416153, "sampling/importance_sampling_ratio/mean": 1.0063490867614746, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.717762142419815, "clip_ratio/low_mean": 0.11891158856451511, "clip_ratio/low_min": 0.11891158856451511, "clip_ratio/high_mean": 0.052052177488803864, "clip_ratio/high_max": 0.052052177488803864, "clip_ratio/region_mean": 0.17096376605331898, "reward_total_mean": 0.18397322297096252, "reward_meter_mean": 0.42708075046539307, "reward_meter_std": 0.293794184923172, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9741393327713013, "reward_lexical_plausibility_std": 0.05264858156442642, "reward_repeat_penalty_mean": 0.9964795112609863, "reward_repeat_penalty_std": 0.005044713616371155, "reward_repeat_floor_mean": 0.99947190284729, "reward_repeat_floor_std": 0.0007567146676592529, "reward_near_duplicate_penalty_mean": 0.9964795112609863, "reward_near_duplicate_penalty_std": 0.005044713616371155, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.18397322297096252, "reward_total_composite_std": 0.13547933101654053} {"timestamp_utc": "2026-04-12T16:14:58Z", "mode": "train", "global_step": 88, "epoch": 0.004631335192884585, "loss": 0.0324, "grad_norm": 6.4770917892456055, "learning_rate": 9.736363636363637e-06, "num_tokens": 169572.0, "completions/mean_length": 235.0, "completions/min_length": 162.0, "completions/max_length": 361.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 235.0, "completions/min_terminated_length": 162.0, "completions/max_terminated_length": 361.0, "rewards/meter/mean": 0.9215198755264282, "rewards/meter/std": 0.09319359064102173, "rewards/count_adherence/mean": 0.953125, "rewards/count_adherence/std": 0.06469365209341049, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9859374761581421, "rewards/count_floor/std": 0.019408106803894043, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9822944402694702, "rewards/repeat_penalty/std": 0.016634171828627586, "rewards/repeat_floor/mean": 0.9981192946434021, "rewards/repeat_floor/std": 0.0015382225392386317, "rewards/near_duplicate_penalty/mean": 0.995309591293335, "rewards/near_duplicate_penalty/std": 0.002218200359493494, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9869205951690674, "rewards/distinct_2/std": 0.016350824385881424, "rewards/total_composite/mean": 0.2676911950111389, "rewards/total_composite/std": 0.07761240750551224, "reward": 0.2676911950111389, "reward_std": 0.07761240750551224, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20899732410907745, "sampling/sampling_logp_difference/max": 1.692124366760254, "sampling/importance_sampling_ratio/min": 0.18412795662879944, "sampling/importance_sampling_ratio/mean": 1.0465455055236816, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8870257139205933, "clip_ratio/low_mean": 0.0739701446145773, "clip_ratio/low_min": 0.0739701446145773, "clip_ratio/high_mean": 0.13612034544348717, "clip_ratio/high_max": 0.13612034544348717, "clip_ratio/region_mean": 0.21009049005806446, "reward_total_mean": 0.2676911950111389, "reward_meter_mean": 0.9215198755264282, "reward_meter_std": 0.09319359064102173, "reward_count_adherence_mean": 0.953125, "reward_count_adherence_std": 0.06469365209341049, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9859374761581421, "reward_count_floor_std": 0.019408106803894043, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9822944402694702, "reward_repeat_penalty_std": 0.016634171828627586, "reward_repeat_floor_mean": 0.9981192946434021, "reward_repeat_floor_std": 0.0015382225392386317, "reward_near_duplicate_penalty_mean": 0.995309591293335, "reward_near_duplicate_penalty_std": 0.002218200359493494, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9869205951690674, "reward_distinct_2_std": 0.016350824385881424, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.2676911950111389, "reward_total_composite_std": 0.07761240750551224} {"timestamp_utc": "2026-04-12T16:15:06Z", "mode": "train", "global_step": 89, "epoch": 0.004683964001894637, "loss": -0.0413, "grad_norm": 15.227660179138184, "learning_rate": 9.733333333333334e-06, "num_tokens": 171157.0, "completions/mean_length": 46.125, "completions/min_length": 39.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.125, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.8218026757240295, "rewards/meter/std": 0.30785462260246277, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9754703640937805, "rewards/lexical_plausibility/std": 0.06938032805919647, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.28630343079566956, "rewards/repeat_penalty/mean": 0.9967880845069885, "rewards/repeat_penalty/std": 0.006415999960154295, "rewards/repeat_floor/mean": 0.9995182156562805, "rewards/repeat_floor/std": 0.0009623938240110874, "rewards/near_duplicate_penalty/mean": 0.9967880845069885, "rewards/near_duplicate_penalty/std": 0.006415999960154295, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.44428551197052, "rewards/total_composite/std": 0.32935091853141785, "reward": 0.44428551197052, "reward_std": 0.32935088872909546, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2216944545507431, "sampling/sampling_logp_difference/max": 1.4072818756103516, "sampling/importance_sampling_ratio/min": 0.24480780959129333, "sampling/importance_sampling_ratio/mean": 1.0472164154052734, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6710088551044464, "clip_ratio/low_mean": 0.14506504870951176, "clip_ratio/low_min": 0.14506504870951176, "clip_ratio/high_mean": 0.05743970721960068, "clip_ratio/high_max": 0.05743970721960068, "clip_ratio/region_mean": 0.20250475592911243, "reward_total_mean": 0.44428551197052, "reward_meter_mean": 0.8218026757240295, "reward_meter_std": 0.30785462260246277, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9754703640937805, "reward_lexical_plausibility_std": 0.06938032805919647, "reward_repeat_penalty_mean": 0.9967880845069885, "reward_repeat_penalty_std": 0.006415999960154295, "reward_repeat_floor_mean": 0.9995182156562805, "reward_repeat_floor_std": 0.0009623938240110874, "reward_near_duplicate_penalty_mean": 0.9967880845069885, "reward_near_duplicate_penalty_std": 0.006415999960154295, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.28630343079566956, "reward_total_composite_mean": 0.44428551197052, "reward_total_composite_std": 0.32935091853141785} {"timestamp_utc": "2026-04-12T16:15:14Z", "mode": "train", "global_step": 90, "epoch": 0.004736592810904689, "loss": 0.1647, "grad_norm": 21.623760223388672, "learning_rate": 9.730303030303031e-06, "num_tokens": 172686.0, "completions/mean_length": 41.125, "completions/min_length": 30.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.125, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.32222986221313477, "rewards/meter/std": 0.24403588473796844, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9518775939941406, "rewards/lexical_plausibility/std": 0.10010452568531036, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.3620477616786957, "rewards/repeat_penalty/mean": 0.9765366315841675, "rewards/repeat_penalty/std": 0.03547777608036995, "rewards/repeat_floor/mean": 0.9969081878662109, "rewards/repeat_floor/std": 0.004214660730212927, "rewards/near_duplicate_penalty/mean": 0.9841955900192261, "rewards/near_duplicate_penalty/std": 0.017114752903580666, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9919871687889099, "rewards/distinct_2/std": 0.02266368828713894, "rewards/total_composite/mean": 0.23835045099258423, "rewards/total_composite/std": 0.25593531131744385, "reward": 0.23835045099258423, "reward_std": 0.25593531131744385, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2359987199306488, "sampling/sampling_logp_difference/max": 1.8980355262756348, "sampling/importance_sampling_ratio/min": 0.14986273646354675, "sampling/importance_sampling_ratio/mean": 0.9931842684745789, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0835602059960365, "clip_ratio/low_mean": 0.13202047906816006, "clip_ratio/low_min": 0.13202047906816006, "clip_ratio/high_mean": 0.0401960788294673, "clip_ratio/high_max": 0.0401960788294673, "clip_ratio/region_mean": 0.17221655789762735, "reward_total_mean": 0.23835045099258423, "reward_meter_mean": 0.32222986221313477, "reward_meter_std": 0.24403588473796844, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9518775939941406, "reward_lexical_plausibility_std": 0.10010452568531036, "reward_repeat_penalty_mean": 0.9765366315841675, "reward_repeat_penalty_std": 0.03547777608036995, "reward_repeat_floor_mean": 0.9969081878662109, "reward_repeat_floor_std": 0.004214660730212927, "reward_near_duplicate_penalty_mean": 0.9841955900192261, "reward_near_duplicate_penalty_std": 0.017114752903580666, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9919871687889099, "reward_distinct_2_std": 0.02266368828713894, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.3620477616786957, "reward_total_composite_mean": 0.23835045099258423, "reward_total_composite_std": 0.25593531131744385} {"timestamp_utc": "2026-04-12T16:15:26Z", "mode": "train", "global_step": 91, "epoch": 0.004789221619914742, "loss": 0.0241, "grad_norm": 6.1096696853637695, "learning_rate": 9.727272727272728e-06, "num_tokens": 175756.0, "completions/mean_length": 174.75, "completions/min_length": 159.0, "completions/max_length": 188.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 174.75, "completions/min_terminated_length": 159.0, "completions/max_terminated_length": 188.0, "rewards/meter/mean": 0.878669023513794, "rewards/meter/std": 0.24484211206436157, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9925000071525574, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.9234609603881836, "rewards/lexical_plausibility/std": 0.1143912598490715, "rewards/judge_quality/mean": 0.38374999165534973, "rewards/judge_quality/std": 0.24076886475086212, "rewards/repeat_penalty/mean": 0.9974187016487122, "rewards/repeat_penalty/std": 0.0032706044148653746, "rewards/repeat_floor/mean": 0.9996128082275391, "rewards/repeat_floor/std": 0.0004905856912955642, "rewards/near_duplicate_penalty/mean": 0.9974187016487122, "rewards/near_duplicate_penalty/std": 0.0032706044148653746, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33547407388687134, "rewards/total_composite/std": 0.24134448170661926, "reward": 0.33547407388687134, "reward_std": 0.24134448170661926, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19223442673683167, "sampling/sampling_logp_difference/max": 1.791189193725586, "sampling/importance_sampling_ratio/min": 0.16676174104213715, "sampling/importance_sampling_ratio/mean": 1.023423194885254, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.378643646836281, "clip_ratio/low_mean": 0.08139126002788544, "clip_ratio/low_min": 0.08139126002788544, "clip_ratio/high_mean": 0.09280398488044739, "clip_ratio/high_max": 0.09280398488044739, "clip_ratio/region_mean": 0.17419524490833282, "reward_total_mean": 0.33547407388687134, "reward_meter_mean": 0.878669023513794, "reward_meter_std": 0.24484211206436157, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9925000071525574, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.9234609603881836, "reward_lexical_plausibility_std": 0.1143912598490715, "reward_repeat_penalty_mean": 0.9974187016487122, "reward_repeat_penalty_std": 0.0032706044148653746, "reward_repeat_floor_mean": 0.9996128082275391, "reward_repeat_floor_std": 0.0004905856912955642, "reward_near_duplicate_penalty_mean": 0.9974187016487122, "reward_near_duplicate_penalty_std": 0.0032706044148653746, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38374999165534973, "reward_judge_quality_std": 0.24076886475086212, "reward_total_composite_mean": 0.33547407388687134, "reward_total_composite_std": 0.24134448170661926} {"timestamp_utc": "2026-04-12T16:15:39Z", "mode": "train", "global_step": 92, "epoch": 0.004841850428924793, "loss": 0.1676, "grad_norm": 5.645833969116211, "learning_rate": 9.724242424242426e-06, "num_tokens": 179653.0, "completions/mean_length": 269.125, "completions/min_length": 180.0, "completions/max_length": 370.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 269.125, "completions/min_terminated_length": 180.0, "completions/max_terminated_length": 370.0, "rewards/meter/mean": 0.2120237946510315, "rewards/meter/std": 0.1717546433210373, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.05345224589109421, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9700000286102295, "rewards/count_floor/std": 0.01603567600250244, "rewards/lexical_plausibility/mean": 0.9818199872970581, "rewards/lexical_plausibility/std": 0.03753276914358139, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.988950252532959, "rewards/repeat_penalty/std": 0.009890228509902954, "rewards/repeat_floor/mean": 0.9986698627471924, "rewards/repeat_floor/std": 0.001043530646711588, "rewards/near_duplicate_penalty/mean": 0.9944734573364258, "rewards/near_duplicate_penalty/std": 0.0028089345432817936, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9944319725036621, "rewards/distinct_2/std": 0.0076876552775502205, "rewards/total_composite/mean": 0.05339657515287399, "rewards/total_composite/std": 0.05815418064594269, "reward": 0.05339657515287399, "reward_std": 0.05815417692065239, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2234933078289032, "sampling/sampling_logp_difference/max": 2.155268669128418, "sampling/importance_sampling_ratio/min": 0.11587205529212952, "sampling/importance_sampling_ratio/mean": 1.033098816871643, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.0099581480026245, "clip_ratio/low_mean": 0.13186335749924183, "clip_ratio/low_min": 0.13186335749924183, "clip_ratio/high_mean": 0.048218170180916786, "clip_ratio/high_max": 0.048218170180916786, "clip_ratio/region_mean": 0.18008152768015862, "reward_total_mean": 0.05339657515287399, "reward_meter_mean": 0.2120237946510315, "reward_meter_std": 0.1717546433210373, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.05345224589109421, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9700000286102295, "reward_count_floor_std": 0.01603567600250244, "reward_lexical_plausibility_mean": 0.9818199872970581, "reward_lexical_plausibility_std": 0.03753276914358139, "reward_repeat_penalty_mean": 0.988950252532959, "reward_repeat_penalty_std": 0.009890228509902954, "reward_repeat_floor_mean": 0.9986698627471924, "reward_repeat_floor_std": 0.001043530646711588, "reward_near_duplicate_penalty_mean": 0.9944734573364258, "reward_near_duplicate_penalty_std": 0.0028089345432817936, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9944319725036621, "reward_distinct_2_std": 0.0076876552775502205, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.05339657515287399, "reward_total_composite_std": 0.05815418064594269} {"timestamp_utc": "2026-04-12T16:15:48Z", "mode": "train", "global_step": 93, "epoch": 0.004894479237934846, "loss": 0.0822, "grad_norm": 20.925451278686523, "learning_rate": 9.721212121212123e-06, "num_tokens": 181102.0, "completions/mean_length": 24.125, "completions/min_length": 18.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.125, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.7652628421783447, "rewards/meter/std": 0.4062955975532532, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8676470518112183, "rewards/lexical_plausibility/std": 0.17168965935707092, "rewards/judge_quality/mean": 0.5850000381469727, "rewards/judge_quality/std": 0.3660210967063904, "rewards/repeat_penalty/mean": 0.7455357313156128, "rewards/repeat_penalty/std": 0.012626901268959045, "rewards/repeat_floor/mean": 0.9841071367263794, "rewards/repeat_floor/std": 0.002525375923141837, "rewards/near_duplicate_penalty/mean": 0.9940476417541504, "rewards/near_duplicate_penalty/std": 0.016835875809192657, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5161031484603882, "rewards/total_composite/std": 0.4155314564704895, "reward": 0.5161031484603882, "reward_std": 0.4155314266681671, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23831449449062347, "sampling/sampling_logp_difference/max": 1.624668836593628, "sampling/importance_sampling_ratio/min": 0.196976900100708, "sampling/importance_sampling_ratio/mean": 1.0388902425765991, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.498924896121025, "clip_ratio/low_mean": 0.0980448741465807, "clip_ratio/low_min": 0.0980448741465807, "clip_ratio/high_mean": 0.1560349315404892, "clip_ratio/high_max": 0.1560349315404892, "clip_ratio/region_mean": 0.2540798056870699, "reward_total_mean": 0.5161031484603882, "reward_meter_mean": 0.7652628421783447, "reward_meter_std": 0.4062955975532532, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8676470518112183, "reward_lexical_plausibility_std": 0.17168965935707092, "reward_repeat_penalty_mean": 0.7455357313156128, "reward_repeat_penalty_std": 0.012626901268959045, "reward_repeat_floor_mean": 0.9841071367263794, "reward_repeat_floor_std": 0.002525375923141837, "reward_near_duplicate_penalty_mean": 0.9940476417541504, "reward_near_duplicate_penalty_std": 0.016835875809192657, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5850000381469727, "reward_judge_quality_std": 0.3660210967063904, "reward_total_composite_mean": 0.5161031484603882, "reward_total_composite_std": 0.4155314564704895} {"timestamp_utc": "2026-04-12T16:15:57Z", "mode": "train", "global_step": 94, "epoch": 0.004947108046944898, "loss": 0.0026, "grad_norm": 16.18235969543457, "learning_rate": 9.718181818181818e-06, "num_tokens": 182594.0, "completions/mean_length": 42.5, "completions/min_length": 34.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.5, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.4126415252685547, "rewards/meter/std": 0.463853657245636, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.9979338645935059, "rewards/repeat_penalty/std": 0.005309219006448984, "rewards/repeat_floor/mean": 0.9996901154518127, "rewards/repeat_floor/std": 0.0007963832467794418, "rewards/near_duplicate_penalty/mean": 0.9979338645935059, "rewards/near_duplicate_penalty/std": 0.005309219006448984, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.144917830824852, "rewards/total_composite/std": 0.18419717252254486, "reward": 0.144917830824852, "reward_std": 0.18419715762138367, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22092963755130768, "sampling/sampling_logp_difference/max": 1.6048192977905273, "sampling/importance_sampling_ratio/min": 0.20092585682868958, "sampling/importance_sampling_ratio/mean": 1.0474412441253662, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.75510573387146, "clip_ratio/low_mean": 0.0901009663939476, "clip_ratio/low_min": 0.0901009663939476, "clip_ratio/high_mean": 0.07163957506418228, "clip_ratio/high_max": 0.07163957506418228, "clip_ratio/region_mean": 0.16174054145812988, "reward_total_mean": 0.144917830824852, "reward_meter_mean": 0.4126415252685547, "reward_meter_std": 0.463853657245636, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9979338645935059, "reward_repeat_penalty_std": 0.005309219006448984, "reward_repeat_floor_mean": 0.9996901154518127, "reward_repeat_floor_std": 0.0007963832467794418, "reward_near_duplicate_penalty_mean": 0.9979338645935059, "reward_near_duplicate_penalty_std": 0.005309219006448984, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.144917830824852, "reward_total_composite_std": 0.18419717252254486} {"timestamp_utc": "2026-04-12T16:16:05Z", "mode": "train", "global_step": 95, "epoch": 0.0049997368559549496, "loss": 0.1012, "grad_norm": 16.56658935546875, "learning_rate": 9.715151515151516e-06, "num_tokens": 184188.0, "completions/mean_length": 42.25, "completions/min_length": 34.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.25, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.7237671613693237, "rewards/meter/std": 0.43647003173828125, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9895833730697632, "rewards/lexical_plausibility/std": 0.014376373030245304, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.21836650371551514, "rewards/repeat_penalty/mean": 0.9969465136528015, "rewards/repeat_penalty/std": 0.00863658543676138, "rewards/repeat_floor/mean": 0.9995419979095459, "rewards/repeat_floor/std": 0.0012954887934029102, "rewards/near_duplicate_penalty/mean": 0.9969465136528015, "rewards/near_duplicate_penalty/std": 0.00863658543676138, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.36743414402008057, "rewards/total_composite/std": 0.3021846413612366, "reward": 0.36743414402008057, "reward_std": 0.3021846115589142, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20720338821411133, "sampling/sampling_logp_difference/max": 1.6059870719909668, "sampling/importance_sampling_ratio/min": 0.2006913721561432, "sampling/importance_sampling_ratio/mean": 1.0434907674789429, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.336642026901245, "clip_ratio/low_mean": 0.06482128519564867, "clip_ratio/low_min": 0.06482128519564867, "clip_ratio/high_mean": 0.12250485830008984, "clip_ratio/high_max": 0.12250485830008984, "clip_ratio/region_mean": 0.1873261434957385, "reward_total_mean": 0.36743414402008057, "reward_meter_mean": 0.7237671613693237, "reward_meter_std": 0.43647003173828125, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9895833730697632, "reward_lexical_plausibility_std": 0.014376373030245304, "reward_repeat_penalty_mean": 0.9969465136528015, "reward_repeat_penalty_std": 0.00863658543676138, "reward_repeat_floor_mean": 0.9995419979095459, "reward_repeat_floor_std": 0.0012954887934029102, "reward_near_duplicate_penalty_mean": 0.9969465136528015, "reward_near_duplicate_penalty_std": 0.00863658543676138, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.21836650371551514, "reward_total_composite_mean": 0.36743414402008057, "reward_total_composite_std": 0.3021846413612366} {"timestamp_utc": "2026-04-12T16:16:15Z", "mode": "train", "global_step": 96, "epoch": 0.005052365664965002, "loss": 0.0625, "grad_norm": 12.924627304077148, "learning_rate": 9.712121212121213e-06, "num_tokens": 185838.0, "completions/mean_length": 45.25, "completions/min_length": 30.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.25, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.9345506429672241, "rewards/meter/std": 0.05481686070561409, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9885380268096924, "rewards/lexical_plausibility/std": 0.032419249415397644, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9998278617858887, "rewards/repeat_penalty/std": 0.0004869857511948794, "rewards/repeat_floor/mean": 0.9999741911888123, "rewards/repeat_floor/std": 7.304049358936027e-05, "rewards/near_duplicate_penalty/mean": 0.9998278617858887, "rewards/near_duplicate_penalty/std": 0.0004869857511948794, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.38547563552856445, "rewards/total_composite/std": 0.05341857299208641, "reward": 0.38547563552856445, "reward_std": 0.05341857671737671, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2202989012002945, "sampling/sampling_logp_difference/max": 1.2113046646118164, "sampling/importance_sampling_ratio/min": 0.2978084683418274, "sampling/importance_sampling_ratio/mean": 1.045016884803772, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.342909559607506, "clip_ratio/low_mean": 0.08094632439315319, "clip_ratio/low_min": 0.08094632439315319, "clip_ratio/high_mean": 0.11059252172708511, "clip_ratio/high_max": 0.11059252172708511, "clip_ratio/region_mean": 0.1915388461202383, "reward_total_mean": 0.38547563552856445, "reward_meter_mean": 0.9345506429672241, "reward_meter_std": 0.05481686070561409, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9885380268096924, "reward_lexical_plausibility_std": 0.032419249415397644, "reward_repeat_penalty_mean": 0.9998278617858887, "reward_repeat_penalty_std": 0.0004869857511948794, "reward_repeat_floor_mean": 0.9999741911888123, "reward_repeat_floor_std": 7.304049358936027e-05, "reward_near_duplicate_penalty_mean": 0.9998278617858887, "reward_near_duplicate_penalty_std": 0.0004869857511948794, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.38547563552856445, "reward_total_composite_std": 0.05341857299208641} {"timestamp_utc": "2026-04-12T16:16:25Z", "mode": "train", "global_step": 97, "epoch": 0.005104994473975054, "loss": 0.2, "grad_norm": 14.041024208068848, "learning_rate": 9.70909090909091e-06, "num_tokens": 187970.0, "completions/mean_length": 91.5, "completions/min_length": 14.0, "completions/max_length": 134.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 91.5, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 134.0, "rewards/meter/mean": 0.5290300846099854, "rewards/meter/std": 0.30417460203170776, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.08017838001251221, "rewards/lexical_plausibility/mean": 0.9743640422821045, "rewards/lexical_plausibility/std": 0.07250935584306717, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9626697301864624, "rewards/repeat_penalty/std": 0.0860561728477478, "rewards/repeat_floor/mean": 0.9972129464149475, "rewards/repeat_floor/std": 0.00498339906334877, "rewards/near_duplicate_penalty/mean": 0.9939197301864624, "rewards/near_duplicate_penalty/std": 0.005241386592388153, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20124690234661102, "rewards/total_composite/std": 0.11275546252727509, "reward": 0.20124690234661102, "reward_std": 0.11275545507669449, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2275000810623169, "sampling/sampling_logp_difference/max": 1.7260465621948242, "sampling/importance_sampling_ratio/min": 0.17798668146133423, "sampling/importance_sampling_ratio/mean": 1.0286104679107666, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.283098965883255, "clip_ratio/low_mean": 0.11474193446338177, "clip_ratio/low_min": 0.11474193446338177, "clip_ratio/high_mean": 0.06822820007801056, "clip_ratio/high_max": 0.06822820007801056, "clip_ratio/region_mean": 0.18297013454139233, "reward_total_mean": 0.20124690234661102, "reward_meter_mean": 0.5290300846099854, "reward_meter_std": 0.30417460203170776, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.08017838001251221, "reward_lexical_plausibility_mean": 0.9743640422821045, "reward_lexical_plausibility_std": 0.07250935584306717, "reward_repeat_penalty_mean": 0.9626697301864624, "reward_repeat_penalty_std": 0.0860561728477478, "reward_repeat_floor_mean": 0.9972129464149475, "reward_repeat_floor_std": 0.00498339906334877, "reward_near_duplicate_penalty_mean": 0.9939197301864624, "reward_near_duplicate_penalty_std": 0.005241386592388153, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.20124690234661102, "reward_total_composite_std": 0.11275546252727509} {"timestamp_utc": "2026-04-12T16:16:35Z", "mode": "train", "global_step": 98, "epoch": 0.005157623282985106, "loss": -0.0143, "grad_norm": 19.608434677124023, "learning_rate": 9.706060606060606e-06, "num_tokens": 189687.0, "completions/mean_length": 38.625, "completions/min_length": 28.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.625, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.18261590600013733, "rewards/meter/std": 0.28733447194099426, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9499838352203369, "rewards/lexical_plausibility/std": 0.10509025305509567, "rewards/judge_quality/mean": 0.4925000071525574, "rewards/judge_quality/std": 0.2945577800273895, "rewards/repeat_penalty/mean": 0.9624144434928894, "rewards/repeat_penalty/std": 0.04290363937616348, "rewards/repeat_floor/mean": 0.9951818585395813, "rewards/repeat_floor/std": 0.005092092324048281, "rewards/near_duplicate_penalty/mean": 0.9761209487915039, "rewards/near_duplicate_penalty/std": 0.03190719336271286, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9862637519836426, "rewards/distinct_2/std": 0.0388520210981369, "rewards/total_composite/mean": 0.04863385111093521, "rewards/total_composite/std": 0.04955475777387619, "reward": 0.04863385111093521, "reward_std": 0.04955475777387619, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22066283226013184, "sampling/sampling_logp_difference/max": 1.746760368347168, "sampling/importance_sampling_ratio/min": 0.17433781921863556, "sampling/importance_sampling_ratio/mean": 1.032572627067566, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3004300892353058, "clip_ratio/low_mean": 0.14087301678955555, "clip_ratio/low_min": 0.14087301678955555, "clip_ratio/high_mean": 0.10493478737771511, "clip_ratio/high_max": 0.10493478737771511, "clip_ratio/region_mean": 0.24580780416727066, "reward_total_mean": 0.04863385111093521, "reward_meter_mean": 0.18261590600013733, "reward_meter_std": 0.28733447194099426, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9499838352203369, "reward_lexical_plausibility_std": 0.10509025305509567, "reward_repeat_penalty_mean": 0.9624144434928894, "reward_repeat_penalty_std": 0.04290363937616348, "reward_repeat_floor_mean": 0.9951818585395813, "reward_repeat_floor_std": 0.005092092324048281, "reward_near_duplicate_penalty_mean": 0.9761209487915039, "reward_near_duplicate_penalty_std": 0.03190719336271286, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9862637519836426, "reward_distinct_2_std": 0.0388520210981369, "reward_judge_quality_mean": 0.4925000071525574, "reward_judge_quality_std": 0.2945577800273895, "reward_total_composite_mean": 0.04863385111093521, "reward_total_composite_std": 0.04955475777387619} {"timestamp_utc": "2026-04-12T16:16:45Z", "mode": "train", "global_step": 99, "epoch": 0.005210252091995158, "loss": -0.0025, "grad_norm": 10.482253074645996, "learning_rate": 9.703030303030305e-06, "num_tokens": 191617.0, "completions/mean_length": 83.25, "completions/min_length": 18.0, "completions/max_length": 131.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 83.25, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 131.0, "rewards/meter/mean": 0.5146980285644531, "rewards/meter/std": 0.41274702548980713, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.35197150707244873, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.953125, "rewards/count_floor/std": 0.10559145361185074, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9783871173858643, "rewards/repeat_penalty/std": 0.033628061413764954, "rewards/repeat_floor/mean": 0.997295081615448, "rewards/repeat_floor/std": 0.0035862107761204243, "rewards/near_duplicate_penalty/mean": 0.9877362251281738, "rewards/near_duplicate_penalty/std": 0.010089682415127754, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.18637636303901672, "rewards/total_composite/std": 0.14430412650108337, "reward": 0.18637636303901672, "reward_std": 0.14430411159992218, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20706245303153992, "sampling/sampling_logp_difference/max": 1.6014900207519531, "sampling/importance_sampling_ratio/min": 0.25874075293540955, "sampling/importance_sampling_ratio/mean": 1.048789143562317, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.520952507853508, "clip_ratio/low_mean": 0.07201317511498928, "clip_ratio/low_min": 0.07201317511498928, "clip_ratio/high_mean": 0.14008009247481823, "clip_ratio/high_max": 0.14008009247481823, "clip_ratio/region_mean": 0.2120932675898075, "reward_total_mean": 0.18637636303901672, "reward_meter_mean": 0.5146980285644531, "reward_meter_std": 0.41274702548980713, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.35197150707244873, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.953125, "reward_count_floor_std": 0.10559145361185074, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9783871173858643, "reward_repeat_penalty_std": 0.033628061413764954, "reward_repeat_floor_mean": 0.997295081615448, "reward_repeat_floor_std": 0.0035862107761204243, "reward_near_duplicate_penalty_mean": 0.9877362251281738, "reward_near_duplicate_penalty_std": 0.010089682415127754, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.18637636303901672, "reward_total_composite_std": 0.14430412650108337} {"timestamp_utc": "2026-04-12T16:16:56Z", "mode": "train", "global_step": 100, "epoch": 0.00526288090100521, "loss": -0.0098, "grad_norm": 8.801105499267578, "learning_rate": 9.7e-06, "num_tokens": 194164.0, "completions/mean_length": 124.375, "completions/min_length": 84.0, "completions/max_length": 160.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 124.375, "completions/min_terminated_length": 84.0, "completions/max_terminated_length": 160.0, "rewards/meter/mean": 0.6300970315933228, "rewards/meter/std": 0.3762970566749573, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9907407760620117, "rewards/lexical_plausibility/std": 0.02618914656341076, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.986890435218811, "rewards/repeat_penalty/std": 0.019385388121008873, "rewards/repeat_floor/mean": 0.9985101819038391, "rewards/repeat_floor/std": 0.0020619009155780077, "rewards/near_duplicate_penalty/mean": 0.9949702024459839, "rewards/near_duplicate_penalty/std": 0.006119845900684595, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.991829514503479, "rewards/distinct_2/std": 0.0152190662920475, "rewards/total_composite/mean": 0.21604344248771667, "rewards/total_composite/std": 0.12924325466156006, "reward": 0.21604344248771667, "reward_std": 0.12924323976039886, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21135327219963074, "sampling/sampling_logp_difference/max": 1.5679607391357422, "sampling/importance_sampling_ratio/min": 0.20846986770629883, "sampling/importance_sampling_ratio/mean": 1.0488430261611938, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6173838078975677, "clip_ratio/low_mean": 0.07352012768387794, "clip_ratio/low_min": 0.07352012768387794, "clip_ratio/high_mean": 0.11888312362134457, "clip_ratio/high_max": 0.11888312362134457, "clip_ratio/region_mean": 0.1924032513052225, "reward_total_mean": 0.21604344248771667, "reward_meter_mean": 0.6300970315933228, "reward_meter_std": 0.3762970566749573, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9907407760620117, "reward_lexical_plausibility_std": 0.02618914656341076, "reward_repeat_penalty_mean": 0.986890435218811, "reward_repeat_penalty_std": 0.019385388121008873, "reward_repeat_floor_mean": 0.9985101819038391, "reward_repeat_floor_std": 0.0020619009155780077, "reward_near_duplicate_penalty_mean": 0.9949702024459839, "reward_near_duplicate_penalty_std": 0.006119845900684595, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.991829514503479, "reward_distinct_2_std": 0.0152190662920475, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.21604344248771667, "reward_total_composite_std": 0.12924325466156006} {"timestamp_utc": "2026-04-12T16:19:30Z", "mode": "eval", "global_step": 100, "epoch": 0.00526288090100521, "eval_loss": NaN, "eval_runtime": 153.78, "eval_samples_per_second": 0.676, "eval_steps_per_second": 0.085, "eval_num_tokens": 194164.0, "eval_completions/mean_length": 193.84615384615384, "eval_completions/min_length": 42.92307692307692, "eval_completions/max_length": 423.3076923076923, "eval_completions/clipped_ratio": 0.0673076923076923, "eval_completions/mean_terminated_length": 171.4107149564303, "eval_completions/min_terminated_length": 42.92307692307692, "eval_completions/max_terminated_length": 364.61538461538464, "eval_rewards/meter/mean": 0.32941878071198094, "eval_rewards/meter/std": 0.36498406300177944, "eval_rewards/count_adherence/mean": 0.9112801781067481, "eval_rewards/count_adherence/std": 0.12825587879006678, "eval_rewards/arabic_clean/mean": 0.9038461538461539, "eval_rewards/arabic_clean/std": 0.21140201504413897, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9985576913906977, "eval_rewards/arabic_floor/std": 0.004079461670838869, "eval_rewards/count_floor/mean": 0.973384059392489, "eval_rewards/count_floor/std": 0.03847676479759125, "eval_rewards/lexical_plausibility/mean": 0.9768699315878061, "eval_rewards/lexical_plausibility/std": 0.05473032858795845, "eval_rewards/judge_quality/mean": 0.32932692078443676, "eval_rewards/judge_quality/std": 0.16876431153370783, "eval_rewards/repeat_penalty/mean": 0.9646368301831759, "eval_rewards/repeat_penalty/std": 0.05871333593789201, "eval_rewards/repeat_floor/mean": 0.9964348903069129, "eval_rewards/repeat_floor/std": 0.005291556106665387, "eval_rewards/near_duplicate_penalty/mean": 0.9886650855724628, "eval_rewards/near_duplicate_penalty/std": 0.014827047564232579, "eval_rewards/opening_diversity/mean": 0.9879807692307693, "eval_rewards/opening_diversity/std": 0.03399551774446781, "eval_rewards/distinct_2/mean": 0.9872922255442693, "eval_rewards/distinct_2/std": 0.025999667015499793, "eval_rewards/total_composite/mean": 0.11386545432301667, "eval_rewards/total_composite/std": 0.1390101150251352, "eval_reward": 0.11386545432301667, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.15946110624533433, "eval_sampling/sampling_logp_difference/max": 1.2660664778489332, "eval_sampling/importance_sampling_ratio/min": 0.2837856881893598, "eval_sampling/importance_sampling_ratio/mean": 1.0492045054068933, "eval_sampling/importance_sampling_ratio/max": 1.6505950414217436, "eval_entropy": 2.7171743649702806, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.11386545432301667, "eval_reward_meter_mean": 0.32941878071198094, "eval_reward_meter_std": 0.36498406300177944, "eval_reward_count_adherence_mean": 0.9112801781067481, "eval_reward_count_adherence_std": 0.12825587879006678, "eval_reward_arabic_clean_mean": 0.9038461538461539, "eval_reward_arabic_clean_std": 0.21140201504413897, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9985576913906977, "eval_reward_arabic_floor_std": 0.004079461670838869, "eval_reward_count_floor_mean": 0.973384059392489, "eval_reward_count_floor_std": 0.03847676479759125, "eval_reward_lexical_plausibility_mean": 0.9768699315878061, "eval_reward_lexical_plausibility_std": 0.05473032858795845, "eval_reward_repeat_penalty_mean": 0.9646368301831759, "eval_reward_repeat_penalty_std": 0.05871333593789201, "eval_reward_repeat_floor_mean": 0.9964348903069129, "eval_reward_repeat_floor_std": 0.005291556106665387, "eval_reward_near_duplicate_penalty_mean": 0.9886650855724628, "eval_reward_near_duplicate_penalty_std": 0.014827047564232579, "eval_reward_opening_diversity_mean": 0.9879807692307693, "eval_reward_opening_diversity_std": 0.03399551774446781, "eval_reward_distinct_2_mean": 0.9872922255442693, "eval_reward_distinct_2_std": 0.025999667015499793, "eval_reward_judge_quality_mean": 0.32932692078443676, "eval_reward_judge_quality_std": 0.16876431153370783, "eval_reward_total_composite_mean": 0.11386545432301667, "eval_reward_total_composite_std": 0.1390101150251352} {"timestamp_utc": "2026-04-12T16:19:41Z", "mode": "train", "global_step": 101, "epoch": 0.005315509710015262, "loss": 0.1291, "grad_norm": 24.660491943359375, "learning_rate": 9.696969696969698e-06, "num_tokens": 195639.0, "completions/mean_length": 20.375, "completions/min_length": 14.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.375, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.48119914531707764, "rewards/meter/std": 0.508114218711853, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6100000143051147, "rewards/judge_quality/std": 0.350265234708786, "rewards/repeat_penalty/mean": 0.7407185435295105, "rewards/repeat_penalty/std": 0.01720251515507698, "rewards/repeat_floor/mean": 0.98314368724823, "rewards/repeat_floor/std": 0.003440506523475051, "rewards/near_duplicate_penalty/mean": 0.9876246452331543, "rewards/near_duplicate_penalty/std": 0.022936683148145676, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3458004295825958, "rewards/total_composite/std": 0.43915578722953796, "reward": 0.3458004295825958, "reward_std": 0.43915584683418274, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2215399593114853, "sampling/sampling_logp_difference/max": 2.1100997924804688, "sampling/importance_sampling_ratio/min": 0.12122586369514465, "sampling/importance_sampling_ratio/mean": 0.9900545477867126, "sampling/importance_sampling_ratio/max": 1.6320496797561646, "entropy": 1.846018135547638, "clip_ratio/low_mean": 0.06352419592440128, "clip_ratio/low_min": 0.06352419592440128, "clip_ratio/high_mean": 0.1071428582072258, "clip_ratio/high_max": 0.1071428582072258, "clip_ratio/region_mean": 0.17066705413162708, "reward_total_mean": 0.3458004295825958, "reward_meter_mean": 0.48119914531707764, "reward_meter_std": 0.508114218711853, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7407185435295105, "reward_repeat_penalty_std": 0.01720251515507698, "reward_repeat_floor_mean": 0.98314368724823, "reward_repeat_floor_std": 0.003440506523475051, "reward_near_duplicate_penalty_mean": 0.9876246452331543, "reward_near_duplicate_penalty_std": 0.022936683148145676, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6100000143051147, "reward_judge_quality_std": 0.350265234708786, "reward_total_composite_mean": 0.3458004295825958, "reward_total_composite_std": 0.43915578722953796} {"timestamp_utc": "2026-04-12T16:19:51Z", "mode": "train", "global_step": 102, "epoch": 0.005368138519025315, "loss": 0.1026, "grad_norm": 13.553353309631348, "learning_rate": 9.693939393939395e-06, "num_tokens": 197312.0, "completions/mean_length": 52.125, "completions/min_length": 36.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.125, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.838103175163269, "rewards/meter/std": 0.3429650664329529, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.9850345849990845, "rewards/repeat_penalty/std": 0.038038067519664764, "rewards/repeat_floor/mean": 0.9982517957687378, "rewards/repeat_floor/std": 0.004305039066821337, "rewards/near_duplicate_penalty/mean": 0.9938398599624634, "rewards/near_duplicate_penalty/std": 0.01328597404062748, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.37283021211624146, "rewards/total_composite/std": 0.2614906132221222, "reward": 0.37283021211624146, "reward_std": 0.2614906430244446, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22789521515369415, "sampling/sampling_logp_difference/max": 1.8274550437927246, "sampling/importance_sampling_ratio/min": 0.160822331905365, "sampling/importance_sampling_ratio/mean": 1.0536524057388306, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5214386582374573, "clip_ratio/low_mean": 0.10784188099205494, "clip_ratio/low_min": 0.10784188099205494, "clip_ratio/high_mean": 0.07347913924604654, "clip_ratio/high_max": 0.07347913924604654, "clip_ratio/region_mean": 0.18132102023810148, "reward_total_mean": 0.37283021211624146, "reward_meter_mean": 0.838103175163269, "reward_meter_std": 0.3429650664329529, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9850345849990845, "reward_repeat_penalty_std": 0.038038067519664764, "reward_repeat_floor_mean": 0.9982517957687378, "reward_repeat_floor_std": 0.004305039066821337, "reward_near_duplicate_penalty_mean": 0.9938398599624634, "reward_near_duplicate_penalty_std": 0.01328597404062748, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.37283021211624146, "reward_total_composite_std": 0.2614906132221222} {"timestamp_utc": "2026-04-12T16:19:59Z", "mode": "train", "global_step": 103, "epoch": 0.005420767328035366, "loss": 0.0504, "grad_norm": 25.127071380615234, "learning_rate": 9.690909090909092e-06, "num_tokens": 198839.0, "completions/mean_length": 43.875, "completions/min_length": 41.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.875, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.5449619293212891, "rewards/meter/std": 0.30401355028152466, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8400000333786011, "rewards/judge_quality/std": 0.16843822598457336, "rewards/repeat_penalty/mean": 0.9917404651641846, "rewards/repeat_penalty/std": 0.01016718428581953, "rewards/repeat_floor/mean": 0.9987610578536987, "rewards/repeat_floor/std": 0.0015250721480697393, "rewards/near_duplicate_penalty/mean": 0.9917404651641846, "rewards/near_duplicate_penalty/std": 0.01016718428581953, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.47210636734962463, "rewards/total_composite/std": 0.28807532787323, "reward": 0.47210636734962463, "reward_std": 0.2880752980709076, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10407081246376038, "sampling/sampling_logp_difference/max": 1.7363204956054688, "sampling/importance_sampling_ratio/min": 0.17616741359233856, "sampling/importance_sampling_ratio/mean": 1.0125762224197388, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5438592098653316, "clip_ratio/low_mean": 0.05730749759823084, "clip_ratio/low_min": 0.05730749759823084, "clip_ratio/high_mean": 0.048939047614112496, "clip_ratio/high_max": 0.048939047614112496, "clip_ratio/region_mean": 0.10624654521234334, "reward_total_mean": 0.47210636734962463, "reward_meter_mean": 0.5449619293212891, "reward_meter_std": 0.30401355028152466, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9917404651641846, "reward_repeat_penalty_std": 0.01016718428581953, "reward_repeat_floor_mean": 0.9987610578536987, "reward_repeat_floor_std": 0.0015250721480697393, "reward_near_duplicate_penalty_mean": 0.9917404651641846, "reward_near_duplicate_penalty_std": 0.01016718428581953, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8400000333786011, "reward_judge_quality_std": 0.16843822598457336, "reward_total_composite_mean": 0.47210636734962463, "reward_total_composite_std": 0.28807532787323} {"timestamp_utc": "2026-04-12T16:20:07Z", "mode": "train", "global_step": 104, "epoch": 0.005473396137045419, "loss": 0.0611, "grad_norm": 21.231082916259766, "learning_rate": 9.687878787878788e-06, "num_tokens": 200299.0, "completions/mean_length": 25.5, "completions/min_length": 20.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.5, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.9572399854660034, "rewards/meter/std": 0.051584795117378235, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9752674102783203, "rewards/lexical_plausibility/std": 0.06995441019535065, "rewards/judge_quality/mean": 0.5724999904632568, "rewards/judge_quality/std": 0.38425251841545105, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5437753200531006, "rewards/total_composite/std": 0.36814752221107483, "reward": 0.5437753200531006, "reward_std": 0.36814752221107483, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23689311742782593, "sampling/sampling_logp_difference/max": 1.550304889678955, "sampling/importance_sampling_ratio/min": 0.21218328177928925, "sampling/importance_sampling_ratio/mean": 1.055704951286316, "sampling/importance_sampling_ratio/max": 1.796012043952942, "entropy": 2.577810436487198, "clip_ratio/low_mean": 0.08415292482823133, "clip_ratio/low_min": 0.08415292482823133, "clip_ratio/high_mean": 0.1052370686084032, "clip_ratio/high_max": 0.1052370686084032, "clip_ratio/region_mean": 0.18938999343663454, "reward_total_mean": 0.5437753200531006, "reward_meter_mean": 0.9572399854660034, "reward_meter_std": 0.051584795117378235, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9752674102783203, "reward_lexical_plausibility_std": 0.06995441019535065, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5724999904632568, "reward_judge_quality_std": 0.38425251841545105, "reward_total_composite_mean": 0.5437753200531006, "reward_total_composite_std": 0.36814752221107483} {"timestamp_utc": "2026-04-12T16:20:16Z", "mode": "train", "global_step": 105, "epoch": 0.005526024946055471, "loss": -0.0739, "grad_norm": 14.191681861877441, "learning_rate": 9.684848484848487e-06, "num_tokens": 202184.0, "completions/mean_length": 50.625, "completions/min_length": 41.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.625, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.5926839113235474, "rewards/meter/std": 0.3989444971084595, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8915603160858154, "rewards/lexical_plausibility/std": 0.11506184935569763, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9921516180038452, "rewards/repeat_penalty/std": 0.01117697823792696, "rewards/repeat_floor/mean": 0.9988227486610413, "rewards/repeat_floor/std": 0.0016765488544479012, "rewards/near_duplicate_penalty/mean": 0.9921516180038452, "rewards/near_duplicate_penalty/std": 0.01117697823792696, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1712530255317688, "rewards/total_composite/std": 0.11353282630443573, "reward": 0.1712530255317688, "reward_std": 0.11353281885385513, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.25293460488319397, "sampling/sampling_logp_difference/max": 1.8832950592041016, "sampling/importance_sampling_ratio/min": 0.15208813548088074, "sampling/importance_sampling_ratio/mean": 1.0083962678909302, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.698224186897278, "clip_ratio/low_mean": 0.12342285364866257, "clip_ratio/low_min": 0.12342285364866257, "clip_ratio/high_mean": 0.10810508020222187, "clip_ratio/high_max": 0.10810508020222187, "clip_ratio/region_mean": 0.23152793385088444, "reward_total_mean": 0.1712530255317688, "reward_meter_mean": 0.5926839113235474, "reward_meter_std": 0.3989444971084595, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8915603160858154, "reward_lexical_plausibility_std": 0.11506184935569763, "reward_repeat_penalty_mean": 0.9921516180038452, "reward_repeat_penalty_std": 0.01117697823792696, "reward_repeat_floor_mean": 0.9988227486610413, "reward_repeat_floor_std": 0.0016765488544479012, "reward_near_duplicate_penalty_mean": 0.9921516180038452, "reward_near_duplicate_penalty_std": 0.01117697823792696, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.1712530255317688, "reward_total_composite_std": 0.11353282630443573} {"timestamp_utc": "2026-04-12T16:20:24Z", "mode": "train", "global_step": 106, "epoch": 0.0055786537550655225, "loss": 0.1553, "grad_norm": 27.88457489013672, "learning_rate": 9.681818181818182e-06, "num_tokens": 203817.0, "completions/mean_length": 42.125, "completions/min_length": 35.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.125, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.6516113877296448, "rewards/meter/std": 0.44471949338912964, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8050000071525574, "rewards/judge_quality/std": 0.2517368495464325, "rewards/repeat_penalty/mean": 0.9780062437057495, "rewards/repeat_penalty/std": 0.02115113101899624, "rewards/repeat_floor/mean": 0.9967009425163269, "rewards/repeat_floor/std": 0.003172681899741292, "rewards/near_duplicate_penalty/mean": 0.9780062437057495, "rewards/near_duplicate_penalty/std": 0.02115113101899624, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5909601449966431, "rewards/total_composite/std": 0.44367197155952454, "reward": 0.5909601449966431, "reward_std": 0.44367194175720215, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20126840472221375, "sampling/sampling_logp_difference/max": 2.3270578384399414, "sampling/importance_sampling_ratio/min": 0.09758242964744568, "sampling/importance_sampling_ratio/mean": 0.9800254702568054, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9679724723100662, "clip_ratio/low_mean": 0.06499474868178368, "clip_ratio/low_min": 0.06499474868178368, "clip_ratio/high_mean": 0.11691626626998186, "clip_ratio/high_max": 0.11691626626998186, "clip_ratio/region_mean": 0.18191101495176554, "reward_total_mean": 0.5909601449966431, "reward_meter_mean": 0.6516113877296448, "reward_meter_std": 0.44471949338912964, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9780062437057495, "reward_repeat_penalty_std": 0.02115113101899624, "reward_repeat_floor_mean": 0.9967009425163269, "reward_repeat_floor_std": 0.003172681899741292, "reward_near_duplicate_penalty_mean": 0.9780062437057495, "reward_near_duplicate_penalty_std": 0.02115113101899624, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8050000071525574, "reward_judge_quality_std": 0.2517368495464325, "reward_total_composite_mean": 0.5909601449966431, "reward_total_composite_std": 0.44367197155952454} {"timestamp_utc": "2026-04-12T16:20:36Z", "mode": "train", "global_step": 107, "epoch": 0.005631282564075575, "loss": 0.0966, "grad_norm": 4.674691677093506, "learning_rate": 9.67878787878788e-06, "num_tokens": 207778.0, "completions/mean_length": 307.125, "completions/min_length": 258.0, "completions/max_length": 390.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 307.125, "completions/min_terminated_length": 258.0, "completions/max_terminated_length": 390.0, "rewards/meter/mean": 0.6583197116851807, "rewards/meter/std": 0.3852737545967102, "rewards/count_adherence/mean": 0.9305555820465088, "rewards/count_adherence/std": 0.08266931027173996, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9791666865348816, "rewards/count_floor/std": 0.024800799787044525, "rewards/lexical_plausibility/mean": 0.9650596380233765, "rewards/lexical_plausibility/std": 0.08201706409454346, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9906517267227173, "rewards/repeat_penalty/std": 0.0076460340060293674, "rewards/repeat_floor/mean": 0.9989129900932312, "rewards/repeat_floor/std": 0.0007341052987612784, "rewards/near_duplicate_penalty/mean": 0.9959393739700317, "rewards/near_duplicate_penalty/std": 0.0019260674016550183, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9946901798248291, "rewards/distinct_2/std": 0.007329006679356098, "rewards/total_composite/mean": 0.13285447657108307, "rewards/total_composite/std": 0.12690594792366028, "reward": 0.13285447657108307, "reward_std": 0.12690596282482147, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20803570747375488, "sampling/sampling_logp_difference/max": 1.7416906356811523, "sampling/importance_sampling_ratio/min": 0.1752239167690277, "sampling/importance_sampling_ratio/mean": 1.0514438152313232, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.267181158065796, "clip_ratio/low_mean": 0.09589782729744911, "clip_ratio/low_min": 0.09589782729744911, "clip_ratio/high_mean": 0.07560446858406067, "clip_ratio/high_max": 0.07560446858406067, "clip_ratio/region_mean": 0.17150229588150978, "reward_total_mean": 0.13285447657108307, "reward_meter_mean": 0.6583197116851807, "reward_meter_std": 0.3852737545967102, "reward_count_adherence_mean": 0.9305555820465088, "reward_count_adherence_std": 0.08266931027173996, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9791666865348816, "reward_count_floor_std": 0.024800799787044525, "reward_lexical_plausibility_mean": 0.9650596380233765, "reward_lexical_plausibility_std": 0.08201706409454346, "reward_repeat_penalty_mean": 0.9906517267227173, "reward_repeat_penalty_std": 0.0076460340060293674, "reward_repeat_floor_mean": 0.9989129900932312, "reward_repeat_floor_std": 0.0007341052987612784, "reward_near_duplicate_penalty_mean": 0.9959393739700317, "reward_near_duplicate_penalty_std": 0.0019260674016550183, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9946901798248291, "reward_distinct_2_std": 0.007329006679356098, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.13285447657108307, "reward_total_composite_std": 0.12690594792366028} {"timestamp_utc": "2026-04-12T16:20:45Z", "mode": "train", "global_step": 108, "epoch": 0.005683911373085627, "loss": -0.0681, "grad_norm": 18.262678146362305, "learning_rate": 9.675757575757577e-06, "num_tokens": 209438.0, "completions/mean_length": 49.5, "completions/min_length": 33.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.5, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.4589425325393677, "rewards/meter/std": 0.31086745858192444, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6762499809265137, "rewards/judge_quality/std": 0.2707628309726715, "rewards/repeat_penalty/mean": 0.9637178182601929, "rewards/repeat_penalty/std": 0.04730316251516342, "rewards/repeat_floor/mean": 0.9956634044647217, "rewards/repeat_floor/std": 0.0054037608206272125, "rewards/near_duplicate_penalty/mean": 0.9829314947128296, "rewards/near_duplicate_penalty/std": 0.023687105625867844, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9802631139755249, "rewards/distinct_2/std": 0.036561544984579086, "rewards/total_composite/mean": 0.3096131682395935, "rewards/total_composite/std": 0.2605850100517273, "reward": 0.3096131682395935, "reward_std": 0.2605850100517273, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20179329812526703, "sampling/sampling_logp_difference/max": 1.2871370315551758, "sampling/importance_sampling_ratio/min": 0.27606001496315, "sampling/importance_sampling_ratio/mean": 1.0199841260910034, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8905853629112244, "clip_ratio/low_mean": 0.10233294777572155, "clip_ratio/low_min": 0.10233294777572155, "clip_ratio/high_mean": 0.06369313038885593, "clip_ratio/high_max": 0.06369313038885593, "clip_ratio/region_mean": 0.16602607816457748, "reward_total_mean": 0.3096131682395935, "reward_meter_mean": 0.4589425325393677, "reward_meter_std": 0.31086745858192444, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9637178182601929, "reward_repeat_penalty_std": 0.04730316251516342, "reward_repeat_floor_mean": 0.9956634044647217, "reward_repeat_floor_std": 0.0054037608206272125, "reward_near_duplicate_penalty_mean": 0.9829314947128296, "reward_near_duplicate_penalty_std": 0.023687105625867844, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9802631139755249, "reward_distinct_2_std": 0.036561544984579086, "reward_judge_quality_mean": 0.6762499809265137, "reward_judge_quality_std": 0.2707628309726715, "reward_total_composite_mean": 0.3096131682395935, "reward_total_composite_std": 0.2605850100517273} {"timestamp_utc": "2026-04-12T16:20:55Z", "mode": "train", "global_step": 109, "epoch": 0.005736540182095679, "loss": 0.019, "grad_norm": 16.318899154663086, "learning_rate": 9.672727272727274e-06, "num_tokens": 211082.0, "completions/mean_length": 52.5, "completions/min_length": 35.0, "completions/max_length": 92.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.5, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.39329585433006287, "rewards/meter/std": 0.3182377219200134, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9126887321472168, "rewards/lexical_plausibility/std": 0.1678655445575714, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.13562028110027313, "rewards/repeat_penalty/mean": 0.9663114547729492, "rewards/repeat_penalty/std": 0.0535384863615036, "rewards/repeat_floor/mean": 0.9959038496017456, "rewards/repeat_floor/std": 0.006516526453197002, "rewards/near_duplicate_penalty/mean": 0.9833259582519531, "rewards/near_duplicate_penalty/std": 0.029908593744039536, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.982277512550354, "rewards/distinct_2/std": 0.03444872051477432, "rewards/total_composite/mean": 0.17002442479133606, "rewards/total_composite/std": 0.13673201203346252, "reward": 0.17002442479133606, "reward_std": 0.13673201203346252, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22045652568340302, "sampling/sampling_logp_difference/max": 2.1182918548583984, "sampling/importance_sampling_ratio/min": 0.120236836373806, "sampling/importance_sampling_ratio/mean": 1.0091578960418701, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5120889097452164, "clip_ratio/low_mean": 0.10537504777312279, "clip_ratio/low_min": 0.10537504777312279, "clip_ratio/high_mean": 0.07010242925025523, "clip_ratio/high_max": 0.07010242925025523, "clip_ratio/region_mean": 0.17547747702337801, "reward_total_mean": 0.17002442479133606, "reward_meter_mean": 0.39329585433006287, "reward_meter_std": 0.3182377219200134, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9126887321472168, "reward_lexical_plausibility_std": 0.1678655445575714, "reward_repeat_penalty_mean": 0.9663114547729492, "reward_repeat_penalty_std": 0.0535384863615036, "reward_repeat_floor_mean": 0.9959038496017456, "reward_repeat_floor_std": 0.006516526453197002, "reward_near_duplicate_penalty_mean": 0.9833259582519531, "reward_near_duplicate_penalty_std": 0.029908593744039536, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.982277512550354, "reward_distinct_2_std": 0.03444872051477432, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.13562028110027313, "reward_total_composite_mean": 0.17002442479133606, "reward_total_composite_std": 0.13673201203346252} {"timestamp_utc": "2026-04-12T16:21:03Z", "mode": "train", "global_step": 110, "epoch": 0.005789168991105731, "loss": 0.0067, "grad_norm": 25.61552619934082, "learning_rate": 9.66969696969697e-06, "num_tokens": 212636.0, "completions/mean_length": 34.25, "completions/min_length": 27.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.25, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.8282620310783386, "rewards/meter/std": 0.2704026401042938, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9994343519210815, "rewards/lexical_plausibility/std": 0.0015997890150174499, "rewards/judge_quality/mean": 0.8799999952316284, "rewards/judge_quality/std": 0.1742740124464035, "rewards/repeat_penalty/mean": 0.9926075339317322, "rewards/repeat_penalty/std": 0.02090907283127308, "rewards/repeat_floor/mean": 0.9988911151885986, "rewards/repeat_floor/std": 0.003136357991024852, "rewards/near_duplicate_penalty/mean": 0.9926075339317322, "rewards/near_duplicate_penalty/std": 0.02090907283127308, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7320461273193359, "rewards/total_composite/std": 0.2981451749801636, "reward": 0.7320461273193359, "reward_std": 0.2981451749801636, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1422923356294632, "sampling/sampling_logp_difference/max": 2.8497915267944336, "sampling/importance_sampling_ratio/min": 0.05785638466477394, "sampling/importance_sampling_ratio/mean": 0.9579386115074158, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.566255196928978, "clip_ratio/low_mean": 0.02813390363007784, "clip_ratio/low_min": 0.02813390363007784, "clip_ratio/high_mean": 0.1177370531950146, "clip_ratio/high_max": 0.1177370531950146, "clip_ratio/region_mean": 0.14587095682509243, "reward_total_mean": 0.7320461273193359, "reward_meter_mean": 0.8282620310783386, "reward_meter_std": 0.2704026401042938, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9994343519210815, "reward_lexical_plausibility_std": 0.0015997890150174499, "reward_repeat_penalty_mean": 0.9926075339317322, "reward_repeat_penalty_std": 0.02090907283127308, "reward_repeat_floor_mean": 0.9988911151885986, "reward_repeat_floor_std": 0.003136357991024852, "reward_near_duplicate_penalty_mean": 0.9926075339317322, "reward_near_duplicate_penalty_std": 0.02090907283127308, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8799999952316284, "reward_judge_quality_std": 0.1742740124464035, "reward_total_composite_mean": 0.7320461273193359, "reward_total_composite_std": 0.2981451749801636} {"timestamp_utc": "2026-04-12T16:21:11Z", "mode": "train", "global_step": 111, "epoch": 0.005841797800115784, "loss": 0.1901, "grad_norm": 20.622541427612305, "learning_rate": 9.666666666666667e-06, "num_tokens": 214072.0, "completions/mean_length": 25.5, "completions/min_length": 16.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.5, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.7410401105880737, "rewards/meter/std": 0.4375188648700714, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9715073704719543, "rewards/lexical_plausibility/std": 0.08058936893939972, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.36246922612190247, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.45010489225387573, "rewards/total_composite/std": 0.3942350745201111, "reward": 0.45010489225387573, "reward_std": 0.3942350447177887, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20283541083335876, "sampling/sampling_logp_difference/max": 1.5572848320007324, "sampling/importance_sampling_ratio/min": 0.2107073962688446, "sampling/importance_sampling_ratio/mean": 1.0446093082427979, "sampling/importance_sampling_ratio/max": 1.9071470499038696, "entropy": 2.180199012160301, "clip_ratio/low_mean": 0.13912497088313103, "clip_ratio/low_min": 0.13912497088313103, "clip_ratio/high_mean": 0.08583960123360157, "clip_ratio/high_max": 0.08583960123360157, "clip_ratio/region_mean": 0.2249645721167326, "reward_total_mean": 0.45010489225387573, "reward_meter_mean": 0.7410401105880737, "reward_meter_std": 0.4375188648700714, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9715073704719543, "reward_lexical_plausibility_std": 0.08058936893939972, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.36246922612190247, "reward_total_composite_mean": 0.45010489225387573, "reward_total_composite_std": 0.3942350745201111} {"timestamp_utc": "2026-04-12T16:21:20Z", "mode": "train", "global_step": 112, "epoch": 0.005894426609125835, "loss": -0.0453, "grad_norm": 19.2539005279541, "learning_rate": 9.663636363636364e-06, "num_tokens": 215478.0, "completions/mean_length": 28.75, "completions/min_length": 16.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.75, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.5128393173217773, "rewards/meter/std": 0.4806661009788513, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.7517600655555725, "rewards/lexical_plausibility/std": 0.3265290856361389, "rewards/judge_quality/mean": 0.4424999952316284, "rewards/judge_quality/std": 0.3340979516506195, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2956763505935669, "rewards/total_composite/std": 0.3917238712310791, "reward": 0.2956763505935669, "reward_std": 0.3917238712310791, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22882838547229767, "sampling/sampling_logp_difference/max": 1.7279586791992188, "sampling/importance_sampling_ratio/min": 0.1776466816663742, "sampling/importance_sampling_ratio/mean": 1.031433343887329, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9021585285663605, "clip_ratio/low_mean": 0.09303139289841056, "clip_ratio/low_min": 0.09303139289841056, "clip_ratio/high_mean": 0.07412941940128803, "clip_ratio/high_max": 0.07412941940128803, "clip_ratio/region_mean": 0.1671608122996986, "reward_total_mean": 0.2956763505935669, "reward_meter_mean": 0.5128393173217773, "reward_meter_std": 0.4806661009788513, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.7517600655555725, "reward_lexical_plausibility_std": 0.3265290856361389, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4424999952316284, "reward_judge_quality_std": 0.3340979516506195, "reward_total_composite_mean": 0.2956763505935669, "reward_total_composite_std": 0.3917238712310791} {"timestamp_utc": "2026-04-12T16:21:29Z", "mode": "train", "global_step": 113, "epoch": 0.005947055418135888, "loss": 0.0237, "grad_norm": 16.712873458862305, "learning_rate": 9.660606060606061e-06, "num_tokens": 217193.0, "completions/mean_length": 43.375, "completions/min_length": 31.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.375, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.3598339557647705, "rewards/meter/std": 0.2768198847770691, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9061805009841919, "rewards/lexical_plausibility/std": 0.1414359211921692, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9927659630775452, "rewards/repeat_penalty/std": 0.018347030505537987, "rewards/repeat_floor/mean": 0.998914897441864, "rewards/repeat_floor/std": 0.0027520437724888325, "rewards/near_duplicate_penalty/mean": 0.9927659630775452, "rewards/near_duplicate_penalty/std": 0.018347030505537987, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12368791550397873, "rewards/total_composite/std": 0.1086086556315422, "reward": 0.12368791550397873, "reward_std": 0.1086086556315422, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2594793140888214, "sampling/sampling_logp_difference/max": 1.387596607208252, "sampling/importance_sampling_ratio/min": 0.24967466294765472, "sampling/importance_sampling_ratio/mean": 1.034879207611084, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.802516222000122, "clip_ratio/low_mean": 0.14920755475759506, "clip_ratio/low_min": 0.14920755475759506, "clip_ratio/high_mean": 0.09501327015459538, "clip_ratio/high_max": 0.09501327015459538, "clip_ratio/region_mean": 0.24422082491219044, "reward_total_mean": 0.12368791550397873, "reward_meter_mean": 0.3598339557647705, "reward_meter_std": 0.2768198847770691, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9061805009841919, "reward_lexical_plausibility_std": 0.1414359211921692, "reward_repeat_penalty_mean": 0.9927659630775452, "reward_repeat_penalty_std": 0.018347030505537987, "reward_repeat_floor_mean": 0.998914897441864, "reward_repeat_floor_std": 0.0027520437724888325, "reward_near_duplicate_penalty_mean": 0.9927659630775452, "reward_near_duplicate_penalty_std": 0.018347030505537987, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.12368791550397873, "reward_total_composite_std": 0.1086086556315422} {"timestamp_utc": "2026-04-12T16:21:39Z", "mode": "train", "global_step": 114, "epoch": 0.00599968422714594, "loss": 0.0008, "grad_norm": 9.978446006774902, "learning_rate": 9.657575757575758e-06, "num_tokens": 219248.0, "completions/mean_length": 92.875, "completions/min_length": 70.0, "completions/max_length": 114.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 92.875, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 114.0, "rewards/meter/mean": 0.8164951801300049, "rewards/meter/std": 0.320004403591156, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.961208701133728, "rewards/lexical_plausibility/std": 0.10971830040216446, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9959613084793091, "rewards/repeat_penalty/std": 0.004583663772791624, "rewards/repeat_floor/mean": 0.9993941783905029, "rewards/repeat_floor/std": 0.0006875431863591075, "rewards/near_duplicate_penalty/mean": 0.9959613084793091, "rewards/near_duplicate_penalty/std": 0.004583663772791624, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.25260108709335327, "rewards/total_composite/std": 0.1469898819923401, "reward": 0.25260108709335327, "reward_std": 0.1469898819923401, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20012064278125763, "sampling/sampling_logp_difference/max": 1.081636905670166, "sampling/importance_sampling_ratio/min": 0.3390401005744934, "sampling/importance_sampling_ratio/mean": 1.0457664728164673, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8036739826202393, "clip_ratio/low_mean": 0.08223419077694416, "clip_ratio/low_min": 0.08223419077694416, "clip_ratio/high_mean": 0.12496751919388771, "clip_ratio/high_max": 0.12496751919388771, "clip_ratio/region_mean": 0.20720170997083187, "reward_total_mean": 0.25260108709335327, "reward_meter_mean": 0.8164951801300049, "reward_meter_std": 0.320004403591156, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.961208701133728, "reward_lexical_plausibility_std": 0.10971830040216446, "reward_repeat_penalty_mean": 0.9959613084793091, "reward_repeat_penalty_std": 0.004583663772791624, "reward_repeat_floor_mean": 0.9993941783905029, "reward_repeat_floor_std": 0.0006875431863591075, "reward_near_duplicate_penalty_mean": 0.9959613084793091, "reward_near_duplicate_penalty_std": 0.004583663772791624, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.25260108709335327, "reward_total_composite_std": 0.1469898819923401} {"timestamp_utc": "2026-04-12T16:21:48Z", "mode": "train", "global_step": 115, "epoch": 0.0060523130361559915, "loss": 0.1745, "grad_norm": 13.326382637023926, "learning_rate": 9.654545454545456e-06, "num_tokens": 221079.0, "completions/mean_length": 54.875, "completions/min_length": 41.0, "completions/max_length": 97.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.875, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 97.0, "rewards/meter/mean": 0.7106096744537354, "rewards/meter/std": 0.3569812476634979, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9928355813026428, "rewards/lexical_plausibility/std": 0.020263994112610817, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.11259915679693222, "rewards/repeat_penalty/mean": 0.9856451749801636, "rewards/repeat_penalty/std": 0.012042542919516563, "rewards/repeat_floor/mean": 0.997846782207489, "rewards/repeat_floor/std": 0.0018063782481476665, "rewards/near_duplicate_penalty/mean": 0.9856451749801636, "rewards/near_duplicate_penalty/std": 0.012042542919516563, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2591401934623718, "rewards/total_composite/std": 0.16632743179798126, "reward": 0.2591401934623718, "reward_std": 0.16632743179798126, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19514282047748566, "sampling/sampling_logp_difference/max": 1.364858627319336, "sampling/importance_sampling_ratio/min": 0.25541678071022034, "sampling/importance_sampling_ratio/mean": 1.0378247499465942, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.176184728741646, "clip_ratio/low_mean": 0.10042064264416695, "clip_ratio/low_min": 0.10042064264416695, "clip_ratio/high_mean": 0.09279343206435442, "clip_ratio/high_max": 0.09279343206435442, "clip_ratio/region_mean": 0.19321407470852137, "reward_total_mean": 0.2591401934623718, "reward_meter_mean": 0.7106096744537354, "reward_meter_std": 0.3569812476634979, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9928355813026428, "reward_lexical_plausibility_std": 0.020263994112610817, "reward_repeat_penalty_mean": 0.9856451749801636, "reward_repeat_penalty_std": 0.012042542919516563, "reward_repeat_floor_mean": 0.997846782207489, "reward_repeat_floor_std": 0.0018063782481476665, "reward_near_duplicate_penalty_mean": 0.9856451749801636, "reward_near_duplicate_penalty_std": 0.012042542919516563, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.11259915679693222, "reward_total_composite_mean": 0.2591401934623718, "reward_total_composite_std": 0.16632743179798126} {"timestamp_utc": "2026-04-12T16:21:59Z", "mode": "train", "global_step": 116, "epoch": 0.006104941845166044, "loss": 0.1931, "grad_norm": 9.80229377746582, "learning_rate": 9.651515151515153e-06, "num_tokens": 223223.0, "completions/mean_length": 96.0, "completions/min_length": 77.0, "completions/max_length": 141.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 96.0, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 141.0, "rewards/meter/mean": 0.7641827464103699, "rewards/meter/std": 0.32104983925819397, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9899832010269165, "rewards/repeat_penalty/std": 0.011829826049506664, "rewards/repeat_floor/mean": 0.998497486114502, "rewards/repeat_floor/std": 0.0017744723008945584, "rewards/near_duplicate_penalty/mean": 0.9899832010269165, "rewards/near_duplicate_penalty/std": 0.011829826049506664, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.31298011541366577, "rewards/total_composite/std": 0.1595117598772049, "reward": 0.31298011541366577, "reward_std": 0.1595117449760437, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20624369382858276, "sampling/sampling_logp_difference/max": 1.57826566696167, "sampling/importance_sampling_ratio/min": 0.20633263885974884, "sampling/importance_sampling_ratio/mean": 1.0410480499267578, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.560793563723564, "clip_ratio/low_mean": 0.06803693901747465, "clip_ratio/low_min": 0.06803693901747465, "clip_ratio/high_mean": 0.13042096979916096, "clip_ratio/high_max": 0.13042096979916096, "clip_ratio/region_mean": 0.1984579088166356, "reward_total_mean": 0.31298011541366577, "reward_meter_mean": 0.7641827464103699, "reward_meter_std": 0.32104983925819397, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9899832010269165, "reward_repeat_penalty_std": 0.011829826049506664, "reward_repeat_floor_mean": 0.998497486114502, "reward_repeat_floor_std": 0.0017744723008945584, "reward_near_duplicate_penalty_mean": 0.9899832010269165, "reward_near_duplicate_penalty_std": 0.011829826049506664, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.31298011541366577, "reward_total_composite_std": 0.1595117598772049} {"timestamp_utc": "2026-04-12T16:22:09Z", "mode": "train", "global_step": 117, "epoch": 0.006157570654176096, "loss": 0.0745, "grad_norm": 13.605415344238281, "learning_rate": 9.648484848484849e-06, "num_tokens": 224921.0, "completions/mean_length": 51.25, "completions/min_length": 35.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.25, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.5380079746246338, "rewards/meter/std": 0.4626144468784332, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9967199563980103, "rewards/repeat_penalty/std": 0.006169808097183704, "rewards/repeat_floor/mean": 0.9995079636573792, "rewards/repeat_floor/std": 0.0009254738688468933, "rewards/near_duplicate_penalty/mean": 0.9967199563980103, "rewards/near_duplicate_penalty/std": 0.006169808097183704, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20348688960075378, "rewards/total_composite/std": 0.18260757625102997, "reward": 0.20348688960075378, "reward_std": 0.18260756134986877, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2219952493906021, "sampling/sampling_logp_difference/max": 1.4091901779174805, "sampling/importance_sampling_ratio/min": 0.24434107542037964, "sampling/importance_sampling_ratio/mean": 1.0295130014419556, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8360769152641296, "clip_ratio/low_mean": 0.09715486317873001, "clip_ratio/low_min": 0.09715486317873001, "clip_ratio/high_mean": 0.09219090826809406, "clip_ratio/high_max": 0.09219090826809406, "clip_ratio/region_mean": 0.18934577144682407, "reward_total_mean": 0.20348688960075378, "reward_meter_mean": 0.5380079746246338, "reward_meter_std": 0.4626144468784332, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9967199563980103, "reward_repeat_penalty_std": 0.006169808097183704, "reward_repeat_floor_mean": 0.9995079636573792, "reward_repeat_floor_std": 0.0009254738688468933, "reward_near_duplicate_penalty_mean": 0.9967199563980103, "reward_near_duplicate_penalty_std": 0.006169808097183704, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.20348688960075378, "reward_total_composite_std": 0.18260757625102997} {"timestamp_utc": "2026-04-12T16:22:18Z", "mode": "train", "global_step": 118, "epoch": 0.006210199463186148, "loss": 0.0664, "grad_norm": 15.919730186462402, "learning_rate": 9.645454545454548e-06, "num_tokens": 226333.0, "completions/mean_length": 24.5, "completions/min_length": 21.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.5, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.6992982625961304, "rewards/meter/std": 0.4218030273914337, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9170168042182922, "rewards/lexical_plausibility/std": 0.2347119152545929, "rewards/judge_quality/mean": 0.6875, "rewards/judge_quality/std": 0.3739270567893982, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5495831966400146, "rewards/total_composite/std": 0.42945122718811035, "reward": 0.5495831966400146, "reward_std": 0.42945122718811035, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1402398943901062, "sampling/sampling_logp_difference/max": 1.2016280889511108, "sampling/importance_sampling_ratio/min": 0.3007042407989502, "sampling/importance_sampling_ratio/mean": 1.0070768594741821, "sampling/importance_sampling_ratio/max": 1.9456191062927246, "entropy": 1.0227503515779972, "clip_ratio/low_mean": 0.06757575832307339, "clip_ratio/low_min": 0.06757575832307339, "clip_ratio/high_mean": 0.060659651178866625, "clip_ratio/high_max": 0.060659651178866625, "clip_ratio/region_mean": 0.12823540950194, "reward_total_mean": 0.5495831966400146, "reward_meter_mean": 0.6992982625961304, "reward_meter_std": 0.4218030273914337, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9170168042182922, "reward_lexical_plausibility_std": 0.2347119152545929, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6875, "reward_judge_quality_std": 0.3739270567893982, "reward_total_composite_mean": 0.5495831966400146, "reward_total_composite_std": 0.42945122718811035} {"timestamp_utc": "2026-04-12T16:22:26Z", "mode": "train", "global_step": 119, "epoch": 0.0062628282721962, "loss": 0.2095, "grad_norm": 27.368627548217773, "learning_rate": 9.642424242424243e-06, "num_tokens": 227751.0, "completions/mean_length": 17.25, "completions/min_length": 10.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.25, "completions/min_terminated_length": 10.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.1176612600684166, "rewards/meter/std": 0.1472979336977005, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.970588207244873, "rewards/lexical_plausibility/std": 0.05446000397205353, "rewards/judge_quality/mean": 0.7762500047683716, "rewards/judge_quality/std": 0.30500292778015137, "rewards/repeat_penalty/mean": 0.7320075631141663, "rewards/repeat_penalty/std": 0.050890251994132996, "rewards/repeat_floor/mean": 0.9814015626907349, "rewards/repeat_floor/std": 0.010178063064813614, "rewards/near_duplicate_penalty/mean": 0.9760100841522217, "rewards/near_duplicate_penalty/std": 0.06785368919372559, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.09496261179447174, "rewards/total_composite/std": 0.13875754177570343, "reward": 0.09496261179447174, "reward_std": 0.13875754177570343, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2491590529680252, "sampling/sampling_logp_difference/max": 1.505394458770752, "sampling/importance_sampling_ratio/min": 0.22192974388599396, "sampling/importance_sampling_ratio/mean": 1.0080736875534058, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4507152736186981, "clip_ratio/low_mean": 0.189669081941247, "clip_ratio/low_min": 0.189669081941247, "clip_ratio/high_mean": 0.07500000018626451, "clip_ratio/high_max": 0.07500000018626451, "clip_ratio/region_mean": 0.2646690821275115, "reward_total_mean": 0.09496261179447174, "reward_meter_mean": 0.1176612600684166, "reward_meter_std": 0.1472979336977005, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.970588207244873, "reward_lexical_plausibility_std": 0.05446000397205353, "reward_repeat_penalty_mean": 0.7320075631141663, "reward_repeat_penalty_std": 0.050890251994132996, "reward_repeat_floor_mean": 0.9814015626907349, "reward_repeat_floor_std": 0.010178063064813614, "reward_near_duplicate_penalty_mean": 0.9760100841522217, "reward_near_duplicate_penalty_std": 0.06785368919372559, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7762500047683716, "reward_judge_quality_std": 0.30500292778015137, "reward_total_composite_mean": 0.09496261179447174, "reward_total_composite_std": 0.13875754177570343} {"timestamp_utc": "2026-04-12T16:22:35Z", "mode": "train", "global_step": 120, "epoch": 0.006315457081206253, "loss": 0.0361, "grad_norm": 11.578890800476074, "learning_rate": 9.63939393939394e-06, "num_tokens": 229648.0, "completions/mean_length": 55.125, "completions/min_length": 44.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.125, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.5034680962562561, "rewards/meter/std": 0.40532049536705017, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.908367395401001, "rewards/lexical_plausibility/std": 0.16053621470928192, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.9956713914871216, "rewards/repeat_penalty/std": 0.008281382732093334, "rewards/repeat_floor/mean": 0.9993507266044617, "rewards/repeat_floor/std": 0.0012422117870301008, "rewards/near_duplicate_penalty/mean": 0.9956713914871216, "rewards/near_duplicate_penalty/std": 0.008281382732093334, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15261298418045044, "rewards/total_composite/std": 0.1726185828447342, "reward": 0.15261298418045044, "reward_std": 0.17261859774589539, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22696611285209656, "sampling/sampling_logp_difference/max": 1.343881607055664, "sampling/importance_sampling_ratio/min": 0.2608312666416168, "sampling/importance_sampling_ratio/mean": 1.028020977973938, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.654230237007141, "clip_ratio/low_mean": 0.13845311105251312, "clip_ratio/low_min": 0.13845311105251312, "clip_ratio/high_mean": 0.05308493785560131, "clip_ratio/high_max": 0.05308493785560131, "clip_ratio/region_mean": 0.19153804890811443, "reward_total_mean": 0.15261298418045044, "reward_meter_mean": 0.5034680962562561, "reward_meter_std": 0.40532049536705017, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.908367395401001, "reward_lexical_plausibility_std": 0.16053621470928192, "reward_repeat_penalty_mean": 0.9956713914871216, "reward_repeat_penalty_std": 0.008281382732093334, "reward_repeat_floor_mean": 0.9993507266044617, "reward_repeat_floor_std": 0.0012422117870301008, "reward_near_duplicate_penalty_mean": 0.9956713914871216, "reward_near_duplicate_penalty_std": 0.008281382732093334, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.15261298418045044, "reward_total_composite_std": 0.1726185828447342} {"timestamp_utc": "2026-04-12T16:22:48Z", "mode": "train", "global_step": 121, "epoch": 0.006368085890216304, "loss": 0.0606, "grad_norm": 5.397149085998535, "learning_rate": 9.636363636363638e-06, "num_tokens": 233918.0, "completions/mean_length": 301.75, "completions/min_length": 158.0, "completions/max_length": 381.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 301.75, "completions/min_terminated_length": 158.0, "completions/max_terminated_length": 381.0, "rewards/meter/mean": 0.22918570041656494, "rewards/meter/std": 0.12608183920383453, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.13849148154258728, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9374999403953552, "rewards/count_floor/std": 0.041547439992427826, "rewards/lexical_plausibility/mean": 0.8940296173095703, "rewards/lexical_plausibility/std": 0.11361392587423325, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.053452249616384506, "rewards/repeat_penalty/mean": 0.9928607940673828, "rewards/repeat_penalty/std": 0.011244257912039757, "rewards/repeat_floor/mean": 0.9992445707321167, "rewards/repeat_floor/std": 0.0010756528936326504, "rewards/near_duplicate_penalty/mean": 0.9981446266174316, "rewards/near_duplicate_penalty/std": 0.0015453349333256483, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9946988821029663, "rewards/distinct_2/std": 0.010371833108365536, "rewards/total_composite/mean": 0.033423878252506256, "rewards/total_composite/std": 0.026064569130539894, "reward": 0.033423878252506256, "reward_std": 0.026064569130539894, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22285933792591095, "sampling/sampling_logp_difference/max": 1.6598758697509766, "sampling/importance_sampling_ratio/min": 0.19016258418560028, "sampling/importance_sampling_ratio/mean": 1.0520243644714355, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.5553068220615387, "clip_ratio/low_mean": 0.07398652471601963, "clip_ratio/low_min": 0.07398652471601963, "clip_ratio/high_mean": 0.09162890538573265, "clip_ratio/high_max": 0.09162890538573265, "clip_ratio/region_mean": 0.16561543010175228, "reward_total_mean": 0.033423878252506256, "reward_meter_mean": 0.22918570041656494, "reward_meter_std": 0.12608183920383453, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.13849148154258728, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9374999403953552, "reward_count_floor_std": 0.041547439992427826, "reward_lexical_plausibility_mean": 0.8940296173095703, "reward_lexical_plausibility_std": 0.11361392587423325, "reward_repeat_penalty_mean": 0.9928607940673828, "reward_repeat_penalty_std": 0.011244257912039757, "reward_repeat_floor_mean": 0.9992445707321167, "reward_repeat_floor_std": 0.0010756528936326504, "reward_near_duplicate_penalty_mean": 0.9981446266174316, "reward_near_duplicate_penalty_std": 0.0015453349333256483, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9946988821029663, "reward_distinct_2_std": 0.010371833108365536, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.053452249616384506, "reward_total_composite_mean": 0.033423878252506256, "reward_total_composite_std": 0.026064569130539894} {"timestamp_utc": "2026-04-12T16:23:00Z", "mode": "train", "global_step": 122, "epoch": 0.006420714699226357, "loss": 0.1563, "grad_norm": 7.213613510131836, "learning_rate": 9.633333333333335e-06, "num_tokens": 236969.0, "completions/mean_length": 197.375, "completions/min_length": 146.0, "completions/max_length": 332.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 197.375, "completions/min_terminated_length": 146.0, "completions/max_terminated_length": 332.0, "rewards/meter/mean": 0.33072274923324585, "rewards/meter/std": 0.33584359288215637, "rewards/count_adherence/mean": 0.8928571939468384, "rewards/count_adherence/std": 0.06613000482320786, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9678571224212646, "rewards/count_floor/std": 0.01983901485800743, "rewards/lexical_plausibility/mean": 0.9770627021789551, "rewards/lexical_plausibility/std": 0.0626121461391449, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9937963485717773, "rewards/repeat_penalty/std": 0.005309552885591984, "rewards/repeat_floor/mean": 0.9991875886917114, "rewards/repeat_floor/std": 0.0005017775110900402, "rewards/near_duplicate_penalty/mean": 0.9957737922668457, "rewards/near_duplicate_penalty/std": 0.00208354857750237, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.998017430305481, "rewards/distinct_2/std": 0.0056075118482112885, "rewards/total_composite/mean": 0.12869678437709808, "rewards/total_composite/std": 0.13592872023582458, "reward": 0.12869678437709808, "reward_std": 0.13592872023582458, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24395523965358734, "sampling/sampling_logp_difference/max": 2.389272451400757, "sampling/importance_sampling_ratio/min": 0.0916963741183281, "sampling/importance_sampling_ratio/mean": 1.0517562627792358, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.2598190009593964, "clip_ratio/low_mean": 0.11706330999732018, "clip_ratio/low_min": 0.11706330999732018, "clip_ratio/high_mean": 0.08133545145392418, "clip_ratio/high_max": 0.08133545145392418, "clip_ratio/region_mean": 0.19839876145124435, "reward_total_mean": 0.12869678437709808, "reward_meter_mean": 0.33072274923324585, "reward_meter_std": 0.33584359288215637, "reward_count_adherence_mean": 0.8928571939468384, "reward_count_adherence_std": 0.06613000482320786, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9678571224212646, "reward_count_floor_std": 0.01983901485800743, "reward_lexical_plausibility_mean": 0.9770627021789551, "reward_lexical_plausibility_std": 0.0626121461391449, "reward_repeat_penalty_mean": 0.9937963485717773, "reward_repeat_penalty_std": 0.005309552885591984, "reward_repeat_floor_mean": 0.9991875886917114, "reward_repeat_floor_std": 0.0005017775110900402, "reward_near_duplicate_penalty_mean": 0.9957737922668457, "reward_near_duplicate_penalty_std": 0.00208354857750237, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.998017430305481, "reward_distinct_2_std": 0.0056075118482112885, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.12869678437709808, "reward_total_composite_std": 0.13592872023582458} {"timestamp_utc": "2026-04-12T16:23:11Z", "mode": "train", "global_step": 123, "epoch": 0.006473343508236409, "loss": -0.006, "grad_norm": 7.073686599731445, "learning_rate": 9.63030303030303e-06, "num_tokens": 239390.0, "completions/mean_length": 132.625, "completions/min_length": 88.0, "completions/max_length": 246.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 132.625, "completions/min_terminated_length": 88.0, "completions/max_terminated_length": 246.0, "rewards/meter/mean": 0.28302252292633057, "rewards/meter/std": 0.3588270843029022, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.29124119877815247, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.08737236261367798, "rewards/lexical_plausibility/mean": 0.9583333134651184, "rewards/lexical_plausibility/std": 0.08147962391376495, "rewards/judge_quality/mean": 0.3412500023841858, "rewards/judge_quality/std": 0.2391316145658493, "rewards/repeat_penalty/mean": 0.9990323185920715, "rewards/repeat_penalty/std": 0.0012910085497424006, "rewards/repeat_floor/mean": 0.9998548626899719, "rewards/repeat_floor/std": 0.00019365194020792842, "rewards/near_duplicate_penalty/mean": 0.9990323185920715, "rewards/near_duplicate_penalty/std": 0.0012910085497424006, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.0783679261803627, "rewards/total_composite/std": 0.11503598839044571, "reward": 0.0783679261803627, "reward_std": 0.11503598093986511, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21352066099643707, "sampling/sampling_logp_difference/max": 1.3450571298599243, "sampling/importance_sampling_ratio/min": 0.26052483916282654, "sampling/importance_sampling_ratio/mean": 1.0447856187820435, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9213546067476273, "clip_ratio/low_mean": 0.14327157847583294, "clip_ratio/low_min": 0.14327157847583294, "clip_ratio/high_mean": 0.051379503682255745, "clip_ratio/high_max": 0.051379503682255745, "clip_ratio/region_mean": 0.19465108215808868, "reward_total_mean": 0.0783679261803627, "reward_meter_mean": 0.28302252292633057, "reward_meter_std": 0.3588270843029022, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.29124119877815247, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.08737236261367798, "reward_lexical_plausibility_mean": 0.9583333134651184, "reward_lexical_plausibility_std": 0.08147962391376495, "reward_repeat_penalty_mean": 0.9990323185920715, "reward_repeat_penalty_std": 0.0012910085497424006, "reward_repeat_floor_mean": 0.9998548626899719, "reward_repeat_floor_std": 0.00019365194020792842, "reward_near_duplicate_penalty_mean": 0.9990323185920715, "reward_near_duplicate_penalty_std": 0.0012910085497424006, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3412500023841858, "reward_judge_quality_std": 0.2391316145658493, "reward_total_composite_mean": 0.0783679261803627, "reward_total_composite_std": 0.11503598839044571} {"timestamp_utc": "2026-04-12T16:23:20Z", "mode": "train", "global_step": 124, "epoch": 0.0065259723172464605, "loss": 0.1116, "grad_norm": 18.304222106933594, "learning_rate": 9.627272727272728e-06, "num_tokens": 240881.0, "completions/mean_length": 48.375, "completions/min_length": 42.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.375, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.25827205181121826, "rewards/meter/std": 0.3599354922771454, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9861021041870117, "rewards/lexical_plausibility/std": 0.03930910304188728, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.24136146903038025, "rewards/repeat_penalty/mean": 0.9810866117477417, "rewards/repeat_penalty/std": 0.02608991600573063, "rewards/repeat_floor/mean": 0.9971629977226257, "rewards/repeat_floor/std": 0.003913478925824165, "rewards/near_duplicate_penalty/mean": 0.9810866117477417, "rewards/near_duplicate_penalty/std": 0.02608991600573063, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1445094496011734, "rewards/total_composite/std": 0.2417820245027542, "reward": 0.1445094496011734, "reward_std": 0.24178199470043182, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22063003480434418, "sampling/sampling_logp_difference/max": 1.8402786254882812, "sampling/importance_sampling_ratio/min": 0.15877318382263184, "sampling/importance_sampling_ratio/mean": 1.0315083265304565, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4374092072248459, "clip_ratio/low_mean": 0.17583125084638596, "clip_ratio/low_min": 0.17583125084638596, "clip_ratio/high_mean": 0.06101190485060215, "clip_ratio/high_max": 0.06101190485060215, "clip_ratio/region_mean": 0.2368431556969881, "reward_total_mean": 0.1445094496011734, "reward_meter_mean": 0.25827205181121826, "reward_meter_std": 0.3599354922771454, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9861021041870117, "reward_lexical_plausibility_std": 0.03930910304188728, "reward_repeat_penalty_mean": 0.9810866117477417, "reward_repeat_penalty_std": 0.02608991600573063, "reward_repeat_floor_mean": 0.9971629977226257, "reward_repeat_floor_std": 0.003913478925824165, "reward_near_duplicate_penalty_mean": 0.9810866117477417, "reward_near_duplicate_penalty_std": 0.02608991600573063, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.24136146903038025, "reward_total_composite_mean": 0.1445094496011734, "reward_total_composite_std": 0.2417820245027542} {"timestamp_utc": "2026-04-12T16:23:29Z", "mode": "train", "global_step": 125, "epoch": 0.006578601126256513, "loss": -0.1071, "grad_norm": 17.003002166748047, "learning_rate": 9.624242424242425e-06, "num_tokens": 242305.0, "completions/mean_length": 25.0, "completions/min_length": 16.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.0, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.551611065864563, "rewards/meter/std": 0.42970213294029236, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.801948070526123, "rewards/lexical_plausibility/std": 0.14781975746154785, "rewards/judge_quality/mean": 0.5712499618530273, "rewards/judge_quality/std": 0.31921499967575073, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.38685962557792664, "rewards/total_composite/std": 0.40095359086990356, "reward": 0.38685962557792664, "reward_std": 0.40095359086990356, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21530112624168396, "sampling/sampling_logp_difference/max": 1.3130431175231934, "sampling/importance_sampling_ratio/min": 0.26900020241737366, "sampling/importance_sampling_ratio/mean": 1.0635402202606201, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5896531641483307, "clip_ratio/low_mean": 0.09175990149378777, "clip_ratio/low_min": 0.09175990149378777, "clip_ratio/high_mean": 0.04286616249009967, "clip_ratio/high_max": 0.04286616249009967, "clip_ratio/region_mean": 0.13462606398388743, "reward_total_mean": 0.38685962557792664, "reward_meter_mean": 0.551611065864563, "reward_meter_std": 0.42970213294029236, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.801948070526123, "reward_lexical_plausibility_std": 0.14781975746154785, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5712499618530273, "reward_judge_quality_std": 0.31921499967575073, "reward_total_composite_mean": 0.38685962557792664, "reward_total_composite_std": 0.40095359086990356} {"timestamp_utc": "2026-04-12T16:23:42Z", "mode": "train", "global_step": 126, "epoch": 0.0066312299352665645, "loss": 0.0092, "grad_norm": 12.127283096313477, "learning_rate": 9.621212121212122e-06, "num_tokens": 244523.0, "completions/mean_length": 99.25, "completions/min_length": 66.0, "completions/max_length": 118.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 99.25, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.28973257541656494, "rewards/meter/std": 0.2882465124130249, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9866727590560913, "rewards/lexical_plausibility/std": 0.02516147866845131, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.977553129196167, "rewards/repeat_penalty/std": 0.02701600268483162, "rewards/repeat_floor/mean": 0.9974371194839478, "rewards/repeat_floor/std": 0.0029925296548753977, "rewards/near_duplicate_penalty/mean": 0.991321325302124, "rewards/near_duplicate_penalty/std": 0.009695005603134632, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9859883785247803, "rewards/distinct_2/std": 0.01951143704354763, "rewards/total_composite/mean": 0.10840226709842682, "rewards/total_composite/std": 0.13197503983974457, "reward": 0.10840226709842682, "reward_std": 0.13197503983974457, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24986715614795685, "sampling/sampling_logp_difference/max": 1.5561456680297852, "sampling/importance_sampling_ratio/min": 0.21094755828380585, "sampling/importance_sampling_ratio/mean": 1.066483974456787, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9682925045490265, "clip_ratio/low_mean": 0.1341007500886917, "clip_ratio/low_min": 0.1341007500886917, "clip_ratio/high_mean": 0.07857861742377281, "clip_ratio/high_max": 0.07857861742377281, "clip_ratio/region_mean": 0.21267936751246452, "reward_total_mean": 0.10840226709842682, "reward_meter_mean": 0.28973257541656494, "reward_meter_std": 0.2882465124130249, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9866727590560913, "reward_lexical_plausibility_std": 0.02516147866845131, "reward_repeat_penalty_mean": 0.977553129196167, "reward_repeat_penalty_std": 0.02701600268483162, "reward_repeat_floor_mean": 0.9974371194839478, "reward_repeat_floor_std": 0.0029925296548753977, "reward_near_duplicate_penalty_mean": 0.991321325302124, "reward_near_duplicate_penalty_std": 0.009695005603134632, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9859883785247803, "reward_distinct_2_std": 0.01951143704354763, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.10840226709842682, "reward_total_composite_std": 0.13197503983974457} {"timestamp_utc": "2026-04-12T16:23:50Z", "mode": "train", "global_step": 127, "epoch": 0.006683858744276617, "loss": -0.1594, "grad_norm": 22.551822662353516, "learning_rate": 9.61818181818182e-06, "num_tokens": 246024.0, "completions/mean_length": 18.625, "completions/min_length": 14.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.625, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.35911935567855835, "rewards/meter/std": 0.4125699996948242, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9397977590560913, "rewards/lexical_plausibility/std": 0.09944810718297958, "rewards/judge_quality/mean": 0.3087500035762787, "rewards/judge_quality/std": 0.2728912830352783, "rewards/repeat_penalty/mean": 0.7033942937850952, "rewards/repeat_penalty/std": 0.08695917576551437, "rewards/repeat_floor/mean": 0.9779176115989685, "rewards/repeat_floor/std": 0.013899269513785839, "rewards/near_duplicate_penalty/mean": 0.9800275564193726, "rewards/near_duplicate_penalty/std": 0.053229887038469315, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9545940160751343, "rewards/distinct_2/std": 0.08426927030086517, "rewards/total_composite/mean": 0.07746857404708862, "rewards/total_composite/std": 0.11463268101215363, "reward": 0.07746857404708862, "reward_std": 0.11463267356157303, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19300872087478638, "sampling/sampling_logp_difference/max": 1.3846263885498047, "sampling/importance_sampling_ratio/min": 0.2504173517227173, "sampling/importance_sampling_ratio/mean": 1.0627801418304443, "sampling/importance_sampling_ratio/max": 1.9003657102584839, "entropy": 2.346334755420685, "clip_ratio/low_mean": 0.12997037917375565, "clip_ratio/low_min": 0.12997037917375565, "clip_ratio/high_mean": 0.08439814671874046, "clip_ratio/high_max": 0.08439814671874046, "clip_ratio/region_mean": 0.2143685258924961, "reward_total_mean": 0.07746857404708862, "reward_meter_mean": 0.35911935567855835, "reward_meter_std": 0.4125699996948242, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9397977590560913, "reward_lexical_plausibility_std": 0.09944810718297958, "reward_repeat_penalty_mean": 0.7033942937850952, "reward_repeat_penalty_std": 0.08695917576551437, "reward_repeat_floor_mean": 0.9779176115989685, "reward_repeat_floor_std": 0.013899269513785839, "reward_near_duplicate_penalty_mean": 0.9800275564193726, "reward_near_duplicate_penalty_std": 0.053229887038469315, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9545940160751343, "reward_distinct_2_std": 0.08426927030086517, "reward_judge_quality_mean": 0.3087500035762787, "reward_judge_quality_std": 0.2728912830352783, "reward_total_composite_mean": 0.07746857404708862, "reward_total_composite_std": 0.11463268101215363} {"timestamp_utc": "2026-04-12T16:23:59Z", "mode": "train", "global_step": 128, "epoch": 0.006736487553286669, "loss": 0.1323, "grad_norm": 16.545969009399414, "learning_rate": 9.615151515151517e-06, "num_tokens": 247659.0, "completions/mean_length": 45.375, "completions/min_length": 33.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.375, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.4964056611061096, "rewards/meter/std": 0.4586038589477539, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.512499988079071, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.9968196153640747, "rewards/repeat_penalty/std": 0.005409465171396732, "rewards/repeat_floor/mean": 0.9995229244232178, "rewards/repeat_floor/std": 0.0008114197407849133, "rewards/near_duplicate_penalty/mean": 0.9968196153640747, "rewards/near_duplicate_penalty/std": 0.005409465171396732, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2368769347667694, "rewards/total_composite/std": 0.23428308963775635, "reward": 0.2368769347667694, "reward_std": 0.23428308963775635, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23393887281417847, "sampling/sampling_logp_difference/max": 1.572005271911621, "sampling/importance_sampling_ratio/min": 0.20762839913368225, "sampling/importance_sampling_ratio/mean": 1.0549741983413696, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4049852788448334, "clip_ratio/low_mean": 0.09577205963432789, "clip_ratio/low_min": 0.09577205963432789, "clip_ratio/high_mean": 0.0936755957081914, "clip_ratio/high_max": 0.0936755957081914, "clip_ratio/region_mean": 0.18944765534251928, "reward_total_mean": 0.2368769347667694, "reward_meter_mean": 0.4964056611061096, "reward_meter_std": 0.4586038589477539, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9968196153640747, "reward_repeat_penalty_std": 0.005409465171396732, "reward_repeat_floor_mean": 0.9995229244232178, "reward_repeat_floor_std": 0.0008114197407849133, "reward_near_duplicate_penalty_mean": 0.9968196153640747, "reward_near_duplicate_penalty_std": 0.005409465171396732, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.512499988079071, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.2368769347667694, "reward_total_composite_std": 0.23428308963775635} {"timestamp_utc": "2026-04-12T16:24:08Z", "mode": "train", "global_step": 129, "epoch": 0.006789116362296721, "loss": 0.206, "grad_norm": 17.825443267822266, "learning_rate": 9.612121212121212e-06, "num_tokens": 249076.0, "completions/mean_length": 33.125, "completions/min_length": 19.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.125, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.5484859943389893, "rewards/meter/std": 0.36270710825920105, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.2639264166355133, "rewards/repeat_penalty/mean": 0.9728013277053833, "rewards/repeat_penalty/std": 0.04434370622038841, "rewards/repeat_floor/mean": 0.996694803237915, "rewards/repeat_floor/std": 0.004625349305570126, "rewards/near_duplicate_penalty/mean": 0.9862070083618164, "rewards/near_duplicate_penalty/std": 0.014626423828303814, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9862637519836426, "rewards/distinct_2/std": 0.0388520210981369, "rewards/total_composite/mean": 0.26354318857192993, "rewards/total_composite/std": 0.2759113609790802, "reward": 0.26354318857192993, "reward_std": 0.2759113311767578, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20456117391586304, "sampling/sampling_logp_difference/max": 1.6085231304168701, "sampling/importance_sampling_ratio/min": 0.20018304884433746, "sampling/importance_sampling_ratio/mean": 0.9972600936889648, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3621015101671219, "clip_ratio/low_mean": 0.12675178702920675, "clip_ratio/low_min": 0.12675178702920675, "clip_ratio/high_mean": 0.08021616749465466, "clip_ratio/high_max": 0.08021616749465466, "clip_ratio/region_mean": 0.2069679545238614, "reward_total_mean": 0.26354318857192993, "reward_meter_mean": 0.5484859943389893, "reward_meter_std": 0.36270710825920105, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9728013277053833, "reward_repeat_penalty_std": 0.04434370622038841, "reward_repeat_floor_mean": 0.996694803237915, "reward_repeat_floor_std": 0.004625349305570126, "reward_near_duplicate_penalty_mean": 0.9862070083618164, "reward_near_duplicate_penalty_std": 0.014626423828303814, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9862637519836426, "reward_distinct_2_std": 0.0388520210981369, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.2639264166355133, "reward_total_composite_mean": 0.26354318857192993, "reward_total_composite_std": 0.2759113609790802} {"timestamp_utc": "2026-04-12T16:24:18Z", "mode": "train", "global_step": 130, "epoch": 0.006841745171306773, "loss": 0.0948, "grad_norm": 13.174181938171387, "learning_rate": 9.60909090909091e-06, "num_tokens": 250797.0, "completions/mean_length": 61.125, "completions/min_length": 50.0, "completions/max_length": 84.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.125, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.3797729015350342, "rewards/meter/std": 0.27309468388557434, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.993243932723999, "rewards/repeat_penalty/std": 0.0058365557342767715, "rewards/repeat_floor/mean": 0.9989866018295288, "rewards/repeat_floor/std": 0.0008754919399507344, "rewards/near_duplicate_penalty/mean": 0.993243932723999, "rewards/near_duplicate_penalty/std": 0.0058365557342767715, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14400315284729004, "rewards/total_composite/std": 0.10686323046684265, "reward": 0.14400315284729004, "reward_std": 0.10686323791742325, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21904681622982025, "sampling/sampling_logp_difference/max": 2.2688913345336914, "sampling/importance_sampling_ratio/min": 0.10342678427696228, "sampling/importance_sampling_ratio/mean": 1.0242271423339844, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2305078506469727, "clip_ratio/low_mean": 0.09416982345283031, "clip_ratio/low_min": 0.09416982345283031, "clip_ratio/high_mean": 0.08246147818863392, "clip_ratio/high_max": 0.08246147818863392, "clip_ratio/region_mean": 0.17663130164146423, "reward_total_mean": 0.14400315284729004, "reward_meter_mean": 0.3797729015350342, "reward_meter_std": 0.27309468388557434, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.993243932723999, "reward_repeat_penalty_std": 0.0058365557342767715, "reward_repeat_floor_mean": 0.9989866018295288, "reward_repeat_floor_std": 0.0008754919399507344, "reward_near_duplicate_penalty_mean": 0.993243932723999, "reward_near_duplicate_penalty_std": 0.0058365557342767715, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.14400315284729004, "reward_total_composite_std": 0.10686323046684265} {"timestamp_utc": "2026-04-12T16:24:28Z", "mode": "train", "global_step": 131, "epoch": 0.006894373980316826, "loss": -0.0146, "grad_norm": 8.176576614379883, "learning_rate": 9.606060606060607e-06, "num_tokens": 253173.0, "completions/mean_length": 112.0, "completions/min_length": 63.0, "completions/max_length": 159.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 112.0, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 159.0, "rewards/meter/mean": 0.5862672328948975, "rewards/meter/std": 0.4476952850818634, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.07763238251209259, "rewards/lexical_plausibility/mean": 0.984375, "rewards/lexical_plausibility/std": 0.04419417306780815, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9982891082763672, "rewards/repeat_penalty/std": 0.0020285688806325197, "rewards/repeat_floor/mean": 0.9997433423995972, "rewards/repeat_floor/std": 0.00030428983154706657, "rewards/near_duplicate_penalty/mean": 0.9982891082763672, "rewards/near_duplicate_penalty/std": 0.0020285688806325197, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21008649468421936, "rewards/total_composite/std": 0.1683793067932129, "reward": 0.21008649468421936, "reward_std": 0.1683792918920517, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20571686327457428, "sampling/sampling_logp_difference/max": 1.4152746200561523, "sampling/importance_sampling_ratio/min": 0.2428589165210724, "sampling/importance_sampling_ratio/mean": 1.0346027612686157, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.915090709924698, "clip_ratio/low_mean": 0.0838995985686779, "clip_ratio/low_min": 0.0838995985686779, "clip_ratio/high_mean": 0.10998196713626385, "clip_ratio/high_max": 0.10998196713626385, "clip_ratio/region_mean": 0.19388156570494175, "reward_total_mean": 0.21008649468421936, "reward_meter_mean": 0.5862672328948975, "reward_meter_std": 0.4476952850818634, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.07763238251209259, "reward_lexical_plausibility_mean": 0.984375, "reward_lexical_plausibility_std": 0.04419417306780815, "reward_repeat_penalty_mean": 0.9982891082763672, "reward_repeat_penalty_std": 0.0020285688806325197, "reward_repeat_floor_mean": 0.9997433423995972, "reward_repeat_floor_std": 0.00030428983154706657, "reward_near_duplicate_penalty_mean": 0.9982891082763672, "reward_near_duplicate_penalty_std": 0.0020285688806325197, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.21008649468421936, "reward_total_composite_std": 0.1683793067932129} {"timestamp_utc": "2026-04-12T16:24:37Z", "mode": "train", "global_step": 132, "epoch": 0.006947002789326877, "loss": 0.0517, "grad_norm": 14.145821571350098, "learning_rate": 9.603030303030304e-06, "num_tokens": 254954.0, "completions/mean_length": 47.625, "completions/min_length": 36.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.625, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.7534605264663696, "rewards/meter/std": 0.4120592474937439, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9898897409439087, "rewards/lexical_plausibility/std": 0.028596237301826477, "rewards/judge_quality/mean": 0.5799999833106995, "rewards/judge_quality/std": 0.24395550787448883, "rewards/repeat_penalty/mean": 0.9879139065742493, "rewards/repeat_penalty/std": 0.0105670765042305, "rewards/repeat_floor/mean": 0.9981870651245117, "rewards/repeat_floor/std": 0.0015850637573748827, "rewards/near_duplicate_penalty/mean": 0.9879139065742493, "rewards/near_duplicate_penalty/std": 0.0105670765042305, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4782547950744629, "rewards/total_composite/std": 0.34520453214645386, "reward": 0.4782547950744629, "reward_std": 0.34520453214645386, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20471051335334778, "sampling/sampling_logp_difference/max": 1.7622137069702148, "sampling/importance_sampling_ratio/min": 0.17166441679000854, "sampling/importance_sampling_ratio/mean": 1.0301520824432373, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.475692719221115, "clip_ratio/low_mean": 0.09087053965777159, "clip_ratio/low_min": 0.09087053965777159, "clip_ratio/high_mean": 0.07378472201526165, "clip_ratio/high_max": 0.07378472201526165, "clip_ratio/region_mean": 0.16465526167303324, "reward_total_mean": 0.4782547950744629, "reward_meter_mean": 0.7534605264663696, "reward_meter_std": 0.4120592474937439, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9898897409439087, "reward_lexical_plausibility_std": 0.028596237301826477, "reward_repeat_penalty_mean": 0.9879139065742493, "reward_repeat_penalty_std": 0.0105670765042305, "reward_repeat_floor_mean": 0.9981870651245117, "reward_repeat_floor_std": 0.0015850637573748827, "reward_near_duplicate_penalty_mean": 0.9879139065742493, "reward_near_duplicate_penalty_std": 0.0105670765042305, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5799999833106995, "reward_judge_quality_std": 0.24395550787448883, "reward_total_composite_mean": 0.4782547950744629, "reward_total_composite_std": 0.34520453214645386} {"timestamp_utc": "2026-04-12T16:24:46Z", "mode": "train", "global_step": 133, "epoch": 0.0069996315983369296, "loss": 0.0629, "grad_norm": 19.718576431274414, "learning_rate": 9.600000000000001e-06, "num_tokens": 256310.0, "completions/mean_length": 18.5, "completions/min_length": 13.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.5, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.4098302721977234, "rewards/meter/std": 0.44320231676101685, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9459689855575562, "rewards/lexical_plausibility/std": 0.12943005561828613, "rewards/judge_quality/mean": 0.29625001549720764, "rewards/judge_quality/std": 0.26773855090141296, "rewards/repeat_penalty/mean": 0.7464906573295593, "rewards/repeat_penalty/std": 0.009925962425768375, "rewards/repeat_floor/mean": 0.9842981100082397, "rewards/repeat_floor/std": 0.0019852009136229753, "rewards/near_duplicate_penalty/mean": 0.9953208565711975, "rewards/near_duplicate_penalty/std": 0.013234616257250309, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14574924111366272, "rewards/total_composite/std": 0.272583931684494, "reward": 0.14574924111366272, "reward_std": 0.272583931684494, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24437402188777924, "sampling/sampling_logp_difference/max": 0.9934263229370117, "sampling/importance_sampling_ratio/min": 0.37030574679374695, "sampling/importance_sampling_ratio/mean": 1.0548073053359985, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.498630940914154, "clip_ratio/low_mean": 0.15323186246678233, "clip_ratio/low_min": 0.15323186246678233, "clip_ratio/high_mean": 0.02777777798473835, "clip_ratio/high_max": 0.02777777798473835, "clip_ratio/region_mean": 0.18100964045152068, "reward_total_mean": 0.14574924111366272, "reward_meter_mean": 0.4098302721977234, "reward_meter_std": 0.44320231676101685, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9459689855575562, "reward_lexical_plausibility_std": 0.12943005561828613, "reward_repeat_penalty_mean": 0.7464906573295593, "reward_repeat_penalty_std": 0.009925962425768375, "reward_repeat_floor_mean": 0.9842981100082397, "reward_repeat_floor_std": 0.0019852009136229753, "reward_near_duplicate_penalty_mean": 0.9953208565711975, "reward_near_duplicate_penalty_std": 0.013234616257250309, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.29625001549720764, "reward_judge_quality_std": 0.26773855090141296, "reward_total_composite_mean": 0.14574924111366272, "reward_total_composite_std": 0.272583931684494} {"timestamp_utc": "2026-04-12T16:24:55Z", "mode": "train", "global_step": 134, "epoch": 0.007052260407346982, "loss": 0.1667, "grad_norm": 12.369037628173828, "learning_rate": 9.596969696969699e-06, "num_tokens": 257969.0, "completions/mean_length": 45.375, "completions/min_length": 30.0, "completions/max_length": 58.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.375, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.37220871448516846, "rewards/meter/std": 0.42236220836639404, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9910990595817566, "rewards/lexical_plausibility/std": 0.02517561987042427, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.25670650601387024, "rewards/repeat_penalty/mean": 0.9431490302085876, "rewards/repeat_penalty/std": 0.08836318552494049, "rewards/repeat_floor/mean": 0.9942848682403564, "rewards/repeat_floor/std": 0.007260276470333338, "rewards/near_duplicate_penalty/mean": 0.9743990302085876, "rewards/near_duplicate_penalty/std": 0.04271058738231659, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13243892788887024, "rewards/total_composite/std": 0.1523837298154831, "reward": 0.13243892788887024, "reward_std": 0.1523837149143219, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21118704974651337, "sampling/sampling_logp_difference/max": 1.2088298797607422, "sampling/importance_sampling_ratio/min": 0.2985464036464691, "sampling/importance_sampling_ratio/mean": 1.0220602750778198, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.166370913386345, "clip_ratio/low_mean": 0.12005884945392609, "clip_ratio/low_min": 0.12005884945392609, "clip_ratio/high_mean": 0.07563676871359348, "clip_ratio/high_max": 0.07563676871359348, "clip_ratio/region_mean": 0.19569561816751957, "reward_total_mean": 0.13243892788887024, "reward_meter_mean": 0.37220871448516846, "reward_meter_std": 0.42236220836639404, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9910990595817566, "reward_lexical_plausibility_std": 0.02517561987042427, "reward_repeat_penalty_mean": 0.9431490302085876, "reward_repeat_penalty_std": 0.08836318552494049, "reward_repeat_floor_mean": 0.9942848682403564, "reward_repeat_floor_std": 0.007260276470333338, "reward_near_duplicate_penalty_mean": 0.9743990302085876, "reward_near_duplicate_penalty_std": 0.04271058738231659, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.25670650601387024, "reward_total_composite_mean": 0.13243892788887024, "reward_total_composite_std": 0.1523837298154831} {"timestamp_utc": "2026-04-12T16:25:04Z", "mode": "train", "global_step": 135, "epoch": 0.0071048892163570335, "loss": 0.0681, "grad_norm": 11.468616485595703, "learning_rate": 9.593939393939394e-06, "num_tokens": 259663.0, "completions/mean_length": 48.75, "completions/min_length": 40.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.75, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.6985104084014893, "rewards/meter/std": 0.3451581299304962, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6387500166893005, "rewards/judge_quality/std": 0.2994489371776581, "rewards/repeat_penalty/mean": 0.9809602499008179, "rewards/repeat_penalty/std": 0.017124870792031288, "rewards/repeat_floor/mean": 0.9971440434455872, "rewards/repeat_floor/std": 0.00256872596219182, "rewards/near_duplicate_penalty/mean": 0.9809602499008179, "rewards/near_duplicate_penalty/std": 0.017124870792031288, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.510533332824707, "rewards/total_composite/std": 0.35021281242370605, "reward": 0.510533332824707, "reward_std": 0.35021281242370605, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17869427800178528, "sampling/sampling_logp_difference/max": 1.879021167755127, "sampling/importance_sampling_ratio/min": 0.1527395397424698, "sampling/importance_sampling_ratio/mean": 1.0203851461410522, "sampling/importance_sampling_ratio/max": 1.786812663078308, "entropy": 1.7431702762842178, "clip_ratio/low_mean": 0.0785891329869628, "clip_ratio/low_min": 0.0785891329869628, "clip_ratio/high_mean": 0.061967531219124794, "clip_ratio/high_max": 0.061967531219124794, "clip_ratio/region_mean": 0.1405566642060876, "reward_total_mean": 0.510533332824707, "reward_meter_mean": 0.6985104084014893, "reward_meter_std": 0.3451581299304962, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9809602499008179, "reward_repeat_penalty_std": 0.017124870792031288, "reward_repeat_floor_mean": 0.9971440434455872, "reward_repeat_floor_std": 0.00256872596219182, "reward_near_duplicate_penalty_mean": 0.9809602499008179, "reward_near_duplicate_penalty_std": 0.017124870792031288, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6387500166893005, "reward_judge_quality_std": 0.2994489371776581, "reward_total_composite_mean": 0.510533332824707, "reward_total_composite_std": 0.35021281242370605} {"timestamp_utc": "2026-04-12T16:25:18Z", "mode": "train", "global_step": 136, "epoch": 0.007157518025367086, "loss": 0.1192, "grad_norm": 5.362037658691406, "learning_rate": 9.590909090909091e-06, "num_tokens": 262090.0, "completions/mean_length": 199.375, "completions/min_length": 88.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 154.71429443359375, "completions/min_terminated_length": 88.0, "completions/max_terminated_length": 403.0, "rewards/meter/mean": 0.526153564453125, "rewards/meter/std": 0.3998994529247284, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.38816189765930176, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.11644857376813889, "rewards/lexical_plausibility/mean": 0.9769138693809509, "rewards/lexical_plausibility/std": 0.041646022349596024, "rewards/judge_quality/mean": 0.19374999403953552, "rewards/judge_quality/std": 0.13999362289905548, "rewards/repeat_penalty/mean": 0.9327306747436523, "rewards/repeat_penalty/std": 0.09829148650169373, "rewards/repeat_floor/mean": 0.9942677021026611, "rewards/repeat_floor/std": 0.007390270940959454, "rewards/near_duplicate_penalty/mean": 0.9916704893112183, "rewards/near_duplicate_penalty/std": 0.01151853334158659, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9710232019424438, "rewards/distinct_2/std": 0.04885513335466385, "rewards/total_composite/mean": 0.11389347165822983, "rewards/total_composite/std": 0.13071997463703156, "reward": 0.11389347165822983, "reward_std": 0.13071998953819275, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23406687378883362, "sampling/sampling_logp_difference/max": 1.371506690979004, "sampling/importance_sampling_ratio/min": 0.2537243664264679, "sampling/importance_sampling_ratio/mean": 1.0817837715148926, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9461817145347595, "clip_ratio/low_mean": 0.11688897851854563, "clip_ratio/low_min": 0.11688897851854563, "clip_ratio/high_mean": 0.046653544530272484, "clip_ratio/high_max": 0.046653544530272484, "clip_ratio/region_mean": 0.1635425230488181, "reward_total_mean": 0.11389347165822983, "reward_meter_mean": 0.526153564453125, "reward_meter_std": 0.3998994529247284, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.38816189765930176, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.11644857376813889, "reward_lexical_plausibility_mean": 0.9769138693809509, "reward_lexical_plausibility_std": 0.041646022349596024, "reward_repeat_penalty_mean": 0.9327306747436523, "reward_repeat_penalty_std": 0.09829148650169373, "reward_repeat_floor_mean": 0.9942677021026611, "reward_repeat_floor_std": 0.007390270940959454, "reward_near_duplicate_penalty_mean": 0.9916704893112183, "reward_near_duplicate_penalty_std": 0.01151853334158659, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9710232019424438, "reward_distinct_2_std": 0.04885513335466385, "reward_judge_quality_mean": 0.19374999403953552, "reward_judge_quality_std": 0.13999362289905548, "reward_total_composite_mean": 0.11389347165822983, "reward_total_composite_std": 0.13071997463703156} {"timestamp_utc": "2026-04-12T16:25:32Z", "mode": "train", "global_step": 137, "epoch": 0.007210146834377138, "loss": 0.0377, "grad_norm": 4.935665130615234, "learning_rate": 9.587878787878789e-06, "num_tokens": 265220.0, "completions/mean_length": 260.25, "completions/min_length": 164.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 224.2857208251953, "completions/min_terminated_length": 164.0, "completions/max_terminated_length": 306.0, "rewards/meter/mean": 0.1846785694360733, "rewards/meter/std": 0.26168984174728394, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.11080066114664078, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.953125, "rewards/count_floor/std": 0.033240195363759995, "rewards/lexical_plausibility/mean": 0.9290204048156738, "rewards/lexical_plausibility/std": 0.18416956067085266, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.09161254018545151, "rewards/repeat_penalty/mean": 0.98967444896698, "rewards/repeat_penalty/std": 0.008269112557172775, "rewards/repeat_floor/mean": 0.9988254308700562, "rewards/repeat_floor/std": 0.0007386037614196539, "rewards/near_duplicate_penalty/mean": 0.9959423542022705, "rewards/near_duplicate_penalty/std": 0.0018977454164996743, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9937118291854858, "rewards/distinct_2/std": 0.008787008002400398, "rewards/total_composite/mean": 0.036731235682964325, "rewards/total_composite/std": 0.06452368944883347, "reward": 0.036731235682964325, "reward_std": 0.06452368944883347, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22951792180538177, "sampling/sampling_logp_difference/max": 1.558380126953125, "sampling/importance_sampling_ratio/min": 0.21047674119472504, "sampling/importance_sampling_ratio/mean": 1.0506075620651245, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.0635197460651398, "clip_ratio/low_mean": 0.10556838102638721, "clip_ratio/low_min": 0.10556838102638721, "clip_ratio/high_mean": 0.0488334558904171, "clip_ratio/high_max": 0.0488334558904171, "clip_ratio/region_mean": 0.1544018369168043, "reward_total_mean": 0.036731235682964325, "reward_meter_mean": 0.1846785694360733, "reward_meter_std": 0.26168984174728394, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.11080066114664078, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.953125, "reward_count_floor_std": 0.033240195363759995, "reward_lexical_plausibility_mean": 0.9290204048156738, "reward_lexical_plausibility_std": 0.18416956067085266, "reward_repeat_penalty_mean": 0.98967444896698, "reward_repeat_penalty_std": 0.008269112557172775, "reward_repeat_floor_mean": 0.9988254308700562, "reward_repeat_floor_std": 0.0007386037614196539, "reward_near_duplicate_penalty_mean": 0.9959423542022705, "reward_near_duplicate_penalty_std": 0.0018977454164996743, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9937118291854858, "reward_distinct_2_std": 0.008787008002400398, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.09161254018545151, "reward_total_composite_mean": 0.036731235682964325, "reward_total_composite_std": 0.06452368944883347} {"timestamp_utc": "2026-04-12T16:25:41Z", "mode": "train", "global_step": 138, "epoch": 0.00726277564338719, "loss": 0.0286, "grad_norm": 15.345233917236328, "learning_rate": 9.584848484848486e-06, "num_tokens": 266887.0, "completions/mean_length": 35.375, "completions/min_length": 32.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.375, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.8309788703918457, "rewards/meter/std": 0.29639732837677, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9928355813026428, "rewards/lexical_plausibility/std": 0.020263994112610817, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.995775580406189, "rewards/repeat_penalty/std": 0.010963790118694305, "rewards/repeat_floor/mean": 0.999366283416748, "rewards/repeat_floor/std": 0.0016445706132799387, "rewards/near_duplicate_penalty/mean": 0.995775580406189, "rewards/near_duplicate_penalty/std": 0.010963790118694305, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.35061946511268616, "rewards/total_composite/std": 0.13179932534694672, "reward": 0.35061946511268616, "reward_std": 0.13179932534694672, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2372082620859146, "sampling/sampling_logp_difference/max": 1.6083354949951172, "sampling/importance_sampling_ratio/min": 0.20022061467170715, "sampling/importance_sampling_ratio/mean": 1.0378944873809814, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.649111896753311, "clip_ratio/low_mean": 0.10363711230456829, "clip_ratio/low_min": 0.10363711230456829, "clip_ratio/high_mean": 0.12226535938680172, "clip_ratio/high_max": 0.12226535938680172, "clip_ratio/region_mean": 0.22590247169137, "reward_total_mean": 0.35061946511268616, "reward_meter_mean": 0.8309788703918457, "reward_meter_std": 0.29639732837677, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9928355813026428, "reward_lexical_plausibility_std": 0.020263994112610817, "reward_repeat_penalty_mean": 0.995775580406189, "reward_repeat_penalty_std": 0.010963790118694305, "reward_repeat_floor_mean": 0.999366283416748, "reward_repeat_floor_std": 0.0016445706132799387, "reward_near_duplicate_penalty_mean": 0.995775580406189, "reward_near_duplicate_penalty_std": 0.010963790118694305, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.35061946511268616, "reward_total_composite_std": 0.13179932534694672} {"timestamp_utc": "2026-04-12T16:25:50Z", "mode": "train", "global_step": 139, "epoch": 0.007315404452397242, "loss": -0.0332, "grad_norm": 23.95005226135254, "learning_rate": 9.581818181818181e-06, "num_tokens": 268312.0, "completions/mean_length": 24.125, "completions/min_length": 17.0, "completions/max_length": 34.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.125, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 34.0, "rewards/meter/mean": 0.3752234876155853, "rewards/meter/std": 0.4822108745574951, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.75, "rewards/hard_gate/std": 0.4629100561141968, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.13887302577495575, "rewards/lexical_plausibility/mean": 0.8075591325759888, "rewards/lexical_plausibility/std": 0.22869481146335602, "rewards/judge_quality/mean": 0.5262500047683716, "rewards/judge_quality/std": 0.3414648175239563, "rewards/repeat_penalty/mean": 0.8125, "rewards/repeat_penalty/std": 0.1157275140285492, "rewards/repeat_floor/mean": 0.9887499809265137, "rewards/repeat_floor/std": 0.0069436440244317055, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3305409252643585, "rewards/total_composite/std": 0.4436834752559662, "reward": 0.3305409252643585, "reward_std": 0.4436834752559662, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2235724776983261, "sampling/sampling_logp_difference/max": 1.3785057067871094, "sampling/importance_sampling_ratio/min": 0.3296750783920288, "sampling/importance_sampling_ratio/mean": 1.0513975620269775, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4279952496290207, "clip_ratio/low_mean": 0.15241304971277714, "clip_ratio/low_min": 0.15241304971277714, "clip_ratio/high_mean": 0.08189449831843376, "clip_ratio/high_max": 0.08189449831843376, "clip_ratio/region_mean": 0.2343075480312109, "reward_total_mean": 0.3305409252643585, "reward_meter_mean": 0.3752234876155853, "reward_meter_std": 0.4822108745574951, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.75, "reward_hard_gate_std": 0.4629100561141968, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.13887302577495575, "reward_lexical_plausibility_mean": 0.8075591325759888, "reward_lexical_plausibility_std": 0.22869481146335602, "reward_repeat_penalty_mean": 0.8125, "reward_repeat_penalty_std": 0.1157275140285492, "reward_repeat_floor_mean": 0.9887499809265137, "reward_repeat_floor_std": 0.0069436440244317055, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5262500047683716, "reward_judge_quality_std": 0.3414648175239563, "reward_total_composite_mean": 0.3305409252643585, "reward_total_composite_std": 0.4436834752559662} {"timestamp_utc": "2026-04-12T16:25:58Z", "mode": "train", "global_step": 140, "epoch": 0.007368033261407295, "loss": 0.0396, "grad_norm": 14.158329010009766, "learning_rate": 9.57878787878788e-06, "num_tokens": 270035.0, "completions/mean_length": 46.375, "completions/min_length": 41.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.375, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.6709508299827576, "rewards/meter/std": 0.42303919792175293, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9716345071792603, "rewards/lexical_plausibility/std": 0.0802297294139862, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.268537700176239, "rewards/repeat_penalty/mean": 0.9590060710906982, "rewards/repeat_penalty/std": 0.10046610981225967, "rewards/repeat_floor/mean": 0.9948601722717285, "rewards/repeat_floor/std": 0.012219909578561783, "rewards/near_duplicate_penalty/mean": 0.980157732963562, "rewards/near_duplicate_penalty/std": 0.04083683714270592, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9759615659713745, "rewards/distinct_2/std": 0.06799104809761047, "rewards/total_composite/mean": 0.23097580671310425, "rewards/total_composite/std": 0.2973477840423584, "reward": 0.23097580671310425, "reward_std": 0.2973477840423584, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.240529403090477, "sampling/sampling_logp_difference/max": 1.2370967864990234, "sampling/importance_sampling_ratio/min": 0.2902255952358246, "sampling/importance_sampling_ratio/mean": 1.0806950330734253, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8457294404506683, "clip_ratio/low_mean": 0.14311196468770504, "clip_ratio/low_min": 0.14311196468770504, "clip_ratio/high_mean": 0.034863551147282124, "clip_ratio/high_max": 0.034863551147282124, "clip_ratio/region_mean": 0.17797551583498716, "reward_total_mean": 0.23097580671310425, "reward_meter_mean": 0.6709508299827576, "reward_meter_std": 0.42303919792175293, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9716345071792603, "reward_lexical_plausibility_std": 0.0802297294139862, "reward_repeat_penalty_mean": 0.9590060710906982, "reward_repeat_penalty_std": 0.10046610981225967, "reward_repeat_floor_mean": 0.9948601722717285, "reward_repeat_floor_std": 0.012219909578561783, "reward_near_duplicate_penalty_mean": 0.980157732963562, "reward_near_duplicate_penalty_std": 0.04083683714270592, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9759615659713745, "reward_distinct_2_std": 0.06799104809761047, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.268537700176239, "reward_total_composite_mean": 0.23097580671310425, "reward_total_composite_std": 0.2973477840423584} {"timestamp_utc": "2026-04-12T16:26:06Z", "mode": "train", "global_step": 141, "epoch": 0.007420662070417346, "loss": 0.1518, "grad_norm": 13.101373672485352, "learning_rate": 9.575757575757576e-06, "num_tokens": 271662.0, "completions/mean_length": 46.375, "completions/min_length": 33.0, "completions/max_length": 76.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.375, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.5712951421737671, "rewards/meter/std": 0.41170933842658997, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9915022850036621, "rewards/repeat_penalty/std": 0.014074904844164848, "rewards/repeat_floor/mean": 0.9987253546714783, "rewards/repeat_floor/std": 0.0021112330723553896, "rewards/near_duplicate_penalty/mean": 0.9915022850036621, "rewards/near_duplicate_penalty/std": 0.014074904844164848, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18343859910964966, "rewards/total_composite/std": 0.14860112965106964, "reward": 0.18343859910964966, "reward_std": 0.14860112965106964, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23140616714954376, "sampling/sampling_logp_difference/max": 1.531193733215332, "sampling/importance_sampling_ratio/min": 0.2162773311138153, "sampling/importance_sampling_ratio/mean": 1.0546079874038696, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.774710536003113, "clip_ratio/low_mean": 0.09014561213552952, "clip_ratio/low_min": 0.09014561213552952, "clip_ratio/high_mean": 0.10207689367234707, "clip_ratio/high_max": 0.10207689367234707, "clip_ratio/region_mean": 0.1922225058078766, "reward_total_mean": 0.18343859910964966, "reward_meter_mean": 0.5712951421737671, "reward_meter_std": 0.41170933842658997, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9915022850036621, "reward_repeat_penalty_std": 0.014074904844164848, "reward_repeat_floor_mean": 0.9987253546714783, "reward_repeat_floor_std": 0.0021112330723553896, "reward_near_duplicate_penalty_mean": 0.9915022850036621, "reward_near_duplicate_penalty_std": 0.014074904844164848, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.18343859910964966, "reward_total_composite_std": 0.14860112965106964} {"timestamp_utc": "2026-04-12T16:26:15Z", "mode": "train", "global_step": 142, "epoch": 0.007473290879427399, "loss": -0.0063, "grad_norm": 15.231253623962402, "learning_rate": 9.572727272727273e-06, "num_tokens": 273390.0, "completions/mean_length": 44.0, "completions/min_length": 36.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.0, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.5280349254608154, "rewards/meter/std": 0.41948628425598145, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5587500333786011, "rewards/judge_quality/std": 0.2158992886543274, "rewards/repeat_penalty/mean": 0.9944033026695251, "rewards/repeat_penalty/std": 0.0121182044968009, "rewards/repeat_floor/mean": 0.9991604685783386, "rewards/repeat_floor/std": 0.001817729091271758, "rewards/near_duplicate_penalty/mean": 0.9944033026695251, "rewards/near_duplicate_penalty/std": 0.0121182044968009, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2706297039985657, "rewards/total_composite/std": 0.2414269894361496, "reward": 0.2706297039985657, "reward_std": 0.2414269894361496, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21337202191352844, "sampling/sampling_logp_difference/max": 1.4742069244384766, "sampling/importance_sampling_ratio/min": 0.22896023094654083, "sampling/importance_sampling_ratio/mean": 1.0421977043151855, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.118324249982834, "clip_ratio/low_mean": 0.10393263585865498, "clip_ratio/low_min": 0.10393263585865498, "clip_ratio/high_mean": 0.07075795065611601, "clip_ratio/high_max": 0.07075795065611601, "clip_ratio/region_mean": 0.17469058651477098, "reward_total_mean": 0.2706297039985657, "reward_meter_mean": 0.5280349254608154, "reward_meter_std": 0.41948628425598145, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9944033026695251, "reward_repeat_penalty_std": 0.0121182044968009, "reward_repeat_floor_mean": 0.9991604685783386, "reward_repeat_floor_std": 0.001817729091271758, "reward_near_duplicate_penalty_mean": 0.9944033026695251, "reward_near_duplicate_penalty_std": 0.0121182044968009, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5587500333786011, "reward_judge_quality_std": 0.2158992886543274, "reward_total_composite_mean": 0.2706297039985657, "reward_total_composite_std": 0.2414269894361496} {"timestamp_utc": "2026-04-12T16:26:29Z", "mode": "train", "global_step": 143, "epoch": 0.007525919688437451, "loss": 0.3349, "grad_norm": 7.965107440948486, "learning_rate": 9.56969696969697e-06, "num_tokens": 275990.0, "completions/mean_length": 145.0, "completions/min_length": 81.0, "completions/max_length": 475.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 145.0, "completions/min_terminated_length": 81.0, "completions/max_terminated_length": 475.0, "rewards/meter/mean": 0.12463633716106415, "rewards/meter/std": 0.11814981698989868, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9718749523162842, "rewards/count_floor/std": 0.05580177903175354, "rewards/lexical_plausibility/mean": 0.9836630821228027, "rewards/lexical_plausibility/std": 0.026990195736289024, "rewards/judge_quality/mean": 0.34999996423721313, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9874579906463623, "rewards/repeat_penalty/std": 0.020340239629149437, "rewards/repeat_floor/mean": 0.9984275698661804, "rewards/repeat_floor/std": 0.00232161907479167, "rewards/near_duplicate_penalty/mean": 0.992782711982727, "rewards/near_duplicate_penalty/std": 0.00817783921957016, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9945576190948486, "rewards/distinct_2/std": 0.013459553010761738, "rewards/total_composite/mean": 0.052760906517505646, "rewards/total_composite/std": 0.0543060302734375, "reward": 0.052760906517505646, "reward_std": 0.0543060265481472, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24614021182060242, "sampling/sampling_logp_difference/max": 1.5540504455566406, "sampling/importance_sampling_ratio/min": 0.21139000356197357, "sampling/importance_sampling_ratio/mean": 1.0575592517852783, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.552743285894394, "clip_ratio/low_mean": 0.11233380064368248, "clip_ratio/low_min": 0.11233380064368248, "clip_ratio/high_mean": 0.07718076556921005, "clip_ratio/high_max": 0.07718076556921005, "clip_ratio/region_mean": 0.18951456621289253, "reward_total_mean": 0.052760906517505646, "reward_meter_mean": 0.12463633716106415, "reward_meter_std": 0.11814981698989868, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9718749523162842, "reward_count_floor_std": 0.05580177903175354, "reward_lexical_plausibility_mean": 0.9836630821228027, "reward_lexical_plausibility_std": 0.026990195736289024, "reward_repeat_penalty_mean": 0.9874579906463623, "reward_repeat_penalty_std": 0.020340239629149437, "reward_repeat_floor_mean": 0.9984275698661804, "reward_repeat_floor_std": 0.00232161907479167, "reward_near_duplicate_penalty_mean": 0.992782711982727, "reward_near_duplicate_penalty_std": 0.00817783921957016, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9945576190948486, "reward_distinct_2_std": 0.013459553010761738, "reward_judge_quality_mean": 0.34999996423721313, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.052760906517505646, "reward_total_composite_std": 0.0543060302734375} {"timestamp_utc": "2026-04-12T16:26:38Z", "mode": "train", "global_step": 144, "epoch": 0.0075785484974475025, "loss": 0.1612, "grad_norm": 12.269087791442871, "learning_rate": 9.566666666666668e-06, "num_tokens": 277709.0, "completions/mean_length": 49.875, "completions/min_length": 32.0, "completions/max_length": 87.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.875, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.4163627624511719, "rewards/meter/std": 0.40220409631729126, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8012499809265137, "rewards/judge_quality/std": 0.24948161840438843, "rewards/repeat_penalty/mean": 0.9986408352851868, "rewards/repeat_penalty/std": 0.0038443405646830797, "rewards/repeat_floor/mean": 0.9997961521148682, "rewards/repeat_floor/std": 0.0005766532267443836, "rewards/near_duplicate_penalty/mean": 0.9986408352851868, "rewards/near_duplicate_penalty/std": 0.0038443405646830797, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32693901658058167, "rewards/total_composite/std": 0.36526110768318176, "reward": 0.32693901658058167, "reward_std": 0.36526110768318176, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16840322315692902, "sampling/sampling_logp_difference/max": 1.1883630752563477, "sampling/importance_sampling_ratio/min": 0.3047196567058563, "sampling/importance_sampling_ratio/mean": 1.043142557144165, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7192247211933136, "clip_ratio/low_mean": 0.1265910305082798, "clip_ratio/low_min": 0.1265910305082798, "clip_ratio/high_mean": 0.017189984442666173, "clip_ratio/high_max": 0.017189984442666173, "clip_ratio/region_mean": 0.14378101495094597, "reward_total_mean": 0.32693901658058167, "reward_meter_mean": 0.4163627624511719, "reward_meter_std": 0.40220409631729126, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9986408352851868, "reward_repeat_penalty_std": 0.0038443405646830797, "reward_repeat_floor_mean": 0.9997961521148682, "reward_repeat_floor_std": 0.0005766532267443836, "reward_near_duplicate_penalty_mean": 0.9986408352851868, "reward_near_duplicate_penalty_std": 0.0038443405646830797, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8012499809265137, "reward_judge_quality_std": 0.24948161840438843, "reward_total_composite_mean": 0.32693901658058167, "reward_total_composite_std": 0.36526110768318176} {"timestamp_utc": "2026-04-12T16:26:48Z", "mode": "train", "global_step": 145, "epoch": 0.007631177306457555, "loss": 0.1939, "grad_norm": 8.608485221862793, "learning_rate": 9.563636363636365e-06, "num_tokens": 279792.0, "completions/mean_length": 97.375, "completions/min_length": 56.0, "completions/max_length": 130.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 97.375, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 130.0, "rewards/meter/mean": 0.08041495084762573, "rewards/meter/std": 0.09178543090820312, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.24800792336463928, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.07440238445997238, "rewards/lexical_plausibility/mean": 0.8635621070861816, "rewards/lexical_plausibility/std": 0.13445277512073517, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9962135553359985, "rewards/repeat_penalty/std": 0.006941632833331823, "rewards/repeat_floor/mean": 0.9994320273399353, "rewards/repeat_floor/std": 0.0010412477422505617, "rewards/near_duplicate_penalty/mean": 0.9962135553359985, "rewards/near_duplicate_penalty/std": 0.006941632833331823, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.022487379610538483, "rewards/total_composite/std": 0.03471127897500992, "reward": 0.022487379610538483, "reward_std": 0.03471127897500992, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2191181629896164, "sampling/sampling_logp_difference/max": 1.4294586181640625, "sampling/importance_sampling_ratio/min": 0.2394385188817978, "sampling/importance_sampling_ratio/mean": 1.040704369544983, "sampling/importance_sampling_ratio/max": 1.9703952074050903, "entropy": 2.8126401007175446, "clip_ratio/low_mean": 0.1424967236816883, "clip_ratio/low_min": 0.1424967236816883, "clip_ratio/high_mean": 0.04397551529109478, "clip_ratio/high_max": 0.04397551529109478, "clip_ratio/region_mean": 0.1864722389727831, "reward_total_mean": 0.022487379610538483, "reward_meter_mean": 0.08041495084762573, "reward_meter_std": 0.09178543090820312, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.24800792336463928, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.07440238445997238, "reward_lexical_plausibility_mean": 0.8635621070861816, "reward_lexical_plausibility_std": 0.13445277512073517, "reward_repeat_penalty_mean": 0.9962135553359985, "reward_repeat_penalty_std": 0.006941632833331823, "reward_repeat_floor_mean": 0.9994320273399353, "reward_repeat_floor_std": 0.0010412477422505617, "reward_near_duplicate_penalty_mean": 0.9962135553359985, "reward_near_duplicate_penalty_std": 0.006941632833331823, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.022487379610538483, "reward_total_composite_std": 0.03471127897500992} {"timestamp_utc": "2026-04-12T16:27:06Z", "mode": "train", "global_step": 146, "epoch": 0.007683806115467607, "loss": 0.1073, "grad_norm": 3.361783266067505, "learning_rate": 9.56060606060606e-06, "num_tokens": 281931.0, "completions/mean_length": 223.375, "completions/min_length": 55.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 127.16667175292969, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 449.0, "rewards/meter/mean": 0.7488503456115723, "rewards/meter/std": 0.3192792236804962, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.8579171299934387, "rewards/lexical_plausibility/std": 0.2528241276741028, "rewards/judge_quality/mean": 0.18125000596046448, "rewards/judge_quality/std": 0.14865468442440033, "rewards/repeat_penalty/mean": 0.9988870620727539, "rewards/repeat_penalty/std": 0.0026286349166184664, "rewards/repeat_floor/mean": 0.9998893737792969, "rewards/repeat_floor/std": 0.0002397261851001531, "rewards/near_duplicate_penalty/mean": 0.9998251795768738, "rewards/near_duplicate_penalty/std": 0.000494487932883203, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9990619421005249, "rewards/distinct_2/std": 0.0026533128693699837, "rewards/total_composite/mean": 0.13748405873775482, "rewards/total_composite/std": 0.1326868236064911, "reward": 0.13748405873775482, "reward_std": 0.1326868087053299, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2458665817975998, "sampling/sampling_logp_difference/max": 1.2333660125732422, "sampling/importance_sampling_ratio/min": 0.2913103699684143, "sampling/importance_sampling_ratio/mean": 1.0718419551849365, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9780437648296356, "clip_ratio/low_mean": 0.0679066926240921, "clip_ratio/low_min": 0.0679066926240921, "clip_ratio/high_mean": 0.0773675087839365, "clip_ratio/high_max": 0.0773675087839365, "clip_ratio/region_mean": 0.1452742014080286, "reward_total_mean": 0.13748405873775482, "reward_meter_mean": 0.7488503456115723, "reward_meter_std": 0.3192792236804962, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.8579171299934387, "reward_lexical_plausibility_std": 0.2528241276741028, "reward_repeat_penalty_mean": 0.9988870620727539, "reward_repeat_penalty_std": 0.0026286349166184664, "reward_repeat_floor_mean": 0.9998893737792969, "reward_repeat_floor_std": 0.0002397261851001531, "reward_near_duplicate_penalty_mean": 0.9998251795768738, "reward_near_duplicate_penalty_std": 0.000494487932883203, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9990619421005249, "reward_distinct_2_std": 0.0026533128693699837, "reward_judge_quality_mean": 0.18125000596046448, "reward_judge_quality_std": 0.14865468442440033, "reward_total_composite_mean": 0.13748405873775482, "reward_total_composite_std": 0.1326868236064911} {"timestamp_utc": "2026-04-12T16:27:21Z", "mode": "train", "global_step": 147, "epoch": 0.007736434924477659, "loss": 0.0819, "grad_norm": 10.808486938476562, "learning_rate": 9.55757575757576e-06, "num_tokens": 284258.0, "completions/mean_length": 120.875, "completions/min_length": 104.0, "completions/max_length": 149.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 120.875, "completions/min_terminated_length": 104.0, "completions/max_terminated_length": 149.0, "rewards/meter/mean": 0.3757374882698059, "rewards/meter/std": 0.25155457854270935, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9850000143051147, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 0.995192289352417, "rewards/lexical_plausibility/std": 0.013598216697573662, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9784359931945801, "rewards/repeat_penalty/std": 0.021663790568709373, "rewards/repeat_floor/mean": 0.9973344802856445, "rewards/repeat_floor/std": 0.002300889464095235, "rewards/near_duplicate_penalty/mean": 0.9881511926651001, "rewards/near_duplicate_penalty/std": 0.008078720420598984, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9901315569877625, "rewards/distinct_2/std": 0.018280785530805588, "rewards/total_composite/mean": 0.1059810072183609, "rewards/total_composite/std": 0.07456544041633606, "reward": 0.1059810072183609, "reward_std": 0.07456544041633606, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22779150307178497, "sampling/sampling_logp_difference/max": 2.154332160949707, "sampling/importance_sampling_ratio/min": 0.1159806177020073, "sampling/importance_sampling_ratio/mean": 1.0102511644363403, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5819136500358582, "clip_ratio/low_mean": 0.10269808769226074, "clip_ratio/low_min": 0.10269808769226074, "clip_ratio/high_mean": 0.10698944143950939, "clip_ratio/high_max": 0.10698944143950939, "clip_ratio/region_mean": 0.20968752913177013, "reward_total_mean": 0.1059810072183609, "reward_meter_mean": 0.3757374882698059, "reward_meter_std": 0.25155457854270935, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9850000143051147, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 0.995192289352417, "reward_lexical_plausibility_std": 0.013598216697573662, "reward_repeat_penalty_mean": 0.9784359931945801, "reward_repeat_penalty_std": 0.021663790568709373, "reward_repeat_floor_mean": 0.9973344802856445, "reward_repeat_floor_std": 0.002300889464095235, "reward_near_duplicate_penalty_mean": 0.9881511926651001, "reward_near_duplicate_penalty_std": 0.008078720420598984, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9901315569877625, "reward_distinct_2_std": 0.018280785530805588, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.1059810072183609, "reward_total_composite_std": 0.07456544041633606} {"timestamp_utc": "2026-04-12T16:27:35Z", "mode": "train", "global_step": 148, "epoch": 0.007789063733487711, "loss": -0.1492, "grad_norm": 3.1610093116760254, "learning_rate": 9.554545454545455e-06, "num_tokens": 287190.0, "completions/mean_length": 390.5, "completions/min_length": 173.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 269.0, "completions/min_terminated_length": 173.0, "completions/max_terminated_length": 348.0, "rewards/meter/mean": 0.4640042781829834, "rewards/meter/std": 0.4690435528755188, "rewards/count_adherence/mean": 0.4027777910232544, "rewards/count_adherence/std": 0.33564019203186035, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8208333253860474, "rewards/count_floor/std": 0.10069204121828079, "rewards/lexical_plausibility/mean": 0.5631389617919922, "rewards/lexical_plausibility/std": 0.2559228241443634, "rewards/judge_quality/mean": 0.07500000298023224, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.9368826150894165, "rewards/repeat_penalty/std": 0.11535022407770157, "rewards/repeat_floor/mean": 0.9961574077606201, "rewards/repeat_floor/std": 0.006887897849082947, "rewards/near_duplicate_penalty/mean": 0.9993826150894165, "rewards/near_duplicate_penalty/std": 0.0010040045017376542, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.04006575420498848, "rewards/total_composite/std": 0.05277764052152634, "reward": 0.04006575420498848, "reward_std": 0.05277763679623604, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21735039353370667, "sampling/sampling_logp_difference/max": 1.3076105117797852, "sampling/importance_sampling_ratio/min": 0.27046555280685425, "sampling/importance_sampling_ratio/mean": 1.0642019510269165, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.2763786613941193, "clip_ratio/low_mean": 0.03180444426834583, "clip_ratio/low_min": 0.03180444426834583, "clip_ratio/high_mean": 0.046840742230415344, "clip_ratio/high_max": 0.046840742230415344, "clip_ratio/region_mean": 0.07864518649876118, "reward_total_mean": 0.04006575420498848, "reward_meter_mean": 0.4640042781829834, "reward_meter_std": 0.4690435528755188, "reward_count_adherence_mean": 0.4027777910232544, "reward_count_adherence_std": 0.33564019203186035, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8208333253860474, "reward_count_floor_std": 0.10069204121828079, "reward_lexical_plausibility_mean": 0.5631389617919922, "reward_lexical_plausibility_std": 0.2559228241443634, "reward_repeat_penalty_mean": 0.9368826150894165, "reward_repeat_penalty_std": 0.11535022407770157, "reward_repeat_floor_mean": 0.9961574077606201, "reward_repeat_floor_std": 0.006887897849082947, "reward_near_duplicate_penalty_mean": 0.9993826150894165, "reward_near_duplicate_penalty_std": 0.0010040045017376542, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.07500000298023224, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.04006575420498848, "reward_total_composite_std": 0.05277764052152634} {"timestamp_utc": "2026-04-12T16:27:50Z", "mode": "train", "global_step": 149, "epoch": 0.007841692542497763, "loss": -0.0507, "grad_norm": 2.1130027770996094, "learning_rate": 9.551515151515152e-06, "num_tokens": 290328.0, "completions/mean_length": 439.25, "completions/min_length": 171.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 366.5, "completions/min_terminated_length": 171.0, "completions/max_terminated_length": 494.0, "rewards/meter/mean": 0.4967094957828522, "rewards/meter/std": 0.3946586847305298, "rewards/count_adherence/mean": 0.4583333730697632, "rewards/count_adherence/std": 0.19187648594379425, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8374999761581421, "rewards/count_floor/std": 0.05756295099854469, "rewards/lexical_plausibility/mean": 0.6219012141227722, "rewards/lexical_plausibility/std": 0.23513641953468323, "rewards/judge_quality/mean": 0.0625, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.9974699020385742, "rewards/repeat_penalty/std": 0.003077274886891246, "rewards/repeat_floor/mean": 0.9996856451034546, "rewards/repeat_floor/std": 0.00032589014153927565, "rewards/near_duplicate_penalty/mean": 0.9985562562942505, "rewards/near_duplicate_penalty/std": 0.0018052110681310296, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9989135265350342, "rewards/distinct_2/std": 0.003073032246902585, "rewards/total_composite/mean": 0.03064427338540554, "rewards/total_composite/std": 0.03845704346895218, "reward": 0.03064427338540554, "reward_std": 0.03845703974366188, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23426313698291779, "sampling/sampling_logp_difference/max": 1.581960678100586, "sampling/importance_sampling_ratio/min": 0.20557163655757904, "sampling/importance_sampling_ratio/mean": 1.0527914762496948, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4563476741313934, "clip_ratio/low_mean": 0.028711112216114998, "clip_ratio/low_min": 0.028711112216114998, "clip_ratio/high_mean": 0.04554655961692333, "clip_ratio/high_max": 0.04554655961692333, "clip_ratio/region_mean": 0.07425767183303833, "reward_total_mean": 0.03064427338540554, "reward_meter_mean": 0.4967094957828522, "reward_meter_std": 0.3946586847305298, "reward_count_adherence_mean": 0.4583333730697632, "reward_count_adherence_std": 0.19187648594379425, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8374999761581421, "reward_count_floor_std": 0.05756295099854469, "reward_lexical_plausibility_mean": 0.6219012141227722, "reward_lexical_plausibility_std": 0.23513641953468323, "reward_repeat_penalty_mean": 0.9974699020385742, "reward_repeat_penalty_std": 0.003077274886891246, "reward_repeat_floor_mean": 0.9996856451034546, "reward_repeat_floor_std": 0.00032589014153927565, "reward_near_duplicate_penalty_mean": 0.9985562562942505, "reward_near_duplicate_penalty_std": 0.0018052110681310296, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9989135265350342, "reward_distinct_2_std": 0.003073032246902585, "reward_judge_quality_mean": 0.0625, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.03064427338540554, "reward_total_composite_std": 0.03845704346895218} {"timestamp_utc": "2026-04-12T16:27:58Z", "mode": "train", "global_step": 150, "epoch": 0.007894321351507815, "loss": 0.0257, "grad_norm": 13.331134796142578, "learning_rate": 9.54848484848485e-06, "num_tokens": 291954.0, "completions/mean_length": 39.25, "completions/min_length": 26.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.25, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.14966915547847748, "rewards/meter/std": 0.2939712703227997, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.3624691963195801, "rewards/repeat_penalty/mean": 0.996006190776825, "rewards/repeat_penalty/std": 0.007941397838294506, "rewards/repeat_floor/mean": 0.9994009137153625, "rewards/repeat_floor/std": 0.001191212679259479, "rewards/near_duplicate_penalty/mean": 0.996006190776825, "rewards/near_duplicate_penalty/std": 0.007941397838294506, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08787254989147186, "rewards/total_composite/std": 0.14439496397972107, "reward": 0.08787254989147186, "reward_std": 0.14439494907855988, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18074624240398407, "sampling/sampling_logp_difference/max": 1.9926366806030273, "sampling/importance_sampling_ratio/min": 0.13633549213409424, "sampling/importance_sampling_ratio/mean": 1.0147531032562256, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.20120470225811, "clip_ratio/low_mean": 0.135904380120337, "clip_ratio/low_min": 0.135904380120337, "clip_ratio/high_mean": 0.041025642305612564, "clip_ratio/high_max": 0.041025642305612564, "clip_ratio/region_mean": 0.17693002242594957, "reward_total_mean": 0.08787254989147186, "reward_meter_mean": 0.14966915547847748, "reward_meter_std": 0.2939712703227997, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.996006190776825, "reward_repeat_penalty_std": 0.007941397838294506, "reward_repeat_floor_mean": 0.9994009137153625, "reward_repeat_floor_std": 0.001191212679259479, "reward_near_duplicate_penalty_mean": 0.996006190776825, "reward_near_duplicate_penalty_std": 0.007941397838294506, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.3624691963195801, "reward_total_composite_mean": 0.08787254989147186, "reward_total_composite_std": 0.14439496397972107} {"timestamp_utc": "2026-04-12T16:30:27Z", "mode": "eval", "global_step": 150, "epoch": 0.007894321351507815, "eval_loss": NaN, "eval_runtime": 148.8576, "eval_samples_per_second": 0.699, "eval_steps_per_second": 0.087, "eval_num_tokens": 291954.0, "eval_completions/mean_length": 231.90384615384616, "eval_completions/min_length": 47.84615384615385, "eval_completions/max_length": 511.9230769230769, "eval_completions/clipped_ratio": 0.19230769230769232, "eval_completions/mean_terminated_length": 163.97528017484225, "eval_completions/min_terminated_length": 47.84615384615385, "eval_completions/max_terminated_length": 358.3076923076923, "eval_rewards/meter/mean": 0.2257346401994045, "eval_rewards/meter/std": 0.3091386625399956, "eval_rewards/count_adherence/mean": 0.7586572468280792, "eval_rewards/count_adherence/std": 0.27057631944234556, "eval_rewards/arabic_clean/mean": 0.7115384615384616, "eval_rewards/arabic_clean/std": 0.4383068313965431, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9927884569534888, "eval_rewards/arabic_floor/std": 0.020397308354194347, "eval_rewards/count_floor/mean": 0.9275971605227544, "eval_rewards/count_floor/std": 0.08117289626254486, "eval_rewards/lexical_plausibility/mean": 0.8448186241663419, "eval_rewards/lexical_plausibility/std": 0.20366024054013765, "eval_rewards/judge_quality/mean": 0.23086538853553626, "eval_rewards/judge_quality/std": 0.171858167132506, "eval_rewards/repeat_penalty/mean": 0.9710512023705703, "eval_rewards/repeat_penalty/std": 0.05339848382685047, "eval_rewards/repeat_floor/mean": 0.9975112263972943, "eval_rewards/repeat_floor/std": 0.0038020770656518065, "eval_rewards/near_duplicate_penalty/mean": 0.9936564977352436, "eval_rewards/near_duplicate_penalty/std": 0.009320403108946405, "eval_rewards/opening_diversity/mean": 0.9831730769230769, "eval_rewards/opening_diversity/std": 0.04289763420820236, "eval_rewards/distinct_2/mean": 0.9941373284046466, "eval_rewards/distinct_2/std": 0.012226779443713335, "eval_rewards/total_composite/mean": 0.05975959184937752, "eval_rewards/total_composite/std": 0.10096489437497579, "eval_reward": 0.05975959184937752, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.18483873972525963, "eval_sampling/sampling_logp_difference/max": 1.2555984350351186, "eval_sampling/importance_sampling_ratio/min": 0.2868260466135465, "eval_sampling/importance_sampling_ratio/mean": 1.0590465068817139, "eval_sampling/importance_sampling_ratio/max": 1.7238773290927594, "eval_entropy": 3.7728551167708178, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.05975959184937752, "eval_reward_meter_mean": 0.2257346401994045, "eval_reward_meter_std": 0.3091386625399956, "eval_reward_count_adherence_mean": 0.7586572468280792, "eval_reward_count_adherence_std": 0.27057631944234556, "eval_reward_arabic_clean_mean": 0.7115384615384616, "eval_reward_arabic_clean_std": 0.4383068313965431, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9927884569534888, "eval_reward_arabic_floor_std": 0.020397308354194347, "eval_reward_count_floor_mean": 0.9275971605227544, "eval_reward_count_floor_std": 0.08117289626254486, "eval_reward_lexical_plausibility_mean": 0.8448186241663419, "eval_reward_lexical_plausibility_std": 0.20366024054013765, "eval_reward_repeat_penalty_mean": 0.9710512023705703, "eval_reward_repeat_penalty_std": 0.05339848382685047, "eval_reward_repeat_floor_mean": 0.9975112263972943, "eval_reward_repeat_floor_std": 0.0038020770656518065, "eval_reward_near_duplicate_penalty_mean": 0.9936564977352436, "eval_reward_near_duplicate_penalty_std": 0.009320403108946405, "eval_reward_opening_diversity_mean": 0.9831730769230769, "eval_reward_opening_diversity_std": 0.04289763420820236, "eval_reward_distinct_2_mean": 0.9941373284046466, "eval_reward_distinct_2_std": 0.012226779443713335, "eval_reward_judge_quality_mean": 0.23086538853553626, "eval_reward_judge_quality_std": 0.171858167132506, "eval_reward_total_composite_mean": 0.05975959184937752, "eval_reward_total_composite_std": 0.10096489437497579} {"timestamp_utc": "2026-04-12T16:30:37Z", "mode": "train", "global_step": 151, "epoch": 0.007946950160517868, "loss": 0.1278, "grad_norm": 15.257999420166016, "learning_rate": 9.545454545454547e-06, "num_tokens": 293270.0, "completions/mean_length": 27.5, "completions/min_length": 21.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.5, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.15804384648799896, "rewards/meter/std": 0.2840515971183777, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.3620477616786957, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1102190762758255, "rewards/total_composite/std": 0.2489222139120102, "reward": 0.1102190762758255, "reward_std": 0.2489222139120102, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2210453897714615, "sampling/sampling_logp_difference/max": 1.2390928268432617, "sampling/importance_sampling_ratio/min": 0.28964686393737793, "sampling/importance_sampling_ratio/mean": 1.0759471654891968, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3047438114881516, "clip_ratio/low_mean": 0.14588989783078432, "clip_ratio/low_min": 0.14588989783078432, "clip_ratio/high_mean": 0.02976190485060215, "clip_ratio/high_max": 0.02976190485060215, "clip_ratio/region_mean": 0.17565180268138647, "reward_total_mean": 0.1102190762758255, "reward_meter_mean": 0.15804384648799896, "reward_meter_std": 0.2840515971183777, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.3620477616786957, "reward_total_composite_mean": 0.1102190762758255, "reward_total_composite_std": 0.2489222139120102} {"timestamp_utc": "2026-04-12T16:30:46Z", "mode": "train", "global_step": 152, "epoch": 0.00799957896952792, "loss": 0.0611, "grad_norm": 14.929104804992676, "learning_rate": 9.542424242424242e-06, "num_tokens": 295050.0, "completions/mean_length": 61.5, "completions/min_length": 44.0, "completions/max_length": 83.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.5, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 83.0, "rewards/meter/mean": 0.38935643434524536, "rewards/meter/std": 0.29865187406539917, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9754464626312256, "rewards/lexical_plausibility/std": 0.06944799423217773, "rewards/judge_quality/mean": 0.5712500214576721, "rewards/judge_quality/std": 0.2811424434185028, "rewards/repeat_penalty/mean": 0.9804328680038452, "rewards/repeat_penalty/std": 0.0327908992767334, "rewards/repeat_floor/mean": 0.9973775744438171, "rewards/repeat_floor/std": 0.004061189945787191, "rewards/near_duplicate_penalty/mean": 0.9861229658126831, "rewards/near_duplicate_penalty/std": 0.01746893674135208, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.993990421295166, "rewards/distinct_2/std": 0.01699776202440262, "rewards/total_composite/mean": 0.1978502869606018, "rewards/total_composite/std": 0.1373213827610016, "reward": 0.1978502869606018, "reward_std": 0.1373213678598404, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2262590527534485, "sampling/sampling_logp_difference/max": 1.6137351989746094, "sampling/importance_sampling_ratio/min": 0.19914238154888153, "sampling/importance_sampling_ratio/mean": 1.0549683570861816, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5685294568538666, "clip_ratio/low_mean": 0.12222131341695786, "clip_ratio/low_min": 0.12222131341695786, "clip_ratio/high_mean": 0.09842611104249954, "clip_ratio/high_max": 0.09842611104249954, "clip_ratio/region_mean": 0.2206474244594574, "reward_total_mean": 0.1978502869606018, "reward_meter_mean": 0.38935643434524536, "reward_meter_std": 0.29865187406539917, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9754464626312256, "reward_lexical_plausibility_std": 0.06944799423217773, "reward_repeat_penalty_mean": 0.9804328680038452, "reward_repeat_penalty_std": 0.0327908992767334, "reward_repeat_floor_mean": 0.9973775744438171, "reward_repeat_floor_std": 0.004061189945787191, "reward_near_duplicate_penalty_mean": 0.9861229658126831, "reward_near_duplicate_penalty_std": 0.01746893674135208, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.993990421295166, "reward_distinct_2_std": 0.01699776202440262, "reward_judge_quality_mean": 0.5712500214576721, "reward_judge_quality_std": 0.2811424434185028, "reward_total_composite_mean": 0.1978502869606018, "reward_total_composite_std": 0.1373213827610016} {"timestamp_utc": "2026-04-12T16:30:55Z", "mode": "train", "global_step": 153, "epoch": 0.008052207778537972, "loss": 0.283, "grad_norm": 16.348724365234375, "learning_rate": 9.539393939393941e-06, "num_tokens": 297032.0, "completions/mean_length": 75.75, "completions/min_length": 43.0, "completions/max_length": 124.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 75.75, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 124.0, "rewards/meter/mean": 0.29824861884117126, "rewards/meter/std": 0.29439404606819153, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 0.9386405944824219, "rewards/lexical_plausibility/std": 0.09032656252384186, "rewards/judge_quality/mean": 0.4675000011920929, "rewards/judge_quality/std": 0.32936087250709534, "rewards/repeat_penalty/mean": 0.9406213760375977, "rewards/repeat_penalty/std": 0.1538749784231186, "rewards/repeat_floor/mean": 0.9931595325469971, "rewards/repeat_floor/std": 0.017247755080461502, "rewards/near_duplicate_penalty/mean": 0.982021689414978, "rewards/near_duplicate_penalty/std": 0.03746762499213219, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.9622926115989685, "rewards/distinct_2/std": 0.10665260255336761, "rewards/total_composite/mean": 0.1481320708990097, "rewards/total_composite/std": 0.187057763338089, "reward": 0.1481320708990097, "reward_std": 0.187057763338089, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2677787244319916, "sampling/sampling_logp_difference/max": 2.189413070678711, "sampling/importance_sampling_ratio/min": 0.11198245733976364, "sampling/importance_sampling_ratio/mean": 1.0200051069259644, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.132720023393631, "clip_ratio/low_mean": 0.1375386230647564, "clip_ratio/low_min": 0.1375386230647564, "clip_ratio/high_mean": 0.09088260866701603, "clip_ratio/high_max": 0.09088260866701603, "clip_ratio/region_mean": 0.22842123173177242, "reward_total_mean": 0.1481320708990097, "reward_meter_mean": 0.29824861884117126, "reward_meter_std": 0.29439404606819153, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 0.9386405944824219, "reward_lexical_plausibility_std": 0.09032656252384186, "reward_repeat_penalty_mean": 0.9406213760375977, "reward_repeat_penalty_std": 0.1538749784231186, "reward_repeat_floor_mean": 0.9931595325469971, "reward_repeat_floor_std": 0.017247755080461502, "reward_near_duplicate_penalty_mean": 0.982021689414978, "reward_near_duplicate_penalty_std": 0.03746762499213219, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.9622926115989685, "reward_distinct_2_std": 0.10665260255336761, "reward_judge_quality_mean": 0.4675000011920929, "reward_judge_quality_std": 0.32936087250709534, "reward_total_composite_mean": 0.1481320708990097, "reward_total_composite_std": 0.187057763338089} {"timestamp_utc": "2026-04-12T16:31:05Z", "mode": "train", "global_step": 154, "epoch": 0.008104836587548023, "loss": 0.1705, "grad_norm": 14.417436599731445, "learning_rate": 9.536363636363637e-06, "num_tokens": 298848.0, "completions/mean_length": 44.0, "completions/min_length": 32.0, "completions/max_length": 89.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.0, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 89.0, "rewards/meter/mean": 0.3378413915634155, "rewards/meter/std": 0.40106305480003357, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390502154827118, "rewards/repeat_penalty/mean": 0.9758144617080688, "rewards/repeat_penalty/std": 0.03136686980724335, "rewards/repeat_floor/mean": 0.9969303607940674, "rewards/repeat_floor/std": 0.003498316276818514, "rewards/near_duplicate_penalty/mean": 0.9853047132492065, "rewards/near_duplicate_penalty/std": 0.017314862459897995, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.20318013429641724, "rewards/total_composite/std": 0.3137761652469635, "reward": 0.20318013429641724, "reward_std": 0.3137761652469635, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22353847324848175, "sampling/sampling_logp_difference/max": 1.8340167999267578, "sampling/importance_sampling_ratio/min": 0.15977051854133606, "sampling/importance_sampling_ratio/mean": 1.045520544052124, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.528806522488594, "clip_ratio/low_mean": 0.1583808809518814, "clip_ratio/low_min": 0.1583808809518814, "clip_ratio/high_mean": 0.060891544446349144, "clip_ratio/high_max": 0.060891544446349144, "clip_ratio/region_mean": 0.21927242539823055, "reward_total_mean": 0.20318013429641724, "reward_meter_mean": 0.3378413915634155, "reward_meter_std": 0.40106305480003357, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9758144617080688, "reward_repeat_penalty_std": 0.03136686980724335, "reward_repeat_floor_mean": 0.9969303607940674, "reward_repeat_floor_std": 0.003498316276818514, "reward_near_duplicate_penalty_mean": 0.9853047132492065, "reward_near_duplicate_penalty_std": 0.017314862459897995, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390502154827118, "reward_total_composite_mean": 0.20318013429641724, "reward_total_composite_std": 0.3137761652469635} {"timestamp_utc": "2026-04-12T16:31:13Z", "mode": "train", "global_step": 155, "epoch": 0.008157465396558075, "loss": 0.111, "grad_norm": 24.618492126464844, "learning_rate": 9.533333333333334e-06, "num_tokens": 300247.0, "completions/mean_length": 18.875, "completions/min_length": 15.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.875, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.9403250813484192, "rewards/meter/std": 0.06395131349563599, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.945521354675293, "rewards/lexical_plausibility/std": 0.11963294446468353, "rewards/judge_quality/mean": 0.7387499809265137, "rewards/judge_quality/std": 0.3636496663093567, "rewards/repeat_penalty/mean": 0.5773205757141113, "rewards/repeat_penalty/std": 0.248104527592659, "rewards/repeat_floor/mean": 0.9476659297943115, "rewards/repeat_floor/std": 0.05473656207323074, "rewards/near_duplicate_penalty/mean": 0.8023881316184998, "rewards/near_duplicate_penalty/std": 0.27356192469596863, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9145299196243286, "rewards/distinct_2/std": 0.15825983881950378, "rewards/total_composite/mean": 0.6672157049179077, "rewards/total_composite/std": 0.33616819977760315, "reward": 0.6672157049179077, "reward_std": 0.33616816997528076, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17333175241947174, "sampling/sampling_logp_difference/max": 0.9076957702636719, "sampling/importance_sampling_ratio/min": 0.4034528136253357, "sampling/importance_sampling_ratio/mean": 1.0622689723968506, "sampling/importance_sampling_ratio/max": 1.9556593894958496, "entropy": 1.8294667154550552, "clip_ratio/low_mean": 0.07727272808551788, "clip_ratio/low_min": 0.07727272808551788, "clip_ratio/high_mean": 0.153308829292655, "clip_ratio/high_max": 0.153308829292655, "clip_ratio/region_mean": 0.23058155737817287, "reward_total_mean": 0.6672157049179077, "reward_meter_mean": 0.9403250813484192, "reward_meter_std": 0.06395131349563599, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.945521354675293, "reward_lexical_plausibility_std": 0.11963294446468353, "reward_repeat_penalty_mean": 0.5773205757141113, "reward_repeat_penalty_std": 0.248104527592659, "reward_repeat_floor_mean": 0.9476659297943115, "reward_repeat_floor_std": 0.05473656207323074, "reward_near_duplicate_penalty_mean": 0.8023881316184998, "reward_near_duplicate_penalty_std": 0.27356192469596863, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9145299196243286, "reward_distinct_2_std": 0.15825983881950378, "reward_judge_quality_mean": 0.7387499809265137, "reward_judge_quality_std": 0.3636496663093567, "reward_total_composite_mean": 0.6672157049179077, "reward_total_composite_std": 0.33616819977760315} {"timestamp_utc": "2026-04-12T16:31:26Z", "mode": "train", "global_step": 156, "epoch": 0.008210094205568128, "loss": 0.0807, "grad_norm": 6.091550350189209, "learning_rate": 9.530303030303031e-06, "num_tokens": 302442.0, "completions/mean_length": 174.375, "completions/min_length": 83.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 126.14286041259766, "completions/min_terminated_length": 83.0, "completions/max_terminated_length": 259.0, "rewards/meter/mean": 0.27547502517700195, "rewards/meter/std": 0.33542144298553467, "rewards/count_adherence/mean": 0.7999999523162842, "rewards/count_adherence/std": 0.2618614733219147, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9399999976158142, "rewards/count_floor/std": 0.07855844497680664, "rewards/lexical_plausibility/mean": 0.9448052644729614, "rewards/lexical_plausibility/std": 0.12211354076862335, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9574728012084961, "rewards/repeat_penalty/std": 0.03196243569254875, "rewards/repeat_floor/mean": 0.9954248666763306, "rewards/repeat_floor/std": 0.0035908089485019445, "rewards/near_duplicate_penalty/mean": 0.9883695840835571, "rewards/near_duplicate_penalty/std": 0.011273902840912342, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9685494899749756, "rewards/distinct_2/std": 0.02286594547331333, "rewards/total_composite/mean": 0.10009932518005371, "rewards/total_composite/std": 0.1299850195646286, "reward": 0.10009932518005371, "reward_std": 0.1299850195646286, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2429916262626648, "sampling/sampling_logp_difference/max": 1.702545166015625, "sampling/importance_sampling_ratio/min": 0.18221914768218994, "sampling/importance_sampling_ratio/mean": 1.0676641464233398, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.298069953918457, "clip_ratio/low_mean": 0.12119883298873901, "clip_ratio/low_min": 0.12119883298873901, "clip_ratio/high_mean": 0.053592994809150696, "clip_ratio/high_max": 0.053592994809150696, "clip_ratio/region_mean": 0.1747918277978897, "reward_total_mean": 0.10009932518005371, "reward_meter_mean": 0.27547502517700195, "reward_meter_std": 0.33542144298553467, "reward_count_adherence_mean": 0.7999999523162842, "reward_count_adherence_std": 0.2618614733219147, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9399999976158142, "reward_count_floor_std": 0.07855844497680664, "reward_lexical_plausibility_mean": 0.9448052644729614, "reward_lexical_plausibility_std": 0.12211354076862335, "reward_repeat_penalty_mean": 0.9574728012084961, "reward_repeat_penalty_std": 0.03196243569254875, "reward_repeat_floor_mean": 0.9954248666763306, "reward_repeat_floor_std": 0.0035908089485019445, "reward_near_duplicate_penalty_mean": 0.9883695840835571, "reward_near_duplicate_penalty_std": 0.011273902840912342, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9685494899749756, "reward_distinct_2_std": 0.02286594547331333, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.10009932518005371, "reward_total_composite_std": 0.1299850195646286} {"timestamp_utc": "2026-04-12T16:31:34Z", "mode": "train", "global_step": 157, "epoch": 0.00826272301457818, "loss": 0.0154, "grad_norm": 17.993427276611328, "learning_rate": 9.527272727272729e-06, "num_tokens": 303802.0, "completions/mean_length": 22.0, "completions/min_length": 17.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.0, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.9873130321502686, "rewards/meter/std": 0.017658350989222527, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.7425000071525574, "rewards/judge_quality/std": 0.27185869216918945, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7237325310707092, "rewards/total_composite/std": 0.26927655935287476, "reward": 0.7237325310707092, "reward_std": 0.26927658915519714, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19480332732200623, "sampling/sampling_logp_difference/max": 1.1242094039916992, "sampling/importance_sampling_ratio/min": 0.3249092400074005, "sampling/importance_sampling_ratio/mean": 1.061350703239441, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8669251203536987, "clip_ratio/low_mean": 0.09261363931000233, "clip_ratio/low_min": 0.09261363931000233, "clip_ratio/high_mean": 0.09373304760083556, "clip_ratio/high_max": 0.09373304760083556, "clip_ratio/region_mean": 0.1863466869108379, "reward_total_mean": 0.7237325310707092, "reward_meter_mean": 0.9873130321502686, "reward_meter_std": 0.017658350989222527, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7425000071525574, "reward_judge_quality_std": 0.27185869216918945, "reward_total_composite_mean": 0.7237325310707092, "reward_total_composite_std": 0.26927655935287476} {"timestamp_utc": "2026-04-12T16:31:48Z", "mode": "train", "global_step": 158, "epoch": 0.008315351823588233, "loss": 0.0181, "grad_norm": 5.933853626251221, "learning_rate": 9.524242424242424e-06, "num_tokens": 305477.0, "completions/mean_length": 108.375, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 50.71428680419922, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.38190749287605286, "rewards/meter/std": 0.4354288876056671, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9033068418502808, "rewards/lexical_plausibility/std": 0.21514086425304413, "rewards/judge_quality/mean": 0.20624998211860657, "rewards/judge_quality/std": 0.1590990275144577, "rewards/repeat_penalty/mean": 1.0, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 1.0, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11781704425811768, "rewards/total_composite/std": 0.14058606326580048, "reward": 0.11781704425811768, "reward_std": 0.14058606326580048, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23430916666984558, "sampling/sampling_logp_difference/max": 1.268911361694336, "sampling/importance_sampling_ratio/min": 0.28113749623298645, "sampling/importance_sampling_ratio/mean": 1.0673094987869263, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.0684922635555267, "clip_ratio/low_mean": 0.07401142083108425, "clip_ratio/low_min": 0.07401142083108425, "clip_ratio/high_mean": 0.14546815305948257, "clip_ratio/high_max": 0.14546815305948257, "clip_ratio/region_mean": 0.21947957389056683, "reward_total_mean": 0.11781704425811768, "reward_meter_mean": 0.38190749287605286, "reward_meter_std": 0.4354288876056671, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9033068418502808, "reward_lexical_plausibility_std": 0.21514086425304413, "reward_repeat_penalty_mean": 1.0, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 1.0, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.20624998211860657, "reward_judge_quality_std": 0.1590990275144577, "reward_total_composite_mean": 0.11781704425811768, "reward_total_composite_std": 0.14058606326580048} {"timestamp_utc": "2026-04-12T16:32:01Z", "mode": "train", "global_step": 159, "epoch": 0.008367980632598285, "loss": -0.2268, "grad_norm": 2.426312208175659, "learning_rate": 9.521212121212121e-06, "num_tokens": 308165.0, "completions/mean_length": 333.0, "completions/min_length": 141.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 225.60000610351562, "completions/min_terminated_length": 141.0, "completions/max_terminated_length": 360.0, "rewards/meter/mean": 0.353273868560791, "rewards/meter/std": 0.2707987129688263, "rewards/count_adherence/mean": 0.6785714626312256, "rewards/count_adherence/std": 0.26175010204315186, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9035714268684387, "rewards/count_floor/std": 0.07852502912282944, "rewards/lexical_plausibility/mean": 0.6502748727798462, "rewards/lexical_plausibility/std": 0.21541759371757507, "rewards/judge_quality/mean": 0.10000000149011612, "rewards/judge_quality/std": 0.053452253341674805, "rewards/repeat_penalty/mean": 0.9957379102706909, "rewards/repeat_penalty/std": 0.0068611567839980125, "rewards/repeat_floor/mean": 0.999508261680603, "rewards/repeat_floor/std": 0.0006383705767802894, "rewards/near_duplicate_penalty/mean": 0.9982011914253235, "rewards/near_duplicate_penalty/std": 0.0019292989745736122, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9975345134735107, "rewards/distinct_2/std": 0.006973449140787125, "rewards/total_composite/mean": 0.03163018077611923, "rewards/total_composite/std": 0.023396549746394157, "reward": 0.03163018077611923, "reward_std": 0.023396549746394157, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24087728559970856, "sampling/sampling_logp_difference/max": 1.4648590087890625, "sampling/importance_sampling_ratio/min": 0.2311105877161026, "sampling/importance_sampling_ratio/mean": 1.0651675462722778, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.174529790878296, "clip_ratio/low_mean": 0.02570921927690506, "clip_ratio/low_min": 0.02570921927690506, "clip_ratio/high_mean": 0.10626691207289696, "clip_ratio/high_max": 0.10626691207289696, "clip_ratio/region_mean": 0.13197613134980202, "reward_total_mean": 0.03163018077611923, "reward_meter_mean": 0.353273868560791, "reward_meter_std": 0.2707987129688263, "reward_count_adherence_mean": 0.6785714626312256, "reward_count_adherence_std": 0.26175010204315186, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9035714268684387, "reward_count_floor_std": 0.07852502912282944, "reward_lexical_plausibility_mean": 0.6502748727798462, "reward_lexical_plausibility_std": 0.21541759371757507, "reward_repeat_penalty_mean": 0.9957379102706909, "reward_repeat_penalty_std": 0.0068611567839980125, "reward_repeat_floor_mean": 0.999508261680603, "reward_repeat_floor_std": 0.0006383705767802894, "reward_near_duplicate_penalty_mean": 0.9982011914253235, "reward_near_duplicate_penalty_std": 0.0019292989745736122, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9975345134735107, "reward_distinct_2_std": 0.006973449140787125, "reward_judge_quality_mean": 0.10000000149011612, "reward_judge_quality_std": 0.053452253341674805, "reward_total_composite_mean": 0.03163018077611923, "reward_total_composite_std": 0.023396549746394157} {"timestamp_utc": "2026-04-12T16:32:16Z", "mode": "train", "global_step": 160, "epoch": 0.008420609441608336, "loss": -0.0537, "grad_norm": 7.381004333496094, "learning_rate": 9.518181818181819e-06, "num_tokens": 310465.0, "completions/mean_length": 154.5, "completions/min_length": 74.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 103.42857360839844, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 146.0, "rewards/meter/mean": 0.28334954380989075, "rewards/meter/std": 0.33286550641059875, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9006118178367615, "rewards/lexical_plausibility/std": 0.20599594712257385, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.9929472208023071, "rewards/repeat_penalty/std": 0.006425357423722744, "rewards/repeat_floor/mean": 0.9989420771598816, "rewards/repeat_floor/std": 0.0009637992479838431, "rewards/near_duplicate_penalty/mean": 0.9929472208023071, "rewards/near_duplicate_penalty/std": 0.006425357423722744, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.039745062589645386, "rewards/total_composite/std": 0.040800224989652634, "reward": 0.039745062589645386, "reward_std": 0.040800221264362335, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22394897043704987, "sampling/sampling_logp_difference/max": 1.5978527069091797, "sampling/importance_sampling_ratio/min": 0.20233049988746643, "sampling/importance_sampling_ratio/mean": 1.0648385286331177, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8074288964271545, "clip_ratio/low_mean": 0.09691987931728363, "clip_ratio/low_min": 0.09691987931728363, "clip_ratio/high_mean": 0.07455702871084213, "clip_ratio/high_max": 0.07455702871084213, "clip_ratio/region_mean": 0.17147690802812576, "reward_total_mean": 0.039745062589645386, "reward_meter_mean": 0.28334954380989075, "reward_meter_std": 0.33286550641059875, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9006118178367615, "reward_lexical_plausibility_std": 0.20599594712257385, "reward_repeat_penalty_mean": 0.9929472208023071, "reward_repeat_penalty_std": 0.006425357423722744, "reward_repeat_floor_mean": 0.9989420771598816, "reward_repeat_floor_std": 0.0009637992479838431, "reward_near_duplicate_penalty_mean": 0.9929472208023071, "reward_near_duplicate_penalty_std": 0.006425357423722744, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.039745062589645386, "reward_total_composite_std": 0.040800224989652634} {"timestamp_utc": "2026-04-12T16:32:32Z", "mode": "train", "global_step": 161, "epoch": 0.008473238250618388, "loss": 0.0495, "grad_norm": 1.618666648864746, "learning_rate": 9.515151515151516e-06, "num_tokens": 313485.0, "completions/mean_length": 435.5, "completions/min_length": 307.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 359.0, "completions/min_terminated_length": 307.0, "completions/max_terminated_length": 392.0, "rewards/meter/mean": 0.026769960299134254, "rewards/meter/std": 0.0258164219558239, "rewards/count_adherence/mean": 0.6911765336990356, "rewards/count_adherence/std": 0.23894231021404266, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9073529243469238, "rewards/count_floor/std": 0.07168269902467728, "rewards/lexical_plausibility/mean": 0.7938939332962036, "rewards/lexical_plausibility/std": 0.22051064670085907, "rewards/judge_quality/mean": 0.10000000149011612, "rewards/judge_quality/std": 0.053452253341674805, "rewards/repeat_penalty/mean": 0.9705691337585449, "rewards/repeat_penalty/std": 0.04052077978849411, "rewards/repeat_floor/mean": 0.997039794921875, "rewards/repeat_floor/std": 0.003988719079643488, "rewards/near_duplicate_penalty/mean": 0.9952114224433899, "rewards/near_duplicate_penalty/std": 0.004913213662803173, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9750899076461792, "rewards/distinct_2/std": 0.03648589551448822, "rewards/total_composite/mean": 0.0027222498320043087, "rewards/total_composite/std": 0.003158347448334098, "reward": 0.0027222498320043087, "reward_std": 0.003158347215503454, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2468816339969635, "sampling/sampling_logp_difference/max": 1.328948974609375, "sampling/importance_sampling_ratio/min": 0.26475536823272705, "sampling/importance_sampling_ratio/mean": 1.0749328136444092, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4229578971862793, "clip_ratio/low_mean": 0.06084258295595646, "clip_ratio/low_min": 0.06084258295595646, "clip_ratio/high_mean": 0.02207792177796364, "clip_ratio/high_max": 0.02207792177796364, "clip_ratio/region_mean": 0.0829205047339201, "reward_total_mean": 0.0027222498320043087, "reward_meter_mean": 0.026769960299134254, "reward_meter_std": 0.0258164219558239, "reward_count_adherence_mean": 0.6911765336990356, "reward_count_adherence_std": 0.23894231021404266, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9073529243469238, "reward_count_floor_std": 0.07168269902467728, "reward_lexical_plausibility_mean": 0.7938939332962036, "reward_lexical_plausibility_std": 0.22051064670085907, "reward_repeat_penalty_mean": 0.9705691337585449, "reward_repeat_penalty_std": 0.04052077978849411, "reward_repeat_floor_mean": 0.997039794921875, "reward_repeat_floor_std": 0.003988719079643488, "reward_near_duplicate_penalty_mean": 0.9952114224433899, "reward_near_duplicate_penalty_std": 0.004913213662803173, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9750899076461792, "reward_distinct_2_std": 0.03648589551448822, "reward_judge_quality_mean": 0.10000000149011612, "reward_judge_quality_std": 0.053452253341674805, "reward_total_composite_mean": 0.0027222498320043087, "reward_total_composite_std": 0.003158347448334098} {"timestamp_utc": "2026-04-12T16:32:41Z", "mode": "train", "global_step": 162, "epoch": 0.00852586705962844, "loss": 0.0407, "grad_norm": 23.070953369140625, "learning_rate": 9.512121212121213e-06, "num_tokens": 315070.0, "completions/mean_length": 28.125, "completions/min_length": 21.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.125, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.6077741384506226, "rewards/meter/std": 0.3664523959159851, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6974999904632568, "rewards/judge_quality/std": 0.25172266364097595, "rewards/repeat_penalty/mean": 0.9586921334266663, "rewards/repeat_penalty/std": 0.03407951444387436, "rewards/repeat_floor/mean": 0.9945210814476013, "rewards/repeat_floor/std": 0.004034711048007011, "rewards/near_duplicate_penalty/mean": 0.9706853628158569, "rewards/near_duplicate_penalty/std": 0.027476971969008446, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9879807829856873, "rewards/distinct_2/std": 0.03399552404880524, "rewards/total_composite/mean": 0.4812217652797699, "rewards/total_composite/std": 0.35587385296821594, "reward": 0.4812217652797699, "reward_std": 0.35587382316589355, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1815616935491562, "sampling/sampling_logp_difference/max": 1.334096908569336, "sampling/importance_sampling_ratio/min": 0.26339593529701233, "sampling/importance_sampling_ratio/mean": 1.0680123567581177, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3512811288237572, "clip_ratio/low_mean": 0.10988849867135286, "clip_ratio/low_min": 0.10988849867135286, "clip_ratio/high_mean": 0.08059663884341717, "clip_ratio/high_max": 0.08059663884341717, "clip_ratio/region_mean": 0.19048513751477003, "reward_total_mean": 0.4812217652797699, "reward_meter_mean": 0.6077741384506226, "reward_meter_std": 0.3664523959159851, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9586921334266663, "reward_repeat_penalty_std": 0.03407951444387436, "reward_repeat_floor_mean": 0.9945210814476013, "reward_repeat_floor_std": 0.004034711048007011, "reward_near_duplicate_penalty_mean": 0.9706853628158569, "reward_near_duplicate_penalty_std": 0.027476971969008446, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9879807829856873, "reward_distinct_2_std": 0.03399552404880524, "reward_judge_quality_mean": 0.6974999904632568, "reward_judge_quality_std": 0.25172266364097595, "reward_total_composite_mean": 0.4812217652797699, "reward_total_composite_std": 0.35587385296821594} {"timestamp_utc": "2026-04-12T16:32:49Z", "mode": "train", "global_step": 163, "epoch": 0.008578495868638493, "loss": 0.0529, "grad_norm": 17.180492401123047, "learning_rate": 9.50909090909091e-06, "num_tokens": 316574.0, "completions/mean_length": 38.0, "completions/min_length": 27.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.0, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.510293185710907, "rewards/meter/std": 0.4052880108356476, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7350000143051147, "rewards/judge_quality/std": 0.2655990719795227, "rewards/repeat_penalty/mean": 0.9861856698989868, "rewards/repeat_penalty/std": 0.01695219799876213, "rewards/repeat_floor/mean": 0.9979279041290283, "rewards/repeat_floor/std": 0.002542835893109441, "rewards/near_duplicate_penalty/mean": 0.9861856698989868, "rewards/near_duplicate_penalty/std": 0.01695219799876213, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3274025619029999, "rewards/total_composite/std": 0.27338168025016785, "reward": 0.3274025619029999, "reward_std": 0.27338168025016785, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16291232407093048, "sampling/sampling_logp_difference/max": 2.105924606323242, "sampling/importance_sampling_ratio/min": 0.12173306196928024, "sampling/importance_sampling_ratio/mean": 1.0006645917892456, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7504936307668686, "clip_ratio/low_mean": 0.08019230980426073, "clip_ratio/low_min": 0.08019230980426073, "clip_ratio/high_mean": 0.07817300595343113, "clip_ratio/high_max": 0.07817300595343113, "clip_ratio/region_mean": 0.15836531575769186, "reward_total_mean": 0.3274025619029999, "reward_meter_mean": 0.510293185710907, "reward_meter_std": 0.4052880108356476, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9861856698989868, "reward_repeat_penalty_std": 0.01695219799876213, "reward_repeat_floor_mean": 0.9979279041290283, "reward_repeat_floor_std": 0.002542835893109441, "reward_near_duplicate_penalty_mean": 0.9861856698989868, "reward_near_duplicate_penalty_std": 0.01695219799876213, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7350000143051147, "reward_judge_quality_std": 0.2655990719795227, "reward_total_composite_mean": 0.3274025619029999, "reward_total_composite_std": 0.27338168025016785} {"timestamp_utc": "2026-04-12T16:32:59Z", "mode": "train", "global_step": 164, "epoch": 0.008631124677648545, "loss": 0.0941, "grad_norm": 8.719386100769043, "learning_rate": 9.506060606060606e-06, "num_tokens": 319141.0, "completions/mean_length": 119.875, "completions/min_length": 92.0, "completions/max_length": 168.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 119.875, "completions/min_terminated_length": 92.0, "completions/max_terminated_length": 168.0, "rewards/meter/mean": 0.25987565517425537, "rewards/meter/std": 0.3236730992794037, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9850000143051147, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 0.9806985259056091, "rewards/lexical_plausibility/std": 0.054592814296483994, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9858438968658447, "rewards/repeat_penalty/std": 0.020412007346749306, "rewards/repeat_floor/mean": 0.9982364177703857, "rewards/repeat_floor/std": 0.0021149625536054373, "rewards/near_duplicate_penalty/mean": 0.9919647574424744, "rewards/near_duplicate_penalty/std": 0.0065601542592048645, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9937965273857117, "rewards/distinct_2/std": 0.017546070739626884, "rewards/total_composite/mean": 0.09222100675106049, "rewards/total_composite/std": 0.11238480359315872, "reward": 0.09222100675106049, "reward_std": 0.11238480359315872, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22538737952709198, "sampling/sampling_logp_difference/max": 1.495957374572754, "sampling/importance_sampling_ratio/min": 0.22403402626514435, "sampling/importance_sampling_ratio/mean": 1.0768688917160034, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.218059927225113, "clip_ratio/low_mean": 0.10372049733996391, "clip_ratio/low_min": 0.10372049733996391, "clip_ratio/high_mean": 0.06451714038848877, "clip_ratio/high_max": 0.06451714038848877, "clip_ratio/region_mean": 0.16823763772845268, "reward_total_mean": 0.09222100675106049, "reward_meter_mean": 0.25987565517425537, "reward_meter_std": 0.3236730992794037, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9850000143051147, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 0.9806985259056091, "reward_lexical_plausibility_std": 0.054592814296483994, "reward_repeat_penalty_mean": 0.9858438968658447, "reward_repeat_penalty_std": 0.020412007346749306, "reward_repeat_floor_mean": 0.9982364177703857, "reward_repeat_floor_std": 0.0021149625536054373, "reward_near_duplicate_penalty_mean": 0.9919647574424744, "reward_near_duplicate_penalty_std": 0.0065601542592048645, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9937965273857117, "reward_distinct_2_std": 0.017546070739626884, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.09222100675106049, "reward_total_composite_std": 0.11238480359315872} {"timestamp_utc": "2026-04-12T16:33:08Z", "mode": "train", "global_step": 165, "epoch": 0.008683753486658598, "loss": 0.2982, "grad_norm": 14.512274742126465, "learning_rate": 9.503030303030303e-06, "num_tokens": 320704.0, "completions/mean_length": 45.375, "completions/min_length": 21.0, "completions/max_length": 85.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.375, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 85.0, "rewards/meter/mean": 0.5098780989646912, "rewards/meter/std": 0.5024057030677795, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.37796446681022644, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.11338934302330017, "rewards/lexical_plausibility/mean": 0.9523521661758423, "rewards/lexical_plausibility/std": 0.10907252132892609, "rewards/judge_quality/mean": 0.42500001192092896, "rewards/judge_quality/std": 0.23754698038101196, "rewards/repeat_penalty/mean": 0.9246719479560852, "rewards/repeat_penalty/std": 0.11142340302467346, "rewards/repeat_floor/mean": 0.9947507381439209, "rewards/repeat_floor/std": 0.006766745820641518, "rewards/near_duplicate_penalty/mean": 0.9945298433303833, "rewards/near_duplicate_penalty/std": 0.01021417137235403, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9924585223197937, "rewards/distinct_2/std": 0.021330520510673523, "rewards/total_composite/mean": 0.23539981245994568, "rewards/total_composite/std": 0.28147608041763306, "reward": 0.23539981245994568, "reward_std": 0.28147611021995544, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.25541940331459045, "sampling/sampling_logp_difference/max": 1.4899091720581055, "sampling/importance_sampling_ratio/min": 0.2253931164741516, "sampling/importance_sampling_ratio/mean": 1.0630767345428467, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7429435700178146, "clip_ratio/low_mean": 0.09702238254249096, "clip_ratio/low_min": 0.09702238254249096, "clip_ratio/high_mean": 0.08932022284716368, "clip_ratio/high_max": 0.08932022284716368, "clip_ratio/region_mean": 0.18634260538965464, "reward_total_mean": 0.23539981245994568, "reward_meter_mean": 0.5098780989646912, "reward_meter_std": 0.5024057030677795, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.37796446681022644, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.11338934302330017, "reward_lexical_plausibility_mean": 0.9523521661758423, "reward_lexical_plausibility_std": 0.10907252132892609, "reward_repeat_penalty_mean": 0.9246719479560852, "reward_repeat_penalty_std": 0.11142340302467346, "reward_repeat_floor_mean": 0.9947507381439209, "reward_repeat_floor_std": 0.006766745820641518, "reward_near_duplicate_penalty_mean": 0.9945298433303833, "reward_near_duplicate_penalty_std": 0.01021417137235403, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9924585223197937, "reward_distinct_2_std": 0.021330520510673523, "reward_judge_quality_mean": 0.42500001192092896, "reward_judge_quality_std": 0.23754698038101196, "reward_total_composite_mean": 0.23539981245994568, "reward_total_composite_std": 0.28147608041763306} {"timestamp_utc": "2026-04-12T16:33:22Z", "mode": "train", "global_step": 166, "epoch": 0.008736382295668648, "loss": 0.0185, "grad_norm": 5.241777420043945, "learning_rate": 9.5e-06, "num_tokens": 322245.0, "completions/mean_length": 109.625, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 52.142860412597656, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.38890665769577026, "rewards/meter/std": 0.36653921008110046, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.9624999761581421, "rewards/arabic_floor/std": 0.06943649053573608, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9018011093139648, "rewards/lexical_plausibility/std": 0.2394527643918991, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.29001232981681824, "rewards/repeat_penalty/mean": 0.9259210824966431, "rewards/repeat_penalty/std": 0.13395890593528748, "rewards/repeat_floor/mean": 0.9946435689926147, "rewards/repeat_floor/std": 0.009626256301999092, "rewards/near_duplicate_penalty/mean": 0.9957007169723511, "rewards/near_duplicate_penalty/std": 0.0070299566723406315, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.19523629546165466, "rewards/total_composite/std": 0.2460174411535263, "reward": 0.19523629546165466, "reward_std": 0.2460174411535263, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.218777135014534, "sampling/sampling_logp_difference/max": 1.8099956512451172, "sampling/importance_sampling_ratio/min": 0.1636548489332199, "sampling/importance_sampling_ratio/mean": 1.0517387390136719, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.281535819172859, "clip_ratio/low_mean": 0.09778554923832417, "clip_ratio/low_min": 0.09778554923832417, "clip_ratio/high_mean": 0.054242050275206566, "clip_ratio/high_max": 0.054242050275206566, "clip_ratio/region_mean": 0.15202759951353073, "reward_total_mean": 0.19523629546165466, "reward_meter_mean": 0.38890665769577026, "reward_meter_std": 0.36653921008110046, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.9624999761581421, "reward_arabic_floor_std": 0.06943649053573608, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9018011093139648, "reward_lexical_plausibility_std": 0.2394527643918991, "reward_repeat_penalty_mean": 0.9259210824966431, "reward_repeat_penalty_std": 0.13395890593528748, "reward_repeat_floor_mean": 0.9946435689926147, "reward_repeat_floor_std": 0.009626256301999092, "reward_near_duplicate_penalty_mean": 0.9957007169723511, "reward_near_duplicate_penalty_std": 0.0070299566723406315, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.29001232981681824, "reward_total_composite_mean": 0.19523629546165466, "reward_total_composite_std": 0.2460174411535263} {"timestamp_utc": "2026-04-12T16:33:32Z", "mode": "train", "global_step": 167, "epoch": 0.0087890111046787, "loss": 0.0312, "grad_norm": 12.906083106994629, "learning_rate": 9.496969696969698e-06, "num_tokens": 324231.0, "completions/mean_length": 79.25, "completions/min_length": 64.0, "completions/max_length": 92.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.25, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.1399468183517456, "rewards/meter/std": 0.11115916073322296, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9864832758903503, "rewards/lexical_plausibility/std": 0.03823106735944748, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9820793271064758, "rewards/repeat_penalty/std": 0.015891199931502342, "rewards/repeat_floor/mean": 0.997779130935669, "rewards/repeat_floor/std": 0.0016564702382311225, "rewards/near_duplicate_penalty/mean": 0.9899773001670837, "rewards/near_duplicate_penalty/std": 0.00716781709343195, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9920282363891602, "rewards/distinct_2/std": 0.014811928384006023, "rewards/total_composite/mean": 0.0491066500544548, "rewards/total_composite/std": 0.04577239602804184, "reward": 0.0491066500544548, "reward_std": 0.04577239602804184, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24595601856708527, "sampling/sampling_logp_difference/max": 1.7702323198318481, "sampling/importance_sampling_ratio/min": 0.1702934205532074, "sampling/importance_sampling_ratio/mean": 1.049609661102295, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7938202917575836, "clip_ratio/low_mean": 0.14112098701298237, "clip_ratio/low_min": 0.14112098701298237, "clip_ratio/high_mean": 0.057857686653733253, "clip_ratio/high_max": 0.057857686653733253, "clip_ratio/region_mean": 0.19897867366671562, "reward_total_mean": 0.0491066500544548, "reward_meter_mean": 0.1399468183517456, "reward_meter_std": 0.11115916073322296, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9864832758903503, "reward_lexical_plausibility_std": 0.03823106735944748, "reward_repeat_penalty_mean": 0.9820793271064758, "reward_repeat_penalty_std": 0.015891199931502342, "reward_repeat_floor_mean": 0.997779130935669, "reward_repeat_floor_std": 0.0016564702382311225, "reward_near_duplicate_penalty_mean": 0.9899773001670837, "reward_near_duplicate_penalty_std": 0.00716781709343195, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9920282363891602, "reward_distinct_2_std": 0.014811928384006023, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.0491066500544548, "reward_total_composite_std": 0.04577239602804184} {"timestamp_utc": "2026-04-12T16:33:45Z", "mode": "train", "global_step": 168, "epoch": 0.008841639913688753, "loss": 0.0082, "grad_norm": 3.6465823650360107, "learning_rate": 9.493939393939395e-06, "num_tokens": 327106.0, "completions/mean_length": 298.375, "completions/min_length": 176.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 227.1666717529297, "completions/min_terminated_length": 176.0, "completions/max_terminated_length": 456.0, "rewards/meter/mean": 0.46919679641723633, "rewards/meter/std": 0.3492467403411865, "rewards/count_adherence/mean": 0.828125, "rewards/count_adherence/std": 0.11451567709445953, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9484374523162842, "rewards/count_floor/std": 0.03435469791293144, "rewards/lexical_plausibility/mean": 0.8188076019287109, "rewards/lexical_plausibility/std": 0.19052761793136597, "rewards/judge_quality/mean": 0.11250000447034836, "rewards/judge_quality/std": 0.051754921674728394, "rewards/repeat_penalty/mean": 0.9575713872909546, "rewards/repeat_penalty/std": 0.07485056668519974, "rewards/repeat_floor/mean": 0.9963113069534302, "rewards/repeat_floor/std": 0.0055867028422653675, "rewards/near_duplicate_penalty/mean": 0.9936656951904297, "rewards/near_duplicate_penalty/std": 0.006218735594302416, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9695711731910706, "rewards/distinct_2/std": 0.0545896552503109, "rewards/total_composite/mean": 0.05623955279588699, "rewards/total_composite/std": 0.05702324956655502, "reward": 0.05623955279588699, "reward_std": 0.057023245841264725, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22682708501815796, "sampling/sampling_logp_difference/max": 1.3170084953308105, "sampling/importance_sampling_ratio/min": 0.2679356336593628, "sampling/importance_sampling_ratio/mean": 1.0585166215896606, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.532101571559906, "clip_ratio/low_mean": 0.04777298215776682, "clip_ratio/low_min": 0.04777298215776682, "clip_ratio/high_mean": 0.06866891868412495, "clip_ratio/high_max": 0.06866891868412495, "clip_ratio/region_mean": 0.11644190084189177, "reward_total_mean": 0.05623955279588699, "reward_meter_mean": 0.46919679641723633, "reward_meter_std": 0.3492467403411865, "reward_count_adherence_mean": 0.828125, "reward_count_adherence_std": 0.11451567709445953, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9484374523162842, "reward_count_floor_std": 0.03435469791293144, "reward_lexical_plausibility_mean": 0.8188076019287109, "reward_lexical_plausibility_std": 0.19052761793136597, "reward_repeat_penalty_mean": 0.9575713872909546, "reward_repeat_penalty_std": 0.07485056668519974, "reward_repeat_floor_mean": 0.9963113069534302, "reward_repeat_floor_std": 0.0055867028422653675, "reward_near_duplicate_penalty_mean": 0.9936656951904297, "reward_near_duplicate_penalty_std": 0.006218735594302416, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9695711731910706, "reward_distinct_2_std": 0.0545896552503109, "reward_judge_quality_mean": 0.11250000447034836, "reward_judge_quality_std": 0.051754921674728394, "reward_total_composite_mean": 0.05623955279588699, "reward_total_composite_std": 0.05702324956655502} {"timestamp_utc": "2026-04-12T16:33:56Z", "mode": "train", "global_step": 169, "epoch": 0.008894268722698806, "loss": 0.1387, "grad_norm": 7.401317596435547, "learning_rate": 9.490909090909092e-06, "num_tokens": 329621.0, "completions/mean_length": 129.375, "completions/min_length": 73.0, "completions/max_length": 272.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 129.375, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 272.0, "rewards/meter/mean": 0.23914751410484314, "rewards/meter/std": 0.31655964255332947, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9106929302215576, "rewards/lexical_plausibility/std": 0.2039894312620163, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.9846621155738831, "rewards/repeat_penalty/std": 0.01714184693992138, "rewards/repeat_floor/mean": 0.9981511831283569, "rewards/repeat_floor/std": 0.0017984056612476707, "rewards/near_duplicate_penalty/mean": 0.9923198223114014, "rewards/near_duplicate_penalty/std": 0.005941803567111492, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9922581315040588, "rewards/distinct_2/std": 0.014396161772310734, "rewards/total_composite/mean": 0.04120022431015968, "rewards/total_composite/std": 0.04593072086572647, "reward": 0.04120022431015968, "reward_std": 0.045930713415145874, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24399013817310333, "sampling/sampling_logp_difference/max": 1.256594181060791, "sampling/importance_sampling_ratio/min": 0.2846217453479767, "sampling/importance_sampling_ratio/mean": 1.0619888305664062, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.7711445093154907, "clip_ratio/low_mean": 0.12760332319885492, "clip_ratio/low_min": 0.12760332319885492, "clip_ratio/high_mean": 0.07233880087733269, "clip_ratio/high_max": 0.07233880087733269, "clip_ratio/region_mean": 0.1999421240761876, "reward_total_mean": 0.04120022431015968, "reward_meter_mean": 0.23914751410484314, "reward_meter_std": 0.31655964255332947, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9106929302215576, "reward_lexical_plausibility_std": 0.2039894312620163, "reward_repeat_penalty_mean": 0.9846621155738831, "reward_repeat_penalty_std": 0.01714184693992138, "reward_repeat_floor_mean": 0.9981511831283569, "reward_repeat_floor_std": 0.0017984056612476707, "reward_near_duplicate_penalty_mean": 0.9923198223114014, "reward_near_duplicate_penalty_std": 0.005941803567111492, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9922581315040588, "reward_distinct_2_std": 0.014396161772310734, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.04120022431015968, "reward_total_composite_std": 0.04593072086572647} {"timestamp_utc": "2026-04-12T16:34:04Z", "mode": "train", "global_step": 170, "epoch": 0.008946897531708858, "loss": 0.1843, "grad_norm": 14.099448204040527, "learning_rate": 9.487878787878788e-06, "num_tokens": 331351.0, "completions/mean_length": 41.25, "completions/min_length": 28.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.25, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.3891289234161377, "rewards/meter/std": 0.49643561244010925, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9196504354476929, "rewards/lexical_plausibility/std": 0.15237295627593994, "rewards/judge_quality/mean": 0.5, "rewards/judge_quality/std": 0.26613637804985046, "rewards/repeat_penalty/mean": 0.9899561405181885, "rewards/repeat_penalty/std": 0.012933881022036076, "rewards/repeat_floor/mean": 0.9984934329986572, "rewards/repeat_floor/std": 0.0019400803139433265, "rewards/near_duplicate_penalty/mean": 0.9899561405181885, "rewards/near_duplicate_penalty/std": 0.012933881022036076, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2277049720287323, "rewards/total_composite/std": 0.32318681478500366, "reward": 0.2277049720287323, "reward_std": 0.3231867849826813, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23590445518493652, "sampling/sampling_logp_difference/max": 1.0857219696044922, "sampling/importance_sampling_ratio/min": 0.3376579284667969, "sampling/importance_sampling_ratio/mean": 1.066724181175232, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.8991546034812927, "clip_ratio/low_mean": 0.11641414184123278, "clip_ratio/low_min": 0.11641414184123278, "clip_ratio/high_mean": 0.05895737465471029, "clip_ratio/high_max": 0.05895737465471029, "clip_ratio/region_mean": 0.17537151649594307, "reward_total_mean": 0.2277049720287323, "reward_meter_mean": 0.3891289234161377, "reward_meter_std": 0.49643561244010925, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9196504354476929, "reward_lexical_plausibility_std": 0.15237295627593994, "reward_repeat_penalty_mean": 0.9899561405181885, "reward_repeat_penalty_std": 0.012933881022036076, "reward_repeat_floor_mean": 0.9984934329986572, "reward_repeat_floor_std": 0.0019400803139433265, "reward_near_duplicate_penalty_mean": 0.9899561405181885, "reward_near_duplicate_penalty_std": 0.012933881022036076, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5, "reward_judge_quality_std": 0.26613637804985046, "reward_total_composite_mean": 0.2277049720287323, "reward_total_composite_std": 0.32318681478500366} {"timestamp_utc": "2026-04-12T16:34:14Z", "mode": "train", "global_step": 171, "epoch": 0.008999526340718909, "loss": 0.2631, "grad_norm": 12.088873863220215, "learning_rate": 9.484848484848485e-06, "num_tokens": 332990.0, "completions/mean_length": 53.875, "completions/min_length": 33.0, "completions/max_length": 83.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.875, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 83.0, "rewards/meter/mean": 0.5055831074714661, "rewards/meter/std": 0.45644906163215637, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9804325103759766, "rewards/lexical_plausibility/std": 0.03285950794816017, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.25035688281059265, "rewards/repeat_penalty/mean": 0.9683129191398621, "rewards/repeat_penalty/std": 0.08822023123502731, "rewards/repeat_floor/mean": 0.9980594515800476, "rewards/repeat_floor/std": 0.005279997363686562, "rewards/near_duplicate_penalty/mean": 0.9995629191398621, "rewards/near_duplicate_penalty/std": 0.0012362091802060604, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2332489937543869, "rewards/total_composite/std": 0.28420260548591614, "reward": 0.2332489937543869, "reward_std": 0.28420257568359375, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23966380953788757, "sampling/sampling_logp_difference/max": 1.5754125118255615, "sampling/importance_sampling_ratio/min": 0.2928496301174164, "sampling/importance_sampling_ratio/mean": 1.0594810247421265, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.178064525127411, "clip_ratio/low_mean": 0.10319321043789387, "clip_ratio/low_min": 0.10319321043789387, "clip_ratio/high_mean": 0.07592468895018101, "clip_ratio/high_max": 0.07592468895018101, "clip_ratio/region_mean": 0.17911789938807487, "reward_total_mean": 0.2332489937543869, "reward_meter_mean": 0.5055831074714661, "reward_meter_std": 0.45644906163215637, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9804325103759766, "reward_lexical_plausibility_std": 0.03285950794816017, "reward_repeat_penalty_mean": 0.9683129191398621, "reward_repeat_penalty_std": 0.08822023123502731, "reward_repeat_floor_mean": 0.9980594515800476, "reward_repeat_floor_std": 0.005279997363686562, "reward_near_duplicate_penalty_mean": 0.9995629191398621, "reward_near_duplicate_penalty_std": 0.0012362091802060604, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.25035688281059265, "reward_total_composite_mean": 0.2332489937543869, "reward_total_composite_std": 0.28420260548591614} {"timestamp_utc": "2026-04-12T16:34:28Z", "mode": "train", "global_step": 172, "epoch": 0.009052155149728961, "loss": 0.0568, "grad_norm": 6.325699806213379, "learning_rate": 9.481818181818182e-06, "num_tokens": 334935.0, "completions/mean_length": 136.125, "completions/min_length": 59.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 82.42857360839844, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 182.0, "rewards/meter/mean": 0.5953339338302612, "rewards/meter/std": 0.3515208959579468, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.2651650309562683, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.953125, "rewards/count_floor/std": 0.07954952120780945, "rewards/lexical_plausibility/mean": 0.8813091516494751, "rewards/lexical_plausibility/std": 0.25190088152885437, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.9240643382072449, "rewards/repeat_penalty/std": 0.15501122176647186, "rewards/repeat_floor/mean": 0.9928107857704163, "rewards/repeat_floor/std": 0.013184435665607452, "rewards/near_duplicate_penalty/mean": 0.9815835952758789, "rewards/near_duplicate_penalty/std": 0.023980464786291122, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9508135914802551, "rewards/distinct_2/std": 0.10906938463449478, "rewards/total_composite/mean": 0.21437200903892517, "rewards/total_composite/std": 0.154502272605896, "reward": 0.21437200903892517, "reward_std": 0.154502272605896, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2241189181804657, "sampling/sampling_logp_difference/max": 1.5689411163330078, "sampling/importance_sampling_ratio/min": 0.20826558768749237, "sampling/importance_sampling_ratio/mean": 1.0423859357833862, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6517246663570404, "clip_ratio/low_mean": 0.04110402427613735, "clip_ratio/low_min": 0.04110402427613735, "clip_ratio/high_mean": 0.1448630504310131, "clip_ratio/high_max": 0.1448630504310131, "clip_ratio/region_mean": 0.18596707470715046, "reward_total_mean": 0.21437200903892517, "reward_meter_mean": 0.5953339338302612, "reward_meter_std": 0.3515208959579468, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.2651650309562683, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.953125, "reward_count_floor_std": 0.07954952120780945, "reward_lexical_plausibility_mean": 0.8813091516494751, "reward_lexical_plausibility_std": 0.25190088152885437, "reward_repeat_penalty_mean": 0.9240643382072449, "reward_repeat_penalty_std": 0.15501122176647186, "reward_repeat_floor_mean": 0.9928107857704163, "reward_repeat_floor_std": 0.013184435665607452, "reward_near_duplicate_penalty_mean": 0.9815835952758789, "reward_near_duplicate_penalty_std": 0.023980464786291122, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9508135914802551, "reward_distinct_2_std": 0.10906938463449478, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.21437200903892517, "reward_total_composite_std": 0.154502272605896} {"timestamp_utc": "2026-04-12T16:34:36Z", "mode": "train", "global_step": 173, "epoch": 0.009104783958739013, "loss": 0.1524, "grad_norm": 15.391106605529785, "learning_rate": 9.47878787878788e-06, "num_tokens": 336529.0, "completions/mean_length": 39.25, "completions/min_length": 28.0, "completions/max_length": 58.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.25, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.6029083728790283, "rewards/meter/std": 0.4984326660633087, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9895833730697632, "rewards/lexical_plausibility/std": 0.029462775215506554, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.25670650601387024, "rewards/repeat_penalty/mean": 0.9780707359313965, "rewards/repeat_penalty/std": 0.04785861819982529, "rewards/repeat_floor/mean": 0.9973043203353882, "rewards/repeat_floor/std": 0.005578472279012203, "rewards/near_duplicate_penalty/mean": 0.9888160228729248, "rewards/near_duplicate_penalty/std": 0.02026197873055935, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9886877536773682, "rewards/distinct_2/std": 0.031995780766010284, "rewards/total_composite/mean": 0.26817238330841064, "rewards/total_composite/std": 0.3063661754131317, "reward": 0.26817238330841064, "reward_std": 0.3063661754131317, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24825410544872284, "sampling/sampling_logp_difference/max": 1.511880874633789, "sampling/importance_sampling_ratio/min": 0.2204948514699936, "sampling/importance_sampling_ratio/mean": 1.0907857418060303, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.249059647321701, "clip_ratio/low_mean": 0.11488499492406845, "clip_ratio/low_min": 0.11488499492406845, "clip_ratio/high_mean": 0.09170249849557877, "clip_ratio/high_max": 0.09170249849557877, "clip_ratio/region_mean": 0.20658749341964722, "reward_total_mean": 0.26817238330841064, "reward_meter_mean": 0.6029083728790283, "reward_meter_std": 0.4984326660633087, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9895833730697632, "reward_lexical_plausibility_std": 0.029462775215506554, "reward_repeat_penalty_mean": 0.9780707359313965, "reward_repeat_penalty_std": 0.04785861819982529, "reward_repeat_floor_mean": 0.9973043203353882, "reward_repeat_floor_std": 0.005578472279012203, "reward_near_duplicate_penalty_mean": 0.9888160228729248, "reward_near_duplicate_penalty_std": 0.02026197873055935, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9886877536773682, "reward_distinct_2_std": 0.031995780766010284, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.25670650601387024, "reward_total_composite_mean": 0.26817238330841064, "reward_total_composite_std": 0.3063661754131317} {"timestamp_utc": "2026-04-12T16:34:45Z", "mode": "train", "global_step": 174, "epoch": 0.009157412767749066, "loss": 0.013, "grad_norm": 14.048095703125, "learning_rate": 9.475757575757577e-06, "num_tokens": 338062.0, "completions/mean_length": 39.625, "completions/min_length": 35.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.625, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.36875519156455994, "rewards/meter/std": 0.3963353931903839, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9579613208770752, "rewards/lexical_plausibility/std": 0.06439344584941864, "rewards/judge_quality/mean": 0.35874998569488525, "rewards/judge_quality/std": 0.26029860973358154, "rewards/repeat_penalty/mean": 0.9898826479911804, "rewards/repeat_penalty/std": 0.011895010247826576, "rewards/repeat_floor/mean": 0.9984824061393738, "rewards/repeat_floor/std": 0.0017842425731942058, "rewards/near_duplicate_penalty/mean": 0.9898826479911804, "rewards/near_duplicate_penalty/std": 0.011895010247826576, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20255500078201294, "rewards/total_composite/std": 0.30077502131462097, "reward": 0.20255500078201294, "reward_std": 0.30077502131462097, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20269235968589783, "sampling/sampling_logp_difference/max": 1.1932525634765625, "sampling/importance_sampling_ratio/min": 0.30323338508605957, "sampling/importance_sampling_ratio/mean": 1.0353174209594727, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.374999389052391, "clip_ratio/low_mean": 0.130195040255785, "clip_ratio/low_min": 0.130195040255785, "clip_ratio/high_mean": 0.05330598400905728, "clip_ratio/high_max": 0.05330598400905728, "clip_ratio/region_mean": 0.18350102426484227, "reward_total_mean": 0.20255500078201294, "reward_meter_mean": 0.36875519156455994, "reward_meter_std": 0.3963353931903839, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9579613208770752, "reward_lexical_plausibility_std": 0.06439344584941864, "reward_repeat_penalty_mean": 0.9898826479911804, "reward_repeat_penalty_std": 0.011895010247826576, "reward_repeat_floor_mean": 0.9984824061393738, "reward_repeat_floor_std": 0.0017842425731942058, "reward_near_duplicate_penalty_mean": 0.9898826479911804, "reward_near_duplicate_penalty_std": 0.011895010247826576, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.35874998569488525, "reward_judge_quality_std": 0.26029860973358154, "reward_total_composite_mean": 0.20255500078201294, "reward_total_composite_std": 0.30077502131462097} {"timestamp_utc": "2026-04-12T16:34:53Z", "mode": "train", "global_step": 175, "epoch": 0.009210041576759118, "loss": 0.1704, "grad_norm": 16.34452247619629, "learning_rate": 9.472727272727274e-06, "num_tokens": 339664.0, "completions/mean_length": 40.25, "completions/min_length": 31.0, "completions/max_length": 58.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.25, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.47447168827056885, "rewards/meter/std": 0.4072783589363098, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9674941897392273, "rewards/lexical_plausibility/std": 0.04732557013630867, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9900354146957397, "rewards/repeat_penalty/std": 0.014336712658405304, "rewards/repeat_floor/mean": 0.9985052943229675, "rewards/repeat_floor/std": 0.0021505055483430624, "rewards/near_duplicate_penalty/mean": 0.9900354146957397, "rewards/near_duplicate_penalty/std": 0.014336712658405304, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13026830554008484, "rewards/total_composite/std": 0.16197744011878967, "reward": 0.13026830554008484, "reward_std": 0.16197744011878967, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2528935372829437, "sampling/sampling_logp_difference/max": 1.213531494140625, "sampling/importance_sampling_ratio/min": 0.2971460521221161, "sampling/importance_sampling_ratio/mean": 1.0664143562316895, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.0034386217594147, "clip_ratio/low_mean": 0.1279802629724145, "clip_ratio/low_min": 0.1279802629724145, "clip_ratio/high_mean": 0.05409564450383186, "clip_ratio/high_max": 0.05409564450383186, "clip_ratio/region_mean": 0.18207590747624636, "reward_total_mean": 0.13026830554008484, "reward_meter_mean": 0.47447168827056885, "reward_meter_std": 0.4072783589363098, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9674941897392273, "reward_lexical_plausibility_std": 0.04732557013630867, "reward_repeat_penalty_mean": 0.9900354146957397, "reward_repeat_penalty_std": 0.014336712658405304, "reward_repeat_floor_mean": 0.9985052943229675, "reward_repeat_floor_std": 0.0021505055483430624, "reward_near_duplicate_penalty_mean": 0.9900354146957397, "reward_near_duplicate_penalty_std": 0.014336712658405304, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.13026830554008484, "reward_total_composite_std": 0.16197744011878967} {"timestamp_utc": "2026-04-12T16:35:06Z", "mode": "train", "global_step": 176, "epoch": 0.00926267038576917, "loss": 0.0399, "grad_norm": 2.9782471656799316, "learning_rate": 9.469696969696971e-06, "num_tokens": 342295.0, "completions/mean_length": 280.875, "completions/min_length": 12.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 203.83334350585938, "completions/min_terminated_length": 12.0, "completions/max_terminated_length": 476.0, "rewards/meter/mean": 0.4379279613494873, "rewards/meter/std": 0.3314565420150757, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.3204349875450134, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.09613049775362015, "rewards/lexical_plausibility/mean": 0.5992525815963745, "rewards/lexical_plausibility/std": 0.26424071192741394, "rewards/judge_quality/mean": 0.0625, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.9964256882667542, "rewards/repeat_penalty/std": 0.003698437474668026, "rewards/repeat_floor/mean": 0.9995236396789551, "rewards/repeat_floor/std": 0.0004962141974829137, "rewards/near_duplicate_penalty/mean": 0.9974220991134644, "rewards/near_duplicate_penalty/std": 0.0034069011453539133, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9990035891532898, "rewards/distinct_2/std": 0.002818275475874543, "rewards/total_composite/mean": 0.028571154922246933, "rewards/total_composite/std": 0.030546991154551506, "reward": 0.028571154922246933, "reward_std": 0.030546991154551506, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21626479923725128, "sampling/sampling_logp_difference/max": 1.0515127182006836, "sampling/importance_sampling_ratio/min": 0.3494087755680084, "sampling/importance_sampling_ratio/mean": 1.0579288005828857, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 4.235089272260666, "clip_ratio/low_mean": 0.04965019319206476, "clip_ratio/low_min": 0.04965019319206476, "clip_ratio/high_mean": 0.06005795765668154, "clip_ratio/high_max": 0.06005795765668154, "clip_ratio/region_mean": 0.1097081508487463, "reward_total_mean": 0.028571154922246933, "reward_meter_mean": 0.4379279613494873, "reward_meter_std": 0.3314565420150757, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.3204349875450134, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.09613049775362015, "reward_lexical_plausibility_mean": 0.5992525815963745, "reward_lexical_plausibility_std": 0.26424071192741394, "reward_repeat_penalty_mean": 0.9964256882667542, "reward_repeat_penalty_std": 0.003698437474668026, "reward_repeat_floor_mean": 0.9995236396789551, "reward_repeat_floor_std": 0.0004962141974829137, "reward_near_duplicate_penalty_mean": 0.9974220991134644, "reward_near_duplicate_penalty_std": 0.0034069011453539133, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9990035891532898, "reward_distinct_2_std": 0.002818275475874543, "reward_judge_quality_mean": 0.0625, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.028571154922246933, "reward_total_composite_std": 0.030546991154551506} {"timestamp_utc": "2026-04-12T16:35:19Z", "mode": "train", "global_step": 177, "epoch": 0.009315299194779221, "loss": 0.2103, "grad_norm": 4.683366775512695, "learning_rate": 9.466666666666667e-06, "num_tokens": 343915.0, "completions/mean_length": 114.5, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 57.71428680419922, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 280.0, "rewards/meter/mean": 0.48603808879852295, "rewards/meter/std": 0.46289294958114624, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.6432515382766724, "rewards/lexical_plausibility/std": 0.31876441836357117, "rewards/judge_quality/mean": 0.3425000309944153, "rewards/judge_quality/std": 0.3682681620121002, "rewards/repeat_penalty/mean": 0.8125, "rewards/repeat_penalty/std": 0.1157275140285492, "rewards/repeat_floor/mean": 0.9887499809265137, "rewards/repeat_floor/std": 0.0069436440244317055, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.181174635887146, "rewards/total_composite/std": 0.21942174434661865, "reward": 0.181174635887146, "reward_std": 0.21942174434661865, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20456665754318237, "sampling/sampling_logp_difference/max": 1.0288105010986328, "sampling/importance_sampling_ratio/min": 0.35743188858032227, "sampling/importance_sampling_ratio/mean": 1.0502562522888184, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.5841771960258484, "clip_ratio/low_mean": 0.10271092038601637, "clip_ratio/low_min": 0.10271092038601637, "clip_ratio/high_mean": 0.09828431438654661, "clip_ratio/high_max": 0.09828431438654661, "clip_ratio/region_mean": 0.20099523477256298, "reward_total_mean": 0.181174635887146, "reward_meter_mean": 0.48603808879852295, "reward_meter_std": 0.46289294958114624, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.6432515382766724, "reward_lexical_plausibility_std": 0.31876441836357117, "reward_repeat_penalty_mean": 0.8125, "reward_repeat_penalty_std": 0.1157275140285492, "reward_repeat_floor_mean": 0.9887499809265137, "reward_repeat_floor_std": 0.0069436440244317055, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3425000309944153, "reward_judge_quality_std": 0.3682681620121002, "reward_total_composite_mean": 0.181174635887146, "reward_total_composite_std": 0.21942174434661865} {"timestamp_utc": "2026-04-12T16:35:33Z", "mode": "train", "global_step": 178, "epoch": 0.009367928003789274, "loss": -0.0233, "grad_norm": 6.025400638580322, "learning_rate": 9.463636363636364e-06, "num_tokens": 345819.0, "completions/mean_length": 126.0, "completions/min_length": 58.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 70.85714721679688, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.4014953672885895, "rewards/meter/std": 0.3172938823699951, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.953125, "rewards/count_floor/std": 0.05580177903175354, "rewards/lexical_plausibility/mean": 0.8826035261154175, "rewards/lexical_plausibility/std": 0.3079337477684021, "rewards/judge_quality/mean": 0.29999998211860657, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.9888430833816528, "rewards/repeat_penalty/std": 0.010254358872771263, "rewards/repeat_floor/mean": 0.9983264207839966, "rewards/repeat_floor/std": 0.001538152457214892, "rewards/near_duplicate_penalty/mean": 0.9888430833816528, "rewards/near_duplicate_penalty/std": 0.010254358872771263, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13863034546375275, "rewards/total_composite/std": 0.1386062204837799, "reward": 0.13863034546375275, "reward_std": 0.1386062055826187, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21773995459079742, "sampling/sampling_logp_difference/max": 1.9745492935180664, "sampling/importance_sampling_ratio/min": 0.13882386684417725, "sampling/importance_sampling_ratio/mean": 1.04308021068573, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5849375128746033, "clip_ratio/low_mean": 0.09830117598176003, "clip_ratio/low_min": 0.09830117598176003, "clip_ratio/high_mean": 0.06714709103107452, "clip_ratio/high_max": 0.06714709103107452, "clip_ratio/region_mean": 0.16544826701283455, "reward_total_mean": 0.13863034546375275, "reward_meter_mean": 0.4014953672885895, "reward_meter_std": 0.3172938823699951, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.953125, "reward_count_floor_std": 0.05580177903175354, "reward_lexical_plausibility_mean": 0.8826035261154175, "reward_lexical_plausibility_std": 0.3079337477684021, "reward_repeat_penalty_mean": 0.9888430833816528, "reward_repeat_penalty_std": 0.010254358872771263, "reward_repeat_floor_mean": 0.9983264207839966, "reward_repeat_floor_std": 0.001538152457214892, "reward_near_duplicate_penalty_mean": 0.9888430833816528, "reward_near_duplicate_penalty_std": 0.010254358872771263, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.29999998211860657, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.13863034546375275, "reward_total_composite_std": 0.1386062204837799} {"timestamp_utc": "2026-04-12T16:35:47Z", "mode": "train", "global_step": 179, "epoch": 0.009420556812799326, "loss": 0.0374, "grad_norm": 6.673909664154053, "learning_rate": 9.460606060606061e-06, "num_tokens": 347320.0, "completions/mean_length": 106.625, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 48.71428680419922, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.2345580756664276, "rewards/meter/std": 0.3012939989566803, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.7145659923553467, "rewards/lexical_plausibility/std": 0.3297322690486908, "rewards/judge_quality/mean": 0.21249999105930328, "rewards/judge_quality/std": 0.1505940556526184, "rewards/repeat_penalty/mean": 0.982830286026001, "rewards/repeat_penalty/std": 0.027915718033909798, "rewards/repeat_floor/mean": 0.997907280921936, "rewards/repeat_floor/std": 0.002971539506688714, "rewards/near_duplicate_penalty/mean": 0.9910648465156555, "rewards/near_duplicate_penalty/std": 0.010946473106741905, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.0730305165052414, "rewards/total_composite/std": 0.13297533988952637, "reward": 0.0730305165052414, "reward_std": 0.13297533988952637, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2518250644207001, "sampling/sampling_logp_difference/max": 1.1850132942199707, "sampling/importance_sampling_ratio/min": 0.3057421147823334, "sampling/importance_sampling_ratio/mean": 1.0697705745697021, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.3620694875717163, "clip_ratio/low_mean": 0.12779998034238815, "clip_ratio/low_min": 0.12779998034238815, "clip_ratio/high_mean": 0.014285714365541935, "clip_ratio/high_max": 0.014285714365541935, "clip_ratio/region_mean": 0.1420856947079301, "reward_total_mean": 0.0730305165052414, "reward_meter_mean": 0.2345580756664276, "reward_meter_std": 0.3012939989566803, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.7145659923553467, "reward_lexical_plausibility_std": 0.3297322690486908, "reward_repeat_penalty_mean": 0.982830286026001, "reward_repeat_penalty_std": 0.027915718033909798, "reward_repeat_floor_mean": 0.997907280921936, "reward_repeat_floor_std": 0.002971539506688714, "reward_near_duplicate_penalty_mean": 0.9910648465156555, "reward_near_duplicate_penalty_std": 0.010946473106741905, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.21249999105930328, "reward_judge_quality_std": 0.1505940556526184, "reward_total_composite_mean": 0.0730305165052414, "reward_total_composite_std": 0.13297533988952637} {"timestamp_utc": "2026-04-12T16:36:00Z", "mode": "train", "global_step": 180, "epoch": 0.009473185621809379, "loss": -0.1523, "grad_norm": 2.562324285507202, "learning_rate": 9.457575757575759e-06, "num_tokens": 350334.0, "completions/mean_length": 384.75, "completions/min_length": 193.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 308.3999938964844, "completions/min_terminated_length": 193.0, "completions/max_terminated_length": 449.0, "rewards/meter/mean": 0.499294251203537, "rewards/meter/std": 0.41147667169570923, "rewards/count_adherence/mean": 0.640625, "rewards/count_adherence/std": 0.2538762092590332, "rewards/arabic_clean/mean": 0.125, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.8921874761581421, "rewards/count_floor/std": 0.07616285979747772, "rewards/lexical_plausibility/mean": 0.5289751291275024, "rewards/lexical_plausibility/std": 0.2826981246471405, "rewards/judge_quality/mean": 0.06875000149011612, "rewards/judge_quality/std": 0.0530330128967762, "rewards/repeat_penalty/mean": 0.9891723990440369, "rewards/repeat_penalty/std": 0.015472057275474072, "rewards/repeat_floor/mean": 0.9987034797668457, "rewards/repeat_floor/std": 0.0017474140040576458, "rewards/near_duplicate_penalty/mean": 0.9947054982185364, "rewards/near_duplicate_penalty/std": 0.007706289645284414, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9944184422492981, "rewards/distinct_2/std": 0.011827335692942142, "rewards/total_composite/mean": 0.023752262815833092, "rewards/total_composite/std": 0.02465471811592579, "reward": 0.023752262815833092, "reward_std": 0.02465471811592579, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21988987922668457, "sampling/sampling_logp_difference/max": 1.5030994415283203, "sampling/importance_sampling_ratio/min": 0.22243966162204742, "sampling/importance_sampling_ratio/mean": 1.0672351121902466, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.988249957561493, "clip_ratio/low_mean": 0.03225304465740919, "clip_ratio/low_min": 0.03225304465740919, "clip_ratio/high_mean": 0.04911600053310394, "clip_ratio/high_max": 0.04911600053310394, "clip_ratio/region_mean": 0.08136904519051313, "reward_total_mean": 0.023752262815833092, "reward_meter_mean": 0.499294251203537, "reward_meter_std": 0.41147667169570923, "reward_count_adherence_mean": 0.640625, "reward_count_adherence_std": 0.2538762092590332, "reward_arabic_clean_mean": 0.125, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.8921874761581421, "reward_count_floor_std": 0.07616285979747772, "reward_lexical_plausibility_mean": 0.5289751291275024, "reward_lexical_plausibility_std": 0.2826981246471405, "reward_repeat_penalty_mean": 0.9891723990440369, "reward_repeat_penalty_std": 0.015472057275474072, "reward_repeat_floor_mean": 0.9987034797668457, "reward_repeat_floor_std": 0.0017474140040576458, "reward_near_duplicate_penalty_mean": 0.9947054982185364, "reward_near_duplicate_penalty_std": 0.007706289645284414, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9944184422492981, "reward_distinct_2_std": 0.011827335692942142, "reward_judge_quality_mean": 0.06875000149011612, "reward_judge_quality_std": 0.0530330128967762, "reward_total_composite_mean": 0.023752262815833092, "reward_total_composite_std": 0.02465471811592579} {"timestamp_utc": "2026-04-12T16:36:11Z", "mode": "train", "global_step": 181, "epoch": 0.009525814430819431, "loss": 0.3118, "grad_norm": 6.628081321716309, "learning_rate": 9.454545454545456e-06, "num_tokens": 352540.0, "completions/mean_length": 122.75, "completions/min_length": 49.0, "completions/max_length": 289.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 122.75, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 289.0, "rewards/meter/mean": 0.09586291015148163, "rewards/meter/std": 0.11569578945636749, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.24800792336463928, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.07440238445997238, "rewards/lexical_plausibility/mean": 0.8156722784042358, "rewards/lexical_plausibility/std": 0.15160100162029266, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9882614612579346, "rewards/repeat_penalty/std": 0.013631528243422508, "rewards/repeat_floor/mean": 0.9982392191886902, "rewards/repeat_floor/std": 0.0020447387360036373, "rewards/near_duplicate_penalty/mean": 0.9882614612579346, "rewards/near_duplicate_penalty/std": 0.013631528243422508, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.01775287464261055, "rewards/total_composite/std": 0.0199081189930439, "reward": 0.01775287464261055, "reward_std": 0.0199081189930439, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2173110842704773, "sampling/sampling_logp_difference/max": 1.7365942001342773, "sampling/importance_sampling_ratio/min": 0.17611920833587646, "sampling/importance_sampling_ratio/mean": 1.0354623794555664, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 4.3025761395692825, "clip_ratio/low_mean": 0.09172592684626579, "clip_ratio/low_min": 0.09172592684626579, "clip_ratio/high_mean": 0.07841318473219872, "clip_ratio/high_max": 0.07841318473219872, "clip_ratio/region_mean": 0.1701391115784645, "reward_total_mean": 0.01775287464261055, "reward_meter_mean": 0.09586291015148163, "reward_meter_std": 0.11569578945636749, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.24800792336463928, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.07440238445997238, "reward_lexical_plausibility_mean": 0.8156722784042358, "reward_lexical_plausibility_std": 0.15160100162029266, "reward_repeat_penalty_mean": 0.9882614612579346, "reward_repeat_penalty_std": 0.013631528243422508, "reward_repeat_floor_mean": 0.9982392191886902, "reward_repeat_floor_std": 0.0020447387360036373, "reward_near_duplicate_penalty_mean": 0.9882614612579346, "reward_near_duplicate_penalty_std": 0.013631528243422508, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.01775287464261055, "reward_total_composite_std": 0.0199081189930439} {"timestamp_utc": "2026-04-12T16:36:20Z", "mode": "train", "global_step": 182, "epoch": 0.009578443239829483, "loss": 0.0071, "grad_norm": 17.36798095703125, "learning_rate": 9.451515151515153e-06, "num_tokens": 354531.0, "completions/mean_length": 73.875, "completions/min_length": 59.0, "completions/max_length": 87.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 73.875, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.317579984664917, "rewards/meter/std": 0.15974120795726776, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.031052952632308006, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9326201677322388, "rewards/repeat_penalty/std": 0.08470673114061356, "rewards/repeat_floor/mean": 0.9924519062042236, "rewards/repeat_floor/std": 0.009214295074343681, "rewards/near_duplicate_penalty/mean": 0.9785886406898499, "rewards/near_duplicate_penalty/std": 0.02176840789616108, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9518173933029175, "rewards/distinct_2/std": 0.06827271729707718, "rewards/total_composite/mean": 0.11482786387205124, "rewards/total_composite/std": 0.06405065953731537, "reward": 0.11482786387205124, "reward_std": 0.06405065953731537, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2649470269680023, "sampling/sampling_logp_difference/max": 3.0607335567474365, "sampling/importance_sampling_ratio/min": 0.046853311359882355, "sampling/importance_sampling_ratio/mean": 0.9959365725517273, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7446686774492264, "clip_ratio/low_mean": 0.1078990250825882, "clip_ratio/low_min": 0.1078990250825882, "clip_ratio/high_mean": 0.1264716386795044, "clip_ratio/high_max": 0.1264716386795044, "clip_ratio/region_mean": 0.2343706637620926, "reward_total_mean": 0.11482786387205124, "reward_meter_mean": 0.317579984664917, "reward_meter_std": 0.15974120795726776, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.031052952632308006, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9326201677322388, "reward_repeat_penalty_std": 0.08470673114061356, "reward_repeat_floor_mean": 0.9924519062042236, "reward_repeat_floor_std": 0.009214295074343681, "reward_near_duplicate_penalty_mean": 0.9785886406898499, "reward_near_duplicate_penalty_std": 0.02176840789616108, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9518173933029175, "reward_distinct_2_std": 0.06827271729707718, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.11482786387205124, "reward_total_composite_std": 0.06405065953731537} {"timestamp_utc": "2026-04-12T16:36:27Z", "mode": "train", "global_step": 183, "epoch": 0.009631072048839534, "loss": 0.0507, "grad_norm": 26.580228805541992, "learning_rate": 9.448484848484849e-06, "num_tokens": 355870.0, "completions/mean_length": 27.375, "completions/min_length": 24.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.375, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.5567831993103027, "rewards/meter/std": 0.4256998598575592, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8212499618530273, "rewards/judge_quality/std": 0.22937415540218353, "rewards/repeat_penalty/mean": 0.9842255115509033, "rewards/repeat_penalty/std": 0.02475259266793728, "rewards/repeat_floor/mean": 0.9976338148117065, "rewards/repeat_floor/std": 0.003712882287800312, "rewards/near_duplicate_penalty/mean": 0.9842255115509033, "rewards/near_duplicate_penalty/std": 0.02475259266793728, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5049673914909363, "rewards/total_composite/std": 0.42627090215682983, "reward": 0.5049673914909363, "reward_std": 0.42627090215682983, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1320503056049347, "sampling/sampling_logp_difference/max": 1.4269943237304688, "sampling/importance_sampling_ratio/min": 0.24002930521965027, "sampling/importance_sampling_ratio/mean": 1.0096726417541504, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.871697224676609, "clip_ratio/low_mean": 0.09298029448837042, "clip_ratio/low_min": 0.09298029448837042, "clip_ratio/high_mean": 0.03928571566939354, "clip_ratio/high_max": 0.03928571566939354, "clip_ratio/region_mean": 0.13226601015776396, "reward_total_mean": 0.5049673914909363, "reward_meter_mean": 0.5567831993103027, "reward_meter_std": 0.4256998598575592, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9842255115509033, "reward_repeat_penalty_std": 0.02475259266793728, "reward_repeat_floor_mean": 0.9976338148117065, "reward_repeat_floor_std": 0.003712882287800312, "reward_near_duplicate_penalty_mean": 0.9842255115509033, "reward_near_duplicate_penalty_std": 0.02475259266793728, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8212499618530273, "reward_judge_quality_std": 0.22937415540218353, "reward_total_composite_mean": 0.5049673914909363, "reward_total_composite_std": 0.42627090215682983} {"timestamp_utc": "2026-04-12T16:36:41Z", "mode": "train", "global_step": 184, "epoch": 0.009683700857849586, "loss": -0.0154, "grad_norm": 4.983717918395996, "learning_rate": 9.445454545454546e-06, "num_tokens": 357258.0, "completions/mean_length": 81.5, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.0, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.6330931186676025, "rewards/meter/std": 0.48437026143074036, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8900034427642822, "rewards/lexical_plausibility/std": 0.26902082562446594, "rewards/judge_quality/mean": 0.3062500059604645, "rewards/judge_quality/std": 0.18015369772911072, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2401992529630661, "rewards/total_composite/std": 0.2160726934671402, "reward": 0.2401992529630661, "reward_std": 0.216072678565979, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24982981383800507, "sampling/sampling_logp_difference/max": 1.1990976333618164, "sampling/importance_sampling_ratio/min": 0.30146610736846924, "sampling/importance_sampling_ratio/mean": 1.0588208436965942, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.7792413532733917, "clip_ratio/low_mean": 0.06853590346872807, "clip_ratio/low_min": 0.06853590346872807, "clip_ratio/high_mean": 0.10964912362396717, "clip_ratio/high_max": 0.10964912362396717, "clip_ratio/region_mean": 0.17818502709269524, "reward_total_mean": 0.2401992529630661, "reward_meter_mean": 0.6330931186676025, "reward_meter_std": 0.48437026143074036, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8900034427642822, "reward_lexical_plausibility_std": 0.26902082562446594, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3062500059604645, "reward_judge_quality_std": 0.18015369772911072, "reward_total_composite_mean": 0.2401992529630661, "reward_total_composite_std": 0.2160726934671402} {"timestamp_utc": "2026-04-12T16:36:51Z", "mode": "train", "global_step": 185, "epoch": 0.009736329666859639, "loss": 0.4115, "grad_norm": 7.150838375091553, "learning_rate": 9.442424242424243e-06, "num_tokens": 359283.0, "completions/mean_length": 100.125, "completions/min_length": 33.0, "completions/max_length": 279.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 100.125, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 279.0, "rewards/meter/mean": 0.3759284019470215, "rewards/meter/std": 0.4123052656650543, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.7504698038101196, "rewards/lexical_plausibility/std": 0.3222554326057434, "rewards/judge_quality/mean": 0.21249999105930328, "rewards/judge_quality/std": 0.1505940556526184, "rewards/repeat_penalty/mean": 0.9969080686569214, "rewards/repeat_penalty/std": 0.006644115783274174, "rewards/repeat_floor/mean": 0.9995362162590027, "rewards/repeat_floor/std": 0.0009966063080355525, "rewards/near_duplicate_penalty/mean": 0.9969080686569214, "rewards/near_duplicate_penalty/std": 0.006644115783274174, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08624979853630066, "rewards/total_composite/std": 0.11350648105144501, "reward": 0.08624979853630066, "reward_std": 0.11350647360086441, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2148657739162445, "sampling/sampling_logp_difference/max": 1.4891471862792969, "sampling/importance_sampling_ratio/min": 0.22556494176387787, "sampling/importance_sampling_ratio/mean": 1.044112205505371, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 4.610387206077576, "clip_ratio/low_mean": 0.10242792032659054, "clip_ratio/low_min": 0.10242792032659054, "clip_ratio/high_mean": 0.07306698057800531, "clip_ratio/high_max": 0.07306698057800531, "clip_ratio/region_mean": 0.17549490090459585, "reward_total_mean": 0.08624979853630066, "reward_meter_mean": 0.3759284019470215, "reward_meter_std": 0.4123052656650543, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.7504698038101196, "reward_lexical_plausibility_std": 0.3222554326057434, "reward_repeat_penalty_mean": 0.9969080686569214, "reward_repeat_penalty_std": 0.006644115783274174, "reward_repeat_floor_mean": 0.9995362162590027, "reward_repeat_floor_std": 0.0009966063080355525, "reward_near_duplicate_penalty_mean": 0.9969080686569214, "reward_near_duplicate_penalty_std": 0.006644115783274174, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.21249999105930328, "reward_judge_quality_std": 0.1505940556526184, "reward_total_composite_mean": 0.08624979853630066, "reward_total_composite_std": 0.11350648105144501} {"timestamp_utc": "2026-04-12T16:37:05Z", "mode": "train", "global_step": 186, "epoch": 0.009788958475869691, "loss": 0.0533, "grad_norm": 2.1375834941864014, "learning_rate": 9.43939393939394e-06, "num_tokens": 360950.0, "completions/mean_length": 243.375, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 82.20000457763672, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 266.0, "rewards/meter/mean": 0.558614194393158, "rewards/meter/std": 0.36556172370910645, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.727321982383728, "rewards/lexical_plausibility/std": 0.30975380539894104, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.18516401946544647, "rewards/repeat_penalty/mean": 0.9993149638175964, "rewards/repeat_penalty/std": 0.0019375960109755397, "rewards/repeat_floor/mean": 0.9998972415924072, "rewards/repeat_floor/std": 0.0002906446752604097, "rewards/near_duplicate_penalty/mean": 0.9993149638175964, "rewards/near_duplicate_penalty/std": 0.0019375960109755397, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13475856184959412, "rewards/total_composite/std": 0.16865652799606323, "reward": 0.13475856184959412, "reward_std": 0.16865651309490204, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21962442994117737, "sampling/sampling_logp_difference/max": 1.4570684432983398, "sampling/importance_sampling_ratio/min": 0.23291809856891632, "sampling/importance_sampling_ratio/mean": 1.0197837352752686, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.900775671005249, "clip_ratio/low_mean": 0.018703008070588112, "clip_ratio/low_min": 0.018703008070588112, "clip_ratio/high_mean": 0.07720588054507971, "clip_ratio/high_max": 0.07720588054507971, "clip_ratio/region_mean": 0.09590888861566782, "reward_total_mean": 0.13475856184959412, "reward_meter_mean": 0.558614194393158, "reward_meter_std": 0.36556172370910645, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.727321982383728, "reward_lexical_plausibility_std": 0.30975380539894104, "reward_repeat_penalty_mean": 0.9993149638175964, "reward_repeat_penalty_std": 0.0019375960109755397, "reward_repeat_floor_mean": 0.9998972415924072, "reward_repeat_floor_std": 0.0002906446752604097, "reward_near_duplicate_penalty_mean": 0.9993149638175964, "reward_near_duplicate_penalty_std": 0.0019375960109755397, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.18516401946544647, "reward_total_composite_mean": 0.13475856184959412, "reward_total_composite_std": 0.16865652799606323} {"timestamp_utc": "2026-04-12T16:37:19Z", "mode": "train", "global_step": 187, "epoch": 0.009841587284879744, "loss": -0.0061, "grad_norm": 5.491358280181885, "learning_rate": 9.436363636363636e-06, "num_tokens": 362522.0, "completions/mean_length": 96.5, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.142860412597656, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.5083314180374146, "rewards/meter/std": 0.4606216251850128, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8983074426651001, "rewards/lexical_plausibility/std": 0.27657681703567505, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.19955307245254517, "rewards/repeat_penalty/mean": 0.9808831214904785, "rewards/repeat_penalty/std": 0.043287038803100586, "rewards/repeat_floor/mean": 0.9976341128349304, "rewards/repeat_floor/std": 0.00509362667798996, "rewards/near_duplicate_penalty/mean": 0.9899966716766357, "rewards/near_duplicate_penalty/std": 0.018181046470999718, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.16275985538959503, "rewards/total_composite/std": 0.1781010776758194, "reward": 0.16275985538959503, "reward_std": 0.1781010925769806, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22770176827907562, "sampling/sampling_logp_difference/max": 1.481790542602539, "sampling/importance_sampling_ratio/min": 0.2272304743528366, "sampling/importance_sampling_ratio/mean": 1.0485010147094727, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9776471555233002, "clip_ratio/low_mean": 0.09363758750259876, "clip_ratio/low_min": 0.09363758750259876, "clip_ratio/high_mean": 0.08203125, "clip_ratio/high_max": 0.08203125, "clip_ratio/region_mean": 0.17566883750259876, "reward_total_mean": 0.16275985538959503, "reward_meter_mean": 0.5083314180374146, "reward_meter_std": 0.4606216251850128, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8983074426651001, "reward_lexical_plausibility_std": 0.27657681703567505, "reward_repeat_penalty_mean": 0.9808831214904785, "reward_repeat_penalty_std": 0.043287038803100586, "reward_repeat_floor_mean": 0.9976341128349304, "reward_repeat_floor_std": 0.00509362667798996, "reward_near_duplicate_penalty_mean": 0.9899966716766357, "reward_near_duplicate_penalty_std": 0.018181046470999718, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.19955307245254517, "reward_total_composite_mean": 0.16275985538959503, "reward_total_composite_std": 0.1781010776758194} {"timestamp_utc": "2026-04-12T16:37:27Z", "mode": "train", "global_step": 188, "epoch": 0.009894216093889796, "loss": 0.0468, "grad_norm": 15.839167594909668, "learning_rate": 9.433333333333335e-06, "num_tokens": 364111.0, "completions/mean_length": 37.625, "completions/min_length": 29.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.625, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.4937368631362915, "rewards/meter/std": 0.36918631196022034, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9329289197921753, "rewards/lexical_plausibility/std": 0.1064477264881134, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9874900579452515, "rewards/repeat_penalty/std": 0.016355164349079132, "rewards/repeat_floor/mean": 0.9981235265731812, "rewards/repeat_floor/std": 0.002453265246003866, "rewards/near_duplicate_penalty/mean": 0.9874900579452515, "rewards/near_duplicate_penalty/std": 0.016355164349079132, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.188018798828125, "rewards/total_composite/std": 0.15379884839057922, "reward": 0.188018798828125, "reward_std": 0.15379883348941803, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24071529507637024, "sampling/sampling_logp_difference/max": 1.2050809860229492, "sampling/importance_sampling_ratio/min": 0.29966774582862854, "sampling/importance_sampling_ratio/mean": 1.0537582635879517, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.142243593931198, "clip_ratio/low_mean": 0.10029411502182484, "clip_ratio/low_min": 0.10029411502182484, "clip_ratio/high_mean": 0.10462926793843508, "clip_ratio/high_max": 0.10462926793843508, "clip_ratio/region_mean": 0.20492338296025991, "reward_total_mean": 0.188018798828125, "reward_meter_mean": 0.4937368631362915, "reward_meter_std": 0.36918631196022034, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9329289197921753, "reward_lexical_plausibility_std": 0.1064477264881134, "reward_repeat_penalty_mean": 0.9874900579452515, "reward_repeat_penalty_std": 0.016355164349079132, "reward_repeat_floor_mean": 0.9981235265731812, "reward_repeat_floor_std": 0.002453265246003866, "reward_near_duplicate_penalty_mean": 0.9874900579452515, "reward_near_duplicate_penalty_std": 0.016355164349079132, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.188018798828125, "reward_total_composite_std": 0.15379884839057922} {"timestamp_utc": "2026-04-12T16:37:40Z", "mode": "train", "global_step": 189, "epoch": 0.009946844902899847, "loss": 0.3546, "grad_norm": 5.5799479484558105, "learning_rate": 9.43030303030303e-06, "num_tokens": 366066.0, "completions/mean_length": 159.375, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 109.00000762939453, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 458.0, "rewards/meter/mean": 0.6374885439872742, "rewards/meter/std": 0.3750973641872406, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.8109548091888428, "rewards/lexical_plausibility/std": 0.31919920444488525, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.9798671007156372, "rewards/repeat_penalty/std": 0.04848518967628479, "rewards/repeat_floor/mean": 0.9976696372032166, "rewards/repeat_floor/std": 0.005331065040081739, "rewards/near_duplicate_penalty/mean": 0.9921566247940063, "rewards/near_duplicate_penalty/std": 0.014121531508862972, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9871795177459717, "rewards/distinct_2/std": 0.03626188635826111, "rewards/total_composite/mean": 0.22261124849319458, "rewards/total_composite/std": 0.18416748940944672, "reward": 0.22261124849319458, "reward_std": 0.18416748940944672, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2021288424730301, "sampling/sampling_logp_difference/max": 1.7195062637329102, "sampling/importance_sampling_ratio/min": 0.17915457487106323, "sampling/importance_sampling_ratio/mean": 1.0501278638839722, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.273718625307083, "clip_ratio/low_mean": 0.04993602354079485, "clip_ratio/low_min": 0.04993602354079485, "clip_ratio/high_mean": 0.08595150709152222, "clip_ratio/high_max": 0.08595150709152222, "clip_ratio/region_mean": 0.13588753063231707, "reward_total_mean": 0.22261124849319458, "reward_meter_mean": 0.6374885439872742, "reward_meter_std": 0.3750973641872406, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.8109548091888428, "reward_lexical_plausibility_std": 0.31919920444488525, "reward_repeat_penalty_mean": 0.9798671007156372, "reward_repeat_penalty_std": 0.04848518967628479, "reward_repeat_floor_mean": 0.9976696372032166, "reward_repeat_floor_std": 0.005331065040081739, "reward_near_duplicate_penalty_mean": 0.9921566247940063, "reward_near_duplicate_penalty_std": 0.014121531508862972, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9871795177459717, "reward_distinct_2_std": 0.03626188635826111, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.22261124849319458, "reward_total_composite_std": 0.18416748940944672} {"timestamp_utc": "2026-04-12T16:37:51Z", "mode": "train", "global_step": 190, "epoch": 0.009999473711909899, "loss": 0.1348, "grad_norm": 11.683950424194336, "learning_rate": 9.427272727272728e-06, "num_tokens": 368161.0, "completions/mean_length": 75.875, "completions/min_length": 47.0, "completions/max_length": 153.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 75.875, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 153.0, "rewards/meter/mean": 0.5286248326301575, "rewards/meter/std": 0.42756661772727966, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9482710957527161, "rewards/lexical_plausibility/std": 0.09784351289272308, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9863206148147583, "rewards/repeat_penalty/std": 0.025610435754060745, "rewards/repeat_floor/mean": 0.9983108639717102, "rewards/repeat_floor/std": 0.00290672411210835, "rewards/near_duplicate_penalty/mean": 0.9925850629806519, "rewards/near_duplicate_penalty/std": 0.011060180142521858, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9935897588729858, "rewards/distinct_2/std": 0.018130943179130554, "rewards/total_composite/mean": 0.17522484064102173, "rewards/total_composite/std": 0.14982382953166962, "reward": 0.17522484064102173, "reward_std": 0.14982382953166962, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18190455436706543, "sampling/sampling_logp_difference/max": 1.6534295082092285, "sampling/importance_sampling_ratio/min": 0.19139240682125092, "sampling/importance_sampling_ratio/mean": 1.0633751153945923, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.705846443772316, "clip_ratio/low_mean": 0.06471885740756989, "clip_ratio/low_min": 0.06471885740756989, "clip_ratio/high_mean": 0.06607464654371142, "clip_ratio/high_max": 0.06607464654371142, "clip_ratio/region_mean": 0.1307935039512813, "reward_total_mean": 0.17522484064102173, "reward_meter_mean": 0.5286248326301575, "reward_meter_std": 0.42756661772727966, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9482710957527161, "reward_lexical_plausibility_std": 0.09784351289272308, "reward_repeat_penalty_mean": 0.9863206148147583, "reward_repeat_penalty_std": 0.025610435754060745, "reward_repeat_floor_mean": 0.9983108639717102, "reward_repeat_floor_std": 0.00290672411210835, "reward_near_duplicate_penalty_mean": 0.9925850629806519, "reward_near_duplicate_penalty_std": 0.011060180142521858, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9935897588729858, "reward_distinct_2_std": 0.018130943179130554, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.17522484064102173, "reward_total_composite_std": 0.14982382953166962} {"timestamp_utc": "2026-04-12T16:37:59Z", "mode": "train", "global_step": 191, "epoch": 0.010052102520919952, "loss": 0.0416, "grad_norm": 28.455045700073242, "learning_rate": 9.424242424242425e-06, "num_tokens": 369609.0, "completions/mean_length": 20.0, "completions/min_length": 16.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.0, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.5563498139381409, "rewards/meter/std": 0.4520806670188904, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.781009316444397, "rewards/lexical_plausibility/std": 0.1717691421508789, "rewards/judge_quality/mean": 0.4050000309944153, "rewards/judge_quality/std": 0.33713075518608093, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14113321900367737, "rewards/total_composite/std": 0.10498090833425522, "reward": 0.14113321900367737, "reward_std": 0.10498090088367462, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.28368139266967773, "sampling/sampling_logp_difference/max": 1.2664527893066406, "sampling/importance_sampling_ratio/min": 0.2818295657634735, "sampling/importance_sampling_ratio/mean": 1.0669454336166382, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.475811317563057, "clip_ratio/low_mean": 0.04173913039267063, "clip_ratio/low_min": 0.04173913039267063, "clip_ratio/high_mean": 0.12946121580898762, "clip_ratio/high_max": 0.12946121580898762, "clip_ratio/region_mean": 0.17120034620165825, "reward_total_mean": 0.14113321900367737, "reward_meter_mean": 0.5563498139381409, "reward_meter_std": 0.4520806670188904, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.781009316444397, "reward_lexical_plausibility_std": 0.1717691421508789, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4050000309944153, "reward_judge_quality_std": 0.33713075518608093, "reward_total_composite_mean": 0.14113321900367737, "reward_total_composite_std": 0.10498090833425522} {"timestamp_utc": "2026-04-12T16:38:13Z", "mode": "train", "global_step": 192, "epoch": 0.010104731329930004, "loss": 0.0328, "grad_norm": 2.036179780960083, "learning_rate": 9.421212121212122e-06, "num_tokens": 371545.0, "completions/mean_length": 390.0, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 186.6666717529297, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 447.0, "rewards/meter/mean": 0.44524112343788147, "rewards/meter/std": 0.3842077851295471, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175492912530899, "rewards/lexical_plausibility/mean": 0.5221306085586548, "rewards/lexical_plausibility/std": 0.314175009727478, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.18516401946544647, "rewards/repeat_penalty/mean": 0.9935352802276611, "rewards/repeat_penalty/std": 0.012585675343871117, "rewards/repeat_floor/mean": 0.9990302920341492, "rewards/repeat_floor/std": 0.0018878512782976031, "rewards/near_duplicate_penalty/mean": 0.9935352802276611, "rewards/near_duplicate_penalty/std": 0.012585675343871117, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.10575045645236969, "rewards/total_composite/std": 0.1727677285671234, "reward": 0.10575045645236969, "reward_std": 0.17276771366596222, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17472466826438904, "sampling/sampling_logp_difference/max": 1.1510963439941406, "sampling/importance_sampling_ratio/min": 0.3162898123264313, "sampling/importance_sampling_ratio/mean": 1.015725016593933, "sampling/importance_sampling_ratio/max": 1.9650384187698364, "entropy": 1.4540944546461105, "clip_ratio/low_mean": 0.007550335489213467, "clip_ratio/low_min": 0.007550335489213467, "clip_ratio/high_mean": 0.04625237174332142, "clip_ratio/high_max": 0.04625237174332142, "clip_ratio/region_mean": 0.053802707232534885, "reward_total_mean": 0.10575045645236969, "reward_meter_mean": 0.44524112343788147, "reward_meter_std": 0.3842077851295471, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175492912530899, "reward_lexical_plausibility_mean": 0.5221306085586548, "reward_lexical_plausibility_std": 0.314175009727478, "reward_repeat_penalty_mean": 0.9935352802276611, "reward_repeat_penalty_std": 0.012585675343871117, "reward_repeat_floor_mean": 0.9990302920341492, "reward_repeat_floor_std": 0.0018878512782976031, "reward_near_duplicate_penalty_mean": 0.9935352802276611, "reward_near_duplicate_penalty_std": 0.012585675343871117, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.18516401946544647, "reward_total_composite_mean": 0.10575045645236969, "reward_total_composite_std": 0.1727677285671234} {"timestamp_utc": "2026-04-12T16:38:26Z", "mode": "train", "global_step": 193, "epoch": 0.010157360138940056, "loss": 0.0069, "grad_norm": 2.518564224243164, "learning_rate": 9.418181818181818e-06, "num_tokens": 373504.0, "completions/mean_length": 327.875, "completions/min_length": 66.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 143.75, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 362.0, "rewards/meter/mean": 0.21626828610897064, "rewards/meter/std": 0.16922105848789215, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.33905068039894104, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.10171521455049515, "rewards/lexical_plausibility/mean": 0.6645095348358154, "rewards/lexical_plausibility/std": 0.28426334261894226, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9442843794822693, "rewards/repeat_penalty/std": 0.12373539805412292, "rewards/repeat_floor/mean": 0.9955518245697021, "rewards/repeat_floor/std": 0.009132664650678635, "rewards/near_duplicate_penalty/mean": 0.9913046360015869, "rewards/near_duplicate_penalty/std": 0.017040900886058807, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9650679230690002, "rewards/distinct_2/std": 0.07423978298902512, "rewards/total_composite/mean": 0.03105197474360466, "rewards/total_composite/std": 0.03759218379855156, "reward": 0.03105197474360466, "reward_std": 0.03759218752384186, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19447876513004303, "sampling/sampling_logp_difference/max": 1.335679292678833, "sampling/importance_sampling_ratio/min": 0.2629794776439667, "sampling/importance_sampling_ratio/mean": 1.0487233400344849, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.333795487880707, "clip_ratio/low_mean": 0.006560773588716984, "clip_ratio/low_min": 0.006560773588716984, "clip_ratio/high_mean": 0.0716051533818245, "clip_ratio/high_max": 0.0716051533818245, "clip_ratio/region_mean": 0.07816592697054148, "reward_total_mean": 0.03105197474360466, "reward_meter_mean": 0.21626828610897064, "reward_meter_std": 0.16922105848789215, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.33905068039894104, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.10171521455049515, "reward_lexical_plausibility_mean": 0.6645095348358154, "reward_lexical_plausibility_std": 0.28426334261894226, "reward_repeat_penalty_mean": 0.9442843794822693, "reward_repeat_penalty_std": 0.12373539805412292, "reward_repeat_floor_mean": 0.9955518245697021, "reward_repeat_floor_std": 0.009132664650678635, "reward_near_duplicate_penalty_mean": 0.9913046360015869, "reward_near_duplicate_penalty_std": 0.017040900886058807, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9650679230690002, "reward_distinct_2_std": 0.07423978298902512, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.03105197474360466, "reward_total_composite_std": 0.03759218379855156} {"timestamp_utc": "2026-04-12T16:38:39Z", "mode": "train", "global_step": 194, "epoch": 0.010209988947950109, "loss": -0.0852, "grad_norm": 3.6086113452911377, "learning_rate": 9.415151515151515e-06, "num_tokens": 375089.0, "completions/mean_length": 169.125, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 54.833335876464844, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.5615483522415161, "rewards/meter/std": 0.36815136671066284, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.8159192204475403, "rewards/lexical_plausibility/std": 0.22040477395057678, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.2840491831302643, "rewards/repeat_penalty/mean": 0.9941784143447876, "rewards/repeat_penalty/std": 0.008796388283371925, "rewards/repeat_floor/mean": 0.9991267323493958, "rewards/repeat_floor/std": 0.0013194619677960873, "rewards/near_duplicate_penalty/mean": 0.9941784143447876, "rewards/near_duplicate_penalty/std": 0.008796388283371925, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.17255161702632904, "rewards/total_composite/std": 0.14791880548000336, "reward": 0.17255161702632904, "reward_std": 0.14791880548000336, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22499358654022217, "sampling/sampling_logp_difference/max": 1.6198673248291016, "sampling/importance_sampling_ratio/min": 0.19792495667934418, "sampling/importance_sampling_ratio/mean": 1.0764914751052856, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8485622704029083, "clip_ratio/low_mean": 0.06984508596360683, "clip_ratio/low_min": 0.06984508596360683, "clip_ratio/high_mean": 0.09305718168616295, "clip_ratio/high_max": 0.09305718168616295, "clip_ratio/region_mean": 0.16290226764976978, "reward_total_mean": 0.17255161702632904, "reward_meter_mean": 0.5615483522415161, "reward_meter_std": 0.36815136671066284, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.8159192204475403, "reward_lexical_plausibility_std": 0.22040477395057678, "reward_repeat_penalty_mean": 0.9941784143447876, "reward_repeat_penalty_std": 0.008796388283371925, "reward_repeat_floor_mean": 0.9991267323493958, "reward_repeat_floor_std": 0.0013194619677960873, "reward_near_duplicate_penalty_mean": 0.9941784143447876, "reward_near_duplicate_penalty_std": 0.008796388283371925, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.2840491831302643, "reward_total_composite_mean": 0.17255161702632904, "reward_total_composite_std": 0.14791880548000336} {"timestamp_utc": "2026-04-12T16:38:49Z", "mode": "train", "global_step": 195, "epoch": 0.01026261775696016, "loss": 0.0871, "grad_norm": 15.280990600585938, "learning_rate": 9.412121212121212e-06, "num_tokens": 376659.0, "completions/mean_length": 38.25, "completions/min_length": 31.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.25, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.4135478734970093, "rewards/meter/std": 0.33901268243789673, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6387500166893005, "rewards/judge_quality/std": 0.3224211037158966, "rewards/repeat_penalty/mean": 0.9999389052391052, "rewards/repeat_penalty/std": 0.00017280207248404622, "rewards/repeat_floor/mean": 0.9999908208847046, "rewards/repeat_floor/std": 2.5920317057170905e-05, "rewards/near_duplicate_penalty/mean": 0.9999389052391052, "rewards/near_duplicate_penalty/std": 0.00017280207248404622, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.219503253698349, "rewards/total_composite/std": 0.13908927142620087, "reward": 0.219503253698349, "reward_std": 0.13908925652503967, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2435743510723114, "sampling/sampling_logp_difference/max": 2.39784574508667, "sampling/importance_sampling_ratio/min": 0.09091359376907349, "sampling/importance_sampling_ratio/mean": 1.045608401298523, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0363870710134506, "clip_ratio/low_mean": 0.0820359718054533, "clip_ratio/low_min": 0.0820359718054533, "clip_ratio/high_mean": 0.16588432900607586, "clip_ratio/high_max": 0.16588432900607586, "clip_ratio/region_mean": 0.24792030081152916, "reward_total_mean": 0.219503253698349, "reward_meter_mean": 0.4135478734970093, "reward_meter_std": 0.33901268243789673, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9999389052391052, "reward_repeat_penalty_std": 0.00017280207248404622, "reward_repeat_floor_mean": 0.9999908208847046, "reward_repeat_floor_std": 2.5920317057170905e-05, "reward_near_duplicate_penalty_mean": 0.9999389052391052, "reward_near_duplicate_penalty_std": 0.00017280207248404622, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6387500166893005, "reward_judge_quality_std": 0.3224211037158966, "reward_total_composite_mean": 0.219503253698349, "reward_total_composite_std": 0.13908927142620087} {"timestamp_utc": "2026-04-12T16:39:03Z", "mode": "train", "global_step": 196, "epoch": 0.010315246565970212, "loss": -0.0359, "grad_norm": 0.9217419028282166, "learning_rate": 9.40909090909091e-06, "num_tokens": 378148.0, "completions/mean_length": 458.125, "completions/min_length": 81.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 81.0, "completions/min_terminated_length": 81.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.4111250936985016, "rewards/meter/std": 0.2979764938354492, "rewards/count_adherence/mean": 0.5250000357627869, "rewards/count_adherence/std": 0.23754701018333435, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8574999570846558, "rewards/count_floor/std": 0.07126409560441971, "rewards/lexical_plausibility/mean": 0.5859890580177307, "rewards/lexical_plausibility/std": 0.1842985302209854, "rewards/judge_quality/mean": 0.0625, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.9353363513946533, "rewards/repeat_penalty/std": 0.11443106085062027, "rewards/repeat_floor/mean": 0.995958685874939, "rewards/repeat_floor/std": 0.0067739044316112995, "rewards/near_duplicate_penalty/mean": 0.998394250869751, "rewards/near_duplicate_penalty/std": 0.002028181916102767, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9994393587112427, "rewards/distinct_2/std": 0.0015857962425798178, "rewards/total_composite/mean": 0.021751247346401215, "rewards/total_composite/std": 0.016394687816500664, "reward": 0.021751247346401215, "reward_std": 0.016394687816500664, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22108183801174164, "sampling/sampling_logp_difference/max": 0.7847318649291992, "sampling/importance_sampling_ratio/min": 0.5413163304328918, "sampling/importance_sampling_ratio/mean": 1.1084215641021729, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6079707741737366, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.023148147389292717, "clip_ratio/high_max": 0.023148147389292717, "clip_ratio/region_mean": 0.023148147389292717, "reward_total_mean": 0.021751247346401215, "reward_meter_mean": 0.4111250936985016, "reward_meter_std": 0.2979764938354492, "reward_count_adherence_mean": 0.5250000357627869, "reward_count_adherence_std": 0.23754701018333435, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8574999570846558, "reward_count_floor_std": 0.07126409560441971, "reward_lexical_plausibility_mean": 0.5859890580177307, "reward_lexical_plausibility_std": 0.1842985302209854, "reward_repeat_penalty_mean": 0.9353363513946533, "reward_repeat_penalty_std": 0.11443106085062027, "reward_repeat_floor_mean": 0.995958685874939, "reward_repeat_floor_std": 0.0067739044316112995, "reward_near_duplicate_penalty_mean": 0.998394250869751, "reward_near_duplicate_penalty_std": 0.002028181916102767, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9994393587112427, "reward_distinct_2_std": 0.0015857962425798178, "reward_judge_quality_mean": 0.0625, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.021751247346401215, "reward_total_composite_std": 0.016394687816500664} {"timestamp_utc": "2026-04-12T16:39:17Z", "mode": "train", "global_step": 197, "epoch": 0.010367875374980264, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 9.406060606060607e-06, "num_tokens": 380044.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.2945672869682312, "rewards/meter/std": 0.2733685374259949, "rewards/count_adherence/mean": 0.4444444477558136, "rewards/count_adherence/std": 0.29095718264579773, "rewards/arabic_clean/mean": 0.125, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8333333134651184, "rewards/count_floor/std": 0.08728715032339096, "rewards/lexical_plausibility/mean": 0.5796335339546204, "rewards/lexical_plausibility/std": 0.05944741517305374, "rewards/judge_quality/mean": 0.05625000223517418, "rewards/judge_quality/std": 0.04172614961862564, "rewards/repeat_penalty/mean": 0.9643219709396362, "rewards/repeat_penalty/std": 0.08672906458377838, "rewards/repeat_floor/mean": 0.99753338098526, "rewards/repeat_floor/std": 0.005097570829093456, "rewards/near_duplicate_penalty/mean": 0.9967884421348572, "rewards/near_duplicate_penalty/std": 0.0035242505837231874, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9987789988517761, "rewards/distinct_2/std": 0.0034535129088908434, "rewards/total_composite/mean": 0.01453713420778513, "rewards/total_composite/std": 0.014201870188117027, "reward": 0.01453713420778513, "reward_std": 0.014201869256794453, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.01453713420778513, "reward_meter_mean": 0.2945672869682312, "reward_meter_std": 0.2733685374259949, "reward_count_adherence_mean": 0.4444444477558136, "reward_count_adherence_std": 0.29095718264579773, "reward_arabic_clean_mean": 0.125, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8333333134651184, "reward_count_floor_std": 0.08728715032339096, "reward_lexical_plausibility_mean": 0.5796335339546204, "reward_lexical_plausibility_std": 0.05944741517305374, "reward_repeat_penalty_mean": 0.9643219709396362, "reward_repeat_penalty_std": 0.08672906458377838, "reward_repeat_floor_mean": 0.99753338098526, "reward_repeat_floor_std": 0.005097570829093456, "reward_near_duplicate_penalty_mean": 0.9967884421348572, "reward_near_duplicate_penalty_std": 0.0035242505837231874, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9987789988517761, "reward_distinct_2_std": 0.0034535129088908434, "reward_judge_quality_mean": 0.05625000223517418, "reward_judge_quality_std": 0.04172614961862564, "reward_total_composite_mean": 0.01453713420778513, "reward_total_composite_std": 0.014201870188117027} {"timestamp_utc": "2026-04-12T16:39:31Z", "mode": "train", "global_step": 198, "epoch": 0.010420504183990317, "loss": -0.1471, "grad_norm": 2.7665464878082275, "learning_rate": 9.403030303030304e-06, "num_tokens": 382011.0, "completions/mean_length": 309.875, "completions/min_length": 83.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 107.75, "completions/min_terminated_length": 83.0, "completions/max_terminated_length": 157.0, "rewards/meter/mean": 0.667330265045166, "rewards/meter/std": 0.3395802676677704, "rewards/count_adherence/mean": 0.824999988079071, "rewards/count_adherence/std": 0.29154759645462036, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9474999904632568, "rewards/count_floor/std": 0.08746428042650223, "rewards/lexical_plausibility/mean": 0.7903605699539185, "rewards/lexical_plausibility/std": 0.2222806066274643, "rewards/judge_quality/mean": 0.11875000596046448, "rewards/judge_quality/std": 0.1099918857216835, "rewards/repeat_penalty/mean": 0.9035739302635193, "rewards/repeat_penalty/std": 0.1521126925945282, "rewards/repeat_floor/mean": 0.9901407957077026, "rewards/repeat_floor/std": 0.015917491167783737, "rewards/near_duplicate_penalty/mean": 0.9693999290466309, "rewards/near_duplicate_penalty/std": 0.03903765231370926, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.9497872591018677, "rewards/distinct_2/std": 0.09576201438903809, "rewards/total_composite/mean": 0.09143868088722229, "rewards/total_composite/std": 0.1126495972275734, "reward": 0.09143868088722229, "reward_std": 0.1126495897769928, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19507019221782684, "sampling/sampling_logp_difference/max": 1.13051176071167, "sampling/importance_sampling_ratio/min": 0.3228679895401001, "sampling/importance_sampling_ratio/mean": 1.0543478727340698, "sampling/importance_sampling_ratio/max": 1.9720526933670044, "entropy": 1.7003357410430908, "clip_ratio/low_mean": 0.017326733097434044, "clip_ratio/low_min": 0.017326733097434044, "clip_ratio/high_mean": 0.07335328683257103, "clip_ratio/high_max": 0.07335328683257103, "clip_ratio/region_mean": 0.09068001993000507, "reward_total_mean": 0.09143868088722229, "reward_meter_mean": 0.667330265045166, "reward_meter_std": 0.3395802676677704, "reward_count_adherence_mean": 0.824999988079071, "reward_count_adherence_std": 0.29154759645462036, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9474999904632568, "reward_count_floor_std": 0.08746428042650223, "reward_lexical_plausibility_mean": 0.7903605699539185, "reward_lexical_plausibility_std": 0.2222806066274643, "reward_repeat_penalty_mean": 0.9035739302635193, "reward_repeat_penalty_std": 0.1521126925945282, "reward_repeat_floor_mean": 0.9901407957077026, "reward_repeat_floor_std": 0.015917491167783737, "reward_near_duplicate_penalty_mean": 0.9693999290466309, "reward_near_duplicate_penalty_std": 0.03903765231370926, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.9497872591018677, "reward_distinct_2_std": 0.09576201438903809, "reward_judge_quality_mean": 0.11875000596046448, "reward_judge_quality_std": 0.1099918857216835, "reward_total_composite_mean": 0.09143868088722229, "reward_total_composite_std": 0.1126495972275734} {"timestamp_utc": "2026-04-12T16:39:39Z", "mode": "train", "global_step": 199, "epoch": 0.010473132993000369, "loss": 0.0309, "grad_norm": 21.764482498168945, "learning_rate": 9.4e-06, "num_tokens": 383534.0, "completions/mean_length": 30.375, "completions/min_length": 28.0, "completions/max_length": 35.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.375, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.3349902033805847, "rewards/meter/std": 0.41731929779052734, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.24512389302253723, "rewards/repeat_penalty/mean": 0.9688562750816345, "rewards/repeat_penalty/std": 0.047484010457992554, "rewards/repeat_floor/mean": 0.9958813190460205, "rewards/repeat_floor/std": 0.00577416829764843, "rewards/near_duplicate_penalty/mean": 0.978952169418335, "rewards/near_duplicate_penalty/std": 0.025598246604204178, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.17050465941429138, "rewards/total_composite/std": 0.2202007919549942, "reward": 0.17050465941429138, "reward_std": 0.2202007919549942, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19891545176506042, "sampling/sampling_logp_difference/max": 1.0123915672302246, "sampling/importance_sampling_ratio/min": 0.3748926818370819, "sampling/importance_sampling_ratio/mean": 1.0575103759765625, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8103185594081879, "clip_ratio/low_mean": 0.08342103566974401, "clip_ratio/low_min": 0.08342103566974401, "clip_ratio/high_mean": 0.044728269102051854, "clip_ratio/high_max": 0.044728269102051854, "clip_ratio/region_mean": 0.12814930477179587, "reward_total_mean": 0.17050465941429138, "reward_meter_mean": 0.3349902033805847, "reward_meter_std": 0.41731929779052734, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9688562750816345, "reward_repeat_penalty_std": 0.047484010457992554, "reward_repeat_floor_mean": 0.9958813190460205, "reward_repeat_floor_std": 0.00577416829764843, "reward_near_duplicate_penalty_mean": 0.978952169418335, "reward_near_duplicate_penalty_std": 0.025598246604204178, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.24512389302253723, "reward_total_composite_mean": 0.17050465941429138, "reward_total_composite_std": 0.2202007919549942} {"timestamp_utc": "2026-04-12T16:39:47Z", "mode": "train", "global_step": 200, "epoch": 0.01052576180201042, "loss": 0.0221, "grad_norm": 16.82535743713379, "learning_rate": 9.396969696969697e-06, "num_tokens": 385013.0, "completions/mean_length": 36.875, "completions/min_length": 32.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.875, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.25020644068717957, "rewards/meter/std": 0.3476031422615051, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9369837045669556, "rewards/lexical_plausibility/std": 0.11954433470964432, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.25670650601387024, "rewards/repeat_penalty/mean": 0.9960905313491821, "rewards/repeat_penalty/std": 0.004692242946475744, "rewards/repeat_floor/mean": 0.9994135499000549, "rewards/repeat_floor/std": 0.0007038420881144702, "rewards/near_duplicate_penalty/mean": 0.9960905313491821, "rewards/near_duplicate_penalty/std": 0.004692242946475744, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11283959448337555, "rewards/total_composite/std": 0.1497221738100052, "reward": 0.11283959448337555, "reward_std": 0.1497221738100052, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23476119339466095, "sampling/sampling_logp_difference/max": 2.3389034271240234, "sampling/importance_sampling_ratio/min": 0.09643332660198212, "sampling/importance_sampling_ratio/mean": 1.0340209007263184, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.674425408244133, "clip_ratio/low_mean": 0.06655457336455584, "clip_ratio/low_min": 0.06655457336455584, "clip_ratio/high_mean": 0.05685078911483288, "clip_ratio/high_max": 0.05685078911483288, "clip_ratio/region_mean": 0.12340536247938871, "reward_total_mean": 0.11283959448337555, "reward_meter_mean": 0.25020644068717957, "reward_meter_std": 0.3476031422615051, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9369837045669556, "reward_lexical_plausibility_std": 0.11954433470964432, "reward_repeat_penalty_mean": 0.9960905313491821, "reward_repeat_penalty_std": 0.004692242946475744, "reward_repeat_floor_mean": 0.9994135499000549, "reward_repeat_floor_std": 0.0007038420881144702, "reward_near_duplicate_penalty_mean": 0.9960905313491821, "reward_near_duplicate_penalty_std": 0.004692242946475744, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.25670650601387024, "reward_total_composite_mean": 0.11283959448337555, "reward_total_composite_std": 0.1497221738100052} {"timestamp_utc": "2026-04-12T16:42:18Z", "mode": "eval", "global_step": 200, "epoch": 0.01052576180201042, "eval_loss": NaN, "eval_runtime": 151.0431, "eval_samples_per_second": 0.689, "eval_steps_per_second": 0.086, "eval_num_tokens": 385013.0, "eval_completions/mean_length": 288.61538461538464, "eval_completions/min_length": 33.46153846153846, "eval_completions/max_length": 512.0, "eval_completions/clipped_ratio": 0.46153846153846156, "eval_completions/mean_terminated_length": 93.1934080857497, "eval_completions/min_terminated_length": 33.46153846153846, "eval_completions/max_terminated_length": 188.46153846153845, "eval_rewards/meter/mean": 0.27145538880274844, "eval_rewards/meter/std": 0.3038664013147354, "eval_rewards/count_adherence/mean": 0.7206993744923518, "eval_rewards/count_adherence/std": 0.30023181667694676, "eval_rewards/arabic_clean/mean": 0.5384615384615384, "eval_rewards/arabic_clean/std": 0.49203900878246015, "eval_rewards/hard_gate/mean": 0.9807692307692307, "eval_rewards/hard_gate/std": 0.05439282839114849, "eval_rewards/arabic_floor/mean": 0.9956730741720933, "eval_rewards/arabic_floor/std": 0.009420730173587799, "eval_rewards/count_floor/mean": 0.9162098169326782, "eval_rewards/count_floor/std": 0.09006954099123295, "eval_rewards/lexical_plausibility/mean": 0.8058967177684491, "eval_rewards/lexical_plausibility/std": 0.18502292667443937, "eval_rewards/judge_quality/mean": 0.21432691869827417, "eval_rewards/judge_quality/std": 0.19979697867081717, "eval_rewards/repeat_penalty/mean": 0.9533474032695477, "eval_rewards/repeat_penalty/std": 0.08043498184102085, "eval_rewards/repeat_floor/mean": 0.9955630073180566, "eval_rewards/repeat_floor/std": 0.007148864777543797, "eval_rewards/near_duplicate_penalty/mean": 0.9879688849815955, "eval_rewards/near_duplicate_penalty/std": 0.01758513988282245, "eval_rewards/opening_diversity/mean": 0.975600962455456, "eval_rewards/opening_diversity/std": 0.061748841061041906, "eval_rewards/distinct_2/mean": 0.9870180625181931, "eval_rewards/distinct_2/std": 0.02635298454417632, "eval_rewards/total_composite/mean": 0.05888123573878637, "eval_rewards/total_composite/std": 0.0850732745602727, "eval_reward": 0.05888123573878637, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.16237259484254396, "eval_sampling/sampling_logp_difference/max": 1.082637016589825, "eval_sampling/importance_sampling_ratio/min": 0.35368941265803117, "eval_sampling/importance_sampling_ratio/mean": 1.0550401760981634, "eval_sampling/importance_sampling_ratio/max": 1.7244445177224965, "eval_entropy": 3.61222793505742, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.05888123573878637, "eval_reward_meter_mean": 0.27145538880274844, "eval_reward_meter_std": 0.3038664013147354, "eval_reward_count_adherence_mean": 0.7206993744923518, "eval_reward_count_adherence_std": 0.30023181667694676, "eval_reward_arabic_clean_mean": 0.5384615384615384, "eval_reward_arabic_clean_std": 0.49203900878246015, "eval_reward_hard_gate_mean": 0.9807692307692307, "eval_reward_hard_gate_std": 0.05439282839114849, "eval_reward_arabic_floor_mean": 0.9956730741720933, "eval_reward_arabic_floor_std": 0.009420730173587799, "eval_reward_count_floor_mean": 0.9162098169326782, "eval_reward_count_floor_std": 0.09006954099123295, "eval_reward_lexical_plausibility_mean": 0.8058967177684491, "eval_reward_lexical_plausibility_std": 0.18502292667443937, "eval_reward_repeat_penalty_mean": 0.9533474032695477, "eval_reward_repeat_penalty_std": 0.08043498184102085, "eval_reward_repeat_floor_mean": 0.9955630073180566, "eval_reward_repeat_floor_std": 0.007148864777543797, "eval_reward_near_duplicate_penalty_mean": 0.9879688849815955, "eval_reward_near_duplicate_penalty_std": 0.01758513988282245, "eval_reward_opening_diversity_mean": 0.975600962455456, "eval_reward_opening_diversity_std": 0.061748841061041906, "eval_reward_distinct_2_mean": 0.9870180625181931, "eval_reward_distinct_2_std": 0.02635298454417632, "eval_reward_judge_quality_mean": 0.21432691869827417, "eval_reward_judge_quality_std": 0.19979697867081717, "eval_reward_total_composite_mean": 0.05888123573878637, "eval_reward_total_composite_std": 0.0850732745602727} {"timestamp_utc": "2026-04-12T16:42:29Z", "mode": "train", "global_step": 201, "epoch": 0.010578390611020472, "loss": 0.0456, "grad_norm": 22.318904876708984, "learning_rate": 9.393939393939396e-06, "num_tokens": 386583.0, "completions/mean_length": 34.25, "completions/min_length": 30.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.25, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.6802480220794678, "rewards/meter/std": 0.38063785433769226, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4462500214576721, "rewards/judge_quality/std": 0.2173829823732376, "rewards/repeat_penalty/mean": 0.9978264570236206, "rewards/repeat_penalty/std": 0.003853553906083107, "rewards/repeat_floor/mean": 0.9996739625930786, "rewards/repeat_floor/std": 0.000578021805267781, "rewards/near_duplicate_penalty/mean": 0.9978264570236206, "rewards/near_duplicate_penalty/std": 0.003853553906083107, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2922589182853699, "rewards/total_composite/std": 0.16907870769500732, "reward": 0.2922589182853699, "reward_std": 0.16907872259616852, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21440432965755463, "sampling/sampling_logp_difference/max": 1.2445874214172363, "sampling/importance_sampling_ratio/min": 0.2880597412586212, "sampling/importance_sampling_ratio/mean": 1.0453404188156128, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4124284982681274, "clip_ratio/low_mean": 0.03623949736356735, "clip_ratio/low_min": 0.03623949736356735, "clip_ratio/high_mean": 0.1460014395415783, "clip_ratio/high_max": 0.1460014395415783, "clip_ratio/region_mean": 0.18224093690514565, "reward_total_mean": 0.2922589182853699, "reward_meter_mean": 0.6802480220794678, "reward_meter_std": 0.38063785433769226, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9978264570236206, "reward_repeat_penalty_std": 0.003853553906083107, "reward_repeat_floor_mean": 0.9996739625930786, "reward_repeat_floor_std": 0.000578021805267781, "reward_near_duplicate_penalty_mean": 0.9978264570236206, "reward_near_duplicate_penalty_std": 0.003853553906083107, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4462500214576721, "reward_judge_quality_std": 0.2173829823732376, "reward_total_composite_mean": 0.2922589182853699, "reward_total_composite_std": 0.16907870769500732} {"timestamp_utc": "2026-04-12T16:42:43Z", "mode": "train", "global_step": 202, "epoch": 0.010631019420030524, "loss": -0.0311, "grad_norm": 3.6717519760131836, "learning_rate": 9.390909090909092e-06, "num_tokens": 387989.0, "completions/mean_length": 152.75, "completions/min_length": 30.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 33.0, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.156070739030838, "rewards/meter/std": 0.217662513256073, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9246528148651123, "rewards/lexical_plausibility/std": 0.14081719517707825, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.946195125579834, "rewards/repeat_penalty/std": 0.09871681034564972, "rewards/repeat_floor/mean": 0.9936034679412842, "rewards/repeat_floor/std": 0.011640418320894241, "rewards/near_duplicate_penalty/mean": 0.9784188866615295, "rewards/near_duplicate_penalty/std": 0.03865911811590195, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9648962020874023, "rewards/distinct_2/std": 0.06701616942882538, "rewards/total_composite/mean": 0.059857502579689026, "rewards/total_composite/std": 0.0954614207148552, "reward": 0.059857502579689026, "reward_std": 0.0954614207148552, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23309345543384552, "sampling/sampling_logp_difference/max": 0.9677591323852539, "sampling/importance_sampling_ratio/min": 0.3799334764480591, "sampling/importance_sampling_ratio/mean": 1.0754752159118652, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1340361535549164, "clip_ratio/low_mean": 0.11528520844876766, "clip_ratio/low_min": 0.11528520844876766, "clip_ratio/high_mean": 0.04817708395421505, "clip_ratio/high_max": 0.04817708395421505, "clip_ratio/region_mean": 0.1634622924029827, "reward_total_mean": 0.059857502579689026, "reward_meter_mean": 0.156070739030838, "reward_meter_std": 0.217662513256073, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9246528148651123, "reward_lexical_plausibility_std": 0.14081719517707825, "reward_repeat_penalty_mean": 0.946195125579834, "reward_repeat_penalty_std": 0.09871681034564972, "reward_repeat_floor_mean": 0.9936034679412842, "reward_repeat_floor_std": 0.011640418320894241, "reward_near_duplicate_penalty_mean": 0.9784188866615295, "reward_near_duplicate_penalty_std": 0.03865911811590195, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9648962020874023, "reward_distinct_2_std": 0.06701616942882538, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.059857502579689026, "reward_total_composite_std": 0.0954614207148552} {"timestamp_utc": "2026-04-12T16:42:52Z", "mode": "train", "global_step": 203, "epoch": 0.010683648229040577, "loss": 0.1517, "grad_norm": 22.60735511779785, "learning_rate": 9.387878787878789e-06, "num_tokens": 389472.0, "completions/mean_length": 34.375, "completions/min_length": 27.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.375, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.7746254801750183, "rewards/meter/std": 0.300258994102478, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.20951901376247406, "rewards/repeat_penalty/mean": 0.993865430355072, "rewards/repeat_penalty/std": 0.008924965746700764, "rewards/repeat_floor/mean": 0.9990798234939575, "rewards/repeat_floor/std": 0.0013387514045462012, "rewards/near_duplicate_penalty/mean": 0.993865430355072, "rewards/near_duplicate_penalty/std": 0.008924965746700764, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4030006229877472, "rewards/total_composite/std": 0.2450082004070282, "reward": 0.4030006229877472, "reward_std": 0.2450082153081894, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23428988456726074, "sampling/sampling_logp_difference/max": 1.3909235000610352, "sampling/importance_sampling_ratio/min": 0.24884538352489471, "sampling/importance_sampling_ratio/mean": 1.0344312191009521, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.3992421329021454, "clip_ratio/low_mean": 0.09450177289545536, "clip_ratio/low_min": 0.09450177289545536, "clip_ratio/high_mean": 0.10327311791479588, "clip_ratio/high_max": 0.10327311791479588, "clip_ratio/region_mean": 0.19777489081025124, "reward_total_mean": 0.4030006229877472, "reward_meter_mean": 0.7746254801750183, "reward_meter_std": 0.300258994102478, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.993865430355072, "reward_repeat_penalty_std": 0.008924965746700764, "reward_repeat_floor_mean": 0.9990798234939575, "reward_repeat_floor_std": 0.0013387514045462012, "reward_near_duplicate_penalty_mean": 0.993865430355072, "reward_near_duplicate_penalty_std": 0.008924965746700764, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.20951901376247406, "reward_total_composite_mean": 0.4030006229877472, "reward_total_composite_std": 0.2450082004070282} {"timestamp_utc": "2026-04-12T16:43:06Z", "mode": "train", "global_step": 204, "epoch": 0.01073627703805063, "loss": -0.0813, "grad_norm": 1.6889697313308716, "learning_rate": 9.384848484848486e-06, "num_tokens": 391095.0, "completions/mean_length": 346.875, "completions/min_length": 71.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 71.66667175292969, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.7293943166732788, "rewards/meter/std": 0.30243679881095886, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.29880714416503906, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08964214473962784, "rewards/lexical_plausibility/mean": 0.7510567903518677, "rewards/lexical_plausibility/std": 0.21321669220924377, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.9344176054000854, "rewards/repeat_penalty/std": 0.09440242499113083, "rewards/repeat_floor/mean": 0.9948080778121948, "rewards/repeat_floor/std": 0.006688643712550402, "rewards/near_duplicate_penalty/mean": 0.9905301928520203, "rewards/near_duplicate_penalty/std": 0.012749215587973595, "rewards/opening_diversity/mean": 0.953125, "rewards/opening_diversity/std": 0.0867956355214119, "rewards/distinct_2/mean": 0.9893455505371094, "rewards/distinct_2/std": 0.024057654663920403, "rewards/total_composite/mean": 0.10282497107982635, "rewards/total_composite/std": 0.11676634848117828, "reward": 0.10282497107982635, "reward_std": 0.11676633358001709, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21512453258037567, "sampling/sampling_logp_difference/max": 1.3077983856201172, "sampling/importance_sampling_ratio/min": 0.2704147696495056, "sampling/importance_sampling_ratio/mean": 1.0816482305526733, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9477676451206207, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.06274452432990074, "clip_ratio/high_max": 0.06274452432990074, "clip_ratio/region_mean": 0.06274452432990074, "reward_total_mean": 0.10282497107982635, "reward_meter_mean": 0.7293943166732788, "reward_meter_std": 0.30243679881095886, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.29880714416503906, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08964214473962784, "reward_lexical_plausibility_mean": 0.7510567903518677, "reward_lexical_plausibility_std": 0.21321669220924377, "reward_repeat_penalty_mean": 0.9344176054000854, "reward_repeat_penalty_std": 0.09440242499113083, "reward_repeat_floor_mean": 0.9948080778121948, "reward_repeat_floor_std": 0.006688643712550402, "reward_near_duplicate_penalty_mean": 0.9905301928520203, "reward_near_duplicate_penalty_std": 0.012749215587973595, "reward_opening_diversity_mean": 0.953125, "reward_opening_diversity_std": 0.0867956355214119, "reward_distinct_2_mean": 0.9893455505371094, "reward_distinct_2_std": 0.024057654663920403, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.10282497107982635, "reward_total_composite_std": 0.11676634848117828} {"timestamp_utc": "2026-04-12T16:43:20Z", "mode": "train", "global_step": 205, "epoch": 0.010788905847060682, "loss": -0.0467, "grad_norm": 7.729182720184326, "learning_rate": 9.381818181818183e-06, "num_tokens": 392838.0, "completions/mean_length": 117.875, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 61.57143020629883, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.3980157971382141, "rewards/meter/std": 0.33278077840805054, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9597687125205994, "rewards/lexical_plausibility/std": 0.1067589670419693, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.1552647352218628, "rewards/repeat_penalty/mean": 0.9880841374397278, "rewards/repeat_penalty/std": 0.008756035007536411, "rewards/repeat_floor/mean": 0.9982126355171204, "rewards/repeat_floor/std": 0.0013134105829522014, "rewards/near_duplicate_penalty/mean": 0.9880841374397278, "rewards/near_duplicate_penalty/std": 0.008756035007536411, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1487998366355896, "rewards/total_composite/std": 0.14598247408866882, "reward": 0.1487998366355896, "reward_std": 0.14598247408866882, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.26030126214027405, "sampling/sampling_logp_difference/max": 2.192049026489258, "sampling/importance_sampling_ratio/min": 0.11168766766786575, "sampling/importance_sampling_ratio/mean": 1.0297348499298096, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9395598471164703, "clip_ratio/low_mean": 0.11876832321286201, "clip_ratio/low_min": 0.11876832321286201, "clip_ratio/high_mean": 0.09215893037617207, "clip_ratio/high_max": 0.09215893037617207, "clip_ratio/region_mean": 0.21092725358903408, "reward_total_mean": 0.1487998366355896, "reward_meter_mean": 0.3980157971382141, "reward_meter_std": 0.33278077840805054, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9597687125205994, "reward_lexical_plausibility_std": 0.1067589670419693, "reward_repeat_penalty_mean": 0.9880841374397278, "reward_repeat_penalty_std": 0.008756035007536411, "reward_repeat_floor_mean": 0.9982126355171204, "reward_repeat_floor_std": 0.0013134105829522014, "reward_near_duplicate_penalty_mean": 0.9880841374397278, "reward_near_duplicate_penalty_std": 0.008756035007536411, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.1552647352218628, "reward_total_composite_mean": 0.1487998366355896, "reward_total_composite_std": 0.14598247408866882} {"timestamp_utc": "2026-04-12T16:43:34Z", "mode": "train", "global_step": 206, "epoch": 0.010841534656070732, "loss": -0.0657, "grad_norm": 3.1638717651367188, "learning_rate": 9.378787878787879e-06, "num_tokens": 394523.0, "completions/mean_length": 168.625, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 54.16666793823242, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.622302770614624, "rewards/meter/std": 0.48749101161956787, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.3535534143447876, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9010752439498901, "rewards/lexical_plausibility/std": 0.18063318729400635, "rewards/judge_quality/mean": 0.39750000834465027, "rewards/judge_quality/std": 0.27395254373550415, "rewards/repeat_penalty/mean": 0.9985781908035278, "rewards/repeat_penalty/std": 0.0021619838662445545, "rewards/repeat_floor/mean": 0.9997867345809937, "rewards/repeat_floor/std": 0.00032429612474516034, "rewards/near_duplicate_penalty/mean": 0.9985781908035278, "rewards/near_duplicate_penalty/std": 0.0021619838662445545, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32643288373947144, "rewards/total_composite/std": 0.30038806796073914, "reward": 0.32643288373947144, "reward_std": 0.30038806796073914, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19563747942447662, "sampling/sampling_logp_difference/max": 1.1974034309387207, "sampling/importance_sampling_ratio/min": 0.3019773066043854, "sampling/importance_sampling_ratio/mean": 1.0790159702301025, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8306284844875336, "clip_ratio/low_mean": 0.03214285895228386, "clip_ratio/low_min": 0.03214285895228386, "clip_ratio/high_mean": 0.0801125643774867, "clip_ratio/high_max": 0.0801125643774867, "clip_ratio/region_mean": 0.11225542332977057, "reward_total_mean": 0.32643288373947144, "reward_meter_mean": 0.622302770614624, "reward_meter_std": 0.48749101161956787, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.3535534143447876, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9010752439498901, "reward_lexical_plausibility_std": 0.18063318729400635, "reward_repeat_penalty_mean": 0.9985781908035278, "reward_repeat_penalty_std": 0.0021619838662445545, "reward_repeat_floor_mean": 0.9997867345809937, "reward_repeat_floor_std": 0.00032429612474516034, "reward_near_duplicate_penalty_mean": 0.9985781908035278, "reward_near_duplicate_penalty_std": 0.0021619838662445545, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.39750000834465027, "reward_judge_quality_std": 0.27395254373550415, "reward_total_composite_mean": 0.32643288373947144, "reward_total_composite_std": 0.30038806796073914} {"timestamp_utc": "2026-04-12T16:43:48Z", "mode": "train", "global_step": 207, "epoch": 0.010894163465080785, "loss": -0.0234, "grad_norm": 5.783321857452393, "learning_rate": 9.375757575757576e-06, "num_tokens": 396003.0, "completions/mean_length": 96.0, "completions/min_length": 30.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 36.57143020629883, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.6044220328330994, "rewards/meter/std": 0.38935935497283936, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8877576589584351, "rewards/lexical_plausibility/std": 0.16585402190685272, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.9972041845321655, "rewards/repeat_penalty/std": 0.007907760329544544, "rewards/repeat_floor/mean": 0.9995806217193604, "rewards/repeat_floor/std": 0.0011861597886309028, "rewards/near_duplicate_penalty/mean": 0.9972041845321655, "rewards/near_duplicate_penalty/std": 0.007907760329544544, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15325434505939484, "rewards/total_composite/std": 0.13274861872196198, "reward": 0.15325434505939484, "reward_std": 0.13274861872196198, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19770850241184235, "sampling/sampling_logp_difference/max": 1.696860909461975, "sampling/importance_sampling_ratio/min": 0.18325787782669067, "sampling/importance_sampling_ratio/mean": 1.0484166145324707, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0697822868824005, "clip_ratio/low_mean": 0.06460118852555752, "clip_ratio/low_min": 0.06460118852555752, "clip_ratio/high_mean": 0.046474359929561615, "clip_ratio/high_max": 0.046474359929561615, "clip_ratio/region_mean": 0.11107554845511913, "reward_total_mean": 0.15325434505939484, "reward_meter_mean": 0.6044220328330994, "reward_meter_std": 0.38935935497283936, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8877576589584351, "reward_lexical_plausibility_std": 0.16585402190685272, "reward_repeat_penalty_mean": 0.9972041845321655, "reward_repeat_penalty_std": 0.007907760329544544, "reward_repeat_floor_mean": 0.9995806217193604, "reward_repeat_floor_std": 0.0011861597886309028, "reward_near_duplicate_penalty_mean": 0.9972041845321655, "reward_near_duplicate_penalty_std": 0.007907760329544544, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.15325434505939484, "reward_total_composite_std": 0.13274861872196198} {"timestamp_utc": "2026-04-12T16:43:57Z", "mode": "train", "global_step": 208, "epoch": 0.010946792274090837, "loss": -0.0052, "grad_norm": 18.905698776245117, "learning_rate": 9.372727272727273e-06, "num_tokens": 397599.0, "completions/mean_length": 35.5, "completions/min_length": 30.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.5, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.6675697565078735, "rewards/meter/std": 0.31470629572868347, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9751378297805786, "rewards/repeat_penalty/std": 0.029883703216910362, "rewards/repeat_floor/mean": 0.9967879056930542, "rewards/repeat_floor/std": 0.0036519819404929876, "rewards/near_duplicate_penalty/mean": 0.9838311672210693, "rewards/near_duplicate_penalty/std": 0.022379130125045776, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.2621288299560547, "rewards/total_composite/std": 0.13208754360675812, "reward": 0.2621288299560547, "reward_std": 0.13208752870559692, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23961612582206726, "sampling/sampling_logp_difference/max": 1.2466683387756348, "sampling/importance_sampling_ratio/min": 0.28746092319488525, "sampling/importance_sampling_ratio/mean": 1.0629518032073975, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.228884309530258, "clip_ratio/low_mean": 0.1445711050182581, "clip_ratio/low_min": 0.1445711050182581, "clip_ratio/high_mean": 0.11328125186264515, "clip_ratio/high_max": 0.11328125186264515, "clip_ratio/region_mean": 0.25785235688090324, "reward_total_mean": 0.2621288299560547, "reward_meter_mean": 0.6675697565078735, "reward_meter_std": 0.31470629572868347, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9751378297805786, "reward_repeat_penalty_std": 0.029883703216910362, "reward_repeat_floor_mean": 0.9967879056930542, "reward_repeat_floor_std": 0.0036519819404929876, "reward_near_duplicate_penalty_mean": 0.9838311672210693, "reward_near_duplicate_penalty_std": 0.022379130125045776, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.2621288299560547, "reward_total_composite_std": 0.13208754360675812} {"timestamp_utc": "2026-04-12T16:44:11Z", "mode": "train", "global_step": 209, "epoch": 0.01099942108310089, "loss": -0.0311, "grad_norm": 2.745635747909546, "learning_rate": 9.36969696969697e-06, "num_tokens": 399100.0, "completions/mean_length": 213.625, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 34.60000228881836, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.28015777468681335, "rewards/meter/std": 0.3834420144557953, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8569297790527344, "rewards/lexical_plausibility/std": 0.17469874024391174, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.9683129191398621, "rewards/repeat_penalty/std": 0.08822023123502731, "rewards/repeat_floor/mean": 0.9980594515800476, "rewards/repeat_floor/std": 0.005279997363686562, "rewards/near_duplicate_penalty/mean": 0.9995629191398621, "rewards/near_duplicate_penalty/std": 0.0012362091802060604, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11359059810638428, "rewards/total_composite/std": 0.16369518637657166, "reward": 0.11359059810638428, "reward_std": 0.16369518637657166, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24144268035888672, "sampling/sampling_logp_difference/max": 1.072744369506836, "sampling/importance_sampling_ratio/min": 0.34206846356391907, "sampling/importance_sampling_ratio/mean": 1.0731685161590576, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7406482100486755, "clip_ratio/low_mean": 0.04836849123239517, "clip_ratio/low_min": 0.04836849123239517, "clip_ratio/high_mean": 0.0986643135547638, "clip_ratio/high_max": 0.0986643135547638, "clip_ratio/region_mean": 0.14703280478715897, "reward_total_mean": 0.11359059810638428, "reward_meter_mean": 0.28015777468681335, "reward_meter_std": 0.3834420144557953, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8569297790527344, "reward_lexical_plausibility_std": 0.17469874024391174, "reward_repeat_penalty_mean": 0.9683129191398621, "reward_repeat_penalty_std": 0.08822023123502731, "reward_repeat_floor_mean": 0.9980594515800476, "reward_repeat_floor_std": 0.005279997363686562, "reward_near_duplicate_penalty_mean": 0.9995629191398621, "reward_near_duplicate_penalty_std": 0.0012362091802060604, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.11359059810638428, "reward_total_composite_std": 0.16369518637657166} {"timestamp_utc": "2026-04-12T16:44:26Z", "mode": "train", "global_step": 210, "epoch": 0.011052049892110942, "loss": -0.0112, "grad_norm": 0.7419185638427734, "learning_rate": 9.366666666666668e-06, "num_tokens": 400809.0, "completions/mean_length": 402.625, "completions/min_length": 22.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 74.5, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 127.0, "rewards/meter/mean": 0.5791481137275696, "rewards/meter/std": 0.31973588466644287, "rewards/count_adherence/mean": 0.4625000059604645, "rewards/count_adherence/std": 0.2722263038158417, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8387500047683716, "rewards/count_floor/std": 0.08166788518428802, "rewards/lexical_plausibility/mean": 0.7092629671096802, "rewards/lexical_plausibility/std": 0.1857946813106537, "rewards/judge_quality/mean": 0.07500000298023224, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.9599920511245728, "rewards/repeat_penalty/std": 0.08602334558963776, "rewards/repeat_floor/mean": 0.9968570470809937, "rewards/repeat_floor/std": 0.0050535649061203, "rewards/near_duplicate_penalty/mean": 0.9921658039093018, "rewards/near_duplicate_penalty/std": 0.005406332667917013, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9989688396453857, "rewards/distinct_2/std": 0.002916498575359583, "rewards/total_composite/mean": 0.037158988416194916, "rewards/total_composite/std": 0.02932584658265114, "reward": 0.037158988416194916, "reward_std": 0.02932584658265114, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1843682825565338, "sampling/sampling_logp_difference/max": 0.7553153038024902, "sampling/importance_sampling_ratio/min": 0.4817355275154114, "sampling/importance_sampling_ratio/mean": 1.0175669193267822, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4296127259731293, "clip_ratio/low_mean": 0.011811023578047752, "clip_ratio/low_min": 0.011811023578047752, "clip_ratio/high_mean": 0.034090910106897354, "clip_ratio/high_max": 0.034090910106897354, "clip_ratio/region_mean": 0.045901933684945107, "reward_total_mean": 0.037158988416194916, "reward_meter_mean": 0.5791481137275696, "reward_meter_std": 0.31973588466644287, "reward_count_adherence_mean": 0.4625000059604645, "reward_count_adherence_std": 0.2722263038158417, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8387500047683716, "reward_count_floor_std": 0.08166788518428802, "reward_lexical_plausibility_mean": 0.7092629671096802, "reward_lexical_plausibility_std": 0.1857946813106537, "reward_repeat_penalty_mean": 0.9599920511245728, "reward_repeat_penalty_std": 0.08602334558963776, "reward_repeat_floor_mean": 0.9968570470809937, "reward_repeat_floor_std": 0.0050535649061203, "reward_near_duplicate_penalty_mean": 0.9921658039093018, "reward_near_duplicate_penalty_std": 0.005406332667917013, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9989688396453857, "reward_distinct_2_std": 0.002916498575359583, "reward_judge_quality_mean": 0.07500000298023224, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.037158988416194916, "reward_total_composite_std": 0.02932584658265114} {"timestamp_utc": "2026-04-12T16:44:35Z", "mode": "train", "global_step": 211, "epoch": 0.011104678701120994, "loss": 0.0697, "grad_norm": 19.052175521850586, "learning_rate": 9.363636363636365e-06, "num_tokens": 402299.0, "completions/mean_length": 32.25, "completions/min_length": 30.0, "completions/max_length": 35.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.25, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.35857319831848145, "rewards/meter/std": 0.3390684723854065, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.22177450358867645, "rewards/repeat_penalty/mean": 0.995916485786438, "rewards/repeat_penalty/std": 0.00799814984202385, "rewards/repeat_floor/mean": 0.9993874430656433, "rewards/repeat_floor/std": 0.0011997224064543843, "rewards/near_duplicate_penalty/mean": 0.995916485786438, "rewards/near_duplicate_penalty/std": 0.00799814984202385, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16217264533042908, "rewards/total_composite/std": 0.15186506509780884, "reward": 0.16217264533042908, "reward_std": 0.15186506509780884, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2352273315191269, "sampling/sampling_logp_difference/max": 1.5037126541137695, "sampling/importance_sampling_ratio/min": 0.22230330109596252, "sampling/importance_sampling_ratio/mean": 1.0422440767288208, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.69798144698143, "clip_ratio/low_mean": 0.08931615576148033, "clip_ratio/low_min": 0.08931615576148033, "clip_ratio/high_mean": 0.10882056504487991, "clip_ratio/high_max": 0.10882056504487991, "clip_ratio/region_mean": 0.19813672080636024, "reward_total_mean": 0.16217264533042908, "reward_meter_mean": 0.35857319831848145, "reward_meter_std": 0.3390684723854065, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.995916485786438, "reward_repeat_penalty_std": 0.00799814984202385, "reward_repeat_floor_mean": 0.9993874430656433, "reward_repeat_floor_std": 0.0011997224064543843, "reward_near_duplicate_penalty_mean": 0.995916485786438, "reward_near_duplicate_penalty_std": 0.00799814984202385, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.22177450358867645, "reward_total_composite_mean": 0.16217264533042908, "reward_total_composite_std": 0.15186506509780884} {"timestamp_utc": "2026-04-12T16:44:49Z", "mode": "train", "global_step": 212, "epoch": 0.011157307510131045, "loss": -0.0691, "grad_norm": 1.820805311203003, "learning_rate": 9.36060606060606e-06, "num_tokens": 403891.0, "completions/mean_length": 400.0, "completions/min_length": 57.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 64.0, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.673837423324585, "rewards/meter/std": 0.2788621783256531, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687499761581421, "rewards/count_floor/std": 0.07763238251209259, "rewards/lexical_plausibility/mean": 0.7303123474121094, "rewards/lexical_plausibility/std": 0.15362820029258728, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9950567483901978, "rewards/repeat_penalty/std": 0.008463154546916485, "rewards/repeat_floor/mean": 0.9992585182189941, "rewards/repeat_floor/std": 0.001269485685043037, "rewards/near_duplicate_penalty/mean": 0.9950567483901978, "rewards/near_duplicate_penalty/std": 0.008463154546916485, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.07967209815979004, "rewards/total_composite/std": 0.09823612868785858, "reward": 0.07967209815979004, "reward_std": 0.09823612868785858, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2677590847015381, "sampling/sampling_logp_difference/max": 0.7996141910552979, "sampling/importance_sampling_ratio/min": 0.4977577030658722, "sampling/importance_sampling_ratio/mean": 1.1355384588241577, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0449228286743164, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.04657771252095699, "clip_ratio/high_max": 0.04657771252095699, "clip_ratio/region_mean": 0.04657771252095699, "reward_total_mean": 0.07967209815979004, "reward_meter_mean": 0.673837423324585, "reward_meter_std": 0.2788621783256531, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687499761581421, "reward_count_floor_std": 0.07763238251209259, "reward_lexical_plausibility_mean": 0.7303123474121094, "reward_lexical_plausibility_std": 0.15362820029258728, "reward_repeat_penalty_mean": 0.9950567483901978, "reward_repeat_penalty_std": 0.008463154546916485, "reward_repeat_floor_mean": 0.9992585182189941, "reward_repeat_floor_std": 0.001269485685043037, "reward_near_duplicate_penalty_mean": 0.9950567483901978, "reward_near_duplicate_penalty_std": 0.008463154546916485, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.07967209815979004, "reward_total_composite_std": 0.09823612868785858} {"timestamp_utc": "2026-04-12T16:44:57Z", "mode": "train", "global_step": 213, "epoch": 0.011209936319141097, "loss": -0.034, "grad_norm": 27.234357833862305, "learning_rate": 9.357575757575758e-06, "num_tokens": 405291.0, "completions/mean_length": 22.0, "completions/min_length": 17.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.0, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.7079232931137085, "rewards/meter/std": 0.33456262946128845, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.887499988079071, "rewards/judge_quality/std": 0.1767766922712326, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6232815980911255, "rewards/total_composite/std": 0.34102189540863037, "reward": 0.6232815980911255, "reward_std": 0.34102189540863037, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15619590878486633, "sampling/sampling_logp_difference/max": 1.7358851432800293, "sampling/importance_sampling_ratio/min": 0.17624413967132568, "sampling/importance_sampling_ratio/mean": 1.005838394165039, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.035675896331668, "clip_ratio/low_mean": 0.07611111178994179, "clip_ratio/low_min": 0.07611111178994179, "clip_ratio/high_mean": 0.1122333100065589, "clip_ratio/high_max": 0.1122333100065589, "clip_ratio/region_mean": 0.18834442179650068, "reward_total_mean": 0.6232815980911255, "reward_meter_mean": 0.7079232931137085, "reward_meter_std": 0.33456262946128845, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.887499988079071, "reward_judge_quality_std": 0.1767766922712326, "reward_total_composite_mean": 0.6232815980911255, "reward_total_composite_std": 0.34102189540863037} {"timestamp_utc": "2026-04-12T16:45:11Z", "mode": "train", "global_step": 214, "epoch": 0.01126256512815115, "loss": -0.0377, "grad_norm": 1.3515175580978394, "learning_rate": 9.354545454545455e-06, "num_tokens": 406633.0, "completions/mean_length": 454.75, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 54.0, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.38559412956237793, "rewards/meter/std": 0.37455591559410095, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.125, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.05175493285059929, "rewards/lexical_plausibility/mean": 0.7717058658599854, "rewards/lexical_plausibility/std": 0.11193247139453888, "rewards/judge_quality/mean": 0.0625, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.9950237274169922, "rewards/repeat_penalty/std": 0.005315759684890509, "rewards/repeat_floor/mean": 0.9992535710334778, "rewards/repeat_floor/std": 0.0007973714964464307, "rewards/near_duplicate_penalty/mean": 0.9950237274169922, "rewards/near_duplicate_penalty/std": 0.005315759684890509, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.031039826571941376, "rewards/total_composite/std": 0.0496603399515152, "reward": 0.031039826571941376, "reward_std": 0.0496603362262249, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.25347810983657837, "sampling/sampling_logp_difference/max": 0.9176156520843506, "sampling/importance_sampling_ratio/min": 0.537760853767395, "sampling/importance_sampling_ratio/mean": 1.139912486076355, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.48676249384880066, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.025462962687015533, "clip_ratio/high_max": 0.025462962687015533, "clip_ratio/region_mean": 0.025462962687015533, "reward_total_mean": 0.031039826571941376, "reward_meter_mean": 0.38559412956237793, "reward_meter_std": 0.37455591559410095, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.125, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.05175493285059929, "reward_lexical_plausibility_mean": 0.7717058658599854, "reward_lexical_plausibility_std": 0.11193247139453888, "reward_repeat_penalty_mean": 0.9950237274169922, "reward_repeat_penalty_std": 0.005315759684890509, "reward_repeat_floor_mean": 0.9992535710334778, "reward_repeat_floor_std": 0.0007973714964464307, "reward_near_duplicate_penalty_mean": 0.9950237274169922, "reward_near_duplicate_penalty_std": 0.005315759684890509, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.0625, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.031039826571941376, "reward_total_composite_std": 0.0496603399515152} {"timestamp_utc": "2026-04-12T16:45:20Z", "mode": "train", "global_step": 215, "epoch": 0.011315193937161202, "loss": 0.0507, "grad_norm": 23.49319839477539, "learning_rate": 9.351515151515152e-06, "num_tokens": 408734.0, "completions/mean_length": 65.625, "completions/min_length": 51.0, "completions/max_length": 85.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.625, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 85.0, "rewards/meter/mean": 0.5201544165611267, "rewards/meter/std": 0.33865422010421753, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9850000143051147, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.19668231904506683, "rewards/repeat_penalty/mean": 0.9904114007949829, "rewards/repeat_penalty/std": 0.0049859690479934216, "rewards/repeat_floor/mean": 0.9985617399215698, "rewards/repeat_floor/std": 0.000747889163903892, "rewards/near_duplicate_penalty/mean": 0.9904114007949829, "rewards/near_duplicate_penalty/std": 0.0049859690479934216, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2099500298500061, "rewards/total_composite/std": 0.128269225358963, "reward": 0.2099500298500061, "reward_std": 0.12826921045780182, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2299450784921646, "sampling/sampling_logp_difference/max": 2.288926601409912, "sampling/importance_sampling_ratio/min": 0.10137522220611572, "sampling/importance_sampling_ratio/mean": 0.9993533492088318, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2596945688128471, "clip_ratio/low_mean": 0.10337468795478344, "clip_ratio/low_min": 0.10337468795478344, "clip_ratio/high_mean": 0.08307577297091484, "clip_ratio/high_max": 0.08307577297091484, "clip_ratio/region_mean": 0.18645046092569828, "reward_total_mean": 0.2099500298500061, "reward_meter_mean": 0.5201544165611267, "reward_meter_std": 0.33865422010421753, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9850000143051147, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9904114007949829, "reward_repeat_penalty_std": 0.0049859690479934216, "reward_repeat_floor_mean": 0.9985617399215698, "reward_repeat_floor_std": 0.000747889163903892, "reward_near_duplicate_penalty_mean": 0.9904114007949829, "reward_near_duplicate_penalty_std": 0.0049859690479934216, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.19668231904506683, "reward_total_composite_mean": 0.2099500298500061, "reward_total_composite_std": 0.128269225358963} {"timestamp_utc": "2026-04-12T16:45:33Z", "mode": "train", "global_step": 216, "epoch": 0.011367822746171255, "loss": -0.0272, "grad_norm": 3.323742151260376, "learning_rate": 9.34848484848485e-06, "num_tokens": 410190.0, "completions/mean_length": 156.0, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 37.333335876464844, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.6257503032684326, "rewards/meter/std": 0.4384929835796356, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9170446395874023, "rewards/lexical_plausibility/std": 0.13874001801013947, "rewards/judge_quality/mean": 0.3712500333786011, "rewards/judge_quality/std": 0.3466755449771881, "rewards/repeat_penalty/mean": 0.9333760738372803, "rewards/repeat_penalty/std": 0.12040144205093384, "rewards/repeat_floor/mean": 0.9954893589019775, "rewards/repeat_floor/std": 0.007987740449607372, "rewards/near_duplicate_penalty/mean": 0.9949291348457336, "rewards/near_duplicate_penalty/std": 0.01080945786088705, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2878599464893341, "rewards/total_composite/std": 0.34471791982650757, "reward": 0.2878599464893341, "reward_std": 0.3447178900241852, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21436162292957306, "sampling/sampling_logp_difference/max": 0.9169864654541016, "sampling/importance_sampling_ratio/min": 0.39972180128097534, "sampling/importance_sampling_ratio/mean": 1.067720890045166, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4292386174201965, "clip_ratio/low_mean": 0.08294450864195824, "clip_ratio/low_min": 0.08294450864195824, "clip_ratio/high_mean": 0.03644018666818738, "clip_ratio/high_max": 0.03644018666818738, "clip_ratio/region_mean": 0.11938469531014562, "reward_total_mean": 0.2878599464893341, "reward_meter_mean": 0.6257503032684326, "reward_meter_std": 0.4384929835796356, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9170446395874023, "reward_lexical_plausibility_std": 0.13874001801013947, "reward_repeat_penalty_mean": 0.9333760738372803, "reward_repeat_penalty_std": 0.12040144205093384, "reward_repeat_floor_mean": 0.9954893589019775, "reward_repeat_floor_std": 0.007987740449607372, "reward_near_duplicate_penalty_mean": 0.9949291348457336, "reward_near_duplicate_penalty_std": 0.01080945786088705, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3712500333786011, "reward_judge_quality_std": 0.3466755449771881, "reward_total_composite_mean": 0.2878599464893341, "reward_total_composite_std": 0.34471791982650757} {"timestamp_utc": "2026-04-12T16:45:41Z", "mode": "train", "global_step": 217, "epoch": 0.011420451555181307, "loss": 0.1321, "grad_norm": 16.335145950317383, "learning_rate": 9.345454545454547e-06, "num_tokens": 411796.0, "completions/mean_length": 35.75, "completions/min_length": 30.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.75, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.6175544261932373, "rewards/meter/std": 0.4756390154361725, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.9516937732696533, "rewards/repeat_penalty/std": 0.02354690432548523, "rewards/repeat_floor/mean": 0.9927541017532349, "rewards/repeat_floor/std": 0.0035320345778018236, "rewards/near_duplicate_penalty/mean": 0.9516937732696533, "rewards/near_duplicate_penalty/std": 0.02354690432548523, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.43223848938941956, "rewards/total_composite/std": 0.40692591667175293, "reward": 0.43223848938941956, "reward_std": 0.40692591667175293, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17292283475399017, "sampling/sampling_logp_difference/max": 1.6637763977050781, "sampling/importance_sampling_ratio/min": 0.18942229449748993, "sampling/importance_sampling_ratio/mean": 1.015834093093872, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5780327171087265, "clip_ratio/low_mean": 0.10448349639773369, "clip_ratio/low_min": 0.10448349639773369, "clip_ratio/high_mean": 0.08014706149697304, "clip_ratio/high_max": 0.08014706149697304, "clip_ratio/region_mean": 0.18463055789470673, "reward_total_mean": 0.43223848938941956, "reward_meter_mean": 0.6175544261932373, "reward_meter_std": 0.4756390154361725, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9516937732696533, "reward_repeat_penalty_std": 0.02354690432548523, "reward_repeat_floor_mean": 0.9927541017532349, "reward_repeat_floor_std": 0.0035320345778018236, "reward_near_duplicate_penalty_mean": 0.9516937732696533, "reward_near_duplicate_penalty_std": 0.02354690432548523, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.43223848938941956, "reward_total_composite_std": 0.40692591667175293} {"timestamp_utc": "2026-04-12T16:45:50Z", "mode": "train", "global_step": 218, "epoch": 0.011473080364191358, "loss": 0.0679, "grad_norm": 25.940507888793945, "learning_rate": 9.342424242424243e-06, "num_tokens": 413121.0, "completions/mean_length": 17.625, "completions/min_length": 14.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.625, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.7779308557510376, "rewards/meter/std": 0.3581196069717407, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5137500166893005, "rewards/judge_quality/std": 0.3586059510707855, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.36226576566696167, "rewards/total_composite/std": 0.34641146659851074, "reward": 0.36226576566696167, "reward_std": 0.34641146659851074, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20455262064933777, "sampling/sampling_logp_difference/max": 1.4882903099060059, "sampling/importance_sampling_ratio/min": 0.22575829923152924, "sampling/importance_sampling_ratio/mean": 1.0410339832305908, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.24961219727993, "clip_ratio/low_mean": 0.09095703344792128, "clip_ratio/low_min": 0.09095703344792128, "clip_ratio/high_mean": 0.06939338240772486, "clip_ratio/high_max": 0.06939338240772486, "clip_ratio/region_mean": 0.16035041585564613, "reward_total_mean": 0.36226576566696167, "reward_meter_mean": 0.7779308557510376, "reward_meter_std": 0.3581196069717407, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5137500166893005, "reward_judge_quality_std": 0.3586059510707855, "reward_total_composite_mean": 0.36226576566696167, "reward_total_composite_std": 0.34641146659851074} {"timestamp_utc": "2026-04-12T16:45:59Z", "mode": "train", "global_step": 219, "epoch": 0.01152570917320141, "loss": 0.0455, "grad_norm": 19.09295082092285, "learning_rate": 9.33939393939394e-06, "num_tokens": 414570.0, "completions/mean_length": 34.125, "completions/min_length": 28.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.125, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.5822951197624207, "rewards/meter/std": 0.4585415720939636, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9896408915519714, "rewards/repeat_penalty/std": 0.016224481165409088, "rewards/repeat_floor/mean": 0.9984461069107056, "rewards/repeat_floor/std": 0.002433664398267865, "rewards/near_duplicate_penalty/mean": 0.9896408915519714, "rewards/near_duplicate_penalty/std": 0.016224481165409088, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2613937556743622, "rewards/total_composite/std": 0.2057267129421234, "reward": 0.2613937556743622, "reward_std": 0.2057267129421234, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18743401765823364, "sampling/sampling_logp_difference/max": 1.6540594100952148, "sampling/importance_sampling_ratio/min": 0.19127187132835388, "sampling/importance_sampling_ratio/mean": 1.0398900508880615, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9390588402748108, "clip_ratio/low_mean": 0.05295000830665231, "clip_ratio/low_min": 0.05295000830665231, "clip_ratio/high_mean": 0.11012150626629591, "clip_ratio/high_max": 0.11012150626629591, "clip_ratio/region_mean": 0.16307151457294822, "reward_total_mean": 0.2613937556743622, "reward_meter_mean": 0.5822951197624207, "reward_meter_std": 0.4585415720939636, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9896408915519714, "reward_repeat_penalty_std": 0.016224481165409088, "reward_repeat_floor_mean": 0.9984461069107056, "reward_repeat_floor_std": 0.002433664398267865, "reward_near_duplicate_penalty_mean": 0.9896408915519714, "reward_near_duplicate_penalty_std": 0.016224481165409088, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.2613937556743622, "reward_total_composite_std": 0.2057267129421234} {"timestamp_utc": "2026-04-12T16:46:13Z", "mode": "train", "global_step": 220, "epoch": 0.011578337982211463, "loss": -0.0451, "grad_norm": 1.6660808324813843, "learning_rate": 9.336363636363637e-06, "num_tokens": 416198.0, "completions/mean_length": 280.5, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 49.0, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.4168480634689331, "rewards/meter/std": 0.31307777762413025, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.28149792551994324, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.934374988079071, "rewards/count_floor/std": 0.08444937318563461, "rewards/lexical_plausibility/mean": 0.8552516102790833, "rewards/lexical_plausibility/std": 0.16271202266216278, "rewards/judge_quality/mean": 0.18125000596046448, "rewards/judge_quality/std": 0.17512750625610352, "rewards/repeat_penalty/mean": 0.9324818253517151, "rewards/repeat_penalty/std": 0.0984434187412262, "rewards/repeat_floor/mean": 0.9956501722335815, "rewards/repeat_floor/std": 0.005253738723695278, "rewards/near_duplicate_penalty/mean": 0.9883019328117371, "rewards/near_duplicate_penalty/std": 0.013734445907175541, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9919986724853516, "rewards/distinct_2/std": 0.014318671077489853, "rewards/total_composite/mean": 0.08835402131080627, "rewards/total_composite/std": 0.10560376197099686, "reward": 0.08835402131080627, "reward_std": 0.10560375452041626, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21905475854873657, "sampling/sampling_logp_difference/max": 0.9840552806854248, "sampling/importance_sampling_ratio/min": 0.43166446685791016, "sampling/importance_sampling_ratio/mean": 1.0340116024017334, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4396289587020874, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.11531941220164299, "clip_ratio/high_max": 0.11531941220164299, "clip_ratio/region_mean": 0.11531941220164299, "reward_total_mean": 0.08835402131080627, "reward_meter_mean": 0.4168480634689331, "reward_meter_std": 0.31307777762413025, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.28149792551994324, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.934374988079071, "reward_count_floor_std": 0.08444937318563461, "reward_lexical_plausibility_mean": 0.8552516102790833, "reward_lexical_plausibility_std": 0.16271202266216278, "reward_repeat_penalty_mean": 0.9324818253517151, "reward_repeat_penalty_std": 0.0984434187412262, "reward_repeat_floor_mean": 0.9956501722335815, "reward_repeat_floor_std": 0.005253738723695278, "reward_near_duplicate_penalty_mean": 0.9883019328117371, "reward_near_duplicate_penalty_std": 0.013734445907175541, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9919986724853516, "reward_distinct_2_std": 0.014318671077489853, "reward_judge_quality_mean": 0.18125000596046448, "reward_judge_quality_std": 0.17512750625610352, "reward_total_composite_mean": 0.08835402131080627, "reward_total_composite_std": 0.10560376197099686} {"timestamp_utc": "2026-04-12T16:46:26Z", "mode": "train", "global_step": 221, "epoch": 0.011630966791221515, "loss": -0.086, "grad_norm": 4.576457977294922, "learning_rate": 9.333333333333334e-06, "num_tokens": 417948.0, "completions/mean_length": 188.75, "completions/min_length": 73.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 81.0, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.19065053761005402, "rewards/meter/std": 0.1801435500383377, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.1511857807636261, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9700000286102295, "rewards/count_floor/std": 0.04535574093461037, "rewards/lexical_plausibility/mean": 0.9536890983581543, "rewards/lexical_plausibility/std": 0.09056153148412704, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.9514344930648804, "rewards/repeat_penalty/std": 0.05912245064973831, "rewards/repeat_floor/mean": 0.9948757886886597, "rewards/repeat_floor/std": 0.006274827290326357, "rewards/near_duplicate_penalty/mean": 0.9889129400253296, "rewards/near_duplicate_penalty/std": 0.013839642517268658, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.961542546749115, "rewards/distinct_2/std": 0.047152500599622726, "rewards/total_composite/mean": 0.07901493459939957, "rewards/total_composite/std": 0.08410973101854324, "reward": 0.07901493459939957, "reward_std": 0.08410973101854324, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2276083528995514, "sampling/sampling_logp_difference/max": 1.8408679962158203, "sampling/importance_sampling_ratio/min": 0.15867963433265686, "sampling/importance_sampling_ratio/mean": 1.0345252752304077, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5651446878910065, "clip_ratio/low_mean": 0.07474303804337978, "clip_ratio/low_min": 0.07474303804337978, "clip_ratio/high_mean": 0.08329828828573227, "clip_ratio/high_max": 0.08329828828573227, "clip_ratio/region_mean": 0.15804132632911205, "reward_total_mean": 0.07901493459939957, "reward_meter_mean": 0.19065053761005402, "reward_meter_std": 0.1801435500383377, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.1511857807636261, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9700000286102295, "reward_count_floor_std": 0.04535574093461037, "reward_lexical_plausibility_mean": 0.9536890983581543, "reward_lexical_plausibility_std": 0.09056153148412704, "reward_repeat_penalty_mean": 0.9514344930648804, "reward_repeat_penalty_std": 0.05912245064973831, "reward_repeat_floor_mean": 0.9948757886886597, "reward_repeat_floor_std": 0.006274827290326357, "reward_near_duplicate_penalty_mean": 0.9889129400253296, "reward_near_duplicate_penalty_std": 0.013839642517268658, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.961542546749115, "reward_distinct_2_std": 0.047152500599622726, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.07901493459939957, "reward_total_composite_std": 0.08410973101854324} {"timestamp_utc": "2026-04-12T16:46:41Z", "mode": "train", "global_step": 222, "epoch": 0.011683595600231567, "loss": 0.0, "grad_norm": 0.0, "learning_rate": 9.33030303030303e-06, "num_tokens": 419516.0, "completions/mean_length": 512.0, "completions/min_length": 512.0, "completions/max_length": 512.0, "completions/clipped_ratio": 1.0, "completions/mean_terminated_length": 0.0, "completions/min_terminated_length": 0.0, "completions/max_terminated_length": 0.0, "rewards/meter/mean": 0.7977553606033325, "rewards/meter/std": 0.2215038686990738, "rewards/count_adherence/mean": 0.578125, "rewards/count_adherence/std": 0.19974872469902039, "rewards/arabic_clean/mean": 0.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.8734374642372131, "rewards/count_floor/std": 0.059924617409706116, "rewards/lexical_plausibility/mean": 0.6908619403839111, "rewards/lexical_plausibility/std": 0.07034913450479507, "rewards/judge_quality/mean": 0.0625, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.9941745400428772, "rewards/repeat_penalty/std": 0.006332909222692251, "rewards/repeat_floor/mean": 0.9992550611495972, "rewards/repeat_floor/std": 0.0008662913460284472, "rewards/near_duplicate_penalty/mean": 0.9963395595550537, "rewards/near_duplicate_penalty/std": 0.005102863069623709, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9978231191635132, "rewards/distinct_2/std": 0.0023297611624002457, "rewards/total_composite/mean": 0.04376174509525299, "rewards/total_composite/std": 0.030908260494470596, "reward": 0.04376174509525299, "reward_std": 0.030908260494470596, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0, "sampling/sampling_logp_difference/max": 0.0, "sampling/importance_sampling_ratio/min": 0.0, "sampling/importance_sampling_ratio/mean": 0.0, "sampling/importance_sampling_ratio/max": 0.0, "entropy": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/high_max": 0.0, "clip_ratio/region_mean": 0.0, "reward_total_mean": 0.04376174509525299, "reward_meter_mean": 0.7977553606033325, "reward_meter_std": 0.2215038686990738, "reward_count_adherence_mean": 0.578125, "reward_count_adherence_std": 0.19974872469902039, "reward_arabic_clean_mean": 0.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.8734374642372131, "reward_count_floor_std": 0.059924617409706116, "reward_lexical_plausibility_mean": 0.6908619403839111, "reward_lexical_plausibility_std": 0.07034913450479507, "reward_repeat_penalty_mean": 0.9941745400428772, "reward_repeat_penalty_std": 0.006332909222692251, "reward_repeat_floor_mean": 0.9992550611495972, "reward_repeat_floor_std": 0.0008662913460284472, "reward_near_duplicate_penalty_mean": 0.9963395595550537, "reward_near_duplicate_penalty_std": 0.005102863069623709, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9978231191635132, "reward_distinct_2_std": 0.0023297611624002457, "reward_judge_quality_mean": 0.0625, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.04376174509525299, "reward_total_composite_std": 0.030908260494470596} {"timestamp_utc": "2026-04-12T16:46:50Z", "mode": "train", "global_step": 223, "epoch": 0.01173622440924162, "loss": -0.0243, "grad_norm": 14.237860679626465, "learning_rate": 9.327272727272729e-06, "num_tokens": 421113.0, "completions/mean_length": 43.625, "completions/min_length": 32.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.625, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.7762871384620667, "rewards/meter/std": 0.323667973279953, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.26592159271240234, "rewards/repeat_penalty/mean": 0.9909542798995972, "rewards/repeat_penalty/std": 0.00725660240277648, "rewards/repeat_floor/mean": 0.998643159866333, "rewards/repeat_floor/std": 0.001088486285880208, "rewards/near_duplicate_penalty/mean": 0.9909542798995972, "rewards/near_duplicate_penalty/std": 0.00725660240277648, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.30592989921569824, "rewards/total_composite/std": 0.2920238971710205, "reward": 0.30592989921569824, "reward_std": 0.2920239269733429, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21913012862205505, "sampling/sampling_logp_difference/max": 1.454554557800293, "sampling/importance_sampling_ratio/min": 0.23350435495376587, "sampling/importance_sampling_ratio/mean": 1.050878882408142, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.473749414086342, "clip_ratio/low_mean": 0.10079926811158657, "clip_ratio/low_min": 0.10079926811158657, "clip_ratio/high_mean": 0.10061218775808811, "clip_ratio/high_max": 0.10061218775808811, "clip_ratio/region_mean": 0.20141145586967468, "reward_total_mean": 0.30592989921569824, "reward_meter_mean": 0.7762871384620667, "reward_meter_std": 0.323667973279953, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9909542798995972, "reward_repeat_penalty_std": 0.00725660240277648, "reward_repeat_floor_mean": 0.998643159866333, "reward_repeat_floor_std": 0.001088486285880208, "reward_near_duplicate_penalty_mean": 0.9909542798995972, "reward_near_duplicate_penalty_std": 0.00725660240277648, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.26592159271240234, "reward_total_composite_mean": 0.30592989921569824, "reward_total_composite_std": 0.2920238971710205} {"timestamp_utc": "2026-04-12T16:47:04Z", "mode": "train", "global_step": 224, "epoch": 0.01178885321825167, "loss": -0.1116, "grad_norm": 5.811514854431152, "learning_rate": 9.324242424242424e-06, "num_tokens": 422749.0, "completions/mean_length": 95.5, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 36.0, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.9750537872314453, "rewards/meter/std": 0.035048168152570724, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 0.9425743222236633, "rewards/lexical_plausibility/std": 0.11617325246334076, "rewards/judge_quality/mean": 0.23125000298023224, "rewards/judge_quality/std": 0.16461534798145294, "rewards/repeat_penalty/mean": 0.8933764696121216, "rewards/repeat_penalty/std": 0.12036852538585663, "rewards/repeat_floor/mean": 0.9929247498512268, "rewards/repeat_floor/std": 0.006812785752117634, "rewards/near_duplicate_penalty/mean": 0.9951393008232117, "rewards/near_duplicate_penalty/std": 0.009027883410453796, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9919871687889099, "rewards/distinct_2/std": 0.02266368828713894, "rewards/total_composite/mean": 0.21982286870479584, "rewards/total_composite/std": 0.16935597360134125, "reward": 0.21982286870479584, "reward_std": 0.16935597360134125, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23326432704925537, "sampling/sampling_logp_difference/max": 1.2762398719787598, "sampling/importance_sampling_ratio/min": 0.279084712266922, "sampling/importance_sampling_ratio/mean": 1.0669156312942505, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 3.077867805957794, "clip_ratio/low_mean": 0.0736715579405427, "clip_ratio/low_min": 0.0736715579405427, "clip_ratio/high_mean": 0.08973146043717861, "clip_ratio/high_max": 0.08973146043717861, "clip_ratio/region_mean": 0.1634030183777213, "reward_total_mean": 0.21982286870479584, "reward_meter_mean": 0.9750537872314453, "reward_meter_std": 0.035048168152570724, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 0.9425743222236633, "reward_lexical_plausibility_std": 0.11617325246334076, "reward_repeat_penalty_mean": 0.8933764696121216, "reward_repeat_penalty_std": 0.12036852538585663, "reward_repeat_floor_mean": 0.9929247498512268, "reward_repeat_floor_std": 0.006812785752117634, "reward_near_duplicate_penalty_mean": 0.9951393008232117, "reward_near_duplicate_penalty_std": 0.009027883410453796, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9919871687889099, "reward_distinct_2_std": 0.02266368828713894, "reward_judge_quality_mean": 0.23125000298023224, "reward_judge_quality_std": 0.16461534798145294, "reward_total_composite_mean": 0.21982286870479584, "reward_total_composite_std": 0.16935597360134125} {"timestamp_utc": "2026-04-12T16:47:12Z", "mode": "train", "global_step": 225, "epoch": 0.011841482027261723, "loss": 0.1261, "grad_norm": 18.091720581054688, "learning_rate": 9.321212121212122e-06, "num_tokens": 424350.0, "completions/mean_length": 36.125, "completions/min_length": 16.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.125, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.7392919063568115, "rewards/meter/std": 0.38587990403175354, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9953668117523193, "rewards/lexical_plausibility/std": 0.009900491684675217, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.96875, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9981250166893005, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4188479781150818, "rewards/total_composite/std": 0.34137439727783203, "reward": 0.4188479781150818, "reward_std": 0.34137439727783203, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22719928622245789, "sampling/sampling_logp_difference/max": 1.7320566177368164, "sampling/importance_sampling_ratio/min": 0.17692016065120697, "sampling/importance_sampling_ratio/mean": 1.0504812002182007, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5301357060670853, "clip_ratio/low_mean": 0.14875992434099317, "clip_ratio/low_min": 0.14875992434099317, "clip_ratio/high_mean": 0.08425324968993664, "clip_ratio/high_max": 0.08425324968993664, "clip_ratio/region_mean": 0.2330131740309298, "reward_total_mean": 0.4188479781150818, "reward_meter_mean": 0.7392919063568115, "reward_meter_std": 0.38587990403175354, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9953668117523193, "reward_lexical_plausibility_std": 0.009900491684675217, "reward_repeat_penalty_mean": 0.96875, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9981250166893005, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.4188479781150818, "reward_total_composite_std": 0.34137439727783203} {"timestamp_utc": "2026-04-12T16:47:26Z", "mode": "train", "global_step": 226, "epoch": 0.011894110836271775, "loss": -0.0531, "grad_norm": 4.074066162109375, "learning_rate": 9.318181818181819e-06, "num_tokens": 425746.0, "completions/mean_length": 82.5, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 21.142858505249023, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.8516990542411804, "rewards/meter/std": 0.34473299980163574, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9503329992294312, "rewards/lexical_plausibility/std": 0.1404794305562973, "rewards/judge_quality/mean": 0.5924999713897705, "rewards/judge_quality/std": 0.3853291869163513, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5613418817520142, "rewards/total_composite/std": 0.3796902000904083, "reward": 0.5613418817520142, "reward_std": 0.3796902000904083, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1913546323776245, "sampling/sampling_logp_difference/max": 1.3582305908203125, "sampling/importance_sampling_ratio/min": 0.25711530447006226, "sampling/importance_sampling_ratio/mean": 1.0482648611068726, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7384716868400574, "clip_ratio/low_mean": 0.07791733276098967, "clip_ratio/low_min": 0.07791733276098967, "clip_ratio/high_mean": 0.05777899548411369, "clip_ratio/high_max": 0.05777899548411369, "clip_ratio/region_mean": 0.13569632824510336, "reward_total_mean": 0.5613418817520142, "reward_meter_mean": 0.8516990542411804, "reward_meter_std": 0.34473299980163574, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9503329992294312, "reward_lexical_plausibility_std": 0.1404794305562973, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5924999713897705, "reward_judge_quality_std": 0.3853291869163513, "reward_total_composite_mean": 0.5613418817520142, "reward_total_composite_std": 0.3796902000904083} {"timestamp_utc": "2026-04-12T16:47:35Z", "mode": "train", "global_step": 227, "epoch": 0.011946739645281828, "loss": 0.062, "grad_norm": 11.85656452178955, "learning_rate": 9.315151515151516e-06, "num_tokens": 427574.0, "completions/mean_length": 57.5, "completions/min_length": 48.0, "completions/max_length": 70.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.5, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.9355548620223999, "rewards/meter/std": 0.10469502210617065, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.971396803855896, "rewards/repeat_penalty/std": 0.03477616235613823, "rewards/repeat_floor/mean": 0.995978832244873, "rewards/repeat_floor/std": 0.004565069917589426, "rewards/near_duplicate_penalty/mean": 0.9763974547386169, "rewards/near_duplicate_penalty/std": 0.02343011274933815, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9946581125259399, "rewards/distinct_2/std": 0.01510911900550127, "rewards/total_composite/mean": 0.45958274602890015, "rewards/total_composite/std": 0.18823538720607758, "reward": 0.45958274602890015, "reward_std": 0.18823538720607758, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22032207250595093, "sampling/sampling_logp_difference/max": 1.444075584411621, "sampling/importance_sampling_ratio/min": 0.2359641194343567, "sampling/importance_sampling_ratio/mean": 1.0553920269012451, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.563923791050911, "clip_ratio/low_mean": 0.1450505694374442, "clip_ratio/low_min": 0.1450505694374442, "clip_ratio/high_mean": 0.029545454308390617, "clip_ratio/high_max": 0.029545454308390617, "clip_ratio/region_mean": 0.17459602374583483, "reward_total_mean": 0.45958274602890015, "reward_meter_mean": 0.9355548620223999, "reward_meter_std": 0.10469502210617065, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.971396803855896, "reward_repeat_penalty_std": 0.03477616235613823, "reward_repeat_floor_mean": 0.995978832244873, "reward_repeat_floor_std": 0.004565069917589426, "reward_near_duplicate_penalty_mean": 0.9763974547386169, "reward_near_duplicate_penalty_std": 0.02343011274933815, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9946581125259399, "reward_distinct_2_std": 0.01510911900550127, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.45958274602890015, "reward_total_composite_std": 0.18823538720607758} {"timestamp_utc": "2026-04-12T16:47:44Z", "mode": "train", "global_step": 228, "epoch": 0.01199936845429188, "loss": -0.009, "grad_norm": 17.098552703857422, "learning_rate": 9.312121212121212e-06, "num_tokens": 429223.0, "completions/mean_length": 39.125, "completions/min_length": 32.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.125, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.2652822732925415, "rewards/meter/std": 0.38240987062454224, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.95652174949646, "rewards/lexical_plausibility/std": 0.12297508865594864, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9891475439071655, "rewards/repeat_penalty/std": 0.016673490405082703, "rewards/repeat_floor/mean": 0.9983721375465393, "rewards/repeat_floor/std": 0.0025010122917592525, "rewards/near_duplicate_penalty/mean": 0.9891475439071655, "rewards/near_duplicate_penalty/std": 0.016673490405082703, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.10478058457374573, "rewards/total_composite/std": 0.15999507904052734, "reward": 0.10478058457374573, "reward_std": 0.15999507904052734, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21070675551891327, "sampling/sampling_logp_difference/max": 2.224109172821045, "sampling/importance_sampling_ratio/min": 0.1081637367606163, "sampling/importance_sampling_ratio/mean": 1.0367555618286133, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9564559906721115, "clip_ratio/low_mean": 0.0989826051518321, "clip_ratio/low_min": 0.0989826051518321, "clip_ratio/high_mean": 0.059379216749221087, "clip_ratio/high_max": 0.059379216749221087, "clip_ratio/region_mean": 0.1583618219010532, "reward_total_mean": 0.10478058457374573, "reward_meter_mean": 0.2652822732925415, "reward_meter_std": 0.38240987062454224, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.95652174949646, "reward_lexical_plausibility_std": 0.12297508865594864, "reward_repeat_penalty_mean": 0.9891475439071655, "reward_repeat_penalty_std": 0.016673490405082703, "reward_repeat_floor_mean": 0.9983721375465393, "reward_repeat_floor_std": 0.0025010122917592525, "reward_near_duplicate_penalty_mean": 0.9891475439071655, "reward_near_duplicate_penalty_std": 0.016673490405082703, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.10478058457374573, "reward_total_composite_std": 0.15999507904052734} {"timestamp_utc": "2026-04-12T16:47:58Z", "mode": "train", "global_step": 229, "epoch": 0.01205199726330193, "loss": -0.0281, "grad_norm": 3.2970972061157227, "learning_rate": 9.30909090909091e-06, "num_tokens": 430888.0, "completions/mean_length": 238.125, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 73.80000305175781, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.32129067182540894, "rewards/meter/std": 0.31284385919570923, "rewards/count_adherence/mean": 0.65625, "rewards/count_adherence/std": 0.22903135418891907, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8968750238418579, "rewards/count_floor/std": 0.06870941072702408, "rewards/lexical_plausibility/mean": 0.8877338171005249, "rewards/lexical_plausibility/std": 0.1321529895067215, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.1767766922712326, "rewards/repeat_penalty/mean": 0.9146140813827515, "rewards/repeat_penalty/std": 0.11323264241218567, "rewards/repeat_floor/mean": 0.9933590888977051, "rewards/repeat_floor/std": 0.00719152856618166, "rewards/near_duplicate_penalty/mean": 0.9878732562065125, "rewards/near_duplicate_penalty/std": 0.015880271792411804, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9880892634391785, "rewards/distinct_2/std": 0.02549082227051258, "rewards/total_composite/mean": 0.087250255048275, "rewards/total_composite/std": 0.13232587277889252, "reward": 0.087250255048275, "reward_std": 0.13232587277889252, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2153828740119934, "sampling/sampling_logp_difference/max": 1.0914678573608398, "sampling/importance_sampling_ratio/min": 0.335723340511322, "sampling/importance_sampling_ratio/mean": 1.0501376390457153, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.866685301065445, "clip_ratio/low_mean": 0.061829304322600365, "clip_ratio/low_min": 0.061829304322600365, "clip_ratio/high_mean": 0.05949237011373043, "clip_ratio/high_max": 0.05949237011373043, "clip_ratio/region_mean": 0.1213216744363308, "reward_total_mean": 0.087250255048275, "reward_meter_mean": 0.32129067182540894, "reward_meter_std": 0.31284385919570923, "reward_count_adherence_mean": 0.65625, "reward_count_adherence_std": 0.22903135418891907, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8968750238418579, "reward_count_floor_std": 0.06870941072702408, "reward_lexical_plausibility_mean": 0.8877338171005249, "reward_lexical_plausibility_std": 0.1321529895067215, "reward_repeat_penalty_mean": 0.9146140813827515, "reward_repeat_penalty_std": 0.11323264241218567, "reward_repeat_floor_mean": 0.9933590888977051, "reward_repeat_floor_std": 0.00719152856618166, "reward_near_duplicate_penalty_mean": 0.9878732562065125, "reward_near_duplicate_penalty_std": 0.015880271792411804, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9880892634391785, "reward_distinct_2_std": 0.02549082227051258, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.1767766922712326, "reward_total_composite_mean": 0.087250255048275, "reward_total_composite_std": 0.13232587277889252} {"timestamp_utc": "2026-04-12T16:48:06Z", "mode": "train", "global_step": 230, "epoch": 0.012104626072311983, "loss": 0.1667, "grad_norm": 24.872583389282227, "learning_rate": 9.306060606060608e-06, "num_tokens": 432191.0, "completions/mean_length": 16.875, "completions/min_length": 14.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.875, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.7083169221878052, "rewards/meter/std": 0.42615315318107605, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8062499761581421, "rewards/judge_quality/std": 0.22012577950954437, "rewards/repeat_penalty/mean": 0.7123380303382874, "rewards/repeat_penalty/std": 0.03877650946378708, "rewards/repeat_floor/mean": 0.9774675965309143, "rewards/repeat_floor/std": 0.007755298633128405, "rewards/near_duplicate_penalty/mean": 0.9497840404510498, "rewards/near_duplicate_penalty/std": 0.05170203372836113, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5452650189399719, "rewards/total_composite/std": 0.3932492136955261, "reward": 0.5452650189399719, "reward_std": 0.39324918389320374, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15991055965423584, "sampling/sampling_logp_difference/max": 1.5523312091827393, "sampling/importance_sampling_ratio/min": 0.2117537558078766, "sampling/importance_sampling_ratio/mean": 0.9995664358139038, "sampling/importance_sampling_ratio/max": 1.9226329326629639, "entropy": 1.2698263004422188, "clip_ratio/low_mean": 0.059748932253569365, "clip_ratio/low_min": 0.059748932253569365, "clip_ratio/high_mean": 0.008928571827709675, "clip_ratio/high_max": 0.008928571827709675, "clip_ratio/region_mean": 0.06867750408127904, "reward_total_mean": 0.5452650189399719, "reward_meter_mean": 0.7083169221878052, "reward_meter_std": 0.42615315318107605, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7123380303382874, "reward_repeat_penalty_std": 0.03877650946378708, "reward_repeat_floor_mean": 0.9774675965309143, "reward_repeat_floor_std": 0.007755298633128405, "reward_near_duplicate_penalty_mean": 0.9497840404510498, "reward_near_duplicate_penalty_std": 0.05170203372836113, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8062499761581421, "reward_judge_quality_std": 0.22012577950954437, "reward_total_composite_mean": 0.5452650189399719, "reward_total_composite_std": 0.3932492136955261} {"timestamp_utc": "2026-04-12T16:48:14Z", "mode": "train", "global_step": 231, "epoch": 0.012157254881322035, "loss": 0.1007, "grad_norm": 15.607954978942871, "learning_rate": 9.303030303030303e-06, "num_tokens": 433877.0, "completions/mean_length": 40.75, "completions/min_length": 35.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.75, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.9608279466629028, "rewards/meter/std": 0.04227001965045929, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.5974999666213989, "rewards/judge_quality/std": 0.35847893357276917, "rewards/repeat_penalty/mean": 0.9857639074325562, "rewards/repeat_penalty/std": 0.024509375914931297, "rewards/repeat_floor/mean": 0.9978646039962769, "rewards/repeat_floor/std": 0.0036764012183994055, "rewards/near_duplicate_penalty/mean": 0.9857639074325562, "rewards/near_duplicate_penalty/std": 0.024509375914931297, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5745943784713745, "rewards/total_composite/std": 0.34490159153938293, "reward": 0.5745943784713745, "reward_std": 0.34490156173706055, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18984870612621307, "sampling/sampling_logp_difference/max": 1.342778205871582, "sampling/importance_sampling_ratio/min": 0.26111921668052673, "sampling/importance_sampling_ratio/mean": 1.0135283470153809, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.680129811167717, "clip_ratio/low_mean": 0.05300451535731554, "clip_ratio/low_min": 0.05300451535731554, "clip_ratio/high_mean": 0.08902871422469616, "clip_ratio/high_max": 0.08902871422469616, "clip_ratio/region_mean": 0.1420332295820117, "reward_total_mean": 0.5745943784713745, "reward_meter_mean": 0.9608279466629028, "reward_meter_std": 0.04227001965045929, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9857639074325562, "reward_repeat_penalty_std": 0.024509375914931297, "reward_repeat_floor_mean": 0.9978646039962769, "reward_repeat_floor_std": 0.0036764012183994055, "reward_near_duplicate_penalty_mean": 0.9857639074325562, "reward_near_duplicate_penalty_std": 0.024509375914931297, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5974999666213989, "reward_judge_quality_std": 0.35847893357276917, "reward_total_composite_mean": 0.5745943784713745, "reward_total_composite_std": 0.34490159153938293} {"timestamp_utc": "2026-04-12T16:48:27Z", "mode": "train", "global_step": 232, "epoch": 0.012209883690332088, "loss": -0.0344, "grad_norm": 3.6098029613494873, "learning_rate": 9.3e-06, "num_tokens": 435583.0, "completions/mean_length": 159.25, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 41.66666793823242, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.4055835008621216, "rewards/meter/std": 0.39694225788116455, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.8637757301330566, "rewards/lexical_plausibility/std": 0.17642712593078613, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.24494898319244385, "rewards/repeat_penalty/mean": 0.9352866411209106, "rewards/repeat_penalty/std": 0.11439581960439682, "rewards/repeat_floor/mean": 0.9959179759025574, "rewards/repeat_floor/std": 0.006751851178705692, "rewards/near_duplicate_penalty/mean": 0.9977866411209106, "rewards/near_duplicate_penalty/std": 0.003120151814073324, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.17531438171863556, "rewards/total_composite/std": 0.2520464062690735, "reward": 0.17531438171863556, "reward_std": 0.2520463764667511, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22814057767391205, "sampling/sampling_logp_difference/max": 1.343282699584961, "sampling/importance_sampling_ratio/min": 0.2609875202178955, "sampling/importance_sampling_ratio/mean": 1.0814465284347534, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4205938577651978, "clip_ratio/low_mean": 0.060912005603313446, "clip_ratio/low_min": 0.060912005603313446, "clip_ratio/high_mean": 0.06919306237250566, "clip_ratio/high_max": 0.06919306237250566, "clip_ratio/region_mean": 0.1301050679758191, "reward_total_mean": 0.17531438171863556, "reward_meter_mean": 0.4055835008621216, "reward_meter_std": 0.39694225788116455, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.8637757301330566, "reward_lexical_plausibility_std": 0.17642712593078613, "reward_repeat_penalty_mean": 0.9352866411209106, "reward_repeat_penalty_std": 0.11439581960439682, "reward_repeat_floor_mean": 0.9959179759025574, "reward_repeat_floor_std": 0.006751851178705692, "reward_near_duplicate_penalty_mean": 0.9977866411209106, "reward_near_duplicate_penalty_std": 0.003120151814073324, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.24494898319244385, "reward_total_composite_mean": 0.17531438171863556, "reward_total_composite_std": 0.2520464062690735} {"timestamp_utc": "2026-04-12T16:48:35Z", "mode": "train", "global_step": 233, "epoch": 0.01226251249934214, "loss": 0.1102, "grad_norm": 16.913036346435547, "learning_rate": 9.296969696969698e-06, "num_tokens": 437102.0, "completions/mean_length": 40.875, "completions/min_length": 33.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.875, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.7456052899360657, "rewards/meter/std": 0.41660934686660767, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5887500047683716, "rewards/judge_quality/std": 0.2924496531486511, "rewards/repeat_penalty/mean": 0.9727711081504822, "rewards/repeat_penalty/std": 0.021970974281430244, "rewards/repeat_floor/mean": 0.9959156513214111, "rewards/repeat_floor/std": 0.003295645583420992, "rewards/near_duplicate_penalty/mean": 0.9727711081504822, "rewards/near_duplicate_penalty/std": 0.021970974281430244, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4961712062358856, "rewards/total_composite/std": 0.3597232401371002, "reward": 0.4961712062358856, "reward_std": 0.35972318053245544, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2133798450231552, "sampling/sampling_logp_difference/max": 1.676072120666504, "sampling/importance_sampling_ratio/min": 0.18710745871067047, "sampling/importance_sampling_ratio/mean": 1.0489169359207153, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1937512159347534, "clip_ratio/low_mean": 0.12542528845369816, "clip_ratio/low_min": 0.12542528845369816, "clip_ratio/high_mean": 0.07146460469812155, "clip_ratio/high_max": 0.07146460469812155, "clip_ratio/region_mean": 0.1968898931518197, "reward_total_mean": 0.4961712062358856, "reward_meter_mean": 0.7456052899360657, "reward_meter_std": 0.41660934686660767, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9727711081504822, "reward_repeat_penalty_std": 0.021970974281430244, "reward_repeat_floor_mean": 0.9959156513214111, "reward_repeat_floor_std": 0.003295645583420992, "reward_near_duplicate_penalty_mean": 0.9727711081504822, "reward_near_duplicate_penalty_std": 0.021970974281430244, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5887500047683716, "reward_judge_quality_std": 0.2924496531486511, "reward_total_composite_mean": 0.4961712062358856, "reward_total_composite_std": 0.3597232401371002} {"timestamp_utc": "2026-04-12T16:48:44Z", "mode": "train", "global_step": 234, "epoch": 0.012315141308352193, "loss": -0.0041, "grad_norm": 13.80274486541748, "learning_rate": 9.293939393939395e-06, "num_tokens": 438821.0, "completions/mean_length": 42.875, "completions/min_length": 39.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.875, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.973192036151886, "rewards/meter/std": 0.03658362105488777, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9765625, "rewards/lexical_plausibility/std": 0.04650149121880531, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390503644943237, "rewards/repeat_penalty/mean": 0.9922782182693481, "rewards/repeat_penalty/std": 0.018763329833745956, "rewards/repeat_floor/mean": 0.9988417625427246, "rewards/repeat_floor/std": 0.0028145047836005688, "rewards/near_duplicate_penalty/mean": 0.9922782182693481, "rewards/near_duplicate_penalty/std": 0.018763329833745956, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.44965702295303345, "rewards/total_composite/std": 0.21406090259552002, "reward": 0.44965702295303345, "reward_std": 0.21406088769435883, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21099594235420227, "sampling/sampling_logp_difference/max": 1.0102977752685547, "sampling/importance_sampling_ratio/min": 0.3641105592250824, "sampling/importance_sampling_ratio/mean": 1.071935772895813, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.9485606849193573, "clip_ratio/low_mean": 0.16430298518389463, "clip_ratio/low_min": 0.16430298518389463, "clip_ratio/high_mean": 0.02976190485060215, "clip_ratio/high_max": 0.02976190485060215, "clip_ratio/region_mean": 0.19406489003449678, "reward_total_mean": 0.44965702295303345, "reward_meter_mean": 0.973192036151886, "reward_meter_std": 0.03658362105488777, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9765625, "reward_lexical_plausibility_std": 0.04650149121880531, "reward_repeat_penalty_mean": 0.9922782182693481, "reward_repeat_penalty_std": 0.018763329833745956, "reward_repeat_floor_mean": 0.9988417625427246, "reward_repeat_floor_std": 0.0028145047836005688, "reward_near_duplicate_penalty_mean": 0.9922782182693481, "reward_near_duplicate_penalty_std": 0.018763329833745956, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390503644943237, "reward_total_composite_mean": 0.44965702295303345, "reward_total_composite_std": 0.21406090259552002} {"timestamp_utc": "2026-04-12T16:48:52Z", "mode": "train", "global_step": 235, "epoch": 0.012367770117362243, "loss": 0.0414, "grad_norm": 23.255542755126953, "learning_rate": 9.29090909090909e-06, "num_tokens": 440167.0, "completions/mean_length": 17.25, "completions/min_length": 13.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.25, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.3789360225200653, "rewards/meter/std": 0.45817628502845764, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9275209903717041, "rewards/lexical_plausibility/std": 0.20500154793262482, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.2881684899330139, "rewards/repeat_penalty/mean": 0.7433712482452393, "rewards/repeat_penalty/std": 0.018749047070741653, "rewards/repeat_floor/mean": 0.9836742877960205, "rewards/repeat_floor/std": 0.0037498052697628736, "rewards/near_duplicate_penalty/mean": 0.991161584854126, "rewards/near_duplicate_penalty/std": 0.024998728185892105, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11721844971179962, "rewards/total_composite/std": 0.1704958826303482, "reward": 0.11721844971179962, "reward_std": 0.1704958826303482, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.25322791934013367, "sampling/sampling_logp_difference/max": 1.1516380310058594, "sampling/importance_sampling_ratio/min": 0.3161185383796692, "sampling/importance_sampling_ratio/mean": 1.0224978923797607, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.6132565438747406, "clip_ratio/low_mean": 0.1485345559194684, "clip_ratio/low_min": 0.1485345559194684, "clip_ratio/high_mean": 0.1067708358168602, "clip_ratio/high_max": 0.1067708358168602, "clip_ratio/region_mean": 0.2553053917363286, "reward_total_mean": 0.11721844971179962, "reward_meter_mean": 0.3789360225200653, "reward_meter_std": 0.45817628502845764, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9275209903717041, "reward_lexical_plausibility_std": 0.20500154793262482, "reward_repeat_penalty_mean": 0.7433712482452393, "reward_repeat_penalty_std": 0.018749047070741653, "reward_repeat_floor_mean": 0.9836742877960205, "reward_repeat_floor_std": 0.0037498052697628736, "reward_near_duplicate_penalty_mean": 0.991161584854126, "reward_near_duplicate_penalty_std": 0.024998728185892105, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.2881684899330139, "reward_total_composite_mean": 0.11721844971179962, "reward_total_composite_std": 0.1704958826303482} {"timestamp_utc": "2026-04-12T16:49:01Z", "mode": "train", "global_step": 236, "epoch": 0.012420398926372296, "loss": 0.0216, "grad_norm": 19.179950714111328, "learning_rate": 9.28787878787879e-06, "num_tokens": 441812.0, "completions/mean_length": 33.625, "completions/min_length": 31.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.625, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.7460530996322632, "rewards/meter/std": 0.3232627511024475, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.97265625, "rewards/lexical_plausibility/std": 0.07733980566263199, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.2173829823732376, "rewards/repeat_penalty/mean": 0.9724409580230713, "rewards/repeat_penalty/std": 0.039793893694877625, "rewards/repeat_floor/mean": 0.9958661198616028, "rewards/repeat_floor/std": 0.005969088524580002, "rewards/near_duplicate_penalty/mean": 0.9724409580230713, "rewards/near_duplicate_penalty/std": 0.039793893694877625, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3454809784889221, "rewards/total_composite/std": 0.25839027762413025, "reward": 0.3454809784889221, "reward_std": 0.25839027762413025, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17248158156871796, "sampling/sampling_logp_difference/max": 1.304800033569336, "sampling/importance_sampling_ratio/min": 0.2778701186180115, "sampling/importance_sampling_ratio/mean": 1.0554769039154053, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5852476954460144, "clip_ratio/low_mean": 0.12302587367594242, "clip_ratio/low_min": 0.12302587367594242, "clip_ratio/high_mean": 0.041598313488066196, "clip_ratio/high_max": 0.041598313488066196, "clip_ratio/region_mean": 0.16462418716400862, "reward_total_mean": 0.3454809784889221, "reward_meter_mean": 0.7460530996322632, "reward_meter_std": 0.3232627511024475, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.97265625, "reward_lexical_plausibility_std": 0.07733980566263199, "reward_repeat_penalty_mean": 0.9724409580230713, "reward_repeat_penalty_std": 0.039793893694877625, "reward_repeat_floor_mean": 0.9958661198616028, "reward_repeat_floor_std": 0.005969088524580002, "reward_near_duplicate_penalty_mean": 0.9724409580230713, "reward_near_duplicate_penalty_std": 0.039793893694877625, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.2173829823732376, "reward_total_composite_mean": 0.3454809784889221, "reward_total_composite_std": 0.25839027762413025} {"timestamp_utc": "2026-04-12T16:49:10Z", "mode": "train", "global_step": 237, "epoch": 0.012473027735382348, "loss": -0.0162, "grad_norm": 11.643808364868164, "learning_rate": 9.284848484848485e-06, "num_tokens": 443893.0, "completions/mean_length": 65.125, "completions/min_length": 53.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.125, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.8283839225769043, "rewards/meter/std": 0.2995067834854126, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9709752798080444, "rewards/lexical_plausibility/std": 0.037827182561159134, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9944260120391846, "rewards/repeat_penalty/std": 0.007627261336892843, "rewards/repeat_floor/mean": 0.9991638660430908, "rewards/repeat_floor/std": 0.001144097768701613, "rewards/near_duplicate_penalty/mean": 0.9944260120391846, "rewards/near_duplicate_penalty/std": 0.007627261336892843, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27146846055984497, "rewards/total_composite/std": 0.14824147522449493, "reward": 0.27146846055984497, "reward_std": 0.14824147522449493, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21287813782691956, "sampling/sampling_logp_difference/max": 1.6447405815124512, "sampling/importance_sampling_ratio/min": 0.19306263327598572, "sampling/importance_sampling_ratio/mean": 1.0562447309494019, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.782700479030609, "clip_ratio/low_mean": 0.07221325859427452, "clip_ratio/low_min": 0.07221325859427452, "clip_ratio/high_mean": 0.11596426740288734, "clip_ratio/high_max": 0.11596426740288734, "clip_ratio/region_mean": 0.18817752599716187, "reward_total_mean": 0.27146846055984497, "reward_meter_mean": 0.8283839225769043, "reward_meter_std": 0.2995067834854126, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9709752798080444, "reward_lexical_plausibility_std": 0.037827182561159134, "reward_repeat_penalty_mean": 0.9944260120391846, "reward_repeat_penalty_std": 0.007627261336892843, "reward_repeat_floor_mean": 0.9991638660430908, "reward_repeat_floor_std": 0.001144097768701613, "reward_near_duplicate_penalty_mean": 0.9944260120391846, "reward_near_duplicate_penalty_std": 0.007627261336892843, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.27146846055984497, "reward_total_composite_std": 0.14824147522449493} {"timestamp_utc": "2026-04-12T16:49:25Z", "mode": "train", "global_step": 238, "epoch": 0.0125256565443924, "loss": -0.1321, "grad_norm": 5.200933933258057, "learning_rate": 9.281818181818183e-06, "num_tokens": 445691.0, "completions/mean_length": 107.75, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 50.000003814697266, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.9475964307785034, "rewards/meter/std": 0.07346004992723465, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.3053750991821289, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.09161254018545151, "rewards/lexical_plausibility/mean": 0.9088233709335327, "rewards/lexical_plausibility/std": 0.16669966280460358, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.7485313415527344, "rewards/repeat_penalty/std": 0.22189751267433167, "rewards/repeat_floor/mean": 0.974923849105835, "rewards/repeat_floor/std": 0.028835337609052658, "rewards/near_duplicate_penalty/mean": 0.9394485354423523, "rewards/near_duplicate_penalty/std": 0.09532373398542404, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8847955465316772, "rewards/distinct_2/std": 0.14293035864830017, "rewards/total_composite/mean": 0.22168511152267456, "rewards/total_composite/std": 0.13467872142791748, "reward": 0.22168511152267456, "reward_std": 0.13467872142791748, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19657887518405914, "sampling/sampling_logp_difference/max": 1.1651115417480469, "sampling/importance_sampling_ratio/min": 0.31188786029815674, "sampling/importance_sampling_ratio/mean": 1.0709632635116577, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1937649250030518, "clip_ratio/low_mean": 0.0767676793038845, "clip_ratio/low_min": 0.0767676793038845, "clip_ratio/high_mean": 0.08816965855658054, "clip_ratio/high_max": 0.08816965855658054, "clip_ratio/region_mean": 0.16493733786046505, "reward_total_mean": 0.22168511152267456, "reward_meter_mean": 0.9475964307785034, "reward_meter_std": 0.07346004992723465, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.3053750991821289, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.09161254018545151, "reward_lexical_plausibility_mean": 0.9088233709335327, "reward_lexical_plausibility_std": 0.16669966280460358, "reward_repeat_penalty_mean": 0.7485313415527344, "reward_repeat_penalty_std": 0.22189751267433167, "reward_repeat_floor_mean": 0.974923849105835, "reward_repeat_floor_std": 0.028835337609052658, "reward_near_duplicate_penalty_mean": 0.9394485354423523, "reward_near_duplicate_penalty_std": 0.09532373398542404, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8847955465316772, "reward_distinct_2_std": 0.14293035864830017, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.22168511152267456, "reward_total_composite_std": 0.13467872142791748} {"timestamp_utc": "2026-04-12T16:49:34Z", "mode": "train", "global_step": 239, "epoch": 0.012578285353402453, "loss": 0.0353, "grad_norm": 19.865358352661133, "learning_rate": 9.27878787878788e-06, "num_tokens": 447175.0, "completions/mean_length": 21.5, "completions/min_length": 14.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.5, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.7912949919700623, "rewards/meter/std": 0.3438830077648163, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.7437499761581421, "rewards/judge_quality/std": 0.2432481348514557, "rewards/repeat_penalty/mean": 0.7480332255363464, "rewards/repeat_penalty/std": 0.005562899634242058, "rewards/repeat_floor/mean": 0.9846066236495972, "rewards/repeat_floor/std": 0.0011125925229862332, "rewards/near_duplicate_penalty/mean": 0.9973776340484619, "rewards/near_duplicate_penalty/std": 0.007417213171720505, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5536940097808838, "rewards/total_composite/std": 0.31100213527679443, "reward": 0.5536940097808838, "reward_std": 0.31100213527679443, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19315433502197266, "sampling/sampling_logp_difference/max": 1.5123519897460938, "sampling/importance_sampling_ratio/min": 0.22039102017879486, "sampling/importance_sampling_ratio/mean": 1.0412137508392334, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7123451083898544, "clip_ratio/low_mean": 0.10180191276594996, "clip_ratio/low_min": 0.10180191276594996, "clip_ratio/high_mean": 0.0555108361877501, "clip_ratio/high_max": 0.0555108361877501, "clip_ratio/region_mean": 0.15731274895370007, "reward_total_mean": 0.5536940097808838, "reward_meter_mean": 0.7912949919700623, "reward_meter_std": 0.3438830077648163, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7480332255363464, "reward_repeat_penalty_std": 0.005562899634242058, "reward_repeat_floor_mean": 0.9846066236495972, "reward_repeat_floor_std": 0.0011125925229862332, "reward_near_duplicate_penalty_mean": 0.9973776340484619, "reward_near_duplicate_penalty_std": 0.007417213171720505, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7437499761581421, "reward_judge_quality_std": 0.2432481348514557, "reward_total_composite_mean": 0.5536940097808838, "reward_total_composite_std": 0.31100213527679443} {"timestamp_utc": "2026-04-12T16:49:48Z", "mode": "train", "global_step": 240, "epoch": 0.012630914162412505, "loss": -0.1714, "grad_norm": 2.913806200027466, "learning_rate": 9.275757575757577e-06, "num_tokens": 449294.0, "completions/mean_length": 376.875, "completions/min_length": 143.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 151.6666717529297, "completions/min_terminated_length": 143.0, "completions/max_terminated_length": 161.0, "rewards/meter/mean": 0.6958625912666321, "rewards/meter/std": 0.4179382920265198, "rewards/count_adherence/mean": 0.6607142686843872, "rewards/count_adherence/std": 0.3234066069126129, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8982142806053162, "rewards/count_floor/std": 0.09702198207378387, "rewards/lexical_plausibility/mean": 0.8450936675071716, "rewards/lexical_plausibility/std": 0.13930977880954742, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.9677689075469971, "rewards/repeat_penalty/std": 0.055305365473032, "rewards/repeat_floor/mean": 0.9966572523117065, "rewards/repeat_floor/std": 0.005531198810786009, "rewards/near_duplicate_penalty/mean": 0.993362307548523, "rewards/near_duplicate_penalty/std": 0.008659596554934978, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.973921000957489, "rewards/distinct_2/std": 0.04876678064465523, "rewards/total_composite/mean": 0.11358870565891266, "rewards/total_composite/std": 0.13763585686683655, "reward": 0.11358870565891266, "reward_std": 0.13763584196567535, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23199371993541718, "sampling/sampling_logp_difference/max": 1.8094148635864258, "sampling/importance_sampling_ratio/min": 0.16374991834163666, "sampling/importance_sampling_ratio/mean": 1.075723648071289, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1606292128562927, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.07492086850106716, "clip_ratio/high_max": 0.07492086850106716, "clip_ratio/region_mean": 0.07492086850106716, "reward_total_mean": 0.11358870565891266, "reward_meter_mean": 0.6958625912666321, "reward_meter_std": 0.4179382920265198, "reward_count_adherence_mean": 0.6607142686843872, "reward_count_adherence_std": 0.3234066069126129, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8982142806053162, "reward_count_floor_std": 0.09702198207378387, "reward_lexical_plausibility_mean": 0.8450936675071716, "reward_lexical_plausibility_std": 0.13930977880954742, "reward_repeat_penalty_mean": 0.9677689075469971, "reward_repeat_penalty_std": 0.055305365473032, "reward_repeat_floor_mean": 0.9966572523117065, "reward_repeat_floor_std": 0.005531198810786009, "reward_near_duplicate_penalty_mean": 0.993362307548523, "reward_near_duplicate_penalty_std": 0.008659596554934978, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.973921000957489, "reward_distinct_2_std": 0.04876678064465523, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.11358870565891266, "reward_total_composite_std": 0.13763585686683655} {"timestamp_utc": "2026-04-12T16:50:01Z", "mode": "train", "global_step": 241, "epoch": 0.012683542971422556, "loss": -0.0291, "grad_norm": 6.813591480255127, "learning_rate": 9.272727272727273e-06, "num_tokens": 451161.0, "completions/mean_length": 122.375, "completions/min_length": 52.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 66.71428680419922, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.3726944029331207, "rewards/meter/std": 0.37314772605895996, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9808240532875061, "rewards/lexical_plausibility/std": 0.03568333387374878, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9513874053955078, "rewards/repeat_penalty/std": 0.053269632160663605, "rewards/repeat_floor/mean": 0.9943923950195312, "rewards/repeat_floor/std": 0.005572207272052765, "rewards/near_duplicate_penalty/mean": 0.9808699488639832, "rewards/near_duplicate_penalty/std": 0.012911330908536911, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9695764183998108, "rewards/distinct_2/std": 0.04475013539195061, "rewards/total_composite/mean": 0.1334598958492279, "rewards/total_composite/std": 0.14915242791175842, "reward": 0.1334598958492279, "reward_std": 0.14915242791175842, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21868832409381866, "sampling/sampling_logp_difference/max": 1.4155559539794922, "sampling/importance_sampling_ratio/min": 0.2427905946969986, "sampling/importance_sampling_ratio/mean": 1.0160592794418335, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7901955991983414, "clip_ratio/low_mean": 0.11398501694202423, "clip_ratio/low_min": 0.11398501694202423, "clip_ratio/high_mean": 0.05323639698326588, "clip_ratio/high_max": 0.05323639698326588, "clip_ratio/region_mean": 0.1672214139252901, "reward_total_mean": 0.1334598958492279, "reward_meter_mean": 0.3726944029331207, "reward_meter_std": 0.37314772605895996, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9808240532875061, "reward_lexical_plausibility_std": 0.03568333387374878, "reward_repeat_penalty_mean": 0.9513874053955078, "reward_repeat_penalty_std": 0.053269632160663605, "reward_repeat_floor_mean": 0.9943923950195312, "reward_repeat_floor_std": 0.005572207272052765, "reward_near_duplicate_penalty_mean": 0.9808699488639832, "reward_near_duplicate_penalty_std": 0.012911330908536911, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9695764183998108, "reward_distinct_2_std": 0.04475013539195061, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.1334598958492279, "reward_total_composite_std": 0.14915242791175842} {"timestamp_utc": "2026-04-12T16:50:09Z", "mode": "train", "global_step": 242, "epoch": 0.012736171780432608, "loss": 0.0805, "grad_norm": 31.87870979309082, "learning_rate": 9.26969696969697e-06, "num_tokens": 452529.0, "completions/mean_length": 16.0, "completions/min_length": 15.0, "completions/max_length": 17.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.0, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 17.0, "rewards/meter/mean": 0.9850348234176636, "rewards/meter/std": 0.013144196011126041, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8137500286102295, "rewards/judge_quality/std": 0.2249404639005661, "rewards/repeat_penalty/mean": 0.7432166337966919, "rewards/repeat_penalty/std": 0.019186342135071754, "rewards/repeat_floor/mean": 0.9836432933807373, "rewards/repeat_floor/std": 0.0038372809067368507, "rewards/near_duplicate_penalty/mean": 0.9909554719924927, "rewards/near_duplicate_penalty/std": 0.025581790134310722, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7880934476852417, "rewards/total_composite/std": 0.21708205342292786, "reward": 0.7880934476852417, "reward_std": 0.21708205342292786, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18875885009765625, "sampling/sampling_logp_difference/max": 1.651460886001587, "sampling/importance_sampling_ratio/min": 0.191769540309906, "sampling/importance_sampling_ratio/mean": 1.0643130540847778, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4098713919520378, "clip_ratio/low_mean": 0.05147058889269829, "clip_ratio/low_min": 0.05147058889269829, "clip_ratio/high_mean": 0.09445465821772814, "clip_ratio/high_max": 0.09445465821772814, "clip_ratio/region_mean": 0.14592524711042643, "reward_total_mean": 0.7880934476852417, "reward_meter_mean": 0.9850348234176636, "reward_meter_std": 0.013144196011126041, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7432166337966919, "reward_repeat_penalty_std": 0.019186342135071754, "reward_repeat_floor_mean": 0.9836432933807373, "reward_repeat_floor_std": 0.0038372809067368507, "reward_near_duplicate_penalty_mean": 0.9909554719924927, "reward_near_duplicate_penalty_std": 0.025581790134310722, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8137500286102295, "reward_judge_quality_std": 0.2249404639005661, "reward_total_composite_mean": 0.7880934476852417, "reward_total_composite_std": 0.21708205342292786} {"timestamp_utc": "2026-04-12T16:50:23Z", "mode": "train", "global_step": 243, "epoch": 0.01278880058944266, "loss": -0.1724, "grad_norm": 2.7820847034454346, "learning_rate": 9.266666666666667e-06, "num_tokens": 454720.0, "completions/mean_length": 331.875, "completions/min_length": 140.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 151.75, "completions/min_terminated_length": 140.0, "completions/max_terminated_length": 163.0, "rewards/meter/mean": 0.7052256464958191, "rewards/meter/std": 0.3101499378681183, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.3061862289905548, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.09185586124658585, "rewards/lexical_plausibility/mean": 0.8455607295036316, "rewards/lexical_plausibility/std": 0.14618223905563354, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.08864052593708038, "rewards/repeat_penalty/mean": 0.9469081163406372, "rewards/repeat_penalty/std": 0.07134432345628738, "rewards/repeat_floor/mean": 0.9948353171348572, "rewards/repeat_floor/std": 0.006482340395450592, "rewards/near_duplicate_penalty/mean": 0.9870542287826538, "rewards/near_duplicate_penalty/std": 0.01594948209822178, "rewards/opening_diversity/mean": 0.9821428656578064, "rewards/opening_diversity/std": 0.05050762742757797, "rewards/distinct_2/mean": 0.9760956764221191, "rewards/distinct_2/std": 0.03492533788084984, "rewards/total_composite/mean": 0.09603214263916016, "rewards/total_composite/std": 0.09496942162513733, "reward": 0.09603214263916016, "reward_std": 0.09496942162513733, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24829797446727753, "sampling/sampling_logp_difference/max": 1.7428979873657227, "sampling/importance_sampling_ratio/min": 0.1750124841928482, "sampling/importance_sampling_ratio/mean": 1.0601587295532227, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9971315264701843, "clip_ratio/low_mean": 0.02083333395421505, "clip_ratio/low_min": 0.02083333395421505, "clip_ratio/high_mean": 0.06954973749816418, "clip_ratio/high_max": 0.06954973749816418, "clip_ratio/region_mean": 0.09038307145237923, "reward_total_mean": 0.09603214263916016, "reward_meter_mean": 0.7052256464958191, "reward_meter_std": 0.3101499378681183, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.3061862289905548, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.09185586124658585, "reward_lexical_plausibility_mean": 0.8455607295036316, "reward_lexical_plausibility_std": 0.14618223905563354, "reward_repeat_penalty_mean": 0.9469081163406372, "reward_repeat_penalty_std": 0.07134432345628738, "reward_repeat_floor_mean": 0.9948353171348572, "reward_repeat_floor_std": 0.006482340395450592, "reward_near_duplicate_penalty_mean": 0.9870542287826538, "reward_near_duplicate_penalty_std": 0.01594948209822178, "reward_opening_diversity_mean": 0.9821428656578064, "reward_opening_diversity_std": 0.05050762742757797, "reward_distinct_2_mean": 0.9760956764221191, "reward_distinct_2_std": 0.03492533788084984, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.08864052593708038, "reward_total_composite_mean": 0.09603214263916016, "reward_total_composite_std": 0.09496942162513733} {"timestamp_utc": "2026-04-12T16:50:31Z", "mode": "train", "global_step": 244, "epoch": 0.012841429398452713, "loss": -0.0167, "grad_norm": 15.387537002563477, "learning_rate": 9.263636363636364e-06, "num_tokens": 456417.0, "completions/mean_length": 42.125, "completions/min_length": 35.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.125, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.9270445704460144, "rewards/meter/std": 0.09438148140907288, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9555628299713135, "rewards/lexical_plausibility/std": 0.0722915381193161, "rewards/judge_quality/mean": 0.4300000071525574, "rewards/judge_quality/std": 0.32262319326400757, "rewards/repeat_penalty/mean": 0.992059588432312, "rewards/repeat_penalty/std": 0.010410577058792114, "rewards/repeat_floor/mean": 0.9988089203834534, "rewards/repeat_floor/std": 0.0015615939628332853, "rewards/near_duplicate_penalty/mean": 0.992059588432312, "rewards/near_duplicate_penalty/std": 0.010410577058792114, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.39052316546440125, "rewards/total_composite/std": 0.2810784578323364, "reward": 0.39052316546440125, "reward_std": 0.2810784578323364, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22290082275867462, "sampling/sampling_logp_difference/max": 1.8054604530334473, "sampling/importance_sampling_ratio/min": 0.16439872980117798, "sampling/importance_sampling_ratio/mean": 1.0307132005691528, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.390533074736595, "clip_ratio/low_mean": 0.09051434975117445, "clip_ratio/low_min": 0.09051434975117445, "clip_ratio/high_mean": 0.055435288697481155, "clip_ratio/high_max": 0.055435288697481155, "clip_ratio/region_mean": 0.1459496384486556, "reward_total_mean": 0.39052316546440125, "reward_meter_mean": 0.9270445704460144, "reward_meter_std": 0.09438148140907288, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9555628299713135, "reward_lexical_plausibility_std": 0.0722915381193161, "reward_repeat_penalty_mean": 0.992059588432312, "reward_repeat_penalty_std": 0.010410577058792114, "reward_repeat_floor_mean": 0.9988089203834534, "reward_repeat_floor_std": 0.0015615939628332853, "reward_near_duplicate_penalty_mean": 0.992059588432312, "reward_near_duplicate_penalty_std": 0.010410577058792114, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4300000071525574, "reward_judge_quality_std": 0.32262319326400757, "reward_total_composite_mean": 0.39052316546440125, "reward_total_composite_std": 0.2810784578323364} {"timestamp_utc": "2026-04-12T16:50:40Z", "mode": "train", "global_step": 245, "epoch": 0.012894058207462766, "loss": 0.0098, "grad_norm": 20.19318199157715, "learning_rate": 9.260606060606062e-06, "num_tokens": 457877.0, "completions/mean_length": 32.5, "completions/min_length": 28.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.5, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.48916447162628174, "rewards/meter/std": 0.3811974823474884, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4337500035762787, "rewards/judge_quality/std": 0.23868316411972046, "rewards/repeat_penalty/mean": 0.8754228353500366, "rewards/repeat_penalty/std": 0.26593077182769775, "rewards/repeat_floor/mean": 0.9854813814163208, "rewards/repeat_floor/std": 0.029772454872727394, "rewards/near_duplicate_penalty/mean": 0.9524838924407959, "rewards/near_duplicate_penalty/std": 0.07924303412437439, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9387089014053345, "rewards/distinct_2/std": 0.14200736582279205, "rewards/total_composite/mean": 0.18750335276126862, "rewards/total_composite/std": 0.1550569087266922, "reward": 0.18750335276126862, "reward_std": 0.1550569236278534, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1468329280614853, "sampling/sampling_logp_difference/max": 1.510289192199707, "sampling/importance_sampling_ratio/min": 0.22084610164165497, "sampling/importance_sampling_ratio/mean": 1.0243041515350342, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.174165040254593, "clip_ratio/low_mean": 0.09172544442117214, "clip_ratio/low_min": 0.09172544442117214, "clip_ratio/high_mean": 0.059171365574002266, "clip_ratio/high_max": 0.059171365574002266, "clip_ratio/region_mean": 0.1508968099951744, "reward_total_mean": 0.18750335276126862, "reward_meter_mean": 0.48916447162628174, "reward_meter_std": 0.3811974823474884, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8754228353500366, "reward_repeat_penalty_std": 0.26593077182769775, "reward_repeat_floor_mean": 0.9854813814163208, "reward_repeat_floor_std": 0.029772454872727394, "reward_near_duplicate_penalty_mean": 0.9524838924407959, "reward_near_duplicate_penalty_std": 0.07924303412437439, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9387089014053345, "reward_distinct_2_std": 0.14200736582279205, "reward_judge_quality_mean": 0.4337500035762787, "reward_judge_quality_std": 0.23868316411972046, "reward_total_composite_mean": 0.18750335276126862, "reward_total_composite_std": 0.1550569087266922} {"timestamp_utc": "2026-04-12T16:50:55Z", "mode": "train", "global_step": 246, "epoch": 0.012946687016472818, "loss": -0.1008, "grad_norm": 6.182137489318848, "learning_rate": 9.257575757575759e-06, "num_tokens": 459822.0, "completions/mean_length": 130.125, "completions/min_length": 65.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 75.5714340209961, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 89.0, "rewards/meter/mean": 0.6792052984237671, "rewards/meter/std": 0.428801566362381, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9701545834541321, "rewards/lexical_plausibility/std": 0.07745271176099777, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.7933319807052612, "rewards/repeat_penalty/std": 0.2632565200328827, "rewards/repeat_floor/mean": 0.9757997989654541, "rewards/repeat_floor/std": 0.036176349967718124, "rewards/near_duplicate_penalty/mean": 0.9379631876945496, "rewards/near_duplicate_penalty/std": 0.09891653060913086, "rewards/opening_diversity/mean": 0.9609375, "rewards/opening_diversity/std": 0.08799287676811218, "rewards/distinct_2/mean": 0.86054527759552, "rewards/distinct_2/std": 0.1846321076154709, "rewards/total_composite/mean": 0.2275792360305786, "rewards/total_composite/std": 0.14797452092170715, "reward": 0.2275792360305786, "reward_std": 0.14797452092170715, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21234148740768433, "sampling/sampling_logp_difference/max": 1.5397872924804688, "sampling/importance_sampling_ratio/min": 0.21442671120166779, "sampling/importance_sampling_ratio/mean": 1.0555132627487183, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1686637550592422, "clip_ratio/low_mean": 0.050833333283662796, "clip_ratio/low_min": 0.050833333283662796, "clip_ratio/high_mean": 0.09622169937938452, "clip_ratio/high_max": 0.09622169937938452, "clip_ratio/region_mean": 0.1470550326630473, "reward_total_mean": 0.2275792360305786, "reward_meter_mean": 0.6792052984237671, "reward_meter_std": 0.428801566362381, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9701545834541321, "reward_lexical_plausibility_std": 0.07745271176099777, "reward_repeat_penalty_mean": 0.7933319807052612, "reward_repeat_penalty_std": 0.2632565200328827, "reward_repeat_floor_mean": 0.9757997989654541, "reward_repeat_floor_std": 0.036176349967718124, "reward_near_duplicate_penalty_mean": 0.9379631876945496, "reward_near_duplicate_penalty_std": 0.09891653060913086, "reward_opening_diversity_mean": 0.9609375, "reward_opening_diversity_std": 0.08799287676811218, "reward_distinct_2_mean": 0.86054527759552, "reward_distinct_2_std": 0.1846321076154709, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.2275792360305786, "reward_total_composite_std": 0.14797452092170715} {"timestamp_utc": "2026-04-12T16:51:03Z", "mode": "train", "global_step": 247, "epoch": 0.012999315825482869, "loss": 0.0586, "grad_norm": 18.777450561523438, "learning_rate": 9.254545454545454e-06, "num_tokens": 461181.0, "completions/mean_length": 30.875, "completions/min_length": 27.0, "completions/max_length": 34.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.875, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 34.0, "rewards/meter/mean": 0.2120095193386078, "rewards/meter/std": 0.13663122057914734, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5387499928474426, "rewards/judge_quality/std": 0.3358757197856903, "rewards/repeat_penalty/mean": 0.9969503879547119, "rewards/repeat_penalty/std": 0.00634540943428874, "rewards/repeat_floor/mean": 0.9995425343513489, "rewards/repeat_floor/std": 0.000951816386077553, "rewards/near_duplicate_penalty/mean": 0.9969503879547119, "rewards/near_duplicate_penalty/std": 0.00634540943428874, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12416981160640717, "rewards/total_composite/std": 0.09541624039411545, "reward": 0.12416981160640717, "reward_std": 0.09541624039411545, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1698114573955536, "sampling/sampling_logp_difference/max": 1.595409870147705, "sampling/importance_sampling_ratio/min": 0.2028253823518753, "sampling/importance_sampling_ratio/mean": 1.03268301486969, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.291483037173748, "clip_ratio/low_mean": 0.037844214122742414, "clip_ratio/low_min": 0.037844214122742414, "clip_ratio/high_mean": 0.0858754962682724, "clip_ratio/high_max": 0.0858754962682724, "clip_ratio/region_mean": 0.12371971039101481, "reward_total_mean": 0.12416981160640717, "reward_meter_mean": 0.2120095193386078, "reward_meter_std": 0.13663122057914734, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9969503879547119, "reward_repeat_penalty_std": 0.00634540943428874, "reward_repeat_floor_mean": 0.9995425343513489, "reward_repeat_floor_std": 0.000951816386077553, "reward_near_duplicate_penalty_mean": 0.9969503879547119, "reward_near_duplicate_penalty_std": 0.00634540943428874, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5387499928474426, "reward_judge_quality_std": 0.3358757197856903, "reward_total_composite_mean": 0.12416981160640717, "reward_total_composite_std": 0.09541624039411545} {"timestamp_utc": "2026-04-12T16:51:17Z", "mode": "train", "global_step": 248, "epoch": 0.013051944634492921, "loss": -0.061, "grad_norm": 2.320683479309082, "learning_rate": 9.251515151515152e-06, "num_tokens": 462772.0, "completions/mean_length": 212.875, "completions/min_length": 25.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 33.400001525878906, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.5926539897918701, "rewards/meter/std": 0.4195498526096344, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9128397703170776, "rewards/lexical_plausibility/std": 0.12853839993476868, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.25495097041130066, "rewards/repeat_penalty/mean": 0.8760510683059692, "rewards/repeat_penalty/std": 0.17846953868865967, "rewards/repeat_floor/mean": 0.989148736000061, "rewards/repeat_floor/std": 0.01759549416601658, "rewards/near_duplicate_penalty/mean": 0.9766964912414551, "rewards/near_duplicate_penalty/std": 0.047928716987371445, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.24713833630084991, "rewards/total_composite/std": 0.25866013765335083, "reward": 0.24713833630084991, "reward_std": 0.25866013765335083, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22261904180049896, "sampling/sampling_logp_difference/max": 1.378725528717041, "sampling/importance_sampling_ratio/min": 0.251899391412735, "sampling/importance_sampling_ratio/mean": 1.0522751808166504, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2500000447034836, "clip_ratio/low_mean": 0.0173611119389534, "clip_ratio/low_min": 0.0173611119389534, "clip_ratio/high_mean": 0.1114067193120718, "clip_ratio/high_max": 0.1114067193120718, "clip_ratio/region_mean": 0.1287678312510252, "reward_total_mean": 0.24713833630084991, "reward_meter_mean": 0.5926539897918701, "reward_meter_std": 0.4195498526096344, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9128397703170776, "reward_lexical_plausibility_std": 0.12853839993476868, "reward_repeat_penalty_mean": 0.8760510683059692, "reward_repeat_penalty_std": 0.17846953868865967, "reward_repeat_floor_mean": 0.989148736000061, "reward_repeat_floor_std": 0.01759549416601658, "reward_near_duplicate_penalty_mean": 0.9766964912414551, "reward_near_duplicate_penalty_std": 0.047928716987371445, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.25495097041130066, "reward_total_composite_mean": 0.24713833630084991, "reward_total_composite_std": 0.25866013765335083} {"timestamp_utc": "2026-04-12T16:51:27Z", "mode": "train", "global_step": 249, "epoch": 0.013104573443502973, "loss": 0.1052, "grad_norm": 7.700905799865723, "learning_rate": 9.248484848484849e-06, "num_tokens": 465589.0, "completions/mean_length": 164.125, "completions/min_length": 122.0, "completions/max_length": 207.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 164.125, "completions/min_terminated_length": 122.0, "completions/max_terminated_length": 207.0, "rewards/meter/mean": 0.8245628476142883, "rewards/meter/std": 0.19125983119010925, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.1079898476600647, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9571428298950195, "rewards/count_floor/std": 0.03239695355296135, "rewards/lexical_plausibility/mean": 0.9769822359085083, "rewards/lexical_plausibility/std": 0.043875548988580704, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.5602109432220459, "rewards/repeat_penalty/std": 0.4092436730861664, "rewards/repeat_floor/mean": 0.949129045009613, "rewards/repeat_floor/std": 0.04875320568680763, "rewards/near_duplicate_penalty/mean": 0.8983430862426758, "rewards/near_duplicate_penalty/std": 0.10049480199813843, "rewards/opening_diversity/mean": 0.9609375, "rewards/opening_diversity/std": 0.08799287676811218, "rewards/distinct_2/mean": 0.6302369832992554, "rewards/distinct_2/std": 0.3503389358520508, "rewards/total_composite/mean": 0.18337294459342957, "rewards/total_composite/std": 0.09522434324026108, "reward": 0.18337294459342957, "reward_std": 0.09522434324026108, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18656452000141144, "sampling/sampling_logp_difference/max": 1.7262134552001953, "sampling/importance_sampling_ratio/min": 0.1779569834470749, "sampling/importance_sampling_ratio/mean": 1.05612313747406, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.4170335233211517, "clip_ratio/low_mean": 0.07984719797968864, "clip_ratio/low_min": 0.07984719797968864, "clip_ratio/high_mean": 0.08934582304209471, "clip_ratio/high_max": 0.08934582304209471, "clip_ratio/region_mean": 0.16919302102178335, "reward_total_mean": 0.18337294459342957, "reward_meter_mean": 0.8245628476142883, "reward_meter_std": 0.19125983119010925, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.1079898476600647, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9571428298950195, "reward_count_floor_std": 0.03239695355296135, "reward_lexical_plausibility_mean": 0.9769822359085083, "reward_lexical_plausibility_std": 0.043875548988580704, "reward_repeat_penalty_mean": 0.5602109432220459, "reward_repeat_penalty_std": 0.4092436730861664, "reward_repeat_floor_mean": 0.949129045009613, "reward_repeat_floor_std": 0.04875320568680763, "reward_near_duplicate_penalty_mean": 0.8983430862426758, "reward_near_duplicate_penalty_std": 0.10049480199813843, "reward_opening_diversity_mean": 0.9609375, "reward_opening_diversity_std": 0.08799287676811218, "reward_distinct_2_mean": 0.6302369832992554, "reward_distinct_2_std": 0.3503389358520508, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.18337294459342957, "reward_total_composite_std": 0.09522434324026108} {"timestamp_utc": "2026-04-12T16:51:36Z", "mode": "train", "global_step": 250, "epoch": 0.013157202252513026, "loss": 0.0255, "grad_norm": 14.192955017089844, "learning_rate": 9.245454545454546e-06, "num_tokens": 467371.0, "completions/mean_length": 58.75, "completions/min_length": 50.0, "completions/max_length": 67.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.75, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.383329838514328, "rewards/meter/std": 0.3598807454109192, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.10350983589887619, "rewards/repeat_penalty/mean": 0.9382904171943665, "rewards/repeat_penalty/std": 0.1468064785003662, "rewards/repeat_floor/mean": 0.9946203231811523, "rewards/repeat_floor/std": 0.011121366173028946, "rewards/near_duplicate_penalty/mean": 0.9795204401016235, "rewards/near_duplicate_penalty/std": 0.03185485675930977, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9743589758872986, "rewards/distinct_2/std": 0.07252377271652222, "rewards/total_composite/mean": 0.12034064531326294, "rewards/total_composite/std": 0.09669128805398941, "reward": 0.12034064531326294, "reward_std": 0.09669128805398941, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22268080711364746, "sampling/sampling_logp_difference/max": 1.697484016418457, "sampling/importance_sampling_ratio/min": 0.26028621196746826, "sampling/importance_sampling_ratio/mean": 1.0251330137252808, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.087587743997574, "clip_ratio/low_mean": 0.0946830315515399, "clip_ratio/low_min": 0.0946830315515399, "clip_ratio/high_mean": 0.11120689660310745, "clip_ratio/high_max": 0.11120689660310745, "clip_ratio/region_mean": 0.20588992815464735, "reward_total_mean": 0.12034064531326294, "reward_meter_mean": 0.383329838514328, "reward_meter_std": 0.3598807454109192, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9382904171943665, "reward_repeat_penalty_std": 0.1468064785003662, "reward_repeat_floor_mean": 0.9946203231811523, "reward_repeat_floor_std": 0.011121366173028946, "reward_near_duplicate_penalty_mean": 0.9795204401016235, "reward_near_duplicate_penalty_std": 0.03185485675930977, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9743589758872986, "reward_distinct_2_std": 0.07252377271652222, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.10350983589887619, "reward_total_composite_mean": 0.12034064531326294, "reward_total_composite_std": 0.09669128805398941} {"timestamp_utc": "2026-04-12T16:53:49Z", "mode": "eval", "global_step": 250, "epoch": 0.013157202252513026, "eval_loss": NaN, "eval_runtime": 133.4458, "eval_samples_per_second": 0.779, "eval_steps_per_second": 0.097, "eval_num_tokens": 467371.0, "eval_completions/mean_length": 171.3846153846154, "eval_completions/min_length": 36.30769230769231, "eval_completions/max_length": 413.0, "eval_completions/clipped_ratio": 0.10576923076923077, "eval_completions/mean_terminated_length": 130.67994689941406, "eval_completions/min_terminated_length": 36.30769230769231, "eval_completions/max_terminated_length": 267.46153846153845, "eval_rewards/meter/mean": 0.4022582242122063, "eval_rewards/meter/std": 0.32037050334306866, "eval_rewards/count_adherence/mean": 0.8858297421382024, "eval_rewards/count_adherence/std": 0.15729298671850792, "eval_rewards/arabic_clean/mean": 0.7884615384615384, "eval_rewards/arabic_clean/std": 0.3460688109581287, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9956730741720933, "eval_rewards/arabic_floor/std": 0.012238385012516608, "eval_rewards/count_floor/mean": 0.9657489107205317, "eval_rewards/count_floor/std": 0.04718789687523475, "eval_rewards/lexical_plausibility/mean": 0.9579436320524949, "eval_rewards/lexical_plausibility/std": 0.07819282206205222, "eval_rewards/judge_quality/mean": 0.3529807673050807, "eval_rewards/judge_quality/std": 0.19971058173821524, "eval_rewards/repeat_penalty/mean": 0.8649896199886615, "eval_rewards/repeat_penalty/std": 0.1934896529867099, "eval_rewards/repeat_floor/mean": 0.9865787029266357, "eval_rewards/repeat_floor/std": 0.019076756524065368, "eval_rewards/near_duplicate_penalty/mean": 0.972652270243718, "eval_rewards/near_duplicate_penalty/std": 0.0355529493580644, "eval_rewards/opening_diversity/mean": 0.9830288474376385, "eval_rewards/opening_diversity/std": 0.03266540993578159, "eval_rewards/distinct_2/mean": 0.9077681211324838, "eval_rewards/distinct_2/std": 0.156504979213843, "eval_rewards/total_composite/mean": 0.14088497224908608, "eval_rewards/total_composite/std": 0.14079813802471527, "eval_reward": 0.14088497224908608, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.1258189225426087, "eval_sampling/sampling_logp_difference/max": 1.347562496478741, "eval_sampling/importance_sampling_ratio/min": 0.26669255242897916, "eval_sampling/importance_sampling_ratio/mean": 1.039134511580834, "eval_sampling/importance_sampling_ratio/max": 1.661945865704463, "eval_entropy": 1.8623096667803252, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.14088497224908608, "eval_reward_meter_mean": 0.4022582242122063, "eval_reward_meter_std": 0.32037050334306866, "eval_reward_count_adherence_mean": 0.8858297421382024, "eval_reward_count_adherence_std": 0.15729298671850792, "eval_reward_arabic_clean_mean": 0.7884615384615384, "eval_reward_arabic_clean_std": 0.3460688109581287, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9956730741720933, "eval_reward_arabic_floor_std": 0.012238385012516608, "eval_reward_count_floor_mean": 0.9657489107205317, "eval_reward_count_floor_std": 0.04718789687523475, "eval_reward_lexical_plausibility_mean": 0.9579436320524949, "eval_reward_lexical_plausibility_std": 0.07819282206205222, "eval_reward_repeat_penalty_mean": 0.8649896199886615, "eval_reward_repeat_penalty_std": 0.1934896529867099, "eval_reward_repeat_floor_mean": 0.9865787029266357, "eval_reward_repeat_floor_std": 0.019076756524065368, "eval_reward_near_duplicate_penalty_mean": 0.972652270243718, "eval_reward_near_duplicate_penalty_std": 0.0355529493580644, "eval_reward_opening_diversity_mean": 0.9830288474376385, "eval_reward_opening_diversity_std": 0.03266540993578159, "eval_reward_distinct_2_mean": 0.9077681211324838, "eval_reward_distinct_2_std": 0.156504979213843, "eval_reward_judge_quality_mean": 0.3529807673050807, "eval_reward_judge_quality_std": 0.19971058173821524, "eval_reward_total_composite_mean": 0.14088497224908608, "eval_reward_total_composite_std": 0.14079813802471527} {"timestamp_utc": "2026-04-12T16:54:02Z", "mode": "train", "global_step": 251, "epoch": 0.013209831061523078, "loss": 0.0141, "grad_norm": 10.03214168548584, "learning_rate": 9.242424242424244e-06, "num_tokens": 469796.0, "completions/mean_length": 99.125, "completions/min_length": 75.0, "completions/max_length": 131.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 99.125, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 131.0, "rewards/meter/mean": 0.781234860420227, "rewards/meter/std": 0.3135354518890381, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.7317330241203308, "rewards/repeat_penalty/std": 0.3799841105937958, "rewards/repeat_floor/mean": 0.9612491130828857, "rewards/repeat_floor/std": 0.06683868169784546, "rewards/near_duplicate_penalty/mean": 0.9002248048782349, "rewards/near_duplicate_penalty/std": 0.1821615844964981, "rewards/opening_diversity/mean": 0.9453125, "rewards/opening_diversity/std": 0.15467961132526398, "rewards/distinct_2/mean": 0.7721851468086243, "rewards/distinct_2/std": 0.3513650596141815, "rewards/total_composite/mean": 0.24391454458236694, "rewards/total_composite/std": 0.1486084908246994, "reward": 0.24391454458236694, "reward_std": 0.1486085057258606, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18580110371112823, "sampling/sampling_logp_difference/max": 2.362151622772217, "sampling/importance_sampling_ratio/min": 0.09421728551387787, "sampling/importance_sampling_ratio/mean": 1.0311291217803955, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4244952648878098, "clip_ratio/low_mean": 0.08838836941868067, "clip_ratio/low_min": 0.08838836941868067, "clip_ratio/high_mean": 0.08680574130266905, "clip_ratio/high_max": 0.08680574130266905, "clip_ratio/region_mean": 0.17519411072134972, "reward_total_mean": 0.24391454458236694, "reward_meter_mean": 0.781234860420227, "reward_meter_std": 0.3135354518890381, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7317330241203308, "reward_repeat_penalty_std": 0.3799841105937958, "reward_repeat_floor_mean": 0.9612491130828857, "reward_repeat_floor_std": 0.06683868169784546, "reward_near_duplicate_penalty_mean": 0.9002248048782349, "reward_near_duplicate_penalty_std": 0.1821615844964981, "reward_opening_diversity_mean": 0.9453125, "reward_opening_diversity_std": 0.15467961132526398, "reward_distinct_2_mean": 0.7721851468086243, "reward_distinct_2_std": 0.3513650596141815, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.24391454458236694, "reward_total_composite_std": 0.1486084908246994} {"timestamp_utc": "2026-04-12T16:54:12Z", "mode": "train", "global_step": 252, "epoch": 0.013262459870533129, "loss": -0.014, "grad_norm": 22.089492797851562, "learning_rate": 9.23939393939394e-06, "num_tokens": 471283.0, "completions/mean_length": 29.875, "completions/min_length": 25.0, "completions/max_length": 35.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.875, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.8945860862731934, "rewards/meter/std": 0.20781312882900238, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8712499737739563, "rewards/judge_quality/std": 0.21087828278541565, "rewards/repeat_penalty/mean": 0.982690155506134, "rewards/repeat_penalty/std": 0.013326878659427166, "rewards/repeat_floor/mean": 0.9974035024642944, "rewards/repeat_floor/std": 0.0019990308210253716, "rewards/near_duplicate_penalty/mean": 0.982690155506134, "rewards/near_duplicate_penalty/std": 0.013326878659427166, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7784930467605591, "rewards/total_composite/std": 0.27445438504219055, "reward": 0.7784930467605591, "reward_std": 0.27445438504219055, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12639819085597992, "sampling/sampling_logp_difference/max": 2.0030102729797363, "sampling/importance_sampling_ratio/min": 0.13492849469184875, "sampling/importance_sampling_ratio/mean": 1.0100497007369995, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.45426201447844505, "clip_ratio/low_mean": 0.05419354699552059, "clip_ratio/low_min": 0.05419354699552059, "clip_ratio/high_mean": 0.03564588166773319, "clip_ratio/high_max": 0.03564588166773319, "clip_ratio/region_mean": 0.08983942866325378, "reward_total_mean": 0.7784930467605591, "reward_meter_mean": 0.8945860862731934, "reward_meter_std": 0.20781312882900238, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.982690155506134, "reward_repeat_penalty_std": 0.013326878659427166, "reward_repeat_floor_mean": 0.9974035024642944, "reward_repeat_floor_std": 0.0019990308210253716, "reward_near_duplicate_penalty_mean": 0.982690155506134, "reward_near_duplicate_penalty_std": 0.013326878659427166, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8712499737739563, "reward_judge_quality_std": 0.21087828278541565, "reward_total_composite_mean": 0.7784930467605591, "reward_total_composite_std": 0.27445438504219055} {"timestamp_utc": "2026-04-12T16:54:25Z", "mode": "train", "global_step": 253, "epoch": 0.013315088679543181, "loss": -0.0213, "grad_norm": 6.694579124450684, "learning_rate": 9.236363636363636e-06, "num_tokens": 472702.0, "completions/mean_length": 96.375, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.40104883909225464, "rewards/meter/std": 0.4383257031440735, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9689521193504333, "rewards/lexical_plausibility/std": 0.08781670778989792, "rewards/judge_quality/mean": 0.5387500524520874, "rewards/judge_quality/std": 0.3484019637107849, "rewards/repeat_penalty/mean": 0.9807029962539673, "rewards/repeat_penalty/std": 0.024172764271497726, "rewards/repeat_floor/mean": 0.9971054196357727, "rewards/repeat_floor/std": 0.0036259046755731106, "rewards/near_duplicate_penalty/mean": 0.9807029962539673, "rewards/near_duplicate_penalty/std": 0.024172764271497726, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2465665340423584, "rewards/total_composite/std": 0.2989174425601959, "reward": 0.2465665340423584, "reward_std": 0.2989174425601959, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20465432107448578, "sampling/sampling_logp_difference/max": 1.364037036895752, "sampling/importance_sampling_ratio/min": 0.25562670826911926, "sampling/importance_sampling_ratio/mean": 1.0323041677474976, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.524191364645958, "clip_ratio/low_mean": 0.045112782157957554, "clip_ratio/low_min": 0.045112782157957554, "clip_ratio/high_mean": 0.10233794245868921, "clip_ratio/high_max": 0.10233794245868921, "clip_ratio/region_mean": 0.14745072461664677, "reward_total_mean": 0.2465665340423584, "reward_meter_mean": 0.40104883909225464, "reward_meter_std": 0.4383257031440735, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9689521193504333, "reward_lexical_plausibility_std": 0.08781670778989792, "reward_repeat_penalty_mean": 0.9807029962539673, "reward_repeat_penalty_std": 0.024172764271497726, "reward_repeat_floor_mean": 0.9971054196357727, "reward_repeat_floor_std": 0.0036259046755731106, "reward_near_duplicate_penalty_mean": 0.9807029962539673, "reward_near_duplicate_penalty_std": 0.024172764271497726, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5387500524520874, "reward_judge_quality_std": 0.3484019637107849, "reward_total_composite_mean": 0.2465665340423584, "reward_total_composite_std": 0.2989174425601959} {"timestamp_utc": "2026-04-12T16:54:33Z", "mode": "train", "global_step": 254, "epoch": 0.013367717488553234, "loss": 0.1065, "grad_norm": 26.027971267700195, "learning_rate": 9.233333333333334e-06, "num_tokens": 474076.0, "completions/mean_length": 17.75, "completions/min_length": 15.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.75, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.86481773853302, "rewards/meter/std": 0.3432632088661194, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6974999904632568, "rewards/judge_quality/std": 0.3259163200855255, "rewards/repeat_penalty/mean": 0.7214862108230591, "rewards/repeat_penalty/std": 0.05688679963350296, "rewards/repeat_floor/mean": 0.9792972803115845, "rewards/repeat_floor/std": 0.011377356946468353, "rewards/near_duplicate_penalty/mean": 0.9619816541671753, "rewards/near_duplicate_penalty/std": 0.07584905624389648, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6339339017868042, "rewards/total_composite/std": 0.38137876987457275, "reward": 0.6339339017868042, "reward_std": 0.38137876987457275, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17500117421150208, "sampling/sampling_logp_difference/max": 1.4457502365112305, "sampling/importance_sampling_ratio/min": 0.2355692833662033, "sampling/importance_sampling_ratio/mean": 0.9843676686286926, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1645722165703773, "clip_ratio/low_mean": 0.05166666768491268, "clip_ratio/low_min": 0.05166666768491268, "clip_ratio/high_mean": 0.09493517922237515, "clip_ratio/high_max": 0.09493517922237515, "clip_ratio/region_mean": 0.14660184690728784, "reward_total_mean": 0.6339339017868042, "reward_meter_mean": 0.86481773853302, "reward_meter_std": 0.3432632088661194, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7214862108230591, "reward_repeat_penalty_std": 0.05688679963350296, "reward_repeat_floor_mean": 0.9792972803115845, "reward_repeat_floor_std": 0.011377356946468353, "reward_near_duplicate_penalty_mean": 0.9619816541671753, "reward_near_duplicate_penalty_std": 0.07584905624389648, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6974999904632568, "reward_judge_quality_std": 0.3259163200855255, "reward_total_composite_mean": 0.6339339017868042, "reward_total_composite_std": 0.38137876987457275} {"timestamp_utc": "2026-04-12T16:54:41Z", "mode": "train", "global_step": 255, "epoch": 0.013420346297563286, "loss": 0.1081, "grad_norm": 22.420490264892578, "learning_rate": 9.23030303030303e-06, "num_tokens": 475483.0, "completions/mean_length": 19.875, "completions/min_length": 16.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.875, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.5202906131744385, "rewards/meter/std": 0.3947794735431671, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.7799999713897705, "rewards/judge_quality/std": 0.3071993589401245, "rewards/repeat_penalty/mean": 0.7077559232711792, "rewards/repeat_penalty/std": 0.062000926584005356, "rewards/repeat_floor/mean": 0.9765511751174927, "rewards/repeat_floor/std": 0.012400192208588123, "rewards/near_duplicate_penalty/mean": 0.9436745643615723, "rewards/near_duplicate_penalty/std": 0.08266790211200714, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3250795900821686, "rewards/total_composite/std": 0.2747003734111786, "reward": 0.3250795900821686, "reward_std": 0.2747003734111786, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14918068051338196, "sampling/sampling_logp_difference/max": 1.1693806648254395, "sampling/importance_sampling_ratio/min": 0.3105592131614685, "sampling/importance_sampling_ratio/mean": 1.032403826713562, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9908276125788689, "clip_ratio/low_mean": 0.09877840150147676, "clip_ratio/low_min": 0.09877840150147676, "clip_ratio/high_mean": 0.02878289483487606, "clip_ratio/high_max": 0.02878289483487606, "clip_ratio/region_mean": 0.12756129633635283, "reward_total_mean": 0.3250795900821686, "reward_meter_mean": 0.5202906131744385, "reward_meter_std": 0.3947794735431671, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7077559232711792, "reward_repeat_penalty_std": 0.062000926584005356, "reward_repeat_floor_mean": 0.9765511751174927, "reward_repeat_floor_std": 0.012400192208588123, "reward_near_duplicate_penalty_mean": 0.9436745643615723, "reward_near_duplicate_penalty_std": 0.08266790211200714, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7799999713897705, "reward_judge_quality_std": 0.3071993589401245, "reward_total_composite_mean": 0.3250795900821686, "reward_total_composite_std": 0.2747003734111786} {"timestamp_utc": "2026-04-12T16:54:54Z", "mode": "train", "global_step": 256, "epoch": 0.013472975106573339, "loss": -0.144, "grad_norm": 3.8688511848449707, "learning_rate": 9.227272727272728e-06, "num_tokens": 477640.0, "completions/mean_length": 223.625, "completions/min_length": 71.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 127.5, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 187.0, "rewards/meter/mean": 0.9472206234931946, "rewards/meter/std": 0.07846547663211823, "rewards/count_adherence/mean": 0.7708333134651184, "rewards/count_adherence/std": 0.19795581698417664, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9312499761581421, "rewards/count_floor/std": 0.05938674136996269, "rewards/lexical_plausibility/mean": 0.9372028112411499, "rewards/lexical_plausibility/std": 0.1017853245139122, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.6489769816398621, "rewards/repeat_penalty/std": 0.40324708819389343, "rewards/repeat_floor/mean": 0.958721399307251, "rewards/repeat_floor/std": 0.05086202174425125, "rewards/near_duplicate_penalty/mean": 0.9152227640151978, "rewards/near_duplicate_penalty/std": 0.11003494262695312, "rewards/opening_diversity/mean": 0.9642857313156128, "rewards/opening_diversity/std": 0.0874817818403244, "rewards/distinct_2/mean": 0.7064533233642578, "rewards/distinct_2/std": 0.34807756543159485, "rewards/total_composite/mean": 0.16540731489658356, "rewards/total_composite/std": 0.13221320509910583, "reward": 0.16540731489658356, "reward_std": 0.13221320509910583, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16439630091190338, "sampling/sampling_logp_difference/max": 1.6514892578125, "sampling/importance_sampling_ratio/min": 0.19176411628723145, "sampling/importance_sampling_ratio/mean": 1.0185129642486572, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.504008173942566, "clip_ratio/low_mean": 0.07231230568140745, "clip_ratio/low_min": 0.07231230568140745, "clip_ratio/high_mean": 0.04384084418416023, "clip_ratio/high_max": 0.04384084418416023, "clip_ratio/region_mean": 0.11615314986556768, "reward_total_mean": 0.16540731489658356, "reward_meter_mean": 0.9472206234931946, "reward_meter_std": 0.07846547663211823, "reward_count_adherence_mean": 0.7708333134651184, "reward_count_adherence_std": 0.19795581698417664, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9312499761581421, "reward_count_floor_std": 0.05938674136996269, "reward_lexical_plausibility_mean": 0.9372028112411499, "reward_lexical_plausibility_std": 0.1017853245139122, "reward_repeat_penalty_mean": 0.6489769816398621, "reward_repeat_penalty_std": 0.40324708819389343, "reward_repeat_floor_mean": 0.958721399307251, "reward_repeat_floor_std": 0.05086202174425125, "reward_near_duplicate_penalty_mean": 0.9152227640151978, "reward_near_duplicate_penalty_std": 0.11003494262695312, "reward_opening_diversity_mean": 0.9642857313156128, "reward_opening_diversity_std": 0.0874817818403244, "reward_distinct_2_mean": 0.7064533233642578, "reward_distinct_2_std": 0.34807756543159485, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.16540731489658356, "reward_total_composite_std": 0.13221320509910583} {"timestamp_utc": "2026-04-12T16:55:02Z", "mode": "train", "global_step": 257, "epoch": 0.013525603915583391, "loss": -0.0232, "grad_norm": 18.625070571899414, "learning_rate": 9.224242424242424e-06, "num_tokens": 479142.0, "completions/mean_length": 33.75, "completions/min_length": 27.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.75, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.7656682133674622, "rewards/meter/std": 0.3254414200782776, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.2666056752204895, "rewards/repeat_penalty/mean": 0.9828088283538818, "rewards/repeat_penalty/std": 0.03942342847585678, "rewards/repeat_floor/mean": 0.9974213242530823, "rewards/repeat_floor/std": 0.0059135062620043755, "rewards/near_duplicate_penalty/mean": 0.9828088283538818, "rewards/near_duplicate_penalty/std": 0.03942342847585678, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4802744388580322, "rewards/total_composite/std": 0.27702468633651733, "reward": 0.4802744388580322, "reward_std": 0.27702465653419495, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21323837339878082, "sampling/sampling_logp_difference/max": 1.6583452224731445, "sampling/importance_sampling_ratio/min": 0.1904538869857788, "sampling/importance_sampling_ratio/mean": 1.0013370513916016, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4175041690468788, "clip_ratio/low_mean": 0.11052919365465641, "clip_ratio/low_min": 0.11052919365465641, "clip_ratio/high_mean": 0.04904306307435036, "clip_ratio/high_max": 0.04904306307435036, "clip_ratio/region_mean": 0.15957225672900677, "reward_total_mean": 0.4802744388580322, "reward_meter_mean": 0.7656682133674622, "reward_meter_std": 0.3254414200782776, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9828088283538818, "reward_repeat_penalty_std": 0.03942342847585678, "reward_repeat_floor_mean": 0.9974213242530823, "reward_repeat_floor_std": 0.0059135062620043755, "reward_near_duplicate_penalty_mean": 0.9828088283538818, "reward_near_duplicate_penalty_std": 0.03942342847585678, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.2666056752204895, "reward_total_composite_mean": 0.4802744388580322, "reward_total_composite_std": 0.27702468633651733} {"timestamp_utc": "2026-04-12T16:55:11Z", "mode": "train", "global_step": 258, "epoch": 0.013578232724593442, "loss": 0.0868, "grad_norm": 18.444421768188477, "learning_rate": 9.221212121212123e-06, "num_tokens": 481072.0, "completions/mean_length": 74.25, "completions/min_length": 61.0, "completions/max_length": 89.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 74.25, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 89.0, "rewards/meter/mean": 0.6494839787483215, "rewards/meter/std": 0.32895997166633606, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5249999761581421, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.9731181859970093, "rewards/repeat_penalty/std": 0.038941849023103714, "rewards/repeat_floor/mean": 0.9965662360191345, "rewards/repeat_floor/std": 0.004189968574792147, "rewards/near_duplicate_penalty/mean": 0.9837016463279724, "rewards/near_duplicate_penalty/std": 0.01104305312037468, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9890109896659851, "rewards/distinct_2/std": 0.031081615015864372, "rewards/total_composite/mean": 0.3533145785331726, "rewards/total_composite/std": 0.2352585643529892, "reward": 0.3533145785331726, "reward_std": 0.235258549451828, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21634989976882935, "sampling/sampling_logp_difference/max": 3.4774093627929688, "sampling/importance_sampling_ratio/min": 0.03088732436299324, "sampling/importance_sampling_ratio/mean": 0.9958537817001343, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4792455434799194, "clip_ratio/low_mean": 0.08586963266134262, "clip_ratio/low_min": 0.08586963266134262, "clip_ratio/high_mean": 0.09246682561933994, "clip_ratio/high_max": 0.09246682561933994, "clip_ratio/region_mean": 0.17833645828068256, "reward_total_mean": 0.3533145785331726, "reward_meter_mean": 0.6494839787483215, "reward_meter_std": 0.32895997166633606, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9731181859970093, "reward_repeat_penalty_std": 0.038941849023103714, "reward_repeat_floor_mean": 0.9965662360191345, "reward_repeat_floor_std": 0.004189968574792147, "reward_near_duplicate_penalty_mean": 0.9837016463279724, "reward_near_duplicate_penalty_std": 0.01104305312037468, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9890109896659851, "reward_distinct_2_std": 0.031081615015864372, "reward_judge_quality_mean": 0.5249999761581421, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.3533145785331726, "reward_total_composite_std": 0.2352585643529892} {"timestamp_utc": "2026-04-12T16:55:20Z", "mode": "train", "global_step": 259, "epoch": 0.013630861533603494, "loss": 0.0318, "grad_norm": 13.94146728515625, "learning_rate": 9.21818181818182e-06, "num_tokens": 482844.0, "completions/mean_length": 46.5, "completions/min_length": 37.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.5, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.7833342552185059, "rewards/meter/std": 0.3319782018661499, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.3142678737640381, "rewards/repeat_penalty/mean": 0.9918050169944763, "rewards/repeat_penalty/std": 0.014694659039378166, "rewards/repeat_floor/mean": 0.9987707138061523, "rewards/repeat_floor/std": 0.002204208169132471, "rewards/near_duplicate_penalty/mean": 0.9918050169944763, "rewards/near_duplicate_penalty/std": 0.014694659039378166, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4246077835559845, "rewards/total_composite/std": 0.32079240679740906, "reward": 0.4246077835559845, "reward_std": 0.32079240679740906, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18138344585895538, "sampling/sampling_logp_difference/max": 2.3204782009124756, "sampling/importance_sampling_ratio/min": 0.09822659939527512, "sampling/importance_sampling_ratio/mean": 1.020614504814148, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3293571323156357, "clip_ratio/low_mean": 0.11445644684135914, "clip_ratio/low_min": 0.11445644684135914, "clip_ratio/high_mean": 0.08980211615562439, "clip_ratio/high_max": 0.08980211615562439, "clip_ratio/region_mean": 0.20425856299698353, "reward_total_mean": 0.4246077835559845, "reward_meter_mean": 0.7833342552185059, "reward_meter_std": 0.3319782018661499, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9918050169944763, "reward_repeat_penalty_std": 0.014694659039378166, "reward_repeat_floor_mean": 0.9987707138061523, "reward_repeat_floor_std": 0.002204208169132471, "reward_near_duplicate_penalty_mean": 0.9918050169944763, "reward_near_duplicate_penalty_std": 0.014694659039378166, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.3142678737640381, "reward_total_composite_mean": 0.4246077835559845, "reward_total_composite_std": 0.32079240679740906} {"timestamp_utc": "2026-04-12T16:55:28Z", "mode": "train", "global_step": 260, "epoch": 0.013683490342613546, "loss": 0.1219, "grad_norm": 21.54400634765625, "learning_rate": 9.215151515151515e-06, "num_tokens": 484488.0, "completions/mean_length": 38.5, "completions/min_length": 30.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.5, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.35186442732810974, "rewards/meter/std": 0.2855783700942993, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.5249999761581421, "rewards/judge_quality/std": 0.13887302577495575, "rewards/repeat_penalty/mean": 0.963065505027771, "rewards/repeat_penalty/std": 0.04576059803366661, "rewards/repeat_floor/mean": 0.9949644804000854, "rewards/repeat_floor/std": 0.005850640591233969, "rewards/near_duplicate_penalty/mean": 0.9721989631652832, "rewards/near_duplicate_penalty/std": 0.030996691435575485, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.15843889117240906, "rewards/total_composite/std": 0.11046849191188812, "reward": 0.15843889117240906, "reward_std": 0.11046849191188812, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18502263724803925, "sampling/sampling_logp_difference/max": 1.6262269020080566, "sampling/importance_sampling_ratio/min": 0.19667023420333862, "sampling/importance_sampling_ratio/mean": 1.03053879737854, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3729137480258942, "clip_ratio/low_mean": 0.0936553031206131, "clip_ratio/low_min": 0.0936553031206131, "clip_ratio/high_mean": 0.0783494608476758, "clip_ratio/high_max": 0.0783494608476758, "clip_ratio/region_mean": 0.1720047639682889, "reward_total_mean": 0.15843889117240906, "reward_meter_mean": 0.35186442732810974, "reward_meter_std": 0.2855783700942993, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.963065505027771, "reward_repeat_penalty_std": 0.04576059803366661, "reward_repeat_floor_mean": 0.9949644804000854, "reward_repeat_floor_std": 0.005850640591233969, "reward_near_duplicate_penalty_mean": 0.9721989631652832, "reward_near_duplicate_penalty_std": 0.030996691435575485, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.5249999761581421, "reward_judge_quality_std": 0.13887302577495575, "reward_total_composite_mean": 0.15843889117240906, "reward_total_composite_std": 0.11046849191188812} {"timestamp_utc": "2026-04-12T16:55:36Z", "mode": "train", "global_step": 261, "epoch": 0.013736119151623599, "loss": 0.0201, "grad_norm": 25.051698684692383, "learning_rate": 9.212121212121213e-06, "num_tokens": 485824.0, "completions/mean_length": 17.0, "completions/min_length": 14.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.0, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.826312780380249, "rewards/meter/std": 0.24248762428760529, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.793749988079071, "rewards/judge_quality/std": 0.2447119504213333, "rewards/repeat_penalty/mean": 0.7389006614685059, "rewards/repeat_penalty/std": 0.024166369810700417, "rewards/repeat_floor/mean": 0.9827800989151001, "rewards/repeat_floor/std": 0.004833268467336893, "rewards/near_duplicate_penalty/mean": 0.9852008819580078, "rewards/near_duplicate_penalty/std": 0.03222181275486946, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6345161199569702, "rewards/total_composite/std": 0.27586397528648376, "reward": 0.6345161199569702, "reward_std": 0.27586397528648376, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19997957348823547, "sampling/sampling_logp_difference/max": 1.5830087661743164, "sampling/importance_sampling_ratio/min": 0.20535629987716675, "sampling/importance_sampling_ratio/mean": 1.0394620895385742, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.051232859492302, "clip_ratio/low_mean": 0.1126575656235218, "clip_ratio/low_min": 0.1126575656235218, "clip_ratio/high_mean": 0.09171235375106335, "clip_ratio/high_max": 0.09171235375106335, "clip_ratio/region_mean": 0.20436991937458515, "reward_total_mean": 0.6345161199569702, "reward_meter_mean": 0.826312780380249, "reward_meter_std": 0.24248762428760529, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7389006614685059, "reward_repeat_penalty_std": 0.024166369810700417, "reward_repeat_floor_mean": 0.9827800989151001, "reward_repeat_floor_std": 0.004833268467336893, "reward_near_duplicate_penalty_mean": 0.9852008819580078, "reward_near_duplicate_penalty_std": 0.03222181275486946, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.793749988079071, "reward_judge_quality_std": 0.2447119504213333, "reward_total_composite_mean": 0.6345161199569702, "reward_total_composite_std": 0.27586397528648376} {"timestamp_utc": "2026-04-12T16:55:46Z", "mode": "train", "global_step": 262, "epoch": 0.013788747960633651, "loss": 0.1006, "grad_norm": 8.600594520568848, "learning_rate": 9.20909090909091e-06, "num_tokens": 488790.0, "completions/mean_length": 160.75, "completions/min_length": 135.0, "completions/max_length": 200.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 160.75, "completions/min_terminated_length": 135.0, "completions/max_terminated_length": 200.0, "rewards/meter/mean": 0.6169558167457581, "rewards/meter/std": 0.329196959733963, "rewards/count_adherence/mean": 0.9027777910232544, "rewards/count_adherence/std": 0.07120776921510696, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9708333611488342, "rewards/count_floor/std": 0.021362334489822388, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.7664869427680969, "rewards/repeat_penalty/std": 0.30370059609413147, "rewards/repeat_floor/mean": 0.9746162295341492, "rewards/repeat_floor/std": 0.03300850838422775, "rewards/near_duplicate_penalty/mean": 0.9478528499603271, "rewards/near_duplicate_penalty/std": 0.05683739483356476, "rewards/opening_diversity/mean": 0.996874988079071, "rewards/opening_diversity/std": 0.008838826790452003, "rewards/distinct_2/mean": 0.8069530129432678, "rewards/distinct_2/std": 0.2731459438800812, "rewards/total_composite/mean": 0.2254660427570343, "rewards/total_composite/std": 0.13885778188705444, "reward": 0.2254660427570343, "reward_std": 0.13885776698589325, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1995864361524582, "sampling/sampling_logp_difference/max": 2.6709909439086914, "sampling/importance_sampling_ratio/min": 0.06918363273143768, "sampling/importance_sampling_ratio/mean": 1.0171693563461304, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5021056979894638, "clip_ratio/low_mean": 0.07800502516329288, "clip_ratio/low_min": 0.07800502516329288, "clip_ratio/high_mean": 0.11030659079551697, "clip_ratio/high_max": 0.11030659079551697, "clip_ratio/region_mean": 0.18831161595880985, "reward_total_mean": 0.2254660427570343, "reward_meter_mean": 0.6169558167457581, "reward_meter_std": 0.329196959733963, "reward_count_adherence_mean": 0.9027777910232544, "reward_count_adherence_std": 0.07120776921510696, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9708333611488342, "reward_count_floor_std": 0.021362334489822388, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7664869427680969, "reward_repeat_penalty_std": 0.30370059609413147, "reward_repeat_floor_mean": 0.9746162295341492, "reward_repeat_floor_std": 0.03300850838422775, "reward_near_duplicate_penalty_mean": 0.9478528499603271, "reward_near_duplicate_penalty_std": 0.05683739483356476, "reward_opening_diversity_mean": 0.996874988079071, "reward_opening_diversity_std": 0.008838826790452003, "reward_distinct_2_mean": 0.8069530129432678, "reward_distinct_2_std": 0.2731459438800812, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.2254660427570343, "reward_total_composite_std": 0.13885778188705444} {"timestamp_utc": "2026-04-12T16:55:54Z", "mode": "train", "global_step": 263, "epoch": 0.013841376769643704, "loss": -0.0171, "grad_norm": 16.67426300048828, "learning_rate": 9.206060606060607e-06, "num_tokens": 490132.0, "completions/mean_length": 16.75, "completions/min_length": 15.0, "completions/max_length": 19.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.75, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 19.0, "rewards/meter/mean": 0.3862903118133545, "rewards/meter/std": 0.5008962154388428, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9975490570068359, "rewards/lexical_plausibility/std": 0.006932419259101152, "rewards/judge_quality/mean": 0.5387499928474426, "rewards/judge_quality/std": 0.3358757197856903, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.09208157658576965, "rewards/total_composite/std": 0.11924655735492706, "reward": 0.09208157658576965, "reward_std": 0.11924654990434647, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15335243940353394, "sampling/sampling_logp_difference/max": 1.4169368743896484, "sampling/importance_sampling_ratio/min": 0.24245555698871613, "sampling/importance_sampling_ratio/mean": 1.0290390253067017, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0767432823777199, "clip_ratio/low_mean": 0.08767361240461469, "clip_ratio/low_min": 0.08767361240461469, "clip_ratio/high_mean": 0.08931028470396996, "clip_ratio/high_max": 0.08931028470396996, "clip_ratio/region_mean": 0.17698389710858464, "reward_total_mean": 0.09208157658576965, "reward_meter_mean": 0.3862903118133545, "reward_meter_std": 0.5008962154388428, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9975490570068359, "reward_lexical_plausibility_std": 0.006932419259101152, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5387499928474426, "reward_judge_quality_std": 0.3358757197856903, "reward_total_composite_mean": 0.09208157658576965, "reward_total_composite_std": 0.11924655735492706} {"timestamp_utc": "2026-04-12T16:56:04Z", "mode": "train", "global_step": 264, "epoch": 0.013894005578653754, "loss": 0.0375, "grad_norm": 18.884525299072266, "learning_rate": 9.203030303030304e-06, "num_tokens": 491856.0, "completions/mean_length": 49.5, "completions/min_length": 26.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.5, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.7616921663284302, "rewards/meter/std": 0.3500820994377136, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9848946332931519, "rewards/repeat_penalty/std": 0.03017011098563671, "rewards/repeat_floor/mean": 0.9980955123901367, "rewards/repeat_floor/std": 0.003537016222253442, "rewards/near_duplicate_penalty/mean": 0.991282045841217, "rewards/near_duplicate_penalty/std": 0.013199453242123127, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9933686852455139, "rewards/distinct_2/std": 0.01875614933669567, "rewards/total_composite/mean": 0.3263661861419678, "rewards/total_composite/std": 0.17969068884849548, "reward": 0.3263661861419678, "reward_std": 0.17969068884849548, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16969145834445953, "sampling/sampling_logp_difference/max": 1.3060121536254883, "sampling/importance_sampling_ratio/min": 0.2708982229232788, "sampling/importance_sampling_ratio/mean": 1.0045783519744873, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.137873463332653, "clip_ratio/low_mean": 0.06228146981447935, "clip_ratio/low_min": 0.06228146981447935, "clip_ratio/high_mean": 0.08988671563565731, "clip_ratio/high_max": 0.08988671563565731, "clip_ratio/region_mean": 0.15216818545013666, "reward_total_mean": 0.3263661861419678, "reward_meter_mean": 0.7616921663284302, "reward_meter_std": 0.3500820994377136, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9848946332931519, "reward_repeat_penalty_std": 0.03017011098563671, "reward_repeat_floor_mean": 0.9980955123901367, "reward_repeat_floor_std": 0.003537016222253442, "reward_near_duplicate_penalty_mean": 0.991282045841217, "reward_near_duplicate_penalty_std": 0.013199453242123127, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9933686852455139, "reward_distinct_2_std": 0.01875614933669567, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.3263661861419678, "reward_total_composite_std": 0.17969068884849548} {"timestamp_utc": "2026-04-12T16:56:17Z", "mode": "train", "global_step": 265, "epoch": 0.013946634387663807, "loss": -0.0388, "grad_norm": 6.325990200042725, "learning_rate": 9.200000000000002e-06, "num_tokens": 493720.0, "completions/mean_length": 119.0, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 62.857147216796875, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 85.0, "rewards/meter/mean": 0.6770095825195312, "rewards/meter/std": 0.42658403515815735, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.0707106739282608, "rewards/lexical_plausibility/mean": 0.976481556892395, "rewards/lexical_plausibility/std": 0.06652020663022995, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.1642080545425415, "rewards/repeat_penalty/mean": 0.8401646614074707, "rewards/repeat_penalty/std": 0.3135274052619934, "rewards/repeat_floor/mean": 0.9777703881263733, "rewards/repeat_floor/std": 0.049781881272792816, "rewards/near_duplicate_penalty/mean": 0.9321873188018799, "rewards/near_duplicate_penalty/std": 0.14401811361312866, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9076923131942749, "rewards/distinct_2/std": 0.261085569858551, "rewards/total_composite/mean": 0.2789556682109833, "rewards/total_composite/std": 0.2078925371170044, "reward": 0.2789556682109833, "reward_std": 0.2078925222158432, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1912977397441864, "sampling/sampling_logp_difference/max": 1.1942138671875, "sampling/importance_sampling_ratio/min": 0.3029420077800751, "sampling/importance_sampling_ratio/mean": 1.061216950416565, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5955148190259933, "clip_ratio/low_mean": 0.03898264188319445, "clip_ratio/low_min": 0.03898264188319445, "clip_ratio/high_mean": 0.11994142830371857, "clip_ratio/high_max": 0.11994142830371857, "clip_ratio/region_mean": 0.158924070186913, "reward_total_mean": 0.2789556682109833, "reward_meter_mean": 0.6770095825195312, "reward_meter_std": 0.42658403515815735, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.0707106739282608, "reward_lexical_plausibility_mean": 0.976481556892395, "reward_lexical_plausibility_std": 0.06652020663022995, "reward_repeat_penalty_mean": 0.8401646614074707, "reward_repeat_penalty_std": 0.3135274052619934, "reward_repeat_floor_mean": 0.9777703881263733, "reward_repeat_floor_std": 0.049781881272792816, "reward_near_duplicate_penalty_mean": 0.9321873188018799, "reward_near_duplicate_penalty_std": 0.14401811361312866, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9076923131942749, "reward_distinct_2_std": 0.261085569858551, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.1642080545425415, "reward_total_composite_mean": 0.2789556682109833, "reward_total_composite_std": 0.2078925371170044} {"timestamp_utc": "2026-04-12T16:56:30Z", "mode": "train", "global_step": 266, "epoch": 0.013999263196673859, "loss": -0.0126, "grad_norm": 4.99873161315918, "learning_rate": 9.196969696969697e-06, "num_tokens": 495166.0, "completions/mean_length": 81.75, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.285715103149414, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.5839483737945557, "rewards/meter/std": 0.45508986711502075, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9637843370437622, "rewards/lexical_plausibility/std": 0.08021838963031769, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.32762131094932556, "rewards/repeat_penalty/mean": 0.7245987057685852, "rewards/repeat_penalty/std": 0.14216618239879608, "rewards/repeat_floor/mean": 0.9759916067123413, "rewards/repeat_floor/std": 0.01924424059689045, "rewards/near_duplicate_penalty/mean": 0.9379336833953857, "rewards/near_duplicate_penalty/std": 0.09077394753694534, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.3220638632774353, "rewards/total_composite/std": 0.37391313910484314, "reward": 0.3220638632774353, "reward_std": 0.37391313910484314, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22514304518699646, "sampling/sampling_logp_difference/max": 1.2849922180175781, "sampling/importance_sampling_ratio/min": 0.2766527533531189, "sampling/importance_sampling_ratio/mean": 1.002685785293579, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8283866345882416, "clip_ratio/low_mean": 0.10828283056616783, "clip_ratio/low_min": 0.10828283056616783, "clip_ratio/high_mean": 0.06835317704826593, "clip_ratio/high_max": 0.06835317704826593, "clip_ratio/region_mean": 0.17663600761443377, "reward_total_mean": 0.3220638632774353, "reward_meter_mean": 0.5839483737945557, "reward_meter_std": 0.45508986711502075, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9637843370437622, "reward_lexical_plausibility_std": 0.08021838963031769, "reward_repeat_penalty_mean": 0.7245987057685852, "reward_repeat_penalty_std": 0.14216618239879608, "reward_repeat_floor_mean": 0.9759916067123413, "reward_repeat_floor_std": 0.01924424059689045, "reward_near_duplicate_penalty_mean": 0.9379336833953857, "reward_near_duplicate_penalty_std": 0.09077394753694534, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.32762131094932556, "reward_total_composite_mean": 0.3220638632774353, "reward_total_composite_std": 0.37391313910484314} {"timestamp_utc": "2026-04-12T16:56:38Z", "mode": "train", "global_step": 267, "epoch": 0.014051892005683912, "loss": -0.0225, "grad_norm": 20.03293228149414, "learning_rate": 9.193939393939395e-06, "num_tokens": 496774.0, "completions/mean_length": 38.0, "completions/min_length": 30.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.0, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.5126917362213135, "rewards/meter/std": 0.48572054505348206, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8600000143051147, "rewards/judge_quality/std": 0.2066052109003067, "rewards/repeat_penalty/mean": 0.9858925938606262, "rewards/repeat_penalty/std": 0.024782583117485046, "rewards/repeat_floor/mean": 0.9984083771705627, "rewards/repeat_floor/std": 0.002445716643705964, "rewards/near_duplicate_penalty/mean": 0.9946338534355164, "rewards/near_duplicate_penalty/std": 0.01049359142780304, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.4760437607765198, "rewards/total_composite/std": 0.4552389979362488, "reward": 0.4760437607765198, "reward_std": 0.4552389979362488, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19471172988414764, "sampling/sampling_logp_difference/max": 1.7212409973144531, "sampling/importance_sampling_ratio/min": 0.17884406447410583, "sampling/importance_sampling_ratio/mean": 1.0050082206726074, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.06889970600605, "clip_ratio/low_mean": 0.0628314409404993, "clip_ratio/low_min": 0.0628314409404993, "clip_ratio/high_mean": 0.11642867513000965, "clip_ratio/high_max": 0.11642867513000965, "clip_ratio/region_mean": 0.17926011607050896, "reward_total_mean": 0.4760437607765198, "reward_meter_mean": 0.5126917362213135, "reward_meter_std": 0.48572054505348206, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9858925938606262, "reward_repeat_penalty_std": 0.024782583117485046, "reward_repeat_floor_mean": 0.9984083771705627, "reward_repeat_floor_std": 0.002445716643705964, "reward_near_duplicate_penalty_mean": 0.9946338534355164, "reward_near_duplicate_penalty_std": 0.01049359142780304, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.8600000143051147, "reward_judge_quality_std": 0.2066052109003067, "reward_total_composite_mean": 0.4760437607765198, "reward_total_composite_std": 0.4552389979362488} {"timestamp_utc": "2026-04-12T16:56:48Z", "mode": "train", "global_step": 268, "epoch": 0.014104520814693964, "loss": 0.3745, "grad_norm": 11.29027271270752, "learning_rate": 9.190909090909092e-06, "num_tokens": 498694.0, "completions/mean_length": 65.0, "completions/min_length": 18.0, "completions/max_length": 110.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.0, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 110.0, "rewards/meter/mean": 0.48991847038269043, "rewards/meter/std": 0.3096616268157959, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.3471825420856476, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.10415478050708771, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.8983121514320374, "rewards/repeat_penalty/std": 0.10661174356937408, "rewards/repeat_floor/mean": 0.992123007774353, "rewards/repeat_floor/std": 0.006823556497693062, "rewards/near_duplicate_penalty/mean": 0.9883452653884888, "rewards/near_duplicate_penalty/std": 0.012447234243154526, "rewards/opening_diversity/mean": 0.9296875, "rewards/opening_diversity/std": 0.1129826009273529, "rewards/distinct_2/mean": 0.9787768721580505, "rewards/distinct_2/std": 0.032197922468185425, "rewards/total_composite/mean": 0.19729964435100555, "rewards/total_composite/std": 0.20176763832569122, "reward": 0.19729964435100555, "reward_std": 0.20176765322685242, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1991879642009735, "sampling/sampling_logp_difference/max": 1.4274108409881592, "sampling/importance_sampling_ratio/min": 0.23992934823036194, "sampling/importance_sampling_ratio/mean": 0.9962937831878662, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4438332840800285, "clip_ratio/low_mean": 0.1417461894452572, "clip_ratio/low_min": 0.1417461894452572, "clip_ratio/high_mean": 0.05208333395421505, "clip_ratio/high_max": 0.05208333395421505, "clip_ratio/region_mean": 0.19382952339947224, "reward_total_mean": 0.19729964435100555, "reward_meter_mean": 0.48991847038269043, "reward_meter_std": 0.3096616268157959, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.3471825420856476, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.10415478050708771, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8983121514320374, "reward_repeat_penalty_std": 0.10661174356937408, "reward_repeat_floor_mean": 0.992123007774353, "reward_repeat_floor_std": 0.006823556497693062, "reward_near_duplicate_penalty_mean": 0.9883452653884888, "reward_near_duplicate_penalty_std": 0.012447234243154526, "reward_opening_diversity_mean": 0.9296875, "reward_opening_diversity_std": 0.1129826009273529, "reward_distinct_2_mean": 0.9787768721580505, "reward_distinct_2_std": 0.032197922468185425, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.19729964435100555, "reward_total_composite_std": 0.20176763832569122} {"timestamp_utc": "2026-04-12T16:57:02Z", "mode": "train", "global_step": 269, "epoch": 0.014157149623704016, "loss": -0.0673, "grad_norm": 4.49676513671875, "learning_rate": 9.187878787878789e-06, "num_tokens": 501596.0, "completions/mean_length": 210.75, "completions/min_length": 135.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 167.71429443359375, "completions/min_terminated_length": 135.0, "completions/max_terminated_length": 198.0, "rewards/meter/mean": 0.7809507846832275, "rewards/meter/std": 0.33067092299461365, "rewards/count_adherence/mean": 0.8571429252624512, "rewards/count_adherence/std": 0.1870439052581787, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9571428298950195, "rewards/count_floor/std": 0.05611317232251167, "rewards/lexical_plausibility/mean": 0.9653884172439575, "rewards/lexical_plausibility/std": 0.06582440435886383, "rewards/judge_quality/mean": 0.2499999850988388, "rewards/judge_quality/std": 0.16903084516525269, "rewards/repeat_penalty/mean": 0.8893945217132568, "rewards/repeat_penalty/std": 0.18940770626068115, "rewards/repeat_floor/mean": 0.9884815216064453, "rewards/repeat_floor/std": 0.019608257338404655, "rewards/near_duplicate_penalty/mean": 0.9775195121765137, "rewards/near_duplicate_penalty/std": 0.034854110330343246, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9094846248626709, "rewards/distinct_2/std": 0.1604984998703003, "rewards/total_composite/mean": 0.2199091911315918, "rewards/total_composite/std": 0.17031200230121613, "reward": 0.2199091911315918, "reward_std": 0.17031201720237732, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20452137291431427, "sampling/sampling_logp_difference/max": 1.7001419067382812, "sampling/importance_sampling_ratio/min": 0.18265759944915771, "sampling/importance_sampling_ratio/mean": 1.036447525024414, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.5784726440906525, "clip_ratio/low_mean": 0.04589068330824375, "clip_ratio/low_min": 0.04589068330824375, "clip_ratio/high_mean": 0.1026510912925005, "clip_ratio/high_max": 0.1026510912925005, "clip_ratio/region_mean": 0.14854177460074425, "reward_total_mean": 0.2199091911315918, "reward_meter_mean": 0.7809507846832275, "reward_meter_std": 0.33067092299461365, "reward_count_adherence_mean": 0.8571429252624512, "reward_count_adherence_std": 0.1870439052581787, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9571428298950195, "reward_count_floor_std": 0.05611317232251167, "reward_lexical_plausibility_mean": 0.9653884172439575, "reward_lexical_plausibility_std": 0.06582440435886383, "reward_repeat_penalty_mean": 0.8893945217132568, "reward_repeat_penalty_std": 0.18940770626068115, "reward_repeat_floor_mean": 0.9884815216064453, "reward_repeat_floor_std": 0.019608257338404655, "reward_near_duplicate_penalty_mean": 0.9775195121765137, "reward_near_duplicate_penalty_std": 0.034854110330343246, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9094846248626709, "reward_distinct_2_std": 0.1604984998703003, "reward_judge_quality_mean": 0.2499999850988388, "reward_judge_quality_std": 0.16903084516525269, "reward_total_composite_mean": 0.2199091911315918, "reward_total_composite_std": 0.17031200230121613} {"timestamp_utc": "2026-04-12T16:57:15Z", "mode": "train", "global_step": 270, "epoch": 0.014209778432714067, "loss": -0.1885, "grad_norm": 4.5092997550964355, "learning_rate": 9.184848484848485e-06, "num_tokens": 504535.0, "completions/mean_length": 203.375, "completions/min_length": 131.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 159.2857208251953, "completions/min_terminated_length": 131.0, "completions/max_terminated_length": 205.0, "rewards/meter/mean": 0.9101657867431641, "rewards/meter/std": 0.2245728224515915, "rewards/count_adherence/mean": 0.8928571939468384, "rewards/count_adherence/std": 0.06613000482320786, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9678571224212646, "rewards/count_floor/std": 0.01983901485800743, "rewards/lexical_plausibility/mean": 0.9549747705459595, "rewards/lexical_plausibility/std": 0.1273505836725235, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.2886304259300232, "rewards/repeat_penalty/std": 0.35808151960372925, "rewards/repeat_floor/mean": 0.8897981643676758, "rewards/repeat_floor/std": 0.07292575389146805, "rewards/near_duplicate_penalty/mean": 0.7278239130973816, "rewards/near_duplicate_penalty/std": 0.19873596727848053, "rewards/opening_diversity/mean": 0.7885044813156128, "rewards/opening_diversity/std": 0.2914164960384369, "rewards/distinct_2/mean": 0.3701585531234741, "rewards/distinct_2/std": 0.3632041811943054, "rewards/total_composite/mean": 0.2062847912311554, "rewards/total_composite/std": 0.12853997945785522, "reward": 0.2062847912311554, "reward_std": 0.12853999435901642, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12081237137317657, "sampling/sampling_logp_difference/max": 1.8387348651885986, "sampling/importance_sampling_ratio/min": 0.15901848673820496, "sampling/importance_sampling_ratio/mean": 1.0191649198532104, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9774073697626591, "clip_ratio/low_mean": 0.034974793903529644, "clip_ratio/low_min": 0.034974793903529644, "clip_ratio/high_mean": 0.05621932726353407, "clip_ratio/high_max": 0.05621932726353407, "clip_ratio/region_mean": 0.09119412116706371, "reward_total_mean": 0.2062847912311554, "reward_meter_mean": 0.9101657867431641, "reward_meter_std": 0.2245728224515915, "reward_count_adherence_mean": 0.8928571939468384, "reward_count_adherence_std": 0.06613000482320786, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9678571224212646, "reward_count_floor_std": 0.01983901485800743, "reward_lexical_plausibility_mean": 0.9549747705459595, "reward_lexical_plausibility_std": 0.1273505836725235, "reward_repeat_penalty_mean": 0.2886304259300232, "reward_repeat_penalty_std": 0.35808151960372925, "reward_repeat_floor_mean": 0.8897981643676758, "reward_repeat_floor_std": 0.07292575389146805, "reward_near_duplicate_penalty_mean": 0.7278239130973816, "reward_near_duplicate_penalty_std": 0.19873596727848053, "reward_opening_diversity_mean": 0.7885044813156128, "reward_opening_diversity_std": 0.2914164960384369, "reward_distinct_2_mean": 0.3701585531234741, "reward_distinct_2_std": 0.3632041811943054, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.2062847912311554, "reward_total_composite_std": 0.12853997945785522} {"timestamp_utc": "2026-04-12T16:57:24Z", "mode": "train", "global_step": 271, "epoch": 0.01426240724172412, "loss": 0.0402, "grad_norm": 15.954353332519531, "learning_rate": 9.181818181818184e-06, "num_tokens": 506323.0, "completions/mean_length": 49.5, "completions/min_length": 41.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.5, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.8890167474746704, "rewards/meter/std": 0.2670239210128784, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9825080633163452, "rewards/repeat_penalty/std": 0.026309307664632797, "rewards/repeat_floor/mean": 0.9973762035369873, "rewards/repeat_floor/std": 0.003946396987885237, "rewards/near_duplicate_penalty/mean": 0.9825080633163452, "rewards/near_duplicate_penalty/std": 0.026309307664632797, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3503352403640747, "rewards/total_composite/std": 0.11290138959884644, "reward": 0.3503352403640747, "reward_std": 0.11290138214826584, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18417158722877502, "sampling/sampling_logp_difference/max": 1.2668890953063965, "sampling/importance_sampling_ratio/min": 0.28170663118362427, "sampling/importance_sampling_ratio/mean": 1.0386143922805786, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9212061315774918, "clip_ratio/low_mean": 0.08594587538391352, "clip_ratio/low_min": 0.08594587538391352, "clip_ratio/high_mean": 0.06211677938699722, "clip_ratio/high_max": 0.06211677938699722, "clip_ratio/region_mean": 0.14806265477091074, "reward_total_mean": 0.3503352403640747, "reward_meter_mean": 0.8890167474746704, "reward_meter_std": 0.2670239210128784, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9825080633163452, "reward_repeat_penalty_std": 0.026309307664632797, "reward_repeat_floor_mean": 0.9973762035369873, "reward_repeat_floor_std": 0.003946396987885237, "reward_near_duplicate_penalty_mean": 0.9825080633163452, "reward_near_duplicate_penalty_std": 0.026309307664632797, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.3503352403640747, "reward_total_composite_std": 0.11290138959884644} {"timestamp_utc": "2026-04-12T16:57:32Z", "mode": "train", "global_step": 272, "epoch": 0.014315036050734172, "loss": -0.0054, "grad_norm": 17.56914710998535, "learning_rate": 9.178787878787879e-06, "num_tokens": 507864.0, "completions/mean_length": 37.625, "completions/min_length": 28.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.625, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.5218707323074341, "rewards/meter/std": 0.42126917839050293, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6212499737739563, "rewards/judge_quality/std": 0.2366696149110794, "rewards/repeat_penalty/mean": 0.9531925916671753, "rewards/repeat_penalty/std": 0.060648027807474136, "rewards/repeat_floor/mean": 0.9934064745903015, "rewards/repeat_floor/std": 0.008111451752483845, "rewards/near_duplicate_penalty/mean": 0.961812436580658, "rewards/near_duplicate_penalty/std": 0.042382217943668365, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.27356940507888794, "rewards/total_composite/std": 0.18963998556137085, "reward": 0.27356940507888794, "reward_std": 0.18964000046253204, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18089821934700012, "sampling/sampling_logp_difference/max": 1.433882713317871, "sampling/importance_sampling_ratio/min": 0.23838156461715698, "sampling/importance_sampling_ratio/mean": 1.0495569705963135, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7605403512716293, "clip_ratio/low_mean": 0.07577519584447145, "clip_ratio/low_min": 0.07577519584447145, "clip_ratio/high_mean": 0.09659185446798801, "clip_ratio/high_max": 0.09659185446798801, "clip_ratio/region_mean": 0.17236705031245947, "reward_total_mean": 0.27356940507888794, "reward_meter_mean": 0.5218707323074341, "reward_meter_std": 0.42126917839050293, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9531925916671753, "reward_repeat_penalty_std": 0.060648027807474136, "reward_repeat_floor_mean": 0.9934064745903015, "reward_repeat_floor_std": 0.008111451752483845, "reward_near_duplicate_penalty_mean": 0.961812436580658, "reward_near_duplicate_penalty_std": 0.042382217943668365, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.6212499737739563, "reward_judge_quality_std": 0.2366696149110794, "reward_total_composite_mean": 0.27356940507888794, "reward_total_composite_std": 0.18963998556137085} {"timestamp_utc": "2026-04-12T16:57:41Z", "mode": "train", "global_step": 273, "epoch": 0.014367664859744224, "loss": 0.0331, "grad_norm": 14.007634162902832, "learning_rate": 9.175757575757576e-06, "num_tokens": 509639.0, "completions/mean_length": 53.875, "completions/min_length": 35.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.875, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.7498190402984619, "rewards/meter/std": 0.2539932429790497, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.0707106739282608, "rewards/lexical_plausibility/mean": 0.9226579666137695, "rewards/lexical_plausibility/std": 0.21875634789466858, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.7688454389572144, "rewards/repeat_penalty/std": 0.32037031650543213, "rewards/repeat_floor/mean": 0.9698281288146973, "rewards/repeat_floor/std": 0.053871382027864456, "rewards/near_duplicate_penalty/mean": 0.9199416637420654, "rewards/near_duplicate_penalty/std": 0.14942771196365356, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.18898223340511322, "rewards/distinct_2/mean": 0.8815209865570068, "rewards/distinct_2/std": 0.24810031056404114, "rewards/total_composite/mean": 0.20851707458496094, "rewards/total_composite/std": 0.12288745492696762, "reward": 0.20851707458496094, "reward_std": 0.12288743257522583, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1780700981616974, "sampling/sampling_logp_difference/max": 1.558349370956421, "sampling/importance_sampling_ratio/min": 0.21048320829868317, "sampling/importance_sampling_ratio/mean": 1.0074797868728638, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.261663943529129, "clip_ratio/low_mean": 0.06944405287504196, "clip_ratio/low_min": 0.06944405287504196, "clip_ratio/high_mean": 0.1003403440117836, "clip_ratio/high_max": 0.1003403440117836, "clip_ratio/region_mean": 0.16978439688682556, "reward_total_mean": 0.20851707458496094, "reward_meter_mean": 0.7498190402984619, "reward_meter_std": 0.2539932429790497, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.0707106739282608, "reward_lexical_plausibility_mean": 0.9226579666137695, "reward_lexical_plausibility_std": 0.21875634789466858, "reward_repeat_penalty_mean": 0.7688454389572144, "reward_repeat_penalty_std": 0.32037031650543213, "reward_repeat_floor_mean": 0.9698281288146973, "reward_repeat_floor_std": 0.053871382027864456, "reward_near_duplicate_penalty_mean": 0.9199416637420654, "reward_near_duplicate_penalty_std": 0.14942771196365356, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.18898223340511322, "reward_distinct_2_mean": 0.8815209865570068, "reward_distinct_2_std": 0.24810031056404114, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.20851707458496094, "reward_total_composite_std": 0.12288745492696762} {"timestamp_utc": "2026-04-12T16:57:49Z", "mode": "train", "global_step": 274, "epoch": 0.014420293668754277, "loss": -0.0698, "grad_norm": 16.908870697021484, "learning_rate": 9.172727272727274e-06, "num_tokens": 511364.0, "completions/mean_length": 45.625, "completions/min_length": 36.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.625, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.8064875602722168, "rewards/meter/std": 0.2932147979736328, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9230809807777405, "rewards/lexical_plausibility/std": 0.07844741642475128, "rewards/judge_quality/mean": 0.5974999666213989, "rewards/judge_quality/std": 0.35847893357276917, "rewards/repeat_penalty/mean": 0.8598893284797668, "rewards/repeat_penalty/std": 0.3481849730014801, "rewards/repeat_floor/mean": 0.9718217849731445, "rewards/repeat_floor/std": 0.07245302945375443, "rewards/near_duplicate_penalty/mean": 0.9046551585197449, "rewards/near_duplicate_penalty/std": 0.22198894619941711, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.3535533845424652, "rewards/distinct_2/mean": 0.9291498064994812, "rewards/distinct_2/std": 0.2003946453332901, "rewards/total_composite/mean": 0.44291114807128906, "rewards/total_composite/std": 0.33945468068122864, "reward": 0.44291114807128906, "reward_std": 0.33945468068122864, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22264893352985382, "sampling/sampling_logp_difference/max": 2.238255500793457, "sampling/importance_sampling_ratio/min": 0.10664438456296921, "sampling/importance_sampling_ratio/mean": 1.028499960899353, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9048881530761719, "clip_ratio/low_mean": 0.12737103272229433, "clip_ratio/low_min": 0.12737103272229433, "clip_ratio/high_mean": 0.059583334252238274, "clip_ratio/high_max": 0.059583334252238274, "clip_ratio/region_mean": 0.1869543669745326, "reward_total_mean": 0.44291114807128906, "reward_meter_mean": 0.8064875602722168, "reward_meter_std": 0.2932147979736328, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9230809807777405, "reward_lexical_plausibility_std": 0.07844741642475128, "reward_repeat_penalty_mean": 0.8598893284797668, "reward_repeat_penalty_std": 0.3481849730014801, "reward_repeat_floor_mean": 0.9718217849731445, "reward_repeat_floor_std": 0.07245302945375443, "reward_near_duplicate_penalty_mean": 0.9046551585197449, "reward_near_duplicate_penalty_std": 0.22198894619941711, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.3535533845424652, "reward_distinct_2_mean": 0.9291498064994812, "reward_distinct_2_std": 0.2003946453332901, "reward_judge_quality_mean": 0.5974999666213989, "reward_judge_quality_std": 0.35847893357276917, "reward_total_composite_mean": 0.44291114807128906, "reward_total_composite_std": 0.33945468068122864} {"timestamp_utc": "2026-04-12T16:57:58Z", "mode": "train", "global_step": 275, "epoch": 0.014472922477764329, "loss": 0.0341, "grad_norm": 16.079748153686523, "learning_rate": 9.169696969696971e-06, "num_tokens": 512948.0, "completions/mean_length": 35.0, "completions/min_length": 29.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.0, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.7857391834259033, "rewards/meter/std": 0.31257539987564087, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.26868730783462524, "rewards/repeat_penalty/mean": 0.9848056435585022, "rewards/repeat_penalty/std": 0.041581347584724426, "rewards/repeat_floor/mean": 0.9983481168746948, "rewards/repeat_floor/std": 0.004463964607566595, "rewards/near_duplicate_penalty/mean": 0.995775043964386, "rewards/near_duplicate_penalty/std": 0.010607925243675709, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9886877536773682, "rewards/distinct_2/std": 0.031995780766010284, "rewards/total_composite/mean": 0.4544386863708496, "rewards/total_composite/std": 0.30342113971710205, "reward": 0.4544386863708496, "reward_std": 0.30342110991477966, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16112521290779114, "sampling/sampling_logp_difference/max": 1.8420591354370117, "sampling/importance_sampling_ratio/min": 0.15849074721336365, "sampling/importance_sampling_ratio/mean": 1.0035245418548584, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1782893761992455, "clip_ratio/low_mean": 0.1222641235217452, "clip_ratio/low_min": 0.1222641235217452, "clip_ratio/high_mean": 0.03282828349620104, "clip_ratio/high_max": 0.03282828349620104, "clip_ratio/region_mean": 0.15509240701794624, "reward_total_mean": 0.4544386863708496, "reward_meter_mean": 0.7857391834259033, "reward_meter_std": 0.31257539987564087, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9848056435585022, "reward_repeat_penalty_std": 0.041581347584724426, "reward_repeat_floor_mean": 0.9983481168746948, "reward_repeat_floor_std": 0.004463964607566595, "reward_near_duplicate_penalty_mean": 0.995775043964386, "reward_near_duplicate_penalty_std": 0.010607925243675709, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9886877536773682, "reward_distinct_2_std": 0.031995780766010284, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.26868730783462524, "reward_total_composite_mean": 0.4544386863708496, "reward_total_composite_std": 0.30342113971710205} {"timestamp_utc": "2026-04-12T16:58:07Z", "mode": "train", "global_step": 276, "epoch": 0.01452555128677438, "loss": 0.0716, "grad_norm": 21.031532287597656, "learning_rate": 9.166666666666666e-06, "num_tokens": 514792.0, "completions/mean_length": 67.5, "completions/min_length": 63.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 67.5, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.42907848954200745, "rewards/meter/std": 0.23413845896720886, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9925000071525574, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.9666136503219604, "rewards/lexical_plausibility/std": 0.06906955689191818, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9715597033500671, "rewards/repeat_penalty/std": 0.00994861125946045, "rewards/repeat_floor/mean": 0.9957339763641357, "rewards/repeat_floor/std": 0.001492294017225504, "rewards/near_duplicate_penalty/mean": 0.9715597033500671, "rewards/near_duplicate_penalty/std": 0.00994861125946045, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.17563453316688538, "rewards/total_composite/std": 0.1097688153386116, "reward": 0.17563453316688538, "reward_std": 0.109768807888031, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2141132801771164, "sampling/sampling_logp_difference/max": 2.7121477127075195, "sampling/importance_sampling_ratio/min": 0.06639406085014343, "sampling/importance_sampling_ratio/mean": 0.9953755736351013, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0091766491532326, "clip_ratio/low_mean": 0.09259961731731892, "clip_ratio/low_min": 0.09259961731731892, "clip_ratio/high_mean": 0.06883588805794716, "clip_ratio/high_max": 0.06883588805794716, "clip_ratio/region_mean": 0.16143550537526608, "reward_total_mean": 0.17563453316688538, "reward_meter_mean": 0.42907848954200745, "reward_meter_std": 0.23413845896720886, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9925000071525574, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.9666136503219604, "reward_lexical_plausibility_std": 0.06906955689191818, "reward_repeat_penalty_mean": 0.9715597033500671, "reward_repeat_penalty_std": 0.00994861125946045, "reward_repeat_floor_mean": 0.9957339763641357, "reward_repeat_floor_std": 0.001492294017225504, "reward_near_duplicate_penalty_mean": 0.9715597033500671, "reward_near_duplicate_penalty_std": 0.00994861125946045, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.17563453316688538, "reward_total_composite_std": 0.1097688153386116} {"timestamp_utc": "2026-04-12T16:58:17Z", "mode": "train", "global_step": 277, "epoch": 0.014578180095784432, "loss": 0.0255, "grad_norm": 10.240793228149414, "learning_rate": 9.163636363636365e-06, "num_tokens": 517661.0, "completions/mean_length": 159.625, "completions/min_length": 135.0, "completions/max_length": 195.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 159.625, "completions/min_terminated_length": 135.0, "completions/max_terminated_length": 195.0, "rewards/meter/mean": 0.728797435760498, "rewards/meter/std": 0.3267737925052643, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9571428298950195, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.8291047215461731, "rewards/repeat_penalty/std": 0.14760397374629974, "rewards/repeat_floor/mean": 0.9821028709411621, "rewards/repeat_floor/std": 0.014180499128997326, "rewards/near_duplicate_penalty/mean": 0.9613385200500488, "rewards/near_duplicate_penalty/std": 0.019460754469037056, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8655791878700256, "rewards/distinct_2/std": 0.12903448939323425, "rewards/total_composite/mean": 0.2510860562324524, "rewards/total_composite/std": 0.11653144657611847, "reward": 0.2510860562324524, "reward_std": 0.11653143912553787, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19137711822986603, "sampling/sampling_logp_difference/max": 2.0966250896453857, "sampling/importance_sampling_ratio/min": 0.12287040799856186, "sampling/importance_sampling_ratio/mean": 1.022000789642334, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4952750951051712, "clip_ratio/low_mean": 0.06852423213422298, "clip_ratio/low_min": 0.06852423213422298, "clip_ratio/high_mean": 0.10699446965008974, "clip_ratio/high_max": 0.10699446965008974, "clip_ratio/region_mean": 0.17551870178431273, "reward_total_mean": 0.2510860562324524, "reward_meter_mean": 0.728797435760498, "reward_meter_std": 0.3267737925052643, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9571428298950195, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8291047215461731, "reward_repeat_penalty_std": 0.14760397374629974, "reward_repeat_floor_mean": 0.9821028709411621, "reward_repeat_floor_std": 0.014180499128997326, "reward_near_duplicate_penalty_mean": 0.9613385200500488, "reward_near_duplicate_penalty_std": 0.019460754469037056, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8655791878700256, "reward_distinct_2_std": 0.12903448939323425, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.2510860562324524, "reward_total_composite_std": 0.11653144657611847} {"timestamp_utc": "2026-04-12T16:58:26Z", "mode": "train", "global_step": 278, "epoch": 0.014630808904794484, "loss": 0.0028, "grad_norm": 17.15207862854004, "learning_rate": 9.160606060606061e-06, "num_tokens": 519255.0, "completions/mean_length": 38.25, "completions/min_length": 30.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.25, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.6188963651657104, "rewards/meter/std": 0.2938784956932068, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6712499856948853, "rewards/judge_quality/std": 0.21216151118278503, "rewards/repeat_penalty/mean": 0.9941428303718567, "rewards/repeat_penalty/std": 0.012708526104688644, "rewards/repeat_floor/mean": 0.9991214275360107, "rewards/repeat_floor/std": 0.0019062899518758059, "rewards/near_duplicate_penalty/mean": 0.9941428303718567, "rewards/near_duplicate_penalty/std": 0.012708526104688644, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4416208267211914, "rewards/total_composite/std": 0.2849549353122711, "reward": 0.4416208267211914, "reward_std": 0.2849549651145935, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17788735032081604, "sampling/sampling_logp_difference/max": 2.385617256164551, "sampling/importance_sampling_ratio/min": 0.09203215688467026, "sampling/importance_sampling_ratio/mean": 1.0471211671829224, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2068944796919823, "clip_ratio/low_mean": 0.10344893299043179, "clip_ratio/low_min": 0.10344893299043179, "clip_ratio/high_mean": 0.05647659860551357, "clip_ratio/high_max": 0.05647659860551357, "clip_ratio/region_mean": 0.15992553159594536, "reward_total_mean": 0.4416208267211914, "reward_meter_mean": 0.6188963651657104, "reward_meter_std": 0.2938784956932068, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9941428303718567, "reward_repeat_penalty_std": 0.012708526104688644, "reward_repeat_floor_mean": 0.9991214275360107, "reward_repeat_floor_std": 0.0019062899518758059, "reward_near_duplicate_penalty_mean": 0.9941428303718567, "reward_near_duplicate_penalty_std": 0.012708526104688644, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6712499856948853, "reward_judge_quality_std": 0.21216151118278503, "reward_total_composite_mean": 0.4416208267211914, "reward_total_composite_std": 0.2849549353122711} {"timestamp_utc": "2026-04-12T16:58:40Z", "mode": "train", "global_step": 279, "epoch": 0.014683437713804537, "loss": -0.0698, "grad_norm": 6.8083109855651855, "learning_rate": 9.157575757575758e-06, "num_tokens": 521177.0, "completions/mean_length": 137.25, "completions/min_length": 56.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 83.71428680419922, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 108.0, "rewards/meter/mean": 0.5831443667411804, "rewards/meter/std": 0.38018566370010376, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9480080008506775, "rewards/lexical_plausibility/std": 0.14705561101436615, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9823733568191528, "rewards/repeat_penalty/std": 0.022886598482728004, "rewards/repeat_floor/mean": 0.9979701042175293, "rewards/repeat_floor/std": 0.0023654166143387556, "rewards/near_duplicate_penalty/mean": 0.9927911758422852, "rewards/near_duplicate_penalty/std": 0.007008022628724575, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9894605875015259, "rewards/distinct_2/std": 0.01951758563518524, "rewards/total_composite/mean": 0.21584241092205048, "rewards/total_composite/std": 0.13955256342887878, "reward": 0.21584241092205048, "reward_std": 0.13955256342887878, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20471937954425812, "sampling/sampling_logp_difference/max": 2.334380626678467, "sampling/importance_sampling_ratio/min": 0.09687045961618423, "sampling/importance_sampling_ratio/mean": 1.0382238626480103, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9867303967475891, "clip_ratio/low_mean": 0.05974718276411295, "clip_ratio/low_min": 0.05974718276411295, "clip_ratio/high_mean": 0.1124513577669859, "clip_ratio/high_max": 0.1124513577669859, "clip_ratio/region_mean": 0.17219854053109884, "reward_total_mean": 0.21584241092205048, "reward_meter_mean": 0.5831443667411804, "reward_meter_std": 0.38018566370010376, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9480080008506775, "reward_lexical_plausibility_std": 0.14705561101436615, "reward_repeat_penalty_mean": 0.9823733568191528, "reward_repeat_penalty_std": 0.022886598482728004, "reward_repeat_floor_mean": 0.9979701042175293, "reward_repeat_floor_std": 0.0023654166143387556, "reward_near_duplicate_penalty_mean": 0.9927911758422852, "reward_near_duplicate_penalty_std": 0.007008022628724575, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9894605875015259, "reward_distinct_2_std": 0.01951758563518524, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.21584241092205048, "reward_total_composite_std": 0.13955256342887878} {"timestamp_utc": "2026-04-12T16:58:49Z", "mode": "train", "global_step": 280, "epoch": 0.01473606652281459, "loss": 0.0238, "grad_norm": 14.027534484863281, "learning_rate": 9.154545454545455e-06, "num_tokens": 523216.0, "completions/mean_length": 66.875, "completions/min_length": 52.0, "completions/max_length": 80.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 66.875, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.6803208589553833, "rewards/meter/std": 0.34330227971076965, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9718749523162842, "rewards/count_floor/std": 0.05580177903175354, "rewards/lexical_plausibility/mean": 0.9822304248809814, "rewards/lexical_plausibility/std": 0.0502600334584713, "rewards/judge_quality/mean": 0.4750000238418579, "rewards/judge_quality/std": 0.27536988258361816, "rewards/repeat_penalty/mean": 0.9405751824378967, "rewards/repeat_penalty/std": 0.13471969962120056, "rewards/repeat_floor/mean": 0.9933263659477234, "rewards/repeat_floor/std": 0.01501352060586214, "rewards/near_duplicate_penalty/mean": 0.9833229780197144, "rewards/near_duplicate_penalty/std": 0.03350048512220383, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9588519334793091, "rewards/distinct_2/std": 0.09674642980098724, "rewards/total_composite/mean": 0.3439634144306183, "rewards/total_composite/std": 0.2557860016822815, "reward": 0.3439634144306183, "reward_std": 0.2557860314846039, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18119318783283234, "sampling/sampling_logp_difference/max": 2.4829185009002686, "sampling/importance_sampling_ratio/min": 0.08349917083978653, "sampling/importance_sampling_ratio/mean": 1.0178357362747192, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5650077611207962, "clip_ratio/low_mean": 0.10909930150955915, "clip_ratio/low_min": 0.10909930150955915, "clip_ratio/high_mean": 0.03057802841067314, "clip_ratio/high_max": 0.03057802841067314, "clip_ratio/region_mean": 0.1396773299202323, "reward_total_mean": 0.3439634144306183, "reward_meter_mean": 0.6803208589553833, "reward_meter_std": 0.34330227971076965, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9718749523162842, "reward_count_floor_std": 0.05580177903175354, "reward_lexical_plausibility_mean": 0.9822304248809814, "reward_lexical_plausibility_std": 0.0502600334584713, "reward_repeat_penalty_mean": 0.9405751824378967, "reward_repeat_penalty_std": 0.13471969962120056, "reward_repeat_floor_mean": 0.9933263659477234, "reward_repeat_floor_std": 0.01501352060586214, "reward_near_duplicate_penalty_mean": 0.9833229780197144, "reward_near_duplicate_penalty_std": 0.03350048512220383, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9588519334793091, "reward_distinct_2_std": 0.09674642980098724, "reward_judge_quality_mean": 0.4750000238418579, "reward_judge_quality_std": 0.27536988258361816, "reward_total_composite_mean": 0.3439634144306183, "reward_total_composite_std": 0.2557860016822815} {"timestamp_utc": "2026-04-12T16:58:58Z", "mode": "train", "global_step": 281, "epoch": 0.01478869533182464, "loss": -0.0399, "grad_norm": 15.764311790466309, "learning_rate": 9.151515151515153e-06, "num_tokens": 524735.0, "completions/mean_length": 34.875, "completions/min_length": 31.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.875, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.7278113961219788, "rewards/meter/std": 0.38084539771080017, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5425000190734863, "rewards/judge_quality/std": 0.23705033957958221, "rewards/repeat_penalty/mean": 0.9337247610092163, "rewards/repeat_penalty/std": 0.1624285876750946, "rewards/repeat_floor/mean": 0.9924181699752808, "rewards/repeat_floor/std": 0.01770925335586071, "rewards/near_duplicate_penalty/mean": 0.9755292534828186, "rewards/near_duplicate_penalty/std": 0.04505830630660057, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9773755669593811, "rewards/distinct_2/std": 0.06399156153202057, "rewards/total_composite/mean": 0.4392854571342468, "rewards/total_composite/std": 0.32982638478279114, "reward": 0.4392854571342468, "reward_std": 0.32982638478279114, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16213636100292206, "sampling/sampling_logp_difference/max": 1.188344955444336, "sampling/importance_sampling_ratio/min": 0.30472517013549805, "sampling/importance_sampling_ratio/mean": 1.0190047025680542, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9890183359384537, "clip_ratio/low_mean": 0.07817160151898861, "clip_ratio/low_min": 0.07817160151898861, "clip_ratio/high_mean": 0.04904306307435036, "clip_ratio/high_max": 0.04904306307435036, "clip_ratio/region_mean": 0.12721466459333897, "reward_total_mean": 0.4392854571342468, "reward_meter_mean": 0.7278113961219788, "reward_meter_std": 0.38084539771080017, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9337247610092163, "reward_repeat_penalty_std": 0.1624285876750946, "reward_repeat_floor_mean": 0.9924181699752808, "reward_repeat_floor_std": 0.01770925335586071, "reward_near_duplicate_penalty_mean": 0.9755292534828186, "reward_near_duplicate_penalty_std": 0.04505830630660057, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9773755669593811, "reward_distinct_2_std": 0.06399156153202057, "reward_judge_quality_mean": 0.5425000190734863, "reward_judge_quality_std": 0.23705033957958221, "reward_total_composite_mean": 0.4392854571342468, "reward_total_composite_std": 0.32982638478279114} {"timestamp_utc": "2026-04-12T16:59:07Z", "mode": "train", "global_step": 282, "epoch": 0.014841324140834692, "loss": 0.0643, "grad_norm": 11.418998718261719, "learning_rate": 9.148484848484848e-06, "num_tokens": 526504.0, "completions/mean_length": 41.125, "completions/min_length": 35.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.125, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.38451939821243286, "rewards/meter/std": 0.39363592863082886, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.5337499976158142, "rewards/judge_quality/std": 0.268537700176239, "rewards/repeat_penalty/mean": 0.8803739547729492, "rewards/repeat_penalty/std": 0.3193255364894867, "rewards/repeat_floor/mean": 0.9827873706817627, "rewards/repeat_floor/std": 0.045831385999917984, "rewards/near_duplicate_penalty/mean": 0.9524049758911133, "rewards/near_duplicate_penalty/std": 0.11582916975021362, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.908906877040863, "rewards/distinct_2/std": 0.2576502561569214, "rewards/total_composite/mean": 0.23270350694656372, "rewards/total_composite/std": 0.3042370080947876, "reward": 0.23270350694656372, "reward_std": 0.3042370080947876, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18904976546764374, "sampling/sampling_logp_difference/max": 1.35774564743042, "sampling/importance_sampling_ratio/min": 0.25724002718925476, "sampling/importance_sampling_ratio/mean": 1.0087424516677856, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3395363837480545, "clip_ratio/low_mean": 0.10560396127402782, "clip_ratio/low_min": 0.10560396127402782, "clip_ratio/high_mean": 0.08660891093313694, "clip_ratio/high_max": 0.08660891093313694, "clip_ratio/region_mean": 0.19221287220716476, "reward_total_mean": 0.23270350694656372, "reward_meter_mean": 0.38451939821243286, "reward_meter_std": 0.39363592863082886, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.8803739547729492, "reward_repeat_penalty_std": 0.3193255364894867, "reward_repeat_floor_mean": 0.9827873706817627, "reward_repeat_floor_std": 0.045831385999917984, "reward_near_duplicate_penalty_mean": 0.9524049758911133, "reward_near_duplicate_penalty_std": 0.11582916975021362, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.908906877040863, "reward_distinct_2_std": 0.2576502561569214, "reward_judge_quality_mean": 0.5337499976158142, "reward_judge_quality_std": 0.268537700176239, "reward_total_composite_mean": 0.23270350694656372, "reward_total_composite_std": 0.3042370080947876} {"timestamp_utc": "2026-04-12T16:59:14Z", "mode": "train", "global_step": 283, "epoch": 0.014893952949844745, "loss": 0.0162, "grad_norm": 26.292882919311523, "learning_rate": 9.145454545454546e-06, "num_tokens": 527925.0, "completions/mean_length": 19.625, "completions/min_length": 16.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.625, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.8695434331893921, "rewards/meter/std": 0.3494793772697449, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.3620477616786957, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5417861938476562, "rewards/total_composite/std": 0.4000450372695923, "reward": 0.5417861938476562, "reward_std": 0.4000450372695923, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22980155050754547, "sampling/sampling_logp_difference/max": 1.767982006072998, "sampling/importance_sampling_ratio/min": 0.1706770658493042, "sampling/importance_sampling_ratio/mean": 1.0327543020248413, "sampling/importance_sampling_ratio/max": 1.93062424659729, "entropy": 1.9435898512601852, "clip_ratio/low_mean": 0.07785870879888535, "clip_ratio/low_min": 0.07785870879888535, "clip_ratio/high_mean": 0.09802359342575073, "clip_ratio/high_max": 0.09802359342575073, "clip_ratio/region_mean": 0.17588230222463608, "reward_total_mean": 0.5417861938476562, "reward_meter_mean": 0.8695434331893921, "reward_meter_std": 0.3494793772697449, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.3620477616786957, "reward_total_composite_mean": 0.5417861938476562, "reward_total_composite_std": 0.4000450372695923} {"timestamp_utc": "2026-04-12T16:59:25Z", "mode": "train", "global_step": 284, "epoch": 0.014946581758854797, "loss": 0.0677, "grad_norm": 8.83140754699707, "learning_rate": 9.142424242424243e-06, "num_tokens": 530039.0, "completions/mean_length": 83.25, "completions/min_length": 55.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 83.25, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.9847642183303833, "rewards/meter/std": 0.011187692172825336, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.995192289352417, "rewards/lexical_plausibility/std": 0.013598216697573662, "rewards/judge_quality/mean": 0.4587499797344208, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.9827767610549927, "rewards/repeat_penalty/std": 0.019196975976228714, "rewards/repeat_floor/mean": 0.9979097843170166, "rewards/repeat_floor/std": 0.002083313185721636, "rewards/near_duplicate_penalty/mean": 0.9911524057388306, "rewards/near_duplicate_penalty/std": 0.008081563748419285, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9915212988853455, "rewards/distinct_2/std": 0.015731029212474823, "rewards/total_composite/mean": 0.4405641555786133, "rewards/total_composite/std": 0.19322501122951508, "reward": 0.4405641555786133, "reward_std": 0.19322501122951508, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2049863040447235, "sampling/sampling_logp_difference/max": 3.1022140979766846, "sampling/importance_sampling_ratio/min": 0.044949568808078766, "sampling/importance_sampling_ratio/mean": 1.041797161102295, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.764414131641388, "clip_ratio/low_mean": 0.11656825989484787, "clip_ratio/low_min": 0.11656825989484787, "clip_ratio/high_mean": 0.0931461350992322, "clip_ratio/high_max": 0.0931461350992322, "clip_ratio/region_mean": 0.20971439499408007, "reward_total_mean": 0.4405641555786133, "reward_meter_mean": 0.9847642183303833, "reward_meter_std": 0.011187692172825336, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.995192289352417, "reward_lexical_plausibility_std": 0.013598216697573662, "reward_repeat_penalty_mean": 0.9827767610549927, "reward_repeat_penalty_std": 0.019196975976228714, "reward_repeat_floor_mean": 0.9979097843170166, "reward_repeat_floor_std": 0.002083313185721636, "reward_near_duplicate_penalty_mean": 0.9911524057388306, "reward_near_duplicate_penalty_std": 0.008081563748419285, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9915212988853455, "reward_distinct_2_std": 0.015731029212474823, "reward_judge_quality_mean": 0.4587499797344208, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.4405641555786133, "reward_total_composite_std": 0.19322501122951508} {"timestamp_utc": "2026-04-12T16:59:38Z", "mode": "train", "global_step": 285, "epoch": 0.01499921056786485, "loss": -0.0905, "grad_norm": 3.715938091278076, "learning_rate": 9.13939393939394e-06, "num_tokens": 531627.0, "completions/mean_length": 163.5, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 47.333335876464844, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.8180938959121704, "rewards/meter/std": 0.2964673340320587, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.910395622253418, "rewards/lexical_plausibility/std": 0.15763933956623077, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.27458736300468445, "rewards/repeat_penalty/mean": 0.908223032951355, "rewards/repeat_penalty/std": 0.1296989619731903, "rewards/repeat_floor/mean": 0.992796778678894, "rewards/repeat_floor/std": 0.009746378287672997, "rewards/near_duplicate_penalty/mean": 0.9912854433059692, "rewards/near_duplicate_penalty/std": 0.012134880758821964, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9761550426483154, "rewards/distinct_2/std": 0.048689957708120346, "rewards/total_composite/mean": 0.3021094501018524, "rewards/total_composite/std": 0.2318974882364273, "reward": 0.3021094501018524, "reward_std": 0.2318974733352661, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23120664060115814, "sampling/sampling_logp_difference/max": 1.9547584056854248, "sampling/importance_sampling_ratio/min": 0.1415986716747284, "sampling/importance_sampling_ratio/mean": 1.0576003789901733, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7501201778650284, "clip_ratio/low_mean": 0.02187499962747097, "clip_ratio/low_min": 0.02187499962747097, "clip_ratio/high_mean": 0.1224695174023509, "clip_ratio/high_max": 0.1224695174023509, "clip_ratio/region_mean": 0.14434451702982187, "reward_total_mean": 0.3021094501018524, "reward_meter_mean": 0.8180938959121704, "reward_meter_std": 0.2964673340320587, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.910395622253418, "reward_lexical_plausibility_std": 0.15763933956623077, "reward_repeat_penalty_mean": 0.908223032951355, "reward_repeat_penalty_std": 0.1296989619731903, "reward_repeat_floor_mean": 0.992796778678894, "reward_repeat_floor_std": 0.009746378287672997, "reward_near_duplicate_penalty_mean": 0.9912854433059692, "reward_near_duplicate_penalty_std": 0.012134880758821964, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9761550426483154, "reward_distinct_2_std": 0.048689957708120346, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.27458736300468445, "reward_total_composite_mean": 0.3021094501018524, "reward_total_composite_std": 0.2318974882364273} {"timestamp_utc": "2026-04-12T16:59:53Z", "mode": "train", "global_step": 286, "epoch": 0.015051839376874902, "loss": -0.2538, "grad_norm": 4.339982509613037, "learning_rate": 9.136363636363637e-06, "num_tokens": 534582.0, "completions/mean_length": 229.375, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 189.00001525878906, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 242.0, "rewards/meter/mean": 0.975068211555481, "rewards/meter/std": 0.025850258767604828, "rewards/count_adherence/mean": 0.7638888955116272, "rewards/count_adherence/std": 0.2749859690666199, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9291666746139526, "rewards/count_floor/std": 0.0824957937002182, "rewards/lexical_plausibility/mean": 0.9418684244155884, "rewards/lexical_plausibility/std": 0.13166607916355133, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.6418706178665161, "rewards/repeat_penalty/std": 0.3198451101779938, "rewards/repeat_floor/mean": 0.9624670147895813, "rewards/repeat_floor/std": 0.036328624933958054, "rewards/near_duplicate_penalty/mean": 0.941243052482605, "rewards/near_duplicate_penalty/std": 0.06054975837469101, "rewards/opening_diversity/mean": 0.9635416865348816, "rewards/opening_diversity/std": 0.06298425048589706, "rewards/distinct_2/mean": 0.7052004337310791, "rewards/distinct_2/std": 0.2991887032985687, "rewards/total_composite/mean": 0.23565421998500824, "rewards/total_composite/std": 0.12065204232931137, "reward": 0.23565421998500824, "reward_std": 0.12065203487873077, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18805421888828278, "sampling/sampling_logp_difference/max": 1.7813348770141602, "sampling/importance_sampling_ratio/min": 0.1684131920337677, "sampling/importance_sampling_ratio/mean": 1.0380291938781738, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7005761861801147, "clip_ratio/low_mean": 0.037321277894079685, "clip_ratio/low_min": 0.037321277894079685, "clip_ratio/high_mean": 0.09950423613190651, "clip_ratio/high_max": 0.09950423613190651, "clip_ratio/region_mean": 0.1368255140259862, "reward_total_mean": 0.23565421998500824, "reward_meter_mean": 0.975068211555481, "reward_meter_std": 0.025850258767604828, "reward_count_adherence_mean": 0.7638888955116272, "reward_count_adherence_std": 0.2749859690666199, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9291666746139526, "reward_count_floor_std": 0.0824957937002182, "reward_lexical_plausibility_mean": 0.9418684244155884, "reward_lexical_plausibility_std": 0.13166607916355133, "reward_repeat_penalty_mean": 0.6418706178665161, "reward_repeat_penalty_std": 0.3198451101779938, "reward_repeat_floor_mean": 0.9624670147895813, "reward_repeat_floor_std": 0.036328624933958054, "reward_near_duplicate_penalty_mean": 0.941243052482605, "reward_near_duplicate_penalty_std": 0.06054975837469101, "reward_opening_diversity_mean": 0.9635416865348816, "reward_opening_diversity_std": 0.06298425048589706, "reward_distinct_2_mean": 0.7052004337310791, "reward_distinct_2_std": 0.2991887032985687, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.23565421998500824, "reward_total_composite_std": 0.12065204232931137} {"timestamp_utc": "2026-04-12T17:00:02Z", "mode": "train", "global_step": 287, "epoch": 0.015104468185884953, "loss": 0.1296, "grad_norm": 10.649018287658691, "learning_rate": 9.133333333333335e-06, "num_tokens": 536727.0, "completions/mean_length": 82.125, "completions/min_length": 70.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 82.125, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.9153368473052979, "rewards/meter/std": 0.12883660197257996, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.2558424770832062, "rewards/repeat_penalty/mean": 0.933342456817627, "rewards/repeat_penalty/std": 0.07116208970546722, "rewards/repeat_floor/mean": 0.9924843907356262, "rewards/repeat_floor/std": 0.007308326195925474, "rewards/near_duplicate_penalty/mean": 0.9770587682723999, "rewards/near_duplicate_penalty/std": 0.01574035920202732, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9547288417816162, "rewards/distinct_2/std": 0.06276123225688934, "rewards/total_composite/mean": 0.5432270765304565, "rewards/total_composite/std": 0.2151651531457901, "reward": 0.5432270765304565, "reward_std": 0.2151651382446289, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19400514662265778, "sampling/sampling_logp_difference/max": 2.0500638484954834, "sampling/importance_sampling_ratio/min": 0.12872667610645294, "sampling/importance_sampling_ratio/mean": 1.0157383680343628, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5051335841417313, "clip_ratio/low_mean": 0.10248292610049248, "clip_ratio/low_min": 0.10248292610049248, "clip_ratio/high_mean": 0.07777336798608303, "clip_ratio/high_max": 0.07777336798608303, "clip_ratio/region_mean": 0.1802562940865755, "reward_total_mean": 0.5432270765304565, "reward_meter_mean": 0.9153368473052979, "reward_meter_std": 0.12883660197257996, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.933342456817627, "reward_repeat_penalty_std": 0.07116208970546722, "reward_repeat_floor_mean": 0.9924843907356262, "reward_repeat_floor_std": 0.007308326195925474, "reward_near_duplicate_penalty_mean": 0.9770587682723999, "reward_near_duplicate_penalty_std": 0.01574035920202732, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9547288417816162, "reward_distinct_2_std": 0.06276123225688934, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.2558424770832062, "reward_total_composite_mean": 0.5432270765304565, "reward_total_composite_std": 0.2151651531457901} {"timestamp_utc": "2026-04-12T17:00:09Z", "mode": "train", "global_step": 288, "epoch": 0.015157096994895005, "loss": 0.0657, "grad_norm": 20.441247940063477, "learning_rate": 9.130303030303032e-06, "num_tokens": 538288.0, "completions/mean_length": 31.125, "completions/min_length": 28.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.125, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.691908597946167, "rewards/meter/std": 0.3260622024536133, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.2671777307987213, "rewards/repeat_penalty/mean": 0.9883469343185425, "rewards/repeat_penalty/std": 0.018376260995864868, "rewards/repeat_floor/mean": 0.9982520341873169, "rewards/repeat_floor/std": 0.002756433328613639, "rewards/near_duplicate_penalty/mean": 0.9883469343185425, "rewards/near_duplicate_penalty/std": 0.018376260995864868, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3841954171657562, "rewards/total_composite/std": 0.2176816463470459, "reward": 0.3841954171657562, "reward_std": 0.2176816761493683, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17679233849048615, "sampling/sampling_logp_difference/max": 2.426983594894409, "sampling/importance_sampling_ratio/min": 0.08830278366804123, "sampling/importance_sampling_ratio/mean": 1.0266616344451904, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1910634189844131, "clip_ratio/low_mean": 0.07264610566198826, "clip_ratio/low_min": 0.07264610566198826, "clip_ratio/high_mean": 0.08435960672795773, "clip_ratio/high_max": 0.08435960672795773, "clip_ratio/region_mean": 0.15700571238994598, "reward_total_mean": 0.3841954171657562, "reward_meter_mean": 0.691908597946167, "reward_meter_std": 0.3260622024536133, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9883469343185425, "reward_repeat_penalty_std": 0.018376260995864868, "reward_repeat_floor_mean": 0.9982520341873169, "reward_repeat_floor_std": 0.002756433328613639, "reward_near_duplicate_penalty_mean": 0.9883469343185425, "reward_near_duplicate_penalty_std": 0.018376260995864868, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.2671777307987213, "reward_total_composite_mean": 0.3841954171657562, "reward_total_composite_std": 0.2176816463470459} {"timestamp_utc": "2026-04-12T17:00:18Z", "mode": "train", "global_step": 289, "epoch": 0.015209725803905057, "loss": 0.0171, "grad_norm": 14.392022132873535, "learning_rate": 9.127272727272727e-06, "num_tokens": 539931.0, "completions/mean_length": 40.375, "completions/min_length": 33.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.375, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.7644199132919312, "rewards/meter/std": 0.4023491442203522, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.984375, "rewards/lexical_plausibility/std": 0.04419417306780815, "rewards/judge_quality/mean": 0.7387499809265137, "rewards/judge_quality/std": 0.2687770128250122, "rewards/repeat_penalty/mean": 0.9844462871551514, "rewards/repeat_penalty/std": 0.03247229754924774, "rewards/repeat_floor/mean": 0.9983397722244263, "rewards/repeat_floor/std": 0.0030537107959389687, "rewards/near_duplicate_penalty/mean": 0.9957189559936523, "rewards/near_duplicate_penalty/std": 0.007621096912771463, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9886877536773682, "rewards/distinct_2/std": 0.031995780766010284, "rewards/total_composite/mean": 0.5681802034378052, "rewards/total_composite/std": 0.38565996289253235, "reward": 0.5681802034378052, "reward_std": 0.38565999269485474, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18957798182964325, "sampling/sampling_logp_difference/max": 1.7113916873931885, "sampling/importance_sampling_ratio/min": 0.18061426281929016, "sampling/importance_sampling_ratio/mean": 1.038847804069519, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5313074737787247, "clip_ratio/low_mean": 0.10078554414212704, "clip_ratio/low_min": 0.10078554414212704, "clip_ratio/high_mean": 0.09208153188228607, "clip_ratio/high_max": 0.09208153188228607, "clip_ratio/region_mean": 0.1928670760244131, "reward_total_mean": 0.5681802034378052, "reward_meter_mean": 0.7644199132919312, "reward_meter_std": 0.4023491442203522, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.984375, "reward_lexical_plausibility_std": 0.04419417306780815, "reward_repeat_penalty_mean": 0.9844462871551514, "reward_repeat_penalty_std": 0.03247229754924774, "reward_repeat_floor_mean": 0.9983397722244263, "reward_repeat_floor_std": 0.0030537107959389687, "reward_near_duplicate_penalty_mean": 0.9957189559936523, "reward_near_duplicate_penalty_std": 0.007621096912771463, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9886877536773682, "reward_distinct_2_std": 0.031995780766010284, "reward_judge_quality_mean": 0.7387499809265137, "reward_judge_quality_std": 0.2687770128250122, "reward_total_composite_mean": 0.5681802034378052, "reward_total_composite_std": 0.38565996289253235} {"timestamp_utc": "2026-04-12T17:00:25Z", "mode": "train", "global_step": 290, "epoch": 0.01526235461291511, "loss": -0.0533, "grad_norm": 18.467220306396484, "learning_rate": 9.124242424242425e-06, "num_tokens": 541251.0, "completions/mean_length": 19.0, "completions/min_length": 13.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.0, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.9261953830718994, "rewards/meter/std": 0.07821160554885864, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9237500429153442, "rewards/judge_quality/std": 0.01060659158974886, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.8428959846496582, "rewards/total_composite/std": 0.07375600188970566, "reward": 0.8428959846496582, "reward_std": 0.07375600188970566, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1571652740240097, "sampling/sampling_logp_difference/max": 1.5724208354949951, "sampling/importance_sampling_ratio/min": 0.20754215121269226, "sampling/importance_sampling_ratio/mean": 1.011788249015808, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9865400865674019, "clip_ratio/low_mean": 0.07368983514606953, "clip_ratio/low_min": 0.07368983514606953, "clip_ratio/high_mean": 0.07373120496049523, "clip_ratio/high_max": 0.07373120496049523, "clip_ratio/region_mean": 0.14742104010656476, "reward_total_mean": 0.8428959846496582, "reward_meter_mean": 0.9261953830718994, "reward_meter_std": 0.07821160554885864, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9237500429153442, "reward_judge_quality_std": 0.01060659158974886, "reward_total_composite_mean": 0.8428959846496582, "reward_total_composite_std": 0.07375600188970566} {"timestamp_utc": "2026-04-12T17:00:36Z", "mode": "train", "global_step": 291, "epoch": 0.015314983421925162, "loss": 0.0427, "grad_norm": 12.23320484161377, "learning_rate": 9.121212121212122e-06, "num_tokens": 543317.0, "completions/mean_length": 80.25, "completions/min_length": 68.0, "completions/max_length": 98.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 80.25, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.8204764127731323, "rewards/meter/std": 0.22252389788627625, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9235402345657349, "rewards/repeat_penalty/std": 0.0735095664858818, "rewards/repeat_floor/mean": 0.9913394451141357, "rewards/repeat_floor/std": 0.007823782041668892, "rewards/near_duplicate_penalty/mean": 0.970642626285553, "rewards/near_duplicate_penalty/std": 0.02177763730287552, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.957909345626831, "rewards/distinct_2/std": 0.05162857845425606, "rewards/total_composite/mean": 0.26884764432907104, "rewards/total_composite/std": 0.13277824223041534, "reward": 0.26884764432907104, "reward_std": 0.13277824223041534, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21311388909816742, "sampling/sampling_logp_difference/max": 2.26963472366333, "sampling/importance_sampling_ratio/min": 0.10334992408752441, "sampling/importance_sampling_ratio/mean": 1.0090792179107666, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5345431864261627, "clip_ratio/low_mean": 0.06731525808572769, "clip_ratio/low_min": 0.06731525808572769, "clip_ratio/high_mean": 0.12313556112349033, "clip_ratio/high_max": 0.12313556112349033, "clip_ratio/region_mean": 0.19045081920921803, "reward_total_mean": 0.26884764432907104, "reward_meter_mean": 0.8204764127731323, "reward_meter_std": 0.22252389788627625, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9235402345657349, "reward_repeat_penalty_std": 0.0735095664858818, "reward_repeat_floor_mean": 0.9913394451141357, "reward_repeat_floor_std": 0.007823782041668892, "reward_near_duplicate_penalty_mean": 0.970642626285553, "reward_near_duplicate_penalty_std": 0.02177763730287552, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.957909345626831, "reward_distinct_2_std": 0.05162857845425606, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.26884764432907104, "reward_total_composite_std": 0.13277824223041534} {"timestamp_utc": "2026-04-12T17:00:48Z", "mode": "train", "global_step": 292, "epoch": 0.015367612230935215, "loss": 0.0966, "grad_norm": 5.87149715423584, "learning_rate": 9.118181818181819e-06, "num_tokens": 547735.0, "completions/mean_length": 290.25, "completions/min_length": 245.0, "completions/max_length": 337.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 290.25, "completions/min_terminated_length": 245.0, "completions/max_terminated_length": 337.0, "rewards/meter/mean": 0.7545753717422485, "rewards/meter/std": 0.25584375858306885, "rewards/count_adherence/mean": 0.8392857313156128, "rewards/count_adherence/std": 0.06331465393304825, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.951785683631897, "rewards/count_floor/std": 0.018994387239217758, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.35874998569488525, "rewards/judge_quality/std": 0.1797965168952942, "rewards/repeat_penalty/mean": 0.5786294937133789, "rewards/repeat_penalty/std": 0.365617036819458, "rewards/repeat_floor/mean": 0.9374609589576721, "rewards/repeat_floor/std": 0.08615387231111526, "rewards/near_duplicate_penalty/mean": 0.8657467365264893, "rewards/near_duplicate_penalty/std": 0.26059040427207947, "rewards/opening_diversity/mean": 0.880859375, "rewards/opening_diversity/std": 0.33698058128356934, "rewards/distinct_2/mean": 0.608304500579834, "rewards/distinct_2/std": 0.36024758219718933, "rewards/total_composite/mean": 0.25096577405929565, "rewards/total_composite/std": 0.16703999042510986, "reward": 0.25096577405929565, "reward_std": 0.16703997552394867, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16984857618808746, "sampling/sampling_logp_difference/max": 2.166409492492676, "sampling/importance_sampling_ratio/min": 0.11458830535411835, "sampling/importance_sampling_ratio/mean": 1.0080246925354004, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3792203925549984, "clip_ratio/low_mean": 0.0506894551217556, "clip_ratio/low_min": 0.0506894551217556, "clip_ratio/high_mean": 0.10293518006801605, "clip_ratio/high_max": 0.10293518006801605, "clip_ratio/region_mean": 0.15362463518977165, "reward_total_mean": 0.25096577405929565, "reward_meter_mean": 0.7545753717422485, "reward_meter_std": 0.25584375858306885, "reward_count_adherence_mean": 0.8392857313156128, "reward_count_adherence_std": 0.06331465393304825, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.951785683631897, "reward_count_floor_std": 0.018994387239217758, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5786294937133789, "reward_repeat_penalty_std": 0.365617036819458, "reward_repeat_floor_mean": 0.9374609589576721, "reward_repeat_floor_std": 0.08615387231111526, "reward_near_duplicate_penalty_mean": 0.8657467365264893, "reward_near_duplicate_penalty_std": 0.26059040427207947, "reward_opening_diversity_mean": 0.880859375, "reward_opening_diversity_std": 0.33698058128356934, "reward_distinct_2_mean": 0.608304500579834, "reward_distinct_2_std": 0.36024758219718933, "reward_judge_quality_mean": 0.35874998569488525, "reward_judge_quality_std": 0.1797965168952942, "reward_total_composite_mean": 0.25096577405929565, "reward_total_composite_std": 0.16703999042510986} {"timestamp_utc": "2026-04-12T17:00:58Z", "mode": "train", "global_step": 293, "epoch": 0.015420241039945265, "loss": 0.0856, "grad_norm": 13.421359062194824, "learning_rate": 9.115151515151516e-06, "num_tokens": 549806.0, "completions/mean_length": 69.875, "completions/min_length": 55.0, "completions/max_length": 80.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 69.875, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.5824167728424072, "rewards/meter/std": 0.3231014311313629, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.9687185883522034, "rewards/repeat_penalty/std": 0.02509327046573162, "rewards/repeat_floor/mean": 0.9962530136108398, "rewards/repeat_floor/std": 0.0025091669522225857, "rewards/near_duplicate_penalty/mean": 0.9849103689193726, "rewards/near_duplicate_penalty/std": 0.005877811461687088, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9835164546966553, "rewards/distinct_2/std": 0.022749414667487144, "rewards/total_composite/mean": 0.2556416094303131, "rewards/total_composite/std": 0.12598897516727448, "reward": 0.2556416094303131, "reward_std": 0.12598896026611328, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19969646632671356, "sampling/sampling_logp_difference/max": 2.7699227333068848, "sampling/importance_sampling_ratio/min": 0.06266684830188751, "sampling/importance_sampling_ratio/mean": 1.011916995048523, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4582985788583755, "clip_ratio/low_mean": 0.08662841096520424, "clip_ratio/low_min": 0.08662841096520424, "clip_ratio/high_mean": 0.09717698208987713, "clip_ratio/high_max": 0.09717698208987713, "clip_ratio/region_mean": 0.18380539305508137, "reward_total_mean": 0.2556416094303131, "reward_meter_mean": 0.5824167728424072, "reward_meter_std": 0.3231014311313629, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9687185883522034, "reward_repeat_penalty_std": 0.02509327046573162, "reward_repeat_floor_mean": 0.9962530136108398, "reward_repeat_floor_std": 0.0025091669522225857, "reward_near_duplicate_penalty_mean": 0.9849103689193726, "reward_near_duplicate_penalty_std": 0.005877811461687088, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9835164546966553, "reward_distinct_2_std": 0.022749414667487144, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.2556416094303131, "reward_total_composite_std": 0.12598897516727448} {"timestamp_utc": "2026-04-12T17:01:07Z", "mode": "train", "global_step": 294, "epoch": 0.015472869848955318, "loss": 0.27, "grad_norm": 10.469935417175293, "learning_rate": 9.112121212121214e-06, "num_tokens": 551551.0, "completions/mean_length": 68.125, "completions/min_length": 43.0, "completions/max_length": 152.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 68.125, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 152.0, "rewards/meter/mean": 0.4667671322822571, "rewards/meter/std": 0.3156149685382843, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9322812557220459, "rewards/lexical_plausibility/std": 0.16771572828292847, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.942449688911438, "rewards/repeat_penalty/std": 0.13447071611881256, "rewards/repeat_floor/mean": 0.9921880960464478, "rewards/repeat_floor/std": 0.01786406897008419, "rewards/near_duplicate_penalty/mean": 0.9650149345397949, "rewards/near_duplicate_penalty/std": 0.07132438570261002, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9715099334716797, "rewards/distinct_2/std": 0.08058197051286697, "rewards/total_composite/mean": 0.17989294230937958, "rewards/total_composite/std": 0.13754160702228546, "reward": 0.17989294230937958, "reward_std": 0.13754160702228546, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19069939851760864, "sampling/sampling_logp_difference/max": 1.7069435119628906, "sampling/importance_sampling_ratio/min": 0.18141944706439972, "sampling/importance_sampling_ratio/mean": 1.0364320278167725, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1089000403881073, "clip_ratio/low_mean": 0.10851164069026709, "clip_ratio/low_min": 0.10851164069026709, "clip_ratio/high_mean": 0.06903649494051933, "clip_ratio/high_max": 0.06903649494051933, "clip_ratio/region_mean": 0.17754813563078642, "reward_total_mean": 0.17989294230937958, "reward_meter_mean": 0.4667671322822571, "reward_meter_std": 0.3156149685382843, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9322812557220459, "reward_lexical_plausibility_std": 0.16771572828292847, "reward_repeat_penalty_mean": 0.942449688911438, "reward_repeat_penalty_std": 0.13447071611881256, "reward_repeat_floor_mean": 0.9921880960464478, "reward_repeat_floor_std": 0.01786406897008419, "reward_near_duplicate_penalty_mean": 0.9650149345397949, "reward_near_duplicate_penalty_std": 0.07132438570261002, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9715099334716797, "reward_distinct_2_std": 0.08058197051286697, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.17989294230937958, "reward_total_composite_std": 0.13754160702228546} {"timestamp_utc": "2026-04-12T17:01:18Z", "mode": "train", "global_step": 295, "epoch": 0.01552549865796537, "loss": 0.0718, "grad_norm": 8.419734001159668, "learning_rate": 9.10909090909091e-06, "num_tokens": 554948.0, "completions/mean_length": 230.625, "completions/min_length": 186.0, "completions/max_length": 267.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 230.625, "completions/min_terminated_length": 186.0, "completions/max_terminated_length": 267.0, "rewards/meter/mean": 0.6822469234466553, "rewards/meter/std": 0.26969632506370544, "rewards/count_adherence/mean": 0.8229166269302368, "rewards/count_adherence/std": 0.05340583249926567, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9468749761581421, "rewards/count_floor/std": 0.01602174900472164, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.49954450130462646, "rewards/repeat_penalty/std": 0.3762837052345276, "rewards/repeat_floor/mean": 0.9458256959915161, "rewards/repeat_floor/std": 0.04378613457083702, "rewards/near_duplicate_penalty/mean": 0.9092711210250854, "rewards/near_duplicate_penalty/std": 0.07800742983818054, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.5492782592773438, "rewards/distinct_2/std": 0.3753294348716736, "rewards/total_composite/mean": 0.0907188206911087, "rewards/total_composite/std": 0.03504229336977005, "reward": 0.0907188206911087, "reward_std": 0.03504229336977005, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17964164912700653, "sampling/sampling_logp_difference/max": 2.6832141876220703, "sampling/importance_sampling_ratio/min": 0.0683431327342987, "sampling/importance_sampling_ratio/mean": 1.016755223274231, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.636583685874939, "clip_ratio/low_mean": 0.044303144328296185, "clip_ratio/low_min": 0.044303144328296185, "clip_ratio/high_mean": 0.11310102976858616, "clip_ratio/high_max": 0.11310102976858616, "clip_ratio/region_mean": 0.15740417409688234, "reward_total_mean": 0.0907188206911087, "reward_meter_mean": 0.6822469234466553, "reward_meter_std": 0.26969632506370544, "reward_count_adherence_mean": 0.8229166269302368, "reward_count_adherence_std": 0.05340583249926567, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9468749761581421, "reward_count_floor_std": 0.01602174900472164, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.49954450130462646, "reward_repeat_penalty_std": 0.3762837052345276, "reward_repeat_floor_mean": 0.9458256959915161, "reward_repeat_floor_std": 0.04378613457083702, "reward_near_duplicate_penalty_mean": 0.9092711210250854, "reward_near_duplicate_penalty_std": 0.07800742983818054, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.5492782592773438, "reward_distinct_2_std": 0.3753294348716736, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.0907188206911087, "reward_total_composite_std": 0.03504229336977005} {"timestamp_utc": "2026-04-12T17:01:27Z", "mode": "train", "global_step": 296, "epoch": 0.015578127466975423, "loss": 0.0595, "grad_norm": 20.325502395629883, "learning_rate": 9.106060606060606e-06, "num_tokens": 556612.0, "completions/mean_length": 37.0, "completions/min_length": 31.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.6823065280914307, "rewards/meter/std": 0.3554304838180542, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47499996423721313, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.9453717470169067, "rewards/repeat_penalty/std": 0.12018889933824539, "rewards/repeat_floor/mean": 0.9951096773147583, "rewards/repeat_floor/std": 0.010345329530537128, "rewards/near_duplicate_penalty/mean": 0.9914365410804749, "rewards/near_duplicate_penalty/std": 0.017113231122493744, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.03560846298933029, "rewards/total_composite/mean": 0.33624467253685, "rewards/total_composite/std": 0.21759910881519318, "reward": 0.33624467253685, "reward_std": 0.21759910881519318, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17693468928337097, "sampling/sampling_logp_difference/max": 1.5612378120422363, "sampling/importance_sampling_ratio/min": 0.20987612009048462, "sampling/importance_sampling_ratio/mean": 1.0141507387161255, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.406125545501709, "clip_ratio/low_mean": 0.060963901691138744, "clip_ratio/low_min": 0.060963901691138744, "clip_ratio/high_mean": 0.1305535202845931, "clip_ratio/high_max": 0.1305535202845931, "clip_ratio/region_mean": 0.19151742197573185, "reward_total_mean": 0.33624467253685, "reward_meter_mean": 0.6823065280914307, "reward_meter_std": 0.3554304838180542, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9453717470169067, "reward_repeat_penalty_std": 0.12018889933824539, "reward_repeat_floor_mean": 0.9951096773147583, "reward_repeat_floor_std": 0.010345329530537128, "reward_near_duplicate_penalty_mean": 0.9914365410804749, "reward_near_duplicate_penalty_std": 0.017113231122493744, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.03560846298933029, "reward_judge_quality_mean": 0.47499996423721313, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.33624467253685, "reward_total_composite_std": 0.21759910881519318} {"timestamp_utc": "2026-04-12T17:01:36Z", "mode": "train", "global_step": 297, "epoch": 0.015630756275985473, "loss": 0.1529, "grad_norm": 18.864351272583008, "learning_rate": 9.103030303030304e-06, "num_tokens": 558371.0, "completions/mean_length": 53.875, "completions/min_length": 22.0, "completions/max_length": 75.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.875, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.6778982877731323, "rewards/meter/std": 0.3530502915382385, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.24800792336463928, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.07440238445997238, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.8519001007080078, "rewards/repeat_penalty/std": 0.17187410593032837, "rewards/repeat_floor/mean": 0.9848721027374268, "rewards/repeat_floor/std": 0.017985185608267784, "rewards/near_duplicate_penalty/mean": 0.9594448804855347, "rewards/near_duplicate_penalty/std": 0.04639763757586479, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.941170871257782, "rewards/distinct_2/std": 0.09881649166345596, "rewards/total_composite/mean": 0.25974708795547485, "rewards/total_composite/std": 0.11362625658512115, "reward": 0.25974708795547485, "reward_std": 0.11362624913454056, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17619004845619202, "sampling/sampling_logp_difference/max": 1.391514778137207, "sampling/importance_sampling_ratio/min": 0.27641117572784424, "sampling/importance_sampling_ratio/mean": 1.0293015241622925, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2970117777585983, "clip_ratio/low_mean": 0.059519230388104916, "clip_ratio/low_min": 0.059519230388104916, "clip_ratio/high_mean": 0.086685910820961, "clip_ratio/high_max": 0.086685910820961, "clip_ratio/region_mean": 0.14620514120906591, "reward_total_mean": 0.25974708795547485, "reward_meter_mean": 0.6778982877731323, "reward_meter_std": 0.3530502915382385, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.24800792336463928, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.07440238445997238, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8519001007080078, "reward_repeat_penalty_std": 0.17187410593032837, "reward_repeat_floor_mean": 0.9848721027374268, "reward_repeat_floor_std": 0.017985185608267784, "reward_near_duplicate_penalty_mean": 0.9594448804855347, "reward_near_duplicate_penalty_std": 0.04639763757586479, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.941170871257782, "reward_distinct_2_std": 0.09881649166345596, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.25974708795547485, "reward_total_composite_std": 0.11362625658512115} {"timestamp_utc": "2026-04-12T17:01:44Z", "mode": "train", "global_step": 298, "epoch": 0.015683385084995526, "loss": 0.1765, "grad_norm": 16.459354400634766, "learning_rate": 9.100000000000001e-06, "num_tokens": 559888.0, "completions/mean_length": 36.625, "completions/min_length": 28.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.625, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.3188633918762207, "rewards/meter/std": 0.39131543040275574, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9864082336425781, "rewards/lexical_plausibility/std": 0.0384434312582016, "rewards/judge_quality/mean": 0.42500001192092896, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.9565424919128418, "rewards/repeat_penalty/std": 0.08799579739570618, "rewards/repeat_floor/mean": 0.9944190979003906, "rewards/repeat_floor/std": 0.010565795004367828, "rewards/near_duplicate_penalty/mean": 0.9756143093109131, "rewards/near_duplicate_penalty/std": 0.03482674062252045, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.14072012901306152, "rewards/total_composite/std": 0.17767742276191711, "reward": 0.14072012901306152, "reward_std": 0.17767740786075592, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22021010518074036, "sampling/sampling_logp_difference/max": 1.7613716125488281, "sampling/importance_sampling_ratio/min": 0.17180904746055603, "sampling/importance_sampling_ratio/mean": 1.0427734851837158, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9960065633058548, "clip_ratio/low_mean": 0.155930295586586, "clip_ratio/low_min": 0.155930295586586, "clip_ratio/high_mean": 0.05565476417541504, "clip_ratio/high_max": 0.05565476417541504, "clip_ratio/region_mean": 0.21158505976200104, "reward_total_mean": 0.14072012901306152, "reward_meter_mean": 0.3188633918762207, "reward_meter_std": 0.39131543040275574, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9864082336425781, "reward_lexical_plausibility_std": 0.0384434312582016, "reward_repeat_penalty_mean": 0.9565424919128418, "reward_repeat_penalty_std": 0.08799579739570618, "reward_repeat_floor_mean": 0.9944190979003906, "reward_repeat_floor_std": 0.010565795004367828, "reward_near_duplicate_penalty_mean": 0.9756143093109131, "reward_near_duplicate_penalty_std": 0.03482674062252045, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.42500001192092896, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.14072012901306152, "reward_total_composite_std": 0.17767742276191711} {"timestamp_utc": "2026-04-12T17:01:53Z", "mode": "train", "global_step": 299, "epoch": 0.015736013894005578, "loss": -0.0105, "grad_norm": 22.123252868652344, "learning_rate": 9.096969696969698e-06, "num_tokens": 561547.0, "completions/mean_length": 40.375, "completions/min_length": 32.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.375, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.8137967586517334, "rewards/meter/std": 0.3468204438686371, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.685253381729126, "rewards/repeat_penalty/std": 0.23621059954166412, "rewards/repeat_floor/mean": 0.9616619944572449, "rewards/repeat_floor/std": 0.029687771573662758, "rewards/near_duplicate_penalty/mean": 0.872746467590332, "rewards/near_duplicate_penalty/std": 0.0836421325802803, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.8694448471069336, "rewards/distinct_2/std": 0.14027510583400726, "rewards/total_composite/mean": 0.3305690884590149, "rewards/total_composite/std": 0.1938231736421585, "reward": 0.3305690884590149, "reward_std": 0.19382315874099731, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.188039630651474, "sampling/sampling_logp_difference/max": 1.361454963684082, "sampling/importance_sampling_ratio/min": 0.2562876045703888, "sampling/importance_sampling_ratio/mean": 1.0174654722213745, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6063385754823685, "clip_ratio/low_mean": 0.04625741112977266, "clip_ratio/low_min": 0.04625741112977266, "clip_ratio/high_mean": 0.11450192146003246, "clip_ratio/high_max": 0.11450192146003246, "clip_ratio/region_mean": 0.16075933258980513, "reward_total_mean": 0.3305690884590149, "reward_meter_mean": 0.8137967586517334, "reward_meter_std": 0.3468204438686371, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.685253381729126, "reward_repeat_penalty_std": 0.23621059954166412, "reward_repeat_floor_mean": 0.9616619944572449, "reward_repeat_floor_std": 0.029687771573662758, "reward_near_duplicate_penalty_mean": 0.872746467590332, "reward_near_duplicate_penalty_std": 0.0836421325802803, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.8694448471069336, "reward_distinct_2_std": 0.14027510583400726, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.3305690884590149, "reward_total_composite_std": 0.1938231736421585} {"timestamp_utc": "2026-04-12T17:02:03Z", "mode": "train", "global_step": 300, "epoch": 0.01578864270301563, "loss": 0.1294, "grad_norm": 10.732985496520996, "learning_rate": 9.093939393939395e-06, "num_tokens": 563829.0, "completions/mean_length": 102.25, "completions/min_length": 87.0, "completions/max_length": 128.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 102.25, "completions/min_terminated_length": 87.0, "completions/max_terminated_length": 128.0, "rewards/meter/mean": 0.9553652405738831, "rewards/meter/std": 0.062410105019807816, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9925000071525574, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.9989224076271057, "rewards/lexical_plausibility/std": 0.0030478707049041986, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.6932989358901978, "rewards/repeat_penalty/std": 0.2703261375427246, "rewards/repeat_floor/mean": 0.9686387777328491, "rewards/repeat_floor/std": 0.02692396752536297, "rewards/near_duplicate_penalty/mean": 0.9303176999092102, "rewards/near_duplicate_penalty/std": 0.053814664483070374, "rewards/opening_diversity/mean": 0.956250011920929, "rewards/opening_diversity/std": 0.09038607776165009, "rewards/distinct_2/mean": 0.7968460321426392, "rewards/distinct_2/std": 0.17083317041397095, "rewards/total_composite/mean": 0.31033384799957275, "rewards/total_composite/std": 0.09578508138656616, "reward": 0.31033384799957275, "reward_std": 0.09578507393598557, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1884276568889618, "sampling/sampling_logp_difference/max": 1.5811958312988281, "sampling/importance_sampling_ratio/min": 0.2057289183139801, "sampling/importance_sampling_ratio/mean": 1.0302212238311768, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8757694959640503, "clip_ratio/low_mean": 0.04108297452330589, "clip_ratio/low_min": 0.04108297452330589, "clip_ratio/high_mean": 0.10998972225934267, "clip_ratio/high_max": 0.10998972225934267, "clip_ratio/region_mean": 0.15107269678264856, "reward_total_mean": 0.31033384799957275, "reward_meter_mean": 0.9553652405738831, "reward_meter_std": 0.062410105019807816, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9925000071525574, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.9989224076271057, "reward_lexical_plausibility_std": 0.0030478707049041986, "reward_repeat_penalty_mean": 0.6932989358901978, "reward_repeat_penalty_std": 0.2703261375427246, "reward_repeat_floor_mean": 0.9686387777328491, "reward_repeat_floor_std": 0.02692396752536297, "reward_near_duplicate_penalty_mean": 0.9303176999092102, "reward_near_duplicate_penalty_std": 0.053814664483070374, "reward_opening_diversity_mean": 0.956250011920929, "reward_opening_diversity_std": 0.09038607776165009, "reward_distinct_2_mean": 0.7968460321426392, "reward_distinct_2_std": 0.17083317041397095, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.31033384799957275, "reward_total_composite_std": 0.09578508138656616} {"timestamp_utc": "2026-04-12T17:04:15Z", "mode": "eval", "global_step": 300, "epoch": 0.01578864270301563, "eval_loss": NaN, "eval_runtime": 131.8575, "eval_samples_per_second": 0.789, "eval_steps_per_second": 0.099, "eval_num_tokens": 563829.0, "eval_completions/mean_length": 162.1346153846154, "eval_completions/min_length": 34.0, "eval_completions/max_length": 393.46153846153845, "eval_completions/clipped_ratio": 0.07692307692307693, "eval_completions/mean_terminated_length": 132.56273181621845, "eval_completions/min_terminated_length": 34.0, "eval_completions/max_terminated_length": 286.38461538461536, "eval_rewards/meter/mean": 0.5356990442826197, "eval_rewards/meter/std": 0.3575832729156201, "eval_rewards/count_adherence/mean": 0.8707482906488272, "eval_rewards/count_adherence/std": 0.149359007867483, "eval_rewards/arabic_clean/mean": 0.8173076923076923, "eval_rewards/arabic_clean/std": 0.3392545282840729, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9971153827813956, "eval_rewards/arabic_floor/std": 0.00534126850274893, "eval_rewards/count_floor/mean": 0.9612244780247028, "eval_rewards/count_floor/std": 0.044807702159652345, "eval_rewards/lexical_plausibility/mean": 0.9745920758980972, "eval_rewards/lexical_plausibility/std": 0.05579023715108633, "eval_rewards/judge_quality/mean": 0.3935576814871568, "eval_rewards/judge_quality/std": 0.2108941158423057, "eval_rewards/repeat_penalty/mean": 0.8596907533132113, "eval_rewards/repeat_penalty/std": 0.20423086933218515, "eval_rewards/repeat_floor/mean": 0.9841216344099778, "eval_rewards/repeat_floor/std": 0.025210401222396355, "eval_rewards/near_duplicate_penalty/mean": 0.9630640974411597, "eval_rewards/near_duplicate_penalty/std": 0.05644430162814947, "eval_rewards/opening_diversity/mean": 0.9803355702987084, "eval_rewards/opening_diversity/std": 0.0391376565855283, "eval_rewards/distinct_2/mean": 0.8982431384233328, "eval_rewards/distinct_2/std": 0.17889117420865938, "eval_rewards/total_composite/mean": 0.19682092506151933, "eval_rewards/total_composite/std": 0.19787883586608446, "eval_reward": 0.19682092506151933, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.12074239552021027, "eval_sampling/sampling_logp_difference/max": 1.240494728088379, "eval_sampling/importance_sampling_ratio/min": 0.2920835820528177, "eval_sampling/importance_sampling_ratio/mean": 1.0341917826579168, "eval_sampling/importance_sampling_ratio/max": 1.6474675215207613, "eval_entropy": 1.6511328403766339, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.19682092506151933, "eval_reward_meter_mean": 0.5356990442826197, "eval_reward_meter_std": 0.3575832729156201, "eval_reward_count_adherence_mean": 0.8707482906488272, "eval_reward_count_adherence_std": 0.149359007867483, "eval_reward_arabic_clean_mean": 0.8173076923076923, "eval_reward_arabic_clean_std": 0.3392545282840729, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9971153827813956, "eval_reward_arabic_floor_std": 0.00534126850274893, "eval_reward_count_floor_mean": 0.9612244780247028, "eval_reward_count_floor_std": 0.044807702159652345, "eval_reward_lexical_plausibility_mean": 0.9745920758980972, "eval_reward_lexical_plausibility_std": 0.05579023715108633, "eval_reward_repeat_penalty_mean": 0.8596907533132113, "eval_reward_repeat_penalty_std": 0.20423086933218515, "eval_reward_repeat_floor_mean": 0.9841216344099778, "eval_reward_repeat_floor_std": 0.025210401222396355, "eval_reward_near_duplicate_penalty_mean": 0.9630640974411597, "eval_reward_near_duplicate_penalty_std": 0.05644430162814947, "eval_reward_opening_diversity_mean": 0.9803355702987084, "eval_reward_opening_diversity_std": 0.0391376565855283, "eval_reward_distinct_2_mean": 0.8982431384233328, "eval_reward_distinct_2_std": 0.17889117420865938, "eval_reward_judge_quality_mean": 0.3935576814871568, "eval_reward_judge_quality_std": 0.2108941158423057, "eval_reward_total_composite_mean": 0.19682092506151933, "eval_reward_total_composite_std": 0.19787883586608446} {"timestamp_utc": "2026-04-12T17:04:26Z", "mode": "train", "global_step": 301, "epoch": 0.015841271512025683, "loss": -0.0099, "grad_norm": 14.73071002960205, "learning_rate": 9.090909090909091e-06, "num_tokens": 565447.0, "completions/mean_length": 31.25, "completions/min_length": 27.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.25, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.9344687461853027, "rewards/meter/std": 0.14397835731506348, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.528749942779541, "rewards/judge_quality/std": 0.18333712220191956, "rewards/repeat_penalty/mean": 0.9480298757553101, "rewards/repeat_penalty/std": 0.02693019062280655, "rewards/repeat_floor/mean": 0.9922044277191162, "rewards/repeat_floor/std": 0.00403952831402421, "rewards/near_duplicate_penalty/mean": 0.9480298757553101, "rewards/near_duplicate_penalty/std": 0.02693019062280655, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5002779960632324, "rewards/total_composite/std": 0.2085338681936264, "reward": 0.5002779960632324, "reward_std": 0.2085338681936264, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14948254823684692, "sampling/sampling_logp_difference/max": 1.0367588996887207, "sampling/importance_sampling_ratio/min": 0.3546021282672882, "sampling/importance_sampling_ratio/mean": 1.0220539569854736, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9874745160341263, "clip_ratio/low_mean": 0.0835039522498846, "clip_ratio/low_min": 0.0835039522498846, "clip_ratio/high_mean": 0.02812500041909516, "clip_ratio/high_max": 0.02812500041909516, "clip_ratio/region_mean": 0.11162895266897976, "reward_total_mean": 0.5002779960632324, "reward_meter_mean": 0.9344687461853027, "reward_meter_std": 0.14397835731506348, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9480298757553101, "reward_repeat_penalty_std": 0.02693019062280655, "reward_repeat_floor_mean": 0.9922044277191162, "reward_repeat_floor_std": 0.00403952831402421, "reward_near_duplicate_penalty_mean": 0.9480298757553101, "reward_near_duplicate_penalty_std": 0.02693019062280655, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.528749942779541, "reward_judge_quality_std": 0.18333712220191956, "reward_total_composite_mean": 0.5002779960632324, "reward_total_composite_std": 0.2085338681936264} {"timestamp_utc": "2026-04-12T17:04:33Z", "mode": "train", "global_step": 302, "epoch": 0.015893900321035735, "loss": 0.0162, "grad_norm": 20.9350643157959, "learning_rate": 9.087878787878788e-06, "num_tokens": 566780.0, "completions/mean_length": 17.625, "completions/min_length": 15.0, "completions/max_length": 19.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.625, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 19.0, "rewards/meter/mean": 0.9744971990585327, "rewards/meter/std": 0.03883900120854378, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6812500357627869, "rewards/judge_quality/std": 0.33523714542388916, "rewards/repeat_penalty/mean": 0.7469173073768616, "rewards/repeat_penalty/std": 0.00871915090829134, "rewards/repeat_floor/mean": 0.9843834638595581, "rewards/repeat_floor/std": 0.0017438469221815467, "rewards/near_duplicate_penalty/mean": 0.9958897829055786, "rewards/near_duplicate_penalty/std": 0.011625555343925953, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6600235104560852, "rewards/total_composite/std": 0.32864198088645935, "reward": 0.6600235104560852, "reward_std": 0.32864195108413696, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16773949563503265, "sampling/sampling_logp_difference/max": 1.3249053955078125, "sampling/importance_sampling_ratio/min": 0.26582810282707214, "sampling/importance_sampling_ratio/mean": 1.074419379234314, "sampling/importance_sampling_ratio/max": 1.939653992652893, "entropy": 1.5273366421461105, "clip_ratio/low_mean": 0.09027777845039964, "clip_ratio/low_min": 0.09027777845039964, "clip_ratio/high_mean": 0.08864217903465033, "clip_ratio/high_max": 0.08864217903465033, "clip_ratio/region_mean": 0.17891995748504996, "reward_total_mean": 0.6600235104560852, "reward_meter_mean": 0.9744971990585327, "reward_meter_std": 0.03883900120854378, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7469173073768616, "reward_repeat_penalty_std": 0.00871915090829134, "reward_repeat_floor_mean": 0.9843834638595581, "reward_repeat_floor_std": 0.0017438469221815467, "reward_near_duplicate_penalty_mean": 0.9958897829055786, "reward_near_duplicate_penalty_std": 0.011625555343925953, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6812500357627869, "reward_judge_quality_std": 0.33523714542388916, "reward_total_composite_mean": 0.6600235104560852, "reward_total_composite_std": 0.32864198088645935} {"timestamp_utc": "2026-04-12T17:04:40Z", "mode": "train", "global_step": 303, "epoch": 0.015946529130045788, "loss": -0.016, "grad_norm": 22.582056045532227, "learning_rate": 9.084848484848486e-06, "num_tokens": 568200.0, "completions/mean_length": 19.5, "completions/min_length": 16.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.5, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.8606141209602356, "rewards/meter/std": 0.3475630581378937, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7275000214576721, "rewards/judge_quality/std": 0.3564407229423523, "rewards/repeat_penalty/mean": 0.692996621131897, "rewards/repeat_penalty/std": 0.14628127217292786, "rewards/repeat_floor/mean": 0.9733902215957642, "rewards/repeat_floor/std": 0.029845232143998146, "rewards/near_duplicate_penalty/mean": 0.9354219436645508, "rewards/near_duplicate_penalty/std": 0.1628876030445099, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.5908148288726807, "rewards/total_composite/std": 0.4106263220310211, "reward": 0.5908148288726807, "reward_std": 0.4106263220310211, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19459471106529236, "sampling/sampling_logp_difference/max": 1.9386756420135498, "sampling/importance_sampling_ratio/min": 0.14389438927173615, "sampling/importance_sampling_ratio/mean": 0.9892681837081909, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3566118329763412, "clip_ratio/low_mean": 0.0390625, "clip_ratio/low_min": 0.0390625, "clip_ratio/high_mean": 0.09017220605164766, "clip_ratio/high_max": 0.09017220605164766, "clip_ratio/region_mean": 0.12923470605164766, "reward_total_mean": 0.5908148288726807, "reward_meter_mean": 0.8606141209602356, "reward_meter_std": 0.3475630581378937, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.692996621131897, "reward_repeat_penalty_std": 0.14628127217292786, "reward_repeat_floor_mean": 0.9733902215957642, "reward_repeat_floor_std": 0.029845232143998146, "reward_near_duplicate_penalty_mean": 0.9354219436645508, "reward_near_duplicate_penalty_std": 0.1628876030445099, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.7275000214576721, "reward_judge_quality_std": 0.3564407229423523, "reward_total_composite_mean": 0.5908148288726807, "reward_total_composite_std": 0.4106263220310211} {"timestamp_utc": "2026-04-12T17:04:52Z", "mode": "train", "global_step": 304, "epoch": 0.01599915793905584, "loss": -0.074, "grad_norm": 9.789715766906738, "learning_rate": 9.081818181818183e-06, "num_tokens": 571499.0, "completions/mean_length": 197.375, "completions/min_length": 13.0, "completions/max_length": 268.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 197.375, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 268.0, "rewards/meter/mean": 0.621332049369812, "rewards/meter/std": 0.2757330536842346, "rewards/count_adherence/mean": 0.6538461446762085, "rewards/count_adherence/std": 0.2501056492328644, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.8961538672447205, "rewards/count_floor/std": 0.07503168284893036, "rewards/lexical_plausibility/mean": 0.9904966354370117, "rewards/lexical_plausibility/std": 0.02687946893274784, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1505940556526184, "rewards/repeat_penalty/mean": 0.8952893018722534, "rewards/repeat_penalty/std": 0.0984295904636383, "rewards/repeat_floor/mean": 0.9903676509857178, "rewards/repeat_floor/std": 0.007681592833250761, "rewards/near_duplicate_penalty/mean": 0.9749888777732849, "rewards/near_duplicate_penalty/std": 0.018389739096164703, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9554927349090576, "rewards/distinct_2/std": 0.04836355149745941, "rewards/total_composite/mean": 0.15165047347545624, "rewards/total_composite/std": 0.12145166099071503, "reward": 0.15165047347545624, "reward_std": 0.12145166099071503, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2635415494441986, "sampling/sampling_logp_difference/max": 2.6532626152038574, "sampling/importance_sampling_ratio/min": 0.07042107731103897, "sampling/importance_sampling_ratio/mean": 0.990336537361145, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.568487524986267, "clip_ratio/low_mean": 0.12380932085216045, "clip_ratio/low_min": 0.12380932085216045, "clip_ratio/high_mean": 0.12513156607747078, "clip_ratio/high_max": 0.12513156607747078, "clip_ratio/region_mean": 0.24894088692963123, "reward_total_mean": 0.15165047347545624, "reward_meter_mean": 0.621332049369812, "reward_meter_std": 0.2757330536842346, "reward_count_adherence_mean": 0.6538461446762085, "reward_count_adherence_std": 0.2501056492328644, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.8961538672447205, "reward_count_floor_std": 0.07503168284893036, "reward_lexical_plausibility_mean": 0.9904966354370117, "reward_lexical_plausibility_std": 0.02687946893274784, "reward_repeat_penalty_mean": 0.8952893018722534, "reward_repeat_penalty_std": 0.0984295904636383, "reward_repeat_floor_mean": 0.9903676509857178, "reward_repeat_floor_std": 0.007681592833250761, "reward_near_duplicate_penalty_mean": 0.9749888777732849, "reward_near_duplicate_penalty_std": 0.018389739096164703, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9554927349090576, "reward_distinct_2_std": 0.04836355149745941, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1505940556526184, "reward_total_composite_mean": 0.15165047347545624, "reward_total_composite_std": 0.12145166099071503} {"timestamp_utc": "2026-04-12T17:04:59Z", "mode": "train", "global_step": 305, "epoch": 0.016051786748065892, "loss": -0.0101, "grad_norm": 19.34548568725586, "learning_rate": 9.078787878787878e-06, "num_tokens": 572837.0, "completions/mean_length": 16.25, "completions/min_length": 16.0, "completions/max_length": 18.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.25, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 18.0, "rewards/meter/mean": 0.9452635645866394, "rewards/meter/std": 0.13600192964076996, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3462500274181366, "rewards/judge_quality/std": 0.3634728491306305, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2931850552558899, "rewards/total_composite/std": 0.2865670323371887, "reward": 0.2931850552558899, "reward_std": 0.2865670323371887, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.06238498538732529, "sampling/sampling_logp_difference/max": 0.9791786670684814, "sampling/importance_sampling_ratio/min": 0.375619500875473, "sampling/importance_sampling_ratio/mean": 1.0298633575439453, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4287057965993881, "clip_ratio/low_mean": 0.0390625, "clip_ratio/low_min": 0.0390625, "clip_ratio/high_mean": 0.0069444444961845875, "clip_ratio/high_max": 0.0069444444961845875, "clip_ratio/region_mean": 0.04600694449618459, "reward_total_mean": 0.2931850552558899, "reward_meter_mean": 0.9452635645866394, "reward_meter_std": 0.13600192964076996, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3462500274181366, "reward_judge_quality_std": 0.3634728491306305, "reward_total_composite_mean": 0.2931850552558899, "reward_total_composite_std": 0.2865670323371887} {"timestamp_utc": "2026-04-12T17:05:07Z", "mode": "train", "global_step": 306, "epoch": 0.016104415557075945, "loss": 0.0464, "grad_norm": 19.623510360717773, "learning_rate": 9.075757575757577e-06, "num_tokens": 574345.0, "completions/mean_length": 30.5, "completions/min_length": 26.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.5, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.9649000763893127, "rewards/meter/std": 0.03835184872150421, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.9624999761581421, "rewards/arabic_floor/std": 0.06943649053573608, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6424999833106995, "rewards/judge_quality/std": 0.27395257353782654, "rewards/repeat_penalty/mean": 0.9656938314437866, "rewards/repeat_penalty/std": 0.02919146418571472, "rewards/repeat_floor/mean": 0.9948540925979614, "rewards/repeat_floor/std": 0.004378714598715305, "rewards/near_duplicate_penalty/mean": 0.9656938314437866, "rewards/near_duplicate_penalty/std": 0.02919146418571472, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6089813709259033, "rewards/total_composite/std": 0.2839276194572449, "reward": 0.6089813709259033, "reward_std": 0.2839275896549225, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17152456939220428, "sampling/sampling_logp_difference/max": 1.2357168197631836, "sampling/importance_sampling_ratio/min": 0.2906263768672943, "sampling/importance_sampling_ratio/mean": 1.0257127285003662, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.151340663433075, "clip_ratio/low_mean": 0.07075957581400871, "clip_ratio/low_min": 0.07075957581400871, "clip_ratio/high_mean": 0.07881645485758781, "clip_ratio/high_max": 0.07881645485758781, "clip_ratio/region_mean": 0.14957603067159653, "reward_total_mean": 0.6089813709259033, "reward_meter_mean": 0.9649000763893127, "reward_meter_std": 0.03835184872150421, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.9624999761581421, "reward_arabic_floor_std": 0.06943649053573608, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9656938314437866, "reward_repeat_penalty_std": 0.02919146418571472, "reward_repeat_floor_mean": 0.9948540925979614, "reward_repeat_floor_std": 0.004378714598715305, "reward_near_duplicate_penalty_mean": 0.9656938314437866, "reward_near_duplicate_penalty_std": 0.02919146418571472, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6424999833106995, "reward_judge_quality_std": 0.27395257353782654, "reward_total_composite_mean": 0.6089813709259033, "reward_total_composite_std": 0.2839276194572449} {"timestamp_utc": "2026-04-12T17:05:16Z", "mode": "train", "global_step": 307, "epoch": 0.016157044366085997, "loss": -0.0074, "grad_norm": 15.526321411132812, "learning_rate": 9.072727272727273e-06, "num_tokens": 575903.0, "completions/mean_length": 42.75, "completions/min_length": 28.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.75, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.2503531873226166, "rewards/meter/std": 0.32325610518455505, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5837500095367432, "rewards/judge_quality/std": 0.2719736099243164, "rewards/repeat_penalty/mean": 0.9855555295944214, "rewards/repeat_penalty/std": 0.017932593822479248, "rewards/repeat_floor/mean": 0.9978333115577698, "rewards/repeat_floor/std": 0.002689896384254098, "rewards/near_duplicate_penalty/mean": 0.9855555295944214, "rewards/near_duplicate_penalty/std": 0.017932593822479248, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12381266057491302, "rewards/total_composite/std": 0.15705926716327667, "reward": 0.12381266057491302, "reward_std": 0.15705928206443787, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19509024918079376, "sampling/sampling_logp_difference/max": 1.6404211521148682, "sampling/importance_sampling_ratio/min": 0.237303227186203, "sampling/importance_sampling_ratio/mean": 1.0305685997009277, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5318706631660461, "clip_ratio/low_mean": 0.11107687465846539, "clip_ratio/low_min": 0.11107687465846539, "clip_ratio/high_mean": 0.05315170995891094, "clip_ratio/high_max": 0.05315170995891094, "clip_ratio/region_mean": 0.16422858461737633, "reward_total_mean": 0.12381266057491302, "reward_meter_mean": 0.2503531873226166, "reward_meter_std": 0.32325610518455505, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9855555295944214, "reward_repeat_penalty_std": 0.017932593822479248, "reward_repeat_floor_mean": 0.9978333115577698, "reward_repeat_floor_std": 0.002689896384254098, "reward_near_duplicate_penalty_mean": 0.9855555295944214, "reward_near_duplicate_penalty_std": 0.017932593822479248, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5837500095367432, "reward_judge_quality_std": 0.2719736099243164, "reward_total_composite_mean": 0.12381266057491302, "reward_total_composite_std": 0.15705926716327667} {"timestamp_utc": "2026-04-12T17:05:25Z", "mode": "train", "global_step": 308, "epoch": 0.016209673175096046, "loss": 0.001, "grad_norm": 15.640469551086426, "learning_rate": 9.06969696969697e-06, "num_tokens": 577647.0, "completions/mean_length": 40.0, "completions/min_length": 35.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.9640589952468872, "rewards/meter/std": 0.05266324058175087, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47499996423721313, "rewards/judge_quality/std": 0.1164964810013771, "rewards/repeat_penalty/mean": 0.9954004287719727, "rewards/repeat_penalty/std": 0.013009531423449516, "rewards/repeat_floor/mean": 0.9993100762367249, "rewards/repeat_floor/std": 0.0019514414016157389, "rewards/near_duplicate_penalty/mean": 0.9954004287719727, "rewards/near_duplicate_penalty/std": 0.013009531423449516, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4585379958152771, "rewards/total_composite/std": 0.12229236215353012, "reward": 0.4585379958152771, "reward_std": 0.12229236960411072, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1859753131866455, "sampling/sampling_logp_difference/max": 1.691523551940918, "sampling/importance_sampling_ratio/min": 0.18423861265182495, "sampling/importance_sampling_ratio/mean": 1.0469082593917847, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8675436079502106, "clip_ratio/low_mean": 0.1685184296220541, "clip_ratio/low_min": 0.1685184296220541, "clip_ratio/high_mean": 0.028846153989434242, "clip_ratio/high_max": 0.028846153989434242, "clip_ratio/region_mean": 0.19736458361148834, "reward_total_mean": 0.4585379958152771, "reward_meter_mean": 0.9640589952468872, "reward_meter_std": 0.05266324058175087, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9954004287719727, "reward_repeat_penalty_std": 0.013009531423449516, "reward_repeat_floor_mean": 0.9993100762367249, "reward_repeat_floor_std": 0.0019514414016157389, "reward_near_duplicate_penalty_mean": 0.9954004287719727, "reward_near_duplicate_penalty_std": 0.013009531423449516, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.47499996423721313, "reward_judge_quality_std": 0.1164964810013771, "reward_total_composite_mean": 0.4585379958152771, "reward_total_composite_std": 0.12229236215353012} {"timestamp_utc": "2026-04-12T17:05:35Z", "mode": "train", "global_step": 309, "epoch": 0.0162623019841061, "loss": -0.0282, "grad_norm": 7.242228031158447, "learning_rate": 9.066666666666667e-06, "num_tokens": 580498.0, "completions/mean_length": 172.375, "completions/min_length": 141.0, "completions/max_length": 205.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 172.375, "completions/min_terminated_length": 141.0, "completions/max_terminated_length": 205.0, "rewards/meter/mean": 0.49982455372810364, "rewards/meter/std": 0.3290709853172302, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.0927247703075409, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.9624999761581421, "rewards/arabic_floor/std": 0.06943649053573608, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.027817437425255775, "rewards/lexical_plausibility/mean": 0.9972826242446899, "rewards/lexical_plausibility/std": 0.007685941644012928, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.08864052593708038, "rewards/repeat_penalty/mean": 0.5439807772636414, "rewards/repeat_penalty/std": 0.33551767468452454, "rewards/repeat_floor/mean": 0.9450145363807678, "rewards/repeat_floor/std": 0.05226676166057587, "rewards/near_duplicate_penalty/mean": 0.8956697583198547, "rewards/near_duplicate_penalty/std": 0.12272150069475174, "rewards/opening_diversity/mean": 0.9176136255264282, "rewards/opening_diversity/std": 0.23302382230758667, "rewards/distinct_2/mean": 0.6178585290908813, "rewards/distinct_2/std": 0.28116124868392944, "rewards/total_composite/mean": 0.07592283189296722, "rewards/total_composite/std": 0.04808022081851959, "reward": 0.07592283189296722, "reward_std": 0.04808022454380989, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18043243885040283, "sampling/sampling_logp_difference/max": 1.9903476238250732, "sampling/importance_sampling_ratio/min": 0.13664790987968445, "sampling/importance_sampling_ratio/mean": 1.0302400588989258, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1103629022836685, "clip_ratio/low_mean": 0.08400345873087645, "clip_ratio/low_min": 0.08400345873087645, "clip_ratio/high_mean": 0.07768644392490387, "clip_ratio/high_max": 0.07768644392490387, "clip_ratio/region_mean": 0.16168990265578032, "reward_total_mean": 0.07592283189296722, "reward_meter_mean": 0.49982455372810364, "reward_meter_std": 0.3290709853172302, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.0927247703075409, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.9624999761581421, "reward_arabic_floor_std": 0.06943649053573608, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.027817437425255775, "reward_lexical_plausibility_mean": 0.9972826242446899, "reward_lexical_plausibility_std": 0.007685941644012928, "reward_repeat_penalty_mean": 0.5439807772636414, "reward_repeat_penalty_std": 0.33551767468452454, "reward_repeat_floor_mean": 0.9450145363807678, "reward_repeat_floor_std": 0.05226676166057587, "reward_near_duplicate_penalty_mean": 0.8956697583198547, "reward_near_duplicate_penalty_std": 0.12272150069475174, "reward_opening_diversity_mean": 0.9176136255264282, "reward_opening_diversity_std": 0.23302382230758667, "reward_distinct_2_mean": 0.6178585290908813, "reward_distinct_2_std": 0.28116124868392944, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.08864052593708038, "reward_total_composite_mean": 0.07592283189296722, "reward_total_composite_std": 0.04808022081851959} {"timestamp_utc": "2026-04-12T17:05:43Z", "mode": "train", "global_step": 310, "epoch": 0.01631493079311615, "loss": 0.011, "grad_norm": 19.942989349365234, "learning_rate": 9.063636363636365e-06, "num_tokens": 581819.0, "completions/mean_length": 15.125, "completions/min_length": 14.0, "completions/max_length": 17.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 15.125, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 17.0, "rewards/meter/mean": 0.9323422908782959, "rewards/meter/std": 0.11280333995819092, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8650000095367432, "rewards/judge_quality/std": 0.16801361739635468, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7914478778839111, "rewards/total_composite/std": 0.17643626034259796, "reward": 0.7914478778839111, "reward_std": 0.17643627524375916, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1103106439113617, "sampling/sampling_logp_difference/max": 1.2927289009094238, "sampling/importance_sampling_ratio/min": 0.274520605802536, "sampling/importance_sampling_ratio/mean": 0.9970378875732422, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8194018229842186, "clip_ratio/low_mean": 0.023634454235434532, "clip_ratio/low_min": 0.023634454235434532, "clip_ratio/high_mean": 0.057440477423369884, "clip_ratio/high_max": 0.057440477423369884, "clip_ratio/region_mean": 0.08107493165880442, "reward_total_mean": 0.7914478778839111, "reward_meter_mean": 0.9323422908782959, "reward_meter_std": 0.11280333995819092, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8650000095367432, "reward_judge_quality_std": 0.16801361739635468, "reward_total_composite_mean": 0.7914478778839111, "reward_total_composite_std": 0.17643626034259796} {"timestamp_utc": "2026-04-12T17:05:54Z", "mode": "train", "global_step": 311, "epoch": 0.016367559602126203, "loss": 0.1243, "grad_norm": 23.695682525634766, "learning_rate": 9.06060606060606e-06, "num_tokens": 584255.0, "completions/mean_length": 127.5, "completions/min_length": 99.0, "completions/max_length": 168.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 127.5, "completions/min_terminated_length": 99.0, "completions/max_terminated_length": 168.0, "rewards/meter/mean": 0.7575584650039673, "rewards/meter/std": 0.12200148403644562, "rewards/count_adherence/mean": 0.7857142686843872, "rewards/count_adherence/std": 0.07636035233736038, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9357142448425293, "rewards/count_floor/std": 0.02290808968245983, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9072020053863525, "rewards/repeat_penalty/std": 0.08781477808952332, "rewards/repeat_floor/mean": 0.9906822443008423, "rewards/repeat_floor/std": 0.0062971110455691814, "rewards/near_duplicate_penalty/mean": 0.9672962427139282, "rewards/near_duplicate_penalty/std": 0.007038149982690811, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9509758353233337, "rewards/distinct_2/std": 0.06346998363733292, "rewards/total_composite/mean": 0.2319379448890686, "rewards/total_composite/std": 0.06914785504341125, "reward": 0.2319379448890686, "reward_std": 0.06914784759283066, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2435443103313446, "sampling/sampling_logp_difference/max": 3.416959762573242, "sampling/importance_sampling_ratio/min": 0.03281204029917717, "sampling/importance_sampling_ratio/mean": 1.0153148174285889, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4762604981660843, "clip_ratio/low_mean": 0.05055607669055462, "clip_ratio/low_min": 0.05055607669055462, "clip_ratio/high_mean": 0.153734028339386, "clip_ratio/high_max": 0.153734028339386, "clip_ratio/region_mean": 0.2042901050299406, "reward_total_mean": 0.2319379448890686, "reward_meter_mean": 0.7575584650039673, "reward_meter_std": 0.12200148403644562, "reward_count_adherence_mean": 0.7857142686843872, "reward_count_adherence_std": 0.07636035233736038, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9357142448425293, "reward_count_floor_std": 0.02290808968245983, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9072020053863525, "reward_repeat_penalty_std": 0.08781477808952332, "reward_repeat_floor_mean": 0.9906822443008423, "reward_repeat_floor_std": 0.0062971110455691814, "reward_near_duplicate_penalty_mean": 0.9672962427139282, "reward_near_duplicate_penalty_std": 0.007038149982690811, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9509758353233337, "reward_distinct_2_std": 0.06346998363733292, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.2319379448890686, "reward_total_composite_std": 0.06914785504341125} {"timestamp_utc": "2026-04-12T17:06:03Z", "mode": "train", "global_step": 312, "epoch": 0.016420188411136256, "loss": 0.0475, "grad_norm": 15.920761108398438, "learning_rate": 9.057575757575759e-06, "num_tokens": 586386.0, "completions/mean_length": 85.375, "completions/min_length": 74.0, "completions/max_length": 105.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 85.375, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 105.0, "rewards/meter/mean": 0.41423481702804565, "rewards/meter/std": 0.297497034072876, "rewards/count_adherence/mean": 0.8541666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.9624999761581421, "rewards/arabic_floor/std": 0.06943649053573608, "rewards/count_floor/mean": 0.9562499523162842, "rewards/count_floor/std": 0.01767767407000065, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5212500095367432, "rewards/judge_quality/std": 0.20364098250865936, "rewards/repeat_penalty/mean": 0.9256150126457214, "rewards/repeat_penalty/std": 0.17002542316913605, "rewards/repeat_floor/mean": 0.9923303127288818, "rewards/repeat_floor/std": 0.015654226765036583, "rewards/near_duplicate_penalty/mean": 0.9803370833396912, "rewards/near_duplicate_penalty/std": 0.016884636133909225, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9475524425506592, "rewards/distinct_2/std": 0.14834408462047577, "rewards/total_composite/mean": 0.20512068271636963, "rewards/total_composite/std": 0.18300987780094147, "reward": 0.20512068271636963, "reward_std": 0.18300987780094147, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21955280005931854, "sampling/sampling_logp_difference/max": 2.5457582473754883, "sampling/importance_sampling_ratio/min": 0.07841357588768005, "sampling/importance_sampling_ratio/mean": 1.0039602518081665, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.186564490199089, "clip_ratio/low_mean": 0.13033979572355747, "clip_ratio/low_min": 0.13033979572355747, "clip_ratio/high_mean": 0.061771913431584835, "clip_ratio/high_max": 0.061771913431584835, "clip_ratio/region_mean": 0.1921117091551423, "reward_total_mean": 0.20512068271636963, "reward_meter_mean": 0.41423481702804565, "reward_meter_std": 0.297497034072876, "reward_count_adherence_mean": 0.8541666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.9624999761581421, "reward_arabic_floor_std": 0.06943649053573608, "reward_count_floor_mean": 0.9562499523162842, "reward_count_floor_std": 0.01767767407000065, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9256150126457214, "reward_repeat_penalty_std": 0.17002542316913605, "reward_repeat_floor_mean": 0.9923303127288818, "reward_repeat_floor_std": 0.015654226765036583, "reward_near_duplicate_penalty_mean": 0.9803370833396912, "reward_near_duplicate_penalty_std": 0.016884636133909225, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9475524425506592, "reward_distinct_2_std": 0.14834408462047577, "reward_judge_quality_mean": 0.5212500095367432, "reward_judge_quality_std": 0.20364098250865936, "reward_total_composite_mean": 0.20512068271636963, "reward_total_composite_std": 0.18300987780094147} {"timestamp_utc": "2026-04-12T17:06:11Z", "mode": "train", "global_step": 313, "epoch": 0.016472817220146308, "loss": -0.013, "grad_norm": 27.450632095336914, "learning_rate": 9.054545454545455e-06, "num_tokens": 587671.0, "completions/mean_length": 15.625, "completions/min_length": 10.0, "completions/max_length": 19.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 15.625, "completions/min_terminated_length": 10.0, "completions/max_terminated_length": 19.0, "rewards/meter/mean": 0.5798760652542114, "rewards/meter/std": 0.4535468816757202, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9246323108673096, "rewards/lexical_plausibility/std": 0.14093062281608582, "rewards/judge_quality/mean": 0.6687500476837158, "rewards/judge_quality/std": 0.3589046001434326, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.38387513160705566, "rewards/total_composite/std": 0.3713848888874054, "reward": 0.38387513160705566, "reward_std": 0.371384859085083, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14199897646903992, "sampling/sampling_logp_difference/max": 1.3993990421295166, "sampling/importance_sampling_ratio/min": 0.24674519896507263, "sampling/importance_sampling_ratio/mean": 0.9715681672096252, "sampling/importance_sampling_ratio/max": 1.72029447555542, "entropy": 1.186026468873024, "clip_ratio/low_mean": 0.041165413334965706, "clip_ratio/low_min": 0.041165413334965706, "clip_ratio/high_mean": 0.09990809019654989, "clip_ratio/high_max": 0.09990809019654989, "clip_ratio/region_mean": 0.1410735035315156, "reward_total_mean": 0.38387513160705566, "reward_meter_mean": 0.5798760652542114, "reward_meter_std": 0.4535468816757202, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9246323108673096, "reward_lexical_plausibility_std": 0.14093062281608582, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6687500476837158, "reward_judge_quality_std": 0.3589046001434326, "reward_total_composite_mean": 0.38387513160705566, "reward_total_composite_std": 0.3713848888874054} {"timestamp_utc": "2026-04-12T17:06:19Z", "mode": "train", "global_step": 314, "epoch": 0.01652544602915636, "loss": 0.0362, "grad_norm": 16.598642349243164, "learning_rate": 9.051515151515152e-06, "num_tokens": 589168.0, "completions/mean_length": 38.125, "completions/min_length": 27.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.125, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.6301953792572021, "rewards/meter/std": 0.41348692774772644, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5212500095367432, "rewards/judge_quality/std": 0.20364098250865936, "rewards/repeat_penalty/mean": 0.9459177851676941, "rewards/repeat_penalty/std": 0.0359596312046051, "rewards/repeat_floor/mean": 0.9924371242523193, "rewards/repeat_floor/std": 0.005281753372400999, "rewards/near_duplicate_penalty/mean": 0.9550752639770508, "rewards/near_duplicate_penalty/std": 0.039529163390398026, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.3598251938819885, "rewards/total_composite/std": 0.28503474593162537, "reward": 0.3598251938819885, "reward_std": 0.28503474593162537, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18062487244606018, "sampling/sampling_logp_difference/max": 1.8008413314819336, "sampling/importance_sampling_ratio/min": 0.16515988111495972, "sampling/importance_sampling_ratio/mean": 1.0134027004241943, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2614011317491531, "clip_ratio/low_mean": 0.07839708961546421, "clip_ratio/low_min": 0.07839708961546421, "clip_ratio/high_mean": 0.08655215473845601, "clip_ratio/high_max": 0.08655215473845601, "clip_ratio/region_mean": 0.16494924435392022, "reward_total_mean": 0.3598251938819885, "reward_meter_mean": 0.6301953792572021, "reward_meter_std": 0.41348692774772644, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9459177851676941, "reward_repeat_penalty_std": 0.0359596312046051, "reward_repeat_floor_mean": 0.9924371242523193, "reward_repeat_floor_std": 0.005281753372400999, "reward_near_duplicate_penalty_mean": 0.9550752639770508, "reward_near_duplicate_penalty_std": 0.039529163390398026, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.5212500095367432, "reward_judge_quality_std": 0.20364098250865936, "reward_total_composite_mean": 0.3598251938819885, "reward_total_composite_std": 0.28503474593162537} {"timestamp_utc": "2026-04-12T17:06:29Z", "mode": "train", "global_step": 315, "epoch": 0.016578074838166413, "loss": 0.0764, "grad_norm": 12.955530166625977, "learning_rate": 9.04848484848485e-06, "num_tokens": 591191.0, "completions/mean_length": 70.875, "completions/min_length": 63.0, "completions/max_length": 82.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 70.875, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.5339852571487427, "rewards/meter/std": 0.3451843857765198, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9940476417541504, "rewards/lexical_plausibility/std": 0.016835875809192657, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.13024701178073883, "rewards/repeat_penalty/mean": 0.9954635500907898, "rewards/repeat_penalty/std": 0.005026623606681824, "rewards/repeat_floor/mean": 0.9993195533752441, "rewards/repeat_floor/std": 0.0007539888611063361, "rewards/near_duplicate_penalty/mean": 0.9954635500907898, "rewards/near_duplicate_penalty/std": 0.005026623606681824, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16002997756004333, "rewards/total_composite/std": 0.13243502378463745, "reward": 0.16002997756004333, "reward_std": 0.13243502378463745, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24005933105945587, "sampling/sampling_logp_difference/max": 2.231555938720703, "sampling/importance_sampling_ratio/min": 0.10736124962568283, "sampling/importance_sampling_ratio/mean": 1.0492222309112549, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.608979359269142, "clip_ratio/low_mean": 0.16440259478986263, "clip_ratio/low_min": 0.16440259478986263, "clip_ratio/high_mean": 0.051913054659962654, "clip_ratio/high_max": 0.051913054659962654, "clip_ratio/region_mean": 0.2163156494498253, "reward_total_mean": 0.16002997756004333, "reward_meter_mean": 0.5339852571487427, "reward_meter_std": 0.3451843857765198, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9940476417541504, "reward_lexical_plausibility_std": 0.016835875809192657, "reward_repeat_penalty_mean": 0.9954635500907898, "reward_repeat_penalty_std": 0.005026623606681824, "reward_repeat_floor_mean": 0.9993195533752441, "reward_repeat_floor_std": 0.0007539888611063361, "reward_near_duplicate_penalty_mean": 0.9954635500907898, "reward_near_duplicate_penalty_std": 0.005026623606681824, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.13024701178073883, "reward_total_composite_mean": 0.16002997756004333, "reward_total_composite_std": 0.13243502378463745} {"timestamp_utc": "2026-04-12T17:06:38Z", "mode": "train", "global_step": 316, "epoch": 0.016630703647176465, "loss": 0.0369, "grad_norm": 14.941880226135254, "learning_rate": 9.045454545454546e-06, "num_tokens": 593621.0, "completions/mean_length": 116.75, "completions/min_length": 102.0, "completions/max_length": 143.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 116.75, "completions/min_terminated_length": 102.0, "completions/max_terminated_length": 143.0, "rewards/meter/mean": 0.6072092652320862, "rewards/meter/std": 0.1961025595664978, "rewards/count_adherence/mean": 0.7142857313156128, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9142857193946838, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9895833730697632, "rewards/lexical_plausibility/std": 0.029462775215506554, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.16903084516525269, "rewards/repeat_penalty/mean": 0.8918505907058716, "rewards/repeat_penalty/std": 0.11732038855552673, "rewards/repeat_floor/mean": 0.9889510273933411, "rewards/repeat_floor/std": 0.011997546069324017, "rewards/near_duplicate_penalty/mean": 0.9743615388870239, "rewards/near_duplicate_penalty/std": 0.023420952260494232, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9199645519256592, "rewards/distinct_2/std": 0.09881288558244705, "rewards/total_composite/mean": 0.2331920862197876, "rewards/total_composite/std": 0.15198205411434174, "reward": 0.2331920862197876, "reward_std": 0.15198205411434174, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23752768337726593, "sampling/sampling_logp_difference/max": 2.125997543334961, "sampling/importance_sampling_ratio/min": 0.11931388080120087, "sampling/importance_sampling_ratio/mean": 1.0102297067642212, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.48250912129879, "clip_ratio/low_mean": 0.09028875920921564, "clip_ratio/low_min": 0.09028875920921564, "clip_ratio/high_mean": 0.09031237103044987, "clip_ratio/high_max": 0.09031237103044987, "clip_ratio/region_mean": 0.1806011302396655, "reward_total_mean": 0.2331920862197876, "reward_meter_mean": 0.6072092652320862, "reward_meter_std": 0.1961025595664978, "reward_count_adherence_mean": 0.7142857313156128, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9142857193946838, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9895833730697632, "reward_lexical_plausibility_std": 0.029462775215506554, "reward_repeat_penalty_mean": 0.8918505907058716, "reward_repeat_penalty_std": 0.11732038855552673, "reward_repeat_floor_mean": 0.9889510273933411, "reward_repeat_floor_std": 0.011997546069324017, "reward_near_duplicate_penalty_mean": 0.9743615388870239, "reward_near_duplicate_penalty_std": 0.023420952260494232, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9199645519256592, "reward_distinct_2_std": 0.09881288558244705, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.16903084516525269, "reward_total_composite_mean": 0.2331920862197876, "reward_total_composite_std": 0.15198205411434174} {"timestamp_utc": "2026-04-12T17:06:51Z", "mode": "train", "global_step": 317, "epoch": 0.016683332456186518, "loss": -0.0685, "grad_norm": 7.577369689941406, "learning_rate": 9.042424242424244e-06, "num_tokens": 595465.0, "completions/mean_length": 109.5, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 52.000003814697266, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.42767134308815, "rewards/meter/std": 0.3034510612487793, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9421781897544861, "rewards/lexical_plausibility/std": 0.16354475915431976, "rewards/judge_quality/mean": 0.47999998927116394, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.9288090467453003, "rewards/repeat_penalty/std": 0.06002446636557579, "rewards/repeat_floor/mean": 0.9925997257232666, "rewards/repeat_floor/std": 0.0061640311032533646, "rewards/near_duplicate_penalty/mean": 0.9852910041809082, "rewards/near_duplicate_penalty/std": 0.013444710522890091, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9422902464866638, "rewards/distinct_2/std": 0.05239473283290863, "rewards/total_composite/mean": 0.26846200227737427, "rewards/total_composite/std": 0.31822338700294495, "reward": 0.26846200227737427, "reward_std": 0.31822338700294495, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1445298194885254, "sampling/sampling_logp_difference/max": 1.5252630710601807, "sampling/importance_sampling_ratio/min": 0.21756382286548615, "sampling/importance_sampling_ratio/mean": 1.0262278318405151, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9528652653098106, "clip_ratio/low_mean": 0.09752868209034204, "clip_ratio/low_min": 0.09752868209034204, "clip_ratio/high_mean": 0.03143939469009638, "clip_ratio/high_max": 0.03143939469009638, "clip_ratio/region_mean": 0.12896807678043842, "reward_total_mean": 0.26846200227737427, "reward_meter_mean": 0.42767134308815, "reward_meter_std": 0.3034510612487793, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9421781897544861, "reward_lexical_plausibility_std": 0.16354475915431976, "reward_repeat_penalty_mean": 0.9288090467453003, "reward_repeat_penalty_std": 0.06002446636557579, "reward_repeat_floor_mean": 0.9925997257232666, "reward_repeat_floor_std": 0.0061640311032533646, "reward_near_duplicate_penalty_mean": 0.9852910041809082, "reward_near_duplicate_penalty_std": 0.013444710522890091, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9422902464866638, "reward_distinct_2_std": 0.05239473283290863, "reward_judge_quality_mean": 0.47999998927116394, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.26846200227737427, "reward_total_composite_std": 0.31822338700294495} {"timestamp_utc": "2026-04-12T17:07:01Z", "mode": "train", "global_step": 318, "epoch": 0.01673596126519657, "loss": -0.0155, "grad_norm": 11.436017990112305, "learning_rate": 9.03939393939394e-06, "num_tokens": 597615.0, "completions/mean_length": 82.75, "completions/min_length": 66.0, "completions/max_length": 101.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 82.75, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 101.0, "rewards/meter/mean": 0.2961556315422058, "rewards/meter/std": 0.32202163338661194, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4000000059604645, "rewards/judge_quality/std": 0.22038927674293518, "rewards/repeat_penalty/mean": 0.9850220680236816, "rewards/repeat_penalty/std": 0.013130299746990204, "rewards/repeat_floor/mean": 0.9980374574661255, "rewards/repeat_floor/std": 0.0012959600426256657, "rewards/near_duplicate_penalty/mean": 0.9898011088371277, "rewards/near_duplicate_penalty/std": 0.006006290670484304, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.995192289352417, "rewards/distinct_2/std": 0.013598216697573662, "rewards/total_composite/mean": 0.1574200987815857, "rewards/total_composite/std": 0.21431198716163635, "reward": 0.1574200987815857, "reward_std": 0.21431197226047516, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20027244091033936, "sampling/sampling_logp_difference/max": 1.806778907775879, "sampling/importance_sampling_ratio/min": 0.1641821265220642, "sampling/importance_sampling_ratio/mean": 1.0516811609268188, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7966539114713669, "clip_ratio/low_mean": 0.10688901133835316, "clip_ratio/low_min": 0.10688901133835316, "clip_ratio/high_mean": 0.03520032297819853, "clip_ratio/high_max": 0.03520032297819853, "clip_ratio/region_mean": 0.14208933431655169, "reward_total_mean": 0.1574200987815857, "reward_meter_mean": 0.2961556315422058, "reward_meter_std": 0.32202163338661194, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9850220680236816, "reward_repeat_penalty_std": 0.013130299746990204, "reward_repeat_floor_mean": 0.9980374574661255, "reward_repeat_floor_std": 0.0012959600426256657, "reward_near_duplicate_penalty_mean": 0.9898011088371277, "reward_near_duplicate_penalty_std": 0.006006290670484304, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.995192289352417, "reward_distinct_2_std": 0.013598216697573662, "reward_judge_quality_mean": 0.4000000059604645, "reward_judge_quality_std": 0.22038927674293518, "reward_total_composite_mean": 0.1574200987815857, "reward_total_composite_std": 0.21431198716163635} {"timestamp_utc": "2026-04-12T17:07:09Z", "mode": "train", "global_step": 319, "epoch": 0.01678859007420662, "loss": 0.0669, "grad_norm": 30.49716567993164, "learning_rate": 9.036363636363638e-06, "num_tokens": 598934.0, "completions/mean_length": 18.875, "completions/min_length": 16.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.875, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.7936312556266785, "rewards/meter/std": 0.3362228274345398, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.2512255907058716, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5063081383705139, "rewards/total_composite/std": 0.2949349880218506, "reward": 0.5063081383705139, "reward_std": 0.2949349880218506, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2095964252948761, "sampling/sampling_logp_difference/max": 1.1650099754333496, "sampling/importance_sampling_ratio/min": 0.31191954016685486, "sampling/importance_sampling_ratio/mean": 1.0343742370605469, "sampling/importance_sampling_ratio/max": 1.9709964990615845, "entropy": 1.7813816964626312, "clip_ratio/low_mean": 0.09983944287523627, "clip_ratio/low_min": 0.09983944287523627, "clip_ratio/high_mean": 0.07778637856245041, "clip_ratio/high_max": 0.07778637856245041, "clip_ratio/region_mean": 0.17762582143768668, "reward_total_mean": 0.5063081383705139, "reward_meter_mean": 0.7936312556266785, "reward_meter_std": 0.3362228274345398, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.2512255907058716, "reward_total_composite_mean": 0.5063081383705139, "reward_total_composite_std": 0.2949349880218506} {"timestamp_utc": "2026-04-12T17:07:18Z", "mode": "train", "global_step": 320, "epoch": 0.01684121888321667, "loss": -0.0525, "grad_norm": 13.675727844238281, "learning_rate": 9.033333333333334e-06, "num_tokens": 600460.0, "completions/mean_length": 36.75, "completions/min_length": 26.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.75, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.7165847420692444, "rewards/meter/std": 0.35428208112716675, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.9961137771606445, "rewards/repeat_penalty/std": 0.010145732201635838, "rewards/repeat_floor/mean": 0.9994170665740967, "rewards/repeat_floor/std": 0.0015218672342598438, "rewards/near_duplicate_penalty/mean": 0.9961137771606445, "rewards/near_duplicate_penalty/std": 0.010145732201635838, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3932347297668457, "rewards/total_composite/std": 0.3415294289588928, "reward": 0.3932347297668457, "reward_std": 0.34152939915657043, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17731329798698425, "sampling/sampling_logp_difference/max": 1.387129783630371, "sampling/importance_sampling_ratio/min": 0.2497912496328354, "sampling/importance_sampling_ratio/mean": 1.0123792886734009, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4262383878231049, "clip_ratio/low_mean": 0.11775892227888107, "clip_ratio/low_min": 0.11775892227888107, "clip_ratio/high_mean": 0.06192527338862419, "clip_ratio/high_max": 0.06192527338862419, "clip_ratio/region_mean": 0.17968419566750526, "reward_total_mean": 0.3932347297668457, "reward_meter_mean": 0.7165847420692444, "reward_meter_std": 0.35428208112716675, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9961137771606445, "reward_repeat_penalty_std": 0.010145732201635838, "reward_repeat_floor_mean": 0.9994170665740967, "reward_repeat_floor_std": 0.0015218672342598438, "reward_near_duplicate_penalty_mean": 0.9961137771606445, "reward_near_duplicate_penalty_std": 0.010145732201635838, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.3932347297668457, "reward_total_composite_std": 0.3415294289588928} {"timestamp_utc": "2026-04-12T17:07:33Z", "mode": "train", "global_step": 321, "epoch": 0.016893847692226724, "loss": -0.04, "grad_norm": 5.024820804595947, "learning_rate": 9.030303030303031e-06, "num_tokens": 601934.0, "completions/mean_length": 90.25, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 30.000001907348633, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.5445935130119324, "rewards/meter/std": 0.3765180706977844, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9750847220420837, "rewards/lexical_plausibility/std": 0.060039129108190536, "rewards/judge_quality/mean": 0.5600000619888306, "rewards/judge_quality/std": 0.4012124836444855, "rewards/repeat_penalty/mean": 0.9535180330276489, "rewards/repeat_penalty/std": 0.08469787240028381, "rewards/repeat_floor/mean": 0.9960237145423889, "rewards/repeat_floor/std": 0.00515634985640645, "rewards/near_duplicate_penalty/mean": 0.9880056381225586, "rewards/near_duplicate_penalty/std": 0.013819819316267967, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9966430068016052, "rewards/distinct_2/std": 0.009495011530816555, "rewards/total_composite/mean": 0.27255403995513916, "rewards/total_composite/std": 0.2881576120853424, "reward": 0.27255403995513916, "reward_std": 0.2881576120853424, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17371590435504913, "sampling/sampling_logp_difference/max": 2.350584030151367, "sampling/importance_sampling_ratio/min": 0.09531348198652267, "sampling/importance_sampling_ratio/mean": 1.026108980178833, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1391584053635597, "clip_ratio/low_mean": 0.09603851195424795, "clip_ratio/low_min": 0.09603851195424795, "clip_ratio/high_mean": 0.03629032149910927, "clip_ratio/high_max": 0.03629032149910927, "clip_ratio/region_mean": 0.13232883345335722, "reward_total_mean": 0.27255403995513916, "reward_meter_mean": 0.5445935130119324, "reward_meter_std": 0.3765180706977844, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9750847220420837, "reward_lexical_plausibility_std": 0.060039129108190536, "reward_repeat_penalty_mean": 0.9535180330276489, "reward_repeat_penalty_std": 0.08469787240028381, "reward_repeat_floor_mean": 0.9960237145423889, "reward_repeat_floor_std": 0.00515634985640645, "reward_near_duplicate_penalty_mean": 0.9880056381225586, "reward_near_duplicate_penalty_std": 0.013819819316267967, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9966430068016052, "reward_distinct_2_std": 0.009495011530816555, "reward_judge_quality_mean": 0.5600000619888306, "reward_judge_quality_std": 0.4012124836444855, "reward_total_composite_mean": 0.27255403995513916, "reward_total_composite_std": 0.2881576120853424} {"timestamp_utc": "2026-04-12T17:07:47Z", "mode": "train", "global_step": 322, "epoch": 0.016946476501236776, "loss": -0.1657, "grad_norm": 2.980701208114624, "learning_rate": 9.027272727272728e-06, "num_tokens": 603788.0, "completions/mean_length": 194.75, "completions/min_length": 75.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 89.0, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 105.0, "rewards/meter/mean": 0.7815793752670288, "rewards/meter/std": 0.33709579706192017, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.08017838001251221, "rewards/lexical_plausibility/mean": 0.9196681976318359, "rewards/lexical_plausibility/std": 0.1511790156364441, "rewards/judge_quality/mean": 0.29999998211860657, "rewards/judge_quality/std": 0.18516401946544647, "rewards/repeat_penalty/mean": 0.9904124736785889, "rewards/repeat_penalty/std": 0.013655727729201317, "rewards/repeat_floor/mean": 0.9988014698028564, "rewards/repeat_floor/std": 0.0014115042285993695, "rewards/near_duplicate_penalty/mean": 0.9944649934768677, "rewards/near_duplicate_penalty/std": 0.004200012423098087, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9959083795547485, "rewards/distinct_2/std": 0.011572934687137604, "rewards/total_composite/mean": 0.2697392702102661, "rewards/total_composite/std": 0.1861606240272522, "reward": 0.2697392702102661, "reward_std": 0.1861606240272522, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2009381651878357, "sampling/sampling_logp_difference/max": 1.1313667297363281, "sampling/importance_sampling_ratio/min": 0.3225920796394348, "sampling/importance_sampling_ratio/mean": 1.0548303127288818, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1985997557640076, "clip_ratio/low_mean": 0.02777777798473835, "clip_ratio/low_min": 0.02777777798473835, "clip_ratio/high_mean": 0.12069774232804775, "clip_ratio/high_max": 0.12069774232804775, "clip_ratio/region_mean": 0.1484755203127861, "reward_total_mean": 0.2697392702102661, "reward_meter_mean": 0.7815793752670288, "reward_meter_std": 0.33709579706192017, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.08017838001251221, "reward_lexical_plausibility_mean": 0.9196681976318359, "reward_lexical_plausibility_std": 0.1511790156364441, "reward_repeat_penalty_mean": 0.9904124736785889, "reward_repeat_penalty_std": 0.013655727729201317, "reward_repeat_floor_mean": 0.9988014698028564, "reward_repeat_floor_std": 0.0014115042285993695, "reward_near_duplicate_penalty_mean": 0.9944649934768677, "reward_near_duplicate_penalty_std": 0.004200012423098087, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9959083795547485, "reward_distinct_2_std": 0.011572934687137604, "reward_judge_quality_mean": 0.29999998211860657, "reward_judge_quality_std": 0.18516401946544647, "reward_total_composite_mean": 0.2697392702102661, "reward_total_composite_std": 0.1861606240272522} {"timestamp_utc": "2026-04-12T17:07:55Z", "mode": "train", "global_step": 323, "epoch": 0.01699910531024683, "loss": 0.0405, "grad_norm": 16.94824981689453, "learning_rate": 9.024242424242426e-06, "num_tokens": 605687.0, "completions/mean_length": 44.375, "completions/min_length": 38.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.375, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.8522233963012695, "rewards/meter/std": 0.18364009261131287, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.897731602191925, "rewards/repeat_penalty/std": 0.18885688483715057, "rewards/repeat_floor/mean": 0.9878875017166138, "rewards/repeat_floor/std": 0.022107074037194252, "rewards/near_duplicate_penalty/mean": 0.9626564979553223, "rewards/near_duplicate_penalty/std": 0.06179862096905708, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9484890103340149, "rewards/distinct_2/std": 0.09566201269626617, "rewards/total_composite/mean": 0.3616304099559784, "rewards/total_composite/std": 0.08909326046705246, "reward": 0.3616304099559784, "reward_std": 0.08909326046705246, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24145522713661194, "sampling/sampling_logp_difference/max": 1.7497434616088867, "sampling/importance_sampling_ratio/min": 0.17381852865219116, "sampling/importance_sampling_ratio/mean": 1.0306921005249023, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.072322279214859, "clip_ratio/low_mean": 0.07108516525477171, "clip_ratio/low_min": 0.07108516525477171, "clip_ratio/high_mean": 0.1286225551739335, "clip_ratio/high_max": 0.1286225551739335, "clip_ratio/region_mean": 0.19970772042870522, "reward_total_mean": 0.3616304099559784, "reward_meter_mean": 0.8522233963012695, "reward_meter_std": 0.18364009261131287, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.897731602191925, "reward_repeat_penalty_std": 0.18885688483715057, "reward_repeat_floor_mean": 0.9878875017166138, "reward_repeat_floor_std": 0.022107074037194252, "reward_near_duplicate_penalty_mean": 0.9626564979553223, "reward_near_duplicate_penalty_std": 0.06179862096905708, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9484890103340149, "reward_distinct_2_std": 0.09566201269626617, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.3616304099559784, "reward_total_composite_std": 0.08909326046705246} {"timestamp_utc": "2026-04-12T17:08:03Z", "mode": "train", "global_step": 324, "epoch": 0.01705173411925688, "loss": 0.0265, "grad_norm": 19.082670211791992, "learning_rate": 9.021212121212121e-06, "num_tokens": 607056.0, "completions/mean_length": 22.125, "completions/min_length": 17.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.125, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.6404979825019836, "rewards/meter/std": 0.43355244398117065, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.42500001192092896, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.6094648241996765, "rewards/repeat_penalty/std": 0.12628398835659027, "rewards/repeat_floor/mean": 0.9569916725158691, "rewards/repeat_floor/std": 0.025063540786504745, "rewards/near_duplicate_penalty/mean": 0.8260983228683472, "rewards/near_duplicate_penalty/std": 0.14450305700302124, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.2601917088031769, "rewards/total_composite/std": 0.19473481178283691, "reward": 0.2601917088031769, "reward_std": 0.19473479688167572, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16124628484249115, "sampling/sampling_logp_difference/max": 1.5426025390625, "sampling/importance_sampling_ratio/min": 0.21382389962673187, "sampling/importance_sampling_ratio/mean": 0.9949864745140076, "sampling/importance_sampling_ratio/max": 1.9606815576553345, "entropy": 1.056018553674221, "clip_ratio/low_mean": 0.07366867363452911, "clip_ratio/low_min": 0.07366867363452911, "clip_ratio/high_mean": 0.09975808765739202, "clip_ratio/high_max": 0.09975808765739202, "clip_ratio/region_mean": 0.17342676129192114, "reward_total_mean": 0.2601917088031769, "reward_meter_mean": 0.6404979825019836, "reward_meter_std": 0.43355244398117065, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.6094648241996765, "reward_repeat_penalty_std": 0.12628398835659027, "reward_repeat_floor_mean": 0.9569916725158691, "reward_repeat_floor_std": 0.025063540786504745, "reward_near_duplicate_penalty_mean": 0.8260983228683472, "reward_near_duplicate_penalty_std": 0.14450305700302124, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.42500001192092896, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.2601917088031769, "reward_total_composite_std": 0.19473481178283691} {"timestamp_utc": "2026-04-12T17:08:16Z", "mode": "train", "global_step": 325, "epoch": 0.017104362928266933, "loss": -0.0799, "grad_norm": 3.325479030609131, "learning_rate": 9.01818181818182e-06, "num_tokens": 608534.0, "completions/mean_length": 155.75, "completions/min_length": 24.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.45075857639312744, "rewards/meter/std": 0.40244653820991516, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.879709005355835, "rewards/lexical_plausibility/std": 0.1780509501695633, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213627576828, "rewards/repeat_penalty/mean": 0.9158079624176025, "rewards/repeat_penalty/std": 0.10471590608358383, "rewards/repeat_floor/mean": 0.9929962158203125, "rewards/repeat_floor/std": 0.005952437408268452, "rewards/near_duplicate_penalty/mean": 0.9783079624176025, "rewards/near_duplicate_penalty/std": 0.025911886245012283, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1340664029121399, "rewards/total_composite/std": 0.13815456628799438, "reward": 0.1340664029121399, "reward_std": 0.13815458118915558, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23885197937488556, "sampling/sampling_logp_difference/max": 1.6627397537231445, "sampling/importance_sampling_ratio/min": 0.18961875140666962, "sampling/importance_sampling_ratio/mean": 1.021572232246399, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7420674115419388, "clip_ratio/low_mean": 0.04676120541989803, "clip_ratio/low_min": 0.04676120541989803, "clip_ratio/high_mean": 0.06735125556588173, "clip_ratio/high_max": 0.06735125556588173, "clip_ratio/region_mean": 0.11411246098577976, "reward_total_mean": 0.1340664029121399, "reward_meter_mean": 0.45075857639312744, "reward_meter_std": 0.40244653820991516, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.879709005355835, "reward_lexical_plausibility_std": 0.1780509501695633, "reward_repeat_penalty_mean": 0.9158079624176025, "reward_repeat_penalty_std": 0.10471590608358383, "reward_repeat_floor_mean": 0.9929962158203125, "reward_repeat_floor_std": 0.005952437408268452, "reward_near_duplicate_penalty_mean": 0.9783079624176025, "reward_near_duplicate_penalty_std": 0.025911886245012283, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213627576828, "reward_total_composite_mean": 0.1340664029121399, "reward_total_composite_std": 0.13815456628799438} {"timestamp_utc": "2026-04-12T17:08:27Z", "mode": "train", "global_step": 326, "epoch": 0.017156991737276986, "loss": 0.0237, "grad_norm": 13.654400825500488, "learning_rate": 9.015151515151516e-06, "num_tokens": 610100.0, "completions/mean_length": 47.75, "completions/min_length": 42.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.75, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.5693294405937195, "rewards/meter/std": 0.411795049905777, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.991178035736084, "rewards/repeat_penalty/std": 0.013867231085896492, "rewards/repeat_floor/mean": 0.9986767172813416, "rewards/repeat_floor/std": 0.0020800859201699495, "rewards/near_duplicate_penalty/mean": 0.991178035736084, "rewards/near_duplicate_penalty/std": 0.013867231085896492, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2887307107448578, "rewards/total_composite/std": 0.27768048644065857, "reward": 0.2887307107448578, "reward_std": 0.2776804566383362, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20421560108661652, "sampling/sampling_logp_difference/max": 1.4174118041992188, "sampling/importance_sampling_ratio/min": 0.24234043061733246, "sampling/importance_sampling_ratio/mean": 1.030893325805664, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.896958127617836, "clip_ratio/low_mean": 0.06497407425194979, "clip_ratio/low_min": 0.06497407425194979, "clip_ratio/high_mean": 0.08649432007223368, "clip_ratio/high_max": 0.08649432007223368, "clip_ratio/region_mean": 0.15146839432418346, "reward_total_mean": 0.2887307107448578, "reward_meter_mean": 0.5693294405937195, "reward_meter_std": 0.411795049905777, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.991178035736084, "reward_repeat_penalty_std": 0.013867231085896492, "reward_repeat_floor_mean": 0.9986767172813416, "reward_repeat_floor_std": 0.0020800859201699495, "reward_near_duplicate_penalty_mean": 0.991178035736084, "reward_near_duplicate_penalty_std": 0.013867231085896492, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.2887307107448578, "reward_total_composite_std": 0.27768048644065857} {"timestamp_utc": "2026-04-12T17:08:41Z", "mode": "train", "global_step": 327, "epoch": 0.01720962054628704, "loss": -0.0724, "grad_norm": 6.321916103363037, "learning_rate": 9.012121212121213e-06, "num_tokens": 611672.0, "completions/mean_length": 100.5, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 41.71428680419922, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.4724549353122711, "rewards/meter/std": 0.4008066952228546, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.942983865737915, "rewards/lexical_plausibility/std": 0.14270249009132385, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.24706491827964783, "rewards/repeat_penalty/mean": 0.9759707450866699, "rewards/repeat_penalty/std": 0.03519072011113167, "rewards/repeat_floor/mean": 0.9968447685241699, "rewards/repeat_floor/std": 0.004106494132429361, "rewards/near_duplicate_penalty/mean": 0.9839820861816406, "rewards/near_duplicate_penalty/std": 0.01587345078587532, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.2145029902458191, "rewards/total_composite/std": 0.22043871879577637, "reward": 0.2145029902458191, "reward_std": 0.22043870389461517, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19373220205307007, "sampling/sampling_logp_difference/max": 1.6452445983886719, "sampling/importance_sampling_ratio/min": 0.19296535849571228, "sampling/importance_sampling_ratio/mean": 1.0285770893096924, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7601165026426315, "clip_ratio/low_mean": 0.038460261188447475, "clip_ratio/low_min": 0.038460261188447475, "clip_ratio/high_mean": 0.07752238027751446, "clip_ratio/high_max": 0.07752238027751446, "clip_ratio/region_mean": 0.11598264146596193, "reward_total_mean": 0.2145029902458191, "reward_meter_mean": 0.4724549353122711, "reward_meter_std": 0.4008066952228546, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.942983865737915, "reward_lexical_plausibility_std": 0.14270249009132385, "reward_repeat_penalty_mean": 0.9759707450866699, "reward_repeat_penalty_std": 0.03519072011113167, "reward_repeat_floor_mean": 0.9968447685241699, "reward_repeat_floor_std": 0.004106494132429361, "reward_near_duplicate_penalty_mean": 0.9839820861816406, "reward_near_duplicate_penalty_std": 0.01587345078587532, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.24706491827964783, "reward_total_composite_mean": 0.2145029902458191, "reward_total_composite_std": 0.22043871879577637} {"timestamp_utc": "2026-04-12T17:08:55Z", "mode": "train", "global_step": 328, "epoch": 0.01726224935529709, "loss": -0.0714, "grad_norm": 3.29329252243042, "learning_rate": 9.00909090909091e-06, "num_tokens": 613329.0, "completions/mean_length": 162.125, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 45.5, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.5958593487739563, "rewards/meter/std": 0.4086369574069977, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8750607967376709, "rewards/lexical_plausibility/std": 0.16764959692955017, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.16850179433822632, "rewards/repeat_penalty/mean": 0.9930334091186523, "rewards/repeat_penalty/std": 0.013267184607684612, "rewards/repeat_floor/mean": 0.9989550113677979, "rewards/repeat_floor/std": 0.0019900870975106955, "rewards/near_duplicate_penalty/mean": 0.9930334091186523, "rewards/near_duplicate_penalty/std": 0.013267184607684612, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19685010612010956, "rewards/total_composite/std": 0.17298580706119537, "reward": 0.19685010612010956, "reward_std": 0.17298579216003418, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2268337905406952, "sampling/sampling_logp_difference/max": 1.304356575012207, "sampling/importance_sampling_ratio/min": 0.2713470757007599, "sampling/importance_sampling_ratio/mean": 1.0349611043930054, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3360288888216019, "clip_ratio/low_mean": 0.057386364787817, "clip_ratio/low_min": 0.057386364787817, "clip_ratio/high_mean": 0.10669773630797863, "clip_ratio/high_max": 0.10669773630797863, "clip_ratio/region_mean": 0.16408410109579563, "reward_total_mean": 0.19685010612010956, "reward_meter_mean": 0.5958593487739563, "reward_meter_std": 0.4086369574069977, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8750607967376709, "reward_lexical_plausibility_std": 0.16764959692955017, "reward_repeat_penalty_mean": 0.9930334091186523, "reward_repeat_penalty_std": 0.013267184607684612, "reward_repeat_floor_mean": 0.9989550113677979, "reward_repeat_floor_std": 0.0019900870975106955, "reward_near_duplicate_penalty_mean": 0.9930334091186523, "reward_near_duplicate_penalty_std": 0.013267184607684612, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.16850179433822632, "reward_total_composite_mean": 0.19685010612010956, "reward_total_composite_std": 0.17298580706119537} {"timestamp_utc": "2026-04-12T17:09:03Z", "mode": "train", "global_step": 329, "epoch": 0.017314878164307143, "loss": 0.0155, "grad_norm": 12.86247730255127, "learning_rate": 9.006060606060607e-06, "num_tokens": 614868.0, "completions/mean_length": 39.375, "completions/min_length": 31.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.375, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.5450085401535034, "rewards/meter/std": 0.4167117476463318, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6337499618530273, "rewards/judge_quality/std": 0.3177122473716736, "rewards/repeat_penalty/mean": 0.9742398858070374, "rewards/repeat_penalty/std": 0.06834931671619415, "rewards/repeat_floor/mean": 0.9966607093811035, "rewards/repeat_floor/std": 0.008771215565502644, "rewards/near_duplicate_penalty/mean": 0.9849497079849243, "rewards/near_duplicate_penalty/std": 0.038151029497385025, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9879807829856873, "rewards/distinct_2/std": 0.03399552404880524, "rewards/total_composite/mean": 0.3427734971046448, "rewards/total_composite/std": 0.361762136220932, "reward": 0.3427734971046448, "reward_std": 0.3617621064186096, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1714494675397873, "sampling/sampling_logp_difference/max": 1.2371959686279297, "sampling/importance_sampling_ratio/min": 0.29019680619239807, "sampling/importance_sampling_ratio/mean": 1.01372230052948, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5177952349185944, "clip_ratio/low_mean": 0.07150704646483064, "clip_ratio/low_min": 0.07150704646483064, "clip_ratio/high_mean": 0.06821303069591522, "clip_ratio/high_max": 0.06821303069591522, "clip_ratio/region_mean": 0.13972007716074586, "reward_total_mean": 0.3427734971046448, "reward_meter_mean": 0.5450085401535034, "reward_meter_std": 0.4167117476463318, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9742398858070374, "reward_repeat_penalty_std": 0.06834931671619415, "reward_repeat_floor_mean": 0.9966607093811035, "reward_repeat_floor_std": 0.008771215565502644, "reward_near_duplicate_penalty_mean": 0.9849497079849243, "reward_near_duplicate_penalty_std": 0.038151029497385025, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9879807829856873, "reward_distinct_2_std": 0.03399552404880524, "reward_judge_quality_mean": 0.6337499618530273, "reward_judge_quality_std": 0.3177122473716736, "reward_total_composite_mean": 0.3427734971046448, "reward_total_composite_std": 0.361762136220932} {"timestamp_utc": "2026-04-12T17:09:14Z", "mode": "train", "global_step": 330, "epoch": 0.017367506973317196, "loss": 0.0333, "grad_norm": 7.601152420043945, "learning_rate": 9.003030303030303e-06, "num_tokens": 617814.0, "completions/mean_length": 175.25, "completions/min_length": 148.0, "completions/max_length": 189.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 175.25, "completions/min_terminated_length": 148.0, "completions/max_terminated_length": 189.0, "rewards/meter/mean": 0.6623580455780029, "rewards/meter/std": 0.3066847026348114, "rewards/count_adherence/mean": 0.7142857313156128, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9142857193946838, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.6902416944503784, "rewards/repeat_penalty/std": 0.2966504991054535, "rewards/repeat_floor/mean": 0.9670842885971069, "rewards/repeat_floor/std": 0.03169690817594528, "rewards/near_duplicate_penalty/mean": 0.9358048439025879, "rewards/near_duplicate_penalty/std": 0.06196501478552818, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7412613034248352, "rewards/distinct_2/std": 0.25303134322166443, "rewards/total_composite/mean": 0.19090114533901215, "rewards/total_composite/std": 0.11105522513389587, "reward": 0.19090114533901215, "reward_std": 0.11105521768331528, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18563103675842285, "sampling/sampling_logp_difference/max": 3.275938034057617, "sampling/importance_sampling_ratio/min": 0.03778141364455223, "sampling/importance_sampling_ratio/mean": 1.0296766757965088, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8779809772968292, "clip_ratio/low_mean": 0.05767340213060379, "clip_ratio/low_min": 0.05767340213060379, "clip_ratio/high_mean": 0.10809224285185337, "clip_ratio/high_max": 0.10809224285185337, "clip_ratio/region_mean": 0.16576564498245716, "reward_total_mean": 0.19090114533901215, "reward_meter_mean": 0.6623580455780029, "reward_meter_std": 0.3066847026348114, "reward_count_adherence_mean": 0.7142857313156128, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9142857193946838, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6902416944503784, "reward_repeat_penalty_std": 0.2966504991054535, "reward_repeat_floor_mean": 0.9670842885971069, "reward_repeat_floor_std": 0.03169690817594528, "reward_near_duplicate_penalty_mean": 0.9358048439025879, "reward_near_duplicate_penalty_std": 0.06196501478552818, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7412613034248352, "reward_distinct_2_std": 0.25303134322166443, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.19090114533901215, "reward_total_composite_std": 0.11105522513389587} {"timestamp_utc": "2026-04-12T17:09:24Z", "mode": "train", "global_step": 331, "epoch": 0.017420135782327244, "loss": -0.0227, "grad_norm": 9.477758407592773, "learning_rate": 9e-06, "num_tokens": 620345.0, "completions/mean_length": 119.375, "completions/min_length": 98.0, "completions/max_length": 146.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 119.375, "completions/min_terminated_length": 98.0, "completions/max_terminated_length": 146.0, "rewards/meter/mean": 0.5467900633811951, "rewards/meter/std": 0.36305561661720276, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9850000143051147, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.9762307405471802, "rewards/repeat_penalty/std": 0.04083777964115143, "rewards/repeat_floor/mean": 0.9972497820854187, "rewards/repeat_floor/std": 0.004304586909711361, "rewards/near_duplicate_penalty/mean": 0.9903911352157593, "rewards/near_duplicate_penalty/std": 0.00962204672396183, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9854571223258972, "rewards/distinct_2/std": 0.03325406089425087, "rewards/total_composite/mean": 0.19826576113700867, "rewards/total_composite/std": 0.12650547921657562, "reward": 0.19826576113700867, "reward_std": 0.12650547921657562, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20425374805927277, "sampling/sampling_logp_difference/max": 1.7474346160888672, "sampling/importance_sampling_ratio/min": 0.17422030866146088, "sampling/importance_sampling_ratio/mean": 1.0514130592346191, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.1810272932052612, "clip_ratio/low_mean": 0.10374086908996105, "clip_ratio/low_min": 0.10374086908996105, "clip_ratio/high_mean": 0.08999050967395306, "clip_ratio/high_max": 0.08999050967395306, "clip_ratio/region_mean": 0.1937313787639141, "reward_total_mean": 0.19826576113700867, "reward_meter_mean": 0.5467900633811951, "reward_meter_std": 0.36305561661720276, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9850000143051147, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9762307405471802, "reward_repeat_penalty_std": 0.04083777964115143, "reward_repeat_floor_mean": 0.9972497820854187, "reward_repeat_floor_std": 0.004304586909711361, "reward_near_duplicate_penalty_mean": 0.9903911352157593, "reward_near_duplicate_penalty_std": 0.00962204672396183, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9854571223258972, "reward_distinct_2_std": 0.03325406089425087, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.19826576113700867, "reward_total_composite_std": 0.12650547921657562} {"timestamp_utc": "2026-04-12T17:09:32Z", "mode": "train", "global_step": 332, "epoch": 0.017472764591337297, "loss": 0.0621, "grad_norm": 15.719371795654297, "learning_rate": 8.996969696969697e-06, "num_tokens": 621960.0, "completions/mean_length": 44.875, "completions/min_length": 38.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.875, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.7392489314079285, "rewards/meter/std": 0.4448111951351166, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6512500047683716, "rewards/judge_quality/std": 0.2503390610218048, "rewards/repeat_penalty/mean": 0.8899849057197571, "rewards/repeat_penalty/std": 0.1520090252161026, "rewards/repeat_floor/mean": 0.9863828420639038, "rewards/repeat_floor/std": 0.01840312033891678, "rewards/near_duplicate_penalty/mean": 0.950941801071167, "rewards/near_duplicate_penalty/std": 0.058040469884872437, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9304618835449219, "rewards/distinct_2/std": 0.11295775324106216, "rewards/total_composite/mean": 0.4814991354942322, "rewards/total_composite/std": 0.3474137485027313, "reward": 0.4814991354942322, "reward_std": 0.3474137485027313, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18538926541805267, "sampling/sampling_logp_difference/max": 1.3385437726974487, "sampling/importance_sampling_ratio/min": 0.26222726702690125, "sampling/importance_sampling_ratio/mean": 1.021314263343811, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4954206347465515, "clip_ratio/low_mean": 0.09325589146465063, "clip_ratio/low_min": 0.09325589146465063, "clip_ratio/high_mean": 0.07908442988991737, "clip_ratio/high_max": 0.07908442988991737, "clip_ratio/region_mean": 0.172340321354568, "reward_total_mean": 0.4814991354942322, "reward_meter_mean": 0.7392489314079285, "reward_meter_std": 0.4448111951351166, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8899849057197571, "reward_repeat_penalty_std": 0.1520090252161026, "reward_repeat_floor_mean": 0.9863828420639038, "reward_repeat_floor_std": 0.01840312033891678, "reward_near_duplicate_penalty_mean": 0.950941801071167, "reward_near_duplicate_penalty_std": 0.058040469884872437, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9304618835449219, "reward_distinct_2_std": 0.11295775324106216, "reward_judge_quality_mean": 0.6512500047683716, "reward_judge_quality_std": 0.2503390610218048, "reward_total_composite_mean": 0.4814991354942322, "reward_total_composite_std": 0.3474137485027313} {"timestamp_utc": "2026-04-12T17:09:45Z", "mode": "train", "global_step": 333, "epoch": 0.01752539340034735, "loss": -0.037, "grad_norm": 6.324812412261963, "learning_rate": 8.993939393939395e-06, "num_tokens": 623609.0, "completions/mean_length": 97.125, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.85714340209961, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.3344654142856598, "rewards/meter/std": 0.3455292284488678, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9542313814163208, "rewards/lexical_plausibility/std": 0.12945318222045898, "rewards/judge_quality/mean": 0.5950000286102295, "rewards/judge_quality/std": 0.3374272584915161, "rewards/repeat_penalty/mean": 0.8774904012680054, "rewards/repeat_penalty/std": 0.26813358068466187, "rewards/repeat_floor/mean": 0.9819175004959106, "rewards/repeat_floor/std": 0.03940322995185852, "rewards/near_duplicate_penalty/mean": 0.9334884285926819, "rewards/near_duplicate_penalty/std": 0.11620126664638519, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9307692050933838, "rewards/distinct_2/std": 0.19581419229507446, "rewards/total_composite/mean": 0.16200512647628784, "rewards/total_composite/std": 0.15872851014137268, "reward": 0.16200512647628784, "reward_std": 0.15872851014137268, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20526380836963654, "sampling/sampling_logp_difference/max": 2.0141396522521973, "sampling/importance_sampling_ratio/min": 0.13343514502048492, "sampling/importance_sampling_ratio/mean": 1.0475233793258667, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.45550936460495, "clip_ratio/low_mean": 0.08114611357450485, "clip_ratio/low_min": 0.08114611357450485, "clip_ratio/high_mean": 0.08637686166912317, "clip_ratio/high_max": 0.08637686166912317, "clip_ratio/region_mean": 0.16752297524362803, "reward_total_mean": 0.16200512647628784, "reward_meter_mean": 0.3344654142856598, "reward_meter_std": 0.3455292284488678, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9542313814163208, "reward_lexical_plausibility_std": 0.12945318222045898, "reward_repeat_penalty_mean": 0.8774904012680054, "reward_repeat_penalty_std": 0.26813358068466187, "reward_repeat_floor_mean": 0.9819175004959106, "reward_repeat_floor_std": 0.03940322995185852, "reward_near_duplicate_penalty_mean": 0.9334884285926819, "reward_near_duplicate_penalty_std": 0.11620126664638519, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9307692050933838, "reward_distinct_2_std": 0.19581419229507446, "reward_judge_quality_mean": 0.5950000286102295, "reward_judge_quality_std": 0.3374272584915161, "reward_total_composite_mean": 0.16200512647628784, "reward_total_composite_std": 0.15872851014137268} {"timestamp_utc": "2026-04-12T17:09:53Z", "mode": "train", "global_step": 334, "epoch": 0.0175780222093574, "loss": 0.0261, "grad_norm": 15.41718578338623, "learning_rate": 8.990909090909092e-06, "num_tokens": 625241.0, "completions/mean_length": 32.0, "completions/min_length": 28.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.0, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.3763948082923889, "rewards/meter/std": 0.33724334836006165, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9312499761581421, "rewards/judge_quality/std": 0.015526460483670235, "rewards/repeat_penalty/mean": 0.8744696378707886, "rewards/repeat_penalty/std": 0.0550113208591938, "rewards/repeat_floor/mean": 0.9811704158782959, "rewards/repeat_floor/std": 0.00825169775635004, "rewards/near_duplicate_penalty/mean": 0.8744696378707886, "rewards/near_duplicate_penalty/std": 0.0550113208591938, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3434305787086487, "rewards/total_composite/std": 0.30541110038757324, "reward": 0.3434305787086487, "reward_std": 0.30541110038757324, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11281287670135498, "sampling/sampling_logp_difference/max": 2.121975898742676, "sampling/importance_sampling_ratio/min": 0.11979468911886215, "sampling/importance_sampling_ratio/mean": 0.995778501033783, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.49717994406819344, "clip_ratio/low_mean": 0.0692060450091958, "clip_ratio/low_min": 0.0692060450091958, "clip_ratio/high_mean": 0.03940886817872524, "clip_ratio/high_max": 0.03940886817872524, "clip_ratio/region_mean": 0.10861491318792105, "reward_total_mean": 0.3434305787086487, "reward_meter_mean": 0.3763948082923889, "reward_meter_std": 0.33724334836006165, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8744696378707886, "reward_repeat_penalty_std": 0.0550113208591938, "reward_repeat_floor_mean": 0.9811704158782959, "reward_repeat_floor_std": 0.00825169775635004, "reward_near_duplicate_penalty_mean": 0.8744696378707886, "reward_near_duplicate_penalty_std": 0.0550113208591938, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9312499761581421, "reward_judge_quality_std": 0.015526460483670235, "reward_total_composite_mean": 0.3434305787086487, "reward_total_composite_std": 0.30541110038757324} {"timestamp_utc": "2026-04-12T17:10:07Z", "mode": "train", "global_step": 335, "epoch": 0.017630651018367454, "loss": -0.0462, "grad_norm": 6.4609808921813965, "learning_rate": 8.98787878787879e-06, "num_tokens": 627326.0, "completions/mean_length": 139.625, "completions/min_length": 69.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 86.42857360839844, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 119.0, "rewards/meter/mean": 0.5335412621498108, "rewards/meter/std": 0.4433954656124115, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9291043281555176, "rewards/lexical_plausibility/std": 0.12765920162200928, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.14880475401878357, "rewards/repeat_penalty/mean": 0.9270902872085571, "rewards/repeat_penalty/std": 0.060830820351839066, "rewards/repeat_floor/mean": 0.991856038570404, "rewards/repeat_floor/std": 0.006524866912513971, "rewards/near_duplicate_penalty/mean": 0.9762570858001709, "rewards/near_duplicate_penalty/std": 0.0161101333796978, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9490830898284912, "rewards/distinct_2/std": 0.049733735620975494, "rewards/total_composite/mean": 0.17774923145771027, "rewards/total_composite/std": 0.1678026020526886, "reward": 0.17774923145771027, "reward_std": 0.1678025871515274, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20937727391719818, "sampling/sampling_logp_difference/max": 2.242918014526367, "sampling/importance_sampling_ratio/min": 0.10614831000566483, "sampling/importance_sampling_ratio/mean": 1.030953049659729, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.594652384519577, "clip_ratio/low_mean": 0.07543732784688473, "clip_ratio/low_min": 0.07543732784688473, "clip_ratio/high_mean": 0.06352804228663445, "clip_ratio/high_max": 0.06352804228663445, "clip_ratio/region_mean": 0.13896537013351917, "reward_total_mean": 0.17774923145771027, "reward_meter_mean": 0.5335412621498108, "reward_meter_std": 0.4433954656124115, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9291043281555176, "reward_lexical_plausibility_std": 0.12765920162200928, "reward_repeat_penalty_mean": 0.9270902872085571, "reward_repeat_penalty_std": 0.060830820351839066, "reward_repeat_floor_mean": 0.991856038570404, "reward_repeat_floor_std": 0.006524866912513971, "reward_near_duplicate_penalty_mean": 0.9762570858001709, "reward_near_duplicate_penalty_std": 0.0161101333796978, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9490830898284912, "reward_distinct_2_std": 0.049733735620975494, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.14880475401878357, "reward_total_composite_mean": 0.17774923145771027, "reward_total_composite_std": 0.1678026020526886} {"timestamp_utc": "2026-04-12T17:10:16Z", "mode": "train", "global_step": 336, "epoch": 0.017683279827377506, "loss": 0.0914, "grad_norm": 10.081744194030762, "learning_rate": 8.984848484848485e-06, "num_tokens": 629413.0, "completions/mean_length": 91.875, "completions/min_length": 69.0, "completions/max_length": 109.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 91.875, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 109.0, "rewards/meter/mean": 0.9746475219726562, "rewards/meter/std": 0.024971460923552513, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48249998688697815, "rewards/judge_quality/std": 0.26222947239875793, "rewards/repeat_penalty/mean": 0.927332878112793, "rewards/repeat_penalty/std": 0.09314508736133575, "rewards/repeat_floor/mean": 0.9919474124908447, "rewards/repeat_floor/std": 0.009451538324356079, "rewards/near_duplicate_penalty/mean": 0.9778405427932739, "rewards/near_duplicate_penalty/std": 0.012873595580458641, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9474591016769409, "rewards/distinct_2/std": 0.08519522100687027, "rewards/total_composite/mean": 0.468796968460083, "rewards/total_composite/std": 0.2625926434993744, "reward": 0.468796968460083, "reward_std": 0.2625926434993744, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2029363065958023, "sampling/sampling_logp_difference/max": 2.309131622314453, "sampling/importance_sampling_ratio/min": 0.09934748709201813, "sampling/importance_sampling_ratio/mean": 1.038577914237976, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.144473224878311, "clip_ratio/low_mean": 0.1315344125032425, "clip_ratio/low_min": 0.1315344125032425, "clip_ratio/high_mean": 0.03803516924381256, "clip_ratio/high_max": 0.03803516924381256, "clip_ratio/region_mean": 0.16956958174705505, "reward_total_mean": 0.468796968460083, "reward_meter_mean": 0.9746475219726562, "reward_meter_std": 0.024971460923552513, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.927332878112793, "reward_repeat_penalty_std": 0.09314508736133575, "reward_repeat_floor_mean": 0.9919474124908447, "reward_repeat_floor_std": 0.009451538324356079, "reward_near_duplicate_penalty_mean": 0.9778405427932739, "reward_near_duplicate_penalty_std": 0.012873595580458641, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9474591016769409, "reward_distinct_2_std": 0.08519522100687027, "reward_judge_quality_mean": 0.48249998688697815, "reward_judge_quality_std": 0.26222947239875793, "reward_total_composite_mean": 0.468796968460083, "reward_total_composite_std": 0.2625926434993744} {"timestamp_utc": "2026-04-12T17:10:23Z", "mode": "train", "global_step": 337, "epoch": 0.01773590863638756, "loss": 0.117, "grad_norm": 23.095705032348633, "learning_rate": 8.981818181818182e-06, "num_tokens": 630798.0, "completions/mean_length": 22.125, "completions/min_length": 18.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.125, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.6356936693191528, "rewards/meter/std": 0.4879623353481293, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.831250011920929, "rewards/judge_quality/std": 0.27559998631477356, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.49132412672042847, "rewards/total_composite/std": 0.4544740319252014, "reward": 0.49132412672042847, "reward_std": 0.4544740319252014, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13992170989513397, "sampling/sampling_logp_difference/max": 1.1954584121704102, "sampling/importance_sampling_ratio/min": 0.30256521701812744, "sampling/importance_sampling_ratio/mean": 1.0445661544799805, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.285483255982399, "clip_ratio/low_mean": 0.07399891968816519, "clip_ratio/low_min": 0.07399891968816519, "clip_ratio/high_mean": 0.07162698544561863, "clip_ratio/high_max": 0.07162698544561863, "clip_ratio/region_mean": 0.14562590513378382, "reward_total_mean": 0.49132412672042847, "reward_meter_mean": 0.6356936693191528, "reward_meter_std": 0.4879623353481293, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.831250011920929, "reward_judge_quality_std": 0.27559998631477356, "reward_total_composite_mean": 0.49132412672042847, "reward_total_composite_std": 0.4544740319252014} {"timestamp_utc": "2026-04-12T17:10:32Z", "mode": "train", "global_step": 338, "epoch": 0.01778853744539761, "loss": 0.0889, "grad_norm": 18.370445251464844, "learning_rate": 8.97878787878788e-06, "num_tokens": 632504.0, "completions/mean_length": 32.25, "completions/min_length": 29.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.25, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.305332213640213, "rewards/meter/std": 0.2746565639972687, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7350000143051147, "rewards/judge_quality/std": 0.2655990719795227, "rewards/repeat_penalty/mean": 0.9727151989936829, "rewards/repeat_penalty/std": 0.039194636046886444, "rewards/repeat_floor/mean": 0.9963968992233276, "rewards/repeat_floor/std": 0.004689360503107309, "rewards/near_duplicate_penalty/mean": 0.9814739227294922, "rewards/near_duplicate_penalty/std": 0.02053259313106537, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.25843459367752075, "rewards/total_composite/std": 0.2698877453804016, "reward": 0.25843459367752075, "reward_std": 0.2698877155780792, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1457429975271225, "sampling/sampling_logp_difference/max": 2.2974085807800293, "sampling/importance_sampling_ratio/min": 0.10051899403333664, "sampling/importance_sampling_ratio/mean": 0.991886556148529, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8547821119427681, "clip_ratio/low_mean": 0.07054067309945822, "clip_ratio/low_min": 0.07054067309945822, "clip_ratio/high_mean": 0.08742121048271656, "clip_ratio/high_max": 0.08742121048271656, "clip_ratio/region_mean": 0.15796188358217478, "reward_total_mean": 0.25843459367752075, "reward_meter_mean": 0.305332213640213, "reward_meter_std": 0.2746565639972687, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9727151989936829, "reward_repeat_penalty_std": 0.039194636046886444, "reward_repeat_floor_mean": 0.9963968992233276, "reward_repeat_floor_std": 0.004689360503107309, "reward_near_duplicate_penalty_mean": 0.9814739227294922, "reward_near_duplicate_penalty_std": 0.02053259313106537, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.7350000143051147, "reward_judge_quality_std": 0.2655990719795227, "reward_total_composite_mean": 0.25843459367752075, "reward_total_composite_std": 0.2698877453804016} {"timestamp_utc": "2026-04-12T17:10:43Z", "mode": "train", "global_step": 339, "epoch": 0.017841166254407664, "loss": 0.1405, "grad_norm": 5.842377185821533, "learning_rate": 8.975757575757577e-06, "num_tokens": 636055.0, "completions/mean_length": 232.875, "completions/min_length": 101.0, "completions/max_length": 264.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 232.875, "completions/min_terminated_length": 101.0, "completions/max_terminated_length": 264.0, "rewards/meter/mean": 0.7700097560882568, "rewards/meter/std": 0.2653079628944397, "rewards/count_adherence/mean": 0.7250000238418579, "rewards/count_adherence/std": 0.08864052593708038, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9175000190734863, "rewards/count_floor/std": 0.026592157781124115, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.612265944480896, "rewards/repeat_penalty/std": 0.3063110113143921, "rewards/repeat_floor/mean": 0.9568666219711304, "rewards/repeat_floor/std": 0.03775676712393761, "rewards/near_duplicate_penalty/mean": 0.92043137550354, "rewards/near_duplicate_penalty/std": 0.07240410894155502, "rewards/opening_diversity/mean": 0.990384578704834, "rewards/opening_diversity/std": 0.027196412906050682, "rewards/distinct_2/mean": 0.6597642302513123, "rewards/distinct_2/std": 0.2927972972393036, "rewards/total_composite/mean": 0.19891105592250824, "rewards/total_composite/std": 0.09404581040143967, "reward": 0.19891105592250824, "reward_std": 0.09404580295085907, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15775896608829498, "sampling/sampling_logp_difference/max": 1.7183837890625, "sampling/importance_sampling_ratio/min": 0.17935580015182495, "sampling/importance_sampling_ratio/mean": 1.028220534324646, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4751836135983467, "clip_ratio/low_mean": 0.05240679858252406, "clip_ratio/low_min": 0.05240679858252406, "clip_ratio/high_mean": 0.09283824265003204, "clip_ratio/high_max": 0.09283824265003204, "clip_ratio/region_mean": 0.1452450412325561, "reward_total_mean": 0.19891105592250824, "reward_meter_mean": 0.7700097560882568, "reward_meter_std": 0.2653079628944397, "reward_count_adherence_mean": 0.7250000238418579, "reward_count_adherence_std": 0.08864052593708038, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9175000190734863, "reward_count_floor_std": 0.026592157781124115, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.612265944480896, "reward_repeat_penalty_std": 0.3063110113143921, "reward_repeat_floor_mean": 0.9568666219711304, "reward_repeat_floor_std": 0.03775676712393761, "reward_near_duplicate_penalty_mean": 0.92043137550354, "reward_near_duplicate_penalty_std": 0.07240410894155502, "reward_opening_diversity_mean": 0.990384578704834, "reward_opening_diversity_std": 0.027196412906050682, "reward_distinct_2_mean": 0.6597642302513123, "reward_distinct_2_std": 0.2927972972393036, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.19891105592250824, "reward_total_composite_std": 0.09404581040143967} {"timestamp_utc": "2026-04-12T17:10:57Z", "mode": "train", "global_step": 340, "epoch": 0.017893795063417716, "loss": -0.1115, "grad_norm": 4.992883682250977, "learning_rate": 8.972727272727272e-06, "num_tokens": 638043.0, "completions/mean_length": 135.5, "completions/min_length": 68.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 81.71428680419922, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.6432020664215088, "rewards/meter/std": 0.38517627120018005, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.971875011920929, "rewards/count_floor/std": 0.05580177903175354, "rewards/lexical_plausibility/mean": 0.9695316553115845, "rewards/lexical_plausibility/std": 0.08617749065160751, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.9816516637802124, "rewards/repeat_penalty/std": 0.025329409167170525, "rewards/repeat_floor/mean": 0.9978464245796204, "rewards/repeat_floor/std": 0.002785325050354004, "rewards/near_duplicate_penalty/mean": 0.9918843507766724, "rewards/near_duplicate_penalty/std": 0.009686465375125408, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9895973801612854, "rewards/distinct_2/std": 0.01927127316594124, "rewards/total_composite/mean": 0.2468227744102478, "rewards/total_composite/std": 0.14359211921691895, "reward": 0.2468227744102478, "reward_std": 0.14359211921691895, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2102813720703125, "sampling/sampling_logp_difference/max": 2.0120761394500732, "sampling/importance_sampling_ratio/min": 0.13371077179908752, "sampling/importance_sampling_ratio/mean": 1.0276657342910767, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.608161985874176, "clip_ratio/low_mean": 0.051081934943795204, "clip_ratio/low_min": 0.051081934943795204, "clip_ratio/high_mean": 0.11457800958305597, "clip_ratio/high_max": 0.11457800958305597, "clip_ratio/region_mean": 0.16565994452685118, "reward_total_mean": 0.2468227744102478, "reward_meter_mean": 0.6432020664215088, "reward_meter_std": 0.38517627120018005, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.971875011920929, "reward_count_floor_std": 0.05580177903175354, "reward_lexical_plausibility_mean": 0.9695316553115845, "reward_lexical_plausibility_std": 0.08617749065160751, "reward_repeat_penalty_mean": 0.9816516637802124, "reward_repeat_penalty_std": 0.025329409167170525, "reward_repeat_floor_mean": 0.9978464245796204, "reward_repeat_floor_std": 0.002785325050354004, "reward_near_duplicate_penalty_mean": 0.9918843507766724, "reward_near_duplicate_penalty_std": 0.009686465375125408, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9895973801612854, "reward_distinct_2_std": 0.01927127316594124, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.2468227744102478, "reward_total_composite_std": 0.14359211921691895} {"timestamp_utc": "2026-04-12T17:11:05Z", "mode": "train", "global_step": 341, "epoch": 0.01794642387242777, "loss": -0.0248, "grad_norm": 14.611605644226074, "learning_rate": 8.969696969696971e-06, "num_tokens": 639705.0, "completions/mean_length": 37.75, "completions/min_length": 33.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.75, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.9741537570953369, "rewards/meter/std": 0.018269570544362068, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3837500214576721, "rewards/judge_quality/std": 0.24076886475086212, "rewards/repeat_penalty/mean": 0.9834984540939331, "rewards/repeat_penalty/std": 0.04450032487511635, "rewards/repeat_floor/mean": 0.9979462623596191, "rewards/repeat_floor/std": 0.005484189372509718, "rewards/near_duplicate_penalty/mean": 0.9913252592086792, "rewards/near_duplicate_penalty/std": 0.022403746843338013, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.37501412630081177, "rewards/total_composite/std": 0.23986515402793884, "reward": 0.37501412630081177, "reward_std": 0.23986515402793884, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19988596439361572, "sampling/sampling_logp_difference/max": 1.6068944931030273, "sampling/importance_sampling_ratio/min": 0.20050933957099915, "sampling/importance_sampling_ratio/mean": 0.9957857728004456, "sampling/importance_sampling_ratio/max": 1.8379789590835571, "entropy": 1.989799588918686, "clip_ratio/low_mean": 0.09782019723206758, "clip_ratio/low_min": 0.09782019723206758, "clip_ratio/high_mean": 0.053601814433932304, "clip_ratio/high_max": 0.053601814433932304, "clip_ratio/region_mean": 0.1514220116659999, "reward_total_mean": 0.37501412630081177, "reward_meter_mean": 0.9741537570953369, "reward_meter_std": 0.018269570544362068, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9834984540939331, "reward_repeat_penalty_std": 0.04450032487511635, "reward_repeat_floor_mean": 0.9979462623596191, "reward_repeat_floor_std": 0.005484189372509718, "reward_near_duplicate_penalty_mean": 0.9913252592086792, "reward_near_duplicate_penalty_std": 0.022403746843338013, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.3837500214576721, "reward_judge_quality_std": 0.24076886475086212, "reward_total_composite_mean": 0.37501412630081177, "reward_total_composite_std": 0.23986515402793884} {"timestamp_utc": "2026-04-12T17:11:19Z", "mode": "train", "global_step": 342, "epoch": 0.017999052681437817, "loss": -0.0887, "grad_norm": 5.5700602531433105, "learning_rate": 8.966666666666667e-06, "num_tokens": 641231.0, "completions/mean_length": 97.75, "completions/min_length": 28.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.57143020629883, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.8387867212295532, "rewards/meter/std": 0.33959174156188965, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9402444958686829, "rewards/lexical_plausibility/std": 0.11721032857894897, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.1767766922712326, "rewards/repeat_penalty/mean": 0.9470990896224976, "rewards/repeat_penalty/std": 0.11002103984355927, "rewards/repeat_floor/mean": 0.9949995279312134, "rewards/repeat_floor/std": 0.008322611451148987, "rewards/near_duplicate_penalty/mean": 0.9852362871170044, "rewards/near_duplicate_penalty/std": 0.013277208432555199, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.2696087956428528, "rewards/total_composite/std": 0.18130116164684296, "reward": 0.2696087956428528, "reward_std": 0.18130116164684296, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2047036588191986, "sampling/sampling_logp_difference/max": 2.1100409030914307, "sampling/importance_sampling_ratio/min": 0.1212330088019371, "sampling/importance_sampling_ratio/mean": 1.0251104831695557, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3973510414361954, "clip_ratio/low_mean": 0.08008603379130363, "clip_ratio/low_min": 0.08008603379130363, "clip_ratio/high_mean": 0.07942503038793802, "clip_ratio/high_max": 0.07942503038793802, "clip_ratio/region_mean": 0.15951106417924166, "reward_total_mean": 0.2696087956428528, "reward_meter_mean": 0.8387867212295532, "reward_meter_std": 0.33959174156188965, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9402444958686829, "reward_lexical_plausibility_std": 0.11721032857894897, "reward_repeat_penalty_mean": 0.9470990896224976, "reward_repeat_penalty_std": 0.11002103984355927, "reward_repeat_floor_mean": 0.9949995279312134, "reward_repeat_floor_std": 0.008322611451148987, "reward_near_duplicate_penalty_mean": 0.9852362871170044, "reward_near_duplicate_penalty_std": 0.013277208432555199, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.1767766922712326, "reward_total_composite_mean": 0.2696087956428528, "reward_total_composite_std": 0.18130116164684296} {"timestamp_utc": "2026-04-12T17:11:26Z", "mode": "train", "global_step": 343, "epoch": 0.01805168149044787, "loss": -0.119, "grad_norm": 30.251667022705078, "learning_rate": 8.963636363636364e-06, "num_tokens": 642400.0, "completions/mean_length": 18.125, "completions/min_length": 14.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.125, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.3097136318683624, "rewards/meter/std": 0.4110397696495056, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6549999713897705, "rewards/judge_quality/std": 0.30603456497192383, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20622941851615906, "rewards/total_composite/std": 0.3088410496711731, "reward": 0.20622941851615906, "reward_std": 0.3088410496711731, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1320803165435791, "sampling/sampling_logp_difference/max": 1.0534849166870117, "sampling/importance_sampling_ratio/min": 0.34872034192085266, "sampling/importance_sampling_ratio/mean": 0.9990514516830444, "sampling/importance_sampling_ratio/max": 1.5801866054534912, "entropy": 1.2459015175700188, "clip_ratio/low_mean": 0.08357597421854734, "clip_ratio/low_min": 0.08357597421854734, "clip_ratio/high_mean": 0.028125000186264515, "clip_ratio/high_max": 0.028125000186264515, "clip_ratio/region_mean": 0.11170097440481186, "reward_total_mean": 0.20622941851615906, "reward_meter_mean": 0.3097136318683624, "reward_meter_std": 0.4110397696495056, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6549999713897705, "reward_judge_quality_std": 0.30603456497192383, "reward_total_composite_mean": 0.20622941851615906, "reward_total_composite_std": 0.3088410496711731} {"timestamp_utc": "2026-04-12T17:11:35Z", "mode": "train", "global_step": 344, "epoch": 0.018104310299457922, "loss": -0.0041, "grad_norm": 20.964290618896484, "learning_rate": 8.960606060606061e-06, "num_tokens": 643931.0, "completions/mean_length": 31.375, "completions/min_length": 28.0, "completions/max_length": 34.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.375, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 34.0, "rewards/meter/mean": 0.6057028770446777, "rewards/meter/std": 0.3872171640396118, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9916572570800781, "rewards/lexical_plausibility/std": 0.023596882820129395, "rewards/judge_quality/mean": 0.5337499976158142, "rewards/judge_quality/std": 0.23445606231689453, "rewards/repeat_penalty/mean": 0.9896930456161499, "rewards/repeat_penalty/std": 0.017976956441998482, "rewards/repeat_floor/mean": 0.9984539747238159, "rewards/repeat_floor/std": 0.0026965467259287834, "rewards/near_duplicate_penalty/mean": 0.9896930456161499, "rewards/near_duplicate_penalty/std": 0.017976956441998482, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3533518314361572, "rewards/total_composite/std": 0.29671037197113037, "reward": 0.3533518314361572, "reward_std": 0.29671037197113037, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18388763070106506, "sampling/sampling_logp_difference/max": 2.3177013397216797, "sampling/importance_sampling_ratio/min": 0.09849974513053894, "sampling/importance_sampling_ratio/mean": 1.0307540893554688, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1475198790431023, "clip_ratio/low_mean": 0.09939177334308624, "clip_ratio/low_min": 0.09939177334308624, "clip_ratio/high_mean": 0.09572322852909565, "clip_ratio/high_max": 0.09572322852909565, "clip_ratio/region_mean": 0.1951150018721819, "reward_total_mean": 0.3533518314361572, "reward_meter_mean": 0.6057028770446777, "reward_meter_std": 0.3872171640396118, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9916572570800781, "reward_lexical_plausibility_std": 0.023596882820129395, "reward_repeat_penalty_mean": 0.9896930456161499, "reward_repeat_penalty_std": 0.017976956441998482, "reward_repeat_floor_mean": 0.9984539747238159, "reward_repeat_floor_std": 0.0026965467259287834, "reward_near_duplicate_penalty_mean": 0.9896930456161499, "reward_near_duplicate_penalty_std": 0.017976956441998482, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5337499976158142, "reward_judge_quality_std": 0.23445606231689453, "reward_total_composite_mean": 0.3533518314361572, "reward_total_composite_std": 0.29671037197113037} {"timestamp_utc": "2026-04-12T17:11:43Z", "mode": "train", "global_step": 345, "epoch": 0.018156939108467975, "loss": 0.2317, "grad_norm": 15.436206817626953, "learning_rate": 8.957575757575758e-06, "num_tokens": 645505.0, "completions/mean_length": 44.75, "completions/min_length": 32.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.75, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.422957181930542, "rewards/meter/std": 0.37584730982780457, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9929937124252319, "rewards/repeat_penalty/std": 0.01794723980128765, "rewards/repeat_floor/mean": 0.9989490509033203, "rewards/repeat_floor/std": 0.0026920896489173174, "rewards/near_duplicate_penalty/mean": 0.9929937124252319, "rewards/near_duplicate_penalty/std": 0.01794723980128765, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1952688992023468, "rewards/total_composite/std": 0.1663089394569397, "reward": 0.1952688992023468, "reward_std": 0.1663089245557785, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1889335960149765, "sampling/sampling_logp_difference/max": 1.4973969459533691, "sampling/importance_sampling_ratio/min": 0.2237117439508438, "sampling/importance_sampling_ratio/mean": 1.0012470483779907, "sampling/importance_sampling_ratio/max": 1.9571013450622559, "entropy": 1.4239961951971054, "clip_ratio/low_mean": 0.0805791518650949, "clip_ratio/low_min": 0.0805791518650949, "clip_ratio/high_mean": 0.056426698341965675, "clip_ratio/high_max": 0.056426698341965675, "clip_ratio/region_mean": 0.13700585020706058, "reward_total_mean": 0.1952688992023468, "reward_meter_mean": 0.422957181930542, "reward_meter_std": 0.37584730982780457, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9929937124252319, "reward_repeat_penalty_std": 0.01794723980128765, "reward_repeat_floor_mean": 0.9989490509033203, "reward_repeat_floor_std": 0.0026920896489173174, "reward_near_duplicate_penalty_mean": 0.9929937124252319, "reward_near_duplicate_penalty_std": 0.01794723980128765, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.1952688992023468, "reward_total_composite_std": 0.1663089394569397} {"timestamp_utc": "2026-04-12T17:11:57Z", "mode": "train", "global_step": 346, "epoch": 0.018209567917478027, "loss": -0.2181, "grad_norm": 2.4873247146606445, "learning_rate": 8.954545454545456e-06, "num_tokens": 647715.0, "completions/mean_length": 225.25, "completions/min_length": 118.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 129.6666717529297, "completions/min_terminated_length": 118.0, "completions/max_terminated_length": 155.0, "rewards/meter/mean": 0.8998244404792786, "rewards/meter/std": 0.1816522479057312, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9474999904632568, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.9143241047859192, "rewards/lexical_plausibility/std": 0.16443945467472076, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.852328896522522, "rewards/repeat_penalty/std": 0.2978889048099518, "rewards/repeat_floor/mean": 0.9822715520858765, "rewards/repeat_floor/std": 0.03648386895656586, "rewards/near_duplicate_penalty/mean": 0.9550489187240601, "rewards/near_duplicate_penalty/std": 0.08249100297689438, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8987692594528198, "rewards/distinct_2/std": 0.2097814381122589, "rewards/total_composite/mean": 0.29176658391952515, "rewards/total_composite/std": 0.16676844656467438, "reward": 0.29176658391952515, "reward_std": 0.16676846146583557, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19190363585948944, "sampling/sampling_logp_difference/max": 1.6605510711669922, "sampling/importance_sampling_ratio/min": 0.19003422558307648, "sampling/importance_sampling_ratio/mean": 1.0319976806640625, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.504880130290985, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.1571525987237692, "clip_ratio/high_max": 0.1571525987237692, "clip_ratio/region_mean": 0.1571525987237692, "reward_total_mean": 0.29176658391952515, "reward_meter_mean": 0.8998244404792786, "reward_meter_std": 0.1816522479057312, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9474999904632568, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.9143241047859192, "reward_lexical_plausibility_std": 0.16443945467472076, "reward_repeat_penalty_mean": 0.852328896522522, "reward_repeat_penalty_std": 0.2978889048099518, "reward_repeat_floor_mean": 0.9822715520858765, "reward_repeat_floor_std": 0.03648386895656586, "reward_near_duplicate_penalty_mean": 0.9550489187240601, "reward_near_duplicate_penalty_std": 0.08249100297689438, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8987692594528198, "reward_distinct_2_std": 0.2097814381122589, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.29176658391952515, "reward_total_composite_std": 0.16676844656467438} {"timestamp_utc": "2026-04-12T17:12:04Z", "mode": "train", "global_step": 347, "epoch": 0.01826219672648808, "loss": -0.0315, "grad_norm": 29.22102165222168, "learning_rate": 8.951515151515153e-06, "num_tokens": 649136.0, "completions/mean_length": 18.625, "completions/min_length": 14.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.625, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.6110738515853882, "rewards/meter/std": 0.48206010460853577, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.9387500286102295, "rewards/judge_quality/std": 0.015526460483670235, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5648782849311829, "rewards/total_composite/std": 0.44622117280960083, "reward": 0.5648782849311829, "reward_std": 0.44622117280960083, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18010105192661285, "sampling/sampling_logp_difference/max": 1.4136180877685547, "sampling/importance_sampling_ratio/min": 0.24326156079769135, "sampling/importance_sampling_ratio/mean": 1.022800326347351, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3609361499547958, "clip_ratio/low_mean": 0.044903927482664585, "clip_ratio/low_min": 0.044903927482664585, "clip_ratio/high_mean": 0.11353801470249891, "clip_ratio/high_max": 0.11353801470249891, "clip_ratio/region_mean": 0.1584419421851635, "reward_total_mean": 0.5648782849311829, "reward_meter_mean": 0.6110738515853882, "reward_meter_std": 0.48206010460853577, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9387500286102295, "reward_judge_quality_std": 0.015526460483670235, "reward_total_composite_mean": 0.5648782849311829, "reward_total_composite_std": 0.44622117280960083} {"timestamp_utc": "2026-04-12T17:12:12Z", "mode": "train", "global_step": 348, "epoch": 0.018314825535498132, "loss": 0.1019, "grad_norm": 16.159345626831055, "learning_rate": 8.94848484848485e-06, "num_tokens": 650959.0, "completions/mean_length": 37.875, "completions/min_length": 35.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.875, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.6884497404098511, "rewards/meter/std": 0.3094226121902466, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.3046778440475464, "rewards/repeat_penalty/mean": 0.8826597929000854, "rewards/repeat_penalty/std": 0.2535805404186249, "rewards/repeat_floor/mean": 0.9875184297561646, "rewards/repeat_floor/std": 0.024994323030114174, "rewards/near_duplicate_penalty/mean": 0.9620068073272705, "rewards/near_duplicate_penalty/std": 0.056380949914455414, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9454711675643921, "rewards/distinct_2/std": 0.12832939624786377, "rewards/total_composite/mean": 0.4540812373161316, "rewards/total_composite/std": 0.35023945569992065, "reward": 0.4540812373161316, "reward_std": 0.35023942589759827, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1531946212053299, "sampling/sampling_logp_difference/max": 1.2673401832580566, "sampling/importance_sampling_ratio/min": 0.2815795838832855, "sampling/importance_sampling_ratio/mean": 1.0411983728408813, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1304955556988716, "clip_ratio/low_mean": 0.094660934060812, "clip_ratio/low_min": 0.094660934060812, "clip_ratio/high_mean": 0.03898809617385268, "clip_ratio/high_max": 0.03898809617385268, "clip_ratio/region_mean": 0.13364903023466468, "reward_total_mean": 0.4540812373161316, "reward_meter_mean": 0.6884497404098511, "reward_meter_std": 0.3094226121902466, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8826597929000854, "reward_repeat_penalty_std": 0.2535805404186249, "reward_repeat_floor_mean": 0.9875184297561646, "reward_repeat_floor_std": 0.024994323030114174, "reward_near_duplicate_penalty_mean": 0.9620068073272705, "reward_near_duplicate_penalty_std": 0.056380949914455414, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9454711675643921, "reward_distinct_2_std": 0.12832939624786377, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.3046778440475464, "reward_total_composite_mean": 0.4540812373161316, "reward_total_composite_std": 0.35023945569992065} {"timestamp_utc": "2026-04-12T17:12:20Z", "mode": "train", "global_step": 349, "epoch": 0.018367454344508184, "loss": 0.0321, "grad_norm": 16.422067642211914, "learning_rate": 8.945454545454546e-06, "num_tokens": 652502.0, "completions/mean_length": 40.875, "completions/min_length": 37.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.875, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.7101024389266968, "rewards/meter/std": 0.38420072197914124, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5249999761581421, "rewards/judge_quality/std": 0.23628070950508118, "rewards/repeat_penalty/mean": 0.9426225423812866, "rewards/repeat_penalty/std": 0.14379814267158508, "rewards/repeat_floor/mean": 0.9940041899681091, "rewards/repeat_floor/std": 0.014206590130925179, "rewards/near_duplicate_penalty/mean": 0.9830174446105957, "rewards/near_duplicate_penalty/std": 0.030583709478378296, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.3415525257587433, "rewards/total_composite/std": 0.24239085614681244, "reward": 0.3415525257587433, "reward_std": 0.24239085614681244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17797724902629852, "sampling/sampling_logp_difference/max": 1.420872688293457, "sampling/importance_sampling_ratio/min": 0.24150317907333374, "sampling/importance_sampling_ratio/mean": 1.0511341094970703, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.652133971452713, "clip_ratio/low_mean": 0.04242530930787325, "clip_ratio/low_min": 0.04242530930787325, "clip_ratio/high_mean": 0.0944294249638915, "clip_ratio/high_max": 0.0944294249638915, "clip_ratio/region_mean": 0.13685473427176476, "reward_total_mean": 0.3415525257587433, "reward_meter_mean": 0.7101024389266968, "reward_meter_std": 0.38420072197914124, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9426225423812866, "reward_repeat_penalty_std": 0.14379814267158508, "reward_repeat_floor_mean": 0.9940041899681091, "reward_repeat_floor_std": 0.014206590130925179, "reward_near_duplicate_penalty_mean": 0.9830174446105957, "reward_near_duplicate_penalty_std": 0.030583709478378296, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.5249999761581421, "reward_judge_quality_std": 0.23628070950508118, "reward_total_composite_mean": 0.3415525257587433, "reward_total_composite_std": 0.24239085614681244} {"timestamp_utc": "2026-04-12T17:12:30Z", "mode": "train", "global_step": 350, "epoch": 0.018420083153518237, "loss": 0.1157, "grad_norm": 12.64472484588623, "learning_rate": 8.942424242424243e-06, "num_tokens": 654296.0, "completions/mean_length": 60.25, "completions/min_length": 50.0, "completions/max_length": 79.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.25, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.5088467001914978, "rewards/meter/std": 0.29301485419273376, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9579846262931824, "rewards/repeat_penalty/std": 0.06559336185455322, "rewards/repeat_floor/mean": 0.9949827194213867, "rewards/repeat_floor/std": 0.00734906317666173, "rewards/near_duplicate_penalty/mean": 0.981090784072876, "rewards/near_duplicate_penalty/std": 0.023007508367300034, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9757676720619202, "rewards/distinct_2/std": 0.051502835005521774, "rewards/total_composite/mean": 0.16552507877349854, "rewards/total_composite/std": 0.1121489629149437, "reward": 0.16552507877349854, "reward_std": 0.1121489554643631, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18388310074806213, "sampling/sampling_logp_difference/max": 1.8387489318847656, "sampling/importance_sampling_ratio/min": 0.15901625156402588, "sampling/importance_sampling_ratio/mean": 1.0285263061523438, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.589398980140686, "clip_ratio/low_mean": 0.09163669403642416, "clip_ratio/low_min": 0.09163669403642416, "clip_ratio/high_mean": 0.06783670000731945, "clip_ratio/high_max": 0.06783670000731945, "clip_ratio/region_mean": 0.1594733940437436, "reward_total_mean": 0.16552507877349854, "reward_meter_mean": 0.5088467001914978, "reward_meter_std": 0.29301485419273376, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9579846262931824, "reward_repeat_penalty_std": 0.06559336185455322, "reward_repeat_floor_mean": 0.9949827194213867, "reward_repeat_floor_std": 0.00734906317666173, "reward_near_duplicate_penalty_mean": 0.981090784072876, "reward_near_duplicate_penalty_std": 0.023007508367300034, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9757676720619202, "reward_distinct_2_std": 0.051502835005521774, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.16552507877349854, "reward_total_composite_std": 0.1121489629149437} {"timestamp_utc": "2026-04-12T17:14:55Z", "mode": "eval", "global_step": 350, "epoch": 0.018420083153518237, "eval_loss": NaN, "eval_runtime": 144.7598, "eval_samples_per_second": 0.718, "eval_steps_per_second": 0.09, "eval_num_tokens": 654296.0, "eval_completions/mean_length": 191.83653846153845, "eval_completions/min_length": 38.46153846153846, "eval_completions/max_length": 456.15384615384613, "eval_completions/clipped_ratio": 0.10576923076923077, "eval_completions/mean_terminated_length": 153.97482182429388, "eval_completions/min_terminated_length": 38.46153846153846, "eval_completions/max_terminated_length": 326.38461538461536, "eval_rewards/meter/mean": 0.6187796180064862, "eval_rewards/meter/std": 0.3389004170894623, "eval_rewards/count_adherence/mean": 0.8130821356406579, "eval_rewards/count_adherence/std": 0.17862427234649658, "eval_rewards/arabic_clean/mean": 0.7884615384615384, "eval_rewards/arabic_clean/std": 0.4020594083345853, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9942307655627911, "eval_rewards/arabic_floor/std": 0.01350019184442667, "eval_rewards/count_floor/mean": 0.9439246425261865, "eval_rewards/count_floor/std": 0.05358728565848791, "eval_rewards/lexical_plausibility/mean": 0.9635053460414593, "eval_rewards/lexical_plausibility/std": 0.08824307564646006, "eval_rewards/judge_quality/mean": 0.3454807652876927, "eval_rewards/judge_quality/std": 0.21029764815018728, "eval_rewards/repeat_penalty/mean": 0.7776802594845111, "eval_rewards/repeat_penalty/std": 0.29088544043210834, "eval_rewards/repeat_floor/mean": 0.9749004519902743, "eval_rewards/repeat_floor/std": 0.03472641851896277, "eval_rewards/near_duplicate_penalty/mean": 0.9483849773040185, "eval_rewards/near_duplicate_penalty/std": 0.06695309152396825, "eval_rewards/opening_diversity/mean": 0.9860931359804593, "eval_rewards/opening_diversity/std": 0.03646333916829182, "eval_rewards/distinct_2/mean": 0.8164123571836032, "eval_rewards/distinct_2/std": 0.27630343202214974, "eval_rewards/total_composite/mean": 0.20006298101865327, "eval_rewards/total_composite/std": 0.18831274658441544, "eval_reward": 0.20006298101865327, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.1004102614063483, "eval_sampling/sampling_logp_difference/max": 1.3372466747577374, "eval_sampling/importance_sampling_ratio/min": 0.26711086011849916, "eval_sampling/importance_sampling_ratio/mean": 1.0299167449657733, "eval_sampling/importance_sampling_ratio/max": 1.6205786374899058, "eval_entropy": 1.29667682831104, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.20006298101865327, "eval_reward_meter_mean": 0.6187796180064862, "eval_reward_meter_std": 0.3389004170894623, "eval_reward_count_adherence_mean": 0.8130821356406579, "eval_reward_count_adherence_std": 0.17862427234649658, "eval_reward_arabic_clean_mean": 0.7884615384615384, "eval_reward_arabic_clean_std": 0.4020594083345853, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9942307655627911, "eval_reward_arabic_floor_std": 0.01350019184442667, "eval_reward_count_floor_mean": 0.9439246425261865, "eval_reward_count_floor_std": 0.05358728565848791, "eval_reward_lexical_plausibility_mean": 0.9635053460414593, "eval_reward_lexical_plausibility_std": 0.08824307564646006, "eval_reward_repeat_penalty_mean": 0.7776802594845111, "eval_reward_repeat_penalty_std": 0.29088544043210834, "eval_reward_repeat_floor_mean": 0.9749004519902743, "eval_reward_repeat_floor_std": 0.03472641851896277, "eval_reward_near_duplicate_penalty_mean": 0.9483849773040185, "eval_reward_near_duplicate_penalty_std": 0.06695309152396825, "eval_reward_opening_diversity_mean": 0.9860931359804593, "eval_reward_opening_diversity_std": 0.03646333916829182, "eval_reward_distinct_2_mean": 0.8164123571836032, "eval_reward_distinct_2_std": 0.27630343202214974, "eval_reward_judge_quality_mean": 0.3454807652876927, "eval_reward_judge_quality_std": 0.21029764815018728, "eval_reward_total_composite_mean": 0.20006298101865327, "eval_reward_total_composite_std": 0.18831274658441544} {"timestamp_utc": "2026-04-12T17:15:08Z", "mode": "train", "global_step": 351, "epoch": 0.01847271196252829, "loss": 0.0068, "grad_norm": 10.76603889465332, "learning_rate": 8.93939393939394e-06, "num_tokens": 656400.0, "completions/mean_length": 89.0, "completions/min_length": 64.0, "completions/max_length": 116.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 89.0, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 116.0, "rewards/meter/mean": 0.5040855407714844, "rewards/meter/std": 0.3973883092403412, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9718749523162842, "rewards/count_floor/std": 0.0388161838054657, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.7608175277709961, "rewards/repeat_penalty/std": 0.17903673648834229, "rewards/repeat_floor/mean": 0.9755060076713562, "rewards/repeat_floor/std": 0.01765604317188263, "rewards/near_duplicate_penalty/mean": 0.9422729015350342, "rewards/near_duplicate_penalty/std": 0.04892025515437126, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8240566253662109, "rewards/distinct_2/std": 0.12574154138565063, "rewards/total_composite/mean": 0.19187957048416138, "rewards/total_composite/std": 0.15353643894195557, "reward": 0.19187957048416138, "reward_std": 0.15353643894195557, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18777593970298767, "sampling/sampling_logp_difference/max": 1.54642915725708, "sampling/importance_sampling_ratio/min": 0.21300722658634186, "sampling/importance_sampling_ratio/mean": 1.0208381414413452, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6547548472881317, "clip_ratio/low_mean": 0.07881247438490391, "clip_ratio/low_min": 0.07881247438490391, "clip_ratio/high_mean": 0.11248178035020828, "clip_ratio/high_max": 0.11248178035020828, "clip_ratio/region_mean": 0.1912942547351122, "reward_total_mean": 0.19187957048416138, "reward_meter_mean": 0.5040855407714844, "reward_meter_std": 0.3973883092403412, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9718749523162842, "reward_count_floor_std": 0.0388161838054657, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7608175277709961, "reward_repeat_penalty_std": 0.17903673648834229, "reward_repeat_floor_mean": 0.9755060076713562, "reward_repeat_floor_std": 0.01765604317188263, "reward_near_duplicate_penalty_mean": 0.9422729015350342, "reward_near_duplicate_penalty_std": 0.04892025515437126, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8240566253662109, "reward_distinct_2_std": 0.12574154138565063, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.19187957048416138, "reward_total_composite_std": 0.15353643894195557} {"timestamp_utc": "2026-04-12T17:15:17Z", "mode": "train", "global_step": 352, "epoch": 0.01852534077153834, "loss": -0.1344, "grad_norm": 19.398202896118164, "learning_rate": 8.936363636363638e-06, "num_tokens": 657769.0, "completions/mean_length": 24.125, "completions/min_length": 17.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.125, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.9638572335243225, "rewards/meter/std": 0.07437514513731003, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.3620477616786957, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.631958544254303, "rewards/total_composite/std": 0.34043869376182556, "reward": 0.631958544254303, "reward_std": 0.3404386639595032, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18029649555683136, "sampling/sampling_logp_difference/max": 1.8325433731079102, "sampling/importance_sampling_ratio/min": 0.1600060909986496, "sampling/importance_sampling_ratio/mean": 1.0404987335205078, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6146266758441925, "clip_ratio/low_mean": 0.08503377623856068, "clip_ratio/low_min": 0.08503377623856068, "clip_ratio/high_mean": 0.11602690163999796, "clip_ratio/high_max": 0.11602690163999796, "clip_ratio/region_mean": 0.20106067787855864, "reward_total_mean": 0.631958544254303, "reward_meter_mean": 0.9638572335243225, "reward_meter_std": 0.07437514513731003, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.3620477616786957, "reward_total_composite_mean": 0.631958544254303, "reward_total_composite_std": 0.34043869376182556} {"timestamp_utc": "2026-04-12T17:15:25Z", "mode": "train", "global_step": 353, "epoch": 0.018577969580548394, "loss": 0.015, "grad_norm": 16.73836326599121, "learning_rate": 8.933333333333333e-06, "num_tokens": 659380.0, "completions/mean_length": 27.375, "completions/min_length": 21.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.375, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.6578106880187988, "rewards/meter/std": 0.3674665093421936, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9607843160629272, "rewards/lexical_plausibility/std": 0.11091870814561844, "rewards/judge_quality/mean": 0.8762500286102295, "rewards/judge_quality/std": 0.1728696972131729, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5581198334693909, "rewards/total_composite/std": 0.34355735778808594, "reward": 0.5581198334693909, "reward_std": 0.3435573875904083, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1278843730688095, "sampling/sampling_logp_difference/max": 1.219208002090454, "sampling/importance_sampling_ratio/min": 0.29546409845352173, "sampling/importance_sampling_ratio/mean": 0.9870318174362183, "sampling/importance_sampling_ratio/max": 1.876649022102356, "entropy": 1.0078953579068184, "clip_ratio/low_mean": 0.06661266321316361, "clip_ratio/low_min": 0.06661266321316361, "clip_ratio/high_mean": 0.039164246525615454, "clip_ratio/high_max": 0.039164246525615454, "clip_ratio/region_mean": 0.10577690973877907, "reward_total_mean": 0.5581198334693909, "reward_meter_mean": 0.6578106880187988, "reward_meter_std": 0.3674665093421936, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9607843160629272, "reward_lexical_plausibility_std": 0.11091870814561844, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8762500286102295, "reward_judge_quality_std": 0.1728696972131729, "reward_total_composite_mean": 0.5581198334693909, "reward_total_composite_std": 0.34355735778808594} {"timestamp_utc": "2026-04-12T17:15:35Z", "mode": "train", "global_step": 354, "epoch": 0.018630598389558443, "loss": 0.0475, "grad_norm": 15.901016235351562, "learning_rate": 8.930303030303032e-06, "num_tokens": 661002.0, "completions/mean_length": 40.75, "completions/min_length": 35.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.75, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.6143783926963806, "rewards/meter/std": 0.3755393624305725, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6262499690055847, "rewards/judge_quality/std": 0.2602711617946625, "rewards/repeat_penalty/mean": 0.9787507057189941, "rewards/repeat_penalty/std": 0.017217284068465233, "rewards/repeat_floor/mean": 0.9968125820159912, "rewards/repeat_floor/std": 0.0025825840421020985, "rewards/near_duplicate_penalty/mean": 0.9787507057189941, "rewards/near_duplicate_penalty/std": 0.017217284068465233, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.38773494958877563, "rewards/total_composite/std": 0.2940836548805237, "reward": 0.38773494958877563, "reward_std": 0.2940836548805237, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14339789748191833, "sampling/sampling_logp_difference/max": 1.6837506294250488, "sampling/importance_sampling_ratio/min": 0.18567626178264618, "sampling/importance_sampling_ratio/mean": 1.0196411609649658, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.055018775165081, "clip_ratio/low_mean": 0.05689931521192193, "clip_ratio/low_min": 0.05689931521192193, "clip_ratio/high_mean": 0.041463456116616726, "clip_ratio/high_max": 0.041463456116616726, "clip_ratio/region_mean": 0.09836277132853866, "reward_total_mean": 0.38773494958877563, "reward_meter_mean": 0.6143783926963806, "reward_meter_std": 0.3755393624305725, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9787507057189941, "reward_repeat_penalty_std": 0.017217284068465233, "reward_repeat_floor_mean": 0.9968125820159912, "reward_repeat_floor_std": 0.0025825840421020985, "reward_near_duplicate_penalty_mean": 0.9787507057189941, "reward_near_duplicate_penalty_std": 0.017217284068465233, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6262499690055847, "reward_judge_quality_std": 0.2602711617946625, "reward_total_composite_mean": 0.38773494958877563, "reward_total_composite_std": 0.2940836548805237} {"timestamp_utc": "2026-04-12T17:15:45Z", "mode": "train", "global_step": 355, "epoch": 0.018683227198568495, "loss": 0.0311, "grad_norm": 9.03620719909668, "learning_rate": 8.927272727272728e-06, "num_tokens": 663476.0, "completions/mean_length": 115.25, "completions/min_length": 92.0, "completions/max_length": 127.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.25, "completions/min_terminated_length": 92.0, "completions/max_terminated_length": 127.0, "rewards/meter/mean": 0.6599809527397156, "rewards/meter/std": 0.3750666379928589, "rewards/count_adherence/mean": 0.9249999523162842, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9775000214576721, "rewards/count_floor/std": 0.031052952632308006, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.8529702425003052, "rewards/repeat_penalty/std": 0.15573084354400635, "rewards/repeat_floor/mean": 0.9831531643867493, "rewards/repeat_floor/std": 0.01928114704787731, "rewards/near_duplicate_penalty/mean": 0.9558294415473938, "rewards/near_duplicate_penalty/std": 0.05347747728228569, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8864303827285767, "rewards/distinct_2/std": 0.1275208294391632, "rewards/total_composite/mean": 0.17257274687290192, "rewards/total_composite/std": 0.1348387449979782, "reward": 0.17257274687290192, "reward_std": 0.1348387449979782, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1767425537109375, "sampling/sampling_logp_difference/max": 1.6581840515136719, "sampling/importance_sampling_ratio/min": 0.19048456847667694, "sampling/importance_sampling_ratio/mean": 1.031744360923767, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7184740453958511, "clip_ratio/low_mean": 0.11004908289760351, "clip_ratio/low_min": 0.11004908289760351, "clip_ratio/high_mean": 0.05548185668885708, "clip_ratio/high_max": 0.05548185668885708, "clip_ratio/region_mean": 0.1655309395864606, "reward_total_mean": 0.17257274687290192, "reward_meter_mean": 0.6599809527397156, "reward_meter_std": 0.3750666379928589, "reward_count_adherence_mean": 0.9249999523162842, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9775000214576721, "reward_count_floor_std": 0.031052952632308006, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.8529702425003052, "reward_repeat_penalty_std": 0.15573084354400635, "reward_repeat_floor_mean": 0.9831531643867493, "reward_repeat_floor_std": 0.01928114704787731, "reward_near_duplicate_penalty_mean": 0.9558294415473938, "reward_near_duplicate_penalty_std": 0.05347747728228569, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8864303827285767, "reward_distinct_2_std": 0.1275208294391632, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.17257274687290192, "reward_total_composite_std": 0.1348387449979782} {"timestamp_utc": "2026-04-12T17:15:59Z", "mode": "train", "global_step": 356, "epoch": 0.018735856007578548, "loss": -0.0711, "grad_norm": 5.177454948425293, "learning_rate": 8.924242424242425e-06, "num_tokens": 665124.0, "completions/mean_length": 108.0, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 50.28571701049805, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.7517337799072266, "rewards/meter/std": 0.4055202305316925, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9301379323005676, "rewards/lexical_plausibility/std": 0.16398213803768158, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.23868316411972046, "rewards/repeat_penalty/mean": 0.95414799451828, "rewards/repeat_penalty/std": 0.0918140634894371, "rewards/repeat_floor/mean": 0.9965232014656067, "rewards/repeat_floor/std": 0.006406393367797136, "rewards/near_duplicate_penalty/mean": 0.9957316517829895, "rewards/near_duplicate_penalty/std": 0.011526302434504032, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.37034597992897034, "rewards/total_composite/std": 0.26873478293418884, "reward": 0.37034597992897034, "reward_std": 0.26873478293418884, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16878367960453033, "sampling/sampling_logp_difference/max": 1.2176623344421387, "sampling/importance_sampling_ratio/min": 0.2959211468696594, "sampling/importance_sampling_ratio/mean": 1.0150970220565796, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3488233089447021, "clip_ratio/low_mean": 0.05135582014918327, "clip_ratio/low_min": 0.05135582014918327, "clip_ratio/high_mean": 0.07164111733436584, "clip_ratio/high_max": 0.07164111733436584, "clip_ratio/region_mean": 0.12299693748354912, "reward_total_mean": 0.37034597992897034, "reward_meter_mean": 0.7517337799072266, "reward_meter_std": 0.4055202305316925, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9301379323005676, "reward_lexical_plausibility_std": 0.16398213803768158, "reward_repeat_penalty_mean": 0.95414799451828, "reward_repeat_penalty_std": 0.0918140634894371, "reward_repeat_floor_mean": 0.9965232014656067, "reward_repeat_floor_std": 0.006406393367797136, "reward_near_duplicate_penalty_mean": 0.9957316517829895, "reward_near_duplicate_penalty_std": 0.011526302434504032, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.23868316411972046, "reward_total_composite_mean": 0.37034597992897034, "reward_total_composite_std": 0.26873478293418884} {"timestamp_utc": "2026-04-12T17:16:07Z", "mode": "train", "global_step": 357, "epoch": 0.0187884848165886, "loss": 0.0646, "grad_norm": 31.852699279785156, "learning_rate": 8.921212121212122e-06, "num_tokens": 666383.0, "completions/mean_length": 16.375, "completions/min_length": 15.0, "completions/max_length": 18.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.375, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 18.0, "rewards/meter/mean": 0.7171890735626221, "rewards/meter/std": 0.3812980353832245, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7224999666213989, "rewards/judge_quality/std": 0.28272905945777893, "rewards/repeat_penalty/mean": 0.7396639585494995, "rewards/repeat_penalty/std": 0.02923482470214367, "rewards/repeat_floor/mean": 0.9829328060150146, "rewards/repeat_floor/std": 0.005846968851983547, "rewards/near_duplicate_penalty/mean": 0.9862185716629028, "rewards/near_duplicate_penalty/std": 0.03897976875305176, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5214267373085022, "rewards/total_composite/std": 0.3253229260444641, "reward": 0.5214267373085022, "reward_std": 0.3253229260444641, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20550617575645447, "sampling/sampling_logp_difference/max": 1.5543746948242188, "sampling/importance_sampling_ratio/min": 0.21132147312164307, "sampling/importance_sampling_ratio/mean": 1.0072880983352661, "sampling/importance_sampling_ratio/max": 1.886308193206787, "entropy": 1.1666172742843628, "clip_ratio/low_mean": 0.06274509895592928, "clip_ratio/low_min": 0.06274509895592928, "clip_ratio/high_mean": 0.06093750149011612, "clip_ratio/high_max": 0.06093750149011612, "clip_ratio/region_mean": 0.1236826004460454, "reward_total_mean": 0.5214267373085022, "reward_meter_mean": 0.7171890735626221, "reward_meter_std": 0.3812980353832245, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7396639585494995, "reward_repeat_penalty_std": 0.02923482470214367, "reward_repeat_floor_mean": 0.9829328060150146, "reward_repeat_floor_std": 0.005846968851983547, "reward_near_duplicate_penalty_mean": 0.9862185716629028, "reward_near_duplicate_penalty_std": 0.03897976875305176, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7224999666213989, "reward_judge_quality_std": 0.28272905945777893, "reward_total_composite_mean": 0.5214267373085022, "reward_total_composite_std": 0.3253229260444641} {"timestamp_utc": "2026-04-12T17:16:16Z", "mode": "train", "global_step": 358, "epoch": 0.018841113625598652, "loss": 0.125, "grad_norm": 13.7113037109375, "learning_rate": 8.91818181818182e-06, "num_tokens": 667931.0, "completions/mean_length": 42.5, "completions/min_length": 34.0, "completions/max_length": 58.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.5, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.8698437213897705, "rewards/meter/std": 0.25244367122650146, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.29980650544166565, "rewards/repeat_penalty/mean": 0.9122350215911865, "rewards/repeat_penalty/std": 0.14125025272369385, "rewards/repeat_floor/mean": 0.9896342754364014, "rewards/repeat_floor/std": 0.0170968696475029, "rewards/near_duplicate_penalty/mean": 0.968704104423523, "rewards/near_duplicate_penalty/std": 0.05550863593816757, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.936985194683075, "rewards/distinct_2/std": 0.10052327811717987, "rewards/total_composite/mean": 0.5089001655578613, "rewards/total_composite/std": 0.34366846084594727, "reward": 0.5089001655578613, "reward_std": 0.34366849064826965, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1463201493024826, "sampling/sampling_logp_difference/max": 1.3036623001098633, "sampling/importance_sampling_ratio/min": 0.2715355455875397, "sampling/importance_sampling_ratio/mean": 1.0084954500198364, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0244826599955559, "clip_ratio/low_mean": 0.061588266398757696, "clip_ratio/low_min": 0.061588266398757696, "clip_ratio/high_mean": 0.05237369425594807, "clip_ratio/high_max": 0.05237369425594807, "clip_ratio/region_mean": 0.11396196065470576, "reward_total_mean": 0.5089001655578613, "reward_meter_mean": 0.8698437213897705, "reward_meter_std": 0.25244367122650146, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9122350215911865, "reward_repeat_penalty_std": 0.14125025272369385, "reward_repeat_floor_mean": 0.9896342754364014, "reward_repeat_floor_std": 0.0170968696475029, "reward_near_duplicate_penalty_mean": 0.968704104423523, "reward_near_duplicate_penalty_std": 0.05550863593816757, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.936985194683075, "reward_distinct_2_std": 0.10052327811717987, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.29980650544166565, "reward_total_composite_mean": 0.5089001655578613, "reward_total_composite_std": 0.34366846084594727} {"timestamp_utc": "2026-04-12T17:16:26Z", "mode": "train", "global_step": 359, "epoch": 0.018893742434608705, "loss": 0.1407, "grad_norm": 9.80252742767334, "learning_rate": 8.915151515151515e-06, "num_tokens": 669830.0, "completions/mean_length": 78.375, "completions/min_length": 47.0, "completions/max_length": 105.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 78.375, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 105.0, "rewards/meter/mean": 0.9786201119422913, "rewards/meter/std": 0.015729490667581558, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9513295888900757, "rewards/repeat_penalty/std": 0.048765815794467926, "rewards/repeat_floor/mean": 0.9945008754730225, "rewards/repeat_floor/std": 0.005266440100967884, "rewards/near_duplicate_penalty/mean": 0.9827135801315308, "rewards/near_duplicate_penalty/std": 0.014589764177799225, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9677096009254456, "rewards/distinct_2/std": 0.038812536746263504, "rewards/total_composite/mean": 0.3553292751312256, "rewards/total_composite/std": 0.04220420494675636, "reward": 0.3553292751312256, "reward_std": 0.04220420867204666, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16266827285289764, "sampling/sampling_logp_difference/max": 2.425251007080078, "sampling/importance_sampling_ratio/min": 0.08845590800046921, "sampling/importance_sampling_ratio/mean": 1.0338057279586792, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.546302244067192, "clip_ratio/low_mean": 0.10199844837188721, "clip_ratio/low_min": 0.10199844837188721, "clip_ratio/high_mean": 0.05682884901762009, "clip_ratio/high_max": 0.05682884901762009, "clip_ratio/region_mean": 0.1588272973895073, "reward_total_mean": 0.3553292751312256, "reward_meter_mean": 0.9786201119422913, "reward_meter_std": 0.015729490667581558, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9513295888900757, "reward_repeat_penalty_std": 0.048765815794467926, "reward_repeat_floor_mean": 0.9945008754730225, "reward_repeat_floor_std": 0.005266440100967884, "reward_near_duplicate_penalty_mean": 0.9827135801315308, "reward_near_duplicate_penalty_std": 0.014589764177799225, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9677096009254456, "reward_distinct_2_std": 0.038812536746263504, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.3553292751312256, "reward_total_composite_std": 0.04220420494675636} {"timestamp_utc": "2026-04-12T17:16:36Z", "mode": "train", "global_step": 360, "epoch": 0.018946371243618757, "loss": 0.0458, "grad_norm": 8.05918025970459, "learning_rate": 8.912121212121214e-06, "num_tokens": 672380.0, "completions/mean_length": 131.75, "completions/min_length": 121.0, "completions/max_length": 153.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 131.75, "completions/min_terminated_length": 121.0, "completions/max_terminated_length": 153.0, "rewards/meter/mean": 0.9727927446365356, "rewards/meter/std": 0.05623193830251694, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.9624999761581421, "rewards/arabic_floor/std": 0.06943649053573608, "rewards/count_floor/mean": 0.9850000143051147, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.29999998211860657, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.6192942261695862, "rewards/repeat_penalty/std": 0.23883813619613647, "rewards/repeat_floor/mean": 0.9574646949768066, "rewards/repeat_floor/std": 0.027545826509594917, "rewards/near_duplicate_penalty/mean": 0.9113891124725342, "rewards/near_duplicate_penalty/std": 0.05591447278857231, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.695903480052948, "rewards/distinct_2/std": 0.19315484166145325, "rewards/total_composite/mean": 0.2731468379497528, "rewards/total_composite/std": 0.13597573339939117, "reward": 0.2731468379497528, "reward_std": 0.13597573339939117, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1425296515226364, "sampling/sampling_logp_difference/max": 2.013340473175049, "sampling/importance_sampling_ratio/min": 0.13354183733463287, "sampling/importance_sampling_ratio/mean": 1.0411529541015625, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2808602526783943, "clip_ratio/low_mean": 0.04793283250182867, "clip_ratio/low_min": 0.04793283250182867, "clip_ratio/high_mean": 0.09201209712773561, "clip_ratio/high_max": 0.09201209712773561, "clip_ratio/region_mean": 0.13994492962956429, "reward_total_mean": 0.2731468379497528, "reward_meter_mean": 0.9727927446365356, "reward_meter_std": 0.05623193830251694, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.9624999761581421, "reward_arabic_floor_std": 0.06943649053573608, "reward_count_floor_mean": 0.9850000143051147, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6192942261695862, "reward_repeat_penalty_std": 0.23883813619613647, "reward_repeat_floor_mean": 0.9574646949768066, "reward_repeat_floor_std": 0.027545826509594917, "reward_near_duplicate_penalty_mean": 0.9113891124725342, "reward_near_duplicate_penalty_std": 0.05591447278857231, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.695903480052948, "reward_distinct_2_std": 0.19315484166145325, "reward_judge_quality_mean": 0.29999998211860657, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.2731468379497528, "reward_total_composite_std": 0.13597573339939117} {"timestamp_utc": "2026-04-12T17:16:44Z", "mode": "train", "global_step": 361, "epoch": 0.01899900005262881, "loss": 0.0623, "grad_norm": 12.581989288330078, "learning_rate": 8.90909090909091e-06, "num_tokens": 674011.0, "completions/mean_length": 41.875, "completions/min_length": 39.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.875, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.9363856315612793, "rewards/meter/std": 0.03530038893222809, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4925000071525574, "rewards/judge_quality/std": 0.2796298861503601, "rewards/repeat_penalty/mean": 0.9238135814666748, "rewards/repeat_penalty/std": 0.09648194909095764, "rewards/repeat_floor/mean": 0.9905943274497986, "rewards/repeat_floor/std": 0.01162633579224348, "rewards/near_duplicate_penalty/mean": 0.9627256393432617, "rewards/near_duplicate_penalty/std": 0.04462045058608055, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.95761638879776, "rewards/distinct_2/std": 0.06285658478736877, "rewards/total_composite/mean": 0.4604656398296356, "rewards/total_composite/std": 0.2795504629611969, "reward": 0.4604656398296356, "reward_std": 0.2795504331588745, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16266760230064392, "sampling/sampling_logp_difference/max": 1.2708740234375, "sampling/importance_sampling_ratio/min": 0.28058627247810364, "sampling/importance_sampling_ratio/mean": 1.0118446350097656, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2341424077749252, "clip_ratio/low_mean": 0.12048909720033407, "clip_ratio/low_min": 0.12048909720033407, "clip_ratio/high_mean": 0.03749999962747097, "clip_ratio/high_max": 0.03749999962747097, "clip_ratio/region_mean": 0.15798909682780504, "reward_total_mean": 0.4604656398296356, "reward_meter_mean": 0.9363856315612793, "reward_meter_std": 0.03530038893222809, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9238135814666748, "reward_repeat_penalty_std": 0.09648194909095764, "reward_repeat_floor_mean": 0.9905943274497986, "reward_repeat_floor_std": 0.01162633579224348, "reward_near_duplicate_penalty_mean": 0.9627256393432617, "reward_near_duplicate_penalty_std": 0.04462045058608055, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.95761638879776, "reward_distinct_2_std": 0.06285658478736877, "reward_judge_quality_mean": 0.4925000071525574, "reward_judge_quality_std": 0.2796298861503601, "reward_total_composite_mean": 0.4604656398296356, "reward_total_composite_std": 0.2795504629611969} {"timestamp_utc": "2026-04-12T17:16:54Z", "mode": "train", "global_step": 362, "epoch": 0.019051628861638862, "loss": 0.0213, "grad_norm": 8.42110824584961, "learning_rate": 8.906060606060607e-06, "num_tokens": 676290.0, "completions/mean_length": 108.875, "completions/min_length": 101.0, "completions/max_length": 123.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 108.875, "completions/min_terminated_length": 101.0, "completions/max_terminated_length": 123.0, "rewards/meter/mean": 0.8600841760635376, "rewards/meter/std": 0.2729659974575043, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9075525999069214, "rewards/repeat_penalty/std": 0.09921245276927948, "rewards/repeat_floor/mean": 0.9899107217788696, "rewards/repeat_floor/std": 0.010220066644251347, "rewards/near_duplicate_penalty/mean": 0.9748443961143494, "rewards/near_duplicate_penalty/std": 0.017743341624736786, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9298232793807983, "rewards/distinct_2/std": 0.08806470781564713, "rewards/total_composite/mean": 0.34355881810188293, "rewards/total_composite/std": 0.12731558084487915, "reward": 0.34355881810188293, "reward_std": 0.12731556594371796, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1571449637413025, "sampling/sampling_logp_difference/max": 1.6364707946777344, "sampling/importance_sampling_ratio/min": 0.1946658343076706, "sampling/importance_sampling_ratio/mean": 1.032671570777893, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5461475998163223, "clip_ratio/low_mean": 0.062248033471405506, "clip_ratio/low_min": 0.062248033471405506, "clip_ratio/high_mean": 0.07236636523157358, "clip_ratio/high_max": 0.07236636523157358, "clip_ratio/region_mean": 0.1346143987029791, "reward_total_mean": 0.34355881810188293, "reward_meter_mean": 0.8600841760635376, "reward_meter_std": 0.2729659974575043, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9075525999069214, "reward_repeat_penalty_std": 0.09921245276927948, "reward_repeat_floor_mean": 0.9899107217788696, "reward_repeat_floor_std": 0.010220066644251347, "reward_near_duplicate_penalty_mean": 0.9748443961143494, "reward_near_duplicate_penalty_std": 0.017743341624736786, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9298232793807983, "reward_distinct_2_std": 0.08806470781564713, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.34355881810188293, "reward_total_composite_std": 0.12731558084487915} {"timestamp_utc": "2026-04-12T17:17:09Z", "mode": "train", "global_step": 363, "epoch": 0.019104257670648914, "loss": -0.0513, "grad_norm": 3.1529197692871094, "learning_rate": 8.903030303030304e-06, "num_tokens": 679959.0, "completions/mean_length": 355.625, "completions/min_length": 242.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 303.5, "completions/min_terminated_length": 242.0, "completions/max_terminated_length": 397.0, "rewards/meter/mean": 0.8714945912361145, "rewards/meter/std": 0.18211692571640015, "rewards/count_adherence/mean": 0.6388888955116272, "rewards/count_adherence/std": 0.27054065465927124, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8916666507720947, "rewards/count_floor/std": 0.08116218447685242, "rewards/lexical_plausibility/mean": 0.8723778128623962, "rewards/lexical_plausibility/std": 0.1827472448348999, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.3893314599990845, "rewards/repeat_penalty/std": 0.4064381420612335, "rewards/repeat_floor/mean": 0.916541337966919, "rewards/repeat_floor/std": 0.06046004220843315, "rewards/near_duplicate_penalty/mean": 0.8059448003768921, "rewards/near_duplicate_penalty/std": 0.15235379338264465, "rewards/opening_diversity/mean": 0.9285511374473572, "rewards/opening_diversity/std": 0.11984875798225403, "rewards/distinct_2/mean": 0.4437389373779297, "rewards/distinct_2/std": 0.39232203364372253, "rewards/total_composite/mean": 0.1308785378932953, "rewards/total_composite/std": 0.11467240005731583, "reward": 0.1308785378932953, "reward_std": 0.11467240005731583, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10700076073408127, "sampling/sampling_logp_difference/max": 1.3937110900878906, "sampling/importance_sampling_ratio/min": 0.24815267324447632, "sampling/importance_sampling_ratio/mean": 1.0298869609832764, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8040526509284973, "clip_ratio/low_mean": 0.04215240245684981, "clip_ratio/low_min": 0.04215240245684981, "clip_ratio/high_mean": 0.014462810009717941, "clip_ratio/high_max": 0.014462810009717941, "clip_ratio/region_mean": 0.056615212466567755, "reward_total_mean": 0.1308785378932953, "reward_meter_mean": 0.8714945912361145, "reward_meter_std": 0.18211692571640015, "reward_count_adherence_mean": 0.6388888955116272, "reward_count_adherence_std": 0.27054065465927124, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8916666507720947, "reward_count_floor_std": 0.08116218447685242, "reward_lexical_plausibility_mean": 0.8723778128623962, "reward_lexical_plausibility_std": 0.1827472448348999, "reward_repeat_penalty_mean": 0.3893314599990845, "reward_repeat_penalty_std": 0.4064381420612335, "reward_repeat_floor_mean": 0.916541337966919, "reward_repeat_floor_std": 0.06046004220843315, "reward_near_duplicate_penalty_mean": 0.8059448003768921, "reward_near_duplicate_penalty_std": 0.15235379338264465, "reward_opening_diversity_mean": 0.9285511374473572, "reward_opening_diversity_std": 0.11984875798225403, "reward_distinct_2_mean": 0.4437389373779297, "reward_distinct_2_std": 0.39232203364372253, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.1308785378932953, "reward_total_composite_std": 0.11467240005731583} {"timestamp_utc": "2026-04-12T17:17:19Z", "mode": "train", "global_step": 364, "epoch": 0.019156886479658967, "loss": -0.0034, "grad_norm": 14.464784622192383, "learning_rate": 8.900000000000001e-06, "num_tokens": 681824.0, "completions/mean_length": 61.125, "completions/min_length": 54.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.125, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.8400001525878906, "rewards/meter/std": 0.2184767723083496, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9641179442405701, "rewards/repeat_penalty/std": 0.02980227954685688, "rewards/repeat_floor/mean": 0.9954157471656799, "rewards/repeat_floor/std": 0.003415758488699794, "rewards/near_duplicate_penalty/mean": 0.9778327941894531, "rewards/near_duplicate_penalty/std": 0.01799760013818741, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9860093593597412, "rewards/distinct_2/std": 0.025911342352628708, "rewards/total_composite/mean": 0.30566051602363586, "rewards/total_composite/std": 0.10472958534955978, "reward": 0.30566051602363586, "reward_std": 0.10472958534955978, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1903400421142578, "sampling/sampling_logp_difference/max": 1.529982089996338, "sampling/importance_sampling_ratio/min": 0.21653956174850464, "sampling/importance_sampling_ratio/mean": 1.018998146057129, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4020500034093857, "clip_ratio/low_mean": 0.06268477812409401, "clip_ratio/low_min": 0.06268477812409401, "clip_ratio/high_mean": 0.1172677455469966, "clip_ratio/high_max": 0.1172677455469966, "clip_ratio/region_mean": 0.1799525236710906, "reward_total_mean": 0.30566051602363586, "reward_meter_mean": 0.8400001525878906, "reward_meter_std": 0.2184767723083496, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9641179442405701, "reward_repeat_penalty_std": 0.02980227954685688, "reward_repeat_floor_mean": 0.9954157471656799, "reward_repeat_floor_std": 0.003415758488699794, "reward_near_duplicate_penalty_mean": 0.9778327941894531, "reward_near_duplicate_penalty_std": 0.01799760013818741, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9860093593597412, "reward_distinct_2_std": 0.025911342352628708, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.30566051602363586, "reward_total_composite_std": 0.10472958534955978} {"timestamp_utc": "2026-04-12T17:17:29Z", "mode": "train", "global_step": 365, "epoch": 0.019209515288669016, "loss": 0.0845, "grad_norm": 11.75033950805664, "learning_rate": 8.896969696969697e-06, "num_tokens": 683438.0, "completions/mean_length": 48.75, "completions/min_length": 37.0, "completions/max_length": 92.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.75, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.9052804708480835, "rewards/meter/std": 0.1998172402381897, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.960798978805542, "rewards/repeat_penalty/std": 0.05375628545880318, "rewards/repeat_floor/mean": 0.9946165084838867, "rewards/repeat_floor/std": 0.007642010226845741, "rewards/near_duplicate_penalty/mean": 0.9693548083305359, "rewards/near_duplicate_penalty/std": 0.049885813146829605, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.3255195617675781, "rewards/total_composite/std": 0.12233838438987732, "reward": 0.3255195617675781, "reward_std": 0.12233838438987732, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1449141502380371, "sampling/sampling_logp_difference/max": 2.0596542358398438, "sampling/importance_sampling_ratio/min": 0.12749804556369781, "sampling/importance_sampling_ratio/mean": 1.0061140060424805, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3844047337770462, "clip_ratio/low_mean": 0.035484074614942074, "clip_ratio/low_min": 0.035484074614942074, "clip_ratio/high_mean": 0.10205406416207552, "clip_ratio/high_max": 0.10205406416207552, "clip_ratio/region_mean": 0.1375381387770176, "reward_total_mean": 0.3255195617675781, "reward_meter_mean": 0.9052804708480835, "reward_meter_std": 0.1998172402381897, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.960798978805542, "reward_repeat_penalty_std": 0.05375628545880318, "reward_repeat_floor_mean": 0.9946165084838867, "reward_repeat_floor_std": 0.007642010226845741, "reward_near_duplicate_penalty_mean": 0.9693548083305359, "reward_near_duplicate_penalty_std": 0.049885813146829605, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.3255195617675781, "reward_total_composite_std": 0.12233838438987732} {"timestamp_utc": "2026-04-12T17:17:38Z", "mode": "train", "global_step": 366, "epoch": 0.019262144097679068, "loss": 0.0536, "grad_norm": 15.162606239318848, "learning_rate": 8.893939393939394e-06, "num_tokens": 685036.0, "completions/mean_length": 48.75, "completions/min_length": 43.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.75, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.7743692994117737, "rewards/meter/std": 0.3453243672847748, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.30789607763290405, "rewards/repeat_penalty/mean": 0.9565794467926025, "rewards/repeat_penalty/std": 0.08036018162965775, "rewards/repeat_floor/mean": 0.994333028793335, "rewards/repeat_floor/std": 0.011103691533207893, "rewards/near_duplicate_penalty/mean": 0.9729592204093933, "rewards/near_duplicate_penalty/std": 0.06053483858704567, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9821012020111084, "rewards/distinct_2/std": 0.03315402567386627, "rewards/total_composite/mean": 0.46257612109184265, "rewards/total_composite/std": 0.29698050022125244, "reward": 0.46257612109184265, "reward_std": 0.29698050022125244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1491256058216095, "sampling/sampling_logp_difference/max": 1.3192739486694336, "sampling/importance_sampling_ratio/min": 0.26732930541038513, "sampling/importance_sampling_ratio/mean": 1.0132737159729004, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2742609530687332, "clip_ratio/low_mean": 0.09035304561257362, "clip_ratio/low_min": 0.09035304561257362, "clip_ratio/high_mean": 0.07123877294361591, "clip_ratio/high_max": 0.07123877294361591, "clip_ratio/region_mean": 0.16159181855618954, "reward_total_mean": 0.46257612109184265, "reward_meter_mean": 0.7743692994117737, "reward_meter_std": 0.3453243672847748, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9565794467926025, "reward_repeat_penalty_std": 0.08036018162965775, "reward_repeat_floor_mean": 0.994333028793335, "reward_repeat_floor_std": 0.011103691533207893, "reward_near_duplicate_penalty_mean": 0.9729592204093933, "reward_near_duplicate_penalty_std": 0.06053483858704567, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9821012020111084, "reward_distinct_2_std": 0.03315402567386627, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.30789607763290405, "reward_total_composite_mean": 0.46257612109184265, "reward_total_composite_std": 0.29698050022125244} {"timestamp_utc": "2026-04-12T17:17:47Z", "mode": "train", "global_step": 367, "epoch": 0.01931477290668912, "loss": -0.0082, "grad_norm": 14.321744918823242, "learning_rate": 8.890909090909091e-06, "num_tokens": 686909.0, "completions/mean_length": 74.125, "completions/min_length": 60.0, "completions/max_length": 87.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 74.125, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.5353145003318787, "rewards/meter/std": 0.34504234790802, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.04008918255567551, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.768750011920929, "rewards/judge_quality/std": 0.21767853200435638, "rewards/repeat_penalty/mean": 0.9708654284477234, "rewards/repeat_penalty/std": 0.030411241576075554, "rewards/repeat_floor/mean": 0.9964196085929871, "rewards/repeat_floor/std": 0.003245903877541423, "rewards/near_duplicate_penalty/mean": 0.9844350218772888, "rewards/near_duplicate_penalty/std": 0.012171246111392975, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9861596822738647, "rewards/distinct_2/std": 0.026049774140119553, "rewards/total_composite/mean": 0.42354917526245117, "rewards/total_composite/std": 0.32641151547431946, "reward": 0.42354917526245117, "reward_std": 0.32641151547431946, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18299533426761627, "sampling/sampling_logp_difference/max": 1.67714262008667, "sampling/importance_sampling_ratio/min": 0.18690727651119232, "sampling/importance_sampling_ratio/mean": 1.0056891441345215, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9311363324522972, "clip_ratio/low_mean": 0.09001205768436193, "clip_ratio/low_min": 0.09001205768436193, "clip_ratio/high_mean": 0.08259473368525505, "clip_ratio/high_max": 0.08259473368525505, "clip_ratio/region_mean": 0.17260679136961699, "reward_total_mean": 0.42354917526245117, "reward_meter_mean": 0.5353145003318787, "reward_meter_std": 0.34504234790802, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.04008918255567551, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9708654284477234, "reward_repeat_penalty_std": 0.030411241576075554, "reward_repeat_floor_mean": 0.9964196085929871, "reward_repeat_floor_std": 0.003245903877541423, "reward_near_duplicate_penalty_mean": 0.9844350218772888, "reward_near_duplicate_penalty_std": 0.012171246111392975, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9861596822738647, "reward_distinct_2_std": 0.026049774140119553, "reward_judge_quality_mean": 0.768750011920929, "reward_judge_quality_std": 0.21767853200435638, "reward_total_composite_mean": 0.42354917526245117, "reward_total_composite_std": 0.32641151547431946} {"timestamp_utc": "2026-04-12T17:17:55Z", "mode": "train", "global_step": 368, "epoch": 0.019367401715699173, "loss": 0.1037, "grad_norm": 24.614883422851562, "learning_rate": 8.887878787878789e-06, "num_tokens": 688344.0, "completions/mean_length": 25.375, "completions/min_length": 18.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.375, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.750693142414093, "rewards/meter/std": 0.4268879294395447, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6675000190734863, "rewards/judge_quality/std": 0.38975268602371216, "rewards/repeat_penalty/mean": 0.7699704170227051, "rewards/repeat_penalty/std": 0.0974021628499031, "rewards/repeat_floor/mean": 0.9846190810203552, "rewards/repeat_floor/std": 0.008517809212207794, "rewards/near_duplicate_penalty/mean": 0.9849606156349182, "rewards/near_duplicate_penalty/std": 0.039305027574300766, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5898723602294922, "rewards/total_composite/std": 0.44210949540138245, "reward": 0.5898723602294922, "reward_std": 0.44210949540138245, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18786954879760742, "sampling/sampling_logp_difference/max": 1.6972036361694336, "sampling/importance_sampling_ratio/min": 0.1831950843334198, "sampling/importance_sampling_ratio/mean": 1.0439058542251587, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3269711285829544, "clip_ratio/low_mean": 0.07433712109923363, "clip_ratio/low_min": 0.07433712109923363, "clip_ratio/high_mean": 0.09368357481434941, "clip_ratio/high_max": 0.09368357481434941, "clip_ratio/region_mean": 0.16802069591358304, "reward_total_mean": 0.5898723602294922, "reward_meter_mean": 0.750693142414093, "reward_meter_std": 0.4268879294395447, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7699704170227051, "reward_repeat_penalty_std": 0.0974021628499031, "reward_repeat_floor_mean": 0.9846190810203552, "reward_repeat_floor_std": 0.008517809212207794, "reward_near_duplicate_penalty_mean": 0.9849606156349182, "reward_near_duplicate_penalty_std": 0.039305027574300766, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6675000190734863, "reward_judge_quality_std": 0.38975268602371216, "reward_total_composite_mean": 0.5898723602294922, "reward_total_composite_std": 0.44210949540138245} {"timestamp_utc": "2026-04-12T17:18:07Z", "mode": "train", "global_step": 369, "epoch": 0.019420030524709225, "loss": 0.1814, "grad_norm": 11.213492393493652, "learning_rate": 8.884848484848486e-06, "num_tokens": 691255.0, "completions/mean_length": 171.875, "completions/min_length": 136.0, "completions/max_length": 208.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 171.875, "completions/min_terminated_length": 136.0, "completions/max_terminated_length": 208.0, "rewards/meter/mean": 0.5056368112564087, "rewards/meter/std": 0.33909738063812256, "rewards/count_adherence/mean": 0.734375, "rewards/count_adherence/std": 0.04419417306780815, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9203125238418579, "rewards/count_floor/std": 0.013258260674774647, "rewards/lexical_plausibility/mean": 0.9983552694320679, "rewards/lexical_plausibility/std": 0.004652021918445826, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.8123867511749268, "rewards/repeat_penalty/std": 0.11044201999902725, "rewards/repeat_floor/mean": 0.9818981885910034, "rewards/repeat_floor/std": 0.009863175451755524, "rewards/near_duplicate_penalty/mean": 0.9661498665809631, "rewards/near_duplicate_penalty/std": 0.016471514478325844, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8552853465080261, "rewards/distinct_2/std": 0.09222674369812012, "rewards/total_composite/mean": 0.13929015398025513, "rewards/total_composite/std": 0.07933954149484634, "reward": 0.13929015398025513, "reward_std": 0.07933953404426575, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21959906816482544, "sampling/sampling_logp_difference/max": 2.517941474914551, "sampling/importance_sampling_ratio/min": 0.08062540739774704, "sampling/importance_sampling_ratio/mean": 1.0156633853912354, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2597133070230484, "clip_ratio/low_mean": 0.09509143978357315, "clip_ratio/low_min": 0.09509143978357315, "clip_ratio/high_mean": 0.09948217123746872, "clip_ratio/high_max": 0.09948217123746872, "clip_ratio/region_mean": 0.19457361102104187, "reward_total_mean": 0.13929015398025513, "reward_meter_mean": 0.5056368112564087, "reward_meter_std": 0.33909738063812256, "reward_count_adherence_mean": 0.734375, "reward_count_adherence_std": 0.04419417306780815, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9203125238418579, "reward_count_floor_std": 0.013258260674774647, "reward_lexical_plausibility_mean": 0.9983552694320679, "reward_lexical_plausibility_std": 0.004652021918445826, "reward_repeat_penalty_mean": 0.8123867511749268, "reward_repeat_penalty_std": 0.11044201999902725, "reward_repeat_floor_mean": 0.9818981885910034, "reward_repeat_floor_std": 0.009863175451755524, "reward_near_duplicate_penalty_mean": 0.9661498665809631, "reward_near_duplicate_penalty_std": 0.016471514478325844, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8552853465080261, "reward_distinct_2_std": 0.09222674369812012, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.13929015398025513, "reward_total_composite_std": 0.07933954149484634} {"timestamp_utc": "2026-04-12T17:18:17Z", "mode": "train", "global_step": 370, "epoch": 0.019472659333719278, "loss": 0.0645, "grad_norm": 10.120687484741211, "learning_rate": 8.881818181818183e-06, "num_tokens": 693198.0, "completions/mean_length": 64.875, "completions/min_length": 49.0, "completions/max_length": 86.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.875, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.7698711156845093, "rewards/meter/std": 0.3382386863231659, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390502154827118, "rewards/repeat_penalty/mean": 0.9402925968170166, "rewards/repeat_penalty/std": 0.03833829611539841, "rewards/repeat_floor/mean": 0.992631733417511, "rewards/repeat_floor/std": 0.004147879313677549, "rewards/near_duplicate_penalty/mean": 0.9681292772293091, "rewards/near_duplicate_penalty/std": 0.017739932984113693, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.97124844789505, "rewards/distinct_2/std": 0.035433944314718246, "rewards/total_composite/mean": 0.34389227628707886, "rewards/total_composite/std": 0.26905587315559387, "reward": 0.34389227628707886, "reward_std": 0.2690558433532715, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17440679669380188, "sampling/sampling_logp_difference/max": 2.0173730850219727, "sampling/importance_sampling_ratio/min": 0.13300441205501556, "sampling/importance_sampling_ratio/mean": 1.0081368684768677, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5562718659639359, "clip_ratio/low_mean": 0.10634280368685722, "clip_ratio/low_min": 0.10634280368685722, "clip_ratio/high_mean": 0.09382317028939724, "clip_ratio/high_max": 0.09382317028939724, "clip_ratio/region_mean": 0.20016597397625446, "reward_total_mean": 0.34389227628707886, "reward_meter_mean": 0.7698711156845093, "reward_meter_std": 0.3382386863231659, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9402925968170166, "reward_repeat_penalty_std": 0.03833829611539841, "reward_repeat_floor_mean": 0.992631733417511, "reward_repeat_floor_std": 0.004147879313677549, "reward_near_duplicate_penalty_mean": 0.9681292772293091, "reward_near_duplicate_penalty_std": 0.017739932984113693, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.97124844789505, "reward_distinct_2_std": 0.035433944314718246, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390502154827118, "reward_total_composite_mean": 0.34389227628707886, "reward_total_composite_std": 0.26905587315559387} {"timestamp_utc": "2026-04-12T17:18:29Z", "mode": "train", "global_step": 371, "epoch": 0.01952528814272933, "loss": 0.0797, "grad_norm": 4.831717014312744, "learning_rate": 8.87878787878788e-06, "num_tokens": 696939.0, "completions/mean_length": 277.625, "completions/min_length": 228.0, "completions/max_length": 388.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 277.625, "completions/min_terminated_length": 228.0, "completions/max_terminated_length": 388.0, "rewards/meter/mean": 0.7116806507110596, "rewards/meter/std": 0.41652625799179077, "rewards/count_adherence/mean": 0.6000000238418579, "rewards/count_adherence/std": 0.2507132589817047, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8799999952316284, "rewards/count_floor/std": 0.07521399110555649, "rewards/lexical_plausibility/mean": 0.9736841917037964, "rewards/lexical_plausibility/std": 0.07443228363990784, "rewards/judge_quality/mean": 0.16250000894069672, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.18465471267700195, "rewards/repeat_penalty/std": 0.23464816808700562, "rewards/repeat_floor/mean": 0.8778722882270813, "rewards/repeat_floor/std": 0.06475692987442017, "rewards/near_duplicate_penalty/mean": 0.7020835876464844, "rewards/near_duplicate_penalty/std": 0.27087485790252686, "rewards/opening_diversity/mean": 0.8760069608688354, "rewards/opening_diversity/std": 0.16104254126548767, "rewards/distinct_2/mean": 0.22221457958221436, "rewards/distinct_2/std": 0.25585976243019104, "rewards/total_composite/mean": 0.09522828459739685, "rewards/total_composite/std": 0.06214176118373871, "reward": 0.09522828459739685, "reward_std": 0.06214176118373871, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10685379058122635, "sampling/sampling_logp_difference/max": 4.284203052520752, "sampling/importance_sampling_ratio/min": 0.013784602284431458, "sampling/importance_sampling_ratio/mean": 1.006848692893982, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8036476597189903, "clip_ratio/low_mean": 0.014815543312579393, "clip_ratio/low_min": 0.014815543312579393, "clip_ratio/high_mean": 0.08764226967468858, "clip_ratio/high_max": 0.08764226967468858, "clip_ratio/region_mean": 0.10245781298726797, "reward_total_mean": 0.09522828459739685, "reward_meter_mean": 0.7116806507110596, "reward_meter_std": 0.41652625799179077, "reward_count_adherence_mean": 0.6000000238418579, "reward_count_adherence_std": 0.2507132589817047, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8799999952316284, "reward_count_floor_std": 0.07521399110555649, "reward_lexical_plausibility_mean": 0.9736841917037964, "reward_lexical_plausibility_std": 0.07443228363990784, "reward_repeat_penalty_mean": 0.18465471267700195, "reward_repeat_penalty_std": 0.23464816808700562, "reward_repeat_floor_mean": 0.8778722882270813, "reward_repeat_floor_std": 0.06475692987442017, "reward_near_duplicate_penalty_mean": 0.7020835876464844, "reward_near_duplicate_penalty_std": 0.27087485790252686, "reward_opening_diversity_mean": 0.8760069608688354, "reward_opening_diversity_std": 0.16104254126548767, "reward_distinct_2_mean": 0.22221457958221436, "reward_distinct_2_std": 0.25585976243019104, "reward_judge_quality_mean": 0.16250000894069672, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.09522828459739685, "reward_total_composite_std": 0.06214176118373871} {"timestamp_utc": "2026-04-12T17:18:40Z", "mode": "train", "global_step": 372, "epoch": 0.019577916951739383, "loss": 0.1003, "grad_norm": 12.382516860961914, "learning_rate": 8.875757575757576e-06, "num_tokens": 698989.0, "completions/mean_length": 84.25, "completions/min_length": 70.0, "completions/max_length": 111.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 84.25, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 111.0, "rewards/meter/mean": 0.7467271089553833, "rewards/meter/std": 0.26991549134254456, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.8503808379173279, "rewards/repeat_penalty/std": 0.17994295060634613, "rewards/repeat_floor/mean": 0.9820507168769836, "rewards/repeat_floor/std": 0.02148190326988697, "rewards/near_duplicate_penalty/mean": 0.9449970722198486, "rewards/near_duplicate_penalty/std": 0.053348246961832047, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.8974431753158569, "rewards/distinct_2/std": 0.13926663994789124, "rewards/total_composite/mean": 0.25923699140548706, "rewards/total_composite/std": 0.08671414852142334, "reward": 0.25923699140548706, "reward_std": 0.08671414852142334, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.169866144657135, "sampling/sampling_logp_difference/max": 1.5025932788848877, "sampling/importance_sampling_ratio/min": 0.22255228459835052, "sampling/importance_sampling_ratio/mean": 1.0178216695785522, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5575363039970398, "clip_ratio/low_mean": 0.04029753431677818, "clip_ratio/low_min": 0.04029753431677818, "clip_ratio/high_mean": 0.09936683066189289, "clip_ratio/high_max": 0.09936683066189289, "clip_ratio/region_mean": 0.13966436497867107, "reward_total_mean": 0.25923699140548706, "reward_meter_mean": 0.7467271089553833, "reward_meter_std": 0.26991549134254456, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8503808379173279, "reward_repeat_penalty_std": 0.17994295060634613, "reward_repeat_floor_mean": 0.9820507168769836, "reward_repeat_floor_std": 0.02148190326988697, "reward_near_duplicate_penalty_mean": 0.9449970722198486, "reward_near_duplicate_penalty_std": 0.053348246961832047, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.8974431753158569, "reward_distinct_2_std": 0.13926663994789124, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.25923699140548706, "reward_total_composite_std": 0.08671414852142334} {"timestamp_utc": "2026-04-12T17:18:49Z", "mode": "train", "global_step": 373, "epoch": 0.019630545760749435, "loss": 0.0601, "grad_norm": 15.747854232788086, "learning_rate": 8.872727272727275e-06, "num_tokens": 700546.0, "completions/mean_length": 39.625, "completions/min_length": 33.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.625, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7566812038421631, "rewards/meter/std": 0.29804617166519165, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9986746907234192, "rewards/repeat_penalty/std": 0.0019098890479654074, "rewards/repeat_floor/mean": 0.9998011589050293, "rewards/repeat_floor/std": 0.00028648527222685516, "rewards/near_duplicate_penalty/mean": 0.9986746907234192, "rewards/near_duplicate_penalty/std": 0.0019098890479654074, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2892093062400818, "rewards/total_composite/std": 0.15111269056797028, "reward": 0.2892093062400818, "reward_std": 0.15111269056797028, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2076290398836136, "sampling/sampling_logp_difference/max": 1.383375644683838, "sampling/importance_sampling_ratio/min": 0.2507307529449463, "sampling/importance_sampling_ratio/mean": 1.050705075263977, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0545389354228973, "clip_ratio/low_mean": 0.054423414170742035, "clip_ratio/low_min": 0.054423414170742035, "clip_ratio/high_mean": 0.13461116328835487, "clip_ratio/high_max": 0.13461116328835487, "clip_ratio/region_mean": 0.1890345774590969, "reward_total_mean": 0.2892093062400818, "reward_meter_mean": 0.7566812038421631, "reward_meter_std": 0.29804617166519165, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9986746907234192, "reward_repeat_penalty_std": 0.0019098890479654074, "reward_repeat_floor_mean": 0.9998011589050293, "reward_repeat_floor_std": 0.00028648527222685516, "reward_near_duplicate_penalty_mean": 0.9986746907234192, "reward_near_duplicate_penalty_std": 0.0019098890479654074, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.2892093062400818, "reward_total_composite_std": 0.15111269056797028} {"timestamp_utc": "2026-04-12T17:18:57Z", "mode": "train", "global_step": 374, "epoch": 0.019683174569759487, "loss": 0.076, "grad_norm": 18.713809967041016, "learning_rate": 8.86969696969697e-06, "num_tokens": 701973.0, "completions/mean_length": 34.375, "completions/min_length": 25.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.375, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.8340343236923218, "rewards/meter/std": 0.3362620770931244, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.612500011920929, "rewards/judge_quality/std": 0.2548248767852783, "rewards/repeat_penalty/mean": 0.9939566254615784, "rewards/repeat_penalty/std": 0.009147074073553085, "rewards/repeat_floor/mean": 0.9990935325622559, "rewards/repeat_floor/std": 0.001372060040012002, "rewards/near_duplicate_penalty/mean": 0.9939566254615784, "rewards/near_duplicate_penalty/std": 0.009147074073553085, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.45364952087402344, "rewards/total_composite/std": 0.2479201704263687, "reward": 0.45364952087402344, "reward_std": 0.2479201704263687, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16681362688541412, "sampling/sampling_logp_difference/max": 1.346923589706421, "sampling/importance_sampling_ratio/min": 0.2600390315055847, "sampling/importance_sampling_ratio/mean": 1.0014628171920776, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.135002762079239, "clip_ratio/low_mean": 0.09099704306572676, "clip_ratio/low_min": 0.09099704306572676, "clip_ratio/high_mean": 0.037361111491918564, "clip_ratio/high_max": 0.037361111491918564, "clip_ratio/region_mean": 0.12835815455764532, "reward_total_mean": 0.45364952087402344, "reward_meter_mean": 0.8340343236923218, "reward_meter_std": 0.3362620770931244, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9939566254615784, "reward_repeat_penalty_std": 0.009147074073553085, "reward_repeat_floor_mean": 0.9990935325622559, "reward_repeat_floor_std": 0.001372060040012002, "reward_near_duplicate_penalty_mean": 0.9939566254615784, "reward_near_duplicate_penalty_std": 0.009147074073553085, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.612500011920929, "reward_judge_quality_std": 0.2548248767852783, "reward_total_composite_mean": 0.45364952087402344, "reward_total_composite_std": 0.2479201704263687} {"timestamp_utc": "2026-04-12T17:19:08Z", "mode": "train", "global_step": 375, "epoch": 0.01973580337876954, "loss": -0.2165, "grad_norm": 4.994774341583252, "learning_rate": 8.866666666666668e-06, "num_tokens": 705503.0, "completions/mean_length": 218.25, "completions/min_length": 10.0, "completions/max_length": 266.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 218.25, "completions/min_terminated_length": 10.0, "completions/max_terminated_length": 266.0, "rewards/meter/mean": 0.5767972469329834, "rewards/meter/std": 0.3385557532310486, "rewards/count_adherence/mean": 0.6499999761581421, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8949999809265137, "rewards/count_floor/std": 0.08017838001251221, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.7064532041549683, "rewards/repeat_penalty/std": 0.2740466594696045, "rewards/repeat_floor/mean": 0.9698563814163208, "rewards/repeat_floor/std": 0.028440747410058975, "rewards/near_duplicate_penalty/mean": 0.9573919773101807, "rewards/near_duplicate_penalty/std": 0.03063259646296501, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7360846400260925, "rewards/distinct_2/std": 0.2672129273414612, "rewards/total_composite/mean": 0.15860283374786377, "rewards/total_composite/std": 0.0946909487247467, "reward": 0.15860283374786377, "reward_std": 0.0946909487247467, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16686995327472687, "sampling/sampling_logp_difference/max": 2.11104154586792, "sampling/importance_sampling_ratio/min": 0.12111175805330276, "sampling/importance_sampling_ratio/mean": 1.0233567953109741, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5053788647055626, "clip_ratio/low_mean": 0.09331616386771202, "clip_ratio/low_min": 0.09331616386771202, "clip_ratio/high_mean": 0.07826313748955727, "clip_ratio/high_max": 0.07826313748955727, "clip_ratio/region_mean": 0.1715793013572693, "reward_total_mean": 0.15860283374786377, "reward_meter_mean": 0.5767972469329834, "reward_meter_std": 0.3385557532310486, "reward_count_adherence_mean": 0.6499999761581421, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8949999809265137, "reward_count_floor_std": 0.08017838001251221, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7064532041549683, "reward_repeat_penalty_std": 0.2740466594696045, "reward_repeat_floor_mean": 0.9698563814163208, "reward_repeat_floor_std": 0.028440747410058975, "reward_near_duplicate_penalty_mean": 0.9573919773101807, "reward_near_duplicate_penalty_std": 0.03063259646296501, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7360846400260925, "reward_distinct_2_std": 0.2672129273414612, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.15860283374786377, "reward_total_composite_std": 0.0946909487247467} {"timestamp_utc": "2026-04-12T17:19:17Z", "mode": "train", "global_step": 376, "epoch": 0.019788432187779592, "loss": -0.0054, "grad_norm": 27.141374588012695, "learning_rate": 8.863636363636365e-06, "num_tokens": 707178.0, "completions/mean_length": 44.375, "completions/min_length": 34.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.375, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.8870347738265991, "rewards/meter/std": 0.18807987868785858, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6474999785423279, "rewards/judge_quality/std": 0.2931479811668396, "rewards/repeat_penalty/mean": 0.9769245386123657, "rewards/repeat_penalty/std": 0.03607640415430069, "rewards/repeat_floor/mean": 0.9973078966140747, "rewards/repeat_floor/std": 0.0036129853688180447, "rewards/near_duplicate_penalty/mean": 0.9897450804710388, "rewards/near_duplicate_penalty/std": 0.016943814232945442, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9871795177459717, "rewards/distinct_2/std": 0.03626188635826111, "rewards/total_composite/mean": 0.5531960725784302, "rewards/total_composite/std": 0.2840522527694702, "reward": 0.5531960725784302, "reward_std": 0.2840522527694702, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14562341570854187, "sampling/sampling_logp_difference/max": 2.409628391265869, "sampling/importance_sampling_ratio/min": 0.08984867483377457, "sampling/importance_sampling_ratio/mean": 0.9764859676361084, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.561041820794344, "clip_ratio/low_mean": 0.06508746277540922, "clip_ratio/low_min": 0.06508746277540922, "clip_ratio/high_mean": 0.04916320415213704, "clip_ratio/high_max": 0.04916320415213704, "clip_ratio/region_mean": 0.11425066692754626, "reward_total_mean": 0.5531960725784302, "reward_meter_mean": 0.8870347738265991, "reward_meter_std": 0.18807987868785858, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9769245386123657, "reward_repeat_penalty_std": 0.03607640415430069, "reward_repeat_floor_mean": 0.9973078966140747, "reward_repeat_floor_std": 0.0036129853688180447, "reward_near_duplicate_penalty_mean": 0.9897450804710388, "reward_near_duplicate_penalty_std": 0.016943814232945442, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9871795177459717, "reward_distinct_2_std": 0.03626188635826111, "reward_judge_quality_mean": 0.6474999785423279, "reward_judge_quality_std": 0.2931479811668396, "reward_total_composite_mean": 0.5531960725784302, "reward_total_composite_std": 0.2840522527694702} {"timestamp_utc": "2026-04-12T17:19:26Z", "mode": "train", "global_step": 377, "epoch": 0.01984106099678964, "loss": 0.046, "grad_norm": 14.02459716796875, "learning_rate": 8.860606060606062e-06, "num_tokens": 708931.0, "completions/mean_length": 45.125, "completions/min_length": 40.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.125, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.728223979473114, "rewards/meter/std": 0.37204641103744507, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.25670650601387024, "rewards/repeat_penalty/mean": 0.8173435926437378, "rewards/repeat_penalty/std": 0.29813843965530396, "rewards/repeat_floor/mean": 0.9741727113723755, "rewards/repeat_floor/std": 0.044281184673309326, "rewards/near_duplicate_penalty/mean": 0.9131169319152832, "rewards/near_duplicate_penalty/std": 0.1279606819152832, "rewards/opening_diversity/mean": 0.921875, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.909919023513794, "rewards/distinct_2/std": 0.1458413451910019, "rewards/total_composite/mean": 0.2686946988105774, "rewards/total_composite/std": 0.28365370631217957, "reward": 0.2686946988105774, "reward_std": 0.2836536765098572, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17564965784549713, "sampling/sampling_logp_difference/max": 1.5391759872436523, "sampling/importance_sampling_ratio/min": 0.21455782651901245, "sampling/importance_sampling_ratio/mean": 0.9972003102302551, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4582325965166092, "clip_ratio/low_mean": 0.07083836337551475, "clip_ratio/low_min": 0.07083836337551475, "clip_ratio/high_mean": 0.07301227748394012, "clip_ratio/high_max": 0.07301227748394012, "clip_ratio/region_mean": 0.14385064085945487, "reward_total_mean": 0.2686946988105774, "reward_meter_mean": 0.728223979473114, "reward_meter_std": 0.37204641103744507, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8173435926437378, "reward_repeat_penalty_std": 0.29813843965530396, "reward_repeat_floor_mean": 0.9741727113723755, "reward_repeat_floor_std": 0.044281184673309326, "reward_near_duplicate_penalty_mean": 0.9131169319152832, "reward_near_duplicate_penalty_std": 0.1279606819152832, "reward_opening_diversity_mean": 0.921875, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.909919023513794, "reward_distinct_2_std": 0.1458413451910019, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.25670650601387024, "reward_total_composite_mean": 0.2686946988105774, "reward_total_composite_std": 0.28365370631217957} {"timestamp_utc": "2026-04-12T17:19:34Z", "mode": "train", "global_step": 378, "epoch": 0.019893689805799693, "loss": 0.1539, "grad_norm": 23.855758666992188, "learning_rate": 8.857575757575758e-06, "num_tokens": 710439.0, "completions/mean_length": 30.5, "completions/min_length": 20.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.5, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.7858266830444336, "rewards/meter/std": 0.3465760350227356, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.13887302577495575, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7849999666213989, "rewards/judge_quality/std": 0.2157379686832428, "rewards/repeat_penalty/mean": 0.800424337387085, "rewards/repeat_penalty/std": 0.12245331704616547, "rewards/repeat_floor/mean": 0.9863779544830322, "rewards/repeat_floor/std": 0.008887514472007751, "rewards/near_duplicate_penalty/mean": 0.9841861128807068, "rewards/near_duplicate_penalty/std": 0.02570686861872673, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6044842600822449, "rewards/total_composite/std": 0.3213955760002136, "reward": 0.6044842600822449, "reward_std": 0.3213955760002136, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18083840608596802, "sampling/sampling_logp_difference/max": 2.0914127826690674, "sampling/importance_sampling_ratio/min": 0.12351251393556595, "sampling/importance_sampling_ratio/mean": 1.051404595375061, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4470215737819672, "clip_ratio/low_mean": 0.06036193436011672, "clip_ratio/low_min": 0.06036193436011672, "clip_ratio/high_mean": 0.07732909638434649, "clip_ratio/high_max": 0.07732909638434649, "clip_ratio/region_mean": 0.1376910307444632, "reward_total_mean": 0.6044842600822449, "reward_meter_mean": 0.7858266830444336, "reward_meter_std": 0.3465760350227356, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.13887302577495575, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.800424337387085, "reward_repeat_penalty_std": 0.12245331704616547, "reward_repeat_floor_mean": 0.9863779544830322, "reward_repeat_floor_std": 0.008887514472007751, "reward_near_duplicate_penalty_mean": 0.9841861128807068, "reward_near_duplicate_penalty_std": 0.02570686861872673, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7849999666213989, "reward_judge_quality_std": 0.2157379686832428, "reward_total_composite_mean": 0.6044842600822449, "reward_total_composite_std": 0.3213955760002136} {"timestamp_utc": "2026-04-12T17:19:44Z", "mode": "train", "global_step": 379, "epoch": 0.019946318614809746, "loss": 0.1904, "grad_norm": 19.44912338256836, "learning_rate": 8.854545454545455e-06, "num_tokens": 712276.0, "completions/mean_length": 60.625, "completions/min_length": 29.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.625, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.41483208537101746, "rewards/meter/std": 0.3286876380443573, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.0707106739282608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.10690448433160782, "rewards/repeat_penalty/mean": 0.943665623664856, "rewards/repeat_penalty/std": 0.08658132702112198, "rewards/repeat_floor/mean": 0.9950630068778992, "rewards/repeat_floor/std": 0.005955915432423353, "rewards/near_duplicate_penalty/mean": 0.9872875809669495, "rewards/near_duplicate_penalty/std": 0.017184389755129814, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9871652126312256, "rewards/distinct_2/std": 0.02378297969698906, "rewards/total_composite/mean": 0.1338021457195282, "rewards/total_composite/std": 0.08030419796705246, "reward": 0.1338021457195282, "reward_std": 0.08030419051647186, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2164975255727768, "sampling/sampling_logp_difference/max": 2.004180431365967, "sampling/importance_sampling_ratio/min": 0.1347707062959671, "sampling/importance_sampling_ratio/mean": 1.0033055543899536, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.304855465888977, "clip_ratio/low_mean": 0.08339879103004932, "clip_ratio/low_min": 0.08339879103004932, "clip_ratio/high_mean": 0.10393539629876614, "clip_ratio/high_max": 0.10393539629876614, "clip_ratio/region_mean": 0.18733418732881546, "reward_total_mean": 0.1338021457195282, "reward_meter_mean": 0.41483208537101746, "reward_meter_std": 0.3286876380443573, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.0707106739282608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.943665623664856, "reward_repeat_penalty_std": 0.08658132702112198, "reward_repeat_floor_mean": 0.9950630068778992, "reward_repeat_floor_std": 0.005955915432423353, "reward_near_duplicate_penalty_mean": 0.9872875809669495, "reward_near_duplicate_penalty_std": 0.017184389755129814, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9871652126312256, "reward_distinct_2_std": 0.02378297969698906, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.10690448433160782, "reward_total_composite_mean": 0.1338021457195282, "reward_total_composite_std": 0.08030419796705246} {"timestamp_utc": "2026-04-12T17:19:53Z", "mode": "train", "global_step": 380, "epoch": 0.019998947423819798, "loss": 0.1374, "grad_norm": 13.794597625732422, "learning_rate": 8.851515151515152e-06, "num_tokens": 713928.0, "completions/mean_length": 45.5, "completions/min_length": 36.0, "completions/max_length": 58.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.5, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.8509638905525208, "rewards/meter/std": 0.2640708088874817, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8708540201187134, "rewards/lexical_plausibility/std": 0.2625297009944916, "rewards/judge_quality/mean": 0.38374999165534973, "rewards/judge_quality/std": 0.25795555114746094, "rewards/repeat_penalty/mean": 0.9555281400680542, "rewards/repeat_penalty/std": 0.059608519077301025, "rewards/repeat_floor/mean": 0.9946416020393372, "rewards/repeat_floor/std": 0.007120018359273672, "rewards/near_duplicate_penalty/mean": 0.9793872833251953, "rewards/near_duplicate_penalty/std": 0.026510024443268776, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9748168587684631, "rewards/distinct_2/std": 0.03521263226866722, "rewards/total_composite/mean": 0.34486454725265503, "rewards/total_composite/std": 0.2494838833808899, "reward": 0.34486454725265503, "reward_std": 0.2494838833808899, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1943255513906479, "sampling/sampling_logp_difference/max": 1.334388256072998, "sampling/importance_sampling_ratio/min": 0.2633192241191864, "sampling/importance_sampling_ratio/mean": 1.0238460302352905, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7199637442827225, "clip_ratio/low_mean": 0.09679704904556274, "clip_ratio/low_min": 0.09679704904556274, "clip_ratio/high_mean": 0.09106815978884697, "clip_ratio/high_max": 0.09106815978884697, "clip_ratio/region_mean": 0.1878652088344097, "reward_total_mean": 0.34486454725265503, "reward_meter_mean": 0.8509638905525208, "reward_meter_std": 0.2640708088874817, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8708540201187134, "reward_lexical_plausibility_std": 0.2625297009944916, "reward_repeat_penalty_mean": 0.9555281400680542, "reward_repeat_penalty_std": 0.059608519077301025, "reward_repeat_floor_mean": 0.9946416020393372, "reward_repeat_floor_std": 0.007120018359273672, "reward_near_duplicate_penalty_mean": 0.9793872833251953, "reward_near_duplicate_penalty_std": 0.026510024443268776, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9748168587684631, "reward_distinct_2_std": 0.03521263226866722, "reward_judge_quality_mean": 0.38374999165534973, "reward_judge_quality_std": 0.25795555114746094, "reward_total_composite_mean": 0.34486454725265503, "reward_total_composite_std": 0.2494838833808899} {"timestamp_utc": "2026-04-12T17:20:01Z", "mode": "train", "global_step": 381, "epoch": 0.02005157623282985, "loss": 0.0828, "grad_norm": 20.097248077392578, "learning_rate": 8.84848484848485e-06, "num_tokens": 715643.0, "completions/mean_length": 49.375, "completions/min_length": 45.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.375, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.7343670129776001, "rewards/meter/std": 0.3419080078601837, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9616450071334839, "rewards/lexical_plausibility/std": 0.07202228903770447, "rewards/judge_quality/mean": 0.5725000500679016, "rewards/judge_quality/std": 0.3767435848712921, "rewards/repeat_penalty/mean": 0.9805794954299927, "rewards/repeat_penalty/std": 0.013357391580939293, "rewards/repeat_floor/mean": 0.9970868825912476, "rewards/repeat_floor/std": 0.00200360594317317, "rewards/near_duplicate_penalty/mean": 0.9805794954299927, "rewards/near_duplicate_penalty/std": 0.013357391580939293, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.49548688530921936, "rewards/total_composite/std": 0.38653960824012756, "reward": 0.49548688530921936, "reward_std": 0.38653963804244995, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20156219601631165, "sampling/sampling_logp_difference/max": 2.3564653396606445, "sampling/importance_sampling_ratio/min": 0.09475455433130264, "sampling/importance_sampling_ratio/mean": 1.0000542402267456, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0622112601995468, "clip_ratio/low_mean": 0.10730747692286968, "clip_ratio/low_min": 0.10730747692286968, "clip_ratio/high_mean": 0.0692435372620821, "clip_ratio/high_max": 0.0692435372620821, "clip_ratio/region_mean": 0.17655101418495178, "reward_total_mean": 0.49548688530921936, "reward_meter_mean": 0.7343670129776001, "reward_meter_std": 0.3419080078601837, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9616450071334839, "reward_lexical_plausibility_std": 0.07202228903770447, "reward_repeat_penalty_mean": 0.9805794954299927, "reward_repeat_penalty_std": 0.013357391580939293, "reward_repeat_floor_mean": 0.9970868825912476, "reward_repeat_floor_std": 0.00200360594317317, "reward_near_duplicate_penalty_mean": 0.9805794954299927, "reward_near_duplicate_penalty_std": 0.013357391580939293, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5725000500679016, "reward_judge_quality_std": 0.3767435848712921, "reward_total_composite_mean": 0.49548688530921936, "reward_total_composite_std": 0.38653960824012756} {"timestamp_utc": "2026-04-12T17:20:09Z", "mode": "train", "global_step": 382, "epoch": 0.020104205041839903, "loss": 0.1009, "grad_norm": 16.714942932128906, "learning_rate": 8.845454545454547e-06, "num_tokens": 717150.0, "completions/mean_length": 28.375, "completions/min_length": 23.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.375, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.8646761178970337, "rewards/meter/std": 0.3436548709869385, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5175000429153442, "rewards/judge_quality/std": 0.2522328794002533, "rewards/repeat_penalty/mean": 0.8125, "rewards/repeat_penalty/std": 0.1157275140285492, "rewards/repeat_floor/mean": 0.9887499809265137, "rewards/repeat_floor/std": 0.0069436440244317055, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4472775459289551, "rewards/total_composite/std": 0.30153030157089233, "reward": 0.4472775459289551, "reward_std": 0.30153030157089233, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13552485406398773, "sampling/sampling_logp_difference/max": 1.2284979820251465, "sampling/importance_sampling_ratio/min": 0.292731910943985, "sampling/importance_sampling_ratio/mean": 1.0380221605300903, "sampling/importance_sampling_ratio/max": 1.8198275566101074, "entropy": 0.9642823562026024, "clip_ratio/low_mean": 0.1073402687907219, "clip_ratio/low_min": 0.1073402687907219, "clip_ratio/high_mean": 0.04222408030182123, "clip_ratio/high_max": 0.04222408030182123, "clip_ratio/region_mean": 0.14956434909254313, "reward_total_mean": 0.4472775459289551, "reward_meter_mean": 0.8646761178970337, "reward_meter_std": 0.3436548709869385, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8125, "reward_repeat_penalty_std": 0.1157275140285492, "reward_repeat_floor_mean": 0.9887499809265137, "reward_repeat_floor_std": 0.0069436440244317055, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5175000429153442, "reward_judge_quality_std": 0.2522328794002533, "reward_total_composite_mean": 0.4472775459289551, "reward_total_composite_std": 0.30153030157089233} {"timestamp_utc": "2026-04-12T17:20:18Z", "mode": "train", "global_step": 383, "epoch": 0.020156833850849955, "loss": 0.1194, "grad_norm": 13.620659828186035, "learning_rate": 8.842424242424244e-06, "num_tokens": 718727.0, "completions/mean_length": 47.125, "completions/min_length": 39.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.125, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.7985309958457947, "rewards/meter/std": 0.23880243301391602, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.42500001192092896, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.9678767323493958, "rewards/repeat_penalty/std": 0.047019246965646744, "rewards/repeat_floor/mean": 0.995730996131897, "rewards/repeat_floor/std": 0.006663989741355181, "rewards/near_duplicate_penalty/mean": 0.9770342111587524, "rewards/near_duplicate_penalty/std": 0.044951487332582474, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.3589385449886322, "rewards/total_composite/std": 0.2025938332080841, "reward": 0.3589385449886322, "reward_std": 0.2025938332080841, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16942140460014343, "sampling/sampling_logp_difference/max": 1.446589469909668, "sampling/importance_sampling_ratio/min": 0.2353716641664505, "sampling/importance_sampling_ratio/mean": 1.0394906997680664, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.68963922560215, "clip_ratio/low_mean": 0.07068293169140816, "clip_ratio/low_min": 0.07068293169140816, "clip_ratio/high_mean": 0.04872140567749739, "clip_ratio/high_max": 0.04872140567749739, "clip_ratio/region_mean": 0.11940433736890554, "reward_total_mean": 0.3589385449886322, "reward_meter_mean": 0.7985309958457947, "reward_meter_std": 0.23880243301391602, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9678767323493958, "reward_repeat_penalty_std": 0.047019246965646744, "reward_repeat_floor_mean": 0.995730996131897, "reward_repeat_floor_std": 0.006663989741355181, "reward_near_duplicate_penalty_mean": 0.9770342111587524, "reward_near_duplicate_penalty_std": 0.044951487332582474, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.42500001192092896, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.3589385449886322, "reward_total_composite_std": 0.2025938332080841} {"timestamp_utc": "2026-04-12T17:20:31Z", "mode": "train", "global_step": 384, "epoch": 0.020209462659860008, "loss": -0.0339, "grad_norm": 2.7382514476776123, "learning_rate": 8.83939393939394e-06, "num_tokens": 720291.0, "completions/mean_length": 228.5, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 58.400001525878906, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.41184407472610474, "rewards/meter/std": 0.35498902201652527, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.7898761034011841, "rewards/lexical_plausibility/std": 0.22936077415943146, "rewards/judge_quality/mean": 0.27125000953674316, "rewards/judge_quality/std": 0.2916180193424225, "rewards/repeat_penalty/mean": 0.9973608255386353, "rewards/repeat_penalty/std": 0.00566133763641119, "rewards/repeat_floor/mean": 0.9996041059494019, "rewards/repeat_floor/std": 0.000849198957439512, "rewards/near_duplicate_penalty/mean": 0.9973608255386353, "rewards/near_duplicate_penalty/std": 0.00566133763641119, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.09623901546001434, "rewards/total_composite/std": 0.11577337980270386, "reward": 0.09623901546001434, "reward_std": 0.11577337980270386, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1755877137184143, "sampling/sampling_logp_difference/max": 1.018585205078125, "sampling/importance_sampling_ratio/min": 0.36110547184944153, "sampling/importance_sampling_ratio/mean": 1.0711219310760498, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5550226420164108, "clip_ratio/low_mean": 0.027036355808377266, "clip_ratio/low_min": 0.027036355808377266, "clip_ratio/high_mean": 0.07140899263322353, "clip_ratio/high_max": 0.07140899263322353, "clip_ratio/region_mean": 0.0984453484416008, "reward_total_mean": 0.09623901546001434, "reward_meter_mean": 0.41184407472610474, "reward_meter_std": 0.35498902201652527, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.7898761034011841, "reward_lexical_plausibility_std": 0.22936077415943146, "reward_repeat_penalty_mean": 0.9973608255386353, "reward_repeat_penalty_std": 0.00566133763641119, "reward_repeat_floor_mean": 0.9996041059494019, "reward_repeat_floor_std": 0.000849198957439512, "reward_near_duplicate_penalty_mean": 0.9973608255386353, "reward_near_duplicate_penalty_std": 0.00566133763641119, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.27125000953674316, "reward_judge_quality_std": 0.2916180193424225, "reward_total_composite_mean": 0.09623901546001434, "reward_total_composite_std": 0.11577337980270386} {"timestamp_utc": "2026-04-12T17:20:41Z", "mode": "train", "global_step": 385, "epoch": 0.02026209146887006, "loss": 0.077, "grad_norm": 13.970919609069824, "learning_rate": 8.836363636363637e-06, "num_tokens": 721996.0, "completions/mean_length": 48.125, "completions/min_length": 39.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.125, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.7287188768386841, "rewards/meter/std": 0.2855376601219177, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1767766922712326, "rewards/repeat_penalty/mean": 0.9306275248527527, "rewards/repeat_penalty/std": 0.11843213438987732, "rewards/repeat_floor/mean": 0.9910269975662231, "rewards/repeat_floor/std": 0.01477543544024229, "rewards/near_duplicate_penalty/mean": 0.9616802930831909, "rewards/near_duplicate_penalty/std": 0.053322263062000275, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9641662836074829, "rewards/distinct_2/std": 0.07792406529188156, "rewards/total_composite/mean": 0.2882566452026367, "rewards/total_composite/std": 0.19672976434230804, "reward": 0.2882566452026367, "reward_std": 0.19672976434230804, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19441959261894226, "sampling/sampling_logp_difference/max": 1.3446664810180664, "sampling/importance_sampling_ratio/min": 0.2606266438961029, "sampling/importance_sampling_ratio/mean": 1.051590085029602, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9694604128599167, "clip_ratio/low_mean": 0.09881034214049578, "clip_ratio/low_min": 0.09881034214049578, "clip_ratio/high_mean": 0.08061224780976772, "clip_ratio/high_max": 0.08061224780976772, "clip_ratio/region_mean": 0.1794225899502635, "reward_total_mean": 0.2882566452026367, "reward_meter_mean": 0.7287188768386841, "reward_meter_std": 0.2855376601219177, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9306275248527527, "reward_repeat_penalty_std": 0.11843213438987732, "reward_repeat_floor_mean": 0.9910269975662231, "reward_repeat_floor_std": 0.01477543544024229, "reward_near_duplicate_penalty_mean": 0.9616802930831909, "reward_near_duplicate_penalty_std": 0.053322263062000275, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9641662836074829, "reward_distinct_2_std": 0.07792406529188156, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1767766922712326, "reward_total_composite_mean": 0.2882566452026367, "reward_total_composite_std": 0.19672976434230804} {"timestamp_utc": "2026-04-12T17:20:55Z", "mode": "train", "global_step": 386, "epoch": 0.020314720277880113, "loss": -0.0557, "grad_norm": 5.858519554138184, "learning_rate": 8.833333333333334e-06, "num_tokens": 723502.0, "completions/mean_length": 109.25, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.71428680419922, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.6169261932373047, "rewards/meter/std": 0.41295716166496277, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.9399685859680176, "rewards/lexical_plausibility/std": 0.16979444026947021, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.9202920198440552, "rewards/repeat_penalty/std": 0.07219918817281723, "rewards/repeat_floor/mean": 0.991070568561554, "rewards/repeat_floor/std": 0.007806537672877312, "rewards/near_duplicate_penalty/mean": 0.9741638898849487, "rewards/near_duplicate_penalty/std": 0.018550660461187363, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9438443183898926, "rewards/distinct_2/std": 0.05826306343078613, "rewards/total_composite/mean": 0.17364296317100525, "rewards/total_composite/std": 0.1408962458372116, "reward": 0.17364296317100525, "reward_std": 0.14089623093605042, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22827568650245667, "sampling/sampling_logp_difference/max": 2.9266014099121094, "sampling/importance_sampling_ratio/min": 0.05357882380485535, "sampling/importance_sampling_ratio/mean": 1.0259442329406738, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8930927515029907, "clip_ratio/low_mean": 0.07026487775146961, "clip_ratio/low_min": 0.07026487775146961, "clip_ratio/high_mean": 0.08794041536748409, "clip_ratio/high_max": 0.08794041536748409, "clip_ratio/region_mean": 0.1582052931189537, "reward_total_mean": 0.17364296317100525, "reward_meter_mean": 0.6169261932373047, "reward_meter_std": 0.41295716166496277, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.9399685859680176, "reward_lexical_plausibility_std": 0.16979444026947021, "reward_repeat_penalty_mean": 0.9202920198440552, "reward_repeat_penalty_std": 0.07219918817281723, "reward_repeat_floor_mean": 0.991070568561554, "reward_repeat_floor_std": 0.007806537672877312, "reward_near_duplicate_penalty_mean": 0.9741638898849487, "reward_near_duplicate_penalty_std": 0.018550660461187363, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9438443183898926, "reward_distinct_2_std": 0.05826306343078613, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.17364296317100525, "reward_total_composite_std": 0.1408962458372116} {"timestamp_utc": "2026-04-12T17:21:10Z", "mode": "train", "global_step": 387, "epoch": 0.020367349086890165, "loss": -0.1257, "grad_norm": 3.3730335235595703, "learning_rate": 8.830303030303031e-06, "num_tokens": 725265.0, "completions/mean_length": 183.375, "completions/min_length": 52.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 73.83333587646484, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.640785276889801, "rewards/meter/std": 0.40351882576942444, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175492912530899, "rewards/lexical_plausibility/mean": 0.9212695956230164, "rewards/lexical_plausibility/std": 0.14579758048057556, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.9264574646949768, "rewards/repeat_penalty/std": 0.06898912787437439, "rewards/repeat_floor/mean": 0.9922683238983154, "rewards/repeat_floor/std": 0.0059776995331048965, "rewards/near_duplicate_penalty/mean": 0.9750974178314209, "rewards/near_duplicate_penalty/std": 0.017016621306538582, "rewards/opening_diversity/mean": 0.9821428656578064, "rewards/opening_diversity/std": 0.05050762742757797, "rewards/distinct_2/mean": 0.967501163482666, "rewards/distinct_2/std": 0.05004063621163368, "rewards/total_composite/mean": 0.20359057188034058, "rewards/total_composite/std": 0.1862461119890213, "reward": 0.20359057188034058, "reward_std": 0.1862461119890213, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18108008801937103, "sampling/sampling_logp_difference/max": 1.8801088333129883, "sampling/importance_sampling_ratio/min": 0.15257351100444794, "sampling/importance_sampling_ratio/mean": 1.0532912015914917, "sampling/importance_sampling_ratio/max": 1.9593380689620972, "entropy": 1.5311155915260315, "clip_ratio/low_mean": 0.0421570036560297, "clip_ratio/low_min": 0.0421570036560297, "clip_ratio/high_mean": 0.08029082231223583, "clip_ratio/high_max": 0.08029082231223583, "clip_ratio/region_mean": 0.12244782596826553, "reward_total_mean": 0.20359057188034058, "reward_meter_mean": 0.640785276889801, "reward_meter_std": 0.40351882576942444, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175492912530899, "reward_lexical_plausibility_mean": 0.9212695956230164, "reward_lexical_plausibility_std": 0.14579758048057556, "reward_repeat_penalty_mean": 0.9264574646949768, "reward_repeat_penalty_std": 0.06898912787437439, "reward_repeat_floor_mean": 0.9922683238983154, "reward_repeat_floor_std": 0.0059776995331048965, "reward_near_duplicate_penalty_mean": 0.9750974178314209, "reward_near_duplicate_penalty_std": 0.017016621306538582, "reward_opening_diversity_mean": 0.9821428656578064, "reward_opening_diversity_std": 0.05050762742757797, "reward_distinct_2_mean": 0.967501163482666, "reward_distinct_2_std": 0.05004063621163368, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.20359057188034058, "reward_total_composite_std": 0.1862461119890213} {"timestamp_utc": "2026-04-12T17:21:25Z", "mode": "train", "global_step": 388, "epoch": 0.020419977895900217, "loss": -0.0383, "grad_norm": 2.712648391723633, "learning_rate": 8.827272727272727e-06, "num_tokens": 726869.0, "completions/mean_length": 228.5, "completions/min_length": 39.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 58.400001525878906, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.6996219158172607, "rewards/meter/std": 0.37979835271835327, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.8547126054763794, "rewards/lexical_plausibility/std": 0.2040940821170807, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1927248239517212, "rewards/repeat_penalty/mean": 0.9994698762893677, "rewards/repeat_penalty/std": 0.0012265866389498115, "rewards/repeat_floor/mean": 0.9999204874038696, "rewards/repeat_floor/std": 0.00018398174142930657, "rewards/near_duplicate_penalty/mean": 0.9994698762893677, "rewards/near_duplicate_penalty/std": 0.0012265866389498115, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15015628933906555, "rewards/total_composite/std": 0.15992803871631622, "reward": 0.15015628933906555, "reward_std": 0.15992803871631622, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20559276640415192, "sampling/sampling_logp_difference/max": 1.097541093826294, "sampling/importance_sampling_ratio/min": 0.3336905837059021, "sampling/importance_sampling_ratio/mean": 1.0503267049789429, "sampling/importance_sampling_ratio/max": 1.9009308815002441, "entropy": 1.6116873621940613, "clip_ratio/low_mean": 0.054532794281840324, "clip_ratio/low_min": 0.054532794281840324, "clip_ratio/high_mean": 0.022411616519093513, "clip_ratio/high_max": 0.022411616519093513, "clip_ratio/region_mean": 0.07694441080093384, "reward_total_mean": 0.15015628933906555, "reward_meter_mean": 0.6996219158172607, "reward_meter_std": 0.37979835271835327, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.8547126054763794, "reward_lexical_plausibility_std": 0.2040940821170807, "reward_repeat_penalty_mean": 0.9994698762893677, "reward_repeat_penalty_std": 0.0012265866389498115, "reward_repeat_floor_mean": 0.9999204874038696, "reward_repeat_floor_std": 0.00018398174142930657, "reward_near_duplicate_penalty_mean": 0.9994698762893677, "reward_near_duplicate_penalty_std": 0.0012265866389498115, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1927248239517212, "reward_total_composite_mean": 0.15015628933906555, "reward_total_composite_std": 0.15992803871631622} {"timestamp_utc": "2026-04-12T17:21:39Z", "mode": "train", "global_step": 389, "epoch": 0.020472606704910266, "loss": -0.0573, "grad_norm": 3.1303796768188477, "learning_rate": 8.824242424242426e-06, "num_tokens": 728568.0, "completions/mean_length": 171.375, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 57.833335876464844, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.3571970462799072, "rewards/meter/std": 0.3356514871120453, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.0707106739282608, "rewards/lexical_plausibility/mean": 0.8955612182617188, "rewards/lexical_plausibility/std": 0.19804127514362335, "rewards/judge_quality/mean": 0.2837499976158142, "rewards/judge_quality/std": 0.29271817207336426, "rewards/repeat_penalty/mean": 0.9397079348564148, "rewards/repeat_penalty/std": 0.08829059451818466, "rewards/repeat_floor/mean": 0.9949350357055664, "rewards/repeat_floor/std": 0.005885038059204817, "rewards/near_duplicate_penalty/mean": 0.9908865690231323, "rewards/near_duplicate_penalty/std": 0.009218401275575161, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9797453880310059, "rewards/distinct_2/std": 0.041432034224271774, "rewards/total_composite/mean": 0.09466156363487244, "rewards/total_composite/std": 0.09176289290189743, "reward": 0.09466156363487244, "reward_std": 0.09176289290189743, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20467402040958405, "sampling/sampling_logp_difference/max": 2.0913610458374023, "sampling/importance_sampling_ratio/min": 0.12351889908313751, "sampling/importance_sampling_ratio/mean": 1.0227696895599365, "sampling/importance_sampling_ratio/max": 1.9052410125732422, "entropy": 1.5064367949962616, "clip_ratio/low_mean": 0.04087243415415287, "clip_ratio/low_min": 0.04087243415415287, "clip_ratio/high_mean": 0.10740681923925877, "clip_ratio/high_max": 0.10740681923925877, "clip_ratio/region_mean": 0.14827925339341164, "reward_total_mean": 0.09466156363487244, "reward_meter_mean": 0.3571970462799072, "reward_meter_std": 0.3356514871120453, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.0707106739282608, "reward_lexical_plausibility_mean": 0.8955612182617188, "reward_lexical_plausibility_std": 0.19804127514362335, "reward_repeat_penalty_mean": 0.9397079348564148, "reward_repeat_penalty_std": 0.08829059451818466, "reward_repeat_floor_mean": 0.9949350357055664, "reward_repeat_floor_std": 0.005885038059204817, "reward_near_duplicate_penalty_mean": 0.9908865690231323, "reward_near_duplicate_penalty_std": 0.009218401275575161, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9797453880310059, "reward_distinct_2_std": 0.041432034224271774, "reward_judge_quality_mean": 0.2837499976158142, "reward_judge_quality_std": 0.29271817207336426, "reward_total_composite_mean": 0.09466156363487244, "reward_total_composite_std": 0.09176289290189743} {"timestamp_utc": "2026-04-12T17:21:54Z", "mode": "train", "global_step": 390, "epoch": 0.02052523551392032, "loss": -0.05, "grad_norm": 5.144541263580322, "learning_rate": 8.821212121212121e-06, "num_tokens": 730251.0, "completions/mean_length": 102.375, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.85714340209961, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.4600223898887634, "rewards/meter/std": 0.42484211921691895, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9141478538513184, "rewards/lexical_plausibility/std": 0.17315734922885895, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.23868314921855927, "rewards/repeat_penalty/mean": 0.9831186532974243, "rewards/repeat_penalty/std": 0.023213526234030724, "rewards/repeat_floor/mean": 0.9977360963821411, "rewards/repeat_floor/std": 0.0028702779673039913, "rewards/near_duplicate_penalty/mean": 0.9877917170524597, "rewards/near_duplicate_penalty/std": 0.013979591429233551, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.995192289352417, "rewards/distinct_2/std": 0.013598216697573662, "rewards/total_composite/mean": 0.2282353937625885, "rewards/total_composite/std": 0.214994877576828, "reward": 0.2282353937625885, "reward_std": 0.214994877576828, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.198981374502182, "sampling/sampling_logp_difference/max": 1.4062249660491943, "sampling/importance_sampling_ratio/min": 0.24506668746471405, "sampling/importance_sampling_ratio/mean": 1.0506387948989868, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3851213604211807, "clip_ratio/low_mean": 0.056114123202860355, "clip_ratio/low_min": 0.056114123202860355, "clip_ratio/high_mean": 0.09040492400527, "clip_ratio/high_max": 0.09040492400527, "clip_ratio/region_mean": 0.14651904720813036, "reward_total_mean": 0.2282353937625885, "reward_meter_mean": 0.4600223898887634, "reward_meter_std": 0.42484211921691895, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9141478538513184, "reward_lexical_plausibility_std": 0.17315734922885895, "reward_repeat_penalty_mean": 0.9831186532974243, "reward_repeat_penalty_std": 0.023213526234030724, "reward_repeat_floor_mean": 0.9977360963821411, "reward_repeat_floor_std": 0.0028702779673039913, "reward_near_duplicate_penalty_mean": 0.9877917170524597, "reward_near_duplicate_penalty_std": 0.013979591429233551, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.995192289352417, "reward_distinct_2_std": 0.013598216697573662, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.23868314921855927, "reward_total_composite_mean": 0.2282353937625885, "reward_total_composite_std": 0.214994877576828} {"timestamp_utc": "2026-04-12T17:22:03Z", "mode": "train", "global_step": 391, "epoch": 0.02057786432293037, "loss": 0.0196, "grad_norm": 9.996170043945312, "learning_rate": 8.818181818181819e-06, "num_tokens": 732125.0, "completions/mean_length": 63.25, "completions/min_length": 53.0, "completions/max_length": 81.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.25, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.8383941650390625, "rewards/meter/std": 0.1706671565771103, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9402313232421875, "rewards/repeat_penalty/std": 0.1063796654343605, "rewards/repeat_floor/mean": 0.9948868751525879, "rewards/repeat_floor/std": 0.007647712714970112, "rewards/near_duplicate_penalty/mean": 0.9843381643295288, "rewards/near_duplicate_penalty/std": 0.017609547823667526, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9692903757095337, "rewards/distinct_2/std": 0.057886600494384766, "rewards/total_composite/mean": 0.32865601778030396, "rewards/total_composite/std": 0.07581639289855957, "reward": 0.32865601778030396, "reward_std": 0.07581639289855957, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16149884462356567, "sampling/sampling_logp_difference/max": 1.7047510147094727, "sampling/importance_sampling_ratio/min": 0.18181763589382172, "sampling/importance_sampling_ratio/mean": 1.0544884204864502, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4993118792772293, "clip_ratio/low_mean": 0.061895521357655525, "clip_ratio/low_min": 0.061895521357655525, "clip_ratio/high_mean": 0.08875847700983286, "clip_ratio/high_max": 0.08875847700983286, "clip_ratio/region_mean": 0.15065399836748838, "reward_total_mean": 0.32865601778030396, "reward_meter_mean": 0.8383941650390625, "reward_meter_std": 0.1706671565771103, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9402313232421875, "reward_repeat_penalty_std": 0.1063796654343605, "reward_repeat_floor_mean": 0.9948868751525879, "reward_repeat_floor_std": 0.007647712714970112, "reward_near_duplicate_penalty_mean": 0.9843381643295288, "reward_near_duplicate_penalty_std": 0.017609547823667526, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9692903757095337, "reward_distinct_2_std": 0.057886600494384766, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.32865601778030396, "reward_total_composite_std": 0.07581639289855957} {"timestamp_utc": "2026-04-12T17:22:12Z", "mode": "train", "global_step": 392, "epoch": 0.020630493131940424, "loss": 0.0233, "grad_norm": 13.247349739074707, "learning_rate": 8.815151515151516e-06, "num_tokens": 733591.0, "completions/mean_length": 40.25, "completions/min_length": 33.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.25, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.47477659583091736, "rewards/meter/std": 0.3723296523094177, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.8869690895080566, "rewards/repeat_penalty/std": 0.1098896786570549, "rewards/repeat_floor/mean": 0.9859501719474792, "rewards/repeat_floor/std": 0.01314405258744955, "rewards/near_duplicate_penalty/mean": 0.9445058107376099, "rewards/near_duplicate_penalty/std": 0.045414797961711884, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9363809823989868, "rewards/distinct_2/std": 0.0766734927892685, "rewards/total_composite/mean": 0.20537853240966797, "rewards/total_composite/std": 0.14428956806659698, "reward": 0.20537853240966797, "reward_std": 0.14428956806659698, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19985879957675934, "sampling/sampling_logp_difference/max": 1.397996425628662, "sampling/importance_sampling_ratio/min": 0.24709153175354004, "sampling/importance_sampling_ratio/mean": 1.0509636402130127, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.148595839738846, "clip_ratio/low_mean": 0.06792653910815716, "clip_ratio/low_min": 0.06792653910815716, "clip_ratio/high_mean": 0.12864204309880733, "clip_ratio/high_max": 0.12864204309880733, "clip_ratio/region_mean": 0.1965685822069645, "reward_total_mean": 0.20537853240966797, "reward_meter_mean": 0.47477659583091736, "reward_meter_std": 0.3723296523094177, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8869690895080566, "reward_repeat_penalty_std": 0.1098896786570549, "reward_repeat_floor_mean": 0.9859501719474792, "reward_repeat_floor_std": 0.01314405258744955, "reward_near_duplicate_penalty_mean": 0.9445058107376099, "reward_near_duplicate_penalty_std": 0.045414797961711884, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9363809823989868, "reward_distinct_2_std": 0.0766734927892685, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.20537853240966797, "reward_total_composite_std": 0.14428956806659698} {"timestamp_utc": "2026-04-12T17:22:27Z", "mode": "train", "global_step": 393, "epoch": 0.020683121940950476, "loss": -0.0492, "grad_norm": 4.1214375495910645, "learning_rate": 8.812121212121213e-06, "num_tokens": 735591.0, "completions/mean_length": 136.0, "completions/min_length": 63.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 82.28572082519531, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 96.0, "rewards/meter/mean": 0.7372268438339233, "rewards/meter/std": 0.4070919156074524, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9264833927154541, "rewards/lexical_plausibility/std": 0.1688588559627533, "rewards/judge_quality/mean": 0.5012500286102295, "rewards/judge_quality/std": 0.36286312341690063, "rewards/repeat_penalty/mean": 0.9304853677749634, "rewards/repeat_penalty/std": 0.0618341863155365, "rewards/repeat_floor/mean": 0.991073727607727, "rewards/repeat_floor/std": 0.008880944922566414, "rewards/near_duplicate_penalty/mean": 0.9570054411888123, "rewards/near_duplicate_penalty/std": 0.05864662677049637, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.972476601600647, "rewards/distinct_2/std": 0.029476290568709373, "rewards/total_composite/mean": 0.4474537968635559, "rewards/total_composite/std": 0.3689633011817932, "reward": 0.4474537968635559, "reward_std": 0.3689633011817932, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14681163430213928, "sampling/sampling_logp_difference/max": 1.7314529418945312, "sampling/importance_sampling_ratio/min": 0.17702700197696686, "sampling/importance_sampling_ratio/mean": 1.010379672050476, "sampling/importance_sampling_ratio/max": 1.965679407119751, "entropy": 1.0856412202119827, "clip_ratio/low_mean": 0.07229009084403515, "clip_ratio/low_min": 0.07229009084403515, "clip_ratio/high_mean": 0.058582477271556854, "clip_ratio/high_max": 0.058582477271556854, "clip_ratio/region_mean": 0.130872568115592, "reward_total_mean": 0.4474537968635559, "reward_meter_mean": 0.7372268438339233, "reward_meter_std": 0.4070919156074524, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9264833927154541, "reward_lexical_plausibility_std": 0.1688588559627533, "reward_repeat_penalty_mean": 0.9304853677749634, "reward_repeat_penalty_std": 0.0618341863155365, "reward_repeat_floor_mean": 0.991073727607727, "reward_repeat_floor_std": 0.008880944922566414, "reward_near_duplicate_penalty_mean": 0.9570054411888123, "reward_near_duplicate_penalty_std": 0.05864662677049637, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.972476601600647, "reward_distinct_2_std": 0.029476290568709373, "reward_judge_quality_mean": 0.5012500286102295, "reward_judge_quality_std": 0.36286312341690063, "reward_total_composite_mean": 0.4474537968635559, "reward_total_composite_std": 0.3689633011817932} {"timestamp_utc": "2026-04-12T17:22:36Z", "mode": "train", "global_step": 394, "epoch": 0.02073575074996053, "loss": -0.0682, "grad_norm": 12.230426788330078, "learning_rate": 8.809090909090909e-06, "num_tokens": 737169.0, "completions/mean_length": 43.25, "completions/min_length": 36.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.25, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.8786708116531372, "rewards/meter/std": 0.23519764840602875, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.8454370498657227, "rewards/repeat_penalty/std": 0.30686092376708984, "rewards/repeat_floor/mean": 0.9786449074745178, "rewards/repeat_floor/std": 0.044148582965135574, "rewards/near_duplicate_penalty/mean": 0.9359985589981079, "rewards/near_duplicate_penalty/std": 0.10977930575609207, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8902232646942139, "rewards/distinct_2/std": 0.250618040561676, "rewards/total_composite/mean": 0.42066481709480286, "rewards/total_composite/std": 0.21841852366924286, "reward": 0.42066481709480286, "reward_std": 0.21841853857040405, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15777400135993958, "sampling/sampling_logp_difference/max": 1.178992748260498, "sampling/importance_sampling_ratio/min": 0.3075883984565735, "sampling/importance_sampling_ratio/mean": 1.0269209146499634, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.279542215168476, "clip_ratio/low_mean": 0.07671437226235867, "clip_ratio/low_min": 0.07671437226235867, "clip_ratio/high_mean": 0.06279671099036932, "clip_ratio/high_max": 0.06279671099036932, "clip_ratio/region_mean": 0.13951108325272799, "reward_total_mean": 0.42066481709480286, "reward_meter_mean": 0.8786708116531372, "reward_meter_std": 0.23519764840602875, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8454370498657227, "reward_repeat_penalty_std": 0.30686092376708984, "reward_repeat_floor_mean": 0.9786449074745178, "reward_repeat_floor_std": 0.044148582965135574, "reward_near_duplicate_penalty_mean": 0.9359985589981079, "reward_near_duplicate_penalty_std": 0.10977930575609207, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8902232646942139, "reward_distinct_2_std": 0.250618040561676, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.42066481709480286, "reward_total_composite_std": 0.21841852366924286} {"timestamp_utc": "2026-04-12T17:22:45Z", "mode": "train", "global_step": 395, "epoch": 0.02078837955897058, "loss": 0.0401, "grad_norm": 10.417993545532227, "learning_rate": 8.806060606060608e-06, "num_tokens": 738946.0, "completions/mean_length": 40.125, "completions/min_length": 34.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.125, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.6346161365509033, "rewards/meter/std": 0.3963431119918823, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.2671777307987213, "rewards/repeat_penalty/mean": 0.9247074723243713, "rewards/repeat_penalty/std": 0.17210596799850464, "rewards/repeat_floor/mean": 0.9911103844642639, "rewards/repeat_floor/std": 0.01904297061264515, "rewards/near_duplicate_penalty/mean": 0.970543622970581, "rewards/near_duplicate_penalty/std": 0.04399280250072479, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9711538553237915, "rewards/distinct_2/std": 0.0815892368555069, "rewards/total_composite/mean": 0.37466081976890564, "rewards/total_composite/std": 0.3277771472930908, "reward": 0.37466081976890564, "reward_std": 0.3277771472930908, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18876314163208008, "sampling/sampling_logp_difference/max": 3.047183036804199, "sampling/importance_sampling_ratio/min": 0.04749252274632454, "sampling/importance_sampling_ratio/mean": 1.014123797416687, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0627145543694496, "clip_ratio/low_mean": 0.12015937734395266, "clip_ratio/low_min": 0.12015937734395266, "clip_ratio/high_mean": 0.04669117787852883, "clip_ratio/high_max": 0.04669117787852883, "clip_ratio/region_mean": 0.1668505552224815, "reward_total_mean": 0.37466081976890564, "reward_meter_mean": 0.6346161365509033, "reward_meter_std": 0.3963431119918823, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9247074723243713, "reward_repeat_penalty_std": 0.17210596799850464, "reward_repeat_floor_mean": 0.9911103844642639, "reward_repeat_floor_std": 0.01904297061264515, "reward_near_duplicate_penalty_mean": 0.970543622970581, "reward_near_duplicate_penalty_std": 0.04399280250072479, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9711538553237915, "reward_distinct_2_std": 0.0815892368555069, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.2671777307987213, "reward_total_composite_mean": 0.37466081976890564, "reward_total_composite_std": 0.3277771472930908} {"timestamp_utc": "2026-04-12T17:22:59Z", "mode": "train", "global_step": 396, "epoch": 0.020841008367980633, "loss": -0.0895, "grad_norm": 4.484723091125488, "learning_rate": 8.803030303030303e-06, "num_tokens": 741130.0, "completions/mean_length": 148.0, "completions/min_length": 85.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 96.00000762939453, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 119.0, "rewards/meter/mean": 0.6980688571929932, "rewards/meter/std": 0.37530940771102905, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.2651650309562683, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.971875011920929, "rewards/count_floor/std": 0.07954952120780945, "rewards/lexical_plausibility/mean": 0.8836562037467957, "rewards/lexical_plausibility/std": 0.2205982357263565, "rewards/judge_quality/mean": 0.23749998211860657, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.7404608726501465, "rewards/repeat_penalty/std": 0.27593088150024414, "rewards/repeat_floor/mean": 0.9706962704658508, "rewards/repeat_floor/std": 0.03453051298856735, "rewards/near_duplicate_penalty/mean": 0.9310324192047119, "rewards/near_duplicate_penalty/std": 0.08182311803102493, "rewards/opening_diversity/mean": 0.9635416269302368, "rewards/opening_diversity/std": 0.05970953777432442, "rewards/distinct_2/mean": 0.8136544823646545, "rewards/distinct_2/std": 0.21146509051322937, "rewards/total_composite/mean": 0.17175447940826416, "rewards/total_composite/std": 0.13983315229415894, "reward": 0.17175447940826416, "reward_std": 0.13983313739299774, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1565432995557785, "sampling/sampling_logp_difference/max": 1.8109512329101562, "sampling/importance_sampling_ratio/min": 0.19080238044261932, "sampling/importance_sampling_ratio/mean": 1.0198642015457153, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7546832039952278, "clip_ratio/low_mean": 0.053342288825660944, "clip_ratio/low_min": 0.053342288825660944, "clip_ratio/high_mean": 0.07533847633749247, "clip_ratio/high_max": 0.07533847633749247, "clip_ratio/region_mean": 0.1286807651631534, "reward_total_mean": 0.17175447940826416, "reward_meter_mean": 0.6980688571929932, "reward_meter_std": 0.37530940771102905, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.2651650309562683, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.971875011920929, "reward_count_floor_std": 0.07954952120780945, "reward_lexical_plausibility_mean": 0.8836562037467957, "reward_lexical_plausibility_std": 0.2205982357263565, "reward_repeat_penalty_mean": 0.7404608726501465, "reward_repeat_penalty_std": 0.27593088150024414, "reward_repeat_floor_mean": 0.9706962704658508, "reward_repeat_floor_std": 0.03453051298856735, "reward_near_duplicate_penalty_mean": 0.9310324192047119, "reward_near_duplicate_penalty_std": 0.08182311803102493, "reward_opening_diversity_mean": 0.9635416269302368, "reward_opening_diversity_std": 0.05970953777432442, "reward_distinct_2_mean": 0.8136544823646545, "reward_distinct_2_std": 0.21146509051322937, "reward_judge_quality_mean": 0.23749998211860657, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.17175447940826416, "reward_total_composite_std": 0.13983315229415894} {"timestamp_utc": "2026-04-12T17:23:14Z", "mode": "train", "global_step": 397, "epoch": 0.020893637176990686, "loss": -0.1715, "grad_norm": 2.000181198120117, "learning_rate": 8.8e-06, "num_tokens": 743012.0, "completions/mean_length": 312.25, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 112.5, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 159.0, "rewards/meter/mean": 0.7296103239059448, "rewards/meter/std": 0.3876735270023346, "rewards/count_adherence/mean": 0.6500000357627869, "rewards/count_adherence/std": 0.3338091969490051, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8949999809265137, "rewards/count_floor/std": 0.10014276206493378, "rewards/lexical_plausibility/mean": 0.7854212522506714, "rewards/lexical_plausibility/std": 0.23089616000652313, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.9214908480644226, "rewards/repeat_penalty/std": 0.16657783091068268, "rewards/repeat_floor/mean": 0.9921917915344238, "rewards/repeat_floor/std": 0.014982621185481548, "rewards/near_duplicate_penalty/mean": 0.9822738766670227, "rewards/near_duplicate_penalty/std": 0.017936529591679573, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9427855014801025, "rewards/distinct_2/std": 0.14097727835178375, "rewards/total_composite/mean": 0.18969127535820007, "rewards/total_composite/std": 0.18752700090408325, "reward": 0.18969127535820007, "reward_std": 0.18752698600292206, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18511773645877838, "sampling/sampling_logp_difference/max": 1.4762601852416992, "sampling/importance_sampling_ratio/min": 0.22849060595035553, "sampling/importance_sampling_ratio/mean": 1.0227693319320679, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2498980313539505, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.09984966926276684, "clip_ratio/high_max": 0.09984966926276684, "clip_ratio/region_mean": 0.09984966926276684, "reward_total_mean": 0.18969127535820007, "reward_meter_mean": 0.7296103239059448, "reward_meter_std": 0.3876735270023346, "reward_count_adherence_mean": 0.6500000357627869, "reward_count_adherence_std": 0.3338091969490051, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8949999809265137, "reward_count_floor_std": 0.10014276206493378, "reward_lexical_plausibility_mean": 0.7854212522506714, "reward_lexical_plausibility_std": 0.23089616000652313, "reward_repeat_penalty_mean": 0.9214908480644226, "reward_repeat_penalty_std": 0.16657783091068268, "reward_repeat_floor_mean": 0.9921917915344238, "reward_repeat_floor_std": 0.014982621185481548, "reward_near_duplicate_penalty_mean": 0.9822738766670227, "reward_near_duplicate_penalty_std": 0.017936529591679573, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9427855014801025, "reward_distinct_2_std": 0.14097727835178375, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.18969127535820007, "reward_total_composite_std": 0.18752700090408325} {"timestamp_utc": "2026-04-12T17:23:28Z", "mode": "train", "global_step": 398, "epoch": 0.020946265986000738, "loss": -0.0332, "grad_norm": 4.894969940185547, "learning_rate": 8.796969696969698e-06, "num_tokens": 744860.0, "completions/mean_length": 120.0, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 64.0, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.61540687084198, "rewards/meter/std": 0.38487833738327026, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.947494387626648, "rewards/lexical_plausibility/std": 0.14850832521915436, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.9320471286773682, "rewards/repeat_penalty/std": 0.07208981364965439, "rewards/repeat_floor/mean": 0.9918498396873474, "rewards/repeat_floor/std": 0.007867157459259033, "rewards/near_duplicate_penalty/mean": 0.9689217805862427, "rewards/near_duplicate_penalty/std": 0.023324813693761826, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.961239755153656, "rewards/distinct_2/std": 0.05945970118045807, "rewards/total_composite/mean": 0.3196439743041992, "rewards/total_composite/std": 0.27725884318351746, "reward": 0.3196439743041992, "reward_std": 0.27725884318351746, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18957772850990295, "sampling/sampling_logp_difference/max": 2.0010344982147217, "sampling/importance_sampling_ratio/min": 0.13519535958766937, "sampling/importance_sampling_ratio/mean": 1.0056103467941284, "sampling/importance_sampling_ratio/max": 1.8509271144866943, "entropy": 1.5113163739442825, "clip_ratio/low_mean": 0.057552896440029144, "clip_ratio/low_min": 0.057552896440029144, "clip_ratio/high_mean": 0.12114899046719074, "clip_ratio/high_max": 0.12114899046719074, "clip_ratio/region_mean": 0.1787018869072199, "reward_total_mean": 0.3196439743041992, "reward_meter_mean": 0.61540687084198, "reward_meter_std": 0.38487833738327026, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.947494387626648, "reward_lexical_plausibility_std": 0.14850832521915436, "reward_repeat_penalty_mean": 0.9320471286773682, "reward_repeat_penalty_std": 0.07208981364965439, "reward_repeat_floor_mean": 0.9918498396873474, "reward_repeat_floor_std": 0.007867157459259033, "reward_near_duplicate_penalty_mean": 0.9689217805862427, "reward_near_duplicate_penalty_std": 0.023324813693761826, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.961239755153656, "reward_distinct_2_std": 0.05945970118045807, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.3196439743041992, "reward_total_composite_std": 0.27725884318351746} {"timestamp_utc": "2026-04-12T17:23:41Z", "mode": "train", "global_step": 399, "epoch": 0.02099889479501079, "loss": -0.0415, "grad_norm": 4.3880839347839355, "learning_rate": 8.793939393939395e-06, "num_tokens": 746519.0, "completions/mean_length": 101.375, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 42.71428680419922, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.7624013423919678, "rewards/meter/std": 0.4070345461368561, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9524913430213928, "rewards/lexical_plausibility/std": 0.12353385984897614, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121344089508057, "rewards/repeat_penalty/mean": 0.9850335121154785, "rewards/repeat_penalty/std": 0.029185784980654716, "rewards/repeat_floor/mean": 0.9983240365982056, "rewards/repeat_floor/std": 0.002946495311334729, "rewards/near_duplicate_penalty/mean": 0.9945961833000183, "rewards/near_duplicate_penalty/std": 0.0108893271535635, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.3531382977962494, "rewards/total_composite/std": 0.2838740348815918, "reward": 0.3531382977962494, "reward_std": 0.2838740050792694, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17453576624393463, "sampling/sampling_logp_difference/max": 1.8483238220214844, "sampling/importance_sampling_ratio/min": 0.15750093758106232, "sampling/importance_sampling_ratio/mean": 1.0251365900039673, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.410551592707634, "clip_ratio/low_mean": 0.08065368328243494, "clip_ratio/low_min": 0.08065368328243494, "clip_ratio/high_mean": 0.06921791657805443, "clip_ratio/high_max": 0.06921791657805443, "clip_ratio/region_mean": 0.14987159986048937, "reward_total_mean": 0.3531382977962494, "reward_meter_mean": 0.7624013423919678, "reward_meter_std": 0.4070345461368561, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9524913430213928, "reward_lexical_plausibility_std": 0.12353385984897614, "reward_repeat_penalty_mean": 0.9850335121154785, "reward_repeat_penalty_std": 0.029185784980654716, "reward_repeat_floor_mean": 0.9983240365982056, "reward_repeat_floor_std": 0.002946495311334729, "reward_near_duplicate_penalty_mean": 0.9945961833000183, "reward_near_duplicate_penalty_std": 0.0108893271535635, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121344089508057, "reward_total_composite_mean": 0.3531382977962494, "reward_total_composite_std": 0.2838740348815918} {"timestamp_utc": "2026-04-12T17:23:49Z", "mode": "train", "global_step": 400, "epoch": 0.02105152360402084, "loss": 0.0365, "grad_norm": 13.021088600158691, "learning_rate": 8.790909090909092e-06, "num_tokens": 747958.0, "completions/mean_length": 24.875, "completions/min_length": 21.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.875, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.8019142746925354, "rewards/meter/std": 0.3328975737094879, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9475266933441162, "rewards/lexical_plausibility/std": 0.0875638872385025, "rewards/judge_quality/mean": 0.831250011920929, "rewards/judge_quality/std": 0.27559998631477356, "rewards/repeat_penalty/mean": 0.7228922843933105, "rewards/repeat_penalty/std": 0.04000207781791687, "rewards/repeat_floor/mean": 0.97957843542099, "rewards/repeat_floor/std": 0.008000420406460762, "rewards/near_duplicate_penalty/mean": 0.9638563394546509, "rewards/near_duplicate_penalty/std": 0.05333612486720085, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7295103073120117, "rewards/total_composite/std": 0.30076947808265686, "reward": 0.7295103073120117, "reward_std": 0.3007694482803345, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16320884227752686, "sampling/sampling_logp_difference/max": 1.4541816711425781, "sampling/importance_sampling_ratio/min": 0.23359143733978271, "sampling/importance_sampling_ratio/mean": 1.0245164632797241, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2223070114850998, "clip_ratio/low_mean": 0.023148147389292717, "clip_ratio/low_min": 0.023148147389292717, "clip_ratio/high_mean": 0.1686567608267069, "clip_ratio/high_max": 0.1686567608267069, "clip_ratio/region_mean": 0.1918049082159996, "reward_total_mean": 0.7295103073120117, "reward_meter_mean": 0.8019142746925354, "reward_meter_std": 0.3328975737094879, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9475266933441162, "reward_lexical_plausibility_std": 0.0875638872385025, "reward_repeat_penalty_mean": 0.7228922843933105, "reward_repeat_penalty_std": 0.04000207781791687, "reward_repeat_floor_mean": 0.97957843542099, "reward_repeat_floor_std": 0.008000420406460762, "reward_near_duplicate_penalty_mean": 0.9638563394546509, "reward_near_duplicate_penalty_std": 0.05333612486720085, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.831250011920929, "reward_judge_quality_std": 0.27559998631477356, "reward_total_composite_mean": 0.7295103073120117, "reward_total_composite_std": 0.30076947808265686} {"timestamp_utc": "2026-04-12T17:26:18Z", "mode": "eval", "global_step": 400, "epoch": 0.02105152360402084, "eval_loss": NaN, "eval_runtime": 148.5287, "eval_samples_per_second": 0.7, "eval_steps_per_second": 0.088, "eval_num_tokens": 747958.0, "eval_completions/mean_length": 212.75, "eval_completions/min_length": 40.38461538461539, "eval_completions/max_length": 493.15384615384613, "eval_completions/clipped_ratio": 0.17307692307692307, "eval_completions/mean_terminated_length": 149.4699677687425, "eval_completions/min_terminated_length": 40.38461538461539, "eval_completions/max_terminated_length": 333.46153846153845, "eval_rewards/meter/mean": 0.6085947385201087, "eval_rewards/meter/std": 0.3327841472167235, "eval_rewards/count_adherence/mean": 0.8155458019329951, "eval_rewards/count_adherence/std": 0.20745725299303347, "eval_rewards/arabic_clean/mean": 0.7692307692307693, "eval_rewards/arabic_clean/std": 0.3929927326165713, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9956730741720933, "eval_rewards/arabic_floor/std": 0.009420730173587799, "eval_rewards/count_floor/mean": 0.9446637447063739, "eval_rewards/count_floor/std": 0.062237174894947275, "eval_rewards/lexical_plausibility/mean": 0.9532026648521423, "eval_rewards/lexical_plausibility/std": 0.08891198726800773, "eval_rewards/judge_quality/mean": 0.3454807721651517, "eval_rewards/judge_quality/std": 0.2318291744360557, "eval_rewards/repeat_penalty/mean": 0.7250972390174866, "eval_rewards/repeat_penalty/std": 0.2896957787183615, "eval_rewards/repeat_floor/mean": 0.970545654113476, "eval_rewards/repeat_floor/std": 0.03406601409929303, "eval_rewards/near_duplicate_penalty/mean": 0.9396584767561692, "eval_rewards/near_duplicate_penalty/std": 0.07124712576086704, "eval_rewards/opening_diversity/mean": 0.9646484072391803, "eval_rewards/opening_diversity/std": 0.07636884599924088, "eval_rewards/distinct_2/mean": 0.7968663985912616, "eval_rewards/distinct_2/std": 0.26321384425346667, "eval_rewards/total_composite/mean": 0.21586975799157068, "eval_rewards/total_composite/std": 0.21183620765805244, "eval_reward": 0.21586975799157068, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.09321756718250421, "eval_sampling/sampling_logp_difference/max": 1.1387993739201472, "eval_sampling/importance_sampling_ratio/min": 0.32615469510738665, "eval_sampling/importance_sampling_ratio/mean": 1.0274855632048387, "eval_sampling/importance_sampling_ratio/max": 1.6013466945061317, "eval_entropy": 1.2129662541242747, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.21586975799157068, "eval_reward_meter_mean": 0.6085947385201087, "eval_reward_meter_std": 0.3327841472167235, "eval_reward_count_adherence_mean": 0.8155458019329951, "eval_reward_count_adherence_std": 0.20745725299303347, "eval_reward_arabic_clean_mean": 0.7692307692307693, "eval_reward_arabic_clean_std": 0.3929927326165713, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9956730741720933, "eval_reward_arabic_floor_std": 0.009420730173587799, "eval_reward_count_floor_mean": 0.9446637447063739, "eval_reward_count_floor_std": 0.062237174894947275, "eval_reward_lexical_plausibility_mean": 0.9532026648521423, "eval_reward_lexical_plausibility_std": 0.08891198726800773, "eval_reward_repeat_penalty_mean": 0.7250972390174866, "eval_reward_repeat_penalty_std": 0.2896957787183615, "eval_reward_repeat_floor_mean": 0.970545654113476, "eval_reward_repeat_floor_std": 0.03406601409929303, "eval_reward_near_duplicate_penalty_mean": 0.9396584767561692, "eval_reward_near_duplicate_penalty_std": 0.07124712576086704, "eval_reward_opening_diversity_mean": 0.9646484072391803, "eval_reward_opening_diversity_std": 0.07636884599924088, "eval_reward_distinct_2_mean": 0.7968663985912616, "eval_reward_distinct_2_std": 0.26321384425346667, "eval_reward_judge_quality_mean": 0.3454807721651517, "eval_reward_judge_quality_std": 0.2318291744360557, "eval_reward_total_composite_mean": 0.21586975799157068, "eval_reward_total_composite_std": 0.21183620765805244} {"timestamp_utc": "2026-04-12T17:26:31Z", "mode": "train", "global_step": 401, "epoch": 0.021104152413030892, "loss": 0.027, "grad_norm": 14.887590408325195, "learning_rate": 8.787878787878788e-06, "num_tokens": 749831.0, "completions/mean_length": 65.125, "completions/min_length": 53.0, "completions/max_length": 88.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.125, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 88.0, "rewards/meter/mean": 0.8512269854545593, "rewards/meter/std": 0.3351706266403198, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.21999594569206238, "rewards/repeat_penalty/mean": 0.9267975091934204, "rewards/repeat_penalty/std": 0.06511903554201126, "rewards/repeat_floor/mean": 0.9922330975532532, "rewards/repeat_floor/std": 0.006678598001599312, "rewards/near_duplicate_penalty/mean": 0.9824880361557007, "rewards/near_duplicate_penalty/std": 0.014683682471513748, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.942887544631958, "rewards/distinct_2/std": 0.05745479464530945, "rewards/total_composite/mean": 0.3106134533882141, "rewards/total_composite/std": 0.15826581418514252, "reward": 0.3106134533882141, "reward_std": 0.15826581418514252, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14995956420898438, "sampling/sampling_logp_difference/max": 1.8227968215942383, "sampling/importance_sampling_ratio/min": 0.16157323122024536, "sampling/importance_sampling_ratio/mean": 1.0287705659866333, "sampling/importance_sampling_ratio/max": 1.9278740882873535, "entropy": 1.2748309522867203, "clip_ratio/low_mean": 0.02996794879436493, "clip_ratio/low_min": 0.02996794879436493, "clip_ratio/high_mean": 0.13120628520846367, "clip_ratio/high_max": 0.13120628520846367, "clip_ratio/region_mean": 0.1611742340028286, "reward_total_mean": 0.3106134533882141, "reward_meter_mean": 0.8512269854545593, "reward_meter_std": 0.3351706266403198, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9267975091934204, "reward_repeat_penalty_std": 0.06511903554201126, "reward_repeat_floor_mean": 0.9922330975532532, "reward_repeat_floor_std": 0.006678598001599312, "reward_near_duplicate_penalty_mean": 0.9824880361557007, "reward_near_duplicate_penalty_std": 0.014683682471513748, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.942887544631958, "reward_distinct_2_std": 0.05745479464530945, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.21999594569206238, "reward_total_composite_mean": 0.3106134533882141, "reward_total_composite_std": 0.15826581418514252} {"timestamp_utc": "2026-04-12T17:26:40Z", "mode": "train", "global_step": 402, "epoch": 0.021156781222040944, "loss": -0.0198, "grad_norm": 14.945469856262207, "learning_rate": 8.784848484848487e-06, "num_tokens": 751533.0, "completions/mean_length": 41.75, "completions/min_length": 33.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.75, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.6461836099624634, "rewards/meter/std": 0.3091847598552704, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7350000143051147, "rewards/judge_quality/std": 0.2655990719795227, "rewards/repeat_penalty/mean": 0.9799329042434692, "rewards/repeat_penalty/std": 0.05391687527298927, "rewards/repeat_floor/mean": 0.9978821277618408, "rewards/repeat_floor/std": 0.005568044725805521, "rewards/near_duplicate_penalty/mean": 0.9954961538314819, "rewards/near_duplicate_penalty/std": 0.010154329240322113, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.045327357947826385, "rewards/total_composite/mean": 0.497277170419693, "rewards/total_composite/std": 0.33507657051086426, "reward": 0.497277170419693, "reward_std": 0.33507657051086426, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14151373505592346, "sampling/sampling_logp_difference/max": 1.328261375427246, "sampling/importance_sampling_ratio/min": 0.26493749022483826, "sampling/importance_sampling_ratio/mean": 1.0286755561828613, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.880745142698288, "clip_ratio/low_mean": 0.06724521797150373, "clip_ratio/low_min": 0.06724521797150373, "clip_ratio/high_mean": 0.03849832620471716, "clip_ratio/high_max": 0.03849832620471716, "clip_ratio/region_mean": 0.1057435441762209, "reward_total_mean": 0.497277170419693, "reward_meter_mean": 0.6461836099624634, "reward_meter_std": 0.3091847598552704, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9799329042434692, "reward_repeat_penalty_std": 0.05391687527298927, "reward_repeat_floor_mean": 0.9978821277618408, "reward_repeat_floor_std": 0.005568044725805521, "reward_near_duplicate_penalty_mean": 0.9954961538314819, "reward_near_duplicate_penalty_std": 0.010154329240322113, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.045327357947826385, "reward_judge_quality_mean": 0.7350000143051147, "reward_judge_quality_std": 0.2655990719795227, "reward_total_composite_mean": 0.497277170419693, "reward_total_composite_std": 0.33507657051086426} {"timestamp_utc": "2026-04-12T17:26:48Z", "mode": "train", "global_step": 403, "epoch": 0.021209410031050997, "loss": 0.0335, "grad_norm": 14.060990333557129, "learning_rate": 8.781818181818182e-06, "num_tokens": 753244.0, "completions/mean_length": 40.875, "completions/min_length": 35.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.875, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.9835188388824463, "rewards/meter/std": 0.013107487931847572, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5587499737739563, "rewards/judge_quality/std": 0.23491261899471283, "rewards/repeat_penalty/mean": 0.9854729771614075, "rewards/repeat_penalty/std": 0.0106391916051507, "rewards/repeat_floor/mean": 0.9978209733963013, "rewards/repeat_floor/std": 0.0015958774602040648, "rewards/near_duplicate_penalty/mean": 0.9854729771614075, "rewards/near_duplicate_penalty/std": 0.0106391916051507, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5484583973884583, "rewards/total_composite/std": 0.23124751448631287, "reward": 0.5484583973884583, "reward_std": 0.23124751448631287, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14659333229064941, "sampling/sampling_logp_difference/max": 1.2318469285964966, "sampling/importance_sampling_ratio/min": 0.29175323247909546, "sampling/importance_sampling_ratio/mean": 1.0133779048919678, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1714520901441574, "clip_ratio/low_mean": 0.12399742100387812, "clip_ratio/low_min": 0.12399742100387812, "clip_ratio/high_mean": 0.0324127902276814, "clip_ratio/high_max": 0.0324127902276814, "clip_ratio/region_mean": 0.15641021123155951, "reward_total_mean": 0.5484583973884583, "reward_meter_mean": 0.9835188388824463, "reward_meter_std": 0.013107487931847572, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9854729771614075, "reward_repeat_penalty_std": 0.0106391916051507, "reward_repeat_floor_mean": 0.9978209733963013, "reward_repeat_floor_std": 0.0015958774602040648, "reward_near_duplicate_penalty_mean": 0.9854729771614075, "reward_near_duplicate_penalty_std": 0.0106391916051507, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5587499737739563, "reward_judge_quality_std": 0.23491261899471283, "reward_total_composite_mean": 0.5484583973884583, "reward_total_composite_std": 0.23124751448631287} {"timestamp_utc": "2026-04-12T17:26:56Z", "mode": "train", "global_step": 404, "epoch": 0.02126203884006105, "loss": 0.1027, "grad_norm": 17.967100143432617, "learning_rate": 8.77878787878788e-06, "num_tokens": 754673.0, "completions/mean_length": 25.625, "completions/min_length": 20.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.625, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.9386039972305298, "rewards/meter/std": 0.0921686589717865, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.984375, "rewards/lexical_plausibility/std": 0.0289318785071373, "rewards/judge_quality/mean": 0.7312500476837158, "rewards/judge_quality/std": 0.2623213827610016, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6715369820594788, "rewards/total_composite/std": 0.24499766528606415, "reward": 0.6715369820594788, "reward_std": 0.24499766528606415, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17219848930835724, "sampling/sampling_logp_difference/max": 1.4513039588928223, "sampling/importance_sampling_ratio/min": 0.23426462709903717, "sampling/importance_sampling_ratio/mean": 1.0142366886138916, "sampling/importance_sampling_ratio/max": 1.8152958154678345, "entropy": 1.4703346639871597, "clip_ratio/low_mean": 0.047901272773742676, "clip_ratio/low_min": 0.047901272773742676, "clip_ratio/high_mean": 0.06808359315618873, "clip_ratio/high_max": 0.06808359315618873, "clip_ratio/region_mean": 0.1159848659299314, "reward_total_mean": 0.6715369820594788, "reward_meter_mean": 0.9386039972305298, "reward_meter_std": 0.0921686589717865, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.984375, "reward_lexical_plausibility_std": 0.0289318785071373, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7312500476837158, "reward_judge_quality_std": 0.2623213827610016, "reward_total_composite_mean": 0.6715369820594788, "reward_total_composite_std": 0.24499766528606415} {"timestamp_utc": "2026-04-12T17:27:05Z", "mode": "train", "global_step": 405, "epoch": 0.0213146676490711, "loss": 0.1602, "grad_norm": 19.066726684570312, "learning_rate": 8.775757575757577e-06, "num_tokens": 756170.0, "completions/mean_length": 30.125, "completions/min_length": 21.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.125, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.9536111354827881, "rewards/meter/std": 0.10049214959144592, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.953125, "rewards/lexical_plausibility/std": 0.13258251547813416, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.3184336721897125, "rewards/repeat_penalty/mean": 0.7586374282836914, "rewards/repeat_penalty/std": 0.033012986183166504, "rewards/repeat_floor/mean": 0.983735978603363, "rewards/repeat_floor/std": 0.0024212803691625595, "rewards/near_duplicate_penalty/mean": 0.9840898513793945, "rewards/near_duplicate_penalty/std": 0.03568260744214058, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.5554136037826538, "rewards/total_composite/std": 0.3026265799999237, "reward": 0.5554136037826538, "reward_std": 0.3026265799999237, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15680178999900818, "sampling/sampling_logp_difference/max": 1.4881324768066406, "sampling/importance_sampling_ratio/min": 0.22579394280910492, "sampling/importance_sampling_ratio/mean": 0.9988325238227844, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0948723927140236, "clip_ratio/low_mean": 0.11339311860501766, "clip_ratio/low_min": 0.11339311860501766, "clip_ratio/high_mean": 0.06383415637537837, "clip_ratio/high_max": 0.06383415637537837, "clip_ratio/region_mean": 0.17722727498039603, "reward_total_mean": 0.5554136037826538, "reward_meter_mean": 0.9536111354827881, "reward_meter_std": 0.10049214959144592, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.953125, "reward_lexical_plausibility_std": 0.13258251547813416, "reward_repeat_penalty_mean": 0.7586374282836914, "reward_repeat_penalty_std": 0.033012986183166504, "reward_repeat_floor_mean": 0.983735978603363, "reward_repeat_floor_std": 0.0024212803691625595, "reward_near_duplicate_penalty_mean": 0.9840898513793945, "reward_near_duplicate_penalty_std": 0.03568260744214058, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.3184336721897125, "reward_total_composite_mean": 0.5554136037826538, "reward_total_composite_std": 0.3026265799999237} {"timestamp_utc": "2026-04-12T17:27:14Z", "mode": "train", "global_step": 406, "epoch": 0.021367296458081154, "loss": 0.0447, "grad_norm": 15.60359001159668, "learning_rate": 8.772727272727274e-06, "num_tokens": 757688.0, "completions/mean_length": 36.75, "completions/min_length": 31.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.75, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.7540900707244873, "rewards/meter/std": 0.33582428097724915, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4925000071525574, "rewards/judge_quality/std": 0.26385873556137085, "rewards/repeat_penalty/mean": 0.9719797372817993, "rewards/repeat_penalty/std": 0.03192441165447235, "rewards/repeat_floor/mean": 0.9957969784736633, "rewards/repeat_floor/std": 0.004788653925061226, "rewards/near_duplicate_penalty/mean": 0.9719797372817993, "rewards/near_duplicate_penalty/std": 0.03192441165447235, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3961288034915924, "rewards/total_composite/std": 0.3084753751754761, "reward": 0.3961288034915924, "reward_std": 0.3084753751754761, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14347271621227264, "sampling/sampling_logp_difference/max": 1.327934741973877, "sampling/importance_sampling_ratio/min": 0.2650240659713745, "sampling/importance_sampling_ratio/mean": 1.0067261457443237, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1793797463178635, "clip_ratio/low_mean": 0.08616048749536276, "clip_ratio/low_min": 0.08616048749536276, "clip_ratio/high_mean": 0.03101503849029541, "clip_ratio/high_max": 0.03101503849029541, "clip_ratio/region_mean": 0.11717552598565817, "reward_total_mean": 0.3961288034915924, "reward_meter_mean": 0.7540900707244873, "reward_meter_std": 0.33582428097724915, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9719797372817993, "reward_repeat_penalty_std": 0.03192441165447235, "reward_repeat_floor_mean": 0.9957969784736633, "reward_repeat_floor_std": 0.004788653925061226, "reward_near_duplicate_penalty_mean": 0.9719797372817993, "reward_near_duplicate_penalty_std": 0.03192441165447235, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4925000071525574, "reward_judge_quality_std": 0.26385873556137085, "reward_total_composite_mean": 0.3961288034915924, "reward_total_composite_std": 0.3084753751754761} {"timestamp_utc": "2026-04-12T17:27:28Z", "mode": "train", "global_step": 407, "epoch": 0.021419925267091206, "loss": -0.013, "grad_norm": 5.35736608505249, "learning_rate": 8.76969696969697e-06, "num_tokens": 759146.0, "completions/mean_length": 101.25, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 42.57143020629883, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.40924423933029175, "rewards/meter/std": 0.47958657145500183, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9370801448822021, "rewards/lexical_plausibility/std": 0.17796415090560913, "rewards/judge_quality/mean": 0.6512500047683716, "rewards/judge_quality/std": 0.39617589116096497, "rewards/repeat_penalty/mean": 0.9908603429794312, "rewards/repeat_penalty/std": 0.01109218504279852, "rewards/repeat_floor/mean": 0.998629093170166, "rewards/repeat_floor/std": 0.0016638237284496427, "rewards/near_duplicate_penalty/mean": 0.9908603429794312, "rewards/near_duplicate_penalty/std": 0.01109218504279852, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.37753111124038696, "rewards/total_composite/std": 0.4559843838214874, "reward": 0.37753111124038696, "reward_std": 0.45598435401916504, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15604357421398163, "sampling/sampling_logp_difference/max": 1.76890230178833, "sampling/importance_sampling_ratio/min": 0.17052006721496582, "sampling/importance_sampling_ratio/mean": 1.0369576215744019, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9246109053492546, "clip_ratio/low_mean": 0.09980427101254463, "clip_ratio/low_min": 0.09980427101254463, "clip_ratio/high_mean": 0.05201525054872036, "clip_ratio/high_max": 0.05201525054872036, "clip_ratio/region_mean": 0.151819521561265, "reward_total_mean": 0.37753111124038696, "reward_meter_mean": 0.40924423933029175, "reward_meter_std": 0.47958657145500183, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9370801448822021, "reward_lexical_plausibility_std": 0.17796415090560913, "reward_repeat_penalty_mean": 0.9908603429794312, "reward_repeat_penalty_std": 0.01109218504279852, "reward_repeat_floor_mean": 0.998629093170166, "reward_repeat_floor_std": 0.0016638237284496427, "reward_near_duplicate_penalty_mean": 0.9908603429794312, "reward_near_duplicate_penalty_std": 0.01109218504279852, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6512500047683716, "reward_judge_quality_std": 0.39617589116096497, "reward_total_composite_mean": 0.37753111124038696, "reward_total_composite_std": 0.4559843838214874} {"timestamp_utc": "2026-04-12T17:27:39Z", "mode": "train", "global_step": 408, "epoch": 0.02147255407610126, "loss": -0.0267, "grad_norm": 26.84180450439453, "learning_rate": 8.766666666666669e-06, "num_tokens": 760463.0, "completions/mean_length": 20.625, "completions/min_length": 16.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.625, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.6541098356246948, "rewards/meter/std": 0.3562012016773224, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6475000381469727, "rewards/judge_quality/std": 0.30742016434669495, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4373846650123596, "rewards/total_composite/std": 0.3502616882324219, "reward": 0.4373846650123596, "reward_std": 0.3502616882324219, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18559736013412476, "sampling/sampling_logp_difference/max": 1.6342525482177734, "sampling/importance_sampling_ratio/min": 0.1950981318950653, "sampling/importance_sampling_ratio/mean": 1.001253604888916, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.170207992196083, "clip_ratio/low_mean": 0.08488005166873336, "clip_ratio/low_min": 0.08488005166873336, "clip_ratio/high_mean": 0.06979166716337204, "clip_ratio/high_max": 0.06979166716337204, "clip_ratio/region_mean": 0.1546717188321054, "reward_total_mean": 0.4373846650123596, "reward_meter_mean": 0.6541098356246948, "reward_meter_std": 0.3562012016773224, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6475000381469727, "reward_judge_quality_std": 0.30742016434669495, "reward_total_composite_mean": 0.4373846650123596, "reward_total_composite_std": 0.3502616882324219} {"timestamp_utc": "2026-04-12T17:27:53Z", "mode": "train", "global_step": 409, "epoch": 0.02152518288511131, "loss": -0.2103, "grad_norm": 2.0406625270843506, "learning_rate": 8.763636363636364e-06, "num_tokens": 764016.0, "completions/mean_length": 281.125, "completions/min_length": 222.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 248.1428680419922, "completions/min_terminated_length": 222.0, "completions/max_terminated_length": 281.0, "rewards/meter/mean": 0.9281846284866333, "rewards/meter/std": 0.1804521679878235, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.07120776921510696, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.02136232703924179, "rewards/lexical_plausibility/mean": 0.9526408910751343, "rewards/lexical_plausibility/std": 0.1339518129825592, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.1510518491268158, "rewards/repeat_penalty/std": 0.27062907814979553, "rewards/repeat_floor/mean": 0.8774338364601135, "rewards/repeat_floor/std": 0.06200440600514412, "rewards/near_duplicate_penalty/mean": 0.7272931337356567, "rewards/near_duplicate_penalty/std": 0.1785890758037567, "rewards/opening_diversity/mean": 0.8492288589477539, "rewards/opening_diversity/std": 0.23756106197834015, "rewards/distinct_2/mean": 0.19317904114723206, "rewards/distinct_2/std": 0.3473024368286133, "rewards/total_composite/mean": 0.09933464229106903, "rewards/total_composite/std": 0.04377879574894905, "reward": 0.09933464229106903, "reward_std": 0.04377879202365875, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07885255664587021, "sampling/sampling_logp_difference/max": 1.6141021251678467, "sampling/importance_sampling_ratio/min": 0.1990693360567093, "sampling/importance_sampling_ratio/mean": 1.0149317979812622, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5574203692376614, "clip_ratio/low_mean": 0.004291845485568047, "clip_ratio/low_min": 0.004291845485568047, "clip_ratio/high_mean": 0.050099303014576435, "clip_ratio/high_max": 0.050099303014576435, "clip_ratio/region_mean": 0.05439114850014448, "reward_total_mean": 0.09933464229106903, "reward_meter_mean": 0.9281846284866333, "reward_meter_std": 0.1804521679878235, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.07120776921510696, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.02136232703924179, "reward_lexical_plausibility_mean": 0.9526408910751343, "reward_lexical_plausibility_std": 0.1339518129825592, "reward_repeat_penalty_mean": 0.1510518491268158, "reward_repeat_penalty_std": 0.27062907814979553, "reward_repeat_floor_mean": 0.8774338364601135, "reward_repeat_floor_std": 0.06200440600514412, "reward_near_duplicate_penalty_mean": 0.7272931337356567, "reward_near_duplicate_penalty_std": 0.1785890758037567, "reward_opening_diversity_mean": 0.8492288589477539, "reward_opening_diversity_std": 0.23756106197834015, "reward_distinct_2_mean": 0.19317904114723206, "reward_distinct_2_std": 0.3473024368286133, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.09933464229106903, "reward_total_composite_std": 0.04377879574894905} {"timestamp_utc": "2026-04-12T17:28:02Z", "mode": "train", "global_step": 410, "epoch": 0.021577811694121363, "loss": 0.0477, "grad_norm": 12.290157318115234, "learning_rate": 8.760606060606061e-06, "num_tokens": 765918.0, "completions/mean_length": 77.75, "completions/min_length": 63.0, "completions/max_length": 100.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 77.75, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 100.0, "rewards/meter/mean": 0.3320328891277313, "rewards/meter/std": 0.33772704005241394, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4587499797344208, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.9249914884567261, "rewards/repeat_penalty/std": 0.07813272625207901, "rewards/repeat_floor/mean": 0.9914798736572266, "rewards/repeat_floor/std": 0.008529511280357838, "rewards/near_duplicate_penalty/mean": 0.9740067720413208, "rewards/near_duplicate_penalty/std": 0.022106532007455826, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9486543536186218, "rewards/distinct_2/std": 0.06189310550689697, "rewards/total_composite/mean": 0.12271323800086975, "rewards/total_composite/std": 0.1129566878080368, "reward": 0.12271323800086975, "reward_std": 0.1129566952586174, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19214822351932526, "sampling/sampling_logp_difference/max": 1.9817166328430176, "sampling/importance_sampling_ratio/min": 0.1378324329853058, "sampling/importance_sampling_ratio/mean": 1.0120923519134521, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9461139813065529, "clip_ratio/low_mean": 0.131487344391644, "clip_ratio/low_min": 0.131487344391644, "clip_ratio/high_mean": 0.0534924641251564, "clip_ratio/high_max": 0.0534924641251564, "clip_ratio/region_mean": 0.1849798085168004, "reward_total_mean": 0.12271323800086975, "reward_meter_mean": 0.3320328891277313, "reward_meter_std": 0.33772704005241394, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9249914884567261, "reward_repeat_penalty_std": 0.07813272625207901, "reward_repeat_floor_mean": 0.9914798736572266, "reward_repeat_floor_std": 0.008529511280357838, "reward_near_duplicate_penalty_mean": 0.9740067720413208, "reward_near_duplicate_penalty_std": 0.022106532007455826, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9486543536186218, "reward_distinct_2_std": 0.06189310550689697, "reward_judge_quality_mean": 0.4587499797344208, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.12271323800086975, "reward_total_composite_std": 0.1129566878080368} {"timestamp_utc": "2026-04-12T17:28:11Z", "mode": "train", "global_step": 411, "epoch": 0.021630440503131416, "loss": 0.0942, "grad_norm": 12.410826683044434, "learning_rate": 8.757575757575759e-06, "num_tokens": 767500.0, "completions/mean_length": 39.75, "completions/min_length": 33.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.75, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.6078414916992188, "rewards/meter/std": 0.43977683782577515, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.2520735561847687, "rewards/repeat_penalty/mean": 0.9345226287841797, "rewards/repeat_penalty/std": 0.12379558384418488, "rewards/repeat_floor/mean": 0.9934014678001404, "rewards/repeat_floor/std": 0.011220952495932579, "rewards/near_duplicate_penalty/mean": 0.9806556701660156, "rewards/near_duplicate_penalty/std": 0.02532178722321987, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9797570705413818, "rewards/distinct_2/std": 0.03748259320855141, "rewards/total_composite/mean": 0.22718289494514465, "rewards/total_composite/std": 0.29405373334884644, "reward": 0.22718289494514465, "reward_std": 0.2940537631511688, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21953687071800232, "sampling/sampling_logp_difference/max": 2.6128580570220947, "sampling/importance_sampling_ratio/min": 0.07332468032836914, "sampling/importance_sampling_ratio/mean": 1.015641689300537, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.9310509115457535, "clip_ratio/low_mean": 0.1193020697683096, "clip_ratio/low_min": 0.1193020697683096, "clip_ratio/high_mean": 0.06779939029365778, "clip_ratio/high_max": 0.06779939029365778, "clip_ratio/region_mean": 0.18710146006196737, "reward_total_mean": 0.22718289494514465, "reward_meter_mean": 0.6078414916992188, "reward_meter_std": 0.43977683782577515, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9345226287841797, "reward_repeat_penalty_std": 0.12379558384418488, "reward_repeat_floor_mean": 0.9934014678001404, "reward_repeat_floor_std": 0.011220952495932579, "reward_near_duplicate_penalty_mean": 0.9806556701660156, "reward_near_duplicate_penalty_std": 0.02532178722321987, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9797570705413818, "reward_distinct_2_std": 0.03748259320855141, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.2520735561847687, "reward_total_composite_mean": 0.22718289494514465, "reward_total_composite_std": 0.29405373334884644} {"timestamp_utc": "2026-04-12T17:28:21Z", "mode": "train", "global_step": 412, "epoch": 0.021683069312141465, "loss": 0.0502, "grad_norm": 12.038230895996094, "learning_rate": 8.754545454545456e-06, "num_tokens": 770026.0, "completions/mean_length": 133.75, "completions/min_length": 120.0, "completions/max_length": 141.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.75, "completions/min_terminated_length": 120.0, "completions/max_terminated_length": 141.0, "rewards/meter/mean": 0.6921815276145935, "rewards/meter/std": 0.26543235778808594, "rewards/count_adherence/mean": 0.7857142686843872, "rewards/count_adherence/std": 0.07636035233736038, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9357142448425293, "rewards/count_floor/std": 0.02290808968245983, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.6986279487609863, "rewards/repeat_penalty/std": 0.11810480058193207, "rewards/repeat_floor/mean": 0.9692379236221313, "rewards/repeat_floor/std": 0.00919030886143446, "rewards/near_duplicate_penalty/mean": 0.9271507263183594, "rewards/near_duplicate_penalty/std": 0.013372487388551235, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7796148061752319, "rewards/distinct_2/std": 0.09739939123392105, "rewards/total_composite/mean": 0.22802862524986267, "rewards/total_composite/std": 0.12687252461910248, "reward": 0.22802862524986267, "reward_std": 0.12687252461910248, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19746123254299164, "sampling/sampling_logp_difference/max": 3.173527479171753, "sampling/importance_sampling_ratio/min": 0.04185568913817406, "sampling/importance_sampling_ratio/mean": 1.0033645629882812, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9051905423402786, "clip_ratio/low_mean": 0.07040649559348822, "clip_ratio/low_min": 0.07040649559348822, "clip_ratio/high_mean": 0.07739872764796019, "clip_ratio/high_max": 0.07739872764796019, "clip_ratio/region_mean": 0.1478052232414484, "reward_total_mean": 0.22802862524986267, "reward_meter_mean": 0.6921815276145935, "reward_meter_std": 0.26543235778808594, "reward_count_adherence_mean": 0.7857142686843872, "reward_count_adherence_std": 0.07636035233736038, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9357142448425293, "reward_count_floor_std": 0.02290808968245983, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6986279487609863, "reward_repeat_penalty_std": 0.11810480058193207, "reward_repeat_floor_mean": 0.9692379236221313, "reward_repeat_floor_std": 0.00919030886143446, "reward_near_duplicate_penalty_mean": 0.9271507263183594, "reward_near_duplicate_penalty_std": 0.013372487388551235, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7796148061752319, "reward_distinct_2_std": 0.09739939123392105, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.22802862524986267, "reward_total_composite_std": 0.12687252461910248} {"timestamp_utc": "2026-04-12T17:28:30Z", "mode": "train", "global_step": 413, "epoch": 0.021735698121151517, "loss": 0.0989, "grad_norm": 19.113256454467773, "learning_rate": 8.751515151515151e-06, "num_tokens": 771716.0, "completions/mean_length": 46.25, "completions/min_length": 40.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.25, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.5463078618049622, "rewards/meter/std": 0.3257794678211212, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5724999904632568, "rewards/judge_quality/std": 0.38425251841545105, "rewards/repeat_penalty/mean": 0.9594578742980957, "rewards/repeat_penalty/std": 0.05256415903568268, "rewards/repeat_floor/mean": 0.9948335289955139, "rewards/repeat_floor/std": 0.006377866957336664, "rewards/near_duplicate_penalty/mean": 0.9761340618133545, "rewards/near_duplicate_penalty/std": 0.026294246315956116, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9823718070983887, "rewards/distinct_2/std": 0.0328204445540905, "rewards/total_composite/mean": 0.3291429281234741, "rewards/total_composite/std": 0.31265631318092346, "reward": 0.3291429281234741, "reward_std": 0.31265631318092346, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2219068855047226, "sampling/sampling_logp_difference/max": 1.6267223358154297, "sampling/importance_sampling_ratio/min": 0.19657281041145325, "sampling/importance_sampling_ratio/mean": 0.9901831150054932, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2640323787927628, "clip_ratio/low_mean": 0.10007031913846731, "clip_ratio/low_min": 0.10007031913846731, "clip_ratio/high_mean": 0.06926407013088465, "clip_ratio/high_max": 0.06926407013088465, "clip_ratio/region_mean": 0.16933438926935196, "reward_total_mean": 0.3291429281234741, "reward_meter_mean": 0.5463078618049622, "reward_meter_std": 0.3257794678211212, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9594578742980957, "reward_repeat_penalty_std": 0.05256415903568268, "reward_repeat_floor_mean": 0.9948335289955139, "reward_repeat_floor_std": 0.006377866957336664, "reward_near_duplicate_penalty_mean": 0.9761340618133545, "reward_near_duplicate_penalty_std": 0.026294246315956116, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9823718070983887, "reward_distinct_2_std": 0.0328204445540905, "reward_judge_quality_mean": 0.5724999904632568, "reward_judge_quality_std": 0.38425251841545105, "reward_total_composite_mean": 0.3291429281234741, "reward_total_composite_std": 0.31265631318092346} {"timestamp_utc": "2026-04-12T17:28:43Z", "mode": "train", "global_step": 414, "epoch": 0.02178832693016157, "loss": -0.0454, "grad_norm": 5.080606460571289, "learning_rate": 8.748484848484849e-06, "num_tokens": 773155.0, "completions/mean_length": 101.875, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.28571701049805, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.7053014039993286, "rewards/meter/std": 0.3809899687767029, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9364877939224243, "rewards/lexical_plausibility/std": 0.17963960766792297, "rewards/judge_quality/mean": 0.6012500524520874, "rewards/judge_quality/std": 0.37410610914230347, "rewards/repeat_penalty/mean": 0.9379380345344543, "rewards/repeat_penalty/std": 0.0914243832230568, "rewards/repeat_floor/mean": 0.9940295815467834, "rewards/repeat_floor/std": 0.007274527568370104, "rewards/near_duplicate_penalty/mean": 0.9791073799133301, "rewards/near_duplicate_penalty/std": 0.02847854606807232, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.5348511338233948, "rewards/total_composite/std": 0.40322163701057434, "reward": 0.5348511338233948, "reward_std": 0.40322160720825195, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1590871512889862, "sampling/sampling_logp_difference/max": 1.3593673706054688, "sampling/importance_sampling_ratio/min": 0.25682318210601807, "sampling/importance_sampling_ratio/mean": 1.007158875465393, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1926024556159973, "clip_ratio/low_mean": 0.027985830791294575, "clip_ratio/low_min": 0.027985830791294575, "clip_ratio/high_mean": 0.07076023425906897, "clip_ratio/high_max": 0.07076023425906897, "clip_ratio/region_mean": 0.09874606505036354, "reward_total_mean": 0.5348511338233948, "reward_meter_mean": 0.7053014039993286, "reward_meter_std": 0.3809899687767029, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9364877939224243, "reward_lexical_plausibility_std": 0.17963960766792297, "reward_repeat_penalty_mean": 0.9379380345344543, "reward_repeat_penalty_std": 0.0914243832230568, "reward_repeat_floor_mean": 0.9940295815467834, "reward_repeat_floor_std": 0.007274527568370104, "reward_near_duplicate_penalty_mean": 0.9791073799133301, "reward_near_duplicate_penalty_std": 0.02847854606807232, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.6012500524520874, "reward_judge_quality_std": 0.37410610914230347, "reward_total_composite_mean": 0.5348511338233948, "reward_total_composite_std": 0.40322163701057434} {"timestamp_utc": "2026-04-12T17:28:53Z", "mode": "train", "global_step": 415, "epoch": 0.021840955739171622, "loss": 0.0183, "grad_norm": 7.434648036956787, "learning_rate": 8.745454545454546e-06, "num_tokens": 775845.0, "completions/mean_length": 131.25, "completions/min_length": 113.0, "completions/max_length": 142.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 131.25, "completions/min_terminated_length": 113.0, "completions/max_terminated_length": 142.0, "rewards/meter/mean": 0.8679296970367432, "rewards/meter/std": 0.1725633591413498, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.05892555043101311, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.01767767407000065, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.537352442741394, "rewards/repeat_penalty/std": 0.2563095986843109, "rewards/repeat_floor/mean": 0.9467770457267761, "rewards/repeat_floor/std": 0.03108583763241768, "rewards/near_duplicate_penalty/mean": 0.8784315586090088, "rewards/near_duplicate_penalty/std": 0.05615968629717827, "rewards/opening_diversity/mean": 0.9776785373687744, "rewards/opening_diversity/std": 0.05028164014220238, "rewards/distinct_2/mean": 0.6261287331581116, "rewards/distinct_2/std": 0.2367241531610489, "rewards/total_composite/mean": 0.16756850481033325, "rewards/total_composite/std": 0.07452666014432907, "reward": 0.16756850481033325, "reward_std": 0.07452665269374847, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15547390282154083, "sampling/sampling_logp_difference/max": 2.2485227584838867, "sampling/importance_sampling_ratio/min": 0.10555503517389297, "sampling/importance_sampling_ratio/mean": 1.0180752277374268, "sampling/importance_sampling_ratio/max": 1.9504648447036743, "entropy": 1.3454219177365303, "clip_ratio/low_mean": 0.08070331392809749, "clip_ratio/low_min": 0.08070331392809749, "clip_ratio/high_mean": 0.0400482714176178, "clip_ratio/high_max": 0.0400482714176178, "clip_ratio/region_mean": 0.12075158534571528, "reward_total_mean": 0.16756850481033325, "reward_meter_mean": 0.8679296970367432, "reward_meter_std": 0.1725633591413498, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.05892555043101311, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.01767767407000065, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.537352442741394, "reward_repeat_penalty_std": 0.2563095986843109, "reward_repeat_floor_mean": 0.9467770457267761, "reward_repeat_floor_std": 0.03108583763241768, "reward_near_duplicate_penalty_mean": 0.8784315586090088, "reward_near_duplicate_penalty_std": 0.05615968629717827, "reward_opening_diversity_mean": 0.9776785373687744, "reward_opening_diversity_std": 0.05028164014220238, "reward_distinct_2_mean": 0.6261287331581116, "reward_distinct_2_std": 0.2367241531610489, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.16756850481033325, "reward_total_composite_std": 0.07452666014432907} {"timestamp_utc": "2026-04-12T17:29:03Z", "mode": "train", "global_step": 416, "epoch": 0.021893584548181674, "loss": 0.0445, "grad_norm": 15.937089920043945, "learning_rate": 8.742424242424243e-06, "num_tokens": 777588.0, "completions/mean_length": 40.875, "completions/min_length": 34.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.875, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.3729636073112488, "rewards/meter/std": 0.33335843682289124, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9930555820465088, "rewards/lexical_plausibility/std": 0.01285861898213625, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.2745385766029358, "rewards/repeat_penalty/mean": 0.9592209458351135, "rewards/repeat_penalty/std": 0.05305812135338783, "rewards/repeat_floor/mean": 0.9949278235435486, "rewards/repeat_floor/std": 0.006081957370042801, "rewards/near_duplicate_penalty/mean": 0.9780904054641724, "rewards/near_duplicate_penalty/std": 0.020435959100723267, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9801587462425232, "rewards/distinct_2/std": 0.036883533000946045, "rewards/total_composite/mean": 0.1650734692811966, "rewards/total_composite/std": 0.1427987813949585, "reward": 0.1650734692811966, "reward_std": 0.1427987664937973, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18382763862609863, "sampling/sampling_logp_difference/max": 1.1045339107513428, "sampling/importance_sampling_ratio/min": 0.3390491306781769, "sampling/importance_sampling_ratio/mean": 1.0634757280349731, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4608836770057678, "clip_ratio/low_mean": 0.08704587444663048, "clip_ratio/low_min": 0.08704587444663048, "clip_ratio/high_mean": 0.07331375125795603, "clip_ratio/high_max": 0.07331375125795603, "clip_ratio/region_mean": 0.1603596257045865, "reward_total_mean": 0.1650734692811966, "reward_meter_mean": 0.3729636073112488, "reward_meter_std": 0.33335843682289124, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9930555820465088, "reward_lexical_plausibility_std": 0.01285861898213625, "reward_repeat_penalty_mean": 0.9592209458351135, "reward_repeat_penalty_std": 0.05305812135338783, "reward_repeat_floor_mean": 0.9949278235435486, "reward_repeat_floor_std": 0.006081957370042801, "reward_near_duplicate_penalty_mean": 0.9780904054641724, "reward_near_duplicate_penalty_std": 0.020435959100723267, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9801587462425232, "reward_distinct_2_std": 0.036883533000946045, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.2745385766029358, "reward_total_composite_mean": 0.1650734692811966, "reward_total_composite_std": 0.1427987813949585} {"timestamp_utc": "2026-04-12T17:29:11Z", "mode": "train", "global_step": 417, "epoch": 0.021946213357191727, "loss": 0.2634, "grad_norm": 18.437881469726562, "learning_rate": 8.73939393939394e-06, "num_tokens": 779137.0, "completions/mean_length": 31.625, "completions/min_length": 20.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.625, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.7448065876960754, "rewards/meter/std": 0.35229867696762085, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.5345224738121033, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.16035674512386322, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.3046778440475464, "rewards/repeat_penalty/mean": 0.8524281978607178, "rewards/repeat_penalty/std": 0.11421186476945877, "rewards/repeat_floor/mean": 0.989524245262146, "rewards/repeat_floor/std": 0.0061520677991211414, "rewards/near_duplicate_penalty/mean": 0.9849691390991211, "rewards/near_duplicate_penalty/std": 0.020624451339244843, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9919871687889099, "rewards/distinct_2/std": 0.02266368828713894, "rewards/total_composite/mean": 0.452991247177124, "rewards/total_composite/std": 0.3771788477897644, "reward": 0.452991247177124, "reward_std": 0.377178817987442, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19702403247356415, "sampling/sampling_logp_difference/max": 1.301346778869629, "sampling/importance_sampling_ratio/min": 0.2721650004386902, "sampling/importance_sampling_ratio/mean": 1.0572483539581299, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6861381083726883, "clip_ratio/low_mean": 0.07361185643821955, "clip_ratio/low_min": 0.07361185643821955, "clip_ratio/high_mean": 0.05312500149011612, "clip_ratio/high_max": 0.05312500149011612, "clip_ratio/region_mean": 0.12673685792833567, "reward_total_mean": 0.452991247177124, "reward_meter_mean": 0.7448065876960754, "reward_meter_std": 0.35229867696762085, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.5345224738121033, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.16035674512386322, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8524281978607178, "reward_repeat_penalty_std": 0.11421186476945877, "reward_repeat_floor_mean": 0.989524245262146, "reward_repeat_floor_std": 0.0061520677991211414, "reward_near_duplicate_penalty_mean": 0.9849691390991211, "reward_near_duplicate_penalty_std": 0.020624451339244843, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9919871687889099, "reward_distinct_2_std": 0.02266368828713894, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.3046778440475464, "reward_total_composite_mean": 0.452991247177124, "reward_total_composite_std": 0.3771788477897644} {"timestamp_utc": "2026-04-12T17:29:25Z", "mode": "train", "global_step": 418, "epoch": 0.02199884216620178, "loss": -0.0278, "grad_norm": 5.720499515533447, "learning_rate": 8.736363636363638e-06, "num_tokens": 781137.0, "completions/mean_length": 134.0, "completions/min_length": 69.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 80.0, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 97.0, "rewards/meter/mean": 0.2404271513223648, "rewards/meter/std": 0.24963420629501343, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.8755707740783691, "rewards/lexical_plausibility/std": 0.17385001480579376, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.5560752153396606, "rewards/repeat_penalty/std": 0.31644949316978455, "rewards/repeat_floor/mean": 0.9357200860977173, "rewards/repeat_floor/std": 0.05104459077119827, "rewards/near_duplicate_penalty/mean": 0.7400911450386047, "rewards/near_duplicate_penalty/std": 0.2015363723039627, "rewards/opening_diversity/mean": 0.8515625, "rewards/opening_diversity/std": 0.3454705476760864, "rewards/distinct_2/mean": 0.8179179430007935, "rewards/distinct_2/std": 0.13774771988391876, "rewards/total_composite/mean": 0.08427922427654266, "rewards/total_composite/std": 0.09055059403181076, "reward": 0.08427922427654266, "reward_std": 0.09055058658123016, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14244744181632996, "sampling/sampling_logp_difference/max": 2.121565580368042, "sampling/importance_sampling_ratio/min": 0.11984385550022125, "sampling/importance_sampling_ratio/mean": 1.0242865085601807, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9750370159745216, "clip_ratio/low_mean": 0.05169749353080988, "clip_ratio/low_min": 0.05169749353080988, "clip_ratio/high_mean": 0.06031937804073095, "clip_ratio/high_max": 0.06031937804073095, "clip_ratio/region_mean": 0.11201687157154083, "reward_total_mean": 0.08427922427654266, "reward_meter_mean": 0.2404271513223648, "reward_meter_std": 0.24963420629501343, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.8755707740783691, "reward_lexical_plausibility_std": 0.17385001480579376, "reward_repeat_penalty_mean": 0.5560752153396606, "reward_repeat_penalty_std": 0.31644949316978455, "reward_repeat_floor_mean": 0.9357200860977173, "reward_repeat_floor_std": 0.05104459077119827, "reward_near_duplicate_penalty_mean": 0.7400911450386047, "reward_near_duplicate_penalty_std": 0.2015363723039627, "reward_opening_diversity_mean": 0.8515625, "reward_opening_diversity_std": 0.3454705476760864, "reward_distinct_2_mean": 0.8179179430007935, "reward_distinct_2_std": 0.13774771988391876, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.08427922427654266, "reward_total_composite_std": 0.09055059403181076} {"timestamp_utc": "2026-04-12T17:29:39Z", "mode": "train", "global_step": 419, "epoch": 0.02205147097521183, "loss": -0.06, "grad_norm": 4.3258056640625, "learning_rate": 8.733333333333333e-06, "num_tokens": 783417.0, "completions/mean_length": 137.0, "completions/min_length": 72.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 83.42857360839844, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.7313331961631775, "rewards/meter/std": 0.3466825485229492, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9925000071525574, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.9555842280387878, "rewards/lexical_plausibility/std": 0.12562675774097443, "rewards/judge_quality/mean": 0.15625, "rewards/judge_quality/std": 0.09425459802150726, "rewards/repeat_penalty/mean": 0.47216612100601196, "rewards/repeat_penalty/std": 0.28925347328186035, "rewards/repeat_floor/mean": 0.9374450445175171, "rewards/repeat_floor/std": 0.03818248212337494, "rewards/near_duplicate_penalty/mean": 0.8511825203895569, "rewards/near_duplicate_penalty/std": 0.08535610139369965, "rewards/opening_diversity/mean": 0.9750000238418579, "rewards/opening_diversity/std": 0.04629101976752281, "rewards/distinct_2/mean": 0.569640576839447, "rewards/distinct_2/std": 0.2676936686038971, "rewards/total_composite/mean": 0.11668050289154053, "rewards/total_composite/std": 0.09349052608013153, "reward": 0.11668050289154053, "reward_std": 0.09349052608013153, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15329334139823914, "sampling/sampling_logp_difference/max": 1.516845703125, "sampling/importance_sampling_ratio/min": 0.21940286457538605, "sampling/importance_sampling_ratio/mean": 1.0286436080932617, "sampling/importance_sampling_ratio/max": 1.940280795097351, "entropy": 1.1357912719249725, "clip_ratio/low_mean": 0.037004128098487854, "clip_ratio/low_min": 0.037004128098487854, "clip_ratio/high_mean": 0.09222503937780857, "clip_ratio/high_max": 0.09222503937780857, "clip_ratio/region_mean": 0.12922916747629642, "reward_total_mean": 0.11668050289154053, "reward_meter_mean": 0.7313331961631775, "reward_meter_std": 0.3466825485229492, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9925000071525574, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.9555842280387878, "reward_lexical_plausibility_std": 0.12562675774097443, "reward_repeat_penalty_mean": 0.47216612100601196, "reward_repeat_penalty_std": 0.28925347328186035, "reward_repeat_floor_mean": 0.9374450445175171, "reward_repeat_floor_std": 0.03818248212337494, "reward_near_duplicate_penalty_mean": 0.8511825203895569, "reward_near_duplicate_penalty_std": 0.08535610139369965, "reward_opening_diversity_mean": 0.9750000238418579, "reward_opening_diversity_std": 0.04629101976752281, "reward_distinct_2_mean": 0.569640576839447, "reward_distinct_2_std": 0.2676936686038971, "reward_judge_quality_mean": 0.15625, "reward_judge_quality_std": 0.09425459802150726, "reward_total_composite_mean": 0.11668050289154053, "reward_total_composite_std": 0.09349052608013153} {"timestamp_utc": "2026-04-12T17:29:52Z", "mode": "train", "global_step": 420, "epoch": 0.022104099784221884, "loss": -0.0663, "grad_norm": 4.583530902862549, "learning_rate": 8.73030303030303e-06, "num_tokens": 785146.0, "completions/mean_length": 104.125, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 45.85714340209961, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.8950604200363159, "rewards/meter/std": 0.10852807760238647, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9589052200317383, "rewards/lexical_plausibility/std": 0.11623367667198181, "rewards/judge_quality/mean": 0.38374999165534973, "rewards/judge_quality/std": 0.2579555809497833, "rewards/repeat_penalty/mean": 0.8724360466003418, "rewards/repeat_penalty/std": 0.10166767239570618, "rewards/repeat_floor/mean": 0.9860841035842896, "rewards/repeat_floor/std": 0.010874365456402302, "rewards/near_duplicate_penalty/mean": 0.9505135416984558, "rewards/near_duplicate_penalty/std": 0.04566945135593414, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9486898183822632, "rewards/distinct_2/std": 0.06557372212409973, "rewards/total_composite/mean": 0.3423081040382385, "rewards/total_composite/std": 0.25631964206695557, "reward": 0.3423081040382385, "reward_std": 0.25631964206695557, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16960261762142181, "sampling/sampling_logp_difference/max": 1.1214208602905273, "sampling/importance_sampling_ratio/min": 0.3258165121078491, "sampling/importance_sampling_ratio/mean": 1.0269588232040405, "sampling/importance_sampling_ratio/max": 1.7959256172180176, "entropy": 1.2777791321277618, "clip_ratio/low_mean": 0.07431362010538578, "clip_ratio/low_min": 0.07431362010538578, "clip_ratio/high_mean": 0.06017801910638809, "clip_ratio/high_max": 0.06017801910638809, "clip_ratio/region_mean": 0.13449163921177387, "reward_total_mean": 0.3423081040382385, "reward_meter_mean": 0.8950604200363159, "reward_meter_std": 0.10852807760238647, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9589052200317383, "reward_lexical_plausibility_std": 0.11623367667198181, "reward_repeat_penalty_mean": 0.8724360466003418, "reward_repeat_penalty_std": 0.10166767239570618, "reward_repeat_floor_mean": 0.9860841035842896, "reward_repeat_floor_std": 0.010874365456402302, "reward_near_duplicate_penalty_mean": 0.9505135416984558, "reward_near_duplicate_penalty_std": 0.04566945135593414, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9486898183822632, "reward_distinct_2_std": 0.06557372212409973, "reward_judge_quality_mean": 0.38374999165534973, "reward_judge_quality_std": 0.2579555809497833, "reward_total_composite_mean": 0.3423081040382385, "reward_total_composite_std": 0.25631964206695557} {"timestamp_utc": "2026-04-12T17:30:01Z", "mode": "train", "global_step": 421, "epoch": 0.022156728593231936, "loss": 0.0642, "grad_norm": 11.137006759643555, "learning_rate": 8.727272727272728e-06, "num_tokens": 786939.0, "completions/mean_length": 59.125, "completions/min_length": 52.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 59.125, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.7526957392692566, "rewards/meter/std": 0.367506206035614, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.8673490285873413, "rewards/repeat_penalty/std": 0.08890773355960846, "rewards/repeat_floor/mean": 0.9845092296600342, "rewards/repeat_floor/std": 0.009965740144252777, "rewards/near_duplicate_penalty/mean": 0.9495429992675781, "rewards/near_duplicate_penalty/std": 0.024446433410048485, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9119751453399658, "rewards/distinct_2/std": 0.07285679876804352, "rewards/total_composite/mean": 0.31252261996269226, "rewards/total_composite/std": 0.27877277135849, "reward": 0.31252261996269226, "reward_std": 0.2787728011608124, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19893643260002136, "sampling/sampling_logp_difference/max": 1.8573691844940186, "sampling/importance_sampling_ratio/min": 0.15608270466327667, "sampling/importance_sampling_ratio/mean": 1.010530710220337, "sampling/importance_sampling_ratio/max": 1.9983532428741455, "entropy": 1.5182730108499527, "clip_ratio/low_mean": 0.08075428754091263, "clip_ratio/low_min": 0.08075428754091263, "clip_ratio/high_mean": 0.09795355051755905, "clip_ratio/high_max": 0.09795355051755905, "clip_ratio/region_mean": 0.17870783805847168, "reward_total_mean": 0.31252261996269226, "reward_meter_mean": 0.7526957392692566, "reward_meter_std": 0.367506206035614, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8673490285873413, "reward_repeat_penalty_std": 0.08890773355960846, "reward_repeat_floor_mean": 0.9845092296600342, "reward_repeat_floor_std": 0.009965740144252777, "reward_near_duplicate_penalty_mean": 0.9495429992675781, "reward_near_duplicate_penalty_std": 0.024446433410048485, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9119751453399658, "reward_distinct_2_std": 0.07285679876804352, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.31252261996269226, "reward_total_composite_std": 0.27877277135849} {"timestamp_utc": "2026-04-12T17:30:11Z", "mode": "train", "global_step": 422, "epoch": 0.02220935740224199, "loss": 0.0672, "grad_norm": 12.562152862548828, "learning_rate": 8.724242424242425e-06, "num_tokens": 788951.0, "completions/mean_length": 66.5, "completions/min_length": 56.0, "completions/max_length": 103.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 66.5, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 103.0, "rewards/meter/mean": 0.7505141496658325, "rewards/meter/std": 0.29966267943382263, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9925000071525574, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5575000047683716, "rewards/judge_quality/std": 0.19905133545398712, "rewards/repeat_penalty/mean": 0.8428101539611816, "rewards/repeat_penalty/std": 0.15667498111724854, "rewards/repeat_floor/mean": 0.9832167625427246, "rewards/repeat_floor/std": 0.014885702170431614, "rewards/near_duplicate_penalty/mean": 0.95533287525177, "rewards/near_duplicate_penalty/std": 0.029687827453017235, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8879644870758057, "rewards/distinct_2/std": 0.12172655016183853, "rewards/total_composite/mean": 0.4289339780807495, "rewards/total_composite/std": 0.26847225427627563, "reward": 0.4289339780807495, "reward_std": 0.26847225427627563, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14342275261878967, "sampling/sampling_logp_difference/max": 1.6937564611434937, "sampling/importance_sampling_ratio/min": 0.1838276982307434, "sampling/importance_sampling_ratio/mean": 1.010650396347046, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7265492081642151, "clip_ratio/low_mean": 0.0837098378688097, "clip_ratio/low_min": 0.0837098378688097, "clip_ratio/high_mean": 0.039722432382404804, "clip_ratio/high_max": 0.039722432382404804, "clip_ratio/region_mean": 0.1234322702512145, "reward_total_mean": 0.4289339780807495, "reward_meter_mean": 0.7505141496658325, "reward_meter_std": 0.29966267943382263, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9925000071525574, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8428101539611816, "reward_repeat_penalty_std": 0.15667498111724854, "reward_repeat_floor_mean": 0.9832167625427246, "reward_repeat_floor_std": 0.014885702170431614, "reward_near_duplicate_penalty_mean": 0.95533287525177, "reward_near_duplicate_penalty_std": 0.029687827453017235, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8879644870758057, "reward_distinct_2_std": 0.12172655016183853, "reward_judge_quality_mean": 0.5575000047683716, "reward_judge_quality_std": 0.19905133545398712, "reward_total_composite_mean": 0.4289339780807495, "reward_total_composite_std": 0.26847225427627563} {"timestamp_utc": "2026-04-12T17:30:19Z", "mode": "train", "global_step": 423, "epoch": 0.022261986211252038, "loss": 0.0614, "grad_norm": 17.327491760253906, "learning_rate": 8.72121212121212e-06, "num_tokens": 790519.0, "completions/mean_length": 40.0, "completions/min_length": 31.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.0, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7543220520019531, "rewards/meter/std": 0.33283770084381104, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.219983771443367, "rewards/repeat_penalty/mean": 0.9855372905731201, "rewards/repeat_penalty/std": 0.017431318759918213, "rewards/repeat_floor/mean": 0.9978306293487549, "rewards/repeat_floor/std": 0.0026147011667490005, "rewards/near_duplicate_penalty/mean": 0.9855372905731201, "rewards/near_duplicate_penalty/std": 0.017431318759918213, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33214086294174194, "rewards/total_composite/std": 0.2602840065956116, "reward": 0.33214086294174194, "reward_std": 0.2602840065956116, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19631245732307434, "sampling/sampling_logp_difference/max": 1.9757099151611328, "sampling/importance_sampling_ratio/min": 0.13866284489631653, "sampling/importance_sampling_ratio/mean": 1.0412321090698242, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7369295060634613, "clip_ratio/low_mean": 0.09031642321497202, "clip_ratio/low_min": 0.09031642321497202, "clip_ratio/high_mean": 0.12331311963498592, "clip_ratio/high_max": 0.12331311963498592, "clip_ratio/region_mean": 0.21362954284995794, "reward_total_mean": 0.33214086294174194, "reward_meter_mean": 0.7543220520019531, "reward_meter_std": 0.33283770084381104, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9855372905731201, "reward_repeat_penalty_std": 0.017431318759918213, "reward_repeat_floor_mean": 0.9978306293487549, "reward_repeat_floor_std": 0.0026147011667490005, "reward_near_duplicate_penalty_mean": 0.9855372905731201, "reward_near_duplicate_penalty_std": 0.017431318759918213, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.219983771443367, "reward_total_composite_mean": 0.33214086294174194, "reward_total_composite_std": 0.2602840065956116} {"timestamp_utc": "2026-04-12T17:30:30Z", "mode": "train", "global_step": 424, "epoch": 0.02231461502026209, "loss": 0.03, "grad_norm": 10.294676780700684, "learning_rate": 8.71818181818182e-06, "num_tokens": 792719.0, "completions/mean_length": 93.0, "completions/min_length": 84.0, "completions/max_length": 100.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.0, "completions/min_terminated_length": 84.0, "completions/max_terminated_length": 100.0, "rewards/meter/mean": 0.4554365873336792, "rewards/meter/std": 0.26305270195007324, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.19668231904506683, "rewards/repeat_penalty/mean": 0.8240758180618286, "rewards/repeat_penalty/std": 0.17134004831314087, "rewards/repeat_floor/mean": 0.9790796041488647, "rewards/repeat_floor/std": 0.022784223780035973, "rewards/near_duplicate_penalty/mean": 0.9403244256973267, "rewards/near_duplicate_penalty/std": 0.06833906471729279, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.8722193241119385, "rewards/distinct_2/std": 0.1265467256307602, "rewards/total_composite/mean": 0.17871516942977905, "rewards/total_composite/std": 0.07699020206928253, "reward": 0.17871516942977905, "reward_std": 0.07699019461870193, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1846231371164322, "sampling/sampling_logp_difference/max": 1.644737720489502, "sampling/importance_sampling_ratio/min": 0.1930631846189499, "sampling/importance_sampling_ratio/mean": 1.0134590864181519, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2414982467889786, "clip_ratio/low_mean": 0.08379538543522358, "clip_ratio/low_min": 0.08379538543522358, "clip_ratio/high_mean": 0.07203113846480846, "clip_ratio/high_max": 0.07203113846480846, "clip_ratio/region_mean": 0.15582652390003204, "reward_total_mean": 0.17871516942977905, "reward_meter_mean": 0.4554365873336792, "reward_meter_std": 0.26305270195007324, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8240758180618286, "reward_repeat_penalty_std": 0.17134004831314087, "reward_repeat_floor_mean": 0.9790796041488647, "reward_repeat_floor_std": 0.022784223780035973, "reward_near_duplicate_penalty_mean": 0.9403244256973267, "reward_near_duplicate_penalty_std": 0.06833906471729279, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.8722193241119385, "reward_distinct_2_std": 0.1265467256307602, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.19668231904506683, "reward_total_composite_mean": 0.17871516942977905, "reward_total_composite_std": 0.07699020206928253} {"timestamp_utc": "2026-04-12T17:30:37Z", "mode": "train", "global_step": 425, "epoch": 0.022367243829272142, "loss": -0.0075, "grad_norm": 38.55045700073242, "learning_rate": 8.715151515151515e-06, "num_tokens": 794072.0, "completions/mean_length": 16.125, "completions/min_length": 11.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.125, "completions/min_terminated_length": 11.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.4318186640739441, "rewards/meter/std": 0.36611291766166687, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9350000023841858, "rewards/judge_quality/std": 0.0160356592386961, "rewards/repeat_penalty/mean": 0.6771972179412842, "rewards/repeat_penalty/std": 0.05999475345015526, "rewards/repeat_floor/mean": 0.9688812494277954, "rewards/repeat_floor/std": 0.01180236879736185, "rewards/near_duplicate_penalty/mean": 0.894464910030365, "rewards/near_duplicate_penalty/std": 0.07809729874134064, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9759615659713745, "rewards/distinct_2/std": 0.06799104809761047, "rewards/total_composite/mean": 0.3588297963142395, "rewards/total_composite/std": 0.29621267318725586, "reward": 0.3588297963142395, "reward_std": 0.29621270298957825, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20691446959972382, "sampling/sampling_logp_difference/max": 1.2421596050262451, "sampling/importance_sampling_ratio/min": 0.2887599468231201, "sampling/importance_sampling_ratio/mean": 1.0438870191574097, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0148386992514133, "clip_ratio/low_mean": 0.05116421636193991, "clip_ratio/low_min": 0.05116421636193991, "clip_ratio/high_mean": 0.12234322540462017, "clip_ratio/high_max": 0.12234322540462017, "clip_ratio/region_mean": 0.17350744176656008, "reward_total_mean": 0.3588297963142395, "reward_meter_mean": 0.4318186640739441, "reward_meter_std": 0.36611291766166687, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6771972179412842, "reward_repeat_penalty_std": 0.05999475345015526, "reward_repeat_floor_mean": 0.9688812494277954, "reward_repeat_floor_std": 0.01180236879736185, "reward_near_duplicate_penalty_mean": 0.894464910030365, "reward_near_duplicate_penalty_std": 0.07809729874134064, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9759615659713745, "reward_distinct_2_std": 0.06799104809761047, "reward_judge_quality_mean": 0.9350000023841858, "reward_judge_quality_std": 0.0160356592386961, "reward_total_composite_mean": 0.3588297963142395, "reward_total_composite_std": 0.29621267318725586} {"timestamp_utc": "2026-04-12T17:30:47Z", "mode": "train", "global_step": 426, "epoch": 0.022419872638282195, "loss": 0.0984, "grad_norm": 8.75532341003418, "learning_rate": 8.712121212121212e-06, "num_tokens": 796359.0, "completions/mean_length": 95.875, "completions/min_length": 75.0, "completions/max_length": 118.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 95.875, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.8751838207244873, "rewards/meter/std": 0.1776522397994995, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.6559178829193115, "rewards/repeat_penalty/std": 0.31605398654937744, "rewards/repeat_floor/mean": 0.9622302055358887, "rewards/repeat_floor/std": 0.04364832490682602, "rewards/near_duplicate_penalty/mean": 0.921332836151123, "rewards/near_duplicate_penalty/std": 0.09565689414739609, "rewards/opening_diversity/mean": 0.9508928656578064, "rewards/opening_diversity/std": 0.09533105045557022, "rewards/distinct_2/mean": 0.744186282157898, "rewards/distinct_2/std": 0.2703051269054413, "rewards/total_composite/mean": 0.24232810735702515, "rewards/total_composite/std": 0.11076441407203674, "reward": 0.24232810735702515, "reward_std": 0.11076439917087555, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15914596617221832, "sampling/sampling_logp_difference/max": 1.3651857376098633, "sampling/importance_sampling_ratio/min": 0.2553332448005676, "sampling/importance_sampling_ratio/mean": 1.0339637994766235, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.381018303334713, "clip_ratio/low_mean": 0.0544103579595685, "clip_ratio/low_min": 0.0544103579595685, "clip_ratio/high_mean": 0.08059742767363787, "clip_ratio/high_max": 0.08059742767363787, "clip_ratio/region_mean": 0.13500778563320637, "reward_total_mean": 0.24232810735702515, "reward_meter_mean": 0.8751838207244873, "reward_meter_std": 0.1776522397994995, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6559178829193115, "reward_repeat_penalty_std": 0.31605398654937744, "reward_repeat_floor_mean": 0.9622302055358887, "reward_repeat_floor_std": 0.04364832490682602, "reward_near_duplicate_penalty_mean": 0.921332836151123, "reward_near_duplicate_penalty_std": 0.09565689414739609, "reward_opening_diversity_mean": 0.9508928656578064, "reward_opening_diversity_std": 0.09533105045557022, "reward_distinct_2_mean": 0.744186282157898, "reward_distinct_2_std": 0.2703051269054413, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.24232810735702515, "reward_total_composite_std": 0.11076441407203674} {"timestamp_utc": "2026-04-12T17:30:56Z", "mode": "train", "global_step": 427, "epoch": 0.022472501447292247, "loss": 0.0511, "grad_norm": 14.312180519104004, "learning_rate": 8.70909090909091e-06, "num_tokens": 797743.0, "completions/mean_length": 38.0, "completions/min_length": 32.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.0, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.49000275135040283, "rewards/meter/std": 0.3732234537601471, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9409509897232056, "rewards/repeat_penalty/std": 0.054482586681842804, "rewards/repeat_floor/mean": 0.9925425052642822, "rewards/repeat_floor/std": 0.006816257257014513, "rewards/near_duplicate_penalty/mean": 0.9660857915878296, "rewards/near_duplicate_penalty/std": 0.03407246991991997, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9736621975898743, "rewards/distinct_2/std": 0.03648125380277634, "rewards/total_composite/mean": 0.17703327536582947, "rewards/total_composite/std": 0.15678516030311584, "reward": 0.17703327536582947, "reward_std": 0.15678516030311584, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1936989724636078, "sampling/sampling_logp_difference/max": 2.4302167892456055, "sampling/importance_sampling_ratio/min": 0.08801774680614471, "sampling/importance_sampling_ratio/mean": 1.0226032733917236, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7115192711353302, "clip_ratio/low_mean": 0.11790913436561823, "clip_ratio/low_min": 0.11790913436561823, "clip_ratio/high_mean": 0.05874060280621052, "clip_ratio/high_max": 0.05874060280621052, "clip_ratio/region_mean": 0.17664973717182875, "reward_total_mean": 0.17703327536582947, "reward_meter_mean": 0.49000275135040283, "reward_meter_std": 0.3732234537601471, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9409509897232056, "reward_repeat_penalty_std": 0.054482586681842804, "reward_repeat_floor_mean": 0.9925425052642822, "reward_repeat_floor_std": 0.006816257257014513, "reward_near_duplicate_penalty_mean": 0.9660857915878296, "reward_near_duplicate_penalty_std": 0.03407246991991997, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9736621975898743, "reward_distinct_2_std": 0.03648125380277634, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.17703327536582947, "reward_total_composite_std": 0.15678516030311584} {"timestamp_utc": "2026-04-12T17:31:04Z", "mode": "train", "global_step": 428, "epoch": 0.0225251302563023, "loss": 0.1184, "grad_norm": 21.285945892333984, "learning_rate": 8.706060606060607e-06, "num_tokens": 799048.0, "completions/mean_length": 20.125, "completions/min_length": 17.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.125, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.8460110425949097, "rewards/meter/std": 0.34095120429992676, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.3620477616786957, "rewards/repeat_penalty/mean": 0.73777174949646, "rewards/repeat_penalty/std": 0.03458673879504204, "rewards/repeat_floor/mean": 0.9825543761253357, "rewards/repeat_floor/std": 0.006917351391166449, "rewards/near_duplicate_penalty/mean": 0.9836956262588501, "rewards/near_duplicate_penalty/std": 0.04611567035317421, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5261960625648499, "rewards/total_composite/std": 0.3867631256580353, "reward": 0.5261960625648499, "reward_std": 0.38676315546035767, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15875288844108582, "sampling/sampling_logp_difference/max": 0.7255430221557617, "sampling/importance_sampling_ratio/min": 0.48406165838241577, "sampling/importance_sampling_ratio/mean": 1.0304712057113647, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5733484327793121, "clip_ratio/low_mean": 0.05192877119407058, "clip_ratio/low_min": 0.05192877119407058, "clip_ratio/high_mean": 0.08513932023197412, "clip_ratio/high_max": 0.08513932023197412, "clip_ratio/region_mean": 0.1370680914260447, "reward_total_mean": 0.5261960625648499, "reward_meter_mean": 0.8460110425949097, "reward_meter_std": 0.34095120429992676, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.73777174949646, "reward_repeat_penalty_std": 0.03458673879504204, "reward_repeat_floor_mean": 0.9825543761253357, "reward_repeat_floor_std": 0.006917351391166449, "reward_near_duplicate_penalty_mean": 0.9836956262588501, "reward_near_duplicate_penalty_std": 0.04611567035317421, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.3620477616786957, "reward_total_composite_mean": 0.5261960625648499, "reward_total_composite_std": 0.3867631256580353} {"timestamp_utc": "2026-04-12T17:31:19Z", "mode": "train", "global_step": 429, "epoch": 0.022577759065312352, "loss": -0.0691, "grad_norm": 4.137322902679443, "learning_rate": 8.703030303030304e-06, "num_tokens": 800575.0, "completions/mean_length": 99.875, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 41.0, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.763437032699585, "rewards/meter/std": 0.40327855944633484, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9443026781082153, "rewards/lexical_plausibility/std": 0.15753573179244995, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.7007288336753845, "rewards/repeat_penalty/std": 0.3058701753616333, "rewards/repeat_floor/mean": 0.9595679640769958, "rewards/repeat_floor/std": 0.05686198174953461, "rewards/near_duplicate_penalty/mean": 0.8809818029403687, "rewards/near_duplicate_penalty/std": 0.15458548069000244, "rewards/opening_diversity/mean": 0.828125, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.8637024164199829, "rewards/distinct_2/std": 0.2479252815246582, "rewards/total_composite/mean": 0.3028221130371094, "rewards/total_composite/std": 0.17363055050373077, "reward": 0.3028221130371094, "reward_std": 0.17363055050373077, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1624930500984192, "sampling/sampling_logp_difference/max": 2.1269805431365967, "sampling/importance_sampling_ratio/min": 0.11919666081666946, "sampling/importance_sampling_ratio/mean": 1.049901008605957, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0335667952895164, "clip_ratio/low_mean": 0.04320652224123478, "clip_ratio/low_min": 0.04320652224123478, "clip_ratio/high_mean": 0.0928165651857853, "clip_ratio/high_max": 0.0928165651857853, "clip_ratio/region_mean": 0.13602308742702007, "reward_total_mean": 0.3028221130371094, "reward_meter_mean": 0.763437032699585, "reward_meter_std": 0.40327855944633484, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9443026781082153, "reward_lexical_plausibility_std": 0.15753573179244995, "reward_repeat_penalty_mean": 0.7007288336753845, "reward_repeat_penalty_std": 0.3058701753616333, "reward_repeat_floor_mean": 0.9595679640769958, "reward_repeat_floor_std": 0.05686198174953461, "reward_near_duplicate_penalty_mean": 0.8809818029403687, "reward_near_duplicate_penalty_std": 0.15458548069000244, "reward_opening_diversity_mean": 0.828125, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.8637024164199829, "reward_distinct_2_std": 0.2479252815246582, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.3028221130371094, "reward_total_composite_std": 0.17363055050373077} {"timestamp_utc": "2026-04-12T17:31:28Z", "mode": "train", "global_step": 430, "epoch": 0.022630387874322404, "loss": 0.047, "grad_norm": 14.473419189453125, "learning_rate": 8.700000000000001e-06, "num_tokens": 802063.0, "completions/mean_length": 41.0, "completions/min_length": 35.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.7545582056045532, "rewards/meter/std": 0.38726872205734253, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5962499976158142, "rewards/judge_quality/std": 0.26065507531166077, "rewards/repeat_penalty/mean": 0.914974570274353, "rewards/repeat_penalty/std": 0.11135981976985931, "rewards/repeat_floor/mean": 0.9899146556854248, "rewards/repeat_floor/std": 0.0101882079616189, "rewards/near_duplicate_penalty/mean": 0.9500719308853149, "rewards/near_duplicate_penalty/std": 0.04354565590620041, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9919871687889099, "rewards/distinct_2/std": 0.02266368828713894, "rewards/total_composite/mean": 0.38103383779525757, "rewards/total_composite/std": 0.23693832755088806, "reward": 0.38103383779525757, "reward_std": 0.23693831264972687, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.170084610581398, "sampling/sampling_logp_difference/max": 1.1645030975341797, "sampling/importance_sampling_ratio/min": 0.31207767128944397, "sampling/importance_sampling_ratio/mean": 1.0287314653396606, "sampling/importance_sampling_ratio/max": 1.9262477159500122, "entropy": 1.3900617808103561, "clip_ratio/low_mean": 0.0738748712465167, "clip_ratio/low_min": 0.0738748712465167, "clip_ratio/high_mean": 0.11073058936744928, "clip_ratio/high_max": 0.11073058936744928, "clip_ratio/region_mean": 0.184605460613966, "reward_total_mean": 0.38103383779525757, "reward_meter_mean": 0.7545582056045532, "reward_meter_std": 0.38726872205734253, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.914974570274353, "reward_repeat_penalty_std": 0.11135981976985931, "reward_repeat_floor_mean": 0.9899146556854248, "reward_repeat_floor_std": 0.0101882079616189, "reward_near_duplicate_penalty_mean": 0.9500719308853149, "reward_near_duplicate_penalty_std": 0.04354565590620041, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9919871687889099, "reward_distinct_2_std": 0.02266368828713894, "reward_judge_quality_mean": 0.5962499976158142, "reward_judge_quality_std": 0.26065507531166077, "reward_total_composite_mean": 0.38103383779525757, "reward_total_composite_std": 0.23693832755088806} {"timestamp_utc": "2026-04-12T17:31:36Z", "mode": "train", "global_step": 431, "epoch": 0.022683016683332457, "loss": -0.0516, "grad_norm": 20.342313766479492, "learning_rate": 8.696969696969699e-06, "num_tokens": 803343.0, "completions/mean_length": 22.0, "completions/min_length": 14.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.0, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.31310927867889404, "rewards/meter/std": 0.40659424662590027, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9321384429931641, "rewards/lexical_plausibility/std": 0.10931902378797531, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.39445942640304565, "rewards/repeat_penalty/mean": 0.8071969747543335, "rewards/repeat_penalty/std": 0.10651341080665588, "rewards/repeat_floor/mean": 0.9879545569419861, "rewards/repeat_floor/std": 0.005729019176214933, "rewards/near_duplicate_penalty/mean": 0.9946969747543335, "rewards/near_duplicate_penalty/std": 0.01499924249947071, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1963495910167694, "rewards/total_composite/std": 0.3161138594150543, "reward": 0.1963495910167694, "reward_std": 0.3161138594150543, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18365509808063507, "sampling/sampling_logp_difference/max": 1.4172420501708984, "sampling/importance_sampling_ratio/min": 0.24238158762454987, "sampling/importance_sampling_ratio/mean": 1.0191051959991455, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2575480788946152, "clip_ratio/low_mean": 0.09572916757315397, "clip_ratio/low_min": 0.09572916757315397, "clip_ratio/high_mean": 0.04442307632416487, "clip_ratio/high_max": 0.04442307632416487, "clip_ratio/region_mean": 0.14015224389731884, "reward_total_mean": 0.1963495910167694, "reward_meter_mean": 0.31310927867889404, "reward_meter_std": 0.40659424662590027, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9321384429931641, "reward_lexical_plausibility_std": 0.10931902378797531, "reward_repeat_penalty_mean": 0.8071969747543335, "reward_repeat_penalty_std": 0.10651341080665588, "reward_repeat_floor_mean": 0.9879545569419861, "reward_repeat_floor_std": 0.005729019176214933, "reward_near_duplicate_penalty_mean": 0.9946969747543335, "reward_near_duplicate_penalty_std": 0.01499924249947071, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.39445942640304565, "reward_total_composite_mean": 0.1963495910167694, "reward_total_composite_std": 0.3161138594150543} {"timestamp_utc": "2026-04-12T17:31:44Z", "mode": "train", "global_step": 432, "epoch": 0.02273564549234251, "loss": 0.0122, "grad_norm": 15.05434799194336, "learning_rate": 8.693939393939394e-06, "num_tokens": 804841.0, "completions/mean_length": 36.25, "completions/min_length": 32.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.25, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.9286046028137207, "rewards/meter/std": 0.10607271641492844, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.25670650601387024, "rewards/repeat_penalty/mean": 0.7789238691329956, "rewards/repeat_penalty/std": 0.31931358575820923, "rewards/repeat_floor/mean": 0.9670715928077698, "rewards/repeat_floor/std": 0.05417557805776596, "rewards/near_duplicate_penalty/mean": 0.8985941410064697, "rewards/near_duplicate_penalty/std": 0.13835026323795319, "rewards/opening_diversity/mean": 0.921875, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.8552219271659851, "rewards/distinct_2/std": 0.2321971356868744, "rewards/total_composite/mean": 0.33405745029449463, "rewards/total_composite/std": 0.21716289222240448, "reward": 0.33405745029449463, "reward_std": 0.21716290712356567, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1804109364748001, "sampling/sampling_logp_difference/max": 1.2361602783203125, "sampling/importance_sampling_ratio/min": 0.2904975116252899, "sampling/importance_sampling_ratio/mean": 1.0170305967330933, "sampling/importance_sampling_ratio/max": 1.888614535331726, "entropy": 1.3487338498234749, "clip_ratio/low_mean": 0.05966893583536148, "clip_ratio/low_min": 0.05966893583536148, "clip_ratio/high_mean": 0.10008982848376036, "clip_ratio/high_max": 0.10008982848376036, "clip_ratio/region_mean": 0.15975876431912184, "reward_total_mean": 0.33405745029449463, "reward_meter_mean": 0.9286046028137207, "reward_meter_std": 0.10607271641492844, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7789238691329956, "reward_repeat_penalty_std": 0.31931358575820923, "reward_repeat_floor_mean": 0.9670715928077698, "reward_repeat_floor_std": 0.05417557805776596, "reward_near_duplicate_penalty_mean": 0.8985941410064697, "reward_near_duplicate_penalty_std": 0.13835026323795319, "reward_opening_diversity_mean": 0.921875, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.8552219271659851, "reward_distinct_2_std": 0.2321971356868744, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.25670650601387024, "reward_total_composite_mean": 0.33405745029449463, "reward_total_composite_std": 0.21716289222240448} {"timestamp_utc": "2026-04-12T17:31:55Z", "mode": "train", "global_step": 433, "epoch": 0.02278827430135256, "loss": 0.0811, "grad_norm": 21.103116989135742, "learning_rate": 8.690909090909091e-06, "num_tokens": 806260.0, "completions/mean_length": 19.375, "completions/min_length": 16.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.375, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.5606968998908997, "rewards/meter/std": 0.42898276448249817, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.2512255907058716, "rewards/repeat_penalty/mean": 0.5866682529449463, "rewards/repeat_penalty/std": 0.18245680630207062, "rewards/repeat_floor/mean": 0.9532995820045471, "rewards/repeat_floor/std": 0.037441376596689224, "rewards/near_duplicate_penalty/mean": 0.8347302675247192, "rewards/near_duplicate_penalty/std": 0.2094637155532837, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9232226014137268, "rewards/distinct_2/std": 0.0840834379196167, "rewards/total_composite/mean": 0.3905339241027832, "rewards/total_composite/std": 0.3559979200363159, "reward": 0.3905339241027832, "reward_std": 0.3559979200363159, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14828713238239288, "sampling/sampling_logp_difference/max": 1.1223297119140625, "sampling/importance_sampling_ratio/min": 0.32552051544189453, "sampling/importance_sampling_ratio/mean": 1.0559544563293457, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2376205250620842, "clip_ratio/low_mean": 0.10375180514529347, "clip_ratio/low_min": 0.10375180514529347, "clip_ratio/high_mean": 0.06840277835726738, "clip_ratio/high_max": 0.06840277835726738, "clip_ratio/region_mean": 0.17215458350256085, "reward_total_mean": 0.3905339241027832, "reward_meter_mean": 0.5606968998908997, "reward_meter_std": 0.42898276448249817, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5866682529449463, "reward_repeat_penalty_std": 0.18245680630207062, "reward_repeat_floor_mean": 0.9532995820045471, "reward_repeat_floor_std": 0.037441376596689224, "reward_near_duplicate_penalty_mean": 0.8347302675247192, "reward_near_duplicate_penalty_std": 0.2094637155532837, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9232226014137268, "reward_distinct_2_std": 0.0840834379196167, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.2512255907058716, "reward_total_composite_mean": 0.3905339241027832, "reward_total_composite_std": 0.3559979200363159} {"timestamp_utc": "2026-04-12T17:32:09Z", "mode": "train", "global_step": 434, "epoch": 0.022840903110362614, "loss": -0.0521, "grad_norm": 4.7322797775268555, "learning_rate": 8.687878787878789e-06, "num_tokens": 807950.0, "completions/mean_length": 98.25, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 39.142860412597656, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.4920887351036072, "rewards/meter/std": 0.44183990359306335, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9341939687728882, "rewards/lexical_plausibility/std": 0.18612757325172424, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9411939382553101, "rewards/repeat_penalty/std": 0.08720644563436508, "rewards/repeat_floor/mean": 0.9944504499435425, "rewards/repeat_floor/std": 0.006299737375229597, "rewards/near_duplicate_penalty/mean": 0.9807475805282593, "rewards/near_duplicate_penalty/std": 0.024986431002616882, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.1768699586391449, "rewards/total_composite/std": 0.15796123445034027, "reward": 0.1768699586391449, "reward_std": 0.15796124935150146, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16028976440429688, "sampling/sampling_logp_difference/max": 1.40220308303833, "sampling/importance_sampling_ratio/min": 0.2460542768239975, "sampling/importance_sampling_ratio/mean": 1.0458790063858032, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2747960537672043, "clip_ratio/low_mean": 0.07279829680919647, "clip_ratio/low_min": 0.07279829680919647, "clip_ratio/high_mean": 0.07110042870044708, "clip_ratio/high_max": 0.07110042870044708, "clip_ratio/region_mean": 0.14389872550964355, "reward_total_mean": 0.1768699586391449, "reward_meter_mean": 0.4920887351036072, "reward_meter_std": 0.44183990359306335, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9341939687728882, "reward_lexical_plausibility_std": 0.18612757325172424, "reward_repeat_penalty_mean": 0.9411939382553101, "reward_repeat_penalty_std": 0.08720644563436508, "reward_repeat_floor_mean": 0.9944504499435425, "reward_repeat_floor_std": 0.006299737375229597, "reward_near_duplicate_penalty_mean": 0.9807475805282593, "reward_near_duplicate_penalty_std": 0.024986431002616882, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.1768699586391449, "reward_total_composite_std": 0.15796123445034027} {"timestamp_utc": "2026-04-12T17:32:19Z", "mode": "train", "global_step": 435, "epoch": 0.022893531919372663, "loss": 0.1078, "grad_norm": 11.790294647216797, "learning_rate": 8.684848484848486e-06, "num_tokens": 810514.0, "completions/mean_length": 115.5, "completions/min_length": 95.0, "completions/max_length": 154.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 115.5, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 154.0, "rewards/meter/mean": 0.4564869999885559, "rewards/meter/std": 0.3084644675254822, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.07715168595314026, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.023145509883761406, "rewards/lexical_plausibility/mean": 0.96875, "rewards/lexical_plausibility/std": 0.0883883461356163, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.47967588901519775, "rewards/repeat_penalty/std": 0.2529032826423645, "rewards/repeat_floor/mean": 0.9452492594718933, "rewards/repeat_floor/std": 0.034242741763591766, "rewards/near_duplicate_penalty/mean": 0.9025230407714844, "rewards/near_duplicate_penalty/std": 0.086373470723629, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.5541201829910278, "rewards/distinct_2/std": 0.25107184052467346, "rewards/total_composite/mean": 0.11287913471460342, "rewards/total_composite/std": 0.0824497640132904, "reward": 0.11287913471460342, "reward_std": 0.08244975656270981, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1585901826620102, "sampling/sampling_logp_difference/max": 2.0680277347564697, "sampling/importance_sampling_ratio/min": 0.12643489241600037, "sampling/importance_sampling_ratio/mean": 1.0194590091705322, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8978934735059738, "clip_ratio/low_mean": 0.07746379356831312, "clip_ratio/low_min": 0.07746379356831312, "clip_ratio/high_mean": 0.08359695691615343, "clip_ratio/high_max": 0.08359695691615343, "clip_ratio/region_mean": 0.16106075048446655, "reward_total_mean": 0.11287913471460342, "reward_meter_mean": 0.4564869999885559, "reward_meter_std": 0.3084644675254822, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.07715168595314026, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.023145509883761406, "reward_lexical_plausibility_mean": 0.96875, "reward_lexical_plausibility_std": 0.0883883461356163, "reward_repeat_penalty_mean": 0.47967588901519775, "reward_repeat_penalty_std": 0.2529032826423645, "reward_repeat_floor_mean": 0.9452492594718933, "reward_repeat_floor_std": 0.034242741763591766, "reward_near_duplicate_penalty_mean": 0.9025230407714844, "reward_near_duplicate_penalty_std": 0.086373470723629, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.5541201829910278, "reward_distinct_2_std": 0.25107184052467346, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.11287913471460342, "reward_total_composite_std": 0.0824497640132904} {"timestamp_utc": "2026-04-12T17:32:28Z", "mode": "train", "global_step": 436, "epoch": 0.022946160728382715, "loss": -0.0476, "grad_norm": 15.734235763549805, "learning_rate": 8.681818181818182e-06, "num_tokens": 812143.0, "completions/mean_length": 37.625, "completions/min_length": 31.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.625, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.9163669347763062, "rewards/meter/std": 0.174087792634964, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48749998211860657, "rewards/judge_quality/std": 0.1060660257935524, "rewards/repeat_penalty/mean": 0.902525782585144, "rewards/repeat_penalty/std": 0.12604406476020813, "rewards/repeat_floor/mean": 0.9895317554473877, "rewards/repeat_floor/std": 0.011998934671282768, "rewards/near_duplicate_penalty/mean": 0.9656435251235962, "rewards/near_duplicate_penalty/std": 0.031159186735749245, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9617804884910583, "rewards/distinct_2/std": 0.05967911705374718, "rewards/total_composite/mean": 0.44398781657218933, "rewards/total_composite/std": 0.13645069301128387, "reward": 0.44398781657218933, "reward_std": 0.13645070791244507, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1768357753753662, "sampling/sampling_logp_difference/max": 2.1466424465179443, "sampling/importance_sampling_ratio/min": 0.11687591671943665, "sampling/importance_sampling_ratio/mean": 1.0240319967269897, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3429600894451141, "clip_ratio/low_mean": 0.14854550547897816, "clip_ratio/low_min": 0.14854550547897816, "clip_ratio/high_mean": 0.019886363297700882, "clip_ratio/high_max": 0.019886363297700882, "clip_ratio/region_mean": 0.16843186877667904, "reward_total_mean": 0.44398781657218933, "reward_meter_mean": 0.9163669347763062, "reward_meter_std": 0.174087792634964, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.902525782585144, "reward_repeat_penalty_std": 0.12604406476020813, "reward_repeat_floor_mean": 0.9895317554473877, "reward_repeat_floor_std": 0.011998934671282768, "reward_near_duplicate_penalty_mean": 0.9656435251235962, "reward_near_duplicate_penalty_std": 0.031159186735749245, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9617804884910583, "reward_distinct_2_std": 0.05967911705374718, "reward_judge_quality_mean": 0.48749998211860657, "reward_judge_quality_std": 0.1060660257935524, "reward_total_composite_mean": 0.44398781657218933, "reward_total_composite_std": 0.13645069301128387} {"timestamp_utc": "2026-04-12T17:32:37Z", "mode": "train", "global_step": 437, "epoch": 0.022998789537392768, "loss": -0.0727, "grad_norm": 14.207025527954102, "learning_rate": 8.67878787878788e-06, "num_tokens": 813768.0, "completions/mean_length": 44.125, "completions/min_length": 20.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.125, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.9627096056938171, "rewards/meter/std": 0.07403799146413803, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5212500095367432, "rewards/judge_quality/std": 0.18137866258621216, "rewards/repeat_penalty/mean": 0.9269751310348511, "rewards/repeat_penalty/std": 0.0906093642115593, "rewards/repeat_floor/mean": 0.9921700358390808, "rewards/repeat_floor/std": 0.007709295954555273, "rewards/near_duplicate_penalty/mean": 0.9649156928062439, "rewards/near_duplicate_penalty/std": 0.03982192277908325, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9923076629638672, "rewards/distinct_2/std": 0.021757129579782486, "rewards/total_composite/mean": 0.49118906259536743, "rewards/total_composite/std": 0.18979567289352417, "reward": 0.49118906259536743, "reward_std": 0.18979567289352417, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19425368309020996, "sampling/sampling_logp_difference/max": 1.845548152923584, "sampling/importance_sampling_ratio/min": 0.15793871879577637, "sampling/importance_sampling_ratio/mean": 1.0171160697937012, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.537724032998085, "clip_ratio/low_mean": 0.1682034321129322, "clip_ratio/low_min": 0.1682034321129322, "clip_ratio/high_mean": 0.04624304175376892, "clip_ratio/high_max": 0.04624304175376892, "clip_ratio/region_mean": 0.21444647386670113, "reward_total_mean": 0.49118906259536743, "reward_meter_mean": 0.9627096056938171, "reward_meter_std": 0.07403799146413803, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9269751310348511, "reward_repeat_penalty_std": 0.0906093642115593, "reward_repeat_floor_mean": 0.9921700358390808, "reward_repeat_floor_std": 0.007709295954555273, "reward_near_duplicate_penalty_mean": 0.9649156928062439, "reward_near_duplicate_penalty_std": 0.03982192277908325, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9923076629638672, "reward_distinct_2_std": 0.021757129579782486, "reward_judge_quality_mean": 0.5212500095367432, "reward_judge_quality_std": 0.18137866258621216, "reward_total_composite_mean": 0.49118906259536743, "reward_total_composite_std": 0.18979567289352417} {"timestamp_utc": "2026-04-12T17:32:50Z", "mode": "train", "global_step": 438, "epoch": 0.02305141834640282, "loss": -0.0364, "grad_norm": 7.291502952575684, "learning_rate": 8.675757575757576e-06, "num_tokens": 815463.0, "completions/mean_length": 105.875, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.85714340209961, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.4315311908721924, "rewards/meter/std": 0.36646798253059387, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.3563483655452728, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9500000476837158, "rewards/count_floor/std": 0.10690450668334961, "rewards/lexical_plausibility/mean": 0.9189607501029968, "rewards/lexical_plausibility/std": 0.2292136400938034, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.24032345414161682, "rewards/repeat_penalty/mean": 0.9554541110992432, "rewards/repeat_penalty/std": 0.050407905131578445, "rewards/repeat_floor/mean": 0.9946420788764954, "rewards/repeat_floor/std": 0.005840022582560778, "rewards/near_duplicate_penalty/mean": 0.9790205955505371, "rewards/near_duplicate_penalty/std": 0.020779188722372055, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9754332304000854, "rewards/distinct_2/std": 0.03412005305290222, "rewards/total_composite/mean": 0.2373935580253601, "rewards/total_composite/std": 0.29499682784080505, "reward": 0.2373935580253601, "reward_std": 0.29499682784080505, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23944535851478577, "sampling/sampling_logp_difference/max": 1.980813980102539, "sampling/importance_sampling_ratio/min": 0.1379568874835968, "sampling/importance_sampling_ratio/mean": 1.0251054763793945, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8470597416162491, "clip_ratio/low_mean": 0.10668371617794037, "clip_ratio/low_min": 0.10668371617794037, "clip_ratio/high_mean": 0.048469388857483864, "clip_ratio/high_max": 0.048469388857483864, "clip_ratio/region_mean": 0.15515310503542423, "reward_total_mean": 0.2373935580253601, "reward_meter_mean": 0.4315311908721924, "reward_meter_std": 0.36646798253059387, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.3563483655452728, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9500000476837158, "reward_count_floor_std": 0.10690450668334961, "reward_lexical_plausibility_mean": 0.9189607501029968, "reward_lexical_plausibility_std": 0.2292136400938034, "reward_repeat_penalty_mean": 0.9554541110992432, "reward_repeat_penalty_std": 0.050407905131578445, "reward_repeat_floor_mean": 0.9946420788764954, "reward_repeat_floor_std": 0.005840022582560778, "reward_near_duplicate_penalty_mean": 0.9790205955505371, "reward_near_duplicate_penalty_std": 0.020779188722372055, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9754332304000854, "reward_distinct_2_std": 0.03412005305290222, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.24032345414161682, "reward_total_composite_mean": 0.2373935580253601, "reward_total_composite_std": 0.29499682784080505} {"timestamp_utc": "2026-04-12T17:32:58Z", "mode": "train", "global_step": 439, "epoch": 0.023104047155412873, "loss": -0.027, "grad_norm": 14.869061470031738, "learning_rate": 8.672727272727273e-06, "num_tokens": 817137.0, "completions/mean_length": 39.25, "completions/min_length": 35.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.25, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.8195381164550781, "rewards/meter/std": 0.3328098952770233, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.8967796564102173, "rewards/repeat_penalty/std": 0.1638745367527008, "rewards/repeat_floor/mean": 0.9877615571022034, "rewards/repeat_floor/std": 0.01785091497004032, "rewards/near_duplicate_penalty/mean": 0.9547200202941895, "rewards/near_duplicate_penalty/std": 0.05203406885266304, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9603174924850464, "rewards/distinct_2/std": 0.07376706600189209, "rewards/total_composite/mean": 0.376526415348053, "rewards/total_composite/std": 0.2509756088256836, "reward": 0.376526415348053, "reward_std": 0.2509755790233612, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17136229574680328, "sampling/sampling_logp_difference/max": 1.500025987625122, "sampling/importance_sampling_ratio/min": 0.22312436997890472, "sampling/importance_sampling_ratio/mean": 1.0411264896392822, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.327915146946907, "clip_ratio/low_mean": 0.09228302352130413, "clip_ratio/low_min": 0.09228302352130413, "clip_ratio/high_mean": 0.03553196042776108, "clip_ratio/high_max": 0.03553196042776108, "clip_ratio/region_mean": 0.1278149839490652, "reward_total_mean": 0.376526415348053, "reward_meter_mean": 0.8195381164550781, "reward_meter_std": 0.3328098952770233, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.8967796564102173, "reward_repeat_penalty_std": 0.1638745367527008, "reward_repeat_floor_mean": 0.9877615571022034, "reward_repeat_floor_std": 0.01785091497004032, "reward_near_duplicate_penalty_mean": 0.9547200202941895, "reward_near_duplicate_penalty_std": 0.05203406885266304, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9603174924850464, "reward_distinct_2_std": 0.07376706600189209, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.376526415348053, "reward_total_composite_std": 0.2509756088256836} {"timestamp_utc": "2026-04-12T17:33:06Z", "mode": "train", "global_step": 440, "epoch": 0.023156675964422925, "loss": 0.0653, "grad_norm": 16.776262283325195, "learning_rate": 8.66969696969697e-06, "num_tokens": 818602.0, "completions/mean_length": 36.125, "completions/min_length": 19.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.125, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.7714211344718933, "rewards/meter/std": 0.3801732361316681, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45374998450279236, "rewards/judge_quality/std": 0.2404720038175583, "rewards/repeat_penalty/mean": 0.9452999234199524, "rewards/repeat_penalty/std": 0.08995723724365234, "rewards/repeat_floor/mean": 0.9950763583183289, "rewards/repeat_floor/std": 0.006854683626443148, "rewards/near_duplicate_penalty/mean": 0.9849203824996948, "rewards/near_duplicate_penalty/std": 0.029514934867620468, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.3650018572807312, "rewards/total_composite/std": 0.279037743806839, "reward": 0.3650018572807312, "reward_std": 0.279037743806839, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18914948403835297, "sampling/sampling_logp_difference/max": 1.8713899850845337, "sampling/importance_sampling_ratio/min": 0.1539095789194107, "sampling/importance_sampling_ratio/mean": 1.0234311819076538, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6712673604488373, "clip_ratio/low_mean": 0.06190958060324192, "clip_ratio/low_min": 0.06190958060324192, "clip_ratio/high_mean": 0.1166908759623766, "clip_ratio/high_max": 0.1166908759623766, "clip_ratio/region_mean": 0.17860045656561852, "reward_total_mean": 0.3650018572807312, "reward_meter_mean": 0.7714211344718933, "reward_meter_std": 0.3801732361316681, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9452999234199524, "reward_repeat_penalty_std": 0.08995723724365234, "reward_repeat_floor_mean": 0.9950763583183289, "reward_repeat_floor_std": 0.006854683626443148, "reward_near_duplicate_penalty_mean": 0.9849203824996948, "reward_near_duplicate_penalty_std": 0.029514934867620468, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.45374998450279236, "reward_judge_quality_std": 0.2404720038175583, "reward_total_composite_mean": 0.3650018572807312, "reward_total_composite_std": 0.279037743806839} {"timestamp_utc": "2026-04-12T17:33:15Z", "mode": "train", "global_step": 441, "epoch": 0.023209304773432977, "loss": 0.0323, "grad_norm": 12.250515937805176, "learning_rate": 8.666666666666668e-06, "num_tokens": 820174.0, "completions/mean_length": 40.5, "completions/min_length": 35.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.5, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7683224678039551, "rewards/meter/std": 0.40084394812583923, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.680577278137207, "rewards/repeat_penalty/std": 0.3836446702480316, "rewards/repeat_floor/mean": 0.9568132162094116, "rewards/repeat_floor/std": 0.06405427306890488, "rewards/near_duplicate_penalty/mean": 0.890741229057312, "rewards/near_duplicate_penalty/std": 0.18196484446525574, "rewards/opening_diversity/mean": 0.828125, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.8168286681175232, "rewards/distinct_2/std": 0.28185638785362244, "rewards/total_composite/mean": 0.3095269799232483, "rewards/total_composite/std": 0.2818174958229065, "reward": 0.3095269799232483, "reward_std": 0.2818174958229065, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1876748502254486, "sampling/sampling_logp_difference/max": 2.106761932373047, "sampling/importance_sampling_ratio/min": 0.1216311827301979, "sampling/importance_sampling_ratio/mean": 1.0105547904968262, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1488417834043503, "clip_ratio/low_mean": 0.08663870207965374, "clip_ratio/low_min": 0.08663870207965374, "clip_ratio/high_mean": 0.0862985560670495, "clip_ratio/high_max": 0.0862985560670495, "clip_ratio/region_mean": 0.17293725814670324, "reward_total_mean": 0.3095269799232483, "reward_meter_mean": 0.7683224678039551, "reward_meter_std": 0.40084394812583923, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.680577278137207, "reward_repeat_penalty_std": 0.3836446702480316, "reward_repeat_floor_mean": 0.9568132162094116, "reward_repeat_floor_std": 0.06405427306890488, "reward_near_duplicate_penalty_mean": 0.890741229057312, "reward_near_duplicate_penalty_std": 0.18196484446525574, "reward_opening_diversity_mean": 0.828125, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.8168286681175232, "reward_distinct_2_std": 0.28185638785362244, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.3095269799232483, "reward_total_composite_std": 0.2818174958229065} {"timestamp_utc": "2026-04-12T17:33:24Z", "mode": "train", "global_step": 442, "epoch": 0.02326193358244303, "loss": 0.0547, "grad_norm": 20.725318908691406, "learning_rate": 8.663636363636363e-06, "num_tokens": 821613.0, "completions/mean_length": 33.875, "completions/min_length": 29.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.875, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.4547012150287628, "rewards/meter/std": 0.40436694025993347, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.268537700176239, "rewards/repeat_penalty/mean": 0.8193002939224243, "rewards/repeat_penalty/std": 0.27543652057647705, "rewards/repeat_floor/mean": 0.9810307025909424, "rewards/repeat_floor/std": 0.028231441974639893, "rewards/near_duplicate_penalty/mean": 0.953036904335022, "rewards/near_duplicate_penalty/std": 0.06711763888597488, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9091683030128479, "rewards/distinct_2/std": 0.13809095323085785, "rewards/total_composite/mean": 0.15017744898796082, "rewards/total_composite/std": 0.1516982614994049, "reward": 0.15017744898796082, "reward_std": 0.1516982614994049, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2031320333480835, "sampling/sampling_logp_difference/max": 2.945540428161621, "sampling/importance_sampling_ratio/min": 0.052573639899492264, "sampling/importance_sampling_ratio/mean": 1.0040764808654785, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2909222468733788, "clip_ratio/low_mean": 0.09805652685463428, "clip_ratio/low_min": 0.09805652685463428, "clip_ratio/high_mean": 0.05971479695290327, "clip_ratio/high_max": 0.05971479695290327, "clip_ratio/region_mean": 0.15777132380753756, "reward_total_mean": 0.15017744898796082, "reward_meter_mean": 0.4547012150287628, "reward_meter_std": 0.40436694025993347, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8193002939224243, "reward_repeat_penalty_std": 0.27543652057647705, "reward_repeat_floor_mean": 0.9810307025909424, "reward_repeat_floor_std": 0.028231441974639893, "reward_near_duplicate_penalty_mean": 0.953036904335022, "reward_near_duplicate_penalty_std": 0.06711763888597488, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9091683030128479, "reward_distinct_2_std": 0.13809095323085785, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.268537700176239, "reward_total_composite_mean": 0.15017744898796082, "reward_total_composite_std": 0.1516982614994049} {"timestamp_utc": "2026-04-12T17:33:33Z", "mode": "train", "global_step": 443, "epoch": 0.023314562391453082, "loss": 0.0462, "grad_norm": 12.641680717468262, "learning_rate": 8.660606060606062e-06, "num_tokens": 823467.0, "completions/mean_length": 53.75, "completions/min_length": 38.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.75, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.6973755955696106, "rewards/meter/std": 0.4102723300457001, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.22177450358867645, "rewards/repeat_penalty/mean": 0.8206741809844971, "rewards/repeat_penalty/std": 0.15012654662132263, "rewards/repeat_floor/mean": 0.9779125452041626, "rewards/repeat_floor/std": 0.017838358879089355, "rewards/near_duplicate_penalty/mean": 0.9214118123054504, "rewards/near_duplicate_penalty/std": 0.05443250760436058, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8855636119842529, "rewards/distinct_2/std": 0.11458331346511841, "rewards/total_composite/mean": 0.28731346130371094, "rewards/total_composite/std": 0.27685046195983887, "reward": 0.28731346130371094, "reward_std": 0.27685049176216125, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1657501608133316, "sampling/sampling_logp_difference/max": 1.9893255233764648, "sampling/importance_sampling_ratio/min": 0.13678765296936035, "sampling/importance_sampling_ratio/mean": 1.0055123567581177, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9584505185484886, "clip_ratio/low_mean": 0.05728705367073417, "clip_ratio/low_min": 0.05728705367073417, "clip_ratio/high_mean": 0.09869378432631493, "clip_ratio/high_max": 0.09869378432631493, "clip_ratio/region_mean": 0.1559808379970491, "reward_total_mean": 0.28731346130371094, "reward_meter_mean": 0.6973755955696106, "reward_meter_std": 0.4102723300457001, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.8206741809844971, "reward_repeat_penalty_std": 0.15012654662132263, "reward_repeat_floor_mean": 0.9779125452041626, "reward_repeat_floor_std": 0.017838358879089355, "reward_near_duplicate_penalty_mean": 0.9214118123054504, "reward_near_duplicate_penalty_std": 0.05443250760436058, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8855636119842529, "reward_distinct_2_std": 0.11458331346511841, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.22177450358867645, "reward_total_composite_mean": 0.28731346130371094, "reward_total_composite_std": 0.27685046195983887} {"timestamp_utc": "2026-04-12T17:33:47Z", "mode": "train", "global_step": 444, "epoch": 0.023367191200463135, "loss": -0.0532, "grad_norm": 2.3879916667938232, "learning_rate": 8.657575757575758e-06, "num_tokens": 825054.0, "completions/mean_length": 218.375, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 42.20000076293945, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.4307488203048706, "rewards/meter/std": 0.45420384407043457, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8206913471221924, "rewards/lexical_plausibility/std": 0.23280160129070282, "rewards/judge_quality/mean": 0.3212500214576721, "rewards/judge_quality/std": 0.29235193133354187, "rewards/repeat_penalty/mean": 0.9374526739120483, "rewards/repeat_penalty/std": 0.08515334874391556, "rewards/repeat_floor/mean": 0.9917943477630615, "rewards/repeat_floor/std": 0.010660682804882526, "rewards/near_duplicate_penalty/mean": 0.9609840512275696, "rewards/near_duplicate_penalty/std": 0.044291090220212936, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9738528728485107, "rewards/distinct_2/std": 0.050033703446388245, "rewards/total_composite/mean": 0.13904240727424622, "rewards/total_composite/std": 0.1691950410604477, "reward": 0.13904240727424622, "reward_std": 0.1691950410604477, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20445603132247925, "sampling/sampling_logp_difference/max": 1.2904787063598633, "sampling/importance_sampling_ratio/min": 0.3813531994819641, "sampling/importance_sampling_ratio/mean": 1.0190016031265259, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2257293909788132, "clip_ratio/low_mean": 0.036382850259542465, "clip_ratio/low_min": 0.036382850259542465, "clip_ratio/high_mean": 0.0665881372988224, "clip_ratio/high_max": 0.0665881372988224, "clip_ratio/region_mean": 0.10297098755836487, "reward_total_mean": 0.13904240727424622, "reward_meter_mean": 0.4307488203048706, "reward_meter_std": 0.45420384407043457, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8206913471221924, "reward_lexical_plausibility_std": 0.23280160129070282, "reward_repeat_penalty_mean": 0.9374526739120483, "reward_repeat_penalty_std": 0.08515334874391556, "reward_repeat_floor_mean": 0.9917943477630615, "reward_repeat_floor_std": 0.010660682804882526, "reward_near_duplicate_penalty_mean": 0.9609840512275696, "reward_near_duplicate_penalty_std": 0.044291090220212936, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9738528728485107, "reward_distinct_2_std": 0.050033703446388245, "reward_judge_quality_mean": 0.3212500214576721, "reward_judge_quality_std": 0.29235193133354187, "reward_total_composite_mean": 0.13904240727424622, "reward_total_composite_std": 0.1691950410604477} {"timestamp_utc": "2026-04-12T17:33:56Z", "mode": "train", "global_step": 445, "epoch": 0.023419820009473187, "loss": 0.0521, "grad_norm": 19.418930053710938, "learning_rate": 8.654545454545455e-06, "num_tokens": 826526.0, "completions/mean_length": 35.0, "completions/min_length": 32.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.0, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.8228330612182617, "rewards/meter/std": 0.3061090409755707, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.3184336721897125, "rewards/repeat_penalty/mean": 0.9564417600631714, "rewards/repeat_penalty/std": 0.08751532435417175, "rewards/repeat_floor/mean": 0.9953893423080444, "rewards/repeat_floor/std": 0.007846657186746597, "rewards/near_duplicate_penalty/mean": 0.9884930849075317, "rewards/near_duplicate_penalty/std": 0.016842078417539597, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9679487347602844, "rewards/distinct_2/std": 0.09065470844507217, "rewards/total_composite/mean": 0.5848497152328491, "rewards/total_composite/std": 0.3616703748703003, "reward": 0.5848497152328491, "reward_std": 0.3616703450679779, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18440987169742584, "sampling/sampling_logp_difference/max": 1.8155077695846558, "sampling/importance_sampling_ratio/min": 0.16275525093078613, "sampling/importance_sampling_ratio/mean": 1.028830885887146, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.263876512646675, "clip_ratio/low_mean": 0.11446377448737621, "clip_ratio/low_min": 0.11446377448737621, "clip_ratio/high_mean": 0.09691220428794622, "clip_ratio/high_max": 0.09691220428794622, "clip_ratio/region_mean": 0.21137597877532244, "reward_total_mean": 0.5848497152328491, "reward_meter_mean": 0.8228330612182617, "reward_meter_std": 0.3061090409755707, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9564417600631714, "reward_repeat_penalty_std": 0.08751532435417175, "reward_repeat_floor_mean": 0.9953893423080444, "reward_repeat_floor_std": 0.007846657186746597, "reward_near_duplicate_penalty_mean": 0.9884930849075317, "reward_near_duplicate_penalty_std": 0.016842078417539597, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9679487347602844, "reward_distinct_2_std": 0.09065470844507217, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.3184336721897125, "reward_total_composite_mean": 0.5848497152328491, "reward_total_composite_std": 0.3616703748703003} {"timestamp_utc": "2026-04-12T17:34:09Z", "mode": "train", "global_step": 446, "epoch": 0.02347244881848324, "loss": -0.0795, "grad_norm": 4.500837326049805, "learning_rate": 8.651515151515152e-06, "num_tokens": 828024.0, "completions/mean_length": 101.25, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 42.57143020629883, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.8515878319740295, "rewards/meter/std": 0.3188558518886566, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9403458833694458, "rewards/lexical_plausibility/std": 0.1687273234128952, "rewards/judge_quality/mean": 0.4675000011920929, "rewards/judge_quality/std": 0.3160809278488159, "rewards/repeat_penalty/mean": 0.6370641589164734, "rewards/repeat_penalty/std": 0.31917449831962585, "rewards/repeat_floor/mean": 0.951697051525116, "rewards/repeat_floor/std": 0.05713529884815216, "rewards/near_duplicate_penalty/mean": 0.8621770143508911, "rewards/near_duplicate_penalty/std": 0.15992195904254913, "rewards/opening_diversity/mean": 0.796875, "rewards/opening_diversity/std": 0.2106272578239441, "rewards/distinct_2/mean": 0.8284223079681396, "rewards/distinct_2/std": 0.24711714684963226, "rewards/total_composite/mean": 0.4267417788505554, "rewards/total_composite/std": 0.3043561279773712, "reward": 0.4267417788505554, "reward_std": 0.3043561279773712, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13605427742004395, "sampling/sampling_logp_difference/max": 1.4208288192749023, "sampling/importance_sampling_ratio/min": 0.24151377379894257, "sampling/importance_sampling_ratio/mean": 1.022839903831482, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8579638451337814, "clip_ratio/low_mean": 0.05235937889665365, "clip_ratio/low_min": 0.05235937889665365, "clip_ratio/high_mean": 0.053034319542348385, "clip_ratio/high_max": 0.053034319542348385, "clip_ratio/region_mean": 0.10539369843900204, "reward_total_mean": 0.4267417788505554, "reward_meter_mean": 0.8515878319740295, "reward_meter_std": 0.3188558518886566, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9403458833694458, "reward_lexical_plausibility_std": 0.1687273234128952, "reward_repeat_penalty_mean": 0.6370641589164734, "reward_repeat_penalty_std": 0.31917449831962585, "reward_repeat_floor_mean": 0.951697051525116, "reward_repeat_floor_std": 0.05713529884815216, "reward_near_duplicate_penalty_mean": 0.8621770143508911, "reward_near_duplicate_penalty_std": 0.15992195904254913, "reward_opening_diversity_mean": 0.796875, "reward_opening_diversity_std": 0.2106272578239441, "reward_distinct_2_mean": 0.8284223079681396, "reward_distinct_2_std": 0.24711714684963226, "reward_judge_quality_mean": 0.4675000011920929, "reward_judge_quality_std": 0.3160809278488159, "reward_total_composite_mean": 0.4267417788505554, "reward_total_composite_std": 0.3043561279773712} {"timestamp_utc": "2026-04-12T17:34:19Z", "mode": "train", "global_step": 447, "epoch": 0.02352507762749329, "loss": 0.0069, "grad_norm": 11.352745056152344, "learning_rate": 8.64848484848485e-06, "num_tokens": 829983.0, "completions/mean_length": 74.875, "completions/min_length": 68.0, "completions/max_length": 81.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 74.875, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.7570005655288696, "rewards/meter/std": 0.37158462405204773, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.892204761505127, "rewards/repeat_penalty/std": 0.15515781939029694, "rewards/repeat_floor/mean": 0.9886047840118408, "rewards/repeat_floor/std": 0.013831005431711674, "rewards/near_duplicate_penalty/mean": 0.9616425037384033, "rewards/near_duplicate_penalty/std": 0.03131810575723648, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.942523717880249, "rewards/distinct_2/std": 0.09394238889217377, "rewards/total_composite/mean": 0.3357177972793579, "rewards/total_composite/std": 0.19216515123844147, "reward": 0.3357177972793579, "reward_std": 0.19216513633728027, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17933063209056854, "sampling/sampling_logp_difference/max": 1.6456398963928223, "sampling/importance_sampling_ratio/min": 0.19288909435272217, "sampling/importance_sampling_ratio/mean": 1.0180919170379639, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.772596687078476, "clip_ratio/low_mean": 0.06287023331969976, "clip_ratio/low_min": 0.06287023331969976, "clip_ratio/high_mean": 0.11908232234418392, "clip_ratio/high_max": 0.11908232234418392, "clip_ratio/region_mean": 0.18195255566388369, "reward_total_mean": 0.3357177972793579, "reward_meter_mean": 0.7570005655288696, "reward_meter_std": 0.37158462405204773, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.892204761505127, "reward_repeat_penalty_std": 0.15515781939029694, "reward_repeat_floor_mean": 0.9886047840118408, "reward_repeat_floor_std": 0.013831005431711674, "reward_near_duplicate_penalty_mean": 0.9616425037384033, "reward_near_duplicate_penalty_std": 0.03131810575723648, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.942523717880249, "reward_distinct_2_std": 0.09394238889217377, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.3357177972793579, "reward_total_composite_std": 0.19216515123844147} {"timestamp_utc": "2026-04-12T17:34:27Z", "mode": "train", "global_step": 448, "epoch": 0.02357770643650334, "loss": 0.0722, "grad_norm": 16.51186752319336, "learning_rate": 8.645454545454545e-06, "num_tokens": 831707.0, "completions/mean_length": 39.5, "completions/min_length": 30.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.5, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.07772711664438248, "rewards/meter/std": 0.058112356811761856, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5887500047683716, "rewards/judge_quality/std": 0.27740830183029175, "rewards/repeat_penalty/mean": 0.8866095542907715, "rewards/repeat_penalty/std": 0.13586875796318054, "rewards/repeat_floor/mean": 0.9853266477584839, "rewards/repeat_floor/std": 0.016353275626897812, "rewards/near_duplicate_penalty/mean": 0.9361306428909302, "rewards/near_duplicate_penalty/std": 0.056301020085811615, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9434118270874023, "rewards/distinct_2/std": 0.10515422374010086, "rewards/total_composite/mean": 0.051152303814888, "rewards/total_composite/std": 0.05245295166969299, "reward": 0.051152303814888, "reward_std": 0.052452944219112396, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20883063971996307, "sampling/sampling_logp_difference/max": 4.22971248626709, "sampling/importance_sampling_ratio/min": 0.014556575566530228, "sampling/importance_sampling_ratio/mean": 0.99327552318573, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9105018004775047, "clip_ratio/low_mean": 0.07945175468921661, "clip_ratio/low_min": 0.07945175468921661, "clip_ratio/high_mean": 0.09045888856053352, "clip_ratio/high_max": 0.09045888856053352, "clip_ratio/region_mean": 0.16991064324975014, "reward_total_mean": 0.051152303814888, "reward_meter_mean": 0.07772711664438248, "reward_meter_std": 0.058112356811761856, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8866095542907715, "reward_repeat_penalty_std": 0.13586875796318054, "reward_repeat_floor_mean": 0.9853266477584839, "reward_repeat_floor_std": 0.016353275626897812, "reward_near_duplicate_penalty_mean": 0.9361306428909302, "reward_near_duplicate_penalty_std": 0.056301020085811615, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9434118270874023, "reward_distinct_2_std": 0.10515422374010086, "reward_judge_quality_mean": 0.5887500047683716, "reward_judge_quality_std": 0.27740830183029175, "reward_total_composite_mean": 0.051152303814888, "reward_total_composite_std": 0.05245295166969299} {"timestamp_utc": "2026-04-12T17:34:41Z", "mode": "train", "global_step": 449, "epoch": 0.023630335245513393, "loss": -0.272, "grad_norm": 1.376067876815796, "learning_rate": 8.642424242424242e-06, "num_tokens": 834948.0, "completions/mean_length": 270.125, "completions/min_length": 188.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 235.57144165039062, "completions/min_terminated_length": 188.0, "completions/max_terminated_length": 279.0, "rewards/meter/mean": 0.9818702936172485, "rewards/meter/std": 0.03067575767636299, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.059391383081674576, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.01781740039587021, "rewards/lexical_plausibility/mean": 0.970257043838501, "rewards/lexical_plausibility/std": 0.08412572741508484, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.05028318986296654, "rewards/repeat_penalty/std": 0.11279795318841934, "rewards/repeat_floor/mean": 0.8261778354644775, "rewards/repeat_floor/std": 0.05766754597425461, "rewards/near_duplicate_penalty/mean": 0.557167649269104, "rewards/near_duplicate_penalty/std": 0.1810387521982193, "rewards/opening_diversity/mean": 0.5578733682632446, "rewards/opening_diversity/std": 0.2818715572357178, "rewards/distinct_2/mean": 0.1014476865530014, "rewards/distinct_2/std": 0.22239363193511963, "rewards/total_composite/mean": 0.10441425442695618, "rewards/total_composite/std": 0.024660808965563774, "reward": 0.10441425442695618, "reward_std": 0.024660807102918625, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07688037306070328, "sampling/sampling_logp_difference/max": 2.050701141357422, "sampling/importance_sampling_ratio/min": 0.1286446750164032, "sampling/importance_sampling_ratio/mean": 1.0193954706192017, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5089322850108147, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.04842671914957464, "clip_ratio/high_max": 0.04842671914957464, "clip_ratio/region_mean": 0.04842671914957464, "reward_total_mean": 0.10441425442695618, "reward_meter_mean": 0.9818702936172485, "reward_meter_std": 0.03067575767636299, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.059391383081674576, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.01781740039587021, "reward_lexical_plausibility_mean": 0.970257043838501, "reward_lexical_plausibility_std": 0.08412572741508484, "reward_repeat_penalty_mean": 0.05028318986296654, "reward_repeat_penalty_std": 0.11279795318841934, "reward_repeat_floor_mean": 0.8261778354644775, "reward_repeat_floor_std": 0.05766754597425461, "reward_near_duplicate_penalty_mean": 0.557167649269104, "reward_near_duplicate_penalty_std": 0.1810387521982193, "reward_opening_diversity_mean": 0.5578733682632446, "reward_opening_diversity_std": 0.2818715572357178, "reward_distinct_2_mean": 0.1014476865530014, "reward_distinct_2_std": 0.22239363193511963, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.10441425442695618, "reward_total_composite_std": 0.024660808965563774} {"timestamp_utc": "2026-04-12T17:34:55Z", "mode": "train", "global_step": 450, "epoch": 0.023682964054523446, "loss": -0.0597, "grad_norm": 2.5712053775787354, "learning_rate": 8.63939393939394e-06, "num_tokens": 836594.0, "completions/mean_length": 156.75, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 38.333335876464844, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.6731521487236023, "rewards/meter/std": 0.29471877217292786, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8807671070098877, "rewards/lexical_plausibility/std": 0.22261570394039154, "rewards/judge_quality/mean": 0.4050000011920929, "rewards/judge_quality/std": 0.3496120274066925, "rewards/repeat_penalty/mean": 0.9917501211166382, "rewards/repeat_penalty/std": 0.011602719314396381, "rewards/repeat_floor/mean": 0.9987624883651733, "rewards/repeat_floor/std": 0.001740400679409504, "rewards/near_duplicate_penalty/mean": 0.9917501211166382, "rewards/near_duplicate_penalty/std": 0.011602719314396381, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.30958878993988037, "rewards/total_composite/std": 0.3038085699081421, "reward": 0.30958878993988037, "reward_std": 0.3038085699081421, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1802184134721756, "sampling/sampling_logp_difference/max": 1.451115608215332, "sampling/importance_sampling_ratio/min": 0.23430874943733215, "sampling/importance_sampling_ratio/mean": 1.0301158428192139, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9844834133982658, "clip_ratio/low_mean": 0.031862745992839336, "clip_ratio/low_min": 0.031862745992839336, "clip_ratio/high_mean": 0.10054155811667442, "clip_ratio/high_max": 0.10054155811667442, "clip_ratio/region_mean": 0.13240430410951376, "reward_total_mean": 0.30958878993988037, "reward_meter_mean": 0.6731521487236023, "reward_meter_std": 0.29471877217292786, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8807671070098877, "reward_lexical_plausibility_std": 0.22261570394039154, "reward_repeat_penalty_mean": 0.9917501211166382, "reward_repeat_penalty_std": 0.011602719314396381, "reward_repeat_floor_mean": 0.9987624883651733, "reward_repeat_floor_std": 0.001740400679409504, "reward_near_duplicate_penalty_mean": 0.9917501211166382, "reward_near_duplicate_penalty_std": 0.011602719314396381, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4050000011920929, "reward_judge_quality_std": 0.3496120274066925, "reward_total_composite_mean": 0.30958878993988037, "reward_total_composite_std": 0.3038085699081421} {"timestamp_utc": "2026-04-12T17:37:20Z", "mode": "eval", "global_step": 450, "epoch": 0.023682964054523446, "eval_loss": NaN, "eval_runtime": 144.2077, "eval_samples_per_second": 0.721, "eval_steps_per_second": 0.09, "eval_num_tokens": 836594.0, "eval_completions/mean_length": 197.1153846153846, "eval_completions/min_length": 38.07692307692308, "eval_completions/max_length": 460.9230769230769, "eval_completions/clipped_ratio": 0.10576923076923077, "eval_completions/mean_terminated_length": 157.49954575758713, "eval_completions/min_terminated_length": 38.07692307692308, "eval_completions/max_terminated_length": 350.0, "eval_rewards/meter/mean": 0.6230765947928796, "eval_rewards/meter/std": 0.39679821867209214, "eval_rewards/count_adherence/mean": 0.8260979927503146, "eval_rewards/count_adherence/std": 0.1801939681172371, "eval_rewards/arabic_clean/mean": 0.8653846153846154, "eval_rewards/arabic_clean/std": 0.26383458421780515, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9951923076923077, "eval_rewards/arabic_floor/std": 0.013598207670908708, "eval_rewards/count_floor/mean": 0.9478294115800124, "eval_rewards/count_floor/std": 0.05405819014861034, "eval_rewards/lexical_plausibility/mean": 0.9509462805894705, "eval_rewards/lexical_plausibility/std": 0.09938178727260003, "eval_rewards/judge_quality/mean": 0.3041346153387657, "eval_rewards/judge_quality/std": 0.2317682011769368, "eval_rewards/repeat_penalty/mean": 0.4748371495650365, "eval_rewards/repeat_penalty/std": 0.4065972406130571, "eval_rewards/repeat_floor/mean": 0.9208995837431687, "eval_rewards/repeat_floor/std": 0.07328143744514538, "eval_rewards/near_duplicate_penalty/mean": 0.8090284558442923, "eval_rewards/near_duplicate_penalty/std": 0.19457622445546663, "eval_rewards/opening_diversity/mean": 0.844254732131958, "eval_rewards/opening_diversity/std": 0.22699065391833967, "eval_rewards/distinct_2/mean": 0.543222583257235, "eval_rewards/distinct_2/std": 0.40615633817819446, "eval_rewards/total_composite/mean": 0.17142489953682974, "eval_rewards/total_composite/std": 0.18232967589910215, "eval_reward": 0.17142489953682974, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.06136284969173945, "eval_sampling/sampling_logp_difference/max": 1.2111104818490834, "eval_sampling/importance_sampling_ratio/min": 0.3060183788721378, "eval_sampling/importance_sampling_ratio/mean": 1.0175598584688628, "eval_sampling/importance_sampling_ratio/max": 1.4855356491529024, "eval_entropy": 0.7185706358689529, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.17142489953682974, "eval_reward_meter_mean": 0.6230765947928796, "eval_reward_meter_std": 0.39679821867209214, "eval_reward_count_adherence_mean": 0.8260979927503146, "eval_reward_count_adherence_std": 0.1801939681172371, "eval_reward_arabic_clean_mean": 0.8653846153846154, "eval_reward_arabic_clean_std": 0.26383458421780515, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9951923076923077, "eval_reward_arabic_floor_std": 0.013598207670908708, "eval_reward_count_floor_mean": 0.9478294115800124, "eval_reward_count_floor_std": 0.05405819014861034, "eval_reward_lexical_plausibility_mean": 0.9509462805894705, "eval_reward_lexical_plausibility_std": 0.09938178727260003, "eval_reward_repeat_penalty_mean": 0.4748371495650365, "eval_reward_repeat_penalty_std": 0.4065972406130571, "eval_reward_repeat_floor_mean": 0.9208995837431687, "eval_reward_repeat_floor_std": 0.07328143744514538, "eval_reward_near_duplicate_penalty_mean": 0.8090284558442923, "eval_reward_near_duplicate_penalty_std": 0.19457622445546663, "eval_reward_opening_diversity_mean": 0.844254732131958, "eval_reward_opening_diversity_std": 0.22699065391833967, "eval_reward_distinct_2_mean": 0.543222583257235, "eval_reward_distinct_2_std": 0.40615633817819446, "eval_reward_judge_quality_mean": 0.3041346153387657, "eval_reward_judge_quality_std": 0.2317682011769368, "eval_reward_total_composite_mean": 0.17142489953682974, "eval_reward_total_composite_std": 0.18232967589910215} {"timestamp_utc": "2026-04-12T17:37:36Z", "mode": "train", "global_step": 451, "epoch": 0.023735592863533498, "loss": -0.114, "grad_norm": 3.049464225769043, "learning_rate": 8.636363636363637e-06, "num_tokens": 838342.0, "completions/mean_length": 180.5, "completions/min_length": 64.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 70.0, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.826685905456543, "rewards/meter/std": 0.34418532252311707, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.0707106739282608, "rewards/lexical_plausibility/mean": 0.878539502620697, "rewards/lexical_plausibility/std": 0.225218266248703, "rewards/judge_quality/mean": 0.2562499940395355, "rewards/judge_quality/std": 0.1898072361946106, "rewards/repeat_penalty/mean": 0.7675365209579468, "rewards/repeat_penalty/std": 0.32234644889831543, "rewards/repeat_floor/mean": 0.9557523131370544, "rewards/repeat_floor/std": 0.09061766415834427, "rewards/near_duplicate_penalty/mean": 0.8593931198120117, "rewards/near_duplicate_penalty/std": 0.3019898533821106, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.26726123690605164, "rewards/distinct_2/mean": 0.8260376453399658, "rewards/distinct_2/std": 0.3385562598705292, "rewards/total_composite/mean": 0.22023338079452515, "rewards/total_composite/std": 0.1806122362613678, "reward": 0.22023338079452515, "reward_std": 0.1806122213602066, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.154558002948761, "sampling/sampling_logp_difference/max": 1.3370943069458008, "sampling/importance_sampling_ratio/min": 0.2626076340675354, "sampling/importance_sampling_ratio/mean": 1.0516215562820435, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9712666273117065, "clip_ratio/low_mean": 0.011194029822945595, "clip_ratio/low_min": 0.011194029822945595, "clip_ratio/high_mean": 0.0904910359531641, "clip_ratio/high_max": 0.0904910359531641, "clip_ratio/region_mean": 0.1016850657761097, "reward_total_mean": 0.22023338079452515, "reward_meter_mean": 0.826685905456543, "reward_meter_std": 0.34418532252311707, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.0707106739282608, "reward_lexical_plausibility_mean": 0.878539502620697, "reward_lexical_plausibility_std": 0.225218266248703, "reward_repeat_penalty_mean": 0.7675365209579468, "reward_repeat_penalty_std": 0.32234644889831543, "reward_repeat_floor_mean": 0.9557523131370544, "reward_repeat_floor_std": 0.09061766415834427, "reward_near_duplicate_penalty_mean": 0.8593931198120117, "reward_near_duplicate_penalty_std": 0.3019898533821106, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.26726123690605164, "reward_distinct_2_mean": 0.8260376453399658, "reward_distinct_2_std": 0.3385562598705292, "reward_judge_quality_mean": 0.2562499940395355, "reward_judge_quality_std": 0.1898072361946106, "reward_total_composite_mean": 0.22023338079452515, "reward_total_composite_std": 0.1806122362613678} {"timestamp_utc": "2026-04-12T17:37:45Z", "mode": "train", "global_step": 452, "epoch": 0.02378822167254355, "loss": 0.0923, "grad_norm": 9.615572929382324, "learning_rate": 8.633333333333334e-06, "num_tokens": 840046.0, "completions/mean_length": 48.0, "completions/min_length": 41.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.0, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.9875295758247375, "rewards/meter/std": 0.005315815564244986, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.20701967179775238, "rewards/repeat_penalty/mean": 0.47380179166793823, "rewards/repeat_penalty/std": 0.3864913880825043, "rewards/repeat_floor/mean": 0.9287439584732056, "rewards/repeat_floor/std": 0.0697137787938118, "rewards/near_duplicate_penalty/mean": 0.831121563911438, "rewards/near_duplicate_penalty/std": 0.19502177834510803, "rewards/opening_diversity/mean": 0.606249988079071, "rewards/opening_diversity/std": 0.27894893288612366, "rewards/distinct_2/mean": 0.7522299289703369, "rewards/distinct_2/std": 0.30790141224861145, "rewards/total_composite/mean": 0.41843971610069275, "rewards/total_composite/std": 0.21579229831695557, "reward": 0.41843971610069275, "reward_std": 0.21579229831695557, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1466285139322281, "sampling/sampling_logp_difference/max": 1.9377379417419434, "sampling/importance_sampling_ratio/min": 0.1440293788909912, "sampling/importance_sampling_ratio/mean": 1.0440196990966797, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2133660018444061, "clip_ratio/low_mean": 0.07121916394680738, "clip_ratio/low_min": 0.07121916394680738, "clip_ratio/high_mean": 0.05051717162132263, "clip_ratio/high_max": 0.05051717162132263, "clip_ratio/region_mean": 0.12173633556813002, "reward_total_mean": 0.41843971610069275, "reward_meter_mean": 0.9875295758247375, "reward_meter_std": 0.005315815564244986, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.47380179166793823, "reward_repeat_penalty_std": 0.3864913880825043, "reward_repeat_floor_mean": 0.9287439584732056, "reward_repeat_floor_std": 0.0697137787938118, "reward_near_duplicate_penalty_mean": 0.831121563911438, "reward_near_duplicate_penalty_std": 0.19502177834510803, "reward_opening_diversity_mean": 0.606249988079071, "reward_opening_diversity_std": 0.27894893288612366, "reward_distinct_2_mean": 0.7522299289703369, "reward_distinct_2_std": 0.30790141224861145, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.20701967179775238, "reward_total_composite_mean": 0.41843971610069275, "reward_total_composite_std": 0.21579229831695557} {"timestamp_utc": "2026-04-12T17:37:54Z", "mode": "train", "global_step": 453, "epoch": 0.023840850481553603, "loss": -0.0161, "grad_norm": 24.25897789001465, "learning_rate": 8.630303030303032e-06, "num_tokens": 841440.0, "completions/mean_length": 18.25, "completions/min_length": 16.0, "completions/max_length": 20.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.25, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 20.0, "rewards/meter/mean": 0.8243906497955322, "rewards/meter/std": 0.30794912576675415, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.8100000023841858, "rewards/judge_quality/std": 0.22258225083351135, "rewards/repeat_penalty/mean": 0.7126040458679199, "rewards/repeat_penalty/std": 0.07829498499631882, "rewards/repeat_floor/mean": 0.9775208234786987, "rewards/repeat_floor/std": 0.01565900444984436, "rewards/near_duplicate_penalty/mean": 0.9501386880874634, "rewards/near_duplicate_penalty/std": 0.10439330339431763, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6381657719612122, "rewards/total_composite/std": 0.2966378331184387, "reward": 0.6381657719612122, "reward_std": 0.29663780331611633, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16541826725006104, "sampling/sampling_logp_difference/max": 1.881052017211914, "sampling/importance_sampling_ratio/min": 0.15242967009544373, "sampling/importance_sampling_ratio/mean": 0.9908430576324463, "sampling/importance_sampling_ratio/max": 1.7325114011764526, "entropy": 0.9089064821600914, "clip_ratio/low_mean": 0.04739583469927311, "clip_ratio/low_min": 0.04739583469927311, "clip_ratio/high_mean": 0.06712461402639747, "clip_ratio/high_max": 0.06712461402639747, "clip_ratio/region_mean": 0.11452044872567058, "reward_total_mean": 0.6381657719612122, "reward_meter_mean": 0.8243906497955322, "reward_meter_std": 0.30794912576675415, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.7126040458679199, "reward_repeat_penalty_std": 0.07829498499631882, "reward_repeat_floor_mean": 0.9775208234786987, "reward_repeat_floor_std": 0.01565900444984436, "reward_near_duplicate_penalty_mean": 0.9501386880874634, "reward_near_duplicate_penalty_std": 0.10439330339431763, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8100000023841858, "reward_judge_quality_std": 0.22258225083351135, "reward_total_composite_mean": 0.6381657719612122, "reward_total_composite_std": 0.2966378331184387} {"timestamp_utc": "2026-04-12T17:38:08Z", "mode": "train", "global_step": 454, "epoch": 0.023893479290563655, "loss": -0.0483, "grad_norm": 3.276338577270508, "learning_rate": 8.627272727272727e-06, "num_tokens": 842988.0, "completions/mean_length": 161.5, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 44.66666793823242, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.6458823680877686, "rewards/meter/std": 0.3947608172893524, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.8737679719924927, "rewards/lexical_plausibility/std": 0.22537542879581451, "rewards/judge_quality/mean": 0.21249999105930328, "rewards/judge_quality/std": 0.1505940556526184, "rewards/repeat_penalty/mean": 0.7688586115837097, "rewards/repeat_penalty/std": 0.26979172229766846, "rewards/repeat_floor/mean": 0.9733320474624634, "rewards/repeat_floor/std": 0.03325796499848366, "rewards/near_duplicate_penalty/mean": 0.9072303771972656, "rewards/near_duplicate_penalty/std": 0.11587676405906677, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9208055734634399, "rewards/distinct_2/std": 0.12130971252918243, "rewards/total_composite/mean": 0.12177006155252457, "rewards/total_composite/std": 0.1357794851064682, "reward": 0.12177006155252457, "reward_std": 0.135779470205307, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15307927131652832, "sampling/sampling_logp_difference/max": 1.7402987480163574, "sampling/importance_sampling_ratio/min": 0.17546798288822174, "sampling/importance_sampling_ratio/mean": 1.0444526672363281, "sampling/importance_sampling_ratio/max": 1.9058141708374023, "entropy": 1.0386455580592155, "clip_ratio/low_mean": 0.01711956551298499, "clip_ratio/low_min": 0.01711956551298499, "clip_ratio/high_mean": 0.09181072749197483, "clip_ratio/high_max": 0.09181072749197483, "clip_ratio/region_mean": 0.10893029300495982, "reward_total_mean": 0.12177006155252457, "reward_meter_mean": 0.6458823680877686, "reward_meter_std": 0.3947608172893524, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.8737679719924927, "reward_lexical_plausibility_std": 0.22537542879581451, "reward_repeat_penalty_mean": 0.7688586115837097, "reward_repeat_penalty_std": 0.26979172229766846, "reward_repeat_floor_mean": 0.9733320474624634, "reward_repeat_floor_std": 0.03325796499848366, "reward_near_duplicate_penalty_mean": 0.9072303771972656, "reward_near_duplicate_penalty_std": 0.11587676405906677, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9208055734634399, "reward_distinct_2_std": 0.12130971252918243, "reward_judge_quality_mean": 0.21249999105930328, "reward_judge_quality_std": 0.1505940556526184, "reward_total_composite_mean": 0.12177006155252457, "reward_total_composite_std": 0.1357794851064682} {"timestamp_utc": "2026-04-12T17:38:17Z", "mode": "train", "global_step": 455, "epoch": 0.023946108099573708, "loss": -0.0052, "grad_norm": 11.381220817565918, "learning_rate": 8.624242424242424e-06, "num_tokens": 844774.0, "completions/mean_length": 52.25, "completions/min_length": 44.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.25, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.7359862327575684, "rewards/meter/std": 0.35290268063545227, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.5788249969482422, "rewards/repeat_penalty/std": 0.28753340244293213, "rewards/repeat_floor/mean": 0.9511308073997498, "rewards/repeat_floor/std": 0.03518301993608475, "rewards/near_duplicate_penalty/mean": 0.8481342196464539, "rewards/near_duplicate_penalty/std": 0.10036998987197876, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.7309515476226807, "rewards/distinct_2/std": 0.2138870507478714, "rewards/total_composite/mean": 0.18463751673698425, "rewards/total_composite/std": 0.12065467983484268, "reward": 0.18463751673698425, "reward_std": 0.12065467238426208, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15961751341819763, "sampling/sampling_logp_difference/max": 1.2055935859680176, "sampling/importance_sampling_ratio/min": 0.29951414465904236, "sampling/importance_sampling_ratio/mean": 1.007577657699585, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3414967358112335, "clip_ratio/low_mean": 0.08063552435487509, "clip_ratio/low_min": 0.08063552435487509, "clip_ratio/high_mean": 0.050244271755218506, "clip_ratio/high_max": 0.050244271755218506, "clip_ratio/region_mean": 0.1308797961100936, "reward_total_mean": 0.18463751673698425, "reward_meter_mean": 0.7359862327575684, "reward_meter_std": 0.35290268063545227, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5788249969482422, "reward_repeat_penalty_std": 0.28753340244293213, "reward_repeat_floor_mean": 0.9511308073997498, "reward_repeat_floor_std": 0.03518301993608475, "reward_near_duplicate_penalty_mean": 0.8481342196464539, "reward_near_duplicate_penalty_std": 0.10036998987197876, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.7309515476226807, "reward_distinct_2_std": 0.2138870507478714, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.18463751673698425, "reward_total_composite_std": 0.12065467983484268} {"timestamp_utc": "2026-04-12T17:38:30Z", "mode": "train", "global_step": 456, "epoch": 0.02399873690858376, "loss": -0.0678, "grad_norm": 7.083357810974121, "learning_rate": 8.621212121212122e-06, "num_tokens": 846441.0, "completions/mean_length": 103.375, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 45.000003814697266, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.37655889987945557, "rewards/meter/std": 0.3353674113750458, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9286011457443237, "rewards/lexical_plausibility/std": 0.20194637775421143, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.26692694425582886, "rewards/repeat_penalty/mean": 0.755588173866272, "rewards/repeat_penalty/std": 0.336740642786026, "rewards/repeat_floor/mean": 0.9539693593978882, "rewards/repeat_floor/std": 0.09076379239559174, "rewards/near_duplicate_penalty/mean": 0.8471053838729858, "rewards/near_duplicate_penalty/std": 0.3191220164299011, "rewards/opening_diversity/mean": 0.890625, "rewards/opening_diversity/std": 0.2259652018547058, "rewards/distinct_2/mean": 0.8162891268730164, "rewards/distinct_2/std": 0.34389954805374146, "rewards/total_composite/mean": 0.13373219966888428, "rewards/total_composite/std": 0.11370719969272614, "reward": 0.13373219966888428, "reward_std": 0.11370719969272614, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16646528244018555, "sampling/sampling_logp_difference/max": 2.7328405380249023, "sampling/importance_sampling_ratio/min": 0.06503429263830185, "sampling/importance_sampling_ratio/mean": 1.0426028966903687, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9241776242852211, "clip_ratio/low_mean": 0.05442966986447573, "clip_ratio/low_min": 0.05442966986447573, "clip_ratio/high_mean": 0.040013296995311975, "clip_ratio/high_max": 0.040013296995311975, "clip_ratio/region_mean": 0.0944429668597877, "reward_total_mean": 0.13373219966888428, "reward_meter_mean": 0.37655889987945557, "reward_meter_std": 0.3353674113750458, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9286011457443237, "reward_lexical_plausibility_std": 0.20194637775421143, "reward_repeat_penalty_mean": 0.755588173866272, "reward_repeat_penalty_std": 0.336740642786026, "reward_repeat_floor_mean": 0.9539693593978882, "reward_repeat_floor_std": 0.09076379239559174, "reward_near_duplicate_penalty_mean": 0.8471053838729858, "reward_near_duplicate_penalty_std": 0.3191220164299011, "reward_opening_diversity_mean": 0.890625, "reward_opening_diversity_std": 0.2259652018547058, "reward_distinct_2_mean": 0.8162891268730164, "reward_distinct_2_std": 0.34389954805374146, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.26692694425582886, "reward_total_composite_mean": 0.13373219966888428, "reward_total_composite_std": 0.11370719969272614} {"timestamp_utc": "2026-04-12T17:38:39Z", "mode": "train", "global_step": 457, "epoch": 0.024051365717593812, "loss": 0.1114, "grad_norm": 16.963098526000977, "learning_rate": 8.618181818181819e-06, "num_tokens": 848264.0, "completions/mean_length": 50.875, "completions/min_length": 41.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.875, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.45969995856285095, "rewards/meter/std": 0.3252045512199402, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.21999594569206238, "rewards/repeat_penalty/mean": 0.9448733329772949, "rewards/repeat_penalty/std": 0.06891842931509018, "rewards/repeat_floor/mean": 0.9932032823562622, "rewards/repeat_floor/std": 0.007673040963709354, "rewards/near_duplicate_penalty/mean": 0.9714715480804443, "rewards/near_duplicate_penalty/std": 0.026079701259732246, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9720279574394226, "rewards/distinct_2/std": 0.05644134432077408, "rewards/total_composite/mean": 0.21489249169826508, "rewards/total_composite/std": 0.20255127549171448, "reward": 0.21489249169826508, "reward_std": 0.20255127549171448, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20060986280441284, "sampling/sampling_logp_difference/max": 1.8694686889648438, "sampling/importance_sampling_ratio/min": 0.1542055755853653, "sampling/importance_sampling_ratio/mean": 1.000983476638794, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2276152670383453, "clip_ratio/low_mean": 0.07881452236324549, "clip_ratio/low_min": 0.07881452236324549, "clip_ratio/high_mean": 0.07786296680569649, "clip_ratio/high_max": 0.07786296680569649, "clip_ratio/region_mean": 0.15667748916894197, "reward_total_mean": 0.21489249169826508, "reward_meter_mean": 0.45969995856285095, "reward_meter_std": 0.3252045512199402, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9448733329772949, "reward_repeat_penalty_std": 0.06891842931509018, "reward_repeat_floor_mean": 0.9932032823562622, "reward_repeat_floor_std": 0.007673040963709354, "reward_near_duplicate_penalty_mean": 0.9714715480804443, "reward_near_duplicate_penalty_std": 0.026079701259732246, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9720279574394226, "reward_distinct_2_std": 0.05644134432077408, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.21999594569206238, "reward_total_composite_mean": 0.21489249169826508, "reward_total_composite_std": 0.20255127549171448} {"timestamp_utc": "2026-04-12T17:38:48Z", "mode": "train", "global_step": 458, "epoch": 0.02410399452660386, "loss": -0.0439, "grad_norm": 13.403787612915039, "learning_rate": 8.615151515151516e-06, "num_tokens": 849850.0, "completions/mean_length": 43.25, "completions/min_length": 37.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.25, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.9791386127471924, "rewards/meter/std": 0.019205288961529732, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.24032345414161682, "rewards/repeat_penalty/mean": 0.8572620153427124, "rewards/repeat_penalty/std": 0.14656752347946167, "rewards/repeat_floor/mean": 0.9833243489265442, "rewards/repeat_floor/std": 0.016158923506736755, "rewards/near_duplicate_penalty/mean": 0.9427228569984436, "rewards/near_duplicate_penalty/std": 0.048306528478860855, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9310103058815002, "rewards/distinct_2/std": 0.07339107990264893, "rewards/total_composite/mean": 0.402590274810791, "rewards/total_composite/std": 0.2356213629245758, "reward": 0.402590274810791, "reward_std": 0.2356213480234146, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14252756536006927, "sampling/sampling_logp_difference/max": 1.5148115158081055, "sampling/importance_sampling_ratio/min": 0.2198496162891388, "sampling/importance_sampling_ratio/mean": 1.0008864402770996, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0320435538887978, "clip_ratio/low_mean": 0.04681248031556606, "clip_ratio/low_min": 0.04681248031556606, "clip_ratio/high_mean": 0.07551885256543756, "clip_ratio/high_max": 0.07551885256543756, "clip_ratio/region_mean": 0.12233133288100362, "reward_total_mean": 0.402590274810791, "reward_meter_mean": 0.9791386127471924, "reward_meter_std": 0.019205288961529732, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8572620153427124, "reward_repeat_penalty_std": 0.14656752347946167, "reward_repeat_floor_mean": 0.9833243489265442, "reward_repeat_floor_std": 0.016158923506736755, "reward_near_duplicate_penalty_mean": 0.9427228569984436, "reward_near_duplicate_penalty_std": 0.048306528478860855, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9310103058815002, "reward_distinct_2_std": 0.07339107990264893, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.24032345414161682, "reward_total_composite_mean": 0.402590274810791, "reward_total_composite_std": 0.2356213629245758} {"timestamp_utc": "2026-04-12T17:38:59Z", "mode": "train", "global_step": 459, "epoch": 0.024156623335613914, "loss": 0.0458, "grad_norm": 4.057854175567627, "learning_rate": 8.612121212121213e-06, "num_tokens": 853245.0, "completions/mean_length": 220.375, "completions/min_length": 196.0, "completions/max_length": 253.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 220.375, "completions/min_terminated_length": 196.0, "completions/max_terminated_length": 253.0, "rewards/meter/mean": 0.9919022917747498, "rewards/meter/std": 0.0029621252324432135, "rewards/count_adherence/mean": 0.7142857313156128, "rewards/count_adherence/std": 0.07636035233736038, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9142856597900391, "rewards/count_floor/std": 0.022908104583621025, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.003524602623656392, "rewards/repeat_penalty/std": 0.00656402762979269, "rewards/repeat_floor/mean": 0.8029244542121887, "rewards/repeat_floor/std": 0.030130090191960335, "rewards/near_duplicate_penalty/mean": 0.5114600658416748, "rewards/near_duplicate_penalty/std": 0.10638757795095444, "rewards/opening_diversity/mean": 0.4069216251373291, "rewards/opening_diversity/std": 0.2500130832195282, "rewards/distinct_2/mean": 0.019890649244189262, "rewards/distinct_2/std": 0.03774602338671684, "rewards/total_composite/mean": 0.12793518602848053, "rewards/total_composite/std": 0.054545022547245026, "reward": 0.12793518602848053, "reward_std": 0.05454501882195473, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.06892064213752747, "sampling/sampling_logp_difference/max": 1.9090232849121094, "sampling/importance_sampling_ratio/min": 0.1482250988483429, "sampling/importance_sampling_ratio/mean": 1.0110036134719849, "sampling/importance_sampling_ratio/max": 1.9041608572006226, "entropy": 0.5043975673615932, "clip_ratio/low_mean": 0.04216759325936437, "clip_ratio/low_min": 0.04216759325936437, "clip_ratio/high_mean": 0.006840796209871769, "clip_ratio/high_max": 0.006840796209871769, "clip_ratio/region_mean": 0.049008389469236135, "reward_total_mean": 0.12793518602848053, "reward_meter_mean": 0.9919022917747498, "reward_meter_std": 0.0029621252324432135, "reward_count_adherence_mean": 0.7142857313156128, "reward_count_adherence_std": 0.07636035233736038, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9142856597900391, "reward_count_floor_std": 0.022908104583621025, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.003524602623656392, "reward_repeat_penalty_std": 0.00656402762979269, "reward_repeat_floor_mean": 0.8029244542121887, "reward_repeat_floor_std": 0.030130090191960335, "reward_near_duplicate_penalty_mean": 0.5114600658416748, "reward_near_duplicate_penalty_std": 0.10638757795095444, "reward_opening_diversity_mean": 0.4069216251373291, "reward_opening_diversity_std": 0.2500130832195282, "reward_distinct_2_mean": 0.019890649244189262, "reward_distinct_2_std": 0.03774602338671684, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.12793518602848053, "reward_total_composite_std": 0.054545022547245026} {"timestamp_utc": "2026-04-12T17:39:08Z", "mode": "train", "global_step": 460, "epoch": 0.024209252144623966, "loss": -0.0389, "grad_norm": 9.394753456115723, "learning_rate": 8.60909090909091e-06, "num_tokens": 855270.0, "completions/mean_length": 69.125, "completions/min_length": 41.0, "completions/max_length": 82.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 69.125, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.9830876588821411, "rewards/meter/std": 0.0073325373232364655, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.6307567954063416, "rewards/repeat_penalty/std": 0.290141224861145, "rewards/repeat_floor/mean": 0.9599894285202026, "rewards/repeat_floor/std": 0.0397547222673893, "rewards/near_duplicate_penalty/mean": 0.8877747058868408, "rewards/near_duplicate_penalty/std": 0.10667216032743454, "rewards/opening_diversity/mean": 0.949999988079071, "rewards/opening_diversity/std": 0.1414213478565216, "rewards/distinct_2/mean": 0.7758134603500366, "rewards/distinct_2/std": 0.18687871098518372, "rewards/total_composite/mean": 0.3974243998527527, "rewards/total_composite/std": 0.138163223862648, "reward": 0.3974243998527527, "reward_std": 0.138163223862648, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13478593528270721, "sampling/sampling_logp_difference/max": 1.2511844635009766, "sampling/importance_sampling_ratio/min": 0.28616565465927124, "sampling/importance_sampling_ratio/mean": 1.0205570459365845, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1178451552987099, "clip_ratio/low_mean": 0.029906955547630787, "clip_ratio/low_min": 0.029906955547630787, "clip_ratio/high_mean": 0.11511932034045458, "clip_ratio/high_max": 0.11511932034045458, "clip_ratio/region_mean": 0.14502627588808537, "reward_total_mean": 0.3974243998527527, "reward_meter_mean": 0.9830876588821411, "reward_meter_std": 0.0073325373232364655, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.6307567954063416, "reward_repeat_penalty_std": 0.290141224861145, "reward_repeat_floor_mean": 0.9599894285202026, "reward_repeat_floor_std": 0.0397547222673893, "reward_near_duplicate_penalty_mean": 0.8877747058868408, "reward_near_duplicate_penalty_std": 0.10667216032743454, "reward_opening_diversity_mean": 0.949999988079071, "reward_opening_diversity_std": 0.1414213478565216, "reward_distinct_2_mean": 0.7758134603500366, "reward_distinct_2_std": 0.18687871098518372, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.3974243998527527, "reward_total_composite_std": 0.138163223862648} {"timestamp_utc": "2026-04-12T17:39:17Z", "mode": "train", "global_step": 461, "epoch": 0.02426188095363402, "loss": -0.0315, "grad_norm": 15.864015579223633, "learning_rate": 8.606060606060606e-06, "num_tokens": 856881.0, "completions/mean_length": 45.375, "completions/min_length": 40.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.375, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.9021110534667969, "rewards/meter/std": 0.22328464686870575, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.2173829823732376, "rewards/repeat_penalty/mean": 0.992229700088501, "rewards/repeat_penalty/std": 0.015372724272310734, "rewards/repeat_floor/mean": 0.998834490776062, "rewards/repeat_floor/std": 0.0023059083614498377, "rewards/near_duplicate_penalty/mean": 0.992229700088501, "rewards/near_duplicate_penalty/std": 0.015372724272310734, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4254631996154785, "rewards/total_composite/std": 0.23813623189926147, "reward": 0.4254631996154785, "reward_std": 0.23813621699810028, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1576824188232422, "sampling/sampling_logp_difference/max": 1.5359315872192383, "sampling/importance_sampling_ratio/min": 0.21525508165359497, "sampling/importance_sampling_ratio/mean": 1.0277284383773804, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.243036836385727, "clip_ratio/low_mean": 0.05429601017385721, "clip_ratio/low_min": 0.05429601017385721, "clip_ratio/high_mean": 0.11604143399745226, "clip_ratio/high_max": 0.11604143399745226, "clip_ratio/region_mean": 0.17033744417130947, "reward_total_mean": 0.4254631996154785, "reward_meter_mean": 0.9021110534667969, "reward_meter_std": 0.22328464686870575, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.992229700088501, "reward_repeat_penalty_std": 0.015372724272310734, "reward_repeat_floor_mean": 0.998834490776062, "reward_repeat_floor_std": 0.0023059083614498377, "reward_near_duplicate_penalty_mean": 0.992229700088501, "reward_near_duplicate_penalty_std": 0.015372724272310734, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.2173829823732376, "reward_total_composite_mean": 0.4254631996154785, "reward_total_composite_std": 0.23813623189926147} {"timestamp_utc": "2026-04-12T17:39:27Z", "mode": "train", "global_step": 462, "epoch": 0.02431450976264407, "loss": 0.0783, "grad_norm": 13.244956016540527, "learning_rate": 8.603030303030303e-06, "num_tokens": 858544.0, "completions/mean_length": 42.875, "completions/min_length": 39.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.875, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.661554217338562, "rewards/meter/std": 0.45109081268310547, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.2558424770832062, "rewards/repeat_penalty/mean": 0.9347594976425171, "rewards/repeat_penalty/std": 0.05908624082803726, "rewards/repeat_floor/mean": 0.9911521673202515, "rewards/repeat_floor/std": 0.008226786740124226, "rewards/near_duplicate_penalty/mean": 0.9515254497528076, "rewards/near_duplicate_penalty/std": 0.052539508789777756, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9824812412261963, "rewards/distinct_2/std": 0.03248300403356552, "rewards/total_composite/mean": 0.40324968099594116, "rewards/total_composite/std": 0.3470838665962219, "reward": 0.40324968099594116, "reward_std": 0.3470838665962219, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1557810753583908, "sampling/sampling_logp_difference/max": 1.781308889389038, "sampling/importance_sampling_ratio/min": 0.1684175729751587, "sampling/importance_sampling_ratio/mean": 1.0169174671173096, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1622472777962685, "clip_ratio/low_mean": 0.07083333376795053, "clip_ratio/low_min": 0.07083333376795053, "clip_ratio/high_mean": 0.07205445971339941, "clip_ratio/high_max": 0.07205445971339941, "clip_ratio/region_mean": 0.14288779348134995, "reward_total_mean": 0.40324968099594116, "reward_meter_mean": 0.661554217338562, "reward_meter_std": 0.45109081268310547, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9347594976425171, "reward_repeat_penalty_std": 0.05908624082803726, "reward_repeat_floor_mean": 0.9911521673202515, "reward_repeat_floor_std": 0.008226786740124226, "reward_near_duplicate_penalty_mean": 0.9515254497528076, "reward_near_duplicate_penalty_std": 0.052539508789777756, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9824812412261963, "reward_distinct_2_std": 0.03248300403356552, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.2558424770832062, "reward_total_composite_mean": 0.40324968099594116, "reward_total_composite_std": 0.3470838665962219} {"timestamp_utc": "2026-04-12T17:39:37Z", "mode": "train", "global_step": 463, "epoch": 0.024367138571654123, "loss": -0.0065, "grad_norm": 16.66472625732422, "learning_rate": 8.6e-06, "num_tokens": 860257.0, "completions/mean_length": 41.125, "completions/min_length": 32.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.125, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.8129892349243164, "rewards/meter/std": 0.21980492770671844, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.24136146903038025, "rewards/repeat_penalty/mean": 0.6516164541244507, "rewards/repeat_penalty/std": 0.29724743962287903, "rewards/repeat_floor/mean": 0.9582736492156982, "rewards/repeat_floor/std": 0.03881257027387619, "rewards/near_duplicate_penalty/mean": 0.8899881839752197, "rewards/near_duplicate_penalty/std": 0.09444312751293182, "rewards/opening_diversity/mean": 0.809374988079071, "rewards/opening_diversity/std": 0.23449699580669403, "rewards/distinct_2/mean": 0.8468108177185059, "rewards/distinct_2/std": 0.14745701849460602, "rewards/total_composite/mean": 0.2842075228691101, "rewards/total_composite/std": 0.1423080712556839, "reward": 0.2842075228691101, "reward_std": 0.1423080712556839, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15802541375160217, "sampling/sampling_logp_difference/max": 1.492415428161621, "sampling/importance_sampling_ratio/min": 0.22482894361019135, "sampling/importance_sampling_ratio/mean": 1.012261986732483, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2356071174144745, "clip_ratio/low_mean": 0.07391707878559828, "clip_ratio/low_min": 0.07391707878559828, "clip_ratio/high_mean": 0.07254288718104362, "clip_ratio/high_max": 0.07254288718104362, "clip_ratio/region_mean": 0.1464599659666419, "reward_total_mean": 0.2842075228691101, "reward_meter_mean": 0.8129892349243164, "reward_meter_std": 0.21980492770671844, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6516164541244507, "reward_repeat_penalty_std": 0.29724743962287903, "reward_repeat_floor_mean": 0.9582736492156982, "reward_repeat_floor_std": 0.03881257027387619, "reward_near_duplicate_penalty_mean": 0.8899881839752197, "reward_near_duplicate_penalty_std": 0.09444312751293182, "reward_opening_diversity_mean": 0.809374988079071, "reward_opening_diversity_std": 0.23449699580669403, "reward_distinct_2_mean": 0.8468108177185059, "reward_distinct_2_std": 0.14745701849460602, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.24136146903038025, "reward_total_composite_mean": 0.2842075228691101, "reward_total_composite_std": 0.1423080712556839} {"timestamp_utc": "2026-04-12T17:39:45Z", "mode": "train", "global_step": 464, "epoch": 0.024419767380664176, "loss": 0.1111, "grad_norm": 20.328224182128906, "learning_rate": 8.596969696969698e-06, "num_tokens": 861760.0, "completions/mean_length": 35.875, "completions/min_length": 31.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.875, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.6358775496482849, "rewards/meter/std": 0.4272748827934265, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45374998450279236, "rewards/judge_quality/std": 0.20170257985591888, "rewards/repeat_penalty/mean": 0.8019654750823975, "rewards/repeat_penalty/std": 0.2824261486530304, "rewards/repeat_floor/mean": 0.9779501557350159, "rewards/repeat_floor/std": 0.030076604336500168, "rewards/near_duplicate_penalty/mean": 0.9389964938163757, "rewards/near_duplicate_penalty/std": 0.06664886325597763, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8983410000801086, "rewards/distinct_2/std": 0.15062162280082703, "rewards/total_composite/mean": 0.26632142066955566, "rewards/total_composite/std": 0.17347563803195953, "reward": 0.26632142066955566, "reward_std": 0.17347563803195953, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18181434273719788, "sampling/sampling_logp_difference/max": 1.780573844909668, "sampling/importance_sampling_ratio/min": 0.16854140162467957, "sampling/importance_sampling_ratio/mean": 1.0317375659942627, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3245523124933243, "clip_ratio/low_mean": 0.049052730202674866, "clip_ratio/low_min": 0.049052730202674866, "clip_ratio/high_mean": 0.10146208759397268, "clip_ratio/high_max": 0.10146208759397268, "clip_ratio/region_mean": 0.15051481779664755, "reward_total_mean": 0.26632142066955566, "reward_meter_mean": 0.6358775496482849, "reward_meter_std": 0.4272748827934265, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8019654750823975, "reward_repeat_penalty_std": 0.2824261486530304, "reward_repeat_floor_mean": 0.9779501557350159, "reward_repeat_floor_std": 0.030076604336500168, "reward_near_duplicate_penalty_mean": 0.9389964938163757, "reward_near_duplicate_penalty_std": 0.06664886325597763, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8983410000801086, "reward_distinct_2_std": 0.15062162280082703, "reward_judge_quality_mean": 0.45374998450279236, "reward_judge_quality_std": 0.20170257985591888, "reward_total_composite_mean": 0.26632142066955566, "reward_total_composite_std": 0.17347563803195953} {"timestamp_utc": "2026-04-12T17:39:54Z", "mode": "train", "global_step": 465, "epoch": 0.024472396189674228, "loss": -0.0292, "grad_norm": 12.978865623474121, "learning_rate": 8.593939393939395e-06, "num_tokens": 863731.0, "completions/mean_length": 63.375, "completions/min_length": 56.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.375, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.8288000226020813, "rewards/meter/std": 0.3157835006713867, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9752435088157654, "rewards/lexical_plausibility/std": 0.046044979244470596, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.2828427255153656, "rewards/repeat_penalty/mean": 0.26078465580940247, "rewards/repeat_penalty/std": 0.253579705953598, "rewards/repeat_floor/mean": 0.885047197341919, "rewards/repeat_floor/std": 0.0638018250465393, "rewards/near_duplicate_penalty/mean": 0.7032175660133362, "rewards/near_duplicate_penalty/std": 0.17859706282615662, "rewards/opening_diversity/mean": 0.65625, "rewards/opening_diversity/std": 0.32561755180358887, "rewards/distinct_2/mean": 0.4465510845184326, "rewards/distinct_2/std": 0.22540301084518433, "rewards/total_composite/mean": 0.20578667521476746, "rewards/total_composite/std": 0.28532278537750244, "reward": 0.20578667521476746, "reward_std": 0.28532278537750244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11823023110628128, "sampling/sampling_logp_difference/max": 2.05720853805542, "sampling/importance_sampling_ratio/min": 0.1278102546930313, "sampling/importance_sampling_ratio/mean": 1.0175706148147583, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9275213107466698, "clip_ratio/low_mean": 0.08856649976223707, "clip_ratio/low_min": 0.08856649976223707, "clip_ratio/high_mean": 0.01584506966173649, "clip_ratio/high_max": 0.01584506966173649, "clip_ratio/region_mean": 0.10441156942397356, "reward_total_mean": 0.20578667521476746, "reward_meter_mean": 0.8288000226020813, "reward_meter_std": 0.3157835006713867, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9752435088157654, "reward_lexical_plausibility_std": 0.046044979244470596, "reward_repeat_penalty_mean": 0.26078465580940247, "reward_repeat_penalty_std": 0.253579705953598, "reward_repeat_floor_mean": 0.885047197341919, "reward_repeat_floor_std": 0.0638018250465393, "reward_near_duplicate_penalty_mean": 0.7032175660133362, "reward_near_duplicate_penalty_std": 0.17859706282615662, "reward_opening_diversity_mean": 0.65625, "reward_opening_diversity_std": 0.32561755180358887, "reward_distinct_2_mean": 0.4465510845184326, "reward_distinct_2_std": 0.22540301084518433, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.2828427255153656, "reward_total_composite_mean": 0.20578667521476746, "reward_total_composite_std": 0.28532278537750244} {"timestamp_utc": "2026-04-12T17:40:03Z", "mode": "train", "global_step": 466, "epoch": 0.02452502499868428, "loss": 0.0338, "grad_norm": 12.60587215423584, "learning_rate": 8.590909090909092e-06, "num_tokens": 865465.0, "completions/mean_length": 47.75, "completions/min_length": 43.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.75, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.846108615398407, "rewards/meter/std": 0.24170660972595215, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.5401484370231628, "rewards/repeat_penalty/std": 0.40161025524139404, "rewards/repeat_floor/mean": 0.9349104762077332, "rewards/repeat_floor/std": 0.05784101411700249, "rewards/near_duplicate_penalty/mean": 0.8248052597045898, "rewards/near_duplicate_penalty/std": 0.1349523812532425, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.2734534442424774, "rewards/distinct_2/mean": 0.7146074771881104, "rewards/distinct_2/std": 0.2804373800754547, "rewards/total_composite/mean": 0.2843344211578369, "rewards/total_composite/std": 0.1477406769990921, "reward": 0.2843344211578369, "reward_std": 0.1477406919002533, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15633729100227356, "sampling/sampling_logp_difference/max": 1.929990291595459, "sampling/importance_sampling_ratio/min": 0.1451496034860611, "sampling/importance_sampling_ratio/mean": 1.035498023033142, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.195248268544674, "clip_ratio/low_mean": 0.040937500074505806, "clip_ratio/low_min": 0.040937500074505806, "clip_ratio/high_mean": 0.09840234834700823, "clip_ratio/high_max": 0.09840234834700823, "clip_ratio/region_mean": 0.13933984842151403, "reward_total_mean": 0.2843344211578369, "reward_meter_mean": 0.846108615398407, "reward_meter_std": 0.24170660972595215, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5401484370231628, "reward_repeat_penalty_std": 0.40161025524139404, "reward_repeat_floor_mean": 0.9349104762077332, "reward_repeat_floor_std": 0.05784101411700249, "reward_near_duplicate_penalty_mean": 0.8248052597045898, "reward_near_duplicate_penalty_std": 0.1349523812532425, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.2734534442424774, "reward_distinct_2_mean": 0.7146074771881104, "reward_distinct_2_std": 0.2804373800754547, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.2843344211578369, "reward_total_composite_std": 0.1477406769990921} {"timestamp_utc": "2026-04-12T17:40:17Z", "mode": "train", "global_step": 467, "epoch": 0.024577653807694333, "loss": -0.0011, "grad_norm": 5.124169826507568, "learning_rate": 8.587878787878788e-06, "num_tokens": 867576.0, "completions/mean_length": 141.875, "completions/min_length": 78.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 89.00000762939453, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.7691898345947266, "rewards/meter/std": 0.37946081161499023, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.2651650309562683, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.971875011920929, "rewards/count_floor/std": 0.07954952120780945, "rewards/lexical_plausibility/mean": 0.9341220259666443, "rewards/lexical_plausibility/std": 0.1792246401309967, "rewards/judge_quality/mean": 0.3162499964237213, "rewards/judge_quality/std": 0.2650572657585144, "rewards/repeat_penalty/mean": 0.7145575881004333, "rewards/repeat_penalty/std": 0.29141151905059814, "rewards/repeat_floor/mean": 0.9686734676361084, "rewards/repeat_floor/std": 0.03696190565824509, "rewards/near_duplicate_penalty/mean": 0.9290385246276855, "rewards/near_duplicate_penalty/std": 0.08091890811920166, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.18600596487522125, "rewards/distinct_2/mean": 0.8326969146728516, "rewards/distinct_2/std": 0.24042244255542755, "rewards/total_composite/mean": 0.22213882207870483, "rewards/total_composite/std": 0.27385786175727844, "reward": 0.22213882207870483, "reward_std": 0.27385786175727844, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16399723291397095, "sampling/sampling_logp_difference/max": 1.9604716300964355, "sampling/importance_sampling_ratio/min": 0.14079201221466064, "sampling/importance_sampling_ratio/mean": 1.0121349096298218, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.01725622266531, "clip_ratio/low_mean": 0.08368723886087537, "clip_ratio/low_min": 0.08368723886087537, "clip_ratio/high_mean": 0.03216309007257223, "clip_ratio/high_max": 0.03216309007257223, "clip_ratio/region_mean": 0.1158503289334476, "reward_total_mean": 0.22213882207870483, "reward_meter_mean": 0.7691898345947266, "reward_meter_std": 0.37946081161499023, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.2651650309562683, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.971875011920929, "reward_count_floor_std": 0.07954952120780945, "reward_lexical_plausibility_mean": 0.9341220259666443, "reward_lexical_plausibility_std": 0.1792246401309967, "reward_repeat_penalty_mean": 0.7145575881004333, "reward_repeat_penalty_std": 0.29141151905059814, "reward_repeat_floor_mean": 0.9686734676361084, "reward_repeat_floor_std": 0.03696190565824509, "reward_near_duplicate_penalty_mean": 0.9290385246276855, "reward_near_duplicate_penalty_std": 0.08091890811920166, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.18600596487522125, "reward_distinct_2_mean": 0.8326969146728516, "reward_distinct_2_std": 0.24042244255542755, "reward_judge_quality_mean": 0.3162499964237213, "reward_judge_quality_std": 0.2650572657585144, "reward_total_composite_mean": 0.22213882207870483, "reward_total_composite_std": 0.27385786175727844} {"timestamp_utc": "2026-04-12T17:40:26Z", "mode": "train", "global_step": 468, "epoch": 0.024630282616704385, "loss": 0.0493, "grad_norm": 8.99153995513916, "learning_rate": 8.584848484848485e-06, "num_tokens": 869645.0, "completions/mean_length": 81.625, "completions/min_length": 76.0, "completions/max_length": 92.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 81.625, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.9223024249076843, "rewards/meter/std": 0.09635310620069504, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.12056658416986465, "rewards/repeat_penalty/std": 0.1343386173248291, "rewards/repeat_floor/mean": 0.8572448492050171, "rewards/repeat_floor/std": 0.050898995250463486, "rewards/near_duplicate_penalty/mean": 0.6321216821670532, "rewards/near_duplicate_penalty/std": 0.15244291722774506, "rewards/opening_diversity/mean": 0.5390625, "rewards/opening_diversity/std": 0.2542880177497864, "rewards/distinct_2/mean": 0.33425378799438477, "rewards/distinct_2/std": 0.1574835479259491, "rewards/total_composite/mean": 0.1184370294213295, "rewards/total_composite/std": 0.01286934595555067, "reward": 0.1184370294213295, "reward_std": 0.01286934781819582, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10954656451940536, "sampling/sampling_logp_difference/max": 1.9089059829711914, "sampling/importance_sampling_ratio/min": 0.14824248850345612, "sampling/importance_sampling_ratio/mean": 1.0160108804702759, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8124596178531647, "clip_ratio/low_mean": 0.03755123261362314, "clip_ratio/low_min": 0.03755123261362314, "clip_ratio/high_mean": 0.05008876696228981, "clip_ratio/high_max": 0.05008876696228981, "clip_ratio/region_mean": 0.08763999957591295, "reward_total_mean": 0.1184370294213295, "reward_meter_mean": 0.9223024249076843, "reward_meter_std": 0.09635310620069504, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.12056658416986465, "reward_repeat_penalty_std": 0.1343386173248291, "reward_repeat_floor_mean": 0.8572448492050171, "reward_repeat_floor_std": 0.050898995250463486, "reward_near_duplicate_penalty_mean": 0.6321216821670532, "reward_near_duplicate_penalty_std": 0.15244291722774506, "reward_opening_diversity_mean": 0.5390625, "reward_opening_diversity_std": 0.2542880177497864, "reward_distinct_2_mean": 0.33425378799438477, "reward_distinct_2_std": 0.1574835479259491, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.1184370294213295, "reward_total_composite_std": 0.01286934595555067} {"timestamp_utc": "2026-04-12T17:40:34Z", "mode": "train", "global_step": 469, "epoch": 0.024682911425714438, "loss": 0.0338, "grad_norm": 14.935983657836914, "learning_rate": 8.581818181818183e-06, "num_tokens": 871213.0, "completions/mean_length": 40.0, "completions/min_length": 35.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.4505701959133148, "rewards/meter/std": 0.4177137017250061, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.7350000143051147, "rewards/judge_quality/std": 0.2655990719795227, "rewards/repeat_penalty/mean": 0.8372052907943726, "rewards/repeat_penalty/std": 0.24754536151885986, "rewards/repeat_floor/mean": 0.9829343557357788, "rewards/repeat_floor/std": 0.022863373160362244, "rewards/near_duplicate_penalty/mean": 0.9355204105377197, "rewards/near_duplicate_penalty/std": 0.06568436324596405, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9595141410827637, "rewards/distinct_2/std": 0.08656234294176102, "rewards/total_composite/mean": 0.38056474924087524, "rewards/total_composite/std": 0.4107729196548462, "reward": 0.38056474924087524, "reward_std": 0.4107729196548462, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13861869275569916, "sampling/sampling_logp_difference/max": 2.2985057830810547, "sampling/importance_sampling_ratio/min": 0.10040877014398575, "sampling/importance_sampling_ratio/mean": 1.007846713066101, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8715974390506744, "clip_ratio/low_mean": 0.07247200142592192, "clip_ratio/low_min": 0.07247200142592192, "clip_ratio/high_mean": 0.06966928578913212, "clip_ratio/high_max": 0.06966928578913212, "clip_ratio/region_mean": 0.14214128721505404, "reward_total_mean": 0.38056474924087524, "reward_meter_mean": 0.4505701959133148, "reward_meter_std": 0.4177137017250061, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.8372052907943726, "reward_repeat_penalty_std": 0.24754536151885986, "reward_repeat_floor_mean": 0.9829343557357788, "reward_repeat_floor_std": 0.022863373160362244, "reward_near_duplicate_penalty_mean": 0.9355204105377197, "reward_near_duplicate_penalty_std": 0.06568436324596405, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9595141410827637, "reward_distinct_2_std": 0.08656234294176102, "reward_judge_quality_mean": 0.7350000143051147, "reward_judge_quality_std": 0.2655990719795227, "reward_total_composite_mean": 0.38056474924087524, "reward_total_composite_std": 0.4107729196548462} {"timestamp_utc": "2026-04-12T17:40:42Z", "mode": "train", "global_step": 470, "epoch": 0.024735540234724487, "loss": 0.0241, "grad_norm": 13.975543022155762, "learning_rate": 8.57878787878788e-06, "num_tokens": 872829.0, "completions/mean_length": 46.0, "completions/min_length": 38.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.0, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.97574782371521, "rewards/meter/std": 0.018756739795207977, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.28749996423721313, "rewards/judge_quality/std": 0.13024701178073883, "rewards/repeat_penalty/mean": 0.7905802726745605, "rewards/repeat_penalty/std": 0.24757647514343262, "rewards/repeat_floor/mean": 0.9748726487159729, "rewards/repeat_floor/std": 0.030745012685656548, "rewards/near_duplicate_penalty/mean": 0.9211663007736206, "rewards/near_duplicate_penalty/std": 0.08916570991277695, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8730300664901733, "rewards/distinct_2/std": 0.1401810348033905, "rewards/total_composite/mean": 0.27376270294189453, "rewards/total_composite/std": 0.12548699975013733, "reward": 0.27376270294189453, "reward_std": 0.12548701465129852, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14351414144039154, "sampling/sampling_logp_difference/max": 1.2779419422149658, "sampling/importance_sampling_ratio/min": 0.27861011028289795, "sampling/importance_sampling_ratio/mean": 1.0189917087554932, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1294040009379387, "clip_ratio/low_mean": 0.05070318467915058, "clip_ratio/low_min": 0.05070318467915058, "clip_ratio/high_mean": 0.07650966197252274, "clip_ratio/high_max": 0.07650966197252274, "clip_ratio/region_mean": 0.12721284665167332, "reward_total_mean": 0.27376270294189453, "reward_meter_mean": 0.97574782371521, "reward_meter_std": 0.018756739795207977, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7905802726745605, "reward_repeat_penalty_std": 0.24757647514343262, "reward_repeat_floor_mean": 0.9748726487159729, "reward_repeat_floor_std": 0.030745012685656548, "reward_near_duplicate_penalty_mean": 0.9211663007736206, "reward_near_duplicate_penalty_std": 0.08916570991277695, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8730300664901733, "reward_distinct_2_std": 0.1401810348033905, "reward_judge_quality_mean": 0.28749996423721313, "reward_judge_quality_std": 0.13024701178073883, "reward_total_composite_mean": 0.27376270294189453, "reward_total_composite_std": 0.12548699975013733} {"timestamp_utc": "2026-04-12T17:40:51Z", "mode": "train", "global_step": 471, "epoch": 0.02478816904373454, "loss": 0.0169, "grad_norm": 8.806530952453613, "learning_rate": 8.575757575757575e-06, "num_tokens": 875072.0, "completions/mean_length": 85.375, "completions/min_length": 47.0, "completions/max_length": 96.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 85.375, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 96.0, "rewards/meter/mean": 0.7614915370941162, "rewards/meter/std": 0.3527231812477112, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5375000238418579, "rewards/judge_quality/std": 0.2462722212076187, "rewards/repeat_penalty/mean": 0.9216973781585693, "rewards/repeat_penalty/std": 0.16981077194213867, "rewards/repeat_floor/mean": 0.9922190308570862, "rewards/repeat_floor/std": 0.01515916083008051, "rewards/near_duplicate_penalty/mean": 0.9779188632965088, "rewards/near_duplicate_penalty/std": 0.026434287428855896, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9503462910652161, "rewards/distinct_2/std": 0.125265434384346, "rewards/total_composite/mean": 0.40381038188934326, "rewards/total_composite/std": 0.29029467701911926, "reward": 0.40381038188934326, "reward_std": 0.29029467701911926, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15804153680801392, "sampling/sampling_logp_difference/max": 1.5367183685302734, "sampling/importance_sampling_ratio/min": 0.21508577466011047, "sampling/importance_sampling_ratio/mean": 1.0180410146713257, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3140480741858482, "clip_ratio/low_mean": 0.09662595391273499, "clip_ratio/low_min": 0.09662595391273499, "clip_ratio/high_mean": 0.06673349719494581, "clip_ratio/high_max": 0.06673349719494581, "clip_ratio/region_mean": 0.1633594511076808, "reward_total_mean": 0.40381038188934326, "reward_meter_mean": 0.7614915370941162, "reward_meter_std": 0.3527231812477112, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9216973781585693, "reward_repeat_penalty_std": 0.16981077194213867, "reward_repeat_floor_mean": 0.9922190308570862, "reward_repeat_floor_std": 0.01515916083008051, "reward_near_duplicate_penalty_mean": 0.9779188632965088, "reward_near_duplicate_penalty_std": 0.026434287428855896, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9503462910652161, "reward_distinct_2_std": 0.125265434384346, "reward_judge_quality_mean": 0.5375000238418579, "reward_judge_quality_std": 0.2462722212076187, "reward_total_composite_mean": 0.40381038188934326, "reward_total_composite_std": 0.29029467701911926} {"timestamp_utc": "2026-04-12T17:41:05Z", "mode": "train", "global_step": 472, "epoch": 0.02484079785274459, "loss": -0.0261, "grad_norm": 4.894377708435059, "learning_rate": 8.572727272727274e-06, "num_tokens": 876404.0, "completions/mean_length": 81.5, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.0, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.6767353415489197, "rewards/meter/std": 0.4195828437805176, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.932405412197113, "rewards/lexical_plausibility/std": 0.16736763715744019, "rewards/judge_quality/mean": 0.5800000429153442, "rewards/judge_quality/std": 0.3921734392642975, "rewards/repeat_penalty/mean": 0.6140526533126831, "rewards/repeat_penalty/std": 0.2528451979160309, "rewards/repeat_floor/mean": 0.9682778120040894, "rewards/repeat_floor/std": 0.027230918407440186, "rewards/near_duplicate_penalty/mean": 0.9653545022010803, "rewards/near_duplicate_penalty/std": 0.044731080532073975, "rewards/opening_diversity/mean": 0.65625, "rewards/opening_diversity/std": 0.2651650309562683, "rewards/distinct_2/mean": 0.9344406127929688, "rewards/distinct_2/std": 0.09809565544128418, "rewards/total_composite/mean": 0.41457605361938477, "rewards/total_composite/std": 0.39520126581192017, "reward": 0.41457605361938477, "reward_std": 0.3952012062072754, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19121161103248596, "sampling/sampling_logp_difference/max": 1.447162389755249, "sampling/importance_sampling_ratio/min": 0.23523686826229095, "sampling/importance_sampling_ratio/mean": 1.0249830484390259, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1275591030716896, "clip_ratio/low_mean": 0.08854811498895288, "clip_ratio/low_min": 0.08854811498895288, "clip_ratio/high_mean": 0.018750000279396772, "clip_ratio/high_max": 0.018750000279396772, "clip_ratio/region_mean": 0.10729811526834965, "reward_total_mean": 0.41457605361938477, "reward_meter_mean": 0.6767353415489197, "reward_meter_std": 0.4195828437805176, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.932405412197113, "reward_lexical_plausibility_std": 0.16736763715744019, "reward_repeat_penalty_mean": 0.6140526533126831, "reward_repeat_penalty_std": 0.2528451979160309, "reward_repeat_floor_mean": 0.9682778120040894, "reward_repeat_floor_std": 0.027230918407440186, "reward_near_duplicate_penalty_mean": 0.9653545022010803, "reward_near_duplicate_penalty_std": 0.044731080532073975, "reward_opening_diversity_mean": 0.65625, "reward_opening_diversity_std": 0.2651650309562683, "reward_distinct_2_mean": 0.9344406127929688, "reward_distinct_2_std": 0.09809565544128418, "reward_judge_quality_mean": 0.5800000429153442, "reward_judge_quality_std": 0.3921734392642975, "reward_total_composite_mean": 0.41457605361938477, "reward_total_composite_std": 0.39520126581192017} {"timestamp_utc": "2026-04-12T17:41:14Z", "mode": "train", "global_step": 473, "epoch": 0.024893426661754644, "loss": 0.0415, "grad_norm": 15.320552825927734, "learning_rate": 8.56969696969697e-06, "num_tokens": 877964.0, "completions/mean_length": 37.0, "completions/min_length": 30.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.3447434604167938, "rewards/meter/std": 0.31754711270332336, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7312500476837158, "rewards/judge_quality/std": 0.3589046001434326, "rewards/repeat_penalty/mean": 0.9638725519180298, "rewards/repeat_penalty/std": 0.0356743298470974, "rewards/repeat_floor/mean": 0.994580864906311, "rewards/repeat_floor/std": 0.005351153668016195, "rewards/near_duplicate_penalty/mean": 0.9638725519180298, "rewards/near_duplicate_penalty/std": 0.0356743298470974, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21917980909347534, "rewards/total_composite/std": 0.26487240195274353, "reward": 0.21917980909347534, "reward_std": 0.26487240195274353, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1716521829366684, "sampling/sampling_logp_difference/max": 2.157565116882324, "sampling/importance_sampling_ratio/min": 0.11560626327991486, "sampling/importance_sampling_ratio/mean": 1.0430837869644165, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9588679075241089, "clip_ratio/low_mean": 0.12824940914288163, "clip_ratio/low_min": 0.12824940914288163, "clip_ratio/high_mean": 0.022857625503093004, "clip_ratio/high_max": 0.022857625503093004, "clip_ratio/region_mean": 0.15110703464597464, "reward_total_mean": 0.21917980909347534, "reward_meter_mean": 0.3447434604167938, "reward_meter_std": 0.31754711270332336, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9638725519180298, "reward_repeat_penalty_std": 0.0356743298470974, "reward_repeat_floor_mean": 0.994580864906311, "reward_repeat_floor_std": 0.005351153668016195, "reward_near_duplicate_penalty_mean": 0.9638725519180298, "reward_near_duplicate_penalty_std": 0.0356743298470974, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7312500476837158, "reward_judge_quality_std": 0.3589046001434326, "reward_total_composite_mean": 0.21917980909347534, "reward_total_composite_std": 0.26487240195274353} {"timestamp_utc": "2026-04-12T17:41:28Z", "mode": "train", "global_step": 474, "epoch": 0.024946055470764696, "loss": -0.0492, "grad_norm": 3.5581774711608887, "learning_rate": 8.566666666666667e-06, "num_tokens": 879673.0, "completions/mean_length": 184.625, "completions/min_length": 69.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 75.5, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 83.0, "rewards/meter/mean": 0.7618043422698975, "rewards/meter/std": 0.351188063621521, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9318425059318542, "rewards/lexical_plausibility/std": 0.1288023144006729, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.7190311551094055, "rewards/repeat_penalty/std": 0.3231569230556488, "rewards/repeat_floor/mean": 0.9632654786109924, "rewards/repeat_floor/std": 0.05032624676823616, "rewards/near_duplicate_penalty/mean": 0.8977975845336914, "rewards/near_duplicate_penalty/std": 0.13175007700920105, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.18898223340511322, "rewards/distinct_2/mean": 0.8455091118812561, "rewards/distinct_2/std": 0.22642596065998077, "rewards/total_composite/mean": 0.16438791155815125, "rewards/total_composite/std": 0.11400491744279861, "reward": 0.16438791155815125, "reward_std": 0.11400491744279861, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14609570801258087, "sampling/sampling_logp_difference/max": 1.4534201622009277, "sampling/importance_sampling_ratio/min": 0.23376940190792084, "sampling/importance_sampling_ratio/mean": 1.0319956541061401, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9716388285160065, "clip_ratio/low_mean": 0.0790879875421524, "clip_ratio/low_min": 0.0790879875421524, "clip_ratio/high_mean": 0.027110389433801174, "clip_ratio/high_max": 0.027110389433801174, "clip_ratio/region_mean": 0.10619837697595358, "reward_total_mean": 0.16438791155815125, "reward_meter_mean": 0.7618043422698975, "reward_meter_std": 0.351188063621521, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9318425059318542, "reward_lexical_plausibility_std": 0.1288023144006729, "reward_repeat_penalty_mean": 0.7190311551094055, "reward_repeat_penalty_std": 0.3231569230556488, "reward_repeat_floor_mean": 0.9632654786109924, "reward_repeat_floor_std": 0.05032624676823616, "reward_near_duplicate_penalty_mean": 0.8977975845336914, "reward_near_duplicate_penalty_std": 0.13175007700920105, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.18898223340511322, "reward_distinct_2_mean": 0.8455091118812561, "reward_distinct_2_std": 0.22642596065998077, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.16438791155815125, "reward_total_composite_std": 0.11400491744279861} {"timestamp_utc": "2026-04-12T17:41:37Z", "mode": "train", "global_step": 475, "epoch": 0.02499868427977475, "loss": -0.0316, "grad_norm": 20.224674224853516, "learning_rate": 8.563636363636364e-06, "num_tokens": 881236.0, "completions/mean_length": 36.375, "completions/min_length": 30.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.375, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.9836364984512329, "rewards/meter/std": 0.011494634672999382, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.8443509936332703, "rewards/repeat_penalty/std": 0.16900120675563812, "rewards/repeat_floor/mean": 0.981834888458252, "rewards/repeat_floor/std": 0.018487006425857544, "rewards/near_duplicate_penalty/mean": 0.9215735197067261, "rewards/near_duplicate_penalty/std": 0.08376346528530121, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9705433249473572, "rewards/distinct_2/std": 0.04079176485538483, "rewards/total_composite/mean": 0.3985815644264221, "rewards/total_composite/std": 0.05256590247154236, "reward": 0.3985815644264221, "reward_std": 0.05256590247154236, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15195895731449127, "sampling/sampling_logp_difference/max": 1.3622798919677734, "sampling/importance_sampling_ratio/min": 0.25607630610466003, "sampling/importance_sampling_ratio/mean": 1.0402600765228271, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2950242161750793, "clip_ratio/low_mean": 0.03435457614250481, "clip_ratio/low_min": 0.03435457614250481, "clip_ratio/high_mean": 0.08515602489933372, "clip_ratio/high_max": 0.08515602489933372, "clip_ratio/region_mean": 0.11951060104183853, "reward_total_mean": 0.3985815644264221, "reward_meter_mean": 0.9836364984512329, "reward_meter_std": 0.011494634672999382, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8443509936332703, "reward_repeat_penalty_std": 0.16900120675563812, "reward_repeat_floor_mean": 0.981834888458252, "reward_repeat_floor_std": 0.018487006425857544, "reward_near_duplicate_penalty_mean": 0.9215735197067261, "reward_near_duplicate_penalty_std": 0.08376346528530121, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9705433249473572, "reward_distinct_2_std": 0.04079176485538483, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.3985815644264221, "reward_total_composite_std": 0.05256590247154236} {"timestamp_utc": "2026-04-12T17:41:50Z", "mode": "train", "global_step": 476, "epoch": 0.0250513130887848, "loss": 0.1432, "grad_norm": 8.356103897094727, "learning_rate": 8.560606060606062e-06, "num_tokens": 884614.0, "completions/mean_length": 215.25, "completions/min_length": 158.0, "completions/max_length": 366.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 215.25, "completions/min_terminated_length": 158.0, "completions/max_terminated_length": 366.0, "rewards/meter/mean": 0.5926367044448853, "rewards/meter/std": 0.2863155007362366, "rewards/count_adherence/mean": 0.6666666269302368, "rewards/count_adherence/std": 0.24487698078155518, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8999999761581421, "rewards/count_floor/std": 0.073463074862957, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.6616848111152649, "rewards/repeat_penalty/std": 0.28253722190856934, "rewards/repeat_floor/mean": 0.9634898900985718, "rewards/repeat_floor/std": 0.034645069390535355, "rewards/near_duplicate_penalty/mean": 0.9370911717414856, "rewards/near_duplicate_penalty/std": 0.06509105116128922, "rewards/opening_diversity/mean": 0.9982142448425293, "rewards/opening_diversity/std": 0.00505077326670289, "rewards/distinct_2/mean": 0.7003699541091919, "rewards/distinct_2/std": 0.27423763275146484, "rewards/total_composite/mean": 0.17490671575069427, "rewards/total_composite/std": 0.1152539923787117, "reward": 0.17490671575069427, "reward_std": 0.1152539849281311, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16131575405597687, "sampling/sampling_logp_difference/max": 2.7115721702575684, "sampling/importance_sampling_ratio/min": 0.06643228232860565, "sampling/importance_sampling_ratio/mean": 1.012266755104065, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9416213482618332, "clip_ratio/low_mean": 0.07172723580151796, "clip_ratio/low_min": 0.07172723580151796, "clip_ratio/high_mean": 0.09089010022580624, "clip_ratio/high_max": 0.09089010022580624, "clip_ratio/region_mean": 0.1626173360273242, "reward_total_mean": 0.17490671575069427, "reward_meter_mean": 0.5926367044448853, "reward_meter_std": 0.2863155007362366, "reward_count_adherence_mean": 0.6666666269302368, "reward_count_adherence_std": 0.24487698078155518, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8999999761581421, "reward_count_floor_std": 0.073463074862957, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6616848111152649, "reward_repeat_penalty_std": 0.28253722190856934, "reward_repeat_floor_mean": 0.9634898900985718, "reward_repeat_floor_std": 0.034645069390535355, "reward_near_duplicate_penalty_mean": 0.9370911717414856, "reward_near_duplicate_penalty_std": 0.06509105116128922, "reward_opening_diversity_mean": 0.9982142448425293, "reward_opening_diversity_std": 0.00505077326670289, "reward_distinct_2_mean": 0.7003699541091919, "reward_distinct_2_std": 0.27423763275146484, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.17490671575069427, "reward_total_composite_std": 0.1152539923787117} {"timestamp_utc": "2026-04-12T17:41:59Z", "mode": "train", "global_step": 477, "epoch": 0.025103941897794853, "loss": 0.1351, "grad_norm": 18.758481979370117, "learning_rate": 8.557575757575757e-06, "num_tokens": 886249.0, "completions/mean_length": 35.375, "completions/min_length": 32.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.375, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.5979759693145752, "rewards/meter/std": 0.3991454541683197, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.5175000429153442, "rewards/judge_quality/std": 0.26868730783462524, "rewards/repeat_penalty/mean": 0.9858666062355042, "rewards/repeat_penalty/std": 0.013685435988008976, "rewards/repeat_floor/mean": 0.9978799819946289, "rewards/repeat_floor/std": 0.002052822383120656, "rewards/near_duplicate_penalty/mean": 0.9858666062355042, "rewards/near_duplicate_penalty/std": 0.013685435988008976, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33318328857421875, "rewards/total_composite/std": 0.3166455924510956, "reward": 0.33318328857421875, "reward_std": 0.3166455924510956, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1638694852590561, "sampling/sampling_logp_difference/max": 1.8494634628295898, "sampling/importance_sampling_ratio/min": 0.15732155740261078, "sampling/importance_sampling_ratio/mean": 0.9977566003799438, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9550353959202766, "clip_ratio/low_mean": 0.0646360320970416, "clip_ratio/low_min": 0.0646360320970416, "clip_ratio/high_mean": 0.08017908968031406, "clip_ratio/high_max": 0.08017908968031406, "clip_ratio/region_mean": 0.14481512177735567, "reward_total_mean": 0.33318328857421875, "reward_meter_mean": 0.5979759693145752, "reward_meter_std": 0.3991454541683197, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.9858666062355042, "reward_repeat_penalty_std": 0.013685435988008976, "reward_repeat_floor_mean": 0.9978799819946289, "reward_repeat_floor_std": 0.002052822383120656, "reward_near_duplicate_penalty_mean": 0.9858666062355042, "reward_near_duplicate_penalty_std": 0.013685435988008976, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5175000429153442, "reward_judge_quality_std": 0.26868730783462524, "reward_total_composite_mean": 0.33318328857421875, "reward_total_composite_std": 0.3166455924510956} {"timestamp_utc": "2026-04-12T17:42:09Z", "mode": "train", "global_step": 478, "epoch": 0.025156570706804906, "loss": 0.0528, "grad_norm": 8.750658988952637, "learning_rate": 8.554545454545456e-06, "num_tokens": 888415.0, "completions/mean_length": 87.75, "completions/min_length": 79.0, "completions/max_length": 98.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.75, "completions/min_terminated_length": 79.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.8960630297660828, "rewards/meter/std": 0.1679113656282425, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9716117978096008, "rewards/lexical_plausibility/std": 0.08029396086931229, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.8216412663459778, "rewards/repeat_penalty/std": 0.30016782879829407, "rewards/repeat_floor/mean": 0.9763308167457581, "rewards/repeat_floor/std": 0.0427468977868557, "rewards/near_duplicate_penalty/mean": 0.9364006519317627, "rewards/near_duplicate_penalty/std": 0.08619730919599533, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1530931144952774, "rewards/distinct_2/mean": 0.8846746683120728, "rewards/distinct_2/std": 0.23017317056655884, "rewards/total_composite/mean": 0.3119262158870697, "rewards/total_composite/std": 0.08966439217329025, "reward": 0.3119262158870697, "reward_std": 0.08966439217329025, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13232532143592834, "sampling/sampling_logp_difference/max": 1.586812973022461, "sampling/importance_sampling_ratio/min": 0.20457656681537628, "sampling/importance_sampling_ratio/mean": 1.024656057357788, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0769718065857887, "clip_ratio/low_mean": 0.053361023776233196, "clip_ratio/low_min": 0.053361023776233196, "clip_ratio/high_mean": 0.10445518139749765, "clip_ratio/high_max": 0.10445518139749765, "clip_ratio/region_mean": 0.15781620517373085, "reward_total_mean": 0.3119262158870697, "reward_meter_mean": 0.8960630297660828, "reward_meter_std": 0.1679113656282425, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9716117978096008, "reward_lexical_plausibility_std": 0.08029396086931229, "reward_repeat_penalty_mean": 0.8216412663459778, "reward_repeat_penalty_std": 0.30016782879829407, "reward_repeat_floor_mean": 0.9763308167457581, "reward_repeat_floor_std": 0.0427468977868557, "reward_near_duplicate_penalty_mean": 0.9364006519317627, "reward_near_duplicate_penalty_std": 0.08619730919599533, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1530931144952774, "reward_distinct_2_mean": 0.8846746683120728, "reward_distinct_2_std": 0.23017317056655884, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.3119262158870697, "reward_total_composite_std": 0.08966439217329025} {"timestamp_utc": "2026-04-12T17:42:17Z", "mode": "train", "global_step": 479, "epoch": 0.02520919951581496, "loss": 0.0898, "grad_norm": 29.00151252746582, "learning_rate": 8.551515151515152e-06, "num_tokens": 889883.0, "completions/mean_length": 22.5, "completions/min_length": 20.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.5, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.9142677783966064, "rewards/meter/std": 0.12872745096683502, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9505208134651184, "rewards/lexical_plausibility/std": 0.07547593116760254, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.3620477616786957, "rewards/repeat_penalty/mean": 0.7300546169281006, "rewards/repeat_penalty/std": 0.04901907593011856, "rewards/repeat_floor/mean": 0.9819168448448181, "rewards/repeat_floor/std": 0.007275138981640339, "rewards/near_duplicate_penalty/mean": 0.989935040473938, "rewards/near_duplicate_penalty/std": 0.02014034427702427, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.5911568403244019, "rewards/total_composite/std": 0.3244568705558777, "reward": 0.5911568403244019, "reward_std": 0.3244568705558777, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16883940994739532, "sampling/sampling_logp_difference/max": 1.9402134418487549, "sampling/importance_sampling_ratio/min": 0.14367328584194183, "sampling/importance_sampling_ratio/mean": 1.0014277696609497, "sampling/importance_sampling_ratio/max": 1.8156558275222778, "entropy": 1.0974134728312492, "clip_ratio/low_mean": 0.03192640794441104, "clip_ratio/low_min": 0.03192640794441104, "clip_ratio/high_mean": 0.09963768254965544, "clip_ratio/high_max": 0.09963768254965544, "clip_ratio/region_mean": 0.13156409049406648, "reward_total_mean": 0.5911568403244019, "reward_meter_mean": 0.9142677783966064, "reward_meter_std": 0.12872745096683502, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9505208134651184, "reward_lexical_plausibility_std": 0.07547593116760254, "reward_repeat_penalty_mean": 0.7300546169281006, "reward_repeat_penalty_std": 0.04901907593011856, "reward_repeat_floor_mean": 0.9819168448448181, "reward_repeat_floor_std": 0.007275138981640339, "reward_near_duplicate_penalty_mean": 0.989935040473938, "reward_near_duplicate_penalty_std": 0.02014034427702427, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.3620477616786957, "reward_total_composite_mean": 0.5911568403244019, "reward_total_composite_std": 0.3244568705558777} {"timestamp_utc": "2026-04-12T17:42:25Z", "mode": "train", "global_step": 480, "epoch": 0.02526182832482501, "loss": 0.1218, "grad_norm": 15.980237007141113, "learning_rate": 8.548484848484849e-06, "num_tokens": 891327.0, "completions/mean_length": 26.5, "completions/min_length": 21.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.5, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.8697779178619385, "rewards/meter/std": 0.2896170914173126, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9217138290405273, "rewards/lexical_plausibility/std": 0.12752297520637512, "rewards/judge_quality/mean": 0.7937500476837158, "rewards/judge_quality/std": 0.2447119504213333, "rewards/repeat_penalty/mean": 0.7800381183624268, "rewards/repeat_penalty/std": 0.08749208599328995, "rewards/repeat_floor/mean": 0.98665452003479, "rewards/repeat_floor/std": 0.005198613274842501, "rewards/near_duplicate_penalty/mean": 0.998529851436615, "rewards/near_duplicate_penalty/std": 0.00300564244389534, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.658567488193512, "rewards/total_composite/std": 0.3341985046863556, "reward": 0.658567488193512, "reward_std": 0.3341985046863556, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1702299267053604, "sampling/sampling_logp_difference/max": 2.050219774246216, "sampling/importance_sampling_ratio/min": 0.12870661914348602, "sampling/importance_sampling_ratio/mean": 1.0064083337783813, "sampling/importance_sampling_ratio/max": 1.9248806238174438, "entropy": 1.475433349609375, "clip_ratio/low_mean": 0.08186069503426552, "clip_ratio/low_min": 0.08186069503426552, "clip_ratio/high_mean": 0.15122710820287466, "clip_ratio/high_max": 0.15122710820287466, "clip_ratio/region_mean": 0.23308780323714018, "reward_total_mean": 0.658567488193512, "reward_meter_mean": 0.8697779178619385, "reward_meter_std": 0.2896170914173126, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9217138290405273, "reward_lexical_plausibility_std": 0.12752297520637512, "reward_repeat_penalty_mean": 0.7800381183624268, "reward_repeat_penalty_std": 0.08749208599328995, "reward_repeat_floor_mean": 0.98665452003479, "reward_repeat_floor_std": 0.005198613274842501, "reward_near_duplicate_penalty_mean": 0.998529851436615, "reward_near_duplicate_penalty_std": 0.00300564244389534, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7937500476837158, "reward_judge_quality_std": 0.2447119504213333, "reward_total_composite_mean": 0.658567488193512, "reward_total_composite_std": 0.3341985046863556} {"timestamp_utc": "2026-04-12T17:42:33Z", "mode": "train", "global_step": 481, "epoch": 0.02531445713383506, "loss": 0.0099, "grad_norm": 10.96861457824707, "learning_rate": 8.545454545454546e-06, "num_tokens": 892900.0, "completions/mean_length": 46.625, "completions/min_length": 42.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.625, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.8064861297607422, "rewards/meter/std": 0.31927233934402466, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.2558424770832062, "rewards/repeat_penalty/mean": 0.8413097858428955, "rewards/repeat_penalty/std": 0.14497357606887817, "rewards/repeat_floor/mean": 0.9844622611999512, "rewards/repeat_floor/std": 0.01077551580965519, "rewards/near_duplicate_penalty/mean": 0.9492339491844177, "rewards/near_duplicate_penalty/std": 0.02526203729212284, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.974468469619751, "rewards/distinct_2/std": 0.035326093435287476, "rewards/total_composite/mean": 0.43128859996795654, "rewards/total_composite/std": 0.17588578164577484, "reward": 0.43128859996795654, "reward_std": 0.17588576674461365, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1625947207212448, "sampling/sampling_logp_difference/max": 1.3164739608764648, "sampling/importance_sampling_ratio/min": 0.26807889342308044, "sampling/importance_sampling_ratio/mean": 1.0100953578948975, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3365557566285133, "clip_ratio/low_mean": 0.044546227902173996, "clip_ratio/low_min": 0.044546227902173996, "clip_ratio/high_mean": 0.09171762876212597, "clip_ratio/high_max": 0.09171762876212597, "clip_ratio/region_mean": 0.13626385666429996, "reward_total_mean": 0.43128859996795654, "reward_meter_mean": 0.8064861297607422, "reward_meter_std": 0.31927233934402466, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8413097858428955, "reward_repeat_penalty_std": 0.14497357606887817, "reward_repeat_floor_mean": 0.9844622611999512, "reward_repeat_floor_std": 0.01077551580965519, "reward_near_duplicate_penalty_mean": 0.9492339491844177, "reward_near_duplicate_penalty_std": 0.02526203729212284, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.974468469619751, "reward_distinct_2_std": 0.035326093435287476, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.2558424770832062, "reward_total_composite_mean": 0.43128859996795654, "reward_total_composite_std": 0.17588578164577484} {"timestamp_utc": "2026-04-12T17:42:47Z", "mode": "train", "global_step": 482, "epoch": 0.025367085942845112, "loss": -0.0776, "grad_norm": 4.801069259643555, "learning_rate": 8.542424242424243e-06, "num_tokens": 894426.0, "completions/mean_length": 105.75, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.71428680419922, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.7329697608947754, "rewards/meter/std": 0.41056057810783386, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9211018085479736, "rewards/lexical_plausibility/std": 0.2231578826904297, "rewards/judge_quality/mean": 0.4925000071525574, "rewards/judge_quality/std": 0.2945577800273895, "rewards/repeat_penalty/mean": 0.9583426713943481, "rewards/repeat_penalty/std": 0.10578048974275589, "rewards/repeat_floor/mean": 0.9967557191848755, "rewards/repeat_floor/std": 0.007397820241749287, "rewards/near_duplicate_penalty/mean": 0.9961162209510803, "rewards/near_duplicate_penalty/std": 0.006006431765854359, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.4038626253604889, "rewards/total_composite/std": 0.29983022809028625, "reward": 0.4038626253604889, "reward_std": 0.29983022809028625, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15785160660743713, "sampling/sampling_logp_difference/max": 1.3366641998291016, "sampling/importance_sampling_ratio/min": 0.26272058486938477, "sampling/importance_sampling_ratio/mean": 1.0346943140029907, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1752451807260513, "clip_ratio/low_mean": 0.0785757452249527, "clip_ratio/low_min": 0.0785757452249527, "clip_ratio/high_mean": 0.07952513638883829, "clip_ratio/high_max": 0.07952513638883829, "clip_ratio/region_mean": 0.158100881613791, "reward_total_mean": 0.4038626253604889, "reward_meter_mean": 0.7329697608947754, "reward_meter_std": 0.41056057810783386, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9211018085479736, "reward_lexical_plausibility_std": 0.2231578826904297, "reward_repeat_penalty_mean": 0.9583426713943481, "reward_repeat_penalty_std": 0.10578048974275589, "reward_repeat_floor_mean": 0.9967557191848755, "reward_repeat_floor_std": 0.007397820241749287, "reward_near_duplicate_penalty_mean": 0.9961162209510803, "reward_near_duplicate_penalty_std": 0.006006431765854359, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.4925000071525574, "reward_judge_quality_std": 0.2945577800273895, "reward_total_composite_mean": 0.4038626253604889, "reward_total_composite_std": 0.29983022809028625} {"timestamp_utc": "2026-04-12T17:42:55Z", "mode": "train", "global_step": 483, "epoch": 0.025419714751855164, "loss": 0.0472, "grad_norm": 13.090096473693848, "learning_rate": 8.539393939393939e-06, "num_tokens": 896071.0, "completions/mean_length": 42.625, "completions/min_length": 41.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.625, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.484230637550354, "rewards/meter/std": 0.32689040899276733, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390502154827118, "rewards/repeat_penalty/mean": 0.8828092813491821, "rewards/repeat_penalty/std": 0.24599142372608185, "rewards/repeat_floor/mean": 0.9882823824882507, "rewards/repeat_floor/std": 0.02364494651556015, "rewards/near_duplicate_penalty/mean": 0.9690269231796265, "rewards/near_duplicate_penalty/std": 0.05978485941886902, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9422594904899597, "rewards/distinct_2/std": 0.10685522109270096, "rewards/total_composite/mean": 0.22645294666290283, "rewards/total_composite/std": 0.14072291553020477, "reward": 0.22645294666290283, "reward_std": 0.14072293043136597, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17176489531993866, "sampling/sampling_logp_difference/max": 1.9394941329956055, "sampling/importance_sampling_ratio/min": 0.14377665519714355, "sampling/importance_sampling_ratio/mean": 1.0345059633255005, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5112168416380882, "clip_ratio/low_mean": 0.08229451440274715, "clip_ratio/low_min": 0.08229451440274715, "clip_ratio/high_mean": 0.08154318574815989, "clip_ratio/high_max": 0.08154318574815989, "clip_ratio/region_mean": 0.16383770015090704, "reward_total_mean": 0.22645294666290283, "reward_meter_mean": 0.484230637550354, "reward_meter_std": 0.32689040899276733, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8828092813491821, "reward_repeat_penalty_std": 0.24599142372608185, "reward_repeat_floor_mean": 0.9882823824882507, "reward_repeat_floor_std": 0.02364494651556015, "reward_near_duplicate_penalty_mean": 0.9690269231796265, "reward_near_duplicate_penalty_std": 0.05978485941886902, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9422594904899597, "reward_distinct_2_std": 0.10685522109270096, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390502154827118, "reward_total_composite_mean": 0.22645294666290283, "reward_total_composite_std": 0.14072291553020477} {"timestamp_utc": "2026-04-12T17:43:03Z", "mode": "train", "global_step": 484, "epoch": 0.025472343560865217, "loss": 0.0005, "grad_norm": 27.089628219604492, "learning_rate": 8.536363636363636e-06, "num_tokens": 897664.0, "completions/mean_length": 18.125, "completions/min_length": 15.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.125, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.9493619203567505, "rewards/meter/std": 0.09226961433887482, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.831250011920929, "rewards/judge_quality/std": 0.27559998631477356, "rewards/repeat_penalty/mean": 0.7269262671470642, "rewards/repeat_penalty/std": 0.06526235491037369, "rewards/repeat_floor/mean": 0.9803853034973145, "rewards/repeat_floor/std": 0.013052479363977909, "rewards/near_duplicate_penalty/mean": 0.9692350625991821, "rewards/near_duplicate_penalty/std": 0.08701647073030472, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7708688378334045, "rewards/total_composite/std": 0.267892986536026, "reward": 0.7708688378334045, "reward_std": 0.267892986536026, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16559292376041412, "sampling/sampling_logp_difference/max": 1.049661636352539, "sampling/importance_sampling_ratio/min": 0.35005617141723633, "sampling/importance_sampling_ratio/mean": 1.027931809425354, "sampling/importance_sampling_ratio/max": 1.7970988750457764, "entropy": 1.1931760981678963, "clip_ratio/low_mean": 0.034722222946584225, "clip_ratio/low_min": 0.034722222946584225, "clip_ratio/high_mean": 0.12408963870257139, "clip_ratio/high_max": 0.12408963870257139, "clip_ratio/region_mean": 0.15881186164915562, "reward_total_mean": 0.7708688378334045, "reward_meter_mean": 0.9493619203567505, "reward_meter_std": 0.09226961433887482, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7269262671470642, "reward_repeat_penalty_std": 0.06526235491037369, "reward_repeat_floor_mean": 0.9803853034973145, "reward_repeat_floor_std": 0.013052479363977909, "reward_near_duplicate_penalty_mean": 0.9692350625991821, "reward_near_duplicate_penalty_std": 0.08701647073030472, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.831250011920929, "reward_judge_quality_std": 0.27559998631477356, "reward_total_composite_mean": 0.7708688378334045, "reward_total_composite_std": 0.267892986536026} {"timestamp_utc": "2026-04-12T17:43:11Z", "mode": "train", "global_step": 485, "epoch": 0.02552497236987527, "loss": 0.0282, "grad_norm": 27.633771896362305, "learning_rate": 8.533333333333335e-06, "num_tokens": 899201.0, "completions/mean_length": 33.125, "completions/min_length": 30.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.125, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.5026096105575562, "rewards/meter/std": 0.3751481771469116, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.5462499856948853, "rewards/judge_quality/std": 0.24401040375232697, "rewards/repeat_penalty/mean": 0.9841090440750122, "rewards/repeat_penalty/std": 0.016218602657318115, "rewards/repeat_floor/mean": 0.9976163506507874, "rewards/repeat_floor/std": 0.0024327824357897043, "rewards/near_duplicate_penalty/mean": 0.9841090440750122, "rewards/near_duplicate_penalty/std": 0.016218602657318115, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.26432886719703674, "rewards/total_composite/std": 0.2809872031211853, "reward": 0.26432886719703674, "reward_std": 0.2809872031211853, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18319426476955414, "sampling/sampling_logp_difference/max": 2.6407713890075684, "sampling/importance_sampling_ratio/min": 0.0713062435388565, "sampling/importance_sampling_ratio/mean": 1.0072911977767944, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0676851198077202, "clip_ratio/low_mean": 0.10398916900157928, "clip_ratio/low_min": 0.10398916900157928, "clip_ratio/high_mean": 0.040719698183238506, "clip_ratio/high_max": 0.040719698183238506, "clip_ratio/region_mean": 0.1447088671848178, "reward_total_mean": 0.26432886719703674, "reward_meter_mean": 0.5026096105575562, "reward_meter_std": 0.3751481771469116, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9841090440750122, "reward_repeat_penalty_std": 0.016218602657318115, "reward_repeat_floor_mean": 0.9976163506507874, "reward_repeat_floor_std": 0.0024327824357897043, "reward_near_duplicate_penalty_mean": 0.9841090440750122, "reward_near_duplicate_penalty_std": 0.016218602657318115, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5462499856948853, "reward_judge_quality_std": 0.24401040375232697, "reward_total_composite_mean": 0.26432886719703674, "reward_total_composite_std": 0.2809872031211853} {"timestamp_utc": "2026-04-12T17:43:21Z", "mode": "train", "global_step": 486, "epoch": 0.02557760117888532, "loss": -0.0285, "grad_norm": 13.541166305541992, "learning_rate": 8.53030303030303e-06, "num_tokens": 901362.0, "completions/mean_length": 100.125, "completions/min_length": 80.0, "completions/max_length": 125.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 100.125, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 125.0, "rewards/meter/mean": 0.41853219270706177, "rewards/meter/std": 0.22888816893100739, "rewards/count_adherence/mean": 0.949999988079071, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9850000143051147, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.7463910579681396, "rewards/repeat_penalty/std": 0.16073068976402283, "rewards/repeat_floor/mean": 0.9715670943260193, "rewards/repeat_floor/std": 0.0172157883644104, "rewards/near_duplicate_penalty/mean": 0.9110779166221619, "rewards/near_duplicate_penalty/std": 0.03621843457221985, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8531154990196228, "rewards/distinct_2/std": 0.08381636440753937, "rewards/total_composite/mean": 0.13727928698062897, "rewards/total_composite/std": 0.0861298069357872, "reward": 0.13727928698062897, "reward_std": 0.0861298143863678, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21168260276317596, "sampling/sampling_logp_difference/max": 2.3718762397766113, "sampling/importance_sampling_ratio/min": 0.09330549836158752, "sampling/importance_sampling_ratio/mean": 0.9802566170692444, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9262030124664307, "clip_ratio/low_mean": 0.09503144770860672, "clip_ratio/low_min": 0.09503144770860672, "clip_ratio/high_mean": 0.07580113597214222, "clip_ratio/high_max": 0.07580113597214222, "clip_ratio/region_mean": 0.17083258368074894, "reward_total_mean": 0.13727928698062897, "reward_meter_mean": 0.41853219270706177, "reward_meter_std": 0.22888816893100739, "reward_count_adherence_mean": 0.949999988079071, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9850000143051147, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7463910579681396, "reward_repeat_penalty_std": 0.16073068976402283, "reward_repeat_floor_mean": 0.9715670943260193, "reward_repeat_floor_std": 0.0172157883644104, "reward_near_duplicate_penalty_mean": 0.9110779166221619, "reward_near_duplicate_penalty_std": 0.03621843457221985, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8531154990196228, "reward_distinct_2_std": 0.08381636440753937, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.13727928698062897, "reward_total_composite_std": 0.0861298069357872} {"timestamp_utc": "2026-04-12T17:43:35Z", "mode": "train", "global_step": 487, "epoch": 0.025630229987895374, "loss": -0.0757, "grad_norm": 3.5076582431793213, "learning_rate": 8.527272727272728e-06, "num_tokens": 904460.0, "completions/mean_length": 248.25, "completions/min_length": 193.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 210.57144165039062, "completions/min_terminated_length": 193.0, "completions/max_terminated_length": 236.0, "rewards/meter/mean": 0.7735596895217896, "rewards/meter/std": 0.3453555107116699, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.1079898476600647, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9571428298950195, "rewards/count_floor/std": 0.03239695355296135, "rewards/lexical_plausibility/mean": 0.9403283596038818, "rewards/lexical_plausibility/std": 0.1687769591808319, "rewards/judge_quality/mean": 0.16249999403953552, "rewards/judge_quality/std": 0.08345229923725128, "rewards/repeat_penalty/mean": 0.08856150507926941, "rewards/repeat_penalty/std": 0.1794922798871994, "rewards/repeat_floor/mean": 0.8054174184799194, "rewards/repeat_floor/std": 0.07545901089906693, "rewards/near_duplicate_penalty/mean": 0.45798158645629883, "rewards/near_duplicate_penalty/std": 0.214552640914917, "rewards/opening_diversity/mean": 0.37261903285980225, "rewards/opening_diversity/std": 0.3214702010154724, "rewards/distinct_2/mean": 0.15958885848522186, "rewards/distinct_2/std": 0.28594765067100525, "rewards/total_composite/mean": 0.10135243833065033, "rewards/total_composite/std": 0.0846024826169014, "reward": 0.10135243833065033, "reward_std": 0.0846024826169014, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.05849408358335495, "sampling/sampling_logp_difference/max": 1.6172943115234375, "sampling/importance_sampling_ratio/min": 0.19843487441539764, "sampling/importance_sampling_ratio/mean": 1.0120666027069092, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3639492578804493, "clip_ratio/low_mean": 0.015279501210898161, "clip_ratio/low_min": 0.015279501210898161, "clip_ratio/high_mean": 0.034134830348193645, "clip_ratio/high_max": 0.034134830348193645, "clip_ratio/region_mean": 0.049414331559091806, "reward_total_mean": 0.10135243833065033, "reward_meter_mean": 0.7735596895217896, "reward_meter_std": 0.3453555107116699, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.1079898476600647, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9571428298950195, "reward_count_floor_std": 0.03239695355296135, "reward_lexical_plausibility_mean": 0.9403283596038818, "reward_lexical_plausibility_std": 0.1687769591808319, "reward_repeat_penalty_mean": 0.08856150507926941, "reward_repeat_penalty_std": 0.1794922798871994, "reward_repeat_floor_mean": 0.8054174184799194, "reward_repeat_floor_std": 0.07545901089906693, "reward_near_duplicate_penalty_mean": 0.45798158645629883, "reward_near_duplicate_penalty_std": 0.214552640914917, "reward_opening_diversity_mean": 0.37261903285980225, "reward_opening_diversity_std": 0.3214702010154724, "reward_distinct_2_mean": 0.15958885848522186, "reward_distinct_2_std": 0.28594765067100525, "reward_judge_quality_mean": 0.16249999403953552, "reward_judge_quality_std": 0.08345229923725128, "reward_total_composite_mean": 0.10135243833065033, "reward_total_composite_std": 0.0846024826169014} {"timestamp_utc": "2026-04-12T17:43:44Z", "mode": "train", "global_step": 488, "epoch": 0.025682858796905426, "loss": 0.0455, "grad_norm": 11.663517951965332, "learning_rate": 8.524242424242425e-06, "num_tokens": 906185.0, "completions/mean_length": 39.625, "completions/min_length": 34.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.625, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.5654488205909729, "rewards/meter/std": 0.3592325747013092, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.29999998211860657, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.6431543827056885, "rewards/repeat_penalty/std": 0.289379745721817, "rewards/repeat_floor/mean": 0.9589046239852905, "rewards/repeat_floor/std": 0.035241127014160156, "rewards/near_duplicate_penalty/mean": 0.8935448527336121, "rewards/near_duplicate_penalty/std": 0.09367447346448898, "rewards/opening_diversity/mean": 0.796875, "rewards/opening_diversity/std": 0.2106272578239441, "rewards/distinct_2/mean": 0.8562270998954773, "rewards/distinct_2/std": 0.12269478291273117, "rewards/total_composite/mean": 0.17606037855148315, "rewards/total_composite/std": 0.14399069547653198, "reward": 0.17606037855148315, "reward_std": 0.1439906805753708, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1685486137866974, "sampling/sampling_logp_difference/max": 1.5693578720092773, "sampling/importance_sampling_ratio/min": 0.2081788182258606, "sampling/importance_sampling_ratio/mean": 1.0289348363876343, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.343580350279808, "clip_ratio/low_mean": 0.05059830006211996, "clip_ratio/low_min": 0.05059830006211996, "clip_ratio/high_mean": 0.08685897663235664, "clip_ratio/high_max": 0.08685897663235664, "clip_ratio/region_mean": 0.1374572766944766, "reward_total_mean": 0.17606037855148315, "reward_meter_mean": 0.5654488205909729, "reward_meter_std": 0.3592325747013092, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6431543827056885, "reward_repeat_penalty_std": 0.289379745721817, "reward_repeat_floor_mean": 0.9589046239852905, "reward_repeat_floor_std": 0.035241127014160156, "reward_near_duplicate_penalty_mean": 0.8935448527336121, "reward_near_duplicate_penalty_std": 0.09367447346448898, "reward_opening_diversity_mean": 0.796875, "reward_opening_diversity_std": 0.2106272578239441, "reward_distinct_2_mean": 0.8562270998954773, "reward_distinct_2_std": 0.12269478291273117, "reward_judge_quality_mean": 0.29999998211860657, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.17606037855148315, "reward_total_composite_std": 0.14399069547653198} {"timestamp_utc": "2026-04-12T17:43:53Z", "mode": "train", "global_step": 489, "epoch": 0.02573548760591548, "loss": 0.0849, "grad_norm": 11.821260452270508, "learning_rate": 8.521212121212123e-06, "num_tokens": 907973.0, "completions/mean_length": 43.5, "completions/min_length": 39.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.5, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.9157294631004333, "rewards/meter/std": 0.10061603784561157, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5762499570846558, "rewards/judge_quality/std": 0.28665250539779663, "rewards/repeat_penalty/mean": 0.9101136326789856, "rewards/repeat_penalty/std": 0.21360865235328674, "rewards/repeat_floor/mean": 0.9878295660018921, "rewards/repeat_floor/std": 0.028341015800833702, "rewards/near_duplicate_penalty/mean": 0.9544407725334167, "rewards/near_duplicate_penalty/std": 0.08910517394542694, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9615384340286255, "rewards/distinct_2/std": 0.10878565162420273, "rewards/total_composite/mean": 0.5179541110992432, "rewards/total_composite/std": 0.2553533911705017, "reward": 0.5179541110992432, "reward_std": 0.2553533911705017, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1325424611568451, "sampling/sampling_logp_difference/max": 1.5777745246887207, "sampling/importance_sampling_ratio/min": 0.20643401145935059, "sampling/importance_sampling_ratio/mean": 1.0154997110366821, "sampling/importance_sampling_ratio/max": 1.8528239727020264, "entropy": 1.0343789383769035, "clip_ratio/low_mean": 0.08047807216644287, "clip_ratio/low_min": 0.08047807216644287, "clip_ratio/high_mean": 0.05606740806251764, "clip_ratio/high_max": 0.05606740806251764, "clip_ratio/region_mean": 0.13654548022896051, "reward_total_mean": 0.5179541110992432, "reward_meter_mean": 0.9157294631004333, "reward_meter_std": 0.10061603784561157, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9101136326789856, "reward_repeat_penalty_std": 0.21360865235328674, "reward_repeat_floor_mean": 0.9878295660018921, "reward_repeat_floor_std": 0.028341015800833702, "reward_near_duplicate_penalty_mean": 0.9544407725334167, "reward_near_duplicate_penalty_std": 0.08910517394542694, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9615384340286255, "reward_distinct_2_std": 0.10878565162420273, "reward_judge_quality_mean": 0.5762499570846558, "reward_judge_quality_std": 0.28665250539779663, "reward_total_composite_mean": 0.5179541110992432, "reward_total_composite_std": 0.2553533911705017} {"timestamp_utc": "2026-04-12T17:44:02Z", "mode": "train", "global_step": 490, "epoch": 0.02578811641492553, "loss": 0.0485, "grad_norm": 13.303430557250977, "learning_rate": 8.518181818181818e-06, "num_tokens": 909837.0, "completions/mean_length": 61.0, "completions/min_length": 54.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.0, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.9696242213249207, "rewards/meter/std": 0.028753528371453285, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.7327563762664795, "rewards/repeat_penalty/std": 0.16056913137435913, "rewards/repeat_floor/mean": 0.9657080173492432, "rewards/repeat_floor/std": 0.020789634436368942, "rewards/near_duplicate_penalty/mean": 0.8702481985092163, "rewards/near_duplicate_penalty/std": 0.0724751353263855, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8352308869361877, "rewards/distinct_2/std": 0.1276673525571823, "rewards/total_composite/mean": 0.2598779499530792, "rewards/total_composite/std": 0.13646939396858215, "reward": 0.2598779499530792, "reward_std": 0.13646937906742096, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1456131488084793, "sampling/sampling_logp_difference/max": 1.0862550735473633, "sampling/importance_sampling_ratio/min": 0.33747798204421997, "sampling/importance_sampling_ratio/mean": 1.037516474723816, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1825586631894112, "clip_ratio/low_mean": 0.06616924051195383, "clip_ratio/low_min": 0.06616924051195383, "clip_ratio/high_mean": 0.06505074258893728, "clip_ratio/high_max": 0.06505074258893728, "clip_ratio/region_mean": 0.1312199831008911, "reward_total_mean": 0.2598779499530792, "reward_meter_mean": 0.9696242213249207, "reward_meter_std": 0.028753528371453285, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7327563762664795, "reward_repeat_penalty_std": 0.16056913137435913, "reward_repeat_floor_mean": 0.9657080173492432, "reward_repeat_floor_std": 0.020789634436368942, "reward_near_duplicate_penalty_mean": 0.8702481985092163, "reward_near_duplicate_penalty_std": 0.0724751353263855, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8352308869361877, "reward_distinct_2_std": 0.1276673525571823, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.2598779499530792, "reward_total_composite_std": 0.13646939396858215} {"timestamp_utc": "2026-04-12T17:44:10Z", "mode": "train", "global_step": 491, "epoch": 0.025840745223935584, "loss": 0.047, "grad_norm": 24.3916015625, "learning_rate": 8.515151515151517e-06, "num_tokens": 911340.0, "completions/mean_length": 19.875, "completions/min_length": 19.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.875, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.8117765188217163, "rewards/meter/std": 0.23110267519950867, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7437499761581421, "rewards/judge_quality/std": 0.33683136105537415, "rewards/repeat_penalty/mean": 0.7433712482452393, "rewards/repeat_penalty/std": 0.018749047070741653, "rewards/repeat_floor/mean": 0.9836742877960205, "rewards/repeat_floor/std": 0.0037498052697628736, "rewards/near_duplicate_penalty/mean": 0.991161584854126, "rewards/near_duplicate_penalty/std": 0.024998728185892105, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6282688975334167, "rewards/total_composite/std": 0.3177328109741211, "reward": 0.6282688975334167, "reward_std": 0.3177328109741211, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17767982184886932, "sampling/sampling_logp_difference/max": 1.1688170433044434, "sampling/importance_sampling_ratio/min": 0.3107343018054962, "sampling/importance_sampling_ratio/mean": 1.010024905204773, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.949689231812954, "clip_ratio/low_mean": 0.02440476231276989, "clip_ratio/low_min": 0.02440476231276989, "clip_ratio/high_mean": 0.15888158092275262, "clip_ratio/high_max": 0.15888158092275262, "clip_ratio/region_mean": 0.1832863432355225, "reward_total_mean": 0.6282688975334167, "reward_meter_mean": 0.8117765188217163, "reward_meter_std": 0.23110267519950867, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7433712482452393, "reward_repeat_penalty_std": 0.018749047070741653, "reward_repeat_floor_mean": 0.9836742877960205, "reward_repeat_floor_std": 0.0037498052697628736, "reward_near_duplicate_penalty_mean": 0.991161584854126, "reward_near_duplicate_penalty_std": 0.024998728185892105, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7437499761581421, "reward_judge_quality_std": 0.33683136105537415, "reward_total_composite_mean": 0.6282688975334167, "reward_total_composite_std": 0.3177328109741211} {"timestamp_utc": "2026-04-12T17:44:19Z", "mode": "train", "global_step": 492, "epoch": 0.025893374032945636, "loss": -0.0398, "grad_norm": 13.04485034942627, "learning_rate": 8.512121212121213e-06, "num_tokens": 912984.0, "completions/mean_length": 47.5, "completions/min_length": 34.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.5, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.7978067398071289, "rewards/meter/std": 0.29664960503578186, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9685828685760498, "rewards/lexical_plausibility/std": 0.08886100351810455, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.3215142786502838, "rewards/repeat_penalty/mean": 0.9837372303009033, "rewards/repeat_penalty/std": 0.028607802465558052, "rewards/repeat_floor/mean": 0.9975606203079224, "rewards/repeat_floor/std": 0.004291166085749865, "rewards/near_duplicate_penalty/mean": 0.9837372303009033, "rewards/near_duplicate_penalty/std": 0.028607802465558052, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4801263213157654, "rewards/total_composite/std": 0.31657642126083374, "reward": 0.4801263213157654, "reward_std": 0.31657639145851135, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1806916892528534, "sampling/sampling_logp_difference/max": 2.440725326538086, "sampling/importance_sampling_ratio/min": 0.0870976522564888, "sampling/importance_sampling_ratio/mean": 1.026998519897461, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3460486084222794, "clip_ratio/low_mean": 0.1184615008533001, "clip_ratio/low_min": 0.1184615008533001, "clip_ratio/high_mean": 0.06188082788139582, "clip_ratio/high_max": 0.06188082788139582, "clip_ratio/region_mean": 0.1803423287346959, "reward_total_mean": 0.4801263213157654, "reward_meter_mean": 0.7978067398071289, "reward_meter_std": 0.29664960503578186, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9685828685760498, "reward_lexical_plausibility_std": 0.08886100351810455, "reward_repeat_penalty_mean": 0.9837372303009033, "reward_repeat_penalty_std": 0.028607802465558052, "reward_repeat_floor_mean": 0.9975606203079224, "reward_repeat_floor_std": 0.004291166085749865, "reward_near_duplicate_penalty_mean": 0.9837372303009033, "reward_near_duplicate_penalty_std": 0.028607802465558052, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.3215142786502838, "reward_total_composite_mean": 0.4801263213157654, "reward_total_composite_std": 0.31657642126083374} {"timestamp_utc": "2026-04-12T17:44:28Z", "mode": "train", "global_step": 493, "epoch": 0.025946002841955685, "loss": 0.0017, "grad_norm": 9.214557647705078, "learning_rate": 8.50909090909091e-06, "num_tokens": 915314.0, "completions/mean_length": 110.25, "completions/min_length": 100.0, "completions/max_length": 127.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 110.25, "completions/min_terminated_length": 100.0, "completions/max_terminated_length": 127.0, "rewards/meter/mean": 0.8839842677116394, "rewards/meter/std": 0.20048923790454865, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9718749523162842, "rewards/count_floor/std": 0.0388161838054657, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.837070107460022, "rewards/repeat_penalty/std": 0.15708816051483154, "rewards/repeat_floor/mean": 0.9832630157470703, "rewards/repeat_floor/std": 0.015097341500222683, "rewards/near_duplicate_penalty/mean": 0.9602870941162109, "rewards/near_duplicate_penalty/std": 0.03420589864253998, "rewards/opening_diversity/mean": 0.979687511920929, "rewards/opening_diversity/std": 0.03892387077212334, "rewards/distinct_2/mean": 0.8937630653381348, "rewards/distinct_2/std": 0.09784720838069916, "rewards/total_composite/mean": 0.3213406205177307, "rewards/total_composite/std": 0.06527985632419586, "reward": 0.3213406205177307, "reward_std": 0.06527985632419586, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1578797847032547, "sampling/sampling_logp_difference/max": 1.584580898284912, "sampling/importance_sampling_ratio/min": 0.20503370463848114, "sampling/importance_sampling_ratio/mean": 1.0144155025482178, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3237784206867218, "clip_ratio/low_mean": 0.04249957110732794, "clip_ratio/low_min": 0.04249957110732794, "clip_ratio/high_mean": 0.09139722678810358, "clip_ratio/high_max": 0.09139722678810358, "clip_ratio/region_mean": 0.13389679789543152, "reward_total_mean": 0.3213406205177307, "reward_meter_mean": 0.8839842677116394, "reward_meter_std": 0.20048923790454865, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9718749523162842, "reward_count_floor_std": 0.0388161838054657, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.837070107460022, "reward_repeat_penalty_std": 0.15708816051483154, "reward_repeat_floor_mean": 0.9832630157470703, "reward_repeat_floor_std": 0.015097341500222683, "reward_near_duplicate_penalty_mean": 0.9602870941162109, "reward_near_duplicate_penalty_std": 0.03420589864253998, "reward_opening_diversity_mean": 0.979687511920929, "reward_opening_diversity_std": 0.03892387077212334, "reward_distinct_2_mean": 0.8937630653381348, "reward_distinct_2_std": 0.09784720838069916, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.3213406205177307, "reward_total_composite_std": 0.06527985632419586} {"timestamp_utc": "2026-04-12T17:44:37Z", "mode": "train", "global_step": 494, "epoch": 0.025998631650965737, "loss": 0.0805, "grad_norm": 17.60483169555664, "learning_rate": 8.506060606060607e-06, "num_tokens": 917279.0, "completions/mean_length": 59.625, "completions/min_length": 42.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 59.625, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.46373629570007324, "rewards/meter/std": 0.27098947763442993, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.9890648722648621, "rewards/lexical_plausibility/std": 0.03092925436794758, "rewards/judge_quality/mean": 0.6499999761581421, "rewards/judge_quality/std": 0.24951381981372833, "rewards/repeat_penalty/mean": 0.9050288796424866, "rewards/repeat_penalty/std": 0.12336964905261993, "rewards/repeat_floor/mean": 0.9879235029220581, "rewards/repeat_floor/std": 0.01584974303841591, "rewards/near_duplicate_penalty/mean": 0.9508566856384277, "rewards/near_duplicate_penalty/std": 0.05863592028617859, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9477227926254272, "rewards/distinct_2/std": 0.08174040168523788, "rewards/total_composite/mean": 0.29722103476524353, "rewards/total_composite/std": 0.21231958270072937, "reward": 0.29722103476524353, "reward_std": 0.21231958270072937, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2143169790506363, "sampling/sampling_logp_difference/max": 3.088449478149414, "sampling/importance_sampling_ratio/min": 0.045572564005851746, "sampling/importance_sampling_ratio/mean": 1.012260913848877, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8211357221007347, "clip_ratio/low_mean": 0.12016293406486511, "clip_ratio/low_min": 0.12016293406486511, "clip_ratio/high_mean": 0.06825524382293224, "clip_ratio/high_max": 0.06825524382293224, "clip_ratio/region_mean": 0.18841817788779736, "reward_total_mean": 0.29722103476524353, "reward_meter_mean": 0.46373629570007324, "reward_meter_std": 0.27098947763442993, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.9890648722648621, "reward_lexical_plausibility_std": 0.03092925436794758, "reward_repeat_penalty_mean": 0.9050288796424866, "reward_repeat_penalty_std": 0.12336964905261993, "reward_repeat_floor_mean": 0.9879235029220581, "reward_repeat_floor_std": 0.01584974303841591, "reward_near_duplicate_penalty_mean": 0.9508566856384277, "reward_near_duplicate_penalty_std": 0.05863592028617859, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9477227926254272, "reward_distinct_2_std": 0.08174040168523788, "reward_judge_quality_mean": 0.6499999761581421, "reward_judge_quality_std": 0.24951381981372833, "reward_total_composite_mean": 0.29722103476524353, "reward_total_composite_std": 0.21231958270072937} {"timestamp_utc": "2026-04-12T17:44:51Z", "mode": "train", "global_step": 495, "epoch": 0.02605126045997579, "loss": -0.3182, "grad_norm": 2.1097261905670166, "learning_rate": 8.503030303030304e-06, "num_tokens": 920445.0, "completions/mean_length": 318.75, "completions/min_length": 231.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 254.33334350585938, "completions/min_terminated_length": 231.0, "completions/max_terminated_length": 271.0, "rewards/meter/mean": 0.9180511236190796, "rewards/meter/std": 0.16932040452957153, "rewards/count_adherence/mean": 0.7083333730697632, "rewards/count_adherence/std": 0.25153848528862, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9124999642372131, "rewards/count_floor/std": 0.07546153664588928, "rewards/lexical_plausibility/mean": 0.8847241401672363, "rewards/lexical_plausibility/std": 0.22568316757678986, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.4951223134994507, "rewards/repeat_penalty/std": 0.4002896249294281, "rewards/repeat_floor/mean": 0.9337047338485718, "rewards/repeat_floor/std": 0.06018609553575516, "rewards/near_duplicate_penalty/mean": 0.860082745552063, "rewards/near_duplicate_penalty/std": 0.14075830578804016, "rewards/opening_diversity/mean": 0.9040663838386536, "rewards/opening_diversity/std": 0.15982766449451447, "rewards/distinct_2/mean": 0.5605370402336121, "rewards/distinct_2/std": 0.36832550168037415, "rewards/total_composite/mean": 0.10159417241811752, "rewards/total_composite/std": 0.045214757323265076, "reward": 0.10159417241811752, "reward_std": 0.045214757323265076, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1317475438117981, "sampling/sampling_logp_difference/max": 1.3974332809448242, "sampling/importance_sampling_ratio/min": 0.24723073840141296, "sampling/importance_sampling_ratio/mean": 1.0292994976043701, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9910262078046799, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.08706481289118528, "clip_ratio/high_max": 0.08706481289118528, "clip_ratio/region_mean": 0.08706481289118528, "reward_total_mean": 0.10159417241811752, "reward_meter_mean": 0.9180511236190796, "reward_meter_std": 0.16932040452957153, "reward_count_adherence_mean": 0.7083333730697632, "reward_count_adherence_std": 0.25153848528862, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9124999642372131, "reward_count_floor_std": 0.07546153664588928, "reward_lexical_plausibility_mean": 0.8847241401672363, "reward_lexical_plausibility_std": 0.22568316757678986, "reward_repeat_penalty_mean": 0.4951223134994507, "reward_repeat_penalty_std": 0.4002896249294281, "reward_repeat_floor_mean": 0.9337047338485718, "reward_repeat_floor_std": 0.06018609553575516, "reward_near_duplicate_penalty_mean": 0.860082745552063, "reward_near_duplicate_penalty_std": 0.14075830578804016, "reward_opening_diversity_mean": 0.9040663838386536, "reward_opening_diversity_std": 0.15982766449451447, "reward_distinct_2_mean": 0.5605370402336121, "reward_distinct_2_std": 0.36832550168037415, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.10159417241811752, "reward_total_composite_std": 0.045214757323265076} {"timestamp_utc": "2026-04-12T17:45:05Z", "mode": "train", "global_step": 496, "epoch": 0.026103889268985842, "loss": -0.047, "grad_norm": 0.4166216254234314, "learning_rate": 8.5e-06, "num_tokens": 922535.0, "completions/mean_length": 398.25, "completions/min_length": 200.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 208.6666717529297, "completions/min_terminated_length": 200.0, "completions/max_terminated_length": 215.0, "rewards/meter/mean": 0.9173742532730103, "rewards/meter/std": 0.09787047654390335, "rewards/count_adherence/mean": 0.796875, "rewards/count_adherence/std": 0.09300298243761063, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9390624761581421, "rewards/count_floor/std": 0.027900882065296173, "rewards/lexical_plausibility/mean": 0.8016838431358337, "rewards/lexical_plausibility/std": 0.1831950843334198, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.5050085186958313, "rewards/repeat_penalty/std": 0.4174470007419586, "rewards/repeat_floor/mean": 0.9174864888191223, "rewards/repeat_floor/std": 0.08609236776828766, "rewards/near_duplicate_penalty/mean": 0.7942747473716736, "rewards/near_duplicate_penalty/std": 0.19653551280498505, "rewards/opening_diversity/mean": 0.7570332288742065, "rewards/opening_diversity/std": 0.3361288905143738, "rewards/distinct_2/mean": 0.588036060333252, "rewards/distinct_2/std": 0.44063302874565125, "rewards/total_composite/mean": 0.10686292499303818, "rewards/total_composite/std": 0.027179429307579994, "reward": 0.10686292499303818, "reward_std": 0.027179429307579994, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.07973871380090714, "sampling/sampling_logp_difference/max": 1.4409397840499878, "sampling/importance_sampling_ratio/min": 0.23670519888401031, "sampling/importance_sampling_ratio/mean": 1.0160298347473145, "sampling/importance_sampling_ratio/max": 1.79944908618927, "entropy": 0.2535622864961624, "clip_ratio/low_mean": 0.004651162773370743, "clip_ratio/low_min": 0.004651162773370743, "clip_ratio/high_mean": 0.02072867378592491, "clip_ratio/high_max": 0.02072867378592491, "clip_ratio/region_mean": 0.025379836559295654, "reward_total_mean": 0.10686292499303818, "reward_meter_mean": 0.9173742532730103, "reward_meter_std": 0.09787047654390335, "reward_count_adherence_mean": 0.796875, "reward_count_adherence_std": 0.09300298243761063, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9390624761581421, "reward_count_floor_std": 0.027900882065296173, "reward_lexical_plausibility_mean": 0.8016838431358337, "reward_lexical_plausibility_std": 0.1831950843334198, "reward_repeat_penalty_mean": 0.5050085186958313, "reward_repeat_penalty_std": 0.4174470007419586, "reward_repeat_floor_mean": 0.9174864888191223, "reward_repeat_floor_std": 0.08609236776828766, "reward_near_duplicate_penalty_mean": 0.7942747473716736, "reward_near_duplicate_penalty_std": 0.19653551280498505, "reward_opening_diversity_mean": 0.7570332288742065, "reward_opening_diversity_std": 0.3361288905143738, "reward_distinct_2_mean": 0.588036060333252, "reward_distinct_2_std": 0.44063302874565125, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.10686292499303818, "reward_total_composite_std": 0.027179429307579994} {"timestamp_utc": "2026-04-12T17:45:19Z", "mode": "train", "global_step": 497, "epoch": 0.026156518077995895, "loss": -0.0397, "grad_norm": 5.391056537628174, "learning_rate": 8.496969696969697e-06, "num_tokens": 924183.0, "completions/mean_length": 101.0, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 42.28571701049805, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.7750760316848755, "rewards/meter/std": 0.38514024019241333, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8815553188323975, "rewards/lexical_plausibility/std": 0.2033458650112152, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.2133909910917282, "rewards/repeat_penalty/mean": 0.9121878147125244, "rewards/repeat_penalty/std": 0.08433179557323456, "rewards/repeat_floor/mean": 0.9911338686943054, "rewards/repeat_floor/std": 0.006743339356034994, "rewards/near_duplicate_penalty/mean": 0.9704256057739258, "rewards/near_duplicate_penalty/std": 0.027934445068240166, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.971611738204956, "rewards/distinct_2/std": 0.03919585049152374, "rewards/total_composite/mean": 0.35213810205459595, "rewards/total_composite/std": 0.23824480175971985, "reward": 0.35213810205459595, "reward_std": 0.23824478685855865, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17342451214790344, "sampling/sampling_logp_difference/max": 1.6927714347839355, "sampling/importance_sampling_ratio/min": 0.18400885164737701, "sampling/importance_sampling_ratio/mean": 1.0089201927185059, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.298454836010933, "clip_ratio/low_mean": 0.027465221472084522, "clip_ratio/low_min": 0.027465221472084522, "clip_ratio/high_mean": 0.10987714119255543, "clip_ratio/high_max": 0.10987714119255543, "clip_ratio/region_mean": 0.13734236266463995, "reward_total_mean": 0.35213810205459595, "reward_meter_mean": 0.7750760316848755, "reward_meter_std": 0.38514024019241333, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8815553188323975, "reward_lexical_plausibility_std": 0.2033458650112152, "reward_repeat_penalty_mean": 0.9121878147125244, "reward_repeat_penalty_std": 0.08433179557323456, "reward_repeat_floor_mean": 0.9911338686943054, "reward_repeat_floor_std": 0.006743339356034994, "reward_near_duplicate_penalty_mean": 0.9704256057739258, "reward_near_duplicate_penalty_std": 0.027934445068240166, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.971611738204956, "reward_distinct_2_std": 0.03919585049152374, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.2133909910917282, "reward_total_composite_mean": 0.35213810205459595, "reward_total_composite_std": 0.23824480175971985} {"timestamp_utc": "2026-04-12T17:45:28Z", "mode": "train", "global_step": 498, "epoch": 0.026209146887005947, "loss": 0.0807, "grad_norm": 13.27564525604248, "learning_rate": 8.493939393939394e-06, "num_tokens": 926069.0, "completions/mean_length": 63.75, "completions/min_length": 57.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.75, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.6959583759307861, "rewards/meter/std": 0.4100753664970398, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5837499499320984, "rewards/judge_quality/std": 0.23231369256973267, "rewards/repeat_penalty/mean": 0.9601210355758667, "rewards/repeat_penalty/std": 0.05876023322343826, "rewards/repeat_floor/mean": 0.9952081441879272, "rewards/repeat_floor/std": 0.006436796393245459, "rewards/near_duplicate_penalty/mean": 0.9813921451568604, "rewards/near_duplicate_penalty/std": 0.018059436231851578, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9777709245681763, "rewards/distinct_2/std": 0.046208228915929794, "rewards/total_composite/mean": 0.38639330863952637, "rewards/total_composite/std": 0.2618277966976166, "reward": 0.38639330863952637, "reward_std": 0.2618277668952942, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15465795993804932, "sampling/sampling_logp_difference/max": 1.8801250457763672, "sampling/importance_sampling_ratio/min": 0.15257102251052856, "sampling/importance_sampling_ratio/mean": 1.0143102407455444, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1680407375097275, "clip_ratio/low_mean": 0.07754085771739483, "clip_ratio/low_min": 0.07754085771739483, "clip_ratio/high_mean": 0.08074276801198721, "clip_ratio/high_max": 0.08074276801198721, "clip_ratio/region_mean": 0.15828362572938204, "reward_total_mean": 0.38639330863952637, "reward_meter_mean": 0.6959583759307861, "reward_meter_std": 0.4100753664970398, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9601210355758667, "reward_repeat_penalty_std": 0.05876023322343826, "reward_repeat_floor_mean": 0.9952081441879272, "reward_repeat_floor_std": 0.006436796393245459, "reward_near_duplicate_penalty_mean": 0.9813921451568604, "reward_near_duplicate_penalty_std": 0.018059436231851578, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9777709245681763, "reward_distinct_2_std": 0.046208228915929794, "reward_judge_quality_mean": 0.5837499499320984, "reward_judge_quality_std": 0.23231369256973267, "reward_total_composite_mean": 0.38639330863952637, "reward_total_composite_std": 0.2618277966976166} {"timestamp_utc": "2026-04-12T17:45:38Z", "mode": "train", "global_step": 499, "epoch": 0.026261775696016, "loss": -0.0282, "grad_norm": 15.101868629455566, "learning_rate": 8.490909090909092e-06, "num_tokens": 928039.0, "completions/mean_length": 72.25, "completions/min_length": 61.0, "completions/max_length": 85.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 72.25, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 85.0, "rewards/meter/mean": 0.10586683452129364, "rewards/meter/std": 0.11134783923625946, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.7124732136726379, "rewards/repeat_penalty/std": 0.25966528058052063, "rewards/repeat_floor/mean": 0.9673922061920166, "rewards/repeat_floor/std": 0.03315800055861473, "rewards/near_duplicate_penalty/mean": 0.9282726645469666, "rewards/near_duplicate_penalty/std": 0.07145749032497406, "rewards/opening_diversity/mean": 0.8619791269302368, "rewards/opening_diversity/std": 0.21791578829288483, "rewards/distinct_2/mean": 0.849250078201294, "rewards/distinct_2/std": 0.11509034037590027, "rewards/total_composite/mean": 0.03694423288106918, "rewards/total_composite/std": 0.037478912621736526, "reward": 0.03694423288106918, "reward_std": 0.037478912621736526, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19849267601966858, "sampling/sampling_logp_difference/max": 2.7425365447998047, "sampling/importance_sampling_ratio/min": 0.06440676748752594, "sampling/importance_sampling_ratio/mean": 1.0187902450561523, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0103928744792938, "clip_ratio/low_mean": 0.11610000394284725, "clip_ratio/low_min": 0.11610000394284725, "clip_ratio/high_mean": 0.06790966540575027, "clip_ratio/high_max": 0.06790966540575027, "clip_ratio/region_mean": 0.18400966934859753, "reward_total_mean": 0.03694423288106918, "reward_meter_mean": 0.10586683452129364, "reward_meter_std": 0.11134783923625946, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7124732136726379, "reward_repeat_penalty_std": 0.25966528058052063, "reward_repeat_floor_mean": 0.9673922061920166, "reward_repeat_floor_std": 0.03315800055861473, "reward_near_duplicate_penalty_mean": 0.9282726645469666, "reward_near_duplicate_penalty_std": 0.07145749032497406, "reward_opening_diversity_mean": 0.8619791269302368, "reward_opening_diversity_std": 0.21791578829288483, "reward_distinct_2_mean": 0.849250078201294, "reward_distinct_2_std": 0.11509034037590027, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.03694423288106918, "reward_total_composite_std": 0.037478912621736526} {"timestamp_utc": "2026-04-12T17:45:46Z", "mode": "train", "global_step": 500, "epoch": 0.026314404505026052, "loss": 0.047, "grad_norm": 13.783639907836914, "learning_rate": 8.487878787878789e-06, "num_tokens": 929661.0, "completions/mean_length": 47.75, "completions/min_length": 42.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.75, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.8805423974990845, "rewards/meter/std": 0.3042807877063751, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390503644943237, "rewards/repeat_penalty/mean": 0.9955461025238037, "rewards/repeat_penalty/std": 0.008062711916863918, "rewards/repeat_floor/mean": 0.9993319511413574, "rewards/repeat_floor/std": 0.0012094092089682817, "rewards/near_duplicate_penalty/mean": 0.9955461025238037, "rewards/near_duplicate_penalty/std": 0.008062711916863918, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4048282504081726, "rewards/total_composite/std": 0.2536325752735138, "reward": 0.4048282504081726, "reward_std": 0.2536325752735138, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18422798812389374, "sampling/sampling_logp_difference/max": 1.2962336540222168, "sampling/importance_sampling_ratio/min": 0.2897098660469055, "sampling/importance_sampling_ratio/mean": 1.0293875932693481, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6455870270729065, "clip_ratio/low_mean": 0.039795113960281014, "clip_ratio/low_min": 0.039795113960281014, "clip_ratio/high_mean": 0.07668384909629822, "clip_ratio/high_max": 0.07668384909629822, "clip_ratio/region_mean": 0.11647896305657923, "reward_total_mean": 0.4048282504081726, "reward_meter_mean": 0.8805423974990845, "reward_meter_std": 0.3042807877063751, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9955461025238037, "reward_repeat_penalty_std": 0.008062711916863918, "reward_repeat_floor_mean": 0.9993319511413574, "reward_repeat_floor_std": 0.0012094092089682817, "reward_near_duplicate_penalty_mean": 0.9955461025238037, "reward_near_duplicate_penalty_std": 0.008062711916863918, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390503644943237, "reward_total_composite_mean": 0.4048282504081726, "reward_total_composite_std": 0.2536325752735138} {"timestamp_utc": "2026-04-12T17:48:06Z", "mode": "eval", "global_step": 500, "epoch": 0.026314404505026052, "eval_loss": NaN, "eval_runtime": 140.0077, "eval_samples_per_second": 0.743, "eval_steps_per_second": 0.093, "eval_num_tokens": 929661.0, "eval_completions/mean_length": 207.94230769230768, "eval_completions/min_length": 39.30769230769231, "eval_completions/max_length": 445.15384615384613, "eval_completions/clipped_ratio": 0.1346153846153846, "eval_completions/mean_terminated_length": 161.69734896146335, "eval_completions/min_terminated_length": 39.30769230769231, "eval_completions/max_terminated_length": 353.38461538461536, "eval_rewards/meter/mean": 0.6244613459477057, "eval_rewards/meter/std": 0.3818479042786818, "eval_rewards/count_adherence/mean": 0.8154045114150414, "eval_rewards/count_adherence/std": 0.19789515779568598, "eval_rewards/arabic_clean/mean": 0.8461538461538461, "eval_rewards/arabic_clean/std": 0.2952340107697707, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9985576913906977, "eval_rewards/arabic_floor/std": 0.004079461670838869, "eval_rewards/count_floor/mean": 0.9446213566339933, "eval_rewards/count_floor/std": 0.05936854848494896, "eval_rewards/lexical_plausibility/mean": 0.9487303587106558, "eval_rewards/lexical_plausibility/std": 0.10835179056112583, "eval_rewards/judge_quality/mean": 0.32451922733050126, "eval_rewards/judge_quality/std": 0.1936850673877276, "eval_rewards/repeat_penalty/mean": 0.6094352167386275, "eval_rewards/repeat_penalty/std": 0.3754282702620213, "eval_rewards/repeat_floor/mean": 0.9471771717071533, "eval_rewards/repeat_floor/std": 0.06034939077038031, "eval_rewards/near_duplicate_penalty/mean": 0.8858882188796997, "eval_rewards/near_duplicate_penalty/std": 0.1401778683066368, "eval_rewards/opening_diversity/mean": 0.904761268542363, "eval_rewards/opening_diversity/std": 0.1724496314731928, "eval_rewards/distinct_2/mean": 0.6667584410080543, "eval_rewards/distinct_2/std": 0.3708963772425285, "eval_rewards/total_composite/mean": 0.1807767548240148, "eval_rewards/total_composite/std": 0.157410629093647, "eval_reward": 0.1807767548240148, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.07252437248826027, "eval_sampling/sampling_logp_difference/max": 1.2025261658888597, "eval_sampling/importance_sampling_ratio/min": 0.3037391614455443, "eval_sampling/importance_sampling_ratio/mean": 1.0198851548708403, "eval_sampling/importance_sampling_ratio/max": 1.5503454300073476, "eval_entropy": 0.8679274183053237, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.1807767548240148, "eval_reward_meter_mean": 0.6244613459477057, "eval_reward_meter_std": 0.3818479042786818, "eval_reward_count_adherence_mean": 0.8154045114150414, "eval_reward_count_adherence_std": 0.19789515779568598, "eval_reward_arabic_clean_mean": 0.8461538461538461, "eval_reward_arabic_clean_std": 0.2952340107697707, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9985576913906977, "eval_reward_arabic_floor_std": 0.004079461670838869, "eval_reward_count_floor_mean": 0.9446213566339933, "eval_reward_count_floor_std": 0.05936854848494896, "eval_reward_lexical_plausibility_mean": 0.9487303587106558, "eval_reward_lexical_plausibility_std": 0.10835179056112583, "eval_reward_repeat_penalty_mean": 0.6094352167386275, "eval_reward_repeat_penalty_std": 0.3754282702620213, "eval_reward_repeat_floor_mean": 0.9471771717071533, "eval_reward_repeat_floor_std": 0.06034939077038031, "eval_reward_near_duplicate_penalty_mean": 0.8858882188796997, "eval_reward_near_duplicate_penalty_std": 0.1401778683066368, "eval_reward_opening_diversity_mean": 0.904761268542363, "eval_reward_opening_diversity_std": 0.1724496314731928, "eval_reward_distinct_2_mean": 0.6667584410080543, "eval_reward_distinct_2_std": 0.3708963772425285, "eval_reward_judge_quality_mean": 0.32451922733050126, "eval_reward_judge_quality_std": 0.1936850673877276, "eval_reward_total_composite_mean": 0.1807767548240148, "eval_reward_total_composite_std": 0.157410629093647} {"timestamp_utc": "2026-04-12T17:48:24Z", "mode": "train", "global_step": 501, "epoch": 0.026367033314036104, "loss": -0.0266, "grad_norm": 2.2380096912384033, "learning_rate": 8.484848484848486e-06, "num_tokens": 931082.0, "completions/mean_length": 146.625, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 24.83333396911621, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.6835510730743408, "rewards/meter/std": 0.42393729090690613, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.619035542011261, "rewards/lexical_plausibility/std": 0.19606757164001465, "rewards/judge_quality/mean": 0.3175000250339508, "rewards/judge_quality/std": 0.3744233548641205, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27723225951194763, "rewards/total_composite/std": 0.3852379620075226, "reward": 0.27723225951194763, "reward_std": 0.3852379620075226, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17146243155002594, "sampling/sampling_logp_difference/max": 1.5724658966064453, "sampling/importance_sampling_ratio/min": 0.20753279328346252, "sampling/importance_sampling_ratio/mean": 1.0229686498641968, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2139780223369598, "clip_ratio/low_mean": 0.07788322027772665, "clip_ratio/low_min": 0.07788322027772665, "clip_ratio/high_mean": 0.04282407369464636, "clip_ratio/high_max": 0.04282407369464636, "clip_ratio/region_mean": 0.12070729397237301, "reward_total_mean": 0.27723225951194763, "reward_meter_mean": 0.6835510730743408, "reward_meter_std": 0.42393729090690613, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.619035542011261, "reward_lexical_plausibility_std": 0.19606757164001465, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3175000250339508, "reward_judge_quality_std": 0.3744233548641205, "reward_total_composite_mean": 0.27723225951194763, "reward_total_composite_std": 0.3852379620075226} {"timestamp_utc": "2026-04-12T17:48:33Z", "mode": "train", "global_step": 502, "epoch": 0.026419662123046157, "loss": 0.0553, "grad_norm": 18.66092872619629, "learning_rate": 8.481818181818182e-06, "num_tokens": 932642.0, "completions/mean_length": 36.0, "completions/min_length": 32.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.0, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.8124307990074158, "rewards/meter/std": 0.2910243570804596, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9420679211616516, "rewards/repeat_penalty/std": 0.11843415349721909, "rewards/repeat_floor/mean": 0.9940252900123596, "rewards/repeat_floor/std": 0.010170619934797287, "rewards/near_duplicate_penalty/mean": 0.9787415862083435, "rewards/near_duplicate_penalty/std": 0.01927022822201252, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.23945167660713196, "rewards/total_composite/std": 0.1405368149280548, "reward": 0.23945167660713196, "reward_std": 0.1405368149280548, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1669476330280304, "sampling/sampling_logp_difference/max": 1.7191133499145508, "sampling/importance_sampling_ratio/min": 0.17922499775886536, "sampling/importance_sampling_ratio/mean": 1.0241307020187378, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2724262177944183, "clip_ratio/low_mean": 0.09334236197173595, "clip_ratio/low_min": 0.09334236197173595, "clip_ratio/high_mean": 0.05911458469927311, "clip_ratio/high_max": 0.05911458469927311, "clip_ratio/region_mean": 0.15245694667100906, "reward_total_mean": 0.23945167660713196, "reward_meter_mean": 0.8124307990074158, "reward_meter_std": 0.2910243570804596, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9420679211616516, "reward_repeat_penalty_std": 0.11843415349721909, "reward_repeat_floor_mean": 0.9940252900123596, "reward_repeat_floor_std": 0.010170619934797287, "reward_near_duplicate_penalty_mean": 0.9787415862083435, "reward_near_duplicate_penalty_std": 0.01927022822201252, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.23945167660713196, "reward_total_composite_std": 0.1405368149280548} {"timestamp_utc": "2026-04-12T17:48:42Z", "mode": "train", "global_step": 503, "epoch": 0.02647229093205621, "loss": 0.0894, "grad_norm": 28.734704971313477, "learning_rate": 8.478787878787879e-06, "num_tokens": 934168.0, "completions/mean_length": 32.75, "completions/min_length": 31.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.75, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.6736565828323364, "rewards/meter/std": 0.42780157923698425, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.2671777307987213, "rewards/repeat_penalty/mean": 0.9625290632247925, "rewards/repeat_penalty/std": 0.038888026028871536, "rewards/repeat_floor/mean": 0.9943793416023254, "rewards/repeat_floor/std": 0.005833211820572615, "rewards/near_duplicate_penalty/mean": 0.9625290632247925, "rewards/near_duplicate_penalty/std": 0.038888026028871536, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4264630377292633, "rewards/total_composite/std": 0.31055524945259094, "reward": 0.4264630377292633, "reward_std": 0.31055521965026855, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17910559475421906, "sampling/sampling_logp_difference/max": 1.668534755706787, "sampling/importance_sampling_ratio/min": 0.1885230988264084, "sampling/importance_sampling_ratio/mean": 0.9994204044342041, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0970648378133774, "clip_ratio/low_mean": 0.05626591667532921, "clip_ratio/low_min": 0.05626591667532921, "clip_ratio/high_mean": 0.08261030213907361, "clip_ratio/high_max": 0.08261030213907361, "clip_ratio/region_mean": 0.13887621881440282, "reward_total_mean": 0.4264630377292633, "reward_meter_mean": 0.6736565828323364, "reward_meter_std": 0.42780157923698425, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9625290632247925, "reward_repeat_penalty_std": 0.038888026028871536, "reward_repeat_floor_mean": 0.9943793416023254, "reward_repeat_floor_std": 0.005833211820572615, "reward_near_duplicate_penalty_mean": 0.9625290632247925, "reward_near_duplicate_penalty_std": 0.038888026028871536, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.2671777307987213, "reward_total_composite_mean": 0.4264630377292633, "reward_total_composite_std": 0.31055524945259094} {"timestamp_utc": "2026-04-12T17:48:50Z", "mode": "train", "global_step": 504, "epoch": 0.026524919741066258, "loss": 0.0829, "grad_norm": 21.916610717773438, "learning_rate": 8.475757575757576e-06, "num_tokens": 935611.0, "completions/mean_length": 20.375, "completions/min_length": 18.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.375, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.779515266418457, "rewards/meter/std": 0.30250662565231323, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9703159332275391, "rewards/lexical_plausibility/std": 0.08395931124687195, "rewards/judge_quality/mean": 0.8237500190734863, "rewards/judge_quality/std": 0.2722361385822296, "rewards/repeat_penalty/mean": 0.7487824559211731, "rewards/repeat_penalty/std": 0.003443692810833454, "rewards/repeat_floor/mean": 0.9847564697265625, "rewards/repeat_floor/std": 0.0006887427298352122, "rewards/near_duplicate_penalty/mean": 0.9983766078948975, "rewards/near_duplicate_penalty/std": 0.004591604229062796, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6573514342308044, "rewards/total_composite/std": 0.3476335406303406, "reward": 0.6573514342308044, "reward_std": 0.3476335406303406, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17827972769737244, "sampling/sampling_logp_difference/max": 1.0622525215148926, "sampling/importance_sampling_ratio/min": 0.3456763029098511, "sampling/importance_sampling_ratio/mean": 1.0323456525802612, "sampling/importance_sampling_ratio/max": 1.8639169931411743, "entropy": 1.3325960487127304, "clip_ratio/low_mean": 0.03958333469927311, "clip_ratio/low_min": 0.03958333469927311, "clip_ratio/high_mean": 0.07093254057690501, "clip_ratio/high_max": 0.07093254057690501, "clip_ratio/region_mean": 0.11051587527617812, "reward_total_mean": 0.6573514342308044, "reward_meter_mean": 0.779515266418457, "reward_meter_std": 0.30250662565231323, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9703159332275391, "reward_lexical_plausibility_std": 0.08395931124687195, "reward_repeat_penalty_mean": 0.7487824559211731, "reward_repeat_penalty_std": 0.003443692810833454, "reward_repeat_floor_mean": 0.9847564697265625, "reward_repeat_floor_std": 0.0006887427298352122, "reward_near_duplicate_penalty_mean": 0.9983766078948975, "reward_near_duplicate_penalty_std": 0.004591604229062796, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8237500190734863, "reward_judge_quality_std": 0.2722361385822296, "reward_total_composite_mean": 0.6573514342308044, "reward_total_composite_std": 0.3476335406303406} {"timestamp_utc": "2026-04-12T17:49:04Z", "mode": "train", "global_step": 505, "epoch": 0.02657754855007631, "loss": -0.1554, "grad_norm": 3.5683786869049072, "learning_rate": 8.472727272727274e-06, "num_tokens": 937850.0, "completions/mean_length": 216.875, "completions/min_length": 103.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 118.5, "completions/min_terminated_length": 103.0, "completions/max_terminated_length": 130.0, "rewards/meter/mean": 0.34393617510795593, "rewards/meter/std": 0.2458122968673706, "rewards/count_adherence/mean": 0.7749999761581421, "rewards/count_adherence/std": 0.19820624589920044, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9325000047683716, "rewards/count_floor/std": 0.05946187674999237, "rewards/lexical_plausibility/mean": 0.8972842693328857, "rewards/lexical_plausibility/std": 0.21046949923038483, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.84952712059021, "rewards/repeat_penalty/std": 0.22977428138256073, "rewards/repeat_floor/mean": 0.9812049865722656, "rewards/repeat_floor/std": 0.029502667486667633, "rewards/near_duplicate_penalty/mean": 0.9400865435600281, "rewards/near_duplicate_penalty/std": 0.07793454080820084, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9118558168411255, "rewards/distinct_2/std": 0.14232002198696136, "rewards/total_composite/mean": 0.11806898564100266, "rewards/total_composite/std": 0.09317027777433395, "reward": 0.11806898564100266, "reward_std": 0.09317027777433395, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18992212414741516, "sampling/sampling_logp_difference/max": 2.0112175941467285, "sampling/importance_sampling_ratio/min": 0.1338256299495697, "sampling/importance_sampling_ratio/mean": 1.0228536128997803, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0625020116567612, "clip_ratio/low_mean": 0.0348020913079381, "clip_ratio/low_min": 0.0348020913079381, "clip_ratio/high_mean": 0.08876976557075977, "clip_ratio/high_max": 0.08876976557075977, "clip_ratio/region_mean": 0.12357185687869787, "reward_total_mean": 0.11806898564100266, "reward_meter_mean": 0.34393617510795593, "reward_meter_std": 0.2458122968673706, "reward_count_adherence_mean": 0.7749999761581421, "reward_count_adherence_std": 0.19820624589920044, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9325000047683716, "reward_count_floor_std": 0.05946187674999237, "reward_lexical_plausibility_mean": 0.8972842693328857, "reward_lexical_plausibility_std": 0.21046949923038483, "reward_repeat_penalty_mean": 0.84952712059021, "reward_repeat_penalty_std": 0.22977428138256073, "reward_repeat_floor_mean": 0.9812049865722656, "reward_repeat_floor_std": 0.029502667486667633, "reward_near_duplicate_penalty_mean": 0.9400865435600281, "reward_near_duplicate_penalty_std": 0.07793454080820084, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9118558168411255, "reward_distinct_2_std": 0.14232002198696136, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.11806898564100266, "reward_total_composite_std": 0.09317027777433395} {"timestamp_utc": "2026-04-12T17:49:18Z", "mode": "train", "global_step": 506, "epoch": 0.026630177359086363, "loss": -0.0499, "grad_norm": 4.9672064781188965, "learning_rate": 8.46969696969697e-06, "num_tokens": 939513.0, "completions/mean_length": 109.875, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 52.42857360839844, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.7858970165252686, "rewards/meter/std": 0.35001009702682495, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9274303913116455, "rewards/lexical_plausibility/std": 0.19019381701946259, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.26384180784225464, "rewards/repeat_penalty/mean": 0.9860967397689819, "rewards/repeat_penalty/std": 0.02008829265832901, "rewards/repeat_floor/mean": 0.9980258941650391, "rewards/repeat_floor/std": 0.002791586797684431, "rewards/near_duplicate_penalty/mean": 0.9880580306053162, "rewards/near_duplicate_penalty/std": 0.016480281949043274, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9979685544967651, "rewards/distinct_2/std": 0.005745711270719767, "rewards/total_composite/mean": 0.3787696659564972, "rewards/total_composite/std": 0.30826422572135925, "reward": 0.3787696659564972, "reward_std": 0.30826425552368164, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16874362528324127, "sampling/sampling_logp_difference/max": 1.6193904876708984, "sampling/importance_sampling_ratio/min": 0.1980193555355072, "sampling/importance_sampling_ratio/mean": 1.0501161813735962, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.258274033665657, "clip_ratio/low_mean": 0.06342687178403139, "clip_ratio/low_min": 0.06342687178403139, "clip_ratio/high_mean": 0.07070060167461634, "clip_ratio/high_max": 0.07070060167461634, "clip_ratio/region_mean": 0.13412747345864773, "reward_total_mean": 0.3787696659564972, "reward_meter_mean": 0.7858970165252686, "reward_meter_std": 0.35001009702682495, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9274303913116455, "reward_lexical_plausibility_std": 0.19019381701946259, "reward_repeat_penalty_mean": 0.9860967397689819, "reward_repeat_penalty_std": 0.02008829265832901, "reward_repeat_floor_mean": 0.9980258941650391, "reward_repeat_floor_std": 0.002791586797684431, "reward_near_duplicate_penalty_mean": 0.9880580306053162, "reward_near_duplicate_penalty_std": 0.016480281949043274, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9979685544967651, "reward_distinct_2_std": 0.005745711270719767, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.26384180784225464, "reward_total_composite_mean": 0.3787696659564972, "reward_total_composite_std": 0.30826422572135925} {"timestamp_utc": "2026-04-12T17:49:32Z", "mode": "train", "global_step": 507, "epoch": 0.026682806168096415, "loss": -0.1184, "grad_norm": 7.1238603591918945, "learning_rate": 8.466666666666668e-06, "num_tokens": 942101.0, "completions/mean_length": 179.5, "completions/min_length": 106.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 132.0, "completions/min_terminated_length": 106.0, "completions/max_terminated_length": 150.0, "rewards/meter/mean": 0.7116265296936035, "rewards/meter/std": 0.21642476320266724, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9625000357627869, "rewards/count_floor/std": 0.031052952632308006, "rewards/lexical_plausibility/mean": 0.9538431763648987, "rewards/lexical_plausibility/std": 0.13055117428302765, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.9227674603462219, "rewards/repeat_penalty/std": 0.15741252899169922, "rewards/repeat_floor/mean": 0.9924988746643066, "rewards/repeat_floor/std": 0.013243019580841064, "rewards/near_duplicate_penalty/mean": 0.9739339351654053, "rewards/near_duplicate_penalty/std": 0.033551253378391266, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9600974321365356, "rewards/distinct_2/std": 0.0936034694314003, "rewards/total_composite/mean": 0.22344699501991272, "rewards/total_composite/std": 0.10760604590177536, "reward": 0.22344699501991272, "reward_std": 0.10760603845119476, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.23907411098480225, "sampling/sampling_logp_difference/max": 2.4978647232055664, "sampling/importance_sampling_ratio/min": 0.08226045966148376, "sampling/importance_sampling_ratio/mean": 0.9915637969970703, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9913438484072685, "clip_ratio/low_mean": 0.061237018555402756, "clip_ratio/low_min": 0.061237018555402756, "clip_ratio/high_mean": 0.10777921229600906, "clip_ratio/high_max": 0.10777921229600906, "clip_ratio/region_mean": 0.16901623085141182, "reward_total_mean": 0.22344699501991272, "reward_meter_mean": 0.7116265296936035, "reward_meter_std": 0.21642476320266724, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9625000357627869, "reward_count_floor_std": 0.031052952632308006, "reward_lexical_plausibility_mean": 0.9538431763648987, "reward_lexical_plausibility_std": 0.13055117428302765, "reward_repeat_penalty_mean": 0.9227674603462219, "reward_repeat_penalty_std": 0.15741252899169922, "reward_repeat_floor_mean": 0.9924988746643066, "reward_repeat_floor_std": 0.013243019580841064, "reward_near_duplicate_penalty_mean": 0.9739339351654053, "reward_near_duplicate_penalty_std": 0.033551253378391266, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9600974321365356, "reward_distinct_2_std": 0.0936034694314003, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.22344699501991272, "reward_total_composite_std": 0.10760604590177536} {"timestamp_utc": "2026-04-12T17:49:40Z", "mode": "train", "global_step": 508, "epoch": 0.026735434977106468, "loss": 0.0503, "grad_norm": 16.859115600585938, "learning_rate": 8.463636363636364e-06, "num_tokens": 943665.0, "completions/mean_length": 40.5, "completions/min_length": 32.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.5, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.840571403503418, "rewards/meter/std": 0.2462586909532547, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8600000143051147, "rewards/judge_quality/std": 0.16673332452774048, "rewards/repeat_penalty/mean": 0.9342851042747498, "rewards/repeat_penalty/std": 0.11919376254081726, "rewards/repeat_floor/mean": 0.9927542209625244, "rewards/repeat_floor/std": 0.010998665355145931, "rewards/near_duplicate_penalty/mean": 0.9692113399505615, "rewards/near_duplicate_penalty/std": 0.03722553700208664, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.708553671836853, "rewards/total_composite/std": 0.2429817020893097, "reward": 0.708553671836853, "reward_std": 0.2429817020893097, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18467795848846436, "sampling/sampling_logp_difference/max": 1.2500619888305664, "sampling/importance_sampling_ratio/min": 0.28648704290390015, "sampling/importance_sampling_ratio/mean": 1.0246526002883911, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1481572911143303, "clip_ratio/low_mean": 0.07120298407971859, "clip_ratio/low_min": 0.07120298407971859, "clip_ratio/high_mean": 0.10157212615013123, "clip_ratio/high_max": 0.10157212615013123, "clip_ratio/region_mean": 0.17277511022984982, "reward_total_mean": 0.708553671836853, "reward_meter_mean": 0.840571403503418, "reward_meter_std": 0.2462586909532547, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9342851042747498, "reward_repeat_penalty_std": 0.11919376254081726, "reward_repeat_floor_mean": 0.9927542209625244, "reward_repeat_floor_std": 0.010998665355145931, "reward_near_duplicate_penalty_mean": 0.9692113399505615, "reward_near_duplicate_penalty_std": 0.03722553700208664, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.8600000143051147, "reward_judge_quality_std": 0.16673332452774048, "reward_total_composite_mean": 0.708553671836853, "reward_total_composite_std": 0.2429817020893097} {"timestamp_utc": "2026-04-12T17:49:48Z", "mode": "train", "global_step": 509, "epoch": 0.02678806378611652, "loss": -0.0455, "grad_norm": 15.400981903076172, "learning_rate": 8.460606060606061e-06, "num_tokens": 945077.0, "completions/mean_length": 35.5, "completions/min_length": 31.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.8986762762069702, "rewards/meter/std": 0.12459779530763626, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9183171987533569, "rewards/repeat_penalty/std": 0.10537010431289673, "rewards/repeat_floor/mean": 0.9916671514511108, "rewards/repeat_floor/std": 0.00818734522908926, "rewards/near_duplicate_penalty/mean": 0.9737309217453003, "rewards/near_duplicate_penalty/std": 0.020731303840875626, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9720279574394226, "rewards/distinct_2/std": 0.03866533935070038, "rewards/total_composite/mean": 0.30703824758529663, "rewards/total_composite/std": 0.07253486663103104, "reward": 0.30703824758529663, "reward_std": 0.07253486663103104, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17567403614521027, "sampling/sampling_logp_difference/max": 2.484437942504883, "sampling/importance_sampling_ratio/min": 0.08337239921092987, "sampling/importance_sampling_ratio/mean": 1.0124120712280273, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2451279684901237, "clip_ratio/low_mean": 0.04838709533214569, "clip_ratio/low_min": 0.04838709533214569, "clip_ratio/high_mean": 0.130453669000417, "clip_ratio/high_max": 0.130453669000417, "clip_ratio/region_mean": 0.17884076433256269, "reward_total_mean": 0.30703824758529663, "reward_meter_mean": 0.8986762762069702, "reward_meter_std": 0.12459779530763626, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9183171987533569, "reward_repeat_penalty_std": 0.10537010431289673, "reward_repeat_floor_mean": 0.9916671514511108, "reward_repeat_floor_std": 0.00818734522908926, "reward_near_duplicate_penalty_mean": 0.9737309217453003, "reward_near_duplicate_penalty_std": 0.020731303840875626, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9720279574394226, "reward_distinct_2_std": 0.03866533935070038, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.30703824758529663, "reward_total_composite_std": 0.07253486663103104} {"timestamp_utc": "2026-04-12T17:49:56Z", "mode": "train", "global_step": 510, "epoch": 0.026840692595126572, "loss": 0.1634, "grad_norm": 18.07653045654297, "learning_rate": 8.457575757575758e-06, "num_tokens": 946654.0, "completions/mean_length": 28.125, "completions/min_length": 22.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.125, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.9876656532287598, "rewards/meter/std": 0.01162785105407238, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9527714848518372, "rewards/lexical_plausibility/std": 0.13358239829540253, "rewards/judge_quality/mean": 0.6549999713897705, "rewards/judge_quality/std": 0.3013303875923157, "rewards/repeat_penalty/mean": 0.7437795996665955, "rewards/repeat_penalty/std": 0.07384127378463745, "rewards/repeat_floor/mean": 0.980575680732727, "rewards/repeat_floor/std": 0.009911520406603813, "rewards/near_duplicate_penalty/mean": 0.9632494449615479, "rewards/near_duplicate_penalty/std": 0.06476728618144989, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.6190110445022583, "rewards/total_composite/std": 0.3101833462715149, "reward": 0.6190110445022583, "reward_std": 0.3101833164691925, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1761094182729721, "sampling/sampling_logp_difference/max": 1.0814104080200195, "sampling/importance_sampling_ratio/min": 0.3391168713569641, "sampling/importance_sampling_ratio/mean": 1.0074492692947388, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1120131835341454, "clip_ratio/low_mean": 0.06553030479699373, "clip_ratio/low_min": 0.06553030479699373, "clip_ratio/high_mean": 0.08131270948797464, "clip_ratio/high_max": 0.08131270948797464, "clip_ratio/region_mean": 0.14684301428496838, "reward_total_mean": 0.6190110445022583, "reward_meter_mean": 0.9876656532287598, "reward_meter_std": 0.01162785105407238, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9527714848518372, "reward_lexical_plausibility_std": 0.13358239829540253, "reward_repeat_penalty_mean": 0.7437795996665955, "reward_repeat_penalty_std": 0.07384127378463745, "reward_repeat_floor_mean": 0.980575680732727, "reward_repeat_floor_std": 0.009911520406603813, "reward_near_duplicate_penalty_mean": 0.9632494449615479, "reward_near_duplicate_penalty_std": 0.06476728618144989, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.6549999713897705, "reward_judge_quality_std": 0.3013303875923157, "reward_total_composite_mean": 0.6190110445022583, "reward_total_composite_std": 0.3101833462715149} {"timestamp_utc": "2026-04-12T17:50:11Z", "mode": "train", "global_step": 511, "epoch": 0.026893321404136625, "loss": -0.0887, "grad_norm": 5.195733070373535, "learning_rate": 8.454545454545455e-06, "num_tokens": 948639.0, "completions/mean_length": 140.125, "completions/min_length": 77.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 87.00000762939453, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 117.0, "rewards/meter/mean": 0.7908278703689575, "rewards/meter/std": 0.17973321676254272, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9310750365257263, "rewards/lexical_plausibility/std": 0.16537347435951233, "rewards/judge_quality/mean": 0.41624999046325684, "rewards/judge_quality/std": 0.22859430313110352, "rewards/repeat_penalty/mean": 0.7995262145996094, "rewards/repeat_penalty/std": 0.23734745383262634, "rewards/repeat_floor/mean": 0.9780957698822021, "rewards/repeat_floor/std": 0.026306159794330597, "rewards/near_duplicate_penalty/mean": 0.9527913928031921, "rewards/near_duplicate_penalty/std": 0.05639262869954109, "rewards/opening_diversity/mean": 0.9460227489471436, "rewards/opening_diversity/std": 0.10159406810998917, "rewards/distinct_2/mean": 0.8712852001190186, "rewards/distinct_2/std": 0.14188195765018463, "rewards/total_composite/mean": 0.31442081928253174, "rewards/total_composite/std": 0.21579216420650482, "reward": 0.31442081928253174, "reward_std": 0.21579214930534363, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16103772819042206, "sampling/sampling_logp_difference/max": 1.7747416496276855, "sampling/importance_sampling_ratio/min": 0.16952724754810333, "sampling/importance_sampling_ratio/mean": 1.0292243957519531, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1683842241764069, "clip_ratio/low_mean": 0.057608501985669136, "clip_ratio/low_min": 0.057608501985669136, "clip_ratio/high_mean": 0.06842339457944036, "clip_ratio/high_max": 0.06842339457944036, "clip_ratio/region_mean": 0.1260318965651095, "reward_total_mean": 0.31442081928253174, "reward_meter_mean": 0.7908278703689575, "reward_meter_std": 0.17973321676254272, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9310750365257263, "reward_lexical_plausibility_std": 0.16537347435951233, "reward_repeat_penalty_mean": 0.7995262145996094, "reward_repeat_penalty_std": 0.23734745383262634, "reward_repeat_floor_mean": 0.9780957698822021, "reward_repeat_floor_std": 0.026306159794330597, "reward_near_duplicate_penalty_mean": 0.9527913928031921, "reward_near_duplicate_penalty_std": 0.05639262869954109, "reward_opening_diversity_mean": 0.9460227489471436, "reward_opening_diversity_std": 0.10159406810998917, "reward_distinct_2_mean": 0.8712852001190186, "reward_distinct_2_std": 0.14188195765018463, "reward_judge_quality_mean": 0.41624999046325684, "reward_judge_quality_std": 0.22859430313110352, "reward_total_composite_mean": 0.31442081928253174, "reward_total_composite_std": 0.21579216420650482} {"timestamp_utc": "2026-04-12T17:50:27Z", "mode": "train", "global_step": 512, "epoch": 0.026945950213146677, "loss": -0.1608, "grad_norm": 3.0728647708892822, "learning_rate": 8.451515151515151e-06, "num_tokens": 951667.0, "completions/mean_length": 310.5, "completions/min_length": 222.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 243.33334350585938, "completions/min_terminated_length": 222.0, "completions/max_terminated_length": 271.0, "rewards/meter/mean": 0.7266141176223755, "rewards/meter/std": 0.23444527387619019, "rewards/count_adherence/mean": 0.6625000238418579, "rewards/count_adherence/std": 0.1060660183429718, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8987499475479126, "rewards/count_floor/std": 0.03181980550289154, "rewards/lexical_plausibility/mean": 0.913486659526825, "rewards/lexical_plausibility/std": 0.16599012911319733, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.15678924322128296, "rewards/repeat_penalty/std": 0.3314603269100189, "rewards/repeat_floor/mean": 0.8448523283004761, "rewards/repeat_floor/std": 0.07679145038127899, "rewards/near_duplicate_penalty/mean": 0.5846582651138306, "rewards/near_duplicate_penalty/std": 0.24416083097457886, "rewards/opening_diversity/mean": 0.5224862694740295, "rewards/opening_diversity/std": 0.31657326221466064, "rewards/distinct_2/mean": 0.2867155075073242, "rewards/distinct_2/std": 0.34327632188796997, "rewards/total_composite/mean": 0.11474845558404922, "rewards/total_composite/std": 0.09143712371587753, "reward": 0.11474845558404922, "reward_std": 0.09143711626529694, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0956878662109375, "sampling/sampling_logp_difference/max": 1.985860824584961, "sampling/importance_sampling_ratio/min": 0.13726240396499634, "sampling/importance_sampling_ratio/mean": 1.031825065612793, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6953889355063438, "clip_ratio/low_mean": 0.030452340375632048, "clip_ratio/low_min": 0.030452340375632048, "clip_ratio/high_mean": 0.01627675397321582, "clip_ratio/high_max": 0.01627675397321582, "clip_ratio/region_mean": 0.046729094348847866, "reward_total_mean": 0.11474845558404922, "reward_meter_mean": 0.7266141176223755, "reward_meter_std": 0.23444527387619019, "reward_count_adherence_mean": 0.6625000238418579, "reward_count_adherence_std": 0.1060660183429718, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8987499475479126, "reward_count_floor_std": 0.03181980550289154, "reward_lexical_plausibility_mean": 0.913486659526825, "reward_lexical_plausibility_std": 0.16599012911319733, "reward_repeat_penalty_mean": 0.15678924322128296, "reward_repeat_penalty_std": 0.3314603269100189, "reward_repeat_floor_mean": 0.8448523283004761, "reward_repeat_floor_std": 0.07679145038127899, "reward_near_duplicate_penalty_mean": 0.5846582651138306, "reward_near_duplicate_penalty_std": 0.24416083097457886, "reward_opening_diversity_mean": 0.5224862694740295, "reward_opening_diversity_std": 0.31657326221466064, "reward_distinct_2_mean": 0.2867155075073242, "reward_distinct_2_std": 0.34327632188796997, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.11474845558404922, "reward_total_composite_std": 0.09143712371587753} {"timestamp_utc": "2026-04-12T17:50:37Z", "mode": "train", "global_step": 513, "epoch": 0.02699857902215673, "loss": 0.0787, "grad_norm": 12.029963493347168, "learning_rate": 8.44848484848485e-06, "num_tokens": 954172.0, "completions/mean_length": 138.125, "completions/min_length": 122.0, "completions/max_length": 154.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.125, "completions/min_terminated_length": 122.0, "completions/max_terminated_length": 154.0, "rewards/meter/mean": 0.7376955151557922, "rewards/meter/std": 0.16614893078804016, "rewards/count_adherence/mean": 0.660714328289032, "rewards/count_adherence/std": 0.07393559068441391, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8982142806053162, "rewards/count_floor/std": 0.022180693224072456, "rewards/lexical_plausibility/mean": 0.9972826242446899, "rewards/lexical_plausibility/std": 0.007685941644012928, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.6452541351318359, "rewards/repeat_penalty/std": 0.25342443585395813, "rewards/repeat_floor/mean": 0.9669176340103149, "rewards/repeat_floor/std": 0.02324865385890007, "rewards/near_duplicate_penalty/mean": 0.9520882368087769, "rewards/near_duplicate_penalty/std": 0.03388504683971405, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7122707962989807, "rewards/distinct_2/std": 0.21064119040966034, "rewards/total_composite/mean": 0.24093817174434662, "rewards/total_composite/std": 0.07627732306718826, "reward": 0.24093817174434662, "reward_std": 0.07627731561660767, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19718462228775024, "sampling/sampling_logp_difference/max": 2.534458875656128, "sampling/importance_sampling_ratio/min": 0.07930462062358856, "sampling/importance_sampling_ratio/mean": 1.0061147212982178, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.074821561574936, "clip_ratio/low_mean": 0.06576649006456137, "clip_ratio/low_min": 0.06576649006456137, "clip_ratio/high_mean": 0.10233640298247337, "clip_ratio/high_max": 0.10233640298247337, "clip_ratio/region_mean": 0.16810289304703474, "reward_total_mean": 0.24093817174434662, "reward_meter_mean": 0.7376955151557922, "reward_meter_std": 0.16614893078804016, "reward_count_adherence_mean": 0.660714328289032, "reward_count_adherence_std": 0.07393559068441391, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8982142806053162, "reward_count_floor_std": 0.022180693224072456, "reward_lexical_plausibility_mean": 0.9972826242446899, "reward_lexical_plausibility_std": 0.007685941644012928, "reward_repeat_penalty_mean": 0.6452541351318359, "reward_repeat_penalty_std": 0.25342443585395813, "reward_repeat_floor_mean": 0.9669176340103149, "reward_repeat_floor_std": 0.02324865385890007, "reward_near_duplicate_penalty_mean": 0.9520882368087769, "reward_near_duplicate_penalty_std": 0.03388504683971405, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7122707962989807, "reward_distinct_2_std": 0.21064119040966034, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.24093817174434662, "reward_total_composite_std": 0.07627732306718826} {"timestamp_utc": "2026-04-12T17:50:51Z", "mode": "train", "global_step": 514, "epoch": 0.027051207831166782, "loss": -0.1644, "grad_norm": 3.8267667293548584, "learning_rate": 8.445454545454547e-06, "num_tokens": 956592.0, "completions/mean_length": 159.5, "completions/min_length": 93.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 109.14286041259766, "completions/min_terminated_length": 93.0, "completions/max_terminated_length": 153.0, "rewards/meter/mean": 0.8357934355735779, "rewards/meter/std": 0.21477803587913513, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9632163047790527, "rewards/lexical_plausibility/std": 0.10404002666473389, "rewards/judge_quality/mean": 0.4749999940395355, "rewards/judge_quality/std": 0.29051679372787476, "rewards/repeat_penalty/mean": 0.9527912139892578, "rewards/repeat_penalty/std": 0.04206263646483421, "rewards/repeat_floor/mean": 0.9949902892112732, "rewards/repeat_floor/std": 0.004211359657347202, "rewards/near_duplicate_penalty/mean": 0.9882081151008606, "rewards/near_duplicate_penalty/std": 0.007910761050879955, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9639891386032104, "rewards/distinct_2/std": 0.03702307492494583, "rewards/total_composite/mean": 0.346296101808548, "rewards/total_composite/std": 0.14345581829547882, "reward": 0.346296101808548, "reward_std": 0.14345581829547882, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15752151608467102, "sampling/sampling_logp_difference/max": 1.815791130065918, "sampling/importance_sampling_ratio/min": 0.16270913183689117, "sampling/importance_sampling_ratio/mean": 1.029537558555603, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0509411171078682, "clip_ratio/low_mean": 0.06316639482975006, "clip_ratio/low_min": 0.06316639482975006, "clip_ratio/high_mean": 0.06954278890043497, "clip_ratio/high_max": 0.06954278890043497, "clip_ratio/region_mean": 0.13270918373018503, "reward_total_mean": 0.346296101808548, "reward_meter_mean": 0.8357934355735779, "reward_meter_std": 0.21477803587913513, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9632163047790527, "reward_lexical_plausibility_std": 0.10404002666473389, "reward_repeat_penalty_mean": 0.9527912139892578, "reward_repeat_penalty_std": 0.04206263646483421, "reward_repeat_floor_mean": 0.9949902892112732, "reward_repeat_floor_std": 0.004211359657347202, "reward_near_duplicate_penalty_mean": 0.9882081151008606, "reward_near_duplicate_penalty_std": 0.007910761050879955, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9639891386032104, "reward_distinct_2_std": 0.03702307492494583, "reward_judge_quality_mean": 0.4749999940395355, "reward_judge_quality_std": 0.29051679372787476, "reward_total_composite_mean": 0.346296101808548, "reward_total_composite_std": 0.14345581829547882} {"timestamp_utc": "2026-04-12T17:51:01Z", "mode": "train", "global_step": 515, "epoch": 0.027103836640176834, "loss": 0.0591, "grad_norm": 8.03563404083252, "learning_rate": 8.442424242424243e-06, "num_tokens": 958898.0, "completions/mean_length": 105.25, "completions/min_length": 96.0, "completions/max_length": 121.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 105.25, "completions/min_terminated_length": 96.0, "completions/max_terminated_length": 121.0, "rewards/meter/mean": 0.9241654872894287, "rewards/meter/std": 0.051645684987306595, "rewards/count_adherence/mean": 0.9750000238418579, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9925000071525574, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47499996423721313, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.8615190386772156, "rewards/repeat_penalty/std": 0.11042682081460953, "rewards/repeat_floor/mean": 0.9857146739959717, "rewards/repeat_floor/std": 0.010651892982423306, "rewards/near_duplicate_penalty/mean": 0.969488263130188, "rewards/near_duplicate_penalty/std": 0.017097249627113342, "rewards/opening_diversity/mean": 0.971875011920929, "rewards/opening_diversity/std": 0.05250425636768341, "rewards/distinct_2/mean": 0.9108771085739136, "rewards/distinct_2/std": 0.0654713362455368, "rewards/total_composite/mean": 0.43101412057876587, "rewards/total_composite/std": 0.08232199400663376, "reward": 0.43101412057876587, "reward_std": 0.08232198655605316, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.157629132270813, "sampling/sampling_logp_difference/max": 5.239917278289795, "sampling/importance_sampling_ratio/min": 0.005300695076584816, "sampling/importance_sampling_ratio/mean": 1.0178728103637695, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9227953553199768, "clip_ratio/low_mean": 0.09270178060978651, "clip_ratio/low_min": 0.09270178060978651, "clip_ratio/high_mean": 0.01417525764554739, "clip_ratio/high_max": 0.01417525764554739, "clip_ratio/region_mean": 0.1068770382553339, "reward_total_mean": 0.43101412057876587, "reward_meter_mean": 0.9241654872894287, "reward_meter_std": 0.051645684987306595, "reward_count_adherence_mean": 0.9750000238418579, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9925000071525574, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8615190386772156, "reward_repeat_penalty_std": 0.11042682081460953, "reward_repeat_floor_mean": 0.9857146739959717, "reward_repeat_floor_std": 0.010651892982423306, "reward_near_duplicate_penalty_mean": 0.969488263130188, "reward_near_duplicate_penalty_std": 0.017097249627113342, "reward_opening_diversity_mean": 0.971875011920929, "reward_opening_diversity_std": 0.05250425636768341, "reward_distinct_2_mean": 0.9108771085739136, "reward_distinct_2_std": 0.0654713362455368, "reward_judge_quality_mean": 0.47499996423721313, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.43101412057876587, "reward_total_composite_std": 0.08232199400663376} {"timestamp_utc": "2026-04-12T17:51:11Z", "mode": "train", "global_step": 516, "epoch": 0.027156465449186883, "loss": 0.0255, "grad_norm": 5.3206987380981445, "learning_rate": 8.43939393939394e-06, "num_tokens": 961458.0, "completions/mean_length": 140.0, "completions/min_length": 132.0, "completions/max_length": 158.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 140.0, "completions/min_terminated_length": 132.0, "completions/max_terminated_length": 158.0, "rewards/meter/mean": 0.9921877384185791, "rewards/meter/std": 0.0019624331034719944, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9474999904632568, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.331486314535141, "rewards/repeat_penalty/std": 0.2879042327404022, "rewards/repeat_floor/mean": 0.9014939069747925, "rewards/repeat_floor/std": 0.06623192131519318, "rewards/near_duplicate_penalty/mean": 0.7780974507331848, "rewards/near_duplicate_penalty/std": 0.16105632483959198, "rewards/opening_diversity/mean": 0.7230113744735718, "rewards/opening_diversity/std": 0.3136232793331146, "rewards/distinct_2/mean": 0.4599849581718445, "rewards/distinct_2/std": 0.3084188997745514, "rewards/total_composite/mean": 0.2763414978981018, "rewards/total_composite/std": 0.0654524564743042, "reward": 0.2763414978981018, "reward_std": 0.0654524639248848, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11591927707195282, "sampling/sampling_logp_difference/max": 1.9515008926391602, "sampling/importance_sampling_ratio/min": 0.14206069707870483, "sampling/importance_sampling_ratio/mean": 1.0085686445236206, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8303218744695187, "clip_ratio/low_mean": 0.014263114426285028, "clip_ratio/low_min": 0.014263114426285028, "clip_ratio/high_mean": 0.10018174815922976, "clip_ratio/high_max": 0.10018174815922976, "clip_ratio/region_mean": 0.11444486258551478, "reward_total_mean": 0.2763414978981018, "reward_meter_mean": 0.9921877384185791, "reward_meter_std": 0.0019624331034719944, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9474999904632568, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.331486314535141, "reward_repeat_penalty_std": 0.2879042327404022, "reward_repeat_floor_mean": 0.9014939069747925, "reward_repeat_floor_std": 0.06623192131519318, "reward_near_duplicate_penalty_mean": 0.7780974507331848, "reward_near_duplicate_penalty_std": 0.16105632483959198, "reward_opening_diversity_mean": 0.7230113744735718, "reward_opening_diversity_std": 0.3136232793331146, "reward_distinct_2_mean": 0.4599849581718445, "reward_distinct_2_std": 0.3084188997745514, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.2763414978981018, "reward_total_composite_std": 0.0654524564743042} {"timestamp_utc": "2026-04-12T17:51:19Z", "mode": "train", "global_step": 517, "epoch": 0.027209094258196936, "loss": 0.2659, "grad_norm": 30.32703971862793, "learning_rate": 8.436363636363637e-06, "num_tokens": 962874.0, "completions/mean_length": 27.0, "completions/min_length": 23.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.0, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.8983370661735535, "rewards/meter/std": 0.22539734840393066, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.7975000143051147, "rewards/judge_quality/std": 0.2471408098936081, "rewards/repeat_penalty/mean": 0.733729362487793, "rewards/repeat_penalty/std": 0.12819167971611023, "rewards/repeat_floor/mean": 0.9773709177970886, "rewards/repeat_floor/std": 0.016670571640133858, "rewards/near_duplicate_penalty/mean": 0.936639130115509, "rewards/near_duplicate_penalty/std": 0.09639061987400055, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.727913498878479, "rewards/total_composite/std": 0.30518433451652527, "reward": 0.727913498878479, "reward_std": 0.30518433451652527, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15355220437049866, "sampling/sampling_logp_difference/max": 1.2723546028137207, "sampling/importance_sampling_ratio/min": 0.28017115592956543, "sampling/importance_sampling_ratio/mean": 1.0076162815093994, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9819388464093208, "clip_ratio/low_mean": 0.053321680054068565, "clip_ratio/low_min": 0.053321680054068565, "clip_ratio/high_mean": 0.11706173326820135, "clip_ratio/high_max": 0.11706173326820135, "clip_ratio/region_mean": 0.17038341332226992, "reward_total_mean": 0.727913498878479, "reward_meter_mean": 0.8983370661735535, "reward_meter_std": 0.22539734840393066, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.733729362487793, "reward_repeat_penalty_std": 0.12819167971611023, "reward_repeat_floor_mean": 0.9773709177970886, "reward_repeat_floor_std": 0.016670571640133858, "reward_near_duplicate_penalty_mean": 0.936639130115509, "reward_near_duplicate_penalty_std": 0.09639061987400055, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7975000143051147, "reward_judge_quality_std": 0.2471408098936081, "reward_total_composite_mean": 0.727913498878479, "reward_total_composite_std": 0.30518433451652527} {"timestamp_utc": "2026-04-12T17:51:28Z", "mode": "train", "global_step": 518, "epoch": 0.027261723067206988, "loss": 0.1184, "grad_norm": 13.314927101135254, "learning_rate": 8.433333333333334e-06, "num_tokens": 964540.0, "completions/mean_length": 49.25, "completions/min_length": 40.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.25, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.49174201488494873, "rewards/meter/std": 0.48091262578964233, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9479242563247681, "rewards/lexical_plausibility/std": 0.11055175960063934, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9025670289993286, "rewards/repeat_penalty/std": 0.11271899193525314, "rewards/repeat_floor/mean": 0.9901441931724548, "rewards/repeat_floor/std": 0.009752021171152592, "rewards/near_duplicate_penalty/mean": 0.9737732410430908, "rewards/near_duplicate_penalty/std": 0.025190871208906174, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9550356864929199, "rewards/distinct_2/std": 0.048800356686115265, "rewards/total_composite/mean": 0.2097613513469696, "rewards/total_composite/std": 0.20769169926643372, "reward": 0.2097613513469696, "reward_std": 0.20769169926643372, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18047697842121124, "sampling/sampling_logp_difference/max": 1.7908518314361572, "sampling/importance_sampling_ratio/min": 0.2603965699672699, "sampling/importance_sampling_ratio/mean": 1.0249801874160767, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.371830441057682, "clip_ratio/low_mean": 0.060898084193468094, "clip_ratio/low_min": 0.060898084193468094, "clip_ratio/high_mean": 0.0749156316742301, "clip_ratio/high_max": 0.0749156316742301, "clip_ratio/region_mean": 0.1358137158676982, "reward_total_mean": 0.2097613513469696, "reward_meter_mean": 0.49174201488494873, "reward_meter_std": 0.48091262578964233, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9479242563247681, "reward_lexical_plausibility_std": 0.11055175960063934, "reward_repeat_penalty_mean": 0.9025670289993286, "reward_repeat_penalty_std": 0.11271899193525314, "reward_repeat_floor_mean": 0.9901441931724548, "reward_repeat_floor_std": 0.009752021171152592, "reward_near_duplicate_penalty_mean": 0.9737732410430908, "reward_near_duplicate_penalty_std": 0.025190871208906174, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9550356864929199, "reward_distinct_2_std": 0.048800356686115265, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.2097613513469696, "reward_total_composite_std": 0.20769169926643372} {"timestamp_utc": "2026-04-12T17:51:39Z", "mode": "train", "global_step": 519, "epoch": 0.02731435187621704, "loss": 0.0359, "grad_norm": 12.719137191772461, "learning_rate": 8.43030303030303e-06, "num_tokens": 966497.0, "completions/mean_length": 73.625, "completions/min_length": 55.0, "completions/max_length": 106.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 73.625, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.4631587862968445, "rewards/meter/std": 0.3079971373081207, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175492912530899, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.08864051848649979, "rewards/repeat_penalty/mean": 0.7922379970550537, "rewards/repeat_penalty/std": 0.16282393038272858, "rewards/repeat_floor/mean": 0.9772928953170776, "rewards/repeat_floor/std": 0.019161473959684372, "rewards/near_duplicate_penalty/mean": 0.9444105625152588, "rewards/near_duplicate_penalty/std": 0.05331508442759514, "rewards/opening_diversity/mean": 0.9508928656578064, "rewards/opening_diversity/std": 0.09533105045557022, "rewards/distinct_2/mean": 0.8730860352516174, "rewards/distinct_2/std": 0.0932348221540451, "rewards/total_composite/mean": 0.13563811779022217, "rewards/total_composite/std": 0.09495692700147629, "reward": 0.13563811779022217, "reward_std": 0.09495692700147629, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1856628954410553, "sampling/sampling_logp_difference/max": 1.680562973022461, "sampling/importance_sampling_ratio/min": 0.18626907467842102, "sampling/importance_sampling_ratio/mean": 1.029004454612732, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2884924337267876, "clip_ratio/low_mean": 0.07619927451014519, "clip_ratio/low_min": 0.07619927451014519, "clip_ratio/high_mean": 0.12307463772594929, "clip_ratio/high_max": 0.12307463772594929, "clip_ratio/region_mean": 0.19927391223609447, "reward_total_mean": 0.13563811779022217, "reward_meter_mean": 0.4631587862968445, "reward_meter_std": 0.3079971373081207, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175492912530899, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7922379970550537, "reward_repeat_penalty_std": 0.16282393038272858, "reward_repeat_floor_mean": 0.9772928953170776, "reward_repeat_floor_std": 0.019161473959684372, "reward_near_duplicate_penalty_mean": 0.9444105625152588, "reward_near_duplicate_penalty_std": 0.05331508442759514, "reward_opening_diversity_mean": 0.9508928656578064, "reward_opening_diversity_std": 0.09533105045557022, "reward_distinct_2_mean": 0.8730860352516174, "reward_distinct_2_std": 0.0932348221540451, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.08864051848649979, "reward_total_composite_mean": 0.13563811779022217, "reward_total_composite_std": 0.09495692700147629} {"timestamp_utc": "2026-04-12T17:51:47Z", "mode": "train", "global_step": 520, "epoch": 0.027366980685227093, "loss": 0.1227, "grad_norm": 15.349052429199219, "learning_rate": 8.427272727272729e-06, "num_tokens": 968065.0, "completions/mean_length": 44.0, "completions/min_length": 38.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.0, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.4164927303791046, "rewards/meter/std": 0.3023623824119568, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9845391511917114, "rewards/lexical_plausibility/std": 0.028630122542381287, "rewards/judge_quality/mean": 0.6762499809265137, "rewards/judge_quality/std": 0.2707628309726715, "rewards/repeat_penalty/mean": 0.9862516522407532, "rewards/repeat_penalty/std": 0.012122338637709618, "rewards/repeat_floor/mean": 0.997937798500061, "rewards/repeat_floor/std": 0.001818351331166923, "rewards/near_duplicate_penalty/mean": 0.9862516522407532, "rewards/near_duplicate_penalty/std": 0.012122338637709618, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3138221502304077, "rewards/total_composite/std": 0.28780755400657654, "reward": 0.3138221502304077, "reward_std": 0.28780752420425415, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2093144655227661, "sampling/sampling_logp_difference/max": 2.6798653602600098, "sampling/importance_sampling_ratio/min": 0.06857238709926605, "sampling/importance_sampling_ratio/mean": 1.0018255710601807, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4446628764271736, "clip_ratio/low_mean": 0.12115802429616451, "clip_ratio/low_min": 0.12115802429616451, "clip_ratio/high_mean": 0.08064408600330353, "clip_ratio/high_max": 0.08064408600330353, "clip_ratio/region_mean": 0.20180211029946804, "reward_total_mean": 0.3138221502304077, "reward_meter_mean": 0.4164927303791046, "reward_meter_std": 0.3023623824119568, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9845391511917114, "reward_lexical_plausibility_std": 0.028630122542381287, "reward_repeat_penalty_mean": 0.9862516522407532, "reward_repeat_penalty_std": 0.012122338637709618, "reward_repeat_floor_mean": 0.997937798500061, "reward_repeat_floor_std": 0.001818351331166923, "reward_near_duplicate_penalty_mean": 0.9862516522407532, "reward_near_duplicate_penalty_std": 0.012122338637709618, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6762499809265137, "reward_judge_quality_std": 0.2707628309726715, "reward_total_composite_mean": 0.3138221502304077, "reward_total_composite_std": 0.28780755400657654} {"timestamp_utc": "2026-04-12T17:51:56Z", "mode": "train", "global_step": 521, "epoch": 0.027419609494237145, "loss": 0.0643, "grad_norm": 14.271038055419922, "learning_rate": 8.424242424242425e-06, "num_tokens": 969558.0, "completions/mean_length": 40.625, "completions/min_length": 38.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.625, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.852173924446106, "rewards/meter/std": 0.30694180727005005, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.6225000023841858, "rewards/judge_quality/std": 0.3285357356071472, "rewards/repeat_penalty/mean": 0.8681364059448242, "rewards/repeat_penalty/std": 0.1722218096256256, "rewards/repeat_floor/mean": 0.9858099222183228, "rewards/repeat_floor/std": 0.01767108216881752, "rewards/near_duplicate_penalty/mean": 0.9533722996711731, "rewards/near_duplicate_penalty/std": 0.054576653987169266, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9617122411727905, "rewards/distinct_2/std": 0.05567097291350365, "rewards/total_composite/mean": 0.4916231632232666, "rewards/total_composite/std": 0.3457225561141968, "reward": 0.4916231632232666, "reward_std": 0.34572258591651917, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17721252143383026, "sampling/sampling_logp_difference/max": 1.1589140892028809, "sampling/importance_sampling_ratio/min": 0.3138267993927002, "sampling/importance_sampling_ratio/mean": 1.0233261585235596, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1198498606681824, "clip_ratio/low_mean": 0.12171227484941483, "clip_ratio/low_min": 0.12171227484941483, "clip_ratio/high_mean": 0.060016026720404625, "clip_ratio/high_max": 0.060016026720404625, "clip_ratio/region_mean": 0.18172830156981945, "reward_total_mean": 0.4916231632232666, "reward_meter_mean": 0.852173924446106, "reward_meter_std": 0.30694180727005005, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.8681364059448242, "reward_repeat_penalty_std": 0.1722218096256256, "reward_repeat_floor_mean": 0.9858099222183228, "reward_repeat_floor_std": 0.01767108216881752, "reward_near_duplicate_penalty_mean": 0.9533722996711731, "reward_near_duplicate_penalty_std": 0.054576653987169266, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9617122411727905, "reward_distinct_2_std": 0.05567097291350365, "reward_judge_quality_mean": 0.6225000023841858, "reward_judge_quality_std": 0.3285357356071472, "reward_total_composite_mean": 0.4916231632232666, "reward_total_composite_std": 0.3457225561141968} {"timestamp_utc": "2026-04-12T17:52:06Z", "mode": "train", "global_step": 522, "epoch": 0.027472238303247198, "loss": 0.0002, "grad_norm": 12.01123046875, "learning_rate": 8.421212121212122e-06, "num_tokens": 971670.0, "completions/mean_length": 96.0, "completions/min_length": 85.0, "completions/max_length": 108.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 96.0, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 108.0, "rewards/meter/mean": 0.9132922291755676, "rewards/meter/std": 0.21457339823246002, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.8785302639007568, "rewards/repeat_penalty/std": 0.14265145361423492, "rewards/repeat_floor/mean": 0.9867973327636719, "rewards/repeat_floor/std": 0.014486290514469147, "rewards/near_duplicate_penalty/mean": 0.9676364064216614, "rewards/near_duplicate_penalty/std": 0.021895958110690117, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9124506711959839, "rewards/distinct_2/std": 0.12714537978172302, "rewards/total_composite/mean": 0.3384040296077728, "rewards/total_composite/std": 0.08730526268482208, "reward": 0.3384040296077728, "reward_std": 0.08730526268482208, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1593395620584488, "sampling/sampling_logp_difference/max": 1.6513586044311523, "sampling/importance_sampling_ratio/min": 0.1917891651391983, "sampling/importance_sampling_ratio/mean": 1.0177624225616455, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1946695148944855, "clip_ratio/low_mean": 0.05445515923202038, "clip_ratio/low_min": 0.05445515923202038, "clip_ratio/high_mean": 0.10272705554962158, "clip_ratio/high_max": 0.10272705554962158, "clip_ratio/region_mean": 0.15718221478164196, "reward_total_mean": 0.3384040296077728, "reward_meter_mean": 0.9132922291755676, "reward_meter_std": 0.21457339823246002, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8785302639007568, "reward_repeat_penalty_std": 0.14265145361423492, "reward_repeat_floor_mean": 0.9867973327636719, "reward_repeat_floor_std": 0.014486290514469147, "reward_near_duplicate_penalty_mean": 0.9676364064216614, "reward_near_duplicate_penalty_std": 0.021895958110690117, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9124506711959839, "reward_distinct_2_std": 0.12714537978172302, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.3384040296077728, "reward_total_composite_std": 0.08730526268482208} {"timestamp_utc": "2026-04-12T17:52:15Z", "mode": "train", "global_step": 523, "epoch": 0.02752486711225725, "loss": 0.062, "grad_norm": 15.831817626953125, "learning_rate": 8.418181818181819e-06, "num_tokens": 973284.0, "completions/mean_length": 35.75, "completions/min_length": 32.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.75, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.8376367092132568, "rewards/meter/std": 0.2692849338054657, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.21756774187088013, "rewards/repeat_penalty/mean": 0.9702938795089722, "rewards/repeat_penalty/std": 0.05283456668257713, "rewards/repeat_floor/mean": 0.996000349521637, "rewards/repeat_floor/std": 0.006708947941660881, "rewards/near_duplicate_penalty/mean": 0.9791051149368286, "rewards/near_duplicate_penalty/std": 0.030114414170384407, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.49114301800727844, "rewards/total_composite/std": 0.28003180027008057, "reward": 0.49114301800727844, "reward_std": 0.2800317704677582, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14815272390842438, "sampling/sampling_logp_difference/max": 1.2352204322814941, "sampling/importance_sampling_ratio/min": 0.29077064990997314, "sampling/importance_sampling_ratio/mean": 1.0314936637878418, "sampling/importance_sampling_ratio/max": 1.913636565208435, "entropy": 1.0560617744922638, "clip_ratio/low_mean": 0.11194766499102116, "clip_ratio/low_min": 0.11194766499102116, "clip_ratio/high_mean": 0.037913603708148, "clip_ratio/high_max": 0.037913603708148, "clip_ratio/region_mean": 0.14986126869916916, "reward_total_mean": 0.49114301800727844, "reward_meter_mean": 0.8376367092132568, "reward_meter_std": 0.2692849338054657, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9702938795089722, "reward_repeat_penalty_std": 0.05283456668257713, "reward_repeat_floor_mean": 0.996000349521637, "reward_repeat_floor_std": 0.006708947941660881, "reward_near_duplicate_penalty_mean": 0.9791051149368286, "reward_near_duplicate_penalty_std": 0.030114414170384407, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.21756774187088013, "reward_total_composite_mean": 0.49114301800727844, "reward_total_composite_std": 0.28003180027008057} {"timestamp_utc": "2026-04-12T17:52:23Z", "mode": "train", "global_step": 524, "epoch": 0.027577495921267303, "loss": 0.0541, "grad_norm": 16.983884811401367, "learning_rate": 8.415151515151516e-06, "num_tokens": 974885.0, "completions/mean_length": 42.125, "completions/min_length": 37.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.125, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.49647974967956543, "rewards/meter/std": 0.40011730790138245, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.8025000095367432, "rewards/judge_quality/std": 0.21756774187088013, "rewards/repeat_penalty/mean": 0.9699174761772156, "rewards/repeat_penalty/std": 0.03282570466399193, "rewards/repeat_floor/mean": 0.9960370659828186, "rewards/repeat_floor/std": 0.004304138477891684, "rewards/near_duplicate_penalty/mean": 0.9790749549865723, "rewards/near_duplicate_penalty/std": 0.029062652960419655, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.3848479390144348, "rewards/total_composite/std": 0.34055766463279724, "reward": 0.3848479390144348, "reward_std": 0.34055769443511963, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17654244601726532, "sampling/sampling_logp_difference/max": 3.164750814437866, "sampling/importance_sampling_ratio/min": 0.04222466051578522, "sampling/importance_sampling_ratio/mean": 1.0286885499954224, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2037063613533974, "clip_ratio/low_mean": 0.09554027020931244, "clip_ratio/low_min": 0.09554027020931244, "clip_ratio/high_mean": 0.06381778419017792, "clip_ratio/high_max": 0.06381778419017792, "clip_ratio/region_mean": 0.15935805439949036, "reward_total_mean": 0.3848479390144348, "reward_meter_mean": 0.49647974967956543, "reward_meter_std": 0.40011730790138245, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9699174761772156, "reward_repeat_penalty_std": 0.03282570466399193, "reward_repeat_floor_mean": 0.9960370659828186, "reward_repeat_floor_std": 0.004304138477891684, "reward_near_duplicate_penalty_mean": 0.9790749549865723, "reward_near_duplicate_penalty_std": 0.029062652960419655, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.8025000095367432, "reward_judge_quality_std": 0.21756774187088013, "reward_total_composite_mean": 0.3848479390144348, "reward_total_composite_std": 0.34055766463279724} {"timestamp_utc": "2026-04-12T17:52:31Z", "mode": "train", "global_step": 525, "epoch": 0.027630124730277355, "loss": 0.0999, "grad_norm": 15.229125022888184, "learning_rate": 8.412121212121212e-06, "num_tokens": 976413.0, "completions/mean_length": 37.0, "completions/min_length": 34.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.5796794295310974, "rewards/meter/std": 0.43055519461631775, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.9137818813323975, "rewards/repeat_penalty/std": 0.10843636095523834, "rewards/repeat_floor/mean": 0.990498423576355, "rewards/repeat_floor/std": 0.008728833869099617, "rewards/near_duplicate_penalty/mean": 0.9619768261909485, "rewards/near_duplicate_penalty/std": 0.025421274825930595, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.039564959704875946, "rewards/total_composite/mean": 0.31257349252700806, "rewards/total_composite/std": 0.37147992849349976, "reward": 0.31257349252700806, "reward_std": 0.37147992849349976, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15412814915180206, "sampling/sampling_logp_difference/max": 1.3310840129852295, "sampling/importance_sampling_ratio/min": 0.2641907036304474, "sampling/importance_sampling_ratio/mean": 1.0021681785583496, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8568323999643326, "clip_ratio/low_mean": 0.06261557387188077, "clip_ratio/low_min": 0.06261557387188077, "clip_ratio/high_mean": 0.07849761843681335, "clip_ratio/high_max": 0.07849761843681335, "clip_ratio/region_mean": 0.14111319230869412, "reward_total_mean": 0.31257349252700806, "reward_meter_mean": 0.5796794295310974, "reward_meter_std": 0.43055519461631775, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9137818813323975, "reward_repeat_penalty_std": 0.10843636095523834, "reward_repeat_floor_mean": 0.990498423576355, "reward_repeat_floor_std": 0.008728833869099617, "reward_near_duplicate_penalty_mean": 0.9619768261909485, "reward_near_duplicate_penalty_std": 0.025421274825930595, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.039564959704875946, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.31257349252700806, "reward_total_composite_std": 0.37147992849349976} {"timestamp_utc": "2026-04-12T17:52:41Z", "mode": "train", "global_step": 526, "epoch": 0.027682753539287407, "loss": 0.0467, "grad_norm": 10.695037841796875, "learning_rate": 8.40909090909091e-06, "num_tokens": 978621.0, "completions/mean_length": 96.0, "completions/min_length": 80.0, "completions/max_length": 106.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 96.0, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.4163585603237152, "rewards/meter/std": 0.2186916470527649, "rewards/count_adherence/mean": 0.9249999523162842, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9775000214576721, "rewards/count_floor/std": 0.031052952632308006, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9287399053573608, "rewards/repeat_penalty/std": 0.0394316203892231, "rewards/repeat_floor/mean": 0.9922876954078674, "rewards/repeat_floor/std": 0.004055831581354141, "rewards/near_duplicate_penalty/mean": 0.9801652431488037, "rewards/near_duplicate_penalty/std": 0.008899851702153683, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9473658204078674, "rewards/distinct_2/std": 0.03438752517104149, "rewards/total_composite/mean": 0.15805578231811523, "rewards/total_composite/std": 0.0747164711356163, "reward": 0.15805578231811523, "reward_std": 0.0747164636850357, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16614016890525818, "sampling/sampling_logp_difference/max": 1.6688706874847412, "sampling/importance_sampling_ratio/min": 0.18845976889133453, "sampling/importance_sampling_ratio/mean": 1.003157615661621, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.111264280974865, "clip_ratio/low_mean": 0.1024137856438756, "clip_ratio/low_min": 0.1024137856438756, "clip_ratio/high_mean": 0.07299947924911976, "clip_ratio/high_max": 0.07299947924911976, "clip_ratio/region_mean": 0.17541326489299536, "reward_total_mean": 0.15805578231811523, "reward_meter_mean": 0.4163585603237152, "reward_meter_std": 0.2186916470527649, "reward_count_adherence_mean": 0.9249999523162842, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9775000214576721, "reward_count_floor_std": 0.031052952632308006, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9287399053573608, "reward_repeat_penalty_std": 0.0394316203892231, "reward_repeat_floor_mean": 0.9922876954078674, "reward_repeat_floor_std": 0.004055831581354141, "reward_near_duplicate_penalty_mean": 0.9801652431488037, "reward_near_duplicate_penalty_std": 0.008899851702153683, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9473658204078674, "reward_distinct_2_std": 0.03438752517104149, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.15805578231811523, "reward_total_composite_std": 0.0747164711356163} {"timestamp_utc": "2026-04-12T17:52:50Z", "mode": "train", "global_step": 527, "epoch": 0.02773538234829746, "loss": 0.0454, "grad_norm": 17.942092895507812, "learning_rate": 8.406060606060606e-06, "num_tokens": 980190.0, "completions/mean_length": 35.125, "completions/min_length": 31.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.125, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.7994195222854614, "rewards/meter/std": 0.33700355887413025, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9340277910232544, "rewards/lexical_plausibility/std": 0.17564287781715393, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.20951901376247406, "rewards/repeat_penalty/mean": 0.8898806571960449, "rewards/repeat_penalty/std": 0.17661099135875702, "rewards/repeat_floor/mean": 0.9880690574645996, "rewards/repeat_floor/std": 0.018163839355111122, "rewards/near_duplicate_penalty/mean": 0.9567240476608276, "rewards/near_duplicate_penalty/std": 0.05666833370923996, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9812270998954773, "rewards/distinct_2/std": 0.034774426370859146, "rewards/total_composite/mean": 0.36645856499671936, "rewards/total_composite/std": 0.1453583687543869, "reward": 0.36645856499671936, "reward_std": 0.1453583836555481, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12800559401512146, "sampling/sampling_logp_difference/max": 1.465423345565796, "sampling/importance_sampling_ratio/min": 0.23098018765449524, "sampling/importance_sampling_ratio/mean": 1.0225130319595337, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8144971951842308, "clip_ratio/low_mean": 0.04513888992369175, "clip_ratio/low_min": 0.04513888992369175, "clip_ratio/high_mean": 0.08164018322713673, "clip_ratio/high_max": 0.08164018322713673, "clip_ratio/region_mean": 0.12677907315082848, "reward_total_mean": 0.36645856499671936, "reward_meter_mean": 0.7994195222854614, "reward_meter_std": 0.33700355887413025, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9340277910232544, "reward_lexical_plausibility_std": 0.17564287781715393, "reward_repeat_penalty_mean": 0.8898806571960449, "reward_repeat_penalty_std": 0.17661099135875702, "reward_repeat_floor_mean": 0.9880690574645996, "reward_repeat_floor_std": 0.018163839355111122, "reward_near_duplicate_penalty_mean": 0.9567240476608276, "reward_near_duplicate_penalty_std": 0.05666833370923996, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9812270998954773, "reward_distinct_2_std": 0.034774426370859146, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.20951901376247406, "reward_total_composite_mean": 0.36645856499671936, "reward_total_composite_std": 0.1453583687543869} {"timestamp_utc": "2026-04-12T17:53:04Z", "mode": "train", "global_step": 528, "epoch": 0.02778801115730751, "loss": -0.0509, "grad_norm": 5.375563144683838, "learning_rate": 8.403030303030304e-06, "num_tokens": 981817.0, "completions/mean_length": 110.375, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 53.000003814697266, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.3983202576637268, "rewards/meter/std": 0.2766818106174469, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.945500373840332, "rewards/lexical_plausibility/std": 0.14706578850746155, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.8291400074958801, "rewards/repeat_penalty/std": 0.12698650360107422, "rewards/repeat_floor/mean": 0.978317379951477, "rewards/repeat_floor/std": 0.01570338010787964, "rewards/near_duplicate_penalty/mean": 0.9111659526824951, "rewards/near_duplicate_penalty/std": 0.06265629827976227, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9071384072303772, "rewards/distinct_2/std": 0.0984184741973877, "rewards/total_composite/mean": 0.15317308902740479, "rewards/total_composite/std": 0.10327749699354172, "reward": 0.15317308902740479, "reward_std": 0.10327748209238052, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19312684237957, "sampling/sampling_logp_difference/max": 1.3962161540985107, "sampling/importance_sampling_ratio/min": 0.24753181636333466, "sampling/importance_sampling_ratio/mean": 1.0329201221466064, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.378822848200798, "clip_ratio/low_mean": 0.04297785647213459, "clip_ratio/low_min": 0.04297785647213459, "clip_ratio/high_mean": 0.11210514605045319, "clip_ratio/high_max": 0.11210514605045319, "clip_ratio/region_mean": 0.15508300252258778, "reward_total_mean": 0.15317308902740479, "reward_meter_mean": 0.3983202576637268, "reward_meter_std": 0.2766818106174469, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.945500373840332, "reward_lexical_plausibility_std": 0.14706578850746155, "reward_repeat_penalty_mean": 0.8291400074958801, "reward_repeat_penalty_std": 0.12698650360107422, "reward_repeat_floor_mean": 0.978317379951477, "reward_repeat_floor_std": 0.01570338010787964, "reward_near_duplicate_penalty_mean": 0.9111659526824951, "reward_near_duplicate_penalty_std": 0.06265629827976227, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9071384072303772, "reward_distinct_2_std": 0.0984184741973877, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.15317308902740479, "reward_total_composite_std": 0.10327749699354172} {"timestamp_utc": "2026-04-12T17:53:12Z", "mode": "train", "global_step": 529, "epoch": 0.02784063996631756, "loss": 0.0224, "grad_norm": 17.020240783691406, "learning_rate": 8.400000000000001e-06, "num_tokens": 983604.0, "completions/mean_length": 42.375, "completions/min_length": 40.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.375, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.6046037673950195, "rewards/meter/std": 0.4366230070590973, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8650000095367432, "rewards/judge_quality/std": 0.16801361739635468, "rewards/repeat_penalty/mean": 0.9792095422744751, "rewards/repeat_penalty/std": 0.024614235386252403, "rewards/repeat_floor/mean": 0.9968814253807068, "rewards/repeat_floor/std": 0.003692133817821741, "rewards/near_duplicate_penalty/mean": 0.9792095422744751, "rewards/near_duplicate_penalty/std": 0.024614235386252403, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5405032634735107, "rewards/total_composite/std": 0.41472986340522766, "reward": 0.5405032634735107, "reward_std": 0.41472986340522766, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13471050560474396, "sampling/sampling_logp_difference/max": 1.173884391784668, "sampling/importance_sampling_ratio/min": 0.3091636896133423, "sampling/importance_sampling_ratio/mean": 1.0192580223083496, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.02584907412529, "clip_ratio/low_mean": 0.06833758763968945, "clip_ratio/low_min": 0.06833758763968945, "clip_ratio/high_mean": 0.0853796461597085, "clip_ratio/high_max": 0.0853796461597085, "clip_ratio/region_mean": 0.15371723379939795, "reward_total_mean": 0.5405032634735107, "reward_meter_mean": 0.6046037673950195, "reward_meter_std": 0.4366230070590973, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9792095422744751, "reward_repeat_penalty_std": 0.024614235386252403, "reward_repeat_floor_mean": 0.9968814253807068, "reward_repeat_floor_std": 0.003692133817821741, "reward_near_duplicate_penalty_mean": 0.9792095422744751, "reward_near_duplicate_penalty_std": 0.024614235386252403, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8650000095367432, "reward_judge_quality_std": 0.16801361739635468, "reward_total_composite_mean": 0.5405032634735107, "reward_total_composite_std": 0.41472986340522766} {"timestamp_utc": "2026-04-12T17:53:22Z", "mode": "train", "global_step": 530, "epoch": 0.027893268775327613, "loss": -0.0243, "grad_norm": 12.753585815429688, "learning_rate": 8.396969696969698e-06, "num_tokens": 985536.0, "completions/mean_length": 70.5, "completions/min_length": 60.0, "completions/max_length": 82.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 70.5, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.977649450302124, "rewards/meter/std": 0.025170614942908287, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47874999046325684, "rewards/judge_quality/std": 0.19208908081054688, "rewards/repeat_penalty/mean": 0.6512997150421143, "rewards/repeat_penalty/std": 0.29170456528663635, "rewards/repeat_floor/mean": 0.9545592069625854, "rewards/repeat_floor/std": 0.04167105257511139, "rewards/near_duplicate_penalty/mean": 0.8683203458786011, "rewards/near_duplicate_penalty/std": 0.09415994584560394, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.18600596487522125, "rewards/distinct_2/mean": 0.7770681381225586, "rewards/distinct_2/std": 0.21163016557693481, "rewards/total_composite/mean": 0.447043240070343, "rewards/total_composite/std": 0.2018108069896698, "reward": 0.447043240070343, "reward_std": 0.201810821890831, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14128251373767853, "sampling/sampling_logp_difference/max": 1.3856477737426758, "sampling/importance_sampling_ratio/min": 0.29448401927948, "sampling/importance_sampling_ratio/mean": 1.0213531255722046, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0827714279294014, "clip_ratio/low_mean": 0.08939542807638645, "clip_ratio/low_min": 0.08939542807638645, "clip_ratio/high_mean": 0.034137751907110214, "clip_ratio/high_max": 0.034137751907110214, "clip_ratio/region_mean": 0.12353317998349667, "reward_total_mean": 0.447043240070343, "reward_meter_mean": 0.977649450302124, "reward_meter_std": 0.025170614942908287, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6512997150421143, "reward_repeat_penalty_std": 0.29170456528663635, "reward_repeat_floor_mean": 0.9545592069625854, "reward_repeat_floor_std": 0.04167105257511139, "reward_near_duplicate_penalty_mean": 0.8683203458786011, "reward_near_duplicate_penalty_std": 0.09415994584560394, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.18600596487522125, "reward_distinct_2_mean": 0.7770681381225586, "reward_distinct_2_std": 0.21163016557693481, "reward_judge_quality_mean": 0.47874999046325684, "reward_judge_quality_std": 0.19208908081054688, "reward_total_composite_mean": 0.447043240070343, "reward_total_composite_std": 0.2018108069896698} {"timestamp_utc": "2026-04-12T17:53:36Z", "mode": "train", "global_step": 531, "epoch": 0.027945897584337666, "loss": -0.0403, "grad_norm": 5.967904567718506, "learning_rate": 8.393939393939394e-06, "num_tokens": 987069.0, "completions/mean_length": 103.625, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 45.28571701049805, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.7417125701904297, "rewards/meter/std": 0.41653189063072205, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.916822075843811, "rewards/lexical_plausibility/std": 0.20004339516162872, "rewards/judge_quality/mean": 0.3974999785423279, "rewards/judge_quality/std": 0.24063903093338013, "rewards/repeat_penalty/mean": 0.9902595281600952, "rewards/repeat_penalty/std": 0.019846748560667038, "rewards/repeat_floor/mean": 0.9985389709472656, "rewards/repeat_floor/std": 0.0029770233668386936, "rewards/near_duplicate_penalty/mean": 0.9902595281600952, "rewards/near_duplicate_penalty/std": 0.019846748560667038, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33809584379196167, "rewards/total_composite/std": 0.2639330327510834, "reward": 0.33809584379196167, "reward_std": 0.2639330327510834, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18398135900497437, "sampling/sampling_logp_difference/max": 1.5910964012145996, "sampling/importance_sampling_ratio/min": 0.2037021517753601, "sampling/importance_sampling_ratio/mean": 1.021674633026123, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.328366443514824, "clip_ratio/low_mean": 0.043073542416095734, "clip_ratio/low_min": 0.043073542416095734, "clip_ratio/high_mean": 0.10310218390077353, "clip_ratio/high_max": 0.10310218390077353, "clip_ratio/region_mean": 0.14617572631686926, "reward_total_mean": 0.33809584379196167, "reward_meter_mean": 0.7417125701904297, "reward_meter_std": 0.41653189063072205, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.916822075843811, "reward_lexical_plausibility_std": 0.20004339516162872, "reward_repeat_penalty_mean": 0.9902595281600952, "reward_repeat_penalty_std": 0.019846748560667038, "reward_repeat_floor_mean": 0.9985389709472656, "reward_repeat_floor_std": 0.0029770233668386936, "reward_near_duplicate_penalty_mean": 0.9902595281600952, "reward_near_duplicate_penalty_std": 0.019846748560667038, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3974999785423279, "reward_judge_quality_std": 0.24063903093338013, "reward_total_composite_mean": 0.33809584379196167, "reward_total_composite_std": 0.2639330327510834} {"timestamp_utc": "2026-04-12T17:53:43Z", "mode": "train", "global_step": 532, "epoch": 0.027998526393347718, "loss": -0.0458, "grad_norm": 16.18859100341797, "learning_rate": 8.390909090909091e-06, "num_tokens": 988585.0, "completions/mean_length": 21.5, "completions/min_length": 18.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.5, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.990827202796936, "rewards/meter/std": 0.004266964737325907, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9350000023841858, "rewards/judge_quality/std": 0.0160356592386961, "rewards/repeat_penalty/mean": 0.7407815456390381, "rewards/repeat_penalty/std": 0.019436990842223167, "rewards/repeat_floor/mean": 0.9831563234329224, "rewards/repeat_floor/std": 0.003887410741299391, "rewards/near_duplicate_penalty/mean": 0.9877086877822876, "rewards/near_duplicate_penalty/std": 0.02591598778963089, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.9108440279960632, "rewards/total_composite/std": 0.017982803285121918, "reward": 0.9108440279960632, "reward_std": 0.017982803285121918, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12008897960186005, "sampling/sampling_logp_difference/max": 1.1165573596954346, "sampling/importance_sampling_ratio/min": 0.32740500569343567, "sampling/importance_sampling_ratio/mean": 1.0318312644958496, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8956025987863541, "clip_ratio/low_mean": 0.10250000189989805, "clip_ratio/low_min": 0.10250000189989805, "clip_ratio/high_mean": 0.06027668062597513, "clip_ratio/high_max": 0.06027668062597513, "clip_ratio/region_mean": 0.16277668252587318, "reward_total_mean": 0.9108440279960632, "reward_meter_mean": 0.990827202796936, "reward_meter_std": 0.004266964737325907, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7407815456390381, "reward_repeat_penalty_std": 0.019436990842223167, "reward_repeat_floor_mean": 0.9831563234329224, "reward_repeat_floor_std": 0.003887410741299391, "reward_near_duplicate_penalty_mean": 0.9877086877822876, "reward_near_duplicate_penalty_std": 0.02591598778963089, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9350000023841858, "reward_judge_quality_std": 0.0160356592386961, "reward_total_composite_mean": 0.9108440279960632, "reward_total_composite_std": 0.017982803285121918} {"timestamp_utc": "2026-04-12T17:53:53Z", "mode": "train", "global_step": 533, "epoch": 0.02805115520235777, "loss": 0.0013, "grad_norm": 10.451583862304688, "learning_rate": 8.387878787878788e-06, "num_tokens": 990655.0, "completions/mean_length": 85.75, "completions/min_length": 69.0, "completions/max_length": 94.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 85.75, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.9029849767684937, "rewards/meter/std": 0.16572394967079163, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9886363744735718, "rewards/lexical_plausibility/std": 0.03214120864868164, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.21999594569206238, "rewards/repeat_penalty/mean": 0.7920286655426025, "rewards/repeat_penalty/std": 0.1517161875963211, "rewards/repeat_floor/mean": 0.9770760536193848, "rewards/repeat_floor/std": 0.016692444682121277, "rewards/near_duplicate_penalty/mean": 0.9443671703338623, "rewards/near_duplicate_penalty/std": 0.036020245403051376, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.033407654613256454, "rewards/distinct_2/mean": 0.8588440418243408, "rewards/distinct_2/std": 0.10853662341833115, "rewards/total_composite/mean": 0.3802032470703125, "rewards/total_composite/std": 0.22947688400745392, "reward": 0.3802032470703125, "reward_std": 0.22947688400745392, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17223356664180756, "sampling/sampling_logp_difference/max": 1.8576600551605225, "sampling/importance_sampling_ratio/min": 0.2245761901140213, "sampling/importance_sampling_ratio/mean": 1.0213243961334229, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1899310946464539, "clip_ratio/low_mean": 0.11127193598076701, "clip_ratio/low_min": 0.11127193598076701, "clip_ratio/high_mean": 0.05669729225337505, "clip_ratio/high_max": 0.05669729225337505, "clip_ratio/region_mean": 0.16796922823414207, "reward_total_mean": 0.3802032470703125, "reward_meter_mean": 0.9029849767684937, "reward_meter_std": 0.16572394967079163, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9886363744735718, "reward_lexical_plausibility_std": 0.03214120864868164, "reward_repeat_penalty_mean": 0.7920286655426025, "reward_repeat_penalty_std": 0.1517161875963211, "reward_repeat_floor_mean": 0.9770760536193848, "reward_repeat_floor_std": 0.016692444682121277, "reward_near_duplicate_penalty_mean": 0.9443671703338623, "reward_near_duplicate_penalty_std": 0.036020245403051376, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.033407654613256454, "reward_distinct_2_mean": 0.8588440418243408, "reward_distinct_2_std": 0.10853662341833115, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.21999594569206238, "reward_total_composite_mean": 0.3802032470703125, "reward_total_composite_std": 0.22947688400745392} {"timestamp_utc": "2026-04-12T17:54:01Z", "mode": "train", "global_step": 534, "epoch": 0.028103784011367823, "loss": -0.0169, "grad_norm": 14.684247016906738, "learning_rate": 8.384848484848485e-06, "num_tokens": 992372.0, "completions/mean_length": 45.625, "completions/min_length": 40.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.625, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.7595301270484924, "rewards/meter/std": 0.35030755400657654, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6512500047683716, "rewards/judge_quality/std": 0.2825110852718353, "rewards/repeat_penalty/mean": 0.9128025770187378, "rewards/repeat_penalty/std": 0.14674966037273407, "rewards/repeat_floor/mean": 0.9907699823379517, "rewards/repeat_floor/std": 0.01503970380872488, "rewards/near_duplicate_penalty/mean": 0.9747364521026611, "rewards/near_duplicate_penalty/std": 0.04412895813584328, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9603838324546814, "rewards/distinct_2/std": 0.059518154710531235, "rewards/total_composite/mean": 0.5552917718887329, "rewards/total_composite/std": 0.3379598557949066, "reward": 0.5552917718887329, "reward_std": 0.3379598557949066, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19227157533168793, "sampling/sampling_logp_difference/max": 1.9252128601074219, "sampling/importance_sampling_ratio/min": 0.1458446979522705, "sampling/importance_sampling_ratio/mean": 1.0221185684204102, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4830809086561203, "clip_ratio/low_mean": 0.08226950652897358, "clip_ratio/low_min": 0.08226950652897358, "clip_ratio/high_mean": 0.12457510828971863, "clip_ratio/high_max": 0.12457510828971863, "clip_ratio/region_mean": 0.2068446148186922, "reward_total_mean": 0.5552917718887329, "reward_meter_mean": 0.7595301270484924, "reward_meter_std": 0.35030755400657654, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9128025770187378, "reward_repeat_penalty_std": 0.14674966037273407, "reward_repeat_floor_mean": 0.9907699823379517, "reward_repeat_floor_std": 0.01503970380872488, "reward_near_duplicate_penalty_mean": 0.9747364521026611, "reward_near_duplicate_penalty_std": 0.04412895813584328, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9603838324546814, "reward_distinct_2_std": 0.059518154710531235, "reward_judge_quality_mean": 0.6512500047683716, "reward_judge_quality_std": 0.2825110852718353, "reward_total_composite_mean": 0.5552917718887329, "reward_total_composite_std": 0.3379598557949066} {"timestamp_utc": "2026-04-12T17:54:10Z", "mode": "train", "global_step": 535, "epoch": 0.028156412820377875, "loss": 0.0063, "grad_norm": 15.400646209716797, "learning_rate": 8.381818181818183e-06, "num_tokens": 994057.0, "completions/mean_length": 36.625, "completions/min_length": 28.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.625, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.5755261778831482, "rewards/meter/std": 0.33385905623435974, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.4337500035762787, "rewards/judge_quality/std": 0.23868314921855927, "rewards/repeat_penalty/mean": 0.9926507472991943, "rewards/repeat_penalty/std": 0.01203578058630228, "rewards/repeat_floor/mean": 0.9988976120948792, "rewards/repeat_floor/std": 0.0018053678795695305, "rewards/near_duplicate_penalty/mean": 0.9926507472991943, "rewards/near_duplicate_penalty/std": 0.01203578058630228, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27345919609069824, "rewards/total_composite/std": 0.27108234167099, "reward": 0.27345919609069824, "reward_std": 0.27108234167099, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14011964201927185, "sampling/sampling_logp_difference/max": 1.2333767414093018, "sampling/importance_sampling_ratio/min": 0.3287924826145172, "sampling/importance_sampling_ratio/mean": 1.0309313535690308, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9671645909547806, "clip_ratio/low_mean": 0.0746927666477859, "clip_ratio/low_min": 0.0746927666477859, "clip_ratio/high_mean": 0.05272368621081114, "clip_ratio/high_max": 0.05272368621081114, "clip_ratio/region_mean": 0.12741645285859704, "reward_total_mean": 0.27345919609069824, "reward_meter_mean": 0.5755261778831482, "reward_meter_std": 0.33385905623435974, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.9926507472991943, "reward_repeat_penalty_std": 0.01203578058630228, "reward_repeat_floor_mean": 0.9988976120948792, "reward_repeat_floor_std": 0.0018053678795695305, "reward_near_duplicate_penalty_mean": 0.9926507472991943, "reward_near_duplicate_penalty_std": 0.01203578058630228, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4337500035762787, "reward_judge_quality_std": 0.23868314921855927, "reward_total_composite_mean": 0.27345919609069824, "reward_total_composite_std": 0.27108234167099} {"timestamp_utc": "2026-04-12T17:54:19Z", "mode": "train", "global_step": 536, "epoch": 0.028209041629387928, "loss": 0.0156, "grad_norm": 14.113986015319824, "learning_rate": 8.37878787878788e-06, "num_tokens": 995744.0, "completions/mean_length": 40.875, "completions/min_length": 37.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.875, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.9737036824226379, "rewards/meter/std": 0.008200089447200298, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6924999952316284, "rewards/judge_quality/std": 0.24702516198158264, "rewards/repeat_penalty/mean": 0.9207477569580078, "rewards/repeat_penalty/std": 0.16635946929454803, "rewards/repeat_floor/mean": 0.9906090497970581, "rewards/repeat_floor/std": 0.018031971529126167, "rewards/near_duplicate_penalty/mean": 0.9663771390914917, "rewards/near_duplicate_penalty/std": 0.04478232190012932, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9725275039672852, "rewards/distinct_2/std": 0.0777040421962738, "rewards/total_composite/mean": 0.6679074168205261, "rewards/total_composite/std": 0.23968350887298584, "reward": 0.6679074168205261, "reward_std": 0.23968349397182465, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1420191377401352, "sampling/sampling_logp_difference/max": 1.8050583600997925, "sampling/importance_sampling_ratio/min": 0.16446486115455627, "sampling/importance_sampling_ratio/mean": 1.0114234685897827, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.072468377649784, "clip_ratio/low_mean": 0.05411811778321862, "clip_ratio/low_min": 0.05411811778321862, "clip_ratio/high_mean": 0.07994132116436958, "clip_ratio/high_max": 0.07994132116436958, "clip_ratio/region_mean": 0.1340594389475882, "reward_total_mean": 0.6679074168205261, "reward_meter_mean": 0.9737036824226379, "reward_meter_std": 0.008200089447200298, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9207477569580078, "reward_repeat_penalty_std": 0.16635946929454803, "reward_repeat_floor_mean": 0.9906090497970581, "reward_repeat_floor_std": 0.018031971529126167, "reward_near_duplicate_penalty_mean": 0.9663771390914917, "reward_near_duplicate_penalty_std": 0.04478232190012932, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9725275039672852, "reward_distinct_2_std": 0.0777040421962738, "reward_judge_quality_mean": 0.6924999952316284, "reward_judge_quality_std": 0.24702516198158264, "reward_total_composite_mean": 0.6679074168205261, "reward_total_composite_std": 0.23968350887298584} {"timestamp_utc": "2026-04-12T17:54:26Z", "mode": "train", "global_step": 537, "epoch": 0.02826167043839798, "loss": 0.0056, "grad_norm": 27.017452239990234, "learning_rate": 8.375757575757576e-06, "num_tokens": 996955.0, "completions/mean_length": 15.375, "completions/min_length": 14.0, "completions/max_length": 17.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 15.375, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 17.0, "rewards/meter/mean": 0.8183342218399048, "rewards/meter/std": 0.22687792778015137, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5175000429153442, "rewards/judge_quality/std": 0.36358335614204407, "rewards/repeat_penalty/mean": 0.5072780847549438, "rewards/repeat_penalty/std": 0.33308693766593933, "rewards/repeat_floor/mean": 0.9359098672866821, "rewards/repeat_floor/std": 0.06790994107723236, "rewards/near_duplicate_penalty/mean": 0.7990146279335022, "rewards/near_duplicate_penalty/std": 0.2539031207561493, "rewards/opening_diversity/mean": 0.5625, "rewards/opening_diversity/std": 0.3471825420856476, "rewards/distinct_2/mean": 0.9145299196243286, "rewards/distinct_2/std": 0.12921862304210663, "rewards/total_composite/mean": 0.41749513149261475, "rewards/total_composite/std": 0.3125753104686737, "reward": 0.41749513149261475, "reward_std": 0.3125753104686737, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1546861231327057, "sampling/sampling_logp_difference/max": 0.8975248336791992, "sampling/importance_sampling_ratio/min": 0.407577246427536, "sampling/importance_sampling_ratio/mean": 1.0093579292297363, "sampling/importance_sampling_ratio/max": 1.9865440130233765, "entropy": 1.0206656903028488, "clip_ratio/low_mean": 0.04010416753590107, "clip_ratio/low_min": 0.04010416753590107, "clip_ratio/high_mean": 0.10004814714193344, "clip_ratio/high_max": 0.10004814714193344, "clip_ratio/region_mean": 0.1401523146778345, "reward_total_mean": 0.41749513149261475, "reward_meter_mean": 0.8183342218399048, "reward_meter_std": 0.22687792778015137, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5072780847549438, "reward_repeat_penalty_std": 0.33308693766593933, "reward_repeat_floor_mean": 0.9359098672866821, "reward_repeat_floor_std": 0.06790994107723236, "reward_near_duplicate_penalty_mean": 0.7990146279335022, "reward_near_duplicate_penalty_std": 0.2539031207561493, "reward_opening_diversity_mean": 0.5625, "reward_opening_diversity_std": 0.3471825420856476, "reward_distinct_2_mean": 0.9145299196243286, "reward_distinct_2_std": 0.12921862304210663, "reward_judge_quality_mean": 0.5175000429153442, "reward_judge_quality_std": 0.36358335614204407, "reward_total_composite_mean": 0.41749513149261475, "reward_total_composite_std": 0.3125753104686737} {"timestamp_utc": "2026-04-12T17:54:34Z", "mode": "train", "global_step": 538, "epoch": 0.028314299247408033, "loss": -0.0252, "grad_norm": 24.270811080932617, "learning_rate": 8.372727272727273e-06, "num_tokens": 998572.0, "completions/mean_length": 23.125, "completions/min_length": 20.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.125, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.5175116062164307, "rewards/meter/std": 0.45019999146461487, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9537814855575562, "rewards/lexical_plausibility/std": 0.13072560727596283, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.4051785469055176, "rewards/repeat_penalty/mean": 0.7772529125213623, "rewards/repeat_penalty/std": 0.09032660722732544, "rewards/repeat_floor/mean": 0.9860755801200867, "rewards/repeat_floor/std": 0.005829798057675362, "rewards/near_duplicate_penalty/mean": 0.9946705102920532, "rewards/near_duplicate_penalty/std": 0.010404122062027454, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3026256859302521, "rewards/total_composite/std": 0.3392674922943115, "reward": 0.3026256859302521, "reward_std": 0.3392674922943115, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15665315091609955, "sampling/sampling_logp_difference/max": 1.524843692779541, "sampling/importance_sampling_ratio/min": 0.21765509247779846, "sampling/importance_sampling_ratio/mean": 1.0388096570968628, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1804536283016205, "clip_ratio/low_mean": 0.10047619184479117, "clip_ratio/low_min": 0.10047619184479117, "clip_ratio/high_mean": 0.04678571503609419, "clip_ratio/high_max": 0.04678571503609419, "clip_ratio/region_mean": 0.14726190688088536, "reward_total_mean": 0.3026256859302521, "reward_meter_mean": 0.5175116062164307, "reward_meter_std": 0.45019999146461487, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9537814855575562, "reward_lexical_plausibility_std": 0.13072560727596283, "reward_repeat_penalty_mean": 0.7772529125213623, "reward_repeat_penalty_std": 0.09032660722732544, "reward_repeat_floor_mean": 0.9860755801200867, "reward_repeat_floor_std": 0.005829798057675362, "reward_near_duplicate_penalty_mean": 0.9946705102920532, "reward_near_duplicate_penalty_std": 0.010404122062027454, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.4051785469055176, "reward_total_composite_mean": 0.3026256859302521, "reward_total_composite_std": 0.3392674922943115} {"timestamp_utc": "2026-04-12T17:54:42Z", "mode": "train", "global_step": 539, "epoch": 0.02836692805641808, "loss": 0.0687, "grad_norm": 28.37616539001465, "learning_rate": 8.36969696969697e-06, "num_tokens": 1000146.0, "completions/mean_length": 20.75, "completions/min_length": 16.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.75, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.836410403251648, "rewards/meter/std": 0.34153905510902405, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9712885022163391, "rewards/lexical_plausibility/std": 0.08120834082365036, "rewards/judge_quality/mean": 0.7350000143051147, "rewards/judge_quality/std": 0.36130717396736145, "rewards/repeat_penalty/mean": 0.7469173073768616, "rewards/repeat_penalty/std": 0.00871915090829134, "rewards/repeat_floor/mean": 0.9843834638595581, "rewards/repeat_floor/std": 0.0017438469221815467, "rewards/near_duplicate_penalty/mean": 0.9958897829055786, "rewards/near_duplicate_penalty/std": 0.011625555343925953, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6694763898849487, "rewards/total_composite/std": 0.3791556656360626, "reward": 0.6694763898849487, "reward_std": 0.37915563583374023, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.195589080452919, "sampling/sampling_logp_difference/max": 2.2354326248168945, "sampling/importance_sampling_ratio/min": 0.10694584995508194, "sampling/importance_sampling_ratio/mean": 1.0180273056030273, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5171124637126923, "clip_ratio/low_mean": 0.03269675932824612, "clip_ratio/low_min": 0.03269675932824612, "clip_ratio/high_mean": 0.14932939317077398, "clip_ratio/high_max": 0.14932939317077398, "clip_ratio/region_mean": 0.1820261524990201, "reward_total_mean": 0.6694763898849487, "reward_meter_mean": 0.836410403251648, "reward_meter_std": 0.34153905510902405, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9712885022163391, "reward_lexical_plausibility_std": 0.08120834082365036, "reward_repeat_penalty_mean": 0.7469173073768616, "reward_repeat_penalty_std": 0.00871915090829134, "reward_repeat_floor_mean": 0.9843834638595581, "reward_repeat_floor_std": 0.0017438469221815467, "reward_near_duplicate_penalty_mean": 0.9958897829055786, "reward_near_duplicate_penalty_std": 0.011625555343925953, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7350000143051147, "reward_judge_quality_std": 0.36130717396736145, "reward_total_composite_mean": 0.6694763898849487, "reward_total_composite_std": 0.3791556656360626} {"timestamp_utc": "2026-04-12T17:54:53Z", "mode": "train", "global_step": 540, "epoch": 0.028419556865428134, "loss": 0.0426, "grad_norm": 5.609861373901367, "learning_rate": 8.366666666666667e-06, "num_tokens": 1003664.0, "completions/mean_length": 221.75, "completions/min_length": 200.0, "completions/max_length": 237.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 221.75, "completions/min_terminated_length": 200.0, "completions/max_terminated_length": 237.0, "rewards/meter/mean": 0.9899396896362305, "rewards/meter/std": 0.006180691998451948, "rewards/count_adherence/mean": 0.796875, "rewards/count_adherence/std": 0.06469365209341049, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9390625357627869, "rewards/count_floor/std": 0.019408077001571655, "rewards/lexical_plausibility/mean": 0.995192289352417, "rewards/lexical_plausibility/std": 0.013598216697573662, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.19504812359809875, "rewards/repeat_penalty/std": 0.23113195598125458, "rewards/repeat_floor/mean": 0.8998855352401733, "rewards/repeat_floor/std": 0.03842740133404732, "rewards/near_duplicate_penalty/mean": 0.804067850112915, "rewards/near_duplicate_penalty/std": 0.10348296910524368, "rewards/opening_diversity/mean": 0.9299342632293701, "rewards/opening_diversity/std": 0.08241672813892365, "rewards/distinct_2/mean": 0.26088157296180725, "rewards/distinct_2/std": 0.2332412302494049, "rewards/total_composite/mean": 0.21253344416618347, "rewards/total_composite/std": 0.10148772597312927, "reward": 0.21253344416618347, "reward_std": 0.10148772597312927, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10452376306056976, "sampling/sampling_logp_difference/max": 2.5418431758880615, "sampling/importance_sampling_ratio/min": 0.07872116565704346, "sampling/importance_sampling_ratio/mean": 1.005106806755066, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7273459509015083, "clip_ratio/low_mean": 0.04295601695775986, "clip_ratio/low_min": 0.04295601695775986, "clip_ratio/high_mean": 0.04126647673547268, "clip_ratio/high_max": 0.04126647673547268, "clip_ratio/region_mean": 0.08422249369323254, "reward_total_mean": 0.21253344416618347, "reward_meter_mean": 0.9899396896362305, "reward_meter_std": 0.006180691998451948, "reward_count_adherence_mean": 0.796875, "reward_count_adherence_std": 0.06469365209341049, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9390625357627869, "reward_count_floor_std": 0.019408077001571655, "reward_lexical_plausibility_mean": 0.995192289352417, "reward_lexical_plausibility_std": 0.013598216697573662, "reward_repeat_penalty_mean": 0.19504812359809875, "reward_repeat_penalty_std": 0.23113195598125458, "reward_repeat_floor_mean": 0.8998855352401733, "reward_repeat_floor_std": 0.03842740133404732, "reward_near_duplicate_penalty_mean": 0.804067850112915, "reward_near_duplicate_penalty_std": 0.10348296910524368, "reward_opening_diversity_mean": 0.9299342632293701, "reward_opening_diversity_std": 0.08241672813892365, "reward_distinct_2_mean": 0.26088157296180725, "reward_distinct_2_std": 0.2332412302494049, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.21253344416618347, "reward_total_composite_std": 0.10148772597312927} {"timestamp_utc": "2026-04-12T17:55:02Z", "mode": "train", "global_step": 541, "epoch": 0.028472185674438186, "loss": 0.0363, "grad_norm": 10.28022289276123, "learning_rate": 8.363636363636365e-06, "num_tokens": 1005309.0, "completions/mean_length": 43.625, "completions/min_length": 39.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.625, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.9291422963142395, "rewards/meter/std": 0.1510709673166275, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5337499976158142, "rewards/judge_quality/std": 0.19449110329151154, "rewards/repeat_penalty/mean": 0.8899205327033997, "rewards/repeat_penalty/std": 0.1447400003671646, "rewards/repeat_floor/mean": 0.9874789714813232, "rewards/repeat_floor/std": 0.014373972080647945, "rewards/near_duplicate_penalty/mean": 0.9584294557571411, "rewards/near_duplicate_penalty/std": 0.02553483657538891, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.950995147228241, "rewards/distinct_2/std": 0.07158949226140976, "rewards/total_composite/mean": 0.4795469641685486, "rewards/total_composite/std": 0.17618587613105774, "reward": 0.4795469641685486, "reward_std": 0.17618586122989655, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17609557509422302, "sampling/sampling_logp_difference/max": 3.096968650817871, "sampling/importance_sampling_ratio/min": 0.04518597200512886, "sampling/importance_sampling_ratio/mean": 1.0256534814834595, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.190860167145729, "clip_ratio/low_mean": 0.1447890056297183, "clip_ratio/low_min": 0.1447890056297183, "clip_ratio/high_mean": 0.034090910106897354, "clip_ratio/high_max": 0.034090910106897354, "clip_ratio/region_mean": 0.17887991573661566, "reward_total_mean": 0.4795469641685486, "reward_meter_mean": 0.9291422963142395, "reward_meter_std": 0.1510709673166275, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8899205327033997, "reward_repeat_penalty_std": 0.1447400003671646, "reward_repeat_floor_mean": 0.9874789714813232, "reward_repeat_floor_std": 0.014373972080647945, "reward_near_duplicate_penalty_mean": 0.9584294557571411, "reward_near_duplicate_penalty_std": 0.02553483657538891, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.950995147228241, "reward_distinct_2_std": 0.07158949226140976, "reward_judge_quality_mean": 0.5337499976158142, "reward_judge_quality_std": 0.19449110329151154, "reward_total_composite_mean": 0.4795469641685486, "reward_total_composite_std": 0.17618587613105774} {"timestamp_utc": "2026-04-12T17:55:12Z", "mode": "train", "global_step": 542, "epoch": 0.02852481448344824, "loss": 0.038, "grad_norm": 10.507553100585938, "learning_rate": 8.360606060606062e-06, "num_tokens": 1006834.0, "completions/mean_length": 43.625, "completions/min_length": 36.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.625, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.5549032092094421, "rewards/meter/std": 0.3387735188007355, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6924999952316284, "rewards/judge_quality/std": 0.22403763234615326, "rewards/repeat_penalty/mean": 0.9862676858901978, "rewards/repeat_penalty/std": 0.017138002440333366, "rewards/repeat_floor/mean": 0.9979401230812073, "rewards/repeat_floor/std": 0.002570702228695154, "rewards/near_duplicate_penalty/mean": 0.9862676858901978, "rewards/near_duplicate_penalty/std": 0.017138002440333366, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3391241431236267, "rewards/total_composite/std": 0.19354674220085144, "reward": 0.3391241431236267, "reward_std": 0.19354675710201263, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1643466353416443, "sampling/sampling_logp_difference/max": 1.9000043869018555, "sampling/importance_sampling_ratio/min": 0.14956796169281006, "sampling/importance_sampling_ratio/mean": 1.0039417743682861, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0861047953367233, "clip_ratio/low_mean": 0.040495650842785835, "clip_ratio/low_min": 0.040495650842785835, "clip_ratio/high_mean": 0.08771135564893484, "clip_ratio/high_max": 0.08771135564893484, "clip_ratio/region_mean": 0.12820700649172068, "reward_total_mean": 0.3391241431236267, "reward_meter_mean": 0.5549032092094421, "reward_meter_std": 0.3387735188007355, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9862676858901978, "reward_repeat_penalty_std": 0.017138002440333366, "reward_repeat_floor_mean": 0.9979401230812073, "reward_repeat_floor_std": 0.002570702228695154, "reward_near_duplicate_penalty_mean": 0.9862676858901978, "reward_near_duplicate_penalty_std": 0.017138002440333366, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6924999952316284, "reward_judge_quality_std": 0.22403763234615326, "reward_total_composite_mean": 0.3391241431236267, "reward_total_composite_std": 0.19354674220085144} {"timestamp_utc": "2026-04-12T17:55:26Z", "mode": "train", "global_step": 543, "epoch": 0.02857744329245829, "loss": -0.0588, "grad_norm": 5.534773349761963, "learning_rate": 8.357575757575759e-06, "num_tokens": 1008491.0, "completions/mean_length": 102.125, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.57143020629883, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.7801710367202759, "rewards/meter/std": 0.3322688639163971, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8668769598007202, "rewards/lexical_plausibility/std": 0.2071887105703354, "rewards/judge_quality/mean": 0.3837500214576721, "rewards/judge_quality/std": 0.2579555809497833, "rewards/repeat_penalty/mean": 0.955765962600708, "rewards/repeat_penalty/std": 0.0842575654387474, "rewards/repeat_floor/mean": 0.9961774349212646, "rewards/repeat_floor/std": 0.004959750920534134, "rewards/near_duplicate_penalty/mean": 0.987015962600708, "rewards/near_duplicate_penalty/std": 0.014638004824519157, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.34550759196281433, "rewards/total_composite/std": 0.2685561776161194, "reward": 0.34550759196281433, "reward_std": 0.268556147813797, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19492827355861664, "sampling/sampling_logp_difference/max": 1.2642736434936523, "sampling/importance_sampling_ratio/min": 0.2824443578720093, "sampling/importance_sampling_ratio/mean": 1.0476534366607666, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6444870680570602, "clip_ratio/low_mean": 0.07559523917734623, "clip_ratio/low_min": 0.07559523917734623, "clip_ratio/high_mean": 0.0709772165864706, "clip_ratio/high_max": 0.0709772165864706, "clip_ratio/region_mean": 0.14657245576381683, "reward_total_mean": 0.34550759196281433, "reward_meter_mean": 0.7801710367202759, "reward_meter_std": 0.3322688639163971, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8668769598007202, "reward_lexical_plausibility_std": 0.2071887105703354, "reward_repeat_penalty_mean": 0.955765962600708, "reward_repeat_penalty_std": 0.0842575654387474, "reward_repeat_floor_mean": 0.9961774349212646, "reward_repeat_floor_std": 0.004959750920534134, "reward_near_duplicate_penalty_mean": 0.987015962600708, "reward_near_duplicate_penalty_std": 0.014638004824519157, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3837500214576721, "reward_judge_quality_std": 0.2579555809497833, "reward_total_composite_mean": 0.34550759196281433, "reward_total_composite_std": 0.2685561776161194} {"timestamp_utc": "2026-04-12T17:55:35Z", "mode": "train", "global_step": 544, "epoch": 0.028630072101468344, "loss": 0.0401, "grad_norm": 13.619742393493652, "learning_rate": 8.354545454545455e-06, "num_tokens": 1010427.0, "completions/mean_length": 55.0, "completions/min_length": 45.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.0, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.610531210899353, "rewards/meter/std": 0.3780951201915741, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.574999988079071, "rewards/judge_quality/std": 0.23628070950508118, "rewards/repeat_penalty/mean": 0.9364616870880127, "rewards/repeat_penalty/std": 0.06729107350111008, "rewards/repeat_floor/mean": 0.9928113222122192, "rewards/repeat_floor/std": 0.007240903563797474, "rewards/near_duplicate_penalty/mean": 0.9779541492462158, "rewards/near_duplicate_penalty/std": 0.01755790412425995, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9568685293197632, "rewards/distinct_2/std": 0.05472530052065849, "rewards/total_composite/mean": 0.3467673659324646, "rewards/total_composite/std": 0.26447150111198425, "reward": 0.3467673659324646, "reward_std": 0.26447150111198425, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1923883855342865, "sampling/sampling_logp_difference/max": 1.640580177307129, "sampling/importance_sampling_ratio/min": 0.1938675343990326, "sampling/importance_sampling_ratio/mean": 1.0281118154525757, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5289423763751984, "clip_ratio/low_mean": 0.1141222445294261, "clip_ratio/low_min": 0.1141222445294261, "clip_ratio/high_mean": 0.046415770426392555, "clip_ratio/high_max": 0.046415770426392555, "clip_ratio/region_mean": 0.16053801495581865, "reward_total_mean": 0.3467673659324646, "reward_meter_mean": 0.610531210899353, "reward_meter_std": 0.3780951201915741, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9364616870880127, "reward_repeat_penalty_std": 0.06729107350111008, "reward_repeat_floor_mean": 0.9928113222122192, "reward_repeat_floor_std": 0.007240903563797474, "reward_near_duplicate_penalty_mean": 0.9779541492462158, "reward_near_duplicate_penalty_std": 0.01755790412425995, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9568685293197632, "reward_distinct_2_std": 0.05472530052065849, "reward_judge_quality_mean": 0.574999988079071, "reward_judge_quality_std": 0.23628070950508118, "reward_total_composite_mean": 0.3467673659324646, "reward_total_composite_std": 0.26447150111198425} {"timestamp_utc": "2026-04-12T17:55:43Z", "mode": "train", "global_step": 545, "epoch": 0.028682700910478396, "loss": -0.0339, "grad_norm": 26.761737823486328, "learning_rate": 8.351515151515152e-06, "num_tokens": 1011888.0, "completions/mean_length": 19.625, "completions/min_length": 14.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.625, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.8017735481262207, "rewards/meter/std": 0.3023511469364166, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.7351142168045044, "rewards/lexical_plausibility/std": 0.26900801062583923, "rewards/judge_quality/mean": 0.6475000381469727, "rewards/judge_quality/std": 0.30742016434669495, "rewards/repeat_penalty/mean": 0.680923581123352, "rewards/repeat_penalty/std": 0.11025054007768631, "rewards/repeat_floor/mean": 0.9711847305297852, "rewards/repeat_floor/std": 0.022050119936466217, "rewards/near_duplicate_penalty/mean": 0.9078980684280396, "rewards/near_duplicate_penalty/std": 0.14700071513652802, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5023888945579529, "rewards/total_composite/std": 0.3166264593601227, "reward": 0.5023888945579529, "reward_std": 0.3166264593601227, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18353956937789917, "sampling/sampling_logp_difference/max": 1.4188008308410645, "sampling/importance_sampling_ratio/min": 0.24200405180454254, "sampling/importance_sampling_ratio/mean": 1.0561906099319458, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.584113746881485, "clip_ratio/low_mean": 0.11533521302044392, "clip_ratio/low_min": 0.11533521302044392, "clip_ratio/high_mean": 0.0706196604296565, "clip_ratio/high_max": 0.0706196604296565, "clip_ratio/region_mean": 0.18595487345010042, "reward_total_mean": 0.5023888945579529, "reward_meter_mean": 0.8017735481262207, "reward_meter_std": 0.3023511469364166, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.7351142168045044, "reward_lexical_plausibility_std": 0.26900801062583923, "reward_repeat_penalty_mean": 0.680923581123352, "reward_repeat_penalty_std": 0.11025054007768631, "reward_repeat_floor_mean": 0.9711847305297852, "reward_repeat_floor_std": 0.022050119936466217, "reward_near_duplicate_penalty_mean": 0.9078980684280396, "reward_near_duplicate_penalty_std": 0.14700071513652802, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6475000381469727, "reward_judge_quality_std": 0.30742016434669495, "reward_total_composite_mean": 0.5023888945579529, "reward_total_composite_std": 0.3166264593601227} {"timestamp_utc": "2026-04-12T17:55:50Z", "mode": "train", "global_step": 546, "epoch": 0.02873532971948845, "loss": 0.039, "grad_norm": 20.77408790588379, "learning_rate": 8.348484848484849e-06, "num_tokens": 1013367.0, "completions/mean_length": 22.875, "completions/min_length": 20.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.875, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.9722200632095337, "rewards/meter/std": 0.03387109562754631, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8274999856948853, "rewards/judge_quality/std": 0.27395257353782654, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7910505533218384, "rewards/total_composite/std": 0.2620963752269745, "reward": 0.7910505533218384, "reward_std": 0.2620963454246521, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16928167641162872, "sampling/sampling_logp_difference/max": 1.0764293670654297, "sampling/importance_sampling_ratio/min": 0.34081026911735535, "sampling/importance_sampling_ratio/mean": 1.0310733318328857, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4028927013278008, "clip_ratio/low_mean": 0.02083333395421505, "clip_ratio/low_min": 0.02083333395421505, "clip_ratio/high_mean": 0.17040193639695644, "clip_ratio/high_max": 0.17040193639695644, "clip_ratio/region_mean": 0.1912352703511715, "reward_total_mean": 0.7910505533218384, "reward_meter_mean": 0.9722200632095337, "reward_meter_std": 0.03387109562754631, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8274999856948853, "reward_judge_quality_std": 0.27395257353782654, "reward_total_composite_mean": 0.7910505533218384, "reward_total_composite_std": 0.2620963752269745} {"timestamp_utc": "2026-04-12T17:56:00Z", "mode": "train", "global_step": 547, "epoch": 0.0287879585284985, "loss": 0.0912, "grad_norm": 14.439604759216309, "learning_rate": 8.345454545454546e-06, "num_tokens": 1015122.0, "completions/mean_length": 41.375, "completions/min_length": 35.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.375, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.3898012340068817, "rewards/meter/std": 0.43012189865112305, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.20951901376247406, "rewards/repeat_penalty/mean": 0.9841147661209106, "rewards/repeat_penalty/std": 0.020881956443190575, "rewards/repeat_floor/mean": 0.9976171851158142, "rewards/repeat_floor/std": 0.003132288111373782, "rewards/near_duplicate_penalty/mean": 0.9841147661209106, "rewards/near_duplicate_penalty/std": 0.020881956443190575, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21943525969982147, "rewards/total_composite/std": 0.2665696144104004, "reward": 0.21943525969982147, "reward_std": 0.2665696144104004, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19609205424785614, "sampling/sampling_logp_difference/max": 1.6701555252075195, "sampling/importance_sampling_ratio/min": 0.18821778893470764, "sampling/importance_sampling_ratio/mean": 1.0267587900161743, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7265300154685974, "clip_ratio/low_mean": 0.09462734777480364, "clip_ratio/low_min": 0.09462734777480364, "clip_ratio/high_mean": 0.07235473114997149, "clip_ratio/high_max": 0.07235473114997149, "clip_ratio/region_mean": 0.16698207892477512, "reward_total_mean": 0.21943525969982147, "reward_meter_mean": 0.3898012340068817, "reward_meter_std": 0.43012189865112305, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9841147661209106, "reward_repeat_penalty_std": 0.020881956443190575, "reward_repeat_floor_mean": 0.9976171851158142, "reward_repeat_floor_std": 0.003132288111373782, "reward_near_duplicate_penalty_mean": 0.9841147661209106, "reward_near_duplicate_penalty_std": 0.020881956443190575, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.20951901376247406, "reward_total_composite_mean": 0.21943525969982147, "reward_total_composite_std": 0.2665696144104004} {"timestamp_utc": "2026-04-12T17:56:08Z", "mode": "train", "global_step": 548, "epoch": 0.028840587337508553, "loss": 0.0228, "grad_norm": 14.816450119018555, "learning_rate": 8.342424242424244e-06, "num_tokens": 1016729.0, "completions/mean_length": 42.875, "completions/min_length": 39.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.875, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7090002298355103, "rewards/meter/std": 0.42208850383758545, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9713541269302368, "rewards/lexical_plausibility/std": 0.05990393087267876, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.2975345253944397, "rewards/repeat_penalty/mean": 0.9335046410560608, "rewards/repeat_penalty/std": 0.12607936561107635, "rewards/repeat_floor/mean": 0.9929938316345215, "rewards/repeat_floor/std": 0.010820589028298855, "rewards/near_duplicate_penalty/mean": 0.9758254885673523, "rewards/near_duplicate_penalty/std": 0.025628648698329926, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9832775592803955, "rewards/distinct_2/std": 0.0472981221973896, "rewards/total_composite/mean": 0.5091841220855713, "rewards/total_composite/std": 0.37691253423690796, "reward": 0.5091841220855713, "reward_std": 0.37691250443458557, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1511572003364563, "sampling/sampling_logp_difference/max": 1.2685370445251465, "sampling/importance_sampling_ratio/min": 0.2812427580356598, "sampling/importance_sampling_ratio/mean": 1.0372276306152344, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0031752213835716, "clip_ratio/low_mean": 0.07500832807272673, "clip_ratio/low_min": 0.07500832807272673, "clip_ratio/high_mean": 0.08761508017778397, "clip_ratio/high_max": 0.08761508017778397, "clip_ratio/region_mean": 0.1626234082505107, "reward_total_mean": 0.5091841220855713, "reward_meter_mean": 0.7090002298355103, "reward_meter_std": 0.42208850383758545, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9713541269302368, "reward_lexical_plausibility_std": 0.05990393087267876, "reward_repeat_penalty_mean": 0.9335046410560608, "reward_repeat_penalty_std": 0.12607936561107635, "reward_repeat_floor_mean": 0.9929938316345215, "reward_repeat_floor_std": 0.010820589028298855, "reward_near_duplicate_penalty_mean": 0.9758254885673523, "reward_near_duplicate_penalty_std": 0.025628648698329926, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9832775592803955, "reward_distinct_2_std": 0.0472981221973896, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.2975345253944397, "reward_total_composite_mean": 0.5091841220855713, "reward_total_composite_std": 0.37691253423690796} {"timestamp_utc": "2026-04-12T17:56:19Z", "mode": "train", "global_step": 549, "epoch": 0.028893216146518606, "loss": 0.1447, "grad_norm": 13.118990898132324, "learning_rate": 8.339393939393941e-06, "num_tokens": 1018643.0, "completions/mean_length": 74.25, "completions/min_length": 64.0, "completions/max_length": 101.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 74.25, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 101.0, "rewards/meter/mean": 0.835888147354126, "rewards/meter/std": 0.31511005759239197, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42875000834465027, "rewards/judge_quality/std": 0.18566001951694489, "rewards/repeat_penalty/mean": 0.9674917459487915, "rewards/repeat_penalty/std": 0.03475857898592949, "rewards/repeat_floor/mean": 0.995691180229187, "rewards/repeat_floor/std": 0.004208729136735201, "rewards/near_duplicate_penalty/mean": 0.9776894450187683, "rewards/near_duplicate_penalty/std": 0.01718098670244217, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893079996109009, "rewards/distinct_2/std": 0.019807932898402214, "rewards/total_composite/mean": 0.3585785925388336, "rewards/total_composite/std": 0.19560429453849792, "reward": 0.3585785925388336, "reward_std": 0.19560429453849792, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22280728816986084, "sampling/sampling_logp_difference/max": 4.220475196838379, "sampling/importance_sampling_ratio/min": 0.014691662043333054, "sampling/importance_sampling_ratio/mean": 1.0015207529067993, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.557713970541954, "clip_ratio/low_mean": 0.1308778803795576, "clip_ratio/low_min": 0.1308778803795576, "clip_ratio/high_mean": 0.06722248159348965, "clip_ratio/high_max": 0.06722248159348965, "clip_ratio/region_mean": 0.19810036197304726, "reward_total_mean": 0.3585785925388336, "reward_meter_mean": 0.835888147354126, "reward_meter_std": 0.31511005759239197, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9674917459487915, "reward_repeat_penalty_std": 0.03475857898592949, "reward_repeat_floor_mean": 0.995691180229187, "reward_repeat_floor_std": 0.004208729136735201, "reward_near_duplicate_penalty_mean": 0.9776894450187683, "reward_near_duplicate_penalty_std": 0.01718098670244217, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893079996109009, "reward_distinct_2_std": 0.019807932898402214, "reward_judge_quality_mean": 0.42875000834465027, "reward_judge_quality_std": 0.18566001951694489, "reward_total_composite_mean": 0.3585785925388336, "reward_total_composite_std": 0.19560429453849792} {"timestamp_utc": "2026-04-12T17:56:32Z", "mode": "train", "global_step": 550, "epoch": 0.028945844955528658, "loss": -0.0298, "grad_norm": 5.064102649688721, "learning_rate": 8.336363636363636e-06, "num_tokens": 1020110.0, "completions/mean_length": 92.375, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 32.42857360839844, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.43611469864845276, "rewards/meter/std": 0.3893551230430603, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9332994818687439, "rewards/lexical_plausibility/std": 0.18865752220153809, "rewards/judge_quality/mean": 0.8187500238418579, "rewards/judge_quality/std": 0.3109174370765686, "rewards/repeat_penalty/mean": 0.9961467981338501, "rewards/repeat_penalty/std": 0.010898458771407604, "rewards/repeat_floor/mean": 0.999422013759613, "rewards/repeat_floor/std": 0.001634771004319191, "rewards/near_duplicate_penalty/mean": 0.9961467981338501, "rewards/near_duplicate_penalty/std": 0.010898458771407604, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4066752791404724, "rewards/total_composite/std": 0.3658042848110199, "reward": 0.4066752791404724, "reward_std": 0.3658042848110199, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12511000037193298, "sampling/sampling_logp_difference/max": 1.336487889289856, "sampling/importance_sampling_ratio/min": 0.26276692748069763, "sampling/importance_sampling_ratio/mean": 1.0332398414611816, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6308564990758896, "clip_ratio/low_mean": 0.06636904831975698, "clip_ratio/low_min": 0.06636904831975698, "clip_ratio/high_mean": 0.04446512646973133, "clip_ratio/high_max": 0.04446512646973133, "clip_ratio/region_mean": 0.11083417478948832, "reward_total_mean": 0.4066752791404724, "reward_meter_mean": 0.43611469864845276, "reward_meter_std": 0.3893551230430603, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9332994818687439, "reward_lexical_plausibility_std": 0.18865752220153809, "reward_repeat_penalty_mean": 0.9961467981338501, "reward_repeat_penalty_std": 0.010898458771407604, "reward_repeat_floor_mean": 0.999422013759613, "reward_repeat_floor_std": 0.001634771004319191, "reward_near_duplicate_penalty_mean": 0.9961467981338501, "reward_near_duplicate_penalty_std": 0.010898458771407604, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8187500238418579, "reward_judge_quality_std": 0.3109174370765686, "reward_total_composite_mean": 0.4066752791404724, "reward_total_composite_std": 0.3658042848110199} {"timestamp_utc": "2026-04-12T17:59:00Z", "mode": "eval", "global_step": 550, "epoch": 0.028945844955528658, "eval_loss": NaN, "eval_runtime": 148.3576, "eval_samples_per_second": 0.701, "eval_steps_per_second": 0.088, "eval_num_tokens": 1020110.0, "eval_completions/mean_length": 201.15384615384616, "eval_completions/min_length": 39.0, "eval_completions/max_length": 490.46153846153845, "eval_completions/clipped_ratio": 0.14423076923076922, "eval_completions/mean_terminated_length": 147.55146965613733, "eval_completions/min_terminated_length": 39.0, "eval_completions/max_terminated_length": 333.3076923076923, "eval_rewards/meter/mean": 0.6186482149821061, "eval_rewards/meter/std": 0.35500125472362226, "eval_rewards/count_adherence/mean": 0.8089264081074641, "eval_rewards/count_adherence/std": 0.22151099947782663, "eval_rewards/arabic_clean/mean": 0.8173076923076923, "eval_rewards/arabic_clean/std": 0.3768232533564934, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9985576913906977, "eval_rewards/arabic_floor/std": 0.004079461670838869, "eval_rewards/count_floor/mean": 0.9426779105113103, "eval_rewards/count_floor/std": 0.06645329855382442, "eval_rewards/lexical_plausibility/mean": 0.9259520860818716, "eval_rewards/lexical_plausibility/std": 0.14988471453006452, "eval_rewards/judge_quality/mean": 0.3449038381759937, "eval_rewards/judge_quality/std": 0.2187302645582419, "eval_rewards/repeat_penalty/mean": 0.7233055692452651, "eval_rewards/repeat_penalty/std": 0.318151416686865, "eval_rewards/repeat_floor/mean": 0.9671928745049697, "eval_rewards/repeat_floor/std": 0.04186510058263174, "eval_rewards/near_duplicate_penalty/mean": 0.9314568822200482, "eval_rewards/near_duplicate_penalty/std": 0.08834549498099548, "eval_rewards/opening_diversity/mean": 0.9488580960493821, "eval_rewards/opening_diversity/std": 0.10991556369341336, "eval_rewards/distinct_2/mean": 0.7838094234466553, "eval_rewards/distinct_2/std": 0.2979626308840055, "eval_rewards/total_composite/mean": 0.20396145777060434, "eval_rewards/total_composite/std": 0.18293480288523895, "eval_reward": 0.20396145777060434, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.0797056805055875, "eval_sampling/sampling_logp_difference/max": 1.1188378700843225, "eval_sampling/importance_sampling_ratio/min": 0.33932835780657256, "eval_sampling/importance_sampling_ratio/mean": 1.019963759642381, "eval_sampling/importance_sampling_ratio/max": 1.5410445745174701, "eval_entropy": 1.1367097451136663, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.20396145777060434, "eval_reward_meter_mean": 0.6186482149821061, "eval_reward_meter_std": 0.35500125472362226, "eval_reward_count_adherence_mean": 0.8089264081074641, "eval_reward_count_adherence_std": 0.22151099947782663, "eval_reward_arabic_clean_mean": 0.8173076923076923, "eval_reward_arabic_clean_std": 0.3768232533564934, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9985576913906977, "eval_reward_arabic_floor_std": 0.004079461670838869, "eval_reward_count_floor_mean": 0.9426779105113103, "eval_reward_count_floor_std": 0.06645329855382442, "eval_reward_lexical_plausibility_mean": 0.9259520860818716, "eval_reward_lexical_plausibility_std": 0.14988471453006452, "eval_reward_repeat_penalty_mean": 0.7233055692452651, "eval_reward_repeat_penalty_std": 0.318151416686865, "eval_reward_repeat_floor_mean": 0.9671928745049697, "eval_reward_repeat_floor_std": 0.04186510058263174, "eval_reward_near_duplicate_penalty_mean": 0.9314568822200482, "eval_reward_near_duplicate_penalty_std": 0.08834549498099548, "eval_reward_opening_diversity_mean": 0.9488580960493821, "eval_reward_opening_diversity_std": 0.10991556369341336, "eval_reward_distinct_2_mean": 0.7838094234466553, "eval_reward_distinct_2_std": 0.2979626308840055, "eval_reward_judge_quality_mean": 0.3449038381759937, "eval_reward_judge_quality_std": 0.2187302645582419, "eval_reward_total_composite_mean": 0.20396145777060434, "eval_reward_total_composite_std": 0.18293480288523895} {"timestamp_utc": "2026-04-12T17:59:18Z", "mode": "train", "global_step": 551, "epoch": 0.028998473764538707, "loss": -0.0659, "grad_norm": 5.255579948425293, "learning_rate": 8.333333333333334e-06, "num_tokens": 1021730.0, "completions/mean_length": 102.5, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 44.000003814697266, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.6737279891967773, "rewards/meter/std": 0.38971206545829773, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9403427243232727, "rewards/lexical_plausibility/std": 0.1687362641096115, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9403715133666992, "rewards/repeat_penalty/std": 0.09566418081521988, "rewards/repeat_floor/mean": 0.9947792291641235, "rewards/repeat_floor/std": 0.007299729157239199, "rewards/near_duplicate_penalty/mean": 0.9877285957336426, "rewards/near_duplicate_penalty/std": 0.01969127357006073, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9832775592803955, "rewards/distinct_2/std": 0.0472981221973896, "rewards/total_composite/mean": 0.23661760985851288, "rewards/total_composite/std": 0.16402758657932281, "reward": 0.23661760985851288, "reward_std": 0.16402758657932281, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21333429217338562, "sampling/sampling_logp_difference/max": 1.580709457397461, "sampling/importance_sampling_ratio/min": 0.20582902431488037, "sampling/importance_sampling_ratio/mean": 1.028855562210083, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.7297458723187447, "clip_ratio/low_mean": 0.03371212258934975, "clip_ratio/low_min": 0.03371212258934975, "clip_ratio/high_mean": 0.11647386383265257, "clip_ratio/high_max": 0.11647386383265257, "clip_ratio/region_mean": 0.15018598642200232, "reward_total_mean": 0.23661760985851288, "reward_meter_mean": 0.6737279891967773, "reward_meter_std": 0.38971206545829773, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9403427243232727, "reward_lexical_plausibility_std": 0.1687362641096115, "reward_repeat_penalty_mean": 0.9403715133666992, "reward_repeat_penalty_std": 0.09566418081521988, "reward_repeat_floor_mean": 0.9947792291641235, "reward_repeat_floor_std": 0.007299729157239199, "reward_near_duplicate_penalty_mean": 0.9877285957336426, "reward_near_duplicate_penalty_std": 0.01969127357006073, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9832775592803955, "reward_distinct_2_std": 0.0472981221973896, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.23661760985851288, "reward_total_composite_std": 0.16402758657932281} {"timestamp_utc": "2026-04-12T17:59:33Z", "mode": "train", "global_step": 552, "epoch": 0.02905110257354876, "loss": -0.1397, "grad_norm": 3.367072582244873, "learning_rate": 8.330303030303031e-06, "num_tokens": 1024008.0, "completions/mean_length": 325.75, "completions/min_length": 132.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 139.5, "completions/min_terminated_length": 132.0, "completions/max_terminated_length": 158.0, "rewards/meter/mean": 0.36627963185310364, "rewards/meter/std": 0.2974469065666199, "rewards/count_adherence/mean": 0.6785714626312256, "rewards/count_adherence/std": 0.26175010204315186, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.903571367263794, "rewards/count_floor/std": 0.07852503657341003, "rewards/lexical_plausibility/mean": 0.7508395910263062, "rewards/lexical_plausibility/std": 0.2670208215713501, "rewards/judge_quality/mean": 0.19999998807907104, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.866409182548523, "rewards/repeat_penalty/std": 0.23204495012760162, "rewards/repeat_floor/mean": 0.9853261709213257, "rewards/repeat_floor/std": 0.024082697927951813, "rewards/near_duplicate_penalty/mean": 0.9658227562904358, "rewards/near_duplicate_penalty/std": 0.031006718054413795, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8939195871353149, "rewards/distinct_2/std": 0.22000761330127716, "rewards/total_composite/mean": 0.08916445821523666, "rewards/total_composite/std": 0.1075466051697731, "reward": 0.08916445821523666, "reward_std": 0.1075466051697731, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18914061784744263, "sampling/sampling_logp_difference/max": 1.97637939453125, "sampling/importance_sampling_ratio/min": 0.13857004046440125, "sampling/importance_sampling_ratio/mean": 1.01470947265625, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5549485981464386, "clip_ratio/low_mean": 0.023320894688367844, "clip_ratio/low_min": 0.023320894688367844, "clip_ratio/high_mean": 0.057010688818991184, "clip_ratio/high_max": 0.057010688818991184, "clip_ratio/region_mean": 0.08033158350735903, "reward_total_mean": 0.08916445821523666, "reward_meter_mean": 0.36627963185310364, "reward_meter_std": 0.2974469065666199, "reward_count_adherence_mean": 0.6785714626312256, "reward_count_adherence_std": 0.26175010204315186, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.903571367263794, "reward_count_floor_std": 0.07852503657341003, "reward_lexical_plausibility_mean": 0.7508395910263062, "reward_lexical_plausibility_std": 0.2670208215713501, "reward_repeat_penalty_mean": 0.866409182548523, "reward_repeat_penalty_std": 0.23204495012760162, "reward_repeat_floor_mean": 0.9853261709213257, "reward_repeat_floor_std": 0.024082697927951813, "reward_near_duplicate_penalty_mean": 0.9658227562904358, "reward_near_duplicate_penalty_std": 0.031006718054413795, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8939195871353149, "reward_distinct_2_std": 0.22000761330127716, "reward_judge_quality_mean": 0.19999998807907104, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.08916445821523666, "reward_total_composite_std": 0.1075466051697731} {"timestamp_utc": "2026-04-12T17:59:42Z", "mode": "train", "global_step": 553, "epoch": 0.029103731382558812, "loss": -0.0342, "grad_norm": 21.553974151611328, "learning_rate": 8.327272727272728e-06, "num_tokens": 1025561.0, "completions/mean_length": 26.125, "completions/min_length": 22.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.125, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.5366592407226562, "rewards/meter/std": 0.2860164940357208, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.2173829823732376, "rewards/repeat_penalty/mean": 0.981582522392273, "rewards/repeat_penalty/std": 0.012491089291870594, "rewards/repeat_floor/mean": 0.9972373247146606, "rewards/repeat_floor/std": 0.0018736639758571982, "rewards/near_duplicate_penalty/mean": 0.981582522392273, "rewards/near_duplicate_penalty/std": 0.012491089291870594, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2340528666973114, "rewards/total_composite/std": 0.13655918836593628, "reward": 0.2340528666973114, "reward_std": 0.13655918836593628, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2177087813615799, "sampling/sampling_logp_difference/max": 1.7831556797027588, "sampling/importance_sampling_ratio/min": 0.1681068241596222, "sampling/importance_sampling_ratio/mean": 0.9540435075759888, "sampling/importance_sampling_ratio/max": 1.763105869293213, "entropy": 0.966768778860569, "clip_ratio/low_mean": 0.09590273816138506, "clip_ratio/low_min": 0.09590273816138506, "clip_ratio/high_mean": 0.13204094395041466, "clip_ratio/high_max": 0.13204094395041466, "clip_ratio/region_mean": 0.22794368211179972, "reward_total_mean": 0.2340528666973114, "reward_meter_mean": 0.5366592407226562, "reward_meter_std": 0.2860164940357208, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.981582522392273, "reward_repeat_penalty_std": 0.012491089291870594, "reward_repeat_floor_mean": 0.9972373247146606, "reward_repeat_floor_std": 0.0018736639758571982, "reward_near_duplicate_penalty_mean": 0.981582522392273, "reward_near_duplicate_penalty_std": 0.012491089291870594, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.2173829823732376, "reward_total_composite_mean": 0.2340528666973114, "reward_total_composite_std": 0.13655918836593628} {"timestamp_utc": "2026-04-12T17:59:51Z", "mode": "train", "global_step": 554, "epoch": 0.029156360191568864, "loss": 0.0324, "grad_norm": 20.6953125, "learning_rate": 8.324242424242425e-06, "num_tokens": 1027146.0, "completions/mean_length": 34.125, "completions/min_length": 26.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.125, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.7248470783233643, "rewards/meter/std": 0.26182666420936584, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.2666056752204895, "rewards/repeat_penalty/mean": 0.9007190465927124, "rewards/repeat_penalty/std": 0.20954850316047668, "rewards/repeat_floor/mean": 0.9873193502426147, "rewards/repeat_floor/std": 0.025214746594429016, "rewards/near_duplicate_penalty/mean": 0.9568088054656982, "rewards/near_duplicate_penalty/std": 0.05396223068237305, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9519230723381042, "rewards/distinct_2/std": 0.13598206639289856, "rewards/total_composite/mean": 0.4669719934463501, "rewards/total_composite/std": 0.2306515872478485, "reward": 0.4669719934463501, "reward_std": 0.23065157234668732, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17184989154338837, "sampling/sampling_logp_difference/max": 3.478653907775879, "sampling/importance_sampling_ratio/min": 0.22473815083503723, "sampling/importance_sampling_ratio/mean": 1.046779990196228, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1770471036434174, "clip_ratio/low_mean": 0.09403077885508537, "clip_ratio/low_min": 0.09403077885508537, "clip_ratio/high_mean": 0.031652189092710614, "clip_ratio/high_max": 0.031652189092710614, "clip_ratio/region_mean": 0.125682967947796, "reward_total_mean": 0.4669719934463501, "reward_meter_mean": 0.7248470783233643, "reward_meter_std": 0.26182666420936584, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9007190465927124, "reward_repeat_penalty_std": 0.20954850316047668, "reward_repeat_floor_mean": 0.9873193502426147, "reward_repeat_floor_std": 0.025214746594429016, "reward_near_duplicate_penalty_mean": 0.9568088054656982, "reward_near_duplicate_penalty_std": 0.05396223068237305, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9519230723381042, "reward_distinct_2_std": 0.13598206639289856, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.2666056752204895, "reward_total_composite_mean": 0.4669719934463501, "reward_total_composite_std": 0.2306515872478485} {"timestamp_utc": "2026-04-12T18:00:00Z", "mode": "train", "global_step": 555, "epoch": 0.029208989000578917, "loss": -0.0116, "grad_norm": 18.11533546447754, "learning_rate": 8.321212121212123e-06, "num_tokens": 1028430.0, "completions/mean_length": 17.5, "completions/min_length": 15.0, "completions/max_length": 20.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.5, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 20.0, "rewards/meter/mean": 0.5945756435394287, "rewards/meter/std": 0.4319617450237274, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.29624998569488525, "rewards/judge_quality/std": 0.26773855090141296, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2279086858034134, "rewards/total_composite/std": 0.2996399700641632, "reward": 0.2279086858034134, "reward_std": 0.2996399700641632, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22744089365005493, "sampling/sampling_logp_difference/max": 1.9784126281738281, "sampling/importance_sampling_ratio/min": 0.13828857243061066, "sampling/importance_sampling_ratio/mean": 1.0495731830596924, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.804256483912468, "clip_ratio/low_mean": 0.14473684411495924, "clip_ratio/low_min": 0.14473684411495924, "clip_ratio/high_mean": 0.07152777910232544, "clip_ratio/high_max": 0.07152777910232544, "clip_ratio/region_mean": 0.21626462321728468, "reward_total_mean": 0.2279086858034134, "reward_meter_mean": 0.5945756435394287, "reward_meter_std": 0.4319617450237274, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.29624998569488525, "reward_judge_quality_std": 0.26773855090141296, "reward_total_composite_mean": 0.2279086858034134, "reward_total_composite_std": 0.2996399700641632} {"timestamp_utc": "2026-04-12T18:00:09Z", "mode": "train", "global_step": 556, "epoch": 0.02926161780958897, "loss": 0.1307, "grad_norm": 19.094688415527344, "learning_rate": 8.318181818181818e-06, "num_tokens": 1030183.0, "completions/mean_length": 30.125, "completions/min_length": 26.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.125, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.3635500967502594, "rewards/meter/std": 0.27353185415267944, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.492499977350235, "rewards/judge_quality/std": 0.2796298861503601, "rewards/repeat_penalty/mean": 0.9789423942565918, "rewards/repeat_penalty/std": 0.03175196796655655, "rewards/repeat_floor/mean": 0.9968413710594177, "rewards/repeat_floor/std": 0.0047627887688577175, "rewards/near_duplicate_penalty/mean": 0.9789423942565918, "rewards/near_duplicate_penalty/std": 0.03175196796655655, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1594967097043991, "rewards/total_composite/std": 0.14096620678901672, "reward": 0.1594967097043991, "reward_std": 0.14096622169017792, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18325132131576538, "sampling/sampling_logp_difference/max": 2.0480260848999023, "sampling/importance_sampling_ratio/min": 0.12898926436901093, "sampling/importance_sampling_ratio/mean": 0.9809970855712891, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8702652528882027, "clip_ratio/low_mean": 0.09620174020528793, "clip_ratio/low_min": 0.09620174020528793, "clip_ratio/high_mean": 0.07234333548694849, "clip_ratio/high_max": 0.07234333548694849, "clip_ratio/region_mean": 0.16854507569223642, "reward_total_mean": 0.1594967097043991, "reward_meter_mean": 0.3635500967502594, "reward_meter_std": 0.27353185415267944, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9789423942565918, "reward_repeat_penalty_std": 0.03175196796655655, "reward_repeat_floor_mean": 0.9968413710594177, "reward_repeat_floor_std": 0.0047627887688577175, "reward_near_duplicate_penalty_mean": 0.9789423942565918, "reward_near_duplicate_penalty_std": 0.03175196796655655, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.492499977350235, "reward_judge_quality_std": 0.2796298861503601, "reward_total_composite_mean": 0.1594967097043991, "reward_total_composite_std": 0.14096620678901672} {"timestamp_utc": "2026-04-12T18:00:17Z", "mode": "train", "global_step": 557, "epoch": 0.02931424661859902, "loss": 0.0697, "grad_norm": 33.31736373901367, "learning_rate": 8.315151515151516e-06, "num_tokens": 1031476.0, "completions/mean_length": 17.625, "completions/min_length": 16.0, "completions/max_length": 19.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.625, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 19.0, "rewards/meter/mean": 0.4873313903808594, "rewards/meter/std": 0.40829962491989136, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8387500047683716, "rewards/judge_quality/std": 0.27869275212287903, "rewards/repeat_penalty/mean": 0.7358934283256531, "rewards/repeat_penalty/std": 0.026865478605031967, "rewards/repeat_floor/mean": 0.9821786880493164, "rewards/repeat_floor/std": 0.0053730979561805725, "rewards/near_duplicate_penalty/mean": 0.9811912178993225, "rewards/near_duplicate_penalty/std": 0.03582063689827919, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4177014231681824, "rewards/total_composite/std": 0.3959362804889679, "reward": 0.4177014231681824, "reward_std": 0.3959362506866455, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14491981267929077, "sampling/sampling_logp_difference/max": 1.1840513944625854, "sampling/importance_sampling_ratio/min": 0.3060363531112671, "sampling/importance_sampling_ratio/mean": 0.9935749173164368, "sampling/importance_sampling_ratio/max": 1.8750287294387817, "entropy": 0.8732364699244499, "clip_ratio/low_mean": 0.05417956691235304, "clip_ratio/low_min": 0.05417956691235304, "clip_ratio/high_mean": 0.08652605768293142, "clip_ratio/high_max": 0.08652605768293142, "clip_ratio/region_mean": 0.14070562459528446, "reward_total_mean": 0.4177014231681824, "reward_meter_mean": 0.4873313903808594, "reward_meter_std": 0.40829962491989136, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7358934283256531, "reward_repeat_penalty_std": 0.026865478605031967, "reward_repeat_floor_mean": 0.9821786880493164, "reward_repeat_floor_std": 0.0053730979561805725, "reward_near_duplicate_penalty_mean": 0.9811912178993225, "reward_near_duplicate_penalty_std": 0.03582063689827919, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8387500047683716, "reward_judge_quality_std": 0.27869275212287903, "reward_total_composite_mean": 0.4177014231681824, "reward_total_composite_std": 0.3959362804889679} {"timestamp_utc": "2026-04-12T18:00:33Z", "mode": "train", "global_step": 558, "epoch": 0.029366875427609074, "loss": -0.164, "grad_norm": 4.081277370452881, "learning_rate": 8.312121212121213e-06, "num_tokens": 1033472.0, "completions/mean_length": 123.5, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 68.0, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.8523678779602051, "rewards/meter/std": 0.33246737718582153, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.06943651288747787, "rewards/lexical_plausibility/mean": 0.9511696100234985, "rewards/lexical_plausibility/std": 0.13811323046684265, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.18077215552330017, "rewards/repeat_penalty/mean": 0.9099739193916321, "rewards/repeat_penalty/std": 0.09572067111730576, "rewards/repeat_floor/mean": 0.9904675483703613, "rewards/repeat_floor/std": 0.008024848066270351, "rewards/near_duplicate_penalty/mean": 0.9654771089553833, "rewards/near_duplicate_penalty/std": 0.02118479460477829, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.972455620765686, "rewards/distinct_2/std": 0.03426055610179901, "rewards/total_composite/mean": 0.2987726032733917, "rewards/total_composite/std": 0.1785968840122223, "reward": 0.2987726032733917, "reward_std": 0.1785968691110611, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.163870170712471, "sampling/sampling_logp_difference/max": 1.990492582321167, "sampling/importance_sampling_ratio/min": 0.13662810623645782, "sampling/importance_sampling_ratio/mean": 1.0121395587921143, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0068789720535278, "clip_ratio/low_mean": 0.023333333432674408, "clip_ratio/low_min": 0.023333333432674408, "clip_ratio/high_mean": 0.10875323042273521, "clip_ratio/high_max": 0.10875323042273521, "clip_ratio/region_mean": 0.13208656385540962, "reward_total_mean": 0.2987726032733917, "reward_meter_mean": 0.8523678779602051, "reward_meter_std": 0.33246737718582153, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.06943651288747787, "reward_lexical_plausibility_mean": 0.9511696100234985, "reward_lexical_plausibility_std": 0.13811323046684265, "reward_repeat_penalty_mean": 0.9099739193916321, "reward_repeat_penalty_std": 0.09572067111730576, "reward_repeat_floor_mean": 0.9904675483703613, "reward_repeat_floor_std": 0.008024848066270351, "reward_near_duplicate_penalty_mean": 0.9654771089553833, "reward_near_duplicate_penalty_std": 0.02118479460477829, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.972455620765686, "reward_distinct_2_std": 0.03426055610179901, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.18077215552330017, "reward_total_composite_mean": 0.2987726032733917, "reward_total_composite_std": 0.1785968840122223} {"timestamp_utc": "2026-04-12T18:00:48Z", "mode": "train", "global_step": 559, "epoch": 0.029419504236619126, "loss": -0.0428, "grad_norm": 1.2077611684799194, "learning_rate": 8.30909090909091e-06, "num_tokens": 1035074.0, "completions/mean_length": 456.25, "completions/min_length": 66.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 66.0, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.7518603801727295, "rewards/meter/std": 0.3013761043548584, "rewards/count_adherence/mean": 0.7083333730697632, "rewards/count_adherence/std": 0.2781743109226227, "rewards/arabic_clean/mean": 0.125, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9125000238418579, "rewards/count_floor/std": 0.08345229923725128, "rewards/lexical_plausibility/mean": 0.544519305229187, "rewards/lexical_plausibility/std": 0.19723442196846008, "rewards/judge_quality/mean": 0.1587500125169754, "rewards/judge_quality/std": 0.3075914680957794, "rewards/repeat_penalty/mean": 0.9920206665992737, "rewards/repeat_penalty/std": 0.014792493544518948, "rewards/repeat_floor/mean": 0.9988806247711182, "rewards/repeat_floor/std": 0.002004166366532445, "rewards/near_duplicate_penalty/mean": 0.9933830499649048, "rewards/near_duplicate_penalty/std": 0.011038585565984249, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9985911846160889, "rewards/distinct_2/std": 0.0039848159067332745, "rewards/total_composite/mean": 0.11180394142866135, "rewards/total_composite/std": 0.22277867794036865, "reward": 0.11180394142866135, "reward_std": 0.22277867794036865, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21221083402633667, "sampling/sampling_logp_difference/max": 1.367455244064331, "sampling/importance_sampling_ratio/min": 0.2547544240951538, "sampling/importance_sampling_ratio/mean": 1.0518114566802979, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.1787753403186798, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.01515151560306549, "clip_ratio/high_max": 0.01515151560306549, "clip_ratio/region_mean": 0.01515151560306549, "reward_total_mean": 0.11180394142866135, "reward_meter_mean": 0.7518603801727295, "reward_meter_std": 0.3013761043548584, "reward_count_adherence_mean": 0.7083333730697632, "reward_count_adherence_std": 0.2781743109226227, "reward_arabic_clean_mean": 0.125, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9125000238418579, "reward_count_floor_std": 0.08345229923725128, "reward_lexical_plausibility_mean": 0.544519305229187, "reward_lexical_plausibility_std": 0.19723442196846008, "reward_repeat_penalty_mean": 0.9920206665992737, "reward_repeat_penalty_std": 0.014792493544518948, "reward_repeat_floor_mean": 0.9988806247711182, "reward_repeat_floor_std": 0.002004166366532445, "reward_near_duplicate_penalty_mean": 0.9933830499649048, "reward_near_duplicate_penalty_std": 0.011038585565984249, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9985911846160889, "reward_distinct_2_std": 0.0039848159067332745, "reward_judge_quality_mean": 0.1587500125169754, "reward_judge_quality_std": 0.3075914680957794, "reward_total_composite_mean": 0.11180394142866135, "reward_total_composite_std": 0.22277867794036865} {"timestamp_utc": "2026-04-12T18:01:03Z", "mode": "train", "global_step": 560, "epoch": 0.02947213304562918, "loss": -0.0636, "grad_norm": 5.534683704376221, "learning_rate": 8.306060606060606e-06, "num_tokens": 1036620.0, "completions/mean_length": 97.25, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.0, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.5694347620010376, "rewards/meter/std": 0.4263285994529724, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9341445565223694, "rewards/lexical_plausibility/std": 0.18626733124256134, "rewards/judge_quality/mean": 0.29625001549720764, "rewards/judge_quality/std": 0.283293753862381, "rewards/repeat_penalty/mean": 0.8989452123641968, "rewards/repeat_penalty/std": 0.11513609439134598, "rewards/repeat_floor/mean": 0.9894053339958191, "rewards/repeat_floor/std": 0.011531993746757507, "rewards/near_duplicate_penalty/mean": 0.9644253253936768, "rewards/near_duplicate_penalty/std": 0.036088768392801285, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9624060392379761, "rewards/distinct_2/std": 0.07887901365756989, "rewards/total_composite/mean": 0.22839999198913574, "rewards/total_composite/std": 0.2931581437587738, "reward": 0.22839999198913574, "reward_std": 0.2931581735610962, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15873941779136658, "sampling/sampling_logp_difference/max": 1.1122474670410156, "sampling/importance_sampling_ratio/min": 0.3288191258907318, "sampling/importance_sampling_ratio/mean": 1.0212668180465698, "sampling/importance_sampling_ratio/max": 1.743553638458252, "entropy": 1.5165867358446121, "clip_ratio/low_mean": 0.05816003493964672, "clip_ratio/low_min": 0.05816003493964672, "clip_ratio/high_mean": 0.04723785724490881, "clip_ratio/high_max": 0.04723785724490881, "clip_ratio/region_mean": 0.10539789218455553, "reward_total_mean": 0.22839999198913574, "reward_meter_mean": 0.5694347620010376, "reward_meter_std": 0.4263285994529724, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9341445565223694, "reward_lexical_plausibility_std": 0.18626733124256134, "reward_repeat_penalty_mean": 0.8989452123641968, "reward_repeat_penalty_std": 0.11513609439134598, "reward_repeat_floor_mean": 0.9894053339958191, "reward_repeat_floor_std": 0.011531993746757507, "reward_near_duplicate_penalty_mean": 0.9644253253936768, "reward_near_duplicate_penalty_std": 0.036088768392801285, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9624060392379761, "reward_distinct_2_std": 0.07887901365756989, "reward_judge_quality_mean": 0.29625001549720764, "reward_judge_quality_std": 0.283293753862381, "reward_total_composite_mean": 0.22839999198913574, "reward_total_composite_std": 0.2931581437587738} {"timestamp_utc": "2026-04-12T18:01:17Z", "mode": "train", "global_step": 561, "epoch": 0.02952476185463923, "loss": -0.1271, "grad_norm": 2.5300896167755127, "learning_rate": 8.303030303030305e-06, "num_tokens": 1038453.0, "completions/mean_length": 248.125, "completions/min_length": 70.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 89.80000305175781, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.9038985967636108, "rewards/meter/std": 0.1426585167646408, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.28149792551994324, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.934374988079071, "rewards/count_floor/std": 0.08444938063621521, "rewards/lexical_plausibility/mean": 0.8190855979919434, "rewards/lexical_plausibility/std": 0.25018277764320374, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.8170636892318726, "rewards/repeat_penalty/std": 0.17387215793132782, "rewards/repeat_floor/mean": 0.9830120801925659, "rewards/repeat_floor/std": 0.01619563437998295, "rewards/near_duplicate_penalty/mean": 0.9651481509208679, "rewards/near_duplicate_penalty/std": 0.03389329835772514, "rewards/opening_diversity/mean": 0.925000011920929, "rewards/opening_diversity/std": 0.11338934302330017, "rewards/distinct_2/mean": 0.9193319082260132, "rewards/distinct_2/std": 0.08834436535835266, "rewards/total_composite/mean": 0.20498758554458618, "rewards/total_composite/std": 0.16108544170856476, "reward": 0.20498758554458618, "reward_std": 0.16108545660972595, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17830517888069153, "sampling/sampling_logp_difference/max": 1.7236967086791992, "sampling/importance_sampling_ratio/min": 0.17840541899204254, "sampling/importance_sampling_ratio/mean": 1.0018104314804077, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8101192861795425, "clip_ratio/low_mean": 0.022836538031697273, "clip_ratio/low_min": 0.022836538031697273, "clip_ratio/high_mean": 0.08320409059524536, "clip_ratio/high_max": 0.08320409059524536, "clip_ratio/region_mean": 0.10604062862694263, "reward_total_mean": 0.20498758554458618, "reward_meter_mean": 0.9038985967636108, "reward_meter_std": 0.1426585167646408, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.28149792551994324, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.934374988079071, "reward_count_floor_std": 0.08444938063621521, "reward_lexical_plausibility_mean": 0.8190855979919434, "reward_lexical_plausibility_std": 0.25018277764320374, "reward_repeat_penalty_mean": 0.8170636892318726, "reward_repeat_penalty_std": 0.17387215793132782, "reward_repeat_floor_mean": 0.9830120801925659, "reward_repeat_floor_std": 0.01619563437998295, "reward_near_duplicate_penalty_mean": 0.9651481509208679, "reward_near_duplicate_penalty_std": 0.03389329835772514, "reward_opening_diversity_mean": 0.925000011920929, "reward_opening_diversity_std": 0.11338934302330017, "reward_distinct_2_mean": 0.9193319082260132, "reward_distinct_2_std": 0.08834436535835266, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.20498758554458618, "reward_total_composite_std": 0.16108544170856476} {"timestamp_utc": "2026-04-12T18:01:31Z", "mode": "train", "global_step": 562, "epoch": 0.02957739066364928, "loss": -0.066, "grad_norm": 2.014894723892212, "learning_rate": 8.3e-06, "num_tokens": 1039999.0, "completions/mean_length": 218.25, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.5807574391365051, "rewards/meter/std": 0.44241222739219666, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.9624999761581421, "rewards/arabic_floor/std": 0.06943649053573608, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 0.7765780687332153, "rewards/lexical_plausibility/std": 0.28427284955978394, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.25599944591522217, "rewards/repeat_penalty/mean": 0.8697566390037537, "rewards/repeat_penalty/std": 0.1453157365322113, "rewards/repeat_floor/mean": 0.9894654750823975, "rewards/repeat_floor/std": 0.011609818786382675, "rewards/near_duplicate_penalty/mean": 0.9827976226806641, "rewards/near_duplicate_penalty/std": 0.02610170468688011, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9741200804710388, "rewards/distinct_2/std": 0.050576355308294296, "rewards/total_composite/mean": 0.2178936004638672, "rewards/total_composite/std": 0.22457318007946014, "reward": 0.2178936004638672, "reward_std": 0.22457316517829895, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18242985010147095, "sampling/sampling_logp_difference/max": 1.454162836074829, "sampling/importance_sampling_ratio/min": 0.2335958480834961, "sampling/importance_sampling_ratio/mean": 1.0564383268356323, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2552347481250763, "clip_ratio/low_mean": 0.02820512861944735, "clip_ratio/low_min": 0.02820512861944735, "clip_ratio/high_mean": 0.0937925186008215, "clip_ratio/high_max": 0.0937925186008215, "clip_ratio/region_mean": 0.12199764722026885, "reward_total_mean": 0.2178936004638672, "reward_meter_mean": 0.5807574391365051, "reward_meter_std": 0.44241222739219666, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.9624999761581421, "reward_arabic_floor_std": 0.06943649053573608, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 0.7765780687332153, "reward_lexical_plausibility_std": 0.28427284955978394, "reward_repeat_penalty_mean": 0.8697566390037537, "reward_repeat_penalty_std": 0.1453157365322113, "reward_repeat_floor_mean": 0.9894654750823975, "reward_repeat_floor_std": 0.011609818786382675, "reward_near_duplicate_penalty_mean": 0.9827976226806641, "reward_near_duplicate_penalty_std": 0.02610170468688011, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9741200804710388, "reward_distinct_2_std": 0.050576355308294296, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.25599944591522217, "reward_total_composite_mean": 0.2178936004638672, "reward_total_composite_std": 0.22457318007946014} {"timestamp_utc": "2026-04-12T18:01:45Z", "mode": "train", "global_step": 563, "epoch": 0.029630019472659332, "loss": -0.0549, "grad_norm": 4.267290115356445, "learning_rate": 8.296969696969697e-06, "num_tokens": 1041743.0, "completions/mean_length": 103.0, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 44.57143020629883, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.7931816577911377, "rewards/meter/std": 0.34101036190986633, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9268641471862793, "rewards/lexical_plausibility/std": 0.20685933530330658, "rewards/judge_quality/mean": 0.5799999833106995, "rewards/judge_quality/std": 0.31995537877082825, "rewards/repeat_penalty/mean": 0.9798264503479004, "rewards/repeat_penalty/std": 0.031223196536302567, "rewards/repeat_floor/mean": 0.9969739317893982, "rewards/repeat_floor/std": 0.004683476872742176, "rewards/near_duplicate_penalty/mean": 0.9798264503479004, "rewards/near_duplicate_penalty/std": 0.031223196536302567, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5329734086990356, "rewards/total_composite/std": 0.3447689414024353, "reward": 0.5329734086990356, "reward_std": 0.3447689414024353, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17494451999664307, "sampling/sampling_logp_difference/max": 1.3205337524414062, "sampling/importance_sampling_ratio/min": 0.2669927477836609, "sampling/importance_sampling_ratio/mean": 1.0090452432632446, "sampling/importance_sampling_ratio/max": 1.9617542028427124, "entropy": 1.2997402250766754, "clip_ratio/low_mean": 0.0697510838508606, "clip_ratio/low_min": 0.0697510838508606, "clip_ratio/high_mean": 0.057986111380159855, "clip_ratio/high_max": 0.057986111380159855, "clip_ratio/region_mean": 0.12773719523102045, "reward_total_mean": 0.5329734086990356, "reward_meter_mean": 0.7931816577911377, "reward_meter_std": 0.34101036190986633, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9268641471862793, "reward_lexical_plausibility_std": 0.20685933530330658, "reward_repeat_penalty_mean": 0.9798264503479004, "reward_repeat_penalty_std": 0.031223196536302567, "reward_repeat_floor_mean": 0.9969739317893982, "reward_repeat_floor_std": 0.004683476872742176, "reward_near_duplicate_penalty_mean": 0.9798264503479004, "reward_near_duplicate_penalty_std": 0.031223196536302567, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5799999833106995, "reward_judge_quality_std": 0.31995537877082825, "reward_total_composite_mean": 0.5329734086990356, "reward_total_composite_std": 0.3447689414024353} {"timestamp_utc": "2026-04-12T18:01:59Z", "mode": "train", "global_step": 564, "epoch": 0.029682648281669385, "loss": -0.0951, "grad_norm": 2.4203593730926514, "learning_rate": 8.293939393939395e-06, "num_tokens": 1043364.0, "completions/mean_length": 162.625, "completions/min_length": 42.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 46.16666793823242, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.8536757826805115, "rewards/meter/std": 0.30933067202568054, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8828497529029846, "rewards/lexical_plausibility/std": 0.21698138117790222, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.30875036120414734, "rewards/repeat_penalty/mean": 0.8874882459640503, "rewards/repeat_penalty/std": 0.1500159651041031, "rewards/repeat_floor/mean": 0.9917948246002197, "rewards/repeat_floor/std": 0.01065937802195549, "rewards/near_duplicate_penalty/mean": 0.9933937191963196, "rewards/near_duplicate_penalty/std": 0.009810215793550014, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9823417663574219, "rewards/distinct_2/std": 0.03137263283133507, "rewards/total_composite/mean": 0.4434981644153595, "rewards/total_composite/std": 0.305878609418869, "reward": 0.4434981644153595, "reward_std": 0.30587857961654663, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15061204135417938, "sampling/sampling_logp_difference/max": 1.1129411458969116, "sampling/importance_sampling_ratio/min": 0.32859110832214355, "sampling/importance_sampling_ratio/mean": 1.040624976158142, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9117092192173004, "clip_ratio/low_mean": 0.06774215400218964, "clip_ratio/low_min": 0.06774215400218964, "clip_ratio/high_mean": 0.04718712717294693, "clip_ratio/high_max": 0.04718712717294693, "clip_ratio/region_mean": 0.11492928117513657, "reward_total_mean": 0.4434981644153595, "reward_meter_mean": 0.8536757826805115, "reward_meter_std": 0.30933067202568054, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8828497529029846, "reward_lexical_plausibility_std": 0.21698138117790222, "reward_repeat_penalty_mean": 0.8874882459640503, "reward_repeat_penalty_std": 0.1500159651041031, "reward_repeat_floor_mean": 0.9917948246002197, "reward_repeat_floor_std": 0.01065937802195549, "reward_near_duplicate_penalty_mean": 0.9933937191963196, "reward_near_duplicate_penalty_std": 0.009810215793550014, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9823417663574219, "reward_distinct_2_std": 0.03137263283133507, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.30875036120414734, "reward_total_composite_mean": 0.4434981644153595, "reward_total_composite_std": 0.305878609418869} {"timestamp_utc": "2026-04-12T18:02:13Z", "mode": "train", "global_step": 565, "epoch": 0.029735277090679437, "loss": -0.0916, "grad_norm": 3.097459316253662, "learning_rate": 8.290909090909092e-06, "num_tokens": 1044987.0, "completions/mean_length": 172.875, "completions/min_length": 52.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 59.833335876464844, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.6703800559043884, "rewards/meter/std": 0.4046465754508972, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.8771954774856567, "rewards/lexical_plausibility/std": 0.22751611471176147, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.6906857490539551, "rewards/repeat_penalty/std": 0.31215834617614746, "rewards/repeat_floor/mean": 0.9587532877922058, "rewards/repeat_floor/std": 0.04403448477387428, "rewards/near_duplicate_penalty/mean": 0.8700329065322876, "rewards/near_duplicate_penalty/std": 0.11799958348274231, "rewards/opening_diversity/mean": 0.956250011920929, "rewards/opening_diversity/std": 0.09038607776165009, "rewards/distinct_2/mean": 0.7874820232391357, "rewards/distinct_2/std": 0.24727487564086914, "rewards/total_composite/mean": 0.212692528963089, "rewards/total_composite/std": 0.18281516432762146, "reward": 0.212692528963089, "reward_std": 0.18281514942646027, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12997393310070038, "sampling/sampling_logp_difference/max": 1.0370960235595703, "sampling/importance_sampling_ratio/min": 0.35448259115219116, "sampling/importance_sampling_ratio/mean": 1.046034574508667, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7987740859389305, "clip_ratio/low_mean": 0.01456447970122099, "clip_ratio/low_min": 0.01456447970122099, "clip_ratio/high_mean": 0.06853776425123215, "clip_ratio/high_max": 0.06853776425123215, "clip_ratio/region_mean": 0.08310224395245314, "reward_total_mean": 0.212692528963089, "reward_meter_mean": 0.6703800559043884, "reward_meter_std": 0.4046465754508972, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.8771954774856567, "reward_lexical_plausibility_std": 0.22751611471176147, "reward_repeat_penalty_mean": 0.6906857490539551, "reward_repeat_penalty_std": 0.31215834617614746, "reward_repeat_floor_mean": 0.9587532877922058, "reward_repeat_floor_std": 0.04403448477387428, "reward_near_duplicate_penalty_mean": 0.8700329065322876, "reward_near_duplicate_penalty_std": 0.11799958348274231, "reward_opening_diversity_mean": 0.956250011920929, "reward_opening_diversity_std": 0.09038607776165009, "reward_distinct_2_mean": 0.7874820232391357, "reward_distinct_2_std": 0.24727487564086914, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.212692528963089, "reward_total_composite_std": 0.18281516432762146} {"timestamp_utc": "2026-04-12T18:02:27Z", "mode": "train", "global_step": 566, "epoch": 0.02978790589968949, "loss": -0.0738, "grad_norm": 4.196310520172119, "learning_rate": 8.287878787878787e-06, "num_tokens": 1046916.0, "completions/mean_length": 124.125, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 68.71428680419922, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.9254423379898071, "rewards/meter/std": 0.10226458311080933, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.2519763112068176, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9500000476837158, "rewards/count_floor/std": 0.07559289783239365, "rewards/lexical_plausibility/mean": 0.9235543012619019, "rewards/lexical_plausibility/std": 0.21622098982334137, "rewards/judge_quality/mean": 0.4949999749660492, "rewards/judge_quality/std": 0.2734958827495575, "rewards/repeat_penalty/mean": 0.9449768662452698, "rewards/repeat_penalty/std": 0.0846562534570694, "rewards/repeat_floor/mean": 0.9951215982437134, "rewards/repeat_floor/std": 0.0052273934707045555, "rewards/near_duplicate_penalty/mean": 0.9858943223953247, "rewards/near_duplicate_penalty/std": 0.01343545876443386, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.990138053894043, "rewards/distinct_2/std": 0.027893755584955215, "rewards/total_composite/mean": 0.4442390501499176, "rewards/total_composite/std": 0.2518474757671356, "reward": 0.4442390501499176, "reward_std": 0.2518474757671356, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1668618768453598, "sampling/sampling_logp_difference/max": 1.4340158700942993, "sampling/importance_sampling_ratio/min": 0.2383498251438141, "sampling/importance_sampling_ratio/mean": 1.028917908668518, "sampling/importance_sampling_ratio/max": 1.8224741220474243, "entropy": 1.2820668667554855, "clip_ratio/low_mean": 0.059490740299224854, "clip_ratio/low_min": 0.059490740299224854, "clip_ratio/high_mean": 0.0811594258993864, "clip_ratio/high_max": 0.0811594258993864, "clip_ratio/region_mean": 0.14065016619861126, "reward_total_mean": 0.4442390501499176, "reward_meter_mean": 0.9254423379898071, "reward_meter_std": 0.10226458311080933, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.2519763112068176, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9500000476837158, "reward_count_floor_std": 0.07559289783239365, "reward_lexical_plausibility_mean": 0.9235543012619019, "reward_lexical_plausibility_std": 0.21622098982334137, "reward_repeat_penalty_mean": 0.9449768662452698, "reward_repeat_penalty_std": 0.0846562534570694, "reward_repeat_floor_mean": 0.9951215982437134, "reward_repeat_floor_std": 0.0052273934707045555, "reward_near_duplicate_penalty_mean": 0.9858943223953247, "reward_near_duplicate_penalty_std": 0.01343545876443386, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.990138053894043, "reward_distinct_2_std": 0.027893755584955215, "reward_judge_quality_mean": 0.4949999749660492, "reward_judge_quality_std": 0.2734958827495575, "reward_total_composite_mean": 0.4442390501499176, "reward_total_composite_std": 0.2518474757671356} {"timestamp_utc": "2026-04-12T18:02:42Z", "mode": "train", "global_step": 567, "epoch": 0.029840534708699542, "loss": -0.1443, "grad_norm": 2.7742621898651123, "learning_rate": 8.284848484848486e-06, "num_tokens": 1048737.0, "completions/mean_length": 106.625, "completions/min_length": 28.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 48.71428680419922, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.8627701997756958, "rewards/meter/std": 0.2515907287597656, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.9394711852073669, "rewards/lexical_plausibility/std": 0.17120131850242615, "rewards/judge_quality/mean": 0.39374998211860657, "rewards/judge_quality/std": 0.1590990275144577, "rewards/repeat_penalty/mean": 0.9668909311294556, "rewards/repeat_penalty/std": 0.05515839904546738, "rewards/repeat_floor/mean": 0.9957719445228577, "rewards/repeat_floor/std": 0.006334956735372543, "rewards/near_duplicate_penalty/mean": 0.9803599119186401, "rewards/near_duplicate_penalty/std": 0.022773869335651398, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9857549667358398, "rewards/distinct_2/std": 0.04029097780585289, "rewards/total_composite/mean": 0.36731523275375366, "rewards/total_composite/std": 0.14951860904693604, "reward": 0.36731523275375366, "reward_std": 0.14951860904693604, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18495750427246094, "sampling/sampling_logp_difference/max": 1.7382721900939941, "sampling/importance_sampling_ratio/min": 0.23729169368743896, "sampling/importance_sampling_ratio/mean": 1.0208741426467896, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1288677677512169, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.17848812229931355, "clip_ratio/high_max": 0.17848812229931355, "clip_ratio/region_mean": 0.17848812229931355, "reward_total_mean": 0.36731523275375366, "reward_meter_mean": 0.8627701997756958, "reward_meter_std": 0.2515907287597656, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.9394711852073669, "reward_lexical_plausibility_std": 0.17120131850242615, "reward_repeat_penalty_mean": 0.9668909311294556, "reward_repeat_penalty_std": 0.05515839904546738, "reward_repeat_floor_mean": 0.9957719445228577, "reward_repeat_floor_std": 0.006334956735372543, "reward_near_duplicate_penalty_mean": 0.9803599119186401, "reward_near_duplicate_penalty_std": 0.022773869335651398, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9857549667358398, "reward_distinct_2_std": 0.04029097780585289, "reward_judge_quality_mean": 0.39374998211860657, "reward_judge_quality_std": 0.1590990275144577, "reward_total_composite_mean": 0.36731523275375366, "reward_total_composite_std": 0.14951860904693604} {"timestamp_utc": "2026-04-12T18:02:56Z", "mode": "train", "global_step": 568, "epoch": 0.029893163517709594, "loss": -0.1227, "grad_norm": 5.495846748352051, "learning_rate": 8.281818181818182e-06, "num_tokens": 1051109.0, "completions/mean_length": 165.5, "completions/min_length": 98.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 116.00000762939453, "completions/min_terminated_length": 98.0, "completions/max_terminated_length": 135.0, "rewards/meter/mean": 0.7863644361495972, "rewards/meter/std": 0.23657944798469543, "rewards/count_adherence/mean": 0.8333333134651184, "rewards/count_adherence/std": 0.28171807527542114, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9500000476837158, "rewards/count_floor/std": 0.08451542258262634, "rewards/lexical_plausibility/mean": 0.9286943674087524, "rewards/lexical_plausibility/std": 0.20168279111385345, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1505940556526184, "rewards/repeat_penalty/mean": 0.8176130652427673, "rewards/repeat_penalty/std": 0.17285406589508057, "rewards/repeat_floor/mean": 0.9803366661071777, "rewards/repeat_floor/std": 0.018711449578404427, "rewards/near_duplicate_penalty/mean": 0.9565730094909668, "rewards/near_duplicate_penalty/std": 0.038160938769578934, "rewards/opening_diversity/mean": 0.9955357313156128, "rewards/opening_diversity/std": 0.012626901268959045, "rewards/distinct_2/mean": 0.8568733930587769, "rewards/distinct_2/std": 0.13849873840808868, "rewards/total_composite/mean": 0.23523476719856262, "rewards/total_composite/std": 0.15004345774650574, "reward": 0.23523476719856262, "reward_std": 0.15004344284534454, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17758242785930634, "sampling/sampling_logp_difference/max": 2.321695327758789, "sampling/importance_sampling_ratio/min": 0.09810712188482285, "sampling/importance_sampling_ratio/mean": 1.0052388906478882, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9297135025262833, "clip_ratio/low_mean": 0.060063484124839306, "clip_ratio/low_min": 0.060063484124839306, "clip_ratio/high_mean": 0.08620619587600231, "clip_ratio/high_max": 0.08620619587600231, "clip_ratio/region_mean": 0.14626968000084162, "reward_total_mean": 0.23523476719856262, "reward_meter_mean": 0.7863644361495972, "reward_meter_std": 0.23657944798469543, "reward_count_adherence_mean": 0.8333333134651184, "reward_count_adherence_std": 0.28171807527542114, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9500000476837158, "reward_count_floor_std": 0.08451542258262634, "reward_lexical_plausibility_mean": 0.9286943674087524, "reward_lexical_plausibility_std": 0.20168279111385345, "reward_repeat_penalty_mean": 0.8176130652427673, "reward_repeat_penalty_std": 0.17285406589508057, "reward_repeat_floor_mean": 0.9803366661071777, "reward_repeat_floor_std": 0.018711449578404427, "reward_near_duplicate_penalty_mean": 0.9565730094909668, "reward_near_duplicate_penalty_std": 0.038160938769578934, "reward_opening_diversity_mean": 0.9955357313156128, "reward_opening_diversity_std": 0.012626901268959045, "reward_distinct_2_mean": 0.8568733930587769, "reward_distinct_2_std": 0.13849873840808868, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1505940556526184, "reward_total_composite_mean": 0.23523476719856262, "reward_total_composite_std": 0.15004345774650574} {"timestamp_utc": "2026-04-12T18:03:09Z", "mode": "train", "global_step": 569, "epoch": 0.029945792326719647, "loss": -0.0502, "grad_norm": 4.771590232849121, "learning_rate": 8.27878787878788e-06, "num_tokens": 1052496.0, "completions/mean_length": 81.375, "completions/min_length": 15.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 19.85714340209961, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.7215157747268677, "rewards/meter/std": 0.38841956853866577, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.928816020488739, "rewards/lexical_plausibility/std": 0.2013387531042099, "rewards/judge_quality/mean": 0.4675000011920929, "rewards/judge_quality/std": 0.3160809278488159, "rewards/repeat_penalty/mean": 0.7777406573295593, "rewards/repeat_penalty/std": 0.09034208953380585, "rewards/repeat_floor/mean": 0.986173152923584, "rewards/repeat_floor/std": 0.005922330543398857, "rewards/near_duplicate_penalty/mean": 0.9953208565711975, "rewards/near_duplicate_penalty/std": 0.013234616257250309, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.39093366265296936, "rewards/total_composite/std": 0.3158460855484009, "reward": 0.39093366265296936, "reward_std": 0.3158460855484009, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18371812999248505, "sampling/sampling_logp_difference/max": 1.2501325607299805, "sampling/importance_sampling_ratio/min": 0.2864668071269989, "sampling/importance_sampling_ratio/mean": 1.0116584300994873, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9686591550707817, "clip_ratio/low_mean": 0.045833335258066654, "clip_ratio/low_min": 0.045833335258066654, "clip_ratio/high_mean": 0.12258522864431143, "clip_ratio/high_max": 0.12258522864431143, "clip_ratio/region_mean": 0.16841856390237808, "reward_total_mean": 0.39093366265296936, "reward_meter_mean": 0.7215157747268677, "reward_meter_std": 0.38841956853866577, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.928816020488739, "reward_lexical_plausibility_std": 0.2013387531042099, "reward_repeat_penalty_mean": 0.7777406573295593, "reward_repeat_penalty_std": 0.09034208953380585, "reward_repeat_floor_mean": 0.986173152923584, "reward_repeat_floor_std": 0.005922330543398857, "reward_near_duplicate_penalty_mean": 0.9953208565711975, "reward_near_duplicate_penalty_std": 0.013234616257250309, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4675000011920929, "reward_judge_quality_std": 0.3160809278488159, "reward_total_composite_mean": 0.39093366265296936, "reward_total_composite_std": 0.3158460855484009} {"timestamp_utc": "2026-04-12T18:03:17Z", "mode": "train", "global_step": 570, "epoch": 0.0299984211357297, "loss": 0.0405, "grad_norm": 16.06989288330078, "learning_rate": 8.275757575757577e-06, "num_tokens": 1053983.0, "completions/mean_length": 36.875, "completions/min_length": 29.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.875, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.7739244103431702, "rewards/meter/std": 0.34029388427734375, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4337500035762787, "rewards/judge_quality/std": 0.2774340510368347, "rewards/repeat_penalty/mean": 0.9469379186630249, "rewards/repeat_penalty/std": 0.0600096620619297, "rewards/repeat_floor/mean": 0.9929990768432617, "rewards/repeat_floor/std": 0.007500375155359507, "rewards/near_duplicate_penalty/mean": 0.9648656845092773, "rewards/near_duplicate_penalty/std": 0.034399982541799545, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.03560846298933029, "rewards/total_composite/mean": 0.2977449893951416, "rewards/total_composite/std": 0.24070042371749878, "reward": 0.2977449893951416, "reward_std": 0.24070042371749878, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16520251333713531, "sampling/sampling_logp_difference/max": 2.277348041534424, "sampling/importance_sampling_ratio/min": 0.10255581885576248, "sampling/importance_sampling_ratio/mean": 1.0325301885604858, "sampling/importance_sampling_ratio/max": 1.757184624671936, "entropy": 1.1247583031654358, "clip_ratio/low_mean": 0.062312956899404526, "clip_ratio/low_min": 0.062312956899404526, "clip_ratio/high_mean": 0.06243589986115694, "clip_ratio/high_max": 0.06243589986115694, "clip_ratio/region_mean": 0.12474885676056147, "reward_total_mean": 0.2977449893951416, "reward_meter_mean": 0.7739244103431702, "reward_meter_std": 0.34029388427734375, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9469379186630249, "reward_repeat_penalty_std": 0.0600096620619297, "reward_repeat_floor_mean": 0.9929990768432617, "reward_repeat_floor_std": 0.007500375155359507, "reward_near_duplicate_penalty_mean": 0.9648656845092773, "reward_near_duplicate_penalty_std": 0.034399982541799545, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.03560846298933029, "reward_judge_quality_mean": 0.4337500035762787, "reward_judge_quality_std": 0.2774340510368347, "reward_total_composite_mean": 0.2977449893951416, "reward_total_composite_std": 0.24070042371749878} {"timestamp_utc": "2026-04-12T18:03:29Z", "mode": "train", "global_step": 571, "epoch": 0.03005104994473975, "loss": 0.1376, "grad_norm": 7.757911205291748, "learning_rate": 8.272727272727274e-06, "num_tokens": 1057017.0, "completions/mean_length": 190.25, "completions/min_length": 139.0, "completions/max_length": 239.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 190.25, "completions/min_terminated_length": 139.0, "completions/max_terminated_length": 239.0, "rewards/meter/mean": 0.9191886186599731, "rewards/meter/std": 0.1342712640762329, "rewards/count_adherence/mean": 0.8392857313156128, "rewards/count_adherence/std": 0.141575887799263, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.951785683631897, "rewards/count_floor/std": 0.04247276857495308, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.4537621736526489, "rewards/repeat_penalty/std": 0.2060713768005371, "rewards/repeat_floor/mean": 0.9466707706451416, "rewards/repeat_floor/std": 0.022419724613428116, "rewards/near_duplicate_penalty/mean": 0.9332298040390015, "rewards/near_duplicate_penalty/std": 0.02776387333869934, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.5187369585037231, "rewards/distinct_2/std": 0.21405723690986633, "rewards/total_composite/mean": 0.21533070504665375, "rewards/total_composite/std": 0.08425196260213852, "reward": 0.21533070504665375, "reward_std": 0.08425196260213852, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13699856400489807, "sampling/sampling_logp_difference/max": 2.8776745796203613, "sampling/importance_sampling_ratio/min": 0.0562654510140419, "sampling/importance_sampling_ratio/mean": 1.0142626762390137, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.869613628834486, "clip_ratio/low_mean": 0.06622637994587421, "clip_ratio/low_min": 0.06622637994587421, "clip_ratio/high_mean": 0.0607346361503005, "clip_ratio/high_max": 0.0607346361503005, "clip_ratio/region_mean": 0.12696101609617472, "reward_total_mean": 0.21533070504665375, "reward_meter_mean": 0.9191886186599731, "reward_meter_std": 0.1342712640762329, "reward_count_adherence_mean": 0.8392857313156128, "reward_count_adherence_std": 0.141575887799263, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.951785683631897, "reward_count_floor_std": 0.04247276857495308, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.4537621736526489, "reward_repeat_penalty_std": 0.2060713768005371, "reward_repeat_floor_mean": 0.9466707706451416, "reward_repeat_floor_std": 0.022419724613428116, "reward_near_duplicate_penalty_mean": 0.9332298040390015, "reward_near_duplicate_penalty_std": 0.02776387333869934, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.5187369585037231, "reward_distinct_2_std": 0.21405723690986633, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.21533070504665375, "reward_total_composite_std": 0.08425196260213852} {"timestamp_utc": "2026-04-12T18:03:42Z", "mode": "train", "global_step": 572, "epoch": 0.030103678753749804, "loss": -0.0459, "grad_norm": 2.5027718544006348, "learning_rate": 8.269696969696971e-06, "num_tokens": 1058380.0, "completions/mean_length": 215.375, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 37.400001525878906, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.31860774755477905, "rewards/meter/std": 0.3715546727180481, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8237892389297485, "rewards/lexical_plausibility/std": 0.24426932632923126, "rewards/judge_quality/mean": 0.2587500214576721, "rewards/judge_quality/std": 0.2995920181274414, "rewards/repeat_penalty/mean": 0.9666010141372681, "rewards/repeat_penalty/std": 0.08760970085859299, "rewards/repeat_floor/mean": 0.9978353381156921, "rewards/repeat_floor/std": 0.005218965467065573, "rewards/near_duplicate_penalty/mean": 0.9983958005905151, "rewards/near_duplicate_penalty/std": 0.004009816329926252, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9994552135467529, "rewards/distinct_2/std": 0.0015408677281811833, "rewards/total_composite/mean": 0.09329602867364883, "rewards/total_composite/std": 0.12459640204906464, "reward": 0.09329602867364883, "reward_std": 0.12459640204906464, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17604339122772217, "sampling/sampling_logp_difference/max": 2.6610355377197266, "sampling/importance_sampling_ratio/min": 0.0698758214712143, "sampling/importance_sampling_ratio/mean": 1.0377470254898071, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7948398143053055, "clip_ratio/low_mean": 0.04713901598006487, "clip_ratio/low_min": 0.04713901598006487, "clip_ratio/high_mean": 0.04863256216049194, "clip_ratio/high_max": 0.04863256216049194, "clip_ratio/region_mean": 0.09577157814055681, "reward_total_mean": 0.09329602867364883, "reward_meter_mean": 0.31860774755477905, "reward_meter_std": 0.3715546727180481, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8237892389297485, "reward_lexical_plausibility_std": 0.24426932632923126, "reward_repeat_penalty_mean": 0.9666010141372681, "reward_repeat_penalty_std": 0.08760970085859299, "reward_repeat_floor_mean": 0.9978353381156921, "reward_repeat_floor_std": 0.005218965467065573, "reward_near_duplicate_penalty_mean": 0.9983958005905151, "reward_near_duplicate_penalty_std": 0.004009816329926252, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9994552135467529, "reward_distinct_2_std": 0.0015408677281811833, "reward_judge_quality_mean": 0.2587500214576721, "reward_judge_quality_std": 0.2995920181274414, "reward_total_composite_mean": 0.09329602867364883, "reward_total_composite_std": 0.12459640204906464} {"timestamp_utc": "2026-04-12T18:03:52Z", "mode": "train", "global_step": 573, "epoch": 0.030156307562759856, "loss": 0.0385, "grad_norm": 13.215439796447754, "learning_rate": 8.266666666666667e-06, "num_tokens": 1060255.0, "completions/mean_length": 52.375, "completions/min_length": 43.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.375, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.31971821188926697, "rewards/meter/std": 0.26265063881874084, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6087499856948853, "rewards/judge_quality/std": 0.24930977821350098, "rewards/repeat_penalty/mean": 0.9568012952804565, "rewards/repeat_penalty/std": 0.043867096304893494, "rewards/repeat_floor/mean": 0.9946140050888062, "rewards/repeat_floor/std": 0.00524016423150897, "rewards/near_duplicate_penalty/mean": 0.9762766361236572, "rewards/near_duplicate_penalty/std": 0.02132708951830864, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9796939492225647, "rewards/distinct_2/std": 0.02823641709983349, "rewards/total_composite/mean": 0.2179451435804367, "rewards/total_composite/std": 0.24642625451087952, "reward": 0.2179451435804367, "reward_std": 0.24642623960971832, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1934223175048828, "sampling/sampling_logp_difference/max": 2.0406086444854736, "sampling/importance_sampling_ratio/min": 0.12994959950447083, "sampling/importance_sampling_ratio/mean": 0.9974057078361511, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7752466052770615, "clip_ratio/low_mean": 0.09983043652027845, "clip_ratio/low_min": 0.09983043652027845, "clip_ratio/high_mean": 0.06216245796531439, "clip_ratio/high_max": 0.06216245796531439, "clip_ratio/region_mean": 0.16199289448559284, "reward_total_mean": 0.2179451435804367, "reward_meter_mean": 0.31971821188926697, "reward_meter_std": 0.26265063881874084, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9568012952804565, "reward_repeat_penalty_std": 0.043867096304893494, "reward_repeat_floor_mean": 0.9946140050888062, "reward_repeat_floor_std": 0.00524016423150897, "reward_near_duplicate_penalty_mean": 0.9762766361236572, "reward_near_duplicate_penalty_std": 0.02132708951830864, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9796939492225647, "reward_distinct_2_std": 0.02823641709983349, "reward_judge_quality_mean": 0.6087499856948853, "reward_judge_quality_std": 0.24930977821350098, "reward_total_composite_mean": 0.2179451435804367, "reward_total_composite_std": 0.24642625451087952} {"timestamp_utc": "2026-04-12T18:04:06Z", "mode": "train", "global_step": 574, "epoch": 0.030208936371769905, "loss": -0.0429, "grad_norm": 5.088376522064209, "learning_rate": 8.263636363636366e-06, "num_tokens": 1061807.0, "completions/mean_length": 97.0, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.71428680419922, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.8838696479797363, "rewards/meter/std": 0.15098340809345245, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9406701326370239, "rewards/lexical_plausibility/std": 0.13003993034362793, "rewards/judge_quality/mean": 0.4449999928474426, "rewards/judge_quality/std": 0.3022770583629608, "rewards/repeat_penalty/mean": 0.9857231378555298, "rewards/repeat_penalty/std": 0.01682031713426113, "rewards/repeat_floor/mean": 0.9978585243225098, "rewards/repeat_floor/std": 0.0025230494793504477, "rewards/near_duplicate_penalty/mean": 0.9857231378555298, "rewards/near_duplicate_penalty/std": 0.01682031713426113, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.41043856739997864, "rewards/total_composite/std": 0.30440497398376465, "reward": 0.41043856739997864, "reward_std": 0.30440497398376465, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18837955594062805, "sampling/sampling_logp_difference/max": 1.6316981315612793, "sampling/importance_sampling_ratio/min": 0.19559712707996368, "sampling/importance_sampling_ratio/mean": 1.0205085277557373, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1722734868526459, "clip_ratio/low_mean": 0.07605504244565964, "clip_ratio/low_min": 0.07605504244565964, "clip_ratio/high_mean": 0.05871355161070824, "clip_ratio/high_max": 0.05871355161070824, "clip_ratio/region_mean": 0.13476859405636787, "reward_total_mean": 0.41043856739997864, "reward_meter_mean": 0.8838696479797363, "reward_meter_std": 0.15098340809345245, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9406701326370239, "reward_lexical_plausibility_std": 0.13003993034362793, "reward_repeat_penalty_mean": 0.9857231378555298, "reward_repeat_penalty_std": 0.01682031713426113, "reward_repeat_floor_mean": 0.9978585243225098, "reward_repeat_floor_std": 0.0025230494793504477, "reward_near_duplicate_penalty_mean": 0.9857231378555298, "reward_near_duplicate_penalty_std": 0.01682031713426113, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4449999928474426, "reward_judge_quality_std": 0.3022770583629608, "reward_total_composite_mean": 0.41043856739997864, "reward_total_composite_std": 0.30440497398376465} {"timestamp_utc": "2026-04-12T18:04:14Z", "mode": "train", "global_step": 575, "epoch": 0.030261565180779958, "loss": -0.0124, "grad_norm": 18.976665496826172, "learning_rate": 8.260606060606061e-06, "num_tokens": 1063184.0, "completions/mean_length": 22.125, "completions/min_length": 20.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.125, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.9922141432762146, "rewards/meter/std": 0.0037023602053523064, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.6100000143051147, "rewards/judge_quality/std": 0.34201088547706604, "rewards/repeat_penalty/mean": 0.737289309501648, "rewards/repeat_penalty/std": 0.034418314695358276, "rewards/repeat_floor/mean": 0.9824578762054443, "rewards/repeat_floor/std": 0.006883666850626469, "rewards/near_duplicate_penalty/mean": 0.9830524325370789, "rewards/near_duplicate_penalty/std": 0.045891109853982925, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5936582088470459, "rewards/total_composite/std": 0.33149585127830505, "reward": 0.5936582088470459, "reward_std": 0.33149585127830505, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19855232536792755, "sampling/sampling_logp_difference/max": 1.9538545608520508, "sampling/importance_sampling_ratio/min": 0.14172671735286713, "sampling/importance_sampling_ratio/mean": 1.0286023616790771, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5153897851705551, "clip_ratio/low_mean": 0.09020563028752804, "clip_ratio/low_min": 0.09020563028752804, "clip_ratio/high_mean": 0.1141005763784051, "clip_ratio/high_max": 0.1141005763784051, "clip_ratio/region_mean": 0.20430620666593313, "reward_total_mean": 0.5936582088470459, "reward_meter_mean": 0.9922141432762146, "reward_meter_std": 0.0037023602053523064, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.737289309501648, "reward_repeat_penalty_std": 0.034418314695358276, "reward_repeat_floor_mean": 0.9824578762054443, "reward_repeat_floor_std": 0.006883666850626469, "reward_near_duplicate_penalty_mean": 0.9830524325370789, "reward_near_duplicate_penalty_std": 0.045891109853982925, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6100000143051147, "reward_judge_quality_std": 0.34201088547706604, "reward_total_composite_mean": 0.5936582088470459, "reward_total_composite_std": 0.33149585127830505} {"timestamp_utc": "2026-04-12T18:04:23Z", "mode": "train", "global_step": 576, "epoch": 0.03031419398979001, "loss": 0.0084, "grad_norm": 14.198740005493164, "learning_rate": 8.257575757575758e-06, "num_tokens": 1065070.0, "completions/mean_length": 61.75, "completions/min_length": 45.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.75, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.796534538269043, "rewards/meter/std": 0.22858215868473053, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175492912530899, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.9449714422225952, "rewards/repeat_penalty/std": 0.051366522908210754, "rewards/repeat_floor/mean": 0.9934579133987427, "rewards/repeat_floor/std": 0.005356706213206053, "rewards/near_duplicate_penalty/mean": 0.9747199416160583, "rewards/near_duplicate_penalty/std": 0.020100874826312065, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9694436192512512, "rewards/distinct_2/std": 0.04780247062444687, "rewards/total_composite/mean": 0.35789692401885986, "rewards/total_composite/std": 0.17815133929252625, "reward": 0.35789692401885986, "reward_std": 0.17815133929252625, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1710430234670639, "sampling/sampling_logp_difference/max": 1.8441460132598877, "sampling/importance_sampling_ratio/min": 0.15816032886505127, "sampling/importance_sampling_ratio/mean": 1.0230984687805176, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1213613077998161, "clip_ratio/low_mean": 0.07982475776225328, "clip_ratio/low_min": 0.07982475776225328, "clip_ratio/high_mean": 0.0809027049690485, "clip_ratio/high_max": 0.0809027049690485, "clip_ratio/region_mean": 0.16072746273130178, "reward_total_mean": 0.35789692401885986, "reward_meter_mean": 0.796534538269043, "reward_meter_std": 0.22858215868473053, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175492912530899, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9449714422225952, "reward_repeat_penalty_std": 0.051366522908210754, "reward_repeat_floor_mean": 0.9934579133987427, "reward_repeat_floor_std": 0.005356706213206053, "reward_near_duplicate_penalty_mean": 0.9747199416160583, "reward_near_duplicate_penalty_std": 0.020100874826312065, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9694436192512512, "reward_distinct_2_std": 0.04780247062444687, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.35789692401885986, "reward_total_composite_std": 0.17815133929252625} {"timestamp_utc": "2026-04-12T18:04:30Z", "mode": "train", "global_step": 577, "epoch": 0.030366822798800062, "loss": 0.0412, "grad_norm": 24.08905792236328, "learning_rate": 8.254545454545456e-06, "num_tokens": 1066505.0, "completions/mean_length": 23.375, "completions/min_length": 19.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.375, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.7529468536376953, "rewards/meter/std": 0.33371686935424805, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8385416269302368, "rewards/lexical_plausibility/std": 0.1855888068675995, "rewards/judge_quality/mean": 0.6487500071525574, "rewards/judge_quality/std": 0.413743793964386, "rewards/repeat_penalty/mean": 0.7179175019264221, "rewards/repeat_penalty/std": 0.0642748475074768, "rewards/repeat_floor/mean": 0.9794076681137085, "rewards/repeat_floor/std": 0.012317469343543053, "rewards/near_duplicate_penalty/mean": 0.9709596037864685, "rewards/near_duplicate_penalty/std": 0.08213866502046585, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9862637519836426, "rewards/distinct_2/std": 0.0388520210981369, "rewards/total_composite/mean": 0.43734052777290344, "rewards/total_composite/std": 0.3831902742385864, "reward": 0.43734052777290344, "reward_std": 0.3831902742385864, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18308025598526, "sampling/sampling_logp_difference/max": 0.9893598556518555, "sampling/importance_sampling_ratio/min": 0.37181463837623596, "sampling/importance_sampling_ratio/mean": 1.0063985586166382, "sampling/importance_sampling_ratio/max": 1.9688750505447388, "entropy": 1.371234193444252, "clip_ratio/low_mean": 0.08781056059524417, "clip_ratio/low_min": 0.08781056059524417, "clip_ratio/high_mean": 0.07091317139565945, "clip_ratio/high_max": 0.07091317139565945, "clip_ratio/region_mean": 0.15872373199090362, "reward_total_mean": 0.43734052777290344, "reward_meter_mean": 0.7529468536376953, "reward_meter_std": 0.33371686935424805, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8385416269302368, "reward_lexical_plausibility_std": 0.1855888068675995, "reward_repeat_penalty_mean": 0.7179175019264221, "reward_repeat_penalty_std": 0.0642748475074768, "reward_repeat_floor_mean": 0.9794076681137085, "reward_repeat_floor_std": 0.012317469343543053, "reward_near_duplicate_penalty_mean": 0.9709596037864685, "reward_near_duplicate_penalty_std": 0.08213866502046585, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9862637519836426, "reward_distinct_2_std": 0.0388520210981369, "reward_judge_quality_mean": 0.6487500071525574, "reward_judge_quality_std": 0.413743793964386, "reward_total_composite_mean": 0.43734052777290344, "reward_total_composite_std": 0.3831902742385864} {"timestamp_utc": "2026-04-12T18:04:41Z", "mode": "train", "global_step": 578, "epoch": 0.030419451607810115, "loss": 0.0593, "grad_norm": 10.385157585144043, "learning_rate": 8.251515151515153e-06, "num_tokens": 1068572.0, "completions/mean_length": 90.375, "completions/min_length": 72.0, "completions/max_length": 110.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 90.375, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 110.0, "rewards/meter/mean": 0.9587092399597168, "rewards/meter/std": 0.08925272524356842, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9718749523162842, "rewards/count_floor/std": 0.0388161838054657, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.8170046210289001, "rewards/repeat_penalty/std": 0.1990501433610916, "rewards/repeat_floor/mean": 0.9804220795631409, "rewards/repeat_floor/std": 0.019898395985364914, "rewards/near_duplicate_penalty/mean": 0.9495874643325806, "rewards/near_duplicate_penalty/std": 0.0440165251493454, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8664884567260742, "rewards/distinct_2/std": 0.15123692154884338, "rewards/total_composite/mean": 0.43401795625686646, "rewards/total_composite/std": 0.1833207905292511, "reward": 0.43401795625686646, "reward_std": 0.1833207607269287, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15359997749328613, "sampling/sampling_logp_difference/max": 2.1504414081573486, "sampling/importance_sampling_ratio/min": 0.11643274873495102, "sampling/importance_sampling_ratio/mean": 1.0121476650238037, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8920102417469025, "clip_ratio/low_mean": 0.04906655754894018, "clip_ratio/low_min": 0.04906655754894018, "clip_ratio/high_mean": 0.11039167083799839, "clip_ratio/high_max": 0.11039167083799839, "clip_ratio/region_mean": 0.15945822838693857, "reward_total_mean": 0.43401795625686646, "reward_meter_mean": 0.9587092399597168, "reward_meter_std": 0.08925272524356842, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9718749523162842, "reward_count_floor_std": 0.0388161838054657, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8170046210289001, "reward_repeat_penalty_std": 0.1990501433610916, "reward_repeat_floor_mean": 0.9804220795631409, "reward_repeat_floor_std": 0.019898395985364914, "reward_near_duplicate_penalty_mean": 0.9495874643325806, "reward_near_duplicate_penalty_std": 0.0440165251493454, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8664884567260742, "reward_distinct_2_std": 0.15123692154884338, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.43401795625686646, "reward_total_composite_std": 0.1833207905292511} {"timestamp_utc": "2026-04-12T18:04:54Z", "mode": "train", "global_step": 579, "epoch": 0.030472080416820167, "loss": -0.0368, "grad_norm": 7.788293361663818, "learning_rate": 8.248484848484848e-06, "num_tokens": 1070141.0, "completions/mean_length": 92.125, "completions/min_length": 27.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 32.142860412597656, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.40672704577445984, "rewards/meter/std": 0.372258722782135, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9135165810585022, "rewards/lexical_plausibility/std": 0.21889373660087585, "rewards/judge_quality/mean": 0.6637499928474426, "rewards/judge_quality/std": 0.33957695960998535, "rewards/repeat_penalty/mean": 0.971304178237915, "rewards/repeat_penalty/std": 0.05075687915086746, "rewards/repeat_floor/mean": 0.9964439868927002, "rewards/repeat_floor/std": 0.0057627735659480095, "rewards/near_duplicate_penalty/mean": 0.9845349788665771, "rewards/near_duplicate_penalty/std": 0.023037346079945564, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9862637519836426, "rewards/distinct_2/std": 0.0388520210981369, "rewards/total_composite/mean": 0.2326650321483612, "rewards/total_composite/std": 0.2507937252521515, "reward": 0.2326650321483612, "reward_std": 0.2507937550544739, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19097664952278137, "sampling/sampling_logp_difference/max": 1.4531831741333008, "sampling/importance_sampling_ratio/min": 0.23382480442523956, "sampling/importance_sampling_ratio/mean": 1.0127637386322021, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7697450146079063, "clip_ratio/low_mean": 0.0793445548042655, "clip_ratio/low_min": 0.0793445548042655, "clip_ratio/high_mean": 0.08510783687233925, "clip_ratio/high_max": 0.08510783687233925, "clip_ratio/region_mean": 0.16445239167660475, "reward_total_mean": 0.2326650321483612, "reward_meter_mean": 0.40672704577445984, "reward_meter_std": 0.372258722782135, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9135165810585022, "reward_lexical_plausibility_std": 0.21889373660087585, "reward_repeat_penalty_mean": 0.971304178237915, "reward_repeat_penalty_std": 0.05075687915086746, "reward_repeat_floor_mean": 0.9964439868927002, "reward_repeat_floor_std": 0.0057627735659480095, "reward_near_duplicate_penalty_mean": 0.9845349788665771, "reward_near_duplicate_penalty_std": 0.023037346079945564, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9862637519836426, "reward_distinct_2_std": 0.0388520210981369, "reward_judge_quality_mean": 0.6637499928474426, "reward_judge_quality_std": 0.33957695960998535, "reward_total_composite_mean": 0.2326650321483612, "reward_total_composite_std": 0.2507937252521515} {"timestamp_utc": "2026-04-12T18:05:08Z", "mode": "train", "global_step": 580, "epoch": 0.03052470922583022, "loss": -0.0992, "grad_norm": 7.1847405433654785, "learning_rate": 8.245454545454546e-06, "num_tokens": 1072011.0, "completions/mean_length": 120.75, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 64.85714721679688, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.705537736415863, "rewards/meter/std": 0.2794915735721588, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.2651650309562683, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.953125, "rewards/count_floor/std": 0.07954952120780945, "rewards/lexical_plausibility/mean": 0.9416865110397339, "rewards/lexical_plausibility/std": 0.16493549942970276, "rewards/judge_quality/mean": 0.3187499940395355, "rewards/judge_quality/std": 0.16243129968643188, "rewards/repeat_penalty/mean": 0.572622537612915, "rewards/repeat_penalty/std": 0.17941150069236755, "rewards/repeat_floor/mean": 0.9546619653701782, "rewards/repeat_floor/std": 0.02013588510453701, "rewards/near_duplicate_penalty/mean": 0.8809958696365356, "rewards/near_duplicate_penalty/std": 0.05666163191199303, "rewards/opening_diversity/mean": 0.9296875, "rewards/opening_diversity/std": 0.1129826009273529, "rewards/distinct_2/mean": 0.7414588928222656, "rewards/distinct_2/std": 0.15535785257816315, "rewards/total_composite/mean": 0.20815955102443695, "rewards/total_composite/std": 0.13052405416965485, "reward": 0.20815955102443695, "reward_std": 0.13052405416965485, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15861372649669647, "sampling/sampling_logp_difference/max": 1.8488059043884277, "sampling/importance_sampling_ratio/min": 0.193994402885437, "sampling/importance_sampling_ratio/mean": 1.0258125066757202, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7317588552832603, "clip_ratio/low_mean": 0.03219697065651417, "clip_ratio/low_min": 0.03219697065651417, "clip_ratio/high_mean": 0.07353195920586586, "clip_ratio/high_max": 0.07353195920586586, "clip_ratio/region_mean": 0.10572892986238003, "reward_total_mean": 0.20815955102443695, "reward_meter_mean": 0.705537736415863, "reward_meter_std": 0.2794915735721588, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.2651650309562683, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.953125, "reward_count_floor_std": 0.07954952120780945, "reward_lexical_plausibility_mean": 0.9416865110397339, "reward_lexical_plausibility_std": 0.16493549942970276, "reward_repeat_penalty_mean": 0.572622537612915, "reward_repeat_penalty_std": 0.17941150069236755, "reward_repeat_floor_mean": 0.9546619653701782, "reward_repeat_floor_std": 0.02013588510453701, "reward_near_duplicate_penalty_mean": 0.8809958696365356, "reward_near_duplicate_penalty_std": 0.05666163191199303, "reward_opening_diversity_mean": 0.9296875, "reward_opening_diversity_std": 0.1129826009273529, "reward_distinct_2_mean": 0.7414588928222656, "reward_distinct_2_std": 0.15535785257816315, "reward_judge_quality_mean": 0.3187499940395355, "reward_judge_quality_std": 0.16243129968643188, "reward_total_composite_mean": 0.20815955102443695, "reward_total_composite_std": 0.13052405416965485} {"timestamp_utc": "2026-04-12T18:05:20Z", "mode": "train", "global_step": 581, "epoch": 0.030577338034840272, "loss": -0.0358, "grad_norm": 14.940107345581055, "learning_rate": 8.242424242424243e-06, "num_tokens": 1073881.0, "completions/mean_length": 53.75, "completions/min_length": 47.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.75, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.3694577217102051, "rewards/meter/std": 0.301023930311203, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5762499570846558, "rewards/judge_quality/std": 0.28665250539779663, "rewards/repeat_penalty/mean": 0.9378868341445923, "rewards/repeat_penalty/std": 0.08922033756971359, "rewards/repeat_floor/mean": 0.9928351640701294, "rewards/repeat_floor/std": 0.009358384646475315, "rewards/near_duplicate_penalty/mean": 0.9766912460327148, "rewards/near_duplicate_penalty/std": 0.019322985783219337, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.95923912525177, "rewards/distinct_2/std": 0.07707840204238892, "rewards/total_composite/mean": 0.2371755689382553, "rewards/total_composite/std": 0.2880220413208008, "reward": 0.2371755689382553, "reward_std": 0.2880220413208008, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1628991961479187, "sampling/sampling_logp_difference/max": 1.9592454433441162, "sampling/importance_sampling_ratio/min": 0.14096474647521973, "sampling/importance_sampling_ratio/mean": 1.0173221826553345, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8562130555510521, "clip_ratio/low_mean": 0.12125014699995518, "clip_ratio/low_min": 0.12125014699995518, "clip_ratio/high_mean": 0.04394703730940819, "clip_ratio/high_max": 0.04394703730940819, "clip_ratio/region_mean": 0.16519718430936337, "reward_total_mean": 0.2371755689382553, "reward_meter_mean": 0.3694577217102051, "reward_meter_std": 0.301023930311203, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9378868341445923, "reward_repeat_penalty_std": 0.08922033756971359, "reward_repeat_floor_mean": 0.9928351640701294, "reward_repeat_floor_std": 0.009358384646475315, "reward_near_duplicate_penalty_mean": 0.9766912460327148, "reward_near_duplicate_penalty_std": 0.019322985783219337, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.95923912525177, "reward_distinct_2_std": 0.07707840204238892, "reward_judge_quality_mean": 0.5762499570846558, "reward_judge_quality_std": 0.28665250539779663, "reward_total_composite_mean": 0.2371755689382553, "reward_total_composite_std": 0.2880220413208008} {"timestamp_utc": "2026-04-12T18:05:33Z", "mode": "train", "global_step": 582, "epoch": 0.030629966843850324, "loss": -0.0443, "grad_norm": 5.245945453643799, "learning_rate": 8.23939393939394e-06, "num_tokens": 1075395.0, "completions/mean_length": 99.25, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 40.28571701049805, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.8541418313980103, "rewards/meter/std": 0.28981056809425354, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9368588924407959, "rewards/lexical_plausibility/std": 0.17858998477458954, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.3003212809562683, "rewards/repeat_penalty/mean": 0.945415735244751, "rewards/repeat_penalty/std": 0.13051041960716248, "rewards/repeat_floor/mean": 0.9943419098854065, "rewards/repeat_floor/std": 0.012509886175394058, "rewards/near_duplicate_penalty/mean": 0.9811896085739136, "rewards/near_duplicate_penalty/std": 0.03266141563653946, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.44984495639801025, "rewards/total_composite/std": 0.2928798794746399, "reward": 0.44984495639801025, "reward_std": 0.2928798794746399, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16057546436786652, "sampling/sampling_logp_difference/max": 1.6267890930175781, "sampling/importance_sampling_ratio/min": 0.19655968248844147, "sampling/importance_sampling_ratio/mean": 1.0162990093231201, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0817658826708794, "clip_ratio/low_mean": 0.06546593271195889, "clip_ratio/low_min": 0.06546593271195889, "clip_ratio/high_mean": 0.05600619316101074, "clip_ratio/high_max": 0.05600619316101074, "clip_ratio/region_mean": 0.12147212587296963, "reward_total_mean": 0.44984495639801025, "reward_meter_mean": 0.8541418313980103, "reward_meter_std": 0.28981056809425354, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9368588924407959, "reward_lexical_plausibility_std": 0.17858998477458954, "reward_repeat_penalty_mean": 0.945415735244751, "reward_repeat_penalty_std": 0.13051041960716248, "reward_repeat_floor_mean": 0.9943419098854065, "reward_repeat_floor_std": 0.012509886175394058, "reward_near_duplicate_penalty_mean": 0.9811896085739136, "reward_near_duplicate_penalty_std": 0.03266141563653946, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.3003212809562683, "reward_total_composite_mean": 0.44984495639801025, "reward_total_composite_std": 0.2928798794746399} {"timestamp_utc": "2026-04-12T18:05:41Z", "mode": "train", "global_step": 583, "epoch": 0.030682595652860377, "loss": 0.0718, "grad_norm": 18.93609046936035, "learning_rate": 8.236363636363637e-06, "num_tokens": 1076997.0, "completions/mean_length": 38.25, "completions/min_length": 33.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.25, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.6064172983169556, "rewards/meter/std": 0.46976912021636963, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.28222334384918213, "rewards/repeat_penalty/mean": 0.9098682403564453, "rewards/repeat_penalty/std": 0.09603958576917648, "rewards/repeat_floor/mean": 0.9876708388328552, "rewards/repeat_floor/std": 0.01218317449092865, "rewards/near_duplicate_penalty/mean": 0.93613600730896, "rewards/near_duplicate_penalty/std": 0.04395810514688492, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9694494009017944, "rewards/distinct_2/std": 0.06382904946804047, "rewards/total_composite/mean": 0.41691726446151733, "rewards/total_composite/std": 0.4035947918891907, "reward": 0.41691726446151733, "reward_std": 0.4035947918891907, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19777661561965942, "sampling/sampling_logp_difference/max": 1.397841453552246, "sampling/importance_sampling_ratio/min": 0.24712984263896942, "sampling/importance_sampling_ratio/mean": 1.0057704448699951, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.934145137667656, "clip_ratio/low_mean": 0.07995073054917157, "clip_ratio/low_min": 0.07995073054917157, "clip_ratio/high_mean": 0.057914674282073975, "clip_ratio/high_max": 0.057914674282073975, "clip_ratio/region_mean": 0.13786540483124554, "reward_total_mean": 0.41691726446151733, "reward_meter_mean": 0.6064172983169556, "reward_meter_std": 0.46976912021636963, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9098682403564453, "reward_repeat_penalty_std": 0.09603958576917648, "reward_repeat_floor_mean": 0.9876708388328552, "reward_repeat_floor_std": 0.01218317449092865, "reward_near_duplicate_penalty_mean": 0.93613600730896, "reward_near_duplicate_penalty_std": 0.04395810514688492, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9694494009017944, "reward_distinct_2_std": 0.06382904946804047, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.28222334384918213, "reward_total_composite_mean": 0.41691726446151733, "reward_total_composite_std": 0.4035947918891907} {"timestamp_utc": "2026-04-12T18:05:55Z", "mode": "train", "global_step": 584, "epoch": 0.03073522446187043, "loss": -0.0751, "grad_norm": 2.6814279556274414, "learning_rate": 8.233333333333335e-06, "num_tokens": 1078505.0, "completions/mean_length": 161.5, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 44.66666793823242, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.9531233906745911, "rewards/meter/std": 0.07817742228507996, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8637686967849731, "rewards/lexical_plausibility/std": 0.2527143359184265, "rewards/judge_quality/mean": 0.41750001907348633, "rewards/judge_quality/std": 0.3366537094116211, "rewards/repeat_penalty/mean": 0.9679023027420044, "rewards/repeat_penalty/std": 0.05428579822182655, "rewards/repeat_floor/mean": 0.9959695339202881, "rewards/repeat_floor/std": 0.006082112900912762, "rewards/near_duplicate_penalty/mean": 0.9820059537887573, "rewards/near_duplicate_penalty/std": 0.020822148770093918, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.38559335470199585, "rewards/total_composite/std": 0.29724568128585815, "reward": 0.38559335470199585, "reward_std": 0.29724568128585815, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15141427516937256, "sampling/sampling_logp_difference/max": 1.228102684020996, "sampling/importance_sampling_ratio/min": 0.2928476631641388, "sampling/importance_sampling_ratio/mean": 1.0269032716751099, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.746183343231678, "clip_ratio/low_mean": 0.08390332479029894, "clip_ratio/low_min": 0.08390332479029894, "clip_ratio/high_mean": 0.042247386649250984, "clip_ratio/high_max": 0.042247386649250984, "clip_ratio/region_mean": 0.12615071143954992, "reward_total_mean": 0.38559335470199585, "reward_meter_mean": 0.9531233906745911, "reward_meter_std": 0.07817742228507996, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8637686967849731, "reward_lexical_plausibility_std": 0.2527143359184265, "reward_repeat_penalty_mean": 0.9679023027420044, "reward_repeat_penalty_std": 0.05428579822182655, "reward_repeat_floor_mean": 0.9959695339202881, "reward_repeat_floor_std": 0.006082112900912762, "reward_near_duplicate_penalty_mean": 0.9820059537887573, "reward_near_duplicate_penalty_std": 0.020822148770093918, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.41750001907348633, "reward_judge_quality_std": 0.3366537094116211, "reward_total_composite_mean": 0.38559335470199585, "reward_total_composite_std": 0.29724568128585815} {"timestamp_utc": "2026-04-12T18:06:04Z", "mode": "train", "global_step": 585, "epoch": 0.03078785327088048, "loss": 0.0964, "grad_norm": 17.864479064941406, "learning_rate": 8.23030303030303e-06, "num_tokens": 1080205.0, "completions/mean_length": 47.5, "completions/min_length": 41.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.5, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.6405714750289917, "rewards/meter/std": 0.38932862877845764, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9398886561393738, "rewards/repeat_penalty/std": 0.11351761221885681, "rewards/repeat_floor/mean": 0.99423748254776, "rewards/repeat_floor/std": 0.00942007452249527, "rewards/near_duplicate_penalty/mean": 0.9843447804450989, "rewards/near_duplicate_penalty/std": 0.017178017646074295, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9828975200653076, "rewards/distinct_2/std": 0.031678035855293274, "rewards/total_composite/mean": 0.2329883575439453, "rewards/total_composite/std": 0.15330007672309875, "reward": 0.2329883575439453, "reward_std": 0.15330006182193756, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1745918095111847, "sampling/sampling_logp_difference/max": 1.549882411956787, "sampling/importance_sampling_ratio/min": 0.21227294206619263, "sampling/importance_sampling_ratio/mean": 1.029954433441162, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1156706884503365, "clip_ratio/low_mean": 0.0724463053047657, "clip_ratio/low_min": 0.0724463053047657, "clip_ratio/high_mean": 0.08492917101830244, "clip_ratio/high_max": 0.08492917101830244, "clip_ratio/region_mean": 0.15737547632306814, "reward_total_mean": 0.2329883575439453, "reward_meter_mean": 0.6405714750289917, "reward_meter_std": 0.38932862877845764, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9398886561393738, "reward_repeat_penalty_std": 0.11351761221885681, "reward_repeat_floor_mean": 0.99423748254776, "reward_repeat_floor_std": 0.00942007452249527, "reward_near_duplicate_penalty_mean": 0.9843447804450989, "reward_near_duplicate_penalty_std": 0.017178017646074295, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9828975200653076, "reward_distinct_2_std": 0.031678035855293274, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.2329883575439453, "reward_total_composite_std": 0.15330007672309875} {"timestamp_utc": "2026-04-12T18:06:18Z", "mode": "train", "global_step": 586, "epoch": 0.03084048207989053, "loss": -0.1275, "grad_norm": 6.149367332458496, "learning_rate": 8.227272727272728e-06, "num_tokens": 1081982.0, "completions/mean_length": 115.125, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 58.42857360839844, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.770018994808197, "rewards/meter/std": 0.3668903112411499, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.24800792336463928, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.07440237700939178, "rewards/lexical_plausibility/mean": 0.9576707482337952, "rewards/lexical_plausibility/std": 0.11972522735595703, "rewards/judge_quality/mean": 0.33375000953674316, "rewards/judge_quality/std": 0.16335216164588928, "rewards/repeat_penalty/mean": 0.8881149291992188, "rewards/repeat_penalty/std": 0.11621665954589844, "rewards/repeat_floor/mean": 0.9900487661361694, "rewards/repeat_floor/std": 0.007919838652014732, "rewards/near_duplicate_penalty/mean": 0.9771410226821899, "rewards/near_duplicate_penalty/std": 0.013170610181987286, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9691950678825378, "rewards/distinct_2/std": 0.03478526324033737, "rewards/total_composite/mean": 0.29879647493362427, "rewards/total_composite/std": 0.17232559621334076, "reward": 0.29879647493362427, "reward_std": 0.17232558131217957, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1661117970943451, "sampling/sampling_logp_difference/max": 1.924523115158081, "sampling/importance_sampling_ratio/min": 0.14594534039497375, "sampling/importance_sampling_ratio/mean": 0.9916799664497375, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9253994524478912, "clip_ratio/low_mean": 0.017500000074505806, "clip_ratio/low_min": 0.017500000074505806, "clip_ratio/high_mean": 0.12571268435567617, "clip_ratio/high_max": 0.12571268435567617, "clip_ratio/region_mean": 0.14321268443018198, "reward_total_mean": 0.29879647493362427, "reward_meter_mean": 0.770018994808197, "reward_meter_std": 0.3668903112411499, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.24800792336463928, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.07440237700939178, "reward_lexical_plausibility_mean": 0.9576707482337952, "reward_lexical_plausibility_std": 0.11972522735595703, "reward_repeat_penalty_mean": 0.8881149291992188, "reward_repeat_penalty_std": 0.11621665954589844, "reward_repeat_floor_mean": 0.9900487661361694, "reward_repeat_floor_std": 0.007919838652014732, "reward_near_duplicate_penalty_mean": 0.9771410226821899, "reward_near_duplicate_penalty_std": 0.013170610181987286, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9691950678825378, "reward_distinct_2_std": 0.03478526324033737, "reward_judge_quality_mean": 0.33375000953674316, "reward_judge_quality_std": 0.16335216164588928, "reward_total_composite_mean": 0.29879647493362427, "reward_total_composite_std": 0.17232559621334076} {"timestamp_utc": "2026-04-12T18:06:31Z", "mode": "train", "global_step": 587, "epoch": 0.030893110888900583, "loss": -0.0525, "grad_norm": 6.476796627044678, "learning_rate": 8.224242424242425e-06, "num_tokens": 1083493.0, "completions/mean_length": 101.875, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.28571701049805, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.7257331013679504, "rewards/meter/std": 0.4257688820362091, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9304554462432861, "rewards/lexical_plausibility/std": 0.196701779961586, "rewards/judge_quality/mean": 0.543749988079071, "rewards/judge_quality/std": 0.29952046275138855, "rewards/repeat_penalty/mean": 0.959242045879364, "rewards/repeat_penalty/std": 0.0620308481156826, "rewards/repeat_floor/mean": 0.9947984218597412, "rewards/repeat_floor/std": 0.006942821200937033, "rewards/near_duplicate_penalty/mean": 0.9758121967315674, "rewards/near_duplicate_penalty/std": 0.024305464699864388, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.4604256749153137, "rewards/total_composite/std": 0.3339039981365204, "reward": 0.4604256749153137, "reward_std": 0.3339039981365204, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15783986449241638, "sampling/sampling_logp_difference/max": 1.6187973022460938, "sampling/importance_sampling_ratio/min": 0.19813686609268188, "sampling/importance_sampling_ratio/mean": 1.0214251279830933, "sampling/importance_sampling_ratio/max": 1.9676741361618042, "entropy": 1.1844745725393295, "clip_ratio/low_mean": 0.04924048949033022, "clip_ratio/low_min": 0.04924048949033022, "clip_ratio/high_mean": 0.06058441661298275, "clip_ratio/high_max": 0.06058441661298275, "clip_ratio/region_mean": 0.10982490610331297, "reward_total_mean": 0.4604256749153137, "reward_meter_mean": 0.7257331013679504, "reward_meter_std": 0.4257688820362091, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9304554462432861, "reward_lexical_plausibility_std": 0.196701779961586, "reward_repeat_penalty_mean": 0.959242045879364, "reward_repeat_penalty_std": 0.0620308481156826, "reward_repeat_floor_mean": 0.9947984218597412, "reward_repeat_floor_std": 0.006942821200937033, "reward_near_duplicate_penalty_mean": 0.9758121967315674, "reward_near_duplicate_penalty_std": 0.024305464699864388, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.543749988079071, "reward_judge_quality_std": 0.29952046275138855, "reward_total_composite_mean": 0.4604256749153137, "reward_total_composite_std": 0.3339039981365204} {"timestamp_utc": "2026-04-12T18:06:42Z", "mode": "train", "global_step": 588, "epoch": 0.030945739697910635, "loss": 0.1025, "grad_norm": 5.921337127685547, "learning_rate": 8.221212121212122e-06, "num_tokens": 1086972.0, "completions/mean_length": 217.875, "completions/min_length": 184.0, "completions/max_length": 270.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 217.875, "completions/min_terminated_length": 184.0, "completions/max_terminated_length": 270.0, "rewards/meter/mean": 0.9886859655380249, "rewards/meter/std": 0.003234405303373933, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.0578637570142746, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.953125, "rewards/count_floor/std": 0.017359109595417976, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.13024701178073883, "rewards/repeat_penalty/mean": 0.28278589248657227, "rewards/repeat_penalty/std": 0.3578672409057617, "rewards/repeat_floor/mean": 0.8869429230690002, "rewards/repeat_floor/std": 0.07762374728918076, "rewards/near_duplicate_penalty/mean": 0.7476008534431458, "rewards/near_duplicate_penalty/std": 0.20883676409721375, "rewards/opening_diversity/mean": 0.7758224010467529, "rewards/opening_diversity/std": 0.2800602912902832, "rewards/distinct_2/mean": 0.31392723321914673, "rewards/distinct_2/std": 0.37888339161872864, "rewards/total_composite/mean": 0.24719148874282837, "rewards/total_composite/std": 0.1288624256849289, "reward": 0.24719148874282837, "reward_std": 0.1288624256849289, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10224106162786484, "sampling/sampling_logp_difference/max": 2.688180446624756, "sampling/importance_sampling_ratio/min": 0.06800457090139389, "sampling/importance_sampling_ratio/mean": 1.006943941116333, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5232706964015961, "clip_ratio/low_mean": 0.0262136145029217, "clip_ratio/low_min": 0.0262136145029217, "clip_ratio/high_mean": 0.06160101946443319, "clip_ratio/high_max": 0.06160101946443319, "clip_ratio/region_mean": 0.0878146339673549, "reward_total_mean": 0.24719148874282837, "reward_meter_mean": 0.9886859655380249, "reward_meter_std": 0.003234405303373933, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.0578637570142746, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.953125, "reward_count_floor_std": 0.017359109595417976, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.28278589248657227, "reward_repeat_penalty_std": 0.3578672409057617, "reward_repeat_floor_mean": 0.8869429230690002, "reward_repeat_floor_std": 0.07762374728918076, "reward_near_duplicate_penalty_mean": 0.7476008534431458, "reward_near_duplicate_penalty_std": 0.20883676409721375, "reward_opening_diversity_mean": 0.7758224010467529, "reward_opening_diversity_std": 0.2800602912902832, "reward_distinct_2_mean": 0.31392723321914673, "reward_distinct_2_std": 0.37888339161872864, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.13024701178073883, "reward_total_composite_mean": 0.24719148874282837, "reward_total_composite_std": 0.1288624256849289} {"timestamp_utc": "2026-04-12T18:06:51Z", "mode": "train", "global_step": 589, "epoch": 0.030998368506920688, "loss": 0.0827, "grad_norm": 18.29681968688965, "learning_rate": 8.21818181818182e-06, "num_tokens": 1088556.0, "completions/mean_length": 37.0, "completions/min_length": 32.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.5002398490905762, "rewards/meter/std": 0.4230419099330902, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5212500095367432, "rewards/judge_quality/std": 0.20364098250865936, "rewards/repeat_penalty/mean": 0.951219379901886, "rewards/repeat_penalty/std": 0.08588853478431702, "rewards/repeat_floor/mean": 0.9942461252212524, "rewards/repeat_floor/std": 0.008486769162118435, "rewards/near_duplicate_penalty/mean": 0.9789485931396484, "rewards/near_duplicate_penalty/std": 0.010279958136379719, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9711538553237915, "rewards/distinct_2/std": 0.0815892368555069, "rewards/total_composite/mean": 0.26205557584762573, "rewards/total_composite/std": 0.24468806385993958, "reward": 0.26205557584762573, "reward_std": 0.24468806385993958, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.182035893201828, "sampling/sampling_logp_difference/max": 2.0241386890411377, "sampling/importance_sampling_ratio/min": 0.13210758566856384, "sampling/importance_sampling_ratio/mean": 1.0191036462783813, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1395717039704323, "clip_ratio/low_mean": 0.09946038946509361, "clip_ratio/low_min": 0.09946038946509361, "clip_ratio/high_mean": 0.06316131725907326, "clip_ratio/high_max": 0.06316131725907326, "clip_ratio/region_mean": 0.16262170672416687, "reward_total_mean": 0.26205557584762573, "reward_meter_mean": 0.5002398490905762, "reward_meter_std": 0.4230419099330902, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.951219379901886, "reward_repeat_penalty_std": 0.08588853478431702, "reward_repeat_floor_mean": 0.9942461252212524, "reward_repeat_floor_std": 0.008486769162118435, "reward_near_duplicate_penalty_mean": 0.9789485931396484, "reward_near_duplicate_penalty_std": 0.010279958136379719, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9711538553237915, "reward_distinct_2_std": 0.0815892368555069, "reward_judge_quality_mean": 0.5212500095367432, "reward_judge_quality_std": 0.20364098250865936, "reward_total_composite_mean": 0.26205557584762573, "reward_total_composite_std": 0.24468806385993958} {"timestamp_utc": "2026-04-12T18:07:04Z", "mode": "train", "global_step": 590, "epoch": 0.03105099731593074, "loss": -0.0411, "grad_norm": 5.579891204833984, "learning_rate": 8.215151515151517e-06, "num_tokens": 1090394.0, "completions/mean_length": 121.75, "completions/min_length": 55.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 66.0, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.7304646968841553, "rewards/meter/std": 0.34969362616539, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9395439624786377, "rewards/lexical_plausibility/std": 0.15603625774383545, "rewards/judge_quality/mean": 0.5762500166893005, "rewards/judge_quality/std": 0.30123260617256165, "rewards/repeat_penalty/mean": 0.9695484638214111, "rewards/repeat_penalty/std": 0.037265244871377945, "rewards/repeat_floor/mean": 0.996529221534729, "rewards/repeat_floor/std": 0.00366105861030519, "rewards/near_duplicate_penalty/mean": 0.988242506980896, "rewards/near_duplicate_penalty/std": 0.009074272587895393, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9810318946838379, "rewards/distinct_2/std": 0.035094089806079865, "rewards/total_composite/mean": 0.47439393401145935, "rewards/total_composite/std": 0.35635241866111755, "reward": 0.47439393401145935, "reward_std": 0.35635238885879517, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1668364405632019, "sampling/sampling_logp_difference/max": 2.9669766426086426, "sampling/importance_sampling_ratio/min": 0.051458653062582016, "sampling/importance_sampling_ratio/mean": 1.0063886642456055, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8602184131741524, "clip_ratio/low_mean": 0.0969181340187788, "clip_ratio/low_min": 0.0969181340187788, "clip_ratio/high_mean": 0.05962243489921093, "clip_ratio/high_max": 0.05962243489921093, "clip_ratio/region_mean": 0.15654056891798973, "reward_total_mean": 0.47439393401145935, "reward_meter_mean": 0.7304646968841553, "reward_meter_std": 0.34969362616539, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9395439624786377, "reward_lexical_plausibility_std": 0.15603625774383545, "reward_repeat_penalty_mean": 0.9695484638214111, "reward_repeat_penalty_std": 0.037265244871377945, "reward_repeat_floor_mean": 0.996529221534729, "reward_repeat_floor_std": 0.00366105861030519, "reward_near_duplicate_penalty_mean": 0.988242506980896, "reward_near_duplicate_penalty_std": 0.009074272587895393, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9810318946838379, "reward_distinct_2_std": 0.035094089806079865, "reward_judge_quality_mean": 0.5762500166893005, "reward_judge_quality_std": 0.30123260617256165, "reward_total_composite_mean": 0.47439393401145935, "reward_total_composite_std": 0.35635241866111755} {"timestamp_utc": "2026-04-12T18:07:13Z", "mode": "train", "global_step": 591, "epoch": 0.031103626124940793, "loss": 0.0622, "grad_norm": 15.370757102966309, "learning_rate": 8.212121212121212e-06, "num_tokens": 1092228.0, "completions/mean_length": 46.25, "completions/min_length": 35.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.25, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.587675929069519, "rewards/meter/std": 0.37471726536750793, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9642857313156128, "rewards/lexical_plausibility/std": 0.10101525485515594, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.9389331340789795, "rewards/repeat_penalty/std": 0.06536339968442917, "rewards/repeat_floor/mean": 0.9920876622200012, "rewards/repeat_floor/std": 0.008928068913519382, "rewards/near_duplicate_penalty/mean": 0.9615490436553955, "rewards/near_duplicate_penalty/std": 0.05235946550965309, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9761699438095093, "rewards/distinct_2/std": 0.03302708640694618, "rewards/total_composite/mean": 0.2845801115036011, "rewards/total_composite/std": 0.20437119901180267, "reward": 0.2845801115036011, "reward_std": 0.20437119901180267, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17702707648277283, "sampling/sampling_logp_difference/max": 2.561309337615967, "sampling/importance_sampling_ratio/min": 0.07848146557807922, "sampling/importance_sampling_ratio/mean": 1.0149379968643188, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.069802649319172, "clip_ratio/low_mean": 0.07182778418064117, "clip_ratio/low_min": 0.07182778418064117, "clip_ratio/high_mean": 0.1115767490118742, "clip_ratio/high_max": 0.1115767490118742, "clip_ratio/region_mean": 0.18340453319251537, "reward_total_mean": 0.2845801115036011, "reward_meter_mean": 0.587675929069519, "reward_meter_std": 0.37471726536750793, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9642857313156128, "reward_lexical_plausibility_std": 0.10101525485515594, "reward_repeat_penalty_mean": 0.9389331340789795, "reward_repeat_penalty_std": 0.06536339968442917, "reward_repeat_floor_mean": 0.9920876622200012, "reward_repeat_floor_std": 0.008928068913519382, "reward_near_duplicate_penalty_mean": 0.9615490436553955, "reward_near_duplicate_penalty_std": 0.05235946550965309, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9761699438095093, "reward_distinct_2_std": 0.03302708640694618, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.2845801115036011, "reward_total_composite_std": 0.20437119901180267} {"timestamp_utc": "2026-04-12T18:07:21Z", "mode": "train", "global_step": 592, "epoch": 0.031156254933950845, "loss": 0.021, "grad_norm": 18.695114135742188, "learning_rate": 8.20909090909091e-06, "num_tokens": 1093785.0, "completions/mean_length": 41.625, "completions/min_length": 35.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.625, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.147118479013443, "rewards/meter/std": 0.22690625488758087, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.731249988079071, "rewards/judge_quality/std": 0.2623213827610016, "rewards/repeat_penalty/mean": 0.9846284985542297, "rewards/repeat_penalty/std": 0.029142936691641808, "rewards/repeat_floor/mean": 0.9981726408004761, "rewards/repeat_floor/std": 0.0031048913951963186, "rewards/near_duplicate_penalty/mean": 0.9928339719772339, "rewards/near_duplicate_penalty/std": 0.009780322201550007, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.10930247604846954, "rewards/total_composite/std": 0.20511575043201447, "reward": 0.10930247604846954, "reward_std": 0.20511573553085327, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16905662417411804, "sampling/sampling_logp_difference/max": 1.3927001953125, "sampling/importance_sampling_ratio/min": 0.2484036535024643, "sampling/importance_sampling_ratio/mean": 1.0127214193344116, "sampling/importance_sampling_ratio/max": 1.9360523223876953, "entropy": 1.1897085085511208, "clip_ratio/low_mean": 0.059014896396547556, "clip_ratio/low_min": 0.059014896396547556, "clip_ratio/high_mean": 0.03730158880352974, "clip_ratio/high_max": 0.03730158880352974, "clip_ratio/region_mean": 0.0963164852000773, "reward_total_mean": 0.10930247604846954, "reward_meter_mean": 0.147118479013443, "reward_meter_std": 0.22690625488758087, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9846284985542297, "reward_repeat_penalty_std": 0.029142936691641808, "reward_repeat_floor_mean": 0.9981726408004761, "reward_repeat_floor_std": 0.0031048913951963186, "reward_near_duplicate_penalty_mean": 0.9928339719772339, "reward_near_duplicate_penalty_std": 0.009780322201550007, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.731249988079071, "reward_judge_quality_std": 0.2623213827610016, "reward_total_composite_mean": 0.10930247604846954, "reward_total_composite_std": 0.20511575043201447} {"timestamp_utc": "2026-04-12T18:07:29Z", "mode": "train", "global_step": 593, "epoch": 0.031208883742960897, "loss": 0.0997, "grad_norm": 23.939882278442383, "learning_rate": 8.206060606060607e-06, "num_tokens": 1095159.0, "completions/mean_length": 23.75, "completions/min_length": 17.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.75, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.9602457284927368, "rewards/meter/std": 0.0740094780921936, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9771242141723633, "rewards/lexical_plausibility/std": 0.0647025778889656, "rewards/judge_quality/mean": 0.706250011920929, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6635200381278992, "rewards/total_composite/std": 0.2914673686027527, "reward": 0.6635200381278992, "reward_std": 0.2914673686027527, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19499801099300385, "sampling/sampling_logp_difference/max": 1.6875286102294922, "sampling/importance_sampling_ratio/min": 0.30928120017051697, "sampling/importance_sampling_ratio/mean": 1.0430655479431152, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4827243760228157, "clip_ratio/low_mean": 0.05938390363007784, "clip_ratio/low_min": 0.05938390363007784, "clip_ratio/high_mean": 0.11629943223670125, "clip_ratio/high_max": 0.11629943223670125, "clip_ratio/region_mean": 0.1756833358667791, "reward_total_mean": 0.6635200381278992, "reward_meter_mean": 0.9602457284927368, "reward_meter_std": 0.0740094780921936, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9771242141723633, "reward_lexical_plausibility_std": 0.0647025778889656, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.706250011920929, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.6635200381278992, "reward_total_composite_std": 0.2914673686027527} {"timestamp_utc": "2026-04-12T18:07:40Z", "mode": "train", "global_step": 594, "epoch": 0.031261512551970946, "loss": 0.0272, "grad_norm": 5.911684989929199, "learning_rate": 8.203030303030304e-06, "num_tokens": 1098190.0, "completions/mean_length": 207.875, "completions/min_length": 183.0, "completions/max_length": 228.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 207.875, "completions/min_terminated_length": 183.0, "completions/max_terminated_length": 228.0, "rewards/meter/mean": 0.9815651178359985, "rewards/meter/std": 0.020114127546548843, "rewards/count_adherence/mean": 0.7678571343421936, "rewards/count_adherence/std": 0.07393559068441391, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9303570985794067, "rewards/count_floor/std": 0.02218066342175007, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.2147345095872879, "rewards/repeat_penalty/std": 0.23416870832443237, "rewards/repeat_floor/mean": 0.9049199819564819, "rewards/repeat_floor/std": 0.03535691276192665, "rewards/near_duplicate_penalty/mean": 0.822540283203125, "rewards/near_duplicate_penalty/std": 0.0837874487042427, "rewards/opening_diversity/mean": 0.9546568393707275, "rewards/opening_diversity/std": 0.08771829307079315, "rewards/distinct_2/mean": 0.26955029368400574, "rewards/distinct_2/std": 0.24233220517635345, "rewards/total_composite/mean": 0.27052873373031616, "rewards/total_composite/std": 0.06528563797473907, "reward": 0.27052873373031616, "reward_std": 0.06528563052415848, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10569387674331665, "sampling/sampling_logp_difference/max": 2.49171781539917, "sampling/importance_sampling_ratio/min": 0.08276766538619995, "sampling/importance_sampling_ratio/mean": 0.9955204725265503, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6036545783281326, "clip_ratio/low_mean": 0.008064515888690948, "clip_ratio/low_min": 0.008064515888690948, "clip_ratio/high_mean": 0.09638627106323838, "clip_ratio/high_max": 0.09638627106323838, "clip_ratio/region_mean": 0.10445078695192933, "reward_total_mean": 0.27052873373031616, "reward_meter_mean": 0.9815651178359985, "reward_meter_std": 0.020114127546548843, "reward_count_adherence_mean": 0.7678571343421936, "reward_count_adherence_std": 0.07393559068441391, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9303570985794067, "reward_count_floor_std": 0.02218066342175007, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.2147345095872879, "reward_repeat_penalty_std": 0.23416870832443237, "reward_repeat_floor_mean": 0.9049199819564819, "reward_repeat_floor_std": 0.03535691276192665, "reward_near_duplicate_penalty_mean": 0.822540283203125, "reward_near_duplicate_penalty_std": 0.0837874487042427, "reward_opening_diversity_mean": 0.9546568393707275, "reward_opening_diversity_std": 0.08771829307079315, "reward_distinct_2_mean": 0.26955029368400574, "reward_distinct_2_std": 0.24233220517635345, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.27052873373031616, "reward_total_composite_std": 0.06528563797473907} {"timestamp_utc": "2026-04-12T18:07:47Z", "mode": "train", "global_step": 595, "epoch": 0.031314141360981, "loss": 0.1301, "grad_norm": 16.424837112426758, "learning_rate": 8.2e-06, "num_tokens": 1099864.0, "completions/mean_length": 39.25, "completions/min_length": 34.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.25, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.4144309461116791, "rewards/meter/std": 0.3266526162624359, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.7312500476837158, "rewards/judge_quality/std": 0.3589046001434326, "rewards/repeat_penalty/mean": 0.9873858690261841, "rewards/repeat_penalty/std": 0.014483274891972542, "rewards/repeat_floor/mean": 0.99810791015625, "rewards/repeat_floor/std": 0.0021724931430071592, "rewards/near_duplicate_penalty/mean": 0.9873858690261841, "rewards/near_duplicate_penalty/std": 0.014483274891972542, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.31065911054611206, "rewards/total_composite/std": 0.33523043990135193, "reward": 0.31065911054611206, "reward_std": 0.33523041009902954, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19718889892101288, "sampling/sampling_logp_difference/max": 2.0223336219787598, "sampling/importance_sampling_ratio/min": 0.1323462575674057, "sampling/importance_sampling_ratio/mean": 1.0170778036117554, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8910216242074966, "clip_ratio/low_mean": 0.09677564026787877, "clip_ratio/low_min": 0.09677564026787877, "clip_ratio/high_mean": 0.06555268634110689, "clip_ratio/high_max": 0.06555268634110689, "clip_ratio/region_mean": 0.16232832660898566, "reward_total_mean": 0.31065911054611206, "reward_meter_mean": 0.4144309461116791, "reward_meter_std": 0.3266526162624359, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9873858690261841, "reward_repeat_penalty_std": 0.014483274891972542, "reward_repeat_floor_mean": 0.99810791015625, "reward_repeat_floor_std": 0.0021724931430071592, "reward_near_duplicate_penalty_mean": 0.9873858690261841, "reward_near_duplicate_penalty_std": 0.014483274891972542, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7312500476837158, "reward_judge_quality_std": 0.3589046001434326, "reward_total_composite_mean": 0.31065911054611206, "reward_total_composite_std": 0.33523043990135193} {"timestamp_utc": "2026-04-12T18:07:56Z", "mode": "train", "global_step": 596, "epoch": 0.03136677016999105, "loss": 0.0465, "grad_norm": 16.912214279174805, "learning_rate": 8.196969696969698e-06, "num_tokens": 1101336.0, "completions/mean_length": 44.0, "completions/min_length": 40.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.0, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.7226223349571228, "rewards/meter/std": 0.32787397503852844, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.78125, "rewards/judge_quality/std": 0.2126995027065277, "rewards/repeat_penalty/mean": 0.9540501236915588, "rewards/repeat_penalty/std": 0.08837031573057175, "rewards/repeat_floor/mean": 0.9942610859870911, "rewards/repeat_floor/std": 0.010143347084522247, "rewards/near_duplicate_penalty/mean": 0.976163387298584, "rewards/near_duplicate_penalty/std": 0.03246826305985451, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9759615659713745, "rewards/distinct_2/std": 0.06799104809761047, "rewards/total_composite/mean": 0.5714898705482483, "rewards/total_composite/std": 0.30262914299964905, "reward": 0.5714898705482483, "reward_std": 0.30262914299964905, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1931528002023697, "sampling/sampling_logp_difference/max": 1.415879249572754, "sampling/importance_sampling_ratio/min": 0.2427121251821518, "sampling/importance_sampling_ratio/mean": 0.9944076538085938, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1498000472784042, "clip_ratio/low_mean": 0.050173611380159855, "clip_ratio/low_min": 0.050173611380159855, "clip_ratio/high_mean": 0.12886305153369904, "clip_ratio/high_max": 0.12886305153369904, "clip_ratio/region_mean": 0.1790366629138589, "reward_total_mean": 0.5714898705482483, "reward_meter_mean": 0.7226223349571228, "reward_meter_std": 0.32787397503852844, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9540501236915588, "reward_repeat_penalty_std": 0.08837031573057175, "reward_repeat_floor_mean": 0.9942610859870911, "reward_repeat_floor_std": 0.010143347084522247, "reward_near_duplicate_penalty_mean": 0.976163387298584, "reward_near_duplicate_penalty_std": 0.03246826305985451, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9759615659713745, "reward_distinct_2_std": 0.06799104809761047, "reward_judge_quality_mean": 0.78125, "reward_judge_quality_std": 0.2126995027065277, "reward_total_composite_mean": 0.5714898705482483, "reward_total_composite_std": 0.30262914299964905} {"timestamp_utc": "2026-04-12T18:08:10Z", "mode": "train", "global_step": 597, "epoch": 0.031419398979001104, "loss": -0.069, "grad_norm": 6.055530071258545, "learning_rate": 8.193939393939394e-06, "num_tokens": 1103138.0, "completions/mean_length": 128.25, "completions/min_length": 62.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 73.42857360839844, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.6486878395080566, "rewards/meter/std": 0.41599565744400024, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.9223067760467529, "rewards/lexical_plausibility/std": 0.21974965929985046, "rewards/judge_quality/mean": 0.48375001549720764, "rewards/judge_quality/std": 0.30514341592788696, "rewards/repeat_penalty/mean": 0.9840086698532104, "rewards/repeat_penalty/std": 0.024673406034708023, "rewards/repeat_floor/mean": 0.9979274272918701, "rewards/repeat_floor/std": 0.0028727182652801275, "rewards/near_duplicate_penalty/mean": 0.9896791577339172, "rewards/near_duplicate_penalty/std": 0.011669785715639591, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9941724538803101, "rewards/distinct_2/std": 0.016482684761285782, "rewards/total_composite/mean": 0.259575217962265, "rewards/total_composite/std": 0.24509544670581818, "reward": 0.259575217962265, "reward_std": 0.24509546160697937, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16639792919158936, "sampling/sampling_logp_difference/max": 2.0793254375457764, "sampling/importance_sampling_ratio/min": 0.1250145137310028, "sampling/importance_sampling_ratio/mean": 1.0385816097259521, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1286614760756493, "clip_ratio/low_mean": 0.07283814251422882, "clip_ratio/low_min": 0.07283814251422882, "clip_ratio/high_mean": 0.08682319335639477, "clip_ratio/high_max": 0.08682319335639477, "clip_ratio/region_mean": 0.1596613358706236, "reward_total_mean": 0.259575217962265, "reward_meter_mean": 0.6486878395080566, "reward_meter_std": 0.41599565744400024, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.9223067760467529, "reward_lexical_plausibility_std": 0.21974965929985046, "reward_repeat_penalty_mean": 0.9840086698532104, "reward_repeat_penalty_std": 0.024673406034708023, "reward_repeat_floor_mean": 0.9979274272918701, "reward_repeat_floor_std": 0.0028727182652801275, "reward_near_duplicate_penalty_mean": 0.9896791577339172, "reward_near_duplicate_penalty_std": 0.011669785715639591, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9941724538803101, "reward_distinct_2_std": 0.016482684761285782, "reward_judge_quality_mean": 0.48375001549720764, "reward_judge_quality_std": 0.30514341592788696, "reward_total_composite_mean": 0.259575217962265, "reward_total_composite_std": 0.24509544670581818} {"timestamp_utc": "2026-04-12T18:08:25Z", "mode": "train", "global_step": 598, "epoch": 0.031472027788011156, "loss": -0.2691, "grad_norm": 2.5904784202575684, "learning_rate": 8.190909090909091e-06, "num_tokens": 1105898.0, "completions/mean_length": 271.0, "completions/min_length": 172.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 190.6666717529297, "completions/min_terminated_length": 172.0, "completions/max_terminated_length": 203.0, "rewards/meter/mean": 0.9814270734786987, "rewards/meter/std": 0.015045571140944958, "rewards/count_adherence/mean": 0.7857142686843872, "rewards/count_adherence/std": 0.3148418068885803, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9357142448425293, "rewards/count_floor/std": 0.09445255249738693, "rewards/lexical_plausibility/mean": 0.9016356468200684, "rewards/lexical_plausibility/std": 0.15866655111312866, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.486883282661438, "rewards/repeat_penalty/std": 0.3581705093383789, "rewards/repeat_floor/mean": 0.9371234774589539, "rewards/repeat_floor/std": 0.05329469218850136, "rewards/near_duplicate_penalty/mean": 0.8602719306945801, "rewards/near_duplicate_penalty/std": 0.13260896503925323, "rewards/opening_diversity/mean": 0.8804687261581421, "rewards/opening_diversity/std": 0.15589021146297455, "rewards/distinct_2/mean": 0.6139395236968994, "rewards/distinct_2/std": 0.3230123817920685, "rewards/total_composite/mean": 0.23201525211334229, "rewards/total_composite/std": 0.12587951123714447, "reward": 0.23201525211334229, "reward_std": 0.12587951123714447, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13244052231311798, "sampling/sampling_logp_difference/max": 2.8504509925842285, "sampling/importance_sampling_ratio/min": 0.05781824141740799, "sampling/importance_sampling_ratio/mean": 1.0080112218856812, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6020743548870087, "clip_ratio/low_mean": 0.012354651466012001, "clip_ratio/low_min": 0.012354651466012001, "clip_ratio/high_mean": 0.091948670335114, "clip_ratio/high_max": 0.091948670335114, "clip_ratio/region_mean": 0.104303321801126, "reward_total_mean": 0.23201525211334229, "reward_meter_mean": 0.9814270734786987, "reward_meter_std": 0.015045571140944958, "reward_count_adherence_mean": 0.7857142686843872, "reward_count_adherence_std": 0.3148418068885803, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9357142448425293, "reward_count_floor_std": 0.09445255249738693, "reward_lexical_plausibility_mean": 0.9016356468200684, "reward_lexical_plausibility_std": 0.15866655111312866, "reward_repeat_penalty_mean": 0.486883282661438, "reward_repeat_penalty_std": 0.3581705093383789, "reward_repeat_floor_mean": 0.9371234774589539, "reward_repeat_floor_std": 0.05329469218850136, "reward_near_duplicate_penalty_mean": 0.8602719306945801, "reward_near_duplicate_penalty_std": 0.13260896503925323, "reward_opening_diversity_mean": 0.8804687261581421, "reward_opening_diversity_std": 0.15589021146297455, "reward_distinct_2_mean": 0.6139395236968994, "reward_distinct_2_std": 0.3230123817920685, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.23201525211334229, "reward_total_composite_std": 0.12587951123714447} {"timestamp_utc": "2026-04-12T18:08:33Z", "mode": "train", "global_step": 599, "epoch": 0.03152465659702121, "loss": 0.1166, "grad_norm": 23.549551010131836, "learning_rate": 8.187878787878788e-06, "num_tokens": 1107294.0, "completions/mean_length": 21.5, "completions/min_length": 17.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.5, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.7523049116134644, "rewards/meter/std": 0.31828737258911133, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.2889884114265442, "rewards/repeat_penalty/mean": 0.6145009994506836, "rewards/repeat_penalty/std": 0.25493043661117554, "rewards/repeat_floor/mean": 0.960392951965332, "rewards/repeat_floor/std": 0.044148046523332596, "rewards/near_duplicate_penalty/mean": 0.8849912285804749, "rewards/near_duplicate_penalty/std": 0.16451109945774078, "rewards/opening_diversity/mean": 0.65625, "rewards/opening_diversity/std": 0.2651650309562683, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.2985857129096985, "rewards/total_composite/std": 0.20206375420093536, "reward": 0.2985857129096985, "reward_std": 0.20206372439861298, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18337790668010712, "sampling/sampling_logp_difference/max": 1.7136726379394531, "sampling/importance_sampling_ratio/min": 0.18020275235176086, "sampling/importance_sampling_ratio/mean": 1.0237829685211182, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1202788725495338, "clip_ratio/low_mean": 0.027953165117651224, "clip_ratio/low_min": 0.027953165117651224, "clip_ratio/high_mean": 0.09070870745927095, "clip_ratio/high_max": 0.09070870745927095, "clip_ratio/region_mean": 0.11866187257692218, "reward_total_mean": 0.2985857129096985, "reward_meter_mean": 0.7523049116134644, "reward_meter_std": 0.31828737258911133, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6145009994506836, "reward_repeat_penalty_std": 0.25493043661117554, "reward_repeat_floor_mean": 0.960392951965332, "reward_repeat_floor_std": 0.044148046523332596, "reward_near_duplicate_penalty_mean": 0.8849912285804749, "reward_near_duplicate_penalty_std": 0.16451109945774078, "reward_opening_diversity_mean": 0.65625, "reward_opening_diversity_std": 0.2651650309562683, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.2889884114265442, "reward_total_composite_mean": 0.2985857129096985, "reward_total_composite_std": 0.20206375420093536} {"timestamp_utc": "2026-04-12T18:08:48Z", "mode": "train", "global_step": 600, "epoch": 0.03157728540603126, "loss": -0.035, "grad_norm": 6.604052543640137, "learning_rate": 8.184848484848486e-06, "num_tokens": 1108936.0, "completions/mean_length": 109.25, "completions/min_length": 39.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.71428680419922, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.3260256052017212, "rewards/meter/std": 0.3266305923461914, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.2519763112068176, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.07559289783239365, "rewards/lexical_plausibility/mean": 0.9401394724845886, "rewards/lexical_plausibility/std": 0.16931118071079254, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.27614372968673706, "rewards/repeat_penalty/mean": 0.9594191908836365, "rewards/repeat_penalty/std": 0.08538877964019775, "rewards/repeat_floor/mean": 0.99672532081604, "rewards/repeat_floor/std": 0.005039273761212826, "rewards/near_duplicate_penalty/mean": 0.9906691908836365, "rewards/near_duplicate_penalty/std": 0.012051167897880077, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1640865057706833, "rewards/total_composite/std": 0.19193319976329803, "reward": 0.1640865057706833, "reward_std": 0.19193319976329803, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1753326654434204, "sampling/sampling_logp_difference/max": 1.8509302139282227, "sampling/importance_sampling_ratio/min": 0.15709097683429718, "sampling/importance_sampling_ratio/mean": 1.0242491960525513, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1086146757006645, "clip_ratio/low_mean": 0.07389158569276333, "clip_ratio/low_min": 0.07389158569276333, "clip_ratio/high_mean": 0.0506847333163023, "clip_ratio/high_max": 0.0506847333163023, "clip_ratio/region_mean": 0.12457631900906563, "reward_total_mean": 0.1640865057706833, "reward_meter_mean": 0.3260256052017212, "reward_meter_std": 0.3266305923461914, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.2519763112068176, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.07559289783239365, "reward_lexical_plausibility_mean": 0.9401394724845886, "reward_lexical_plausibility_std": 0.16931118071079254, "reward_repeat_penalty_mean": 0.9594191908836365, "reward_repeat_penalty_std": 0.08538877964019775, "reward_repeat_floor_mean": 0.99672532081604, "reward_repeat_floor_std": 0.005039273761212826, "reward_near_duplicate_penalty_mean": 0.9906691908836365, "reward_near_duplicate_penalty_std": 0.012051167897880077, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.27614372968673706, "reward_total_composite_mean": 0.1640865057706833, "reward_total_composite_std": 0.19193319976329803} {"timestamp_utc": "2026-04-12T18:11:21Z", "mode": "eval", "global_step": 600, "epoch": 0.03157728540603126, "eval_loss": NaN, "eval_runtime": 153.7922, "eval_samples_per_second": 0.676, "eval_steps_per_second": 0.085, "eval_num_tokens": 1108936.0, "eval_completions/mean_length": 216.35576923076923, "eval_completions/min_length": 51.0, "eval_completions/max_length": 489.2307692307692, "eval_completions/clipped_ratio": 0.15384615384615385, "eval_completions/mean_terminated_length": 161.36337338961087, "eval_completions/min_terminated_length": 51.0, "eval_completions/max_terminated_length": 337.0, "eval_rewards/meter/mean": 0.5323957594541403, "eval_rewards/meter/std": 0.3750814680869763, "eval_rewards/count_adherence/mean": 0.8576028759662921, "eval_rewards/count_adherence/std": 0.19899147462386352, "eval_rewards/arabic_clean/mean": 0.8076923076923077, "eval_rewards/arabic_clean/std": 0.39691325105153596, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9971153827813956, "eval_rewards/arabic_floor/std": 0.008158923341677738, "eval_rewards/count_floor/mean": 0.957280851327456, "eval_rewards/count_floor/std": 0.0596974457685764, "eval_rewards/lexical_plausibility/mean": 0.944066753754249, "eval_rewards/lexical_plausibility/std": 0.12990799660866076, "eval_rewards/judge_quality/mean": 0.34480769015275514, "eval_rewards/judge_quality/std": 0.2326679011950126, "eval_rewards/repeat_penalty/mean": 0.6714496314525604, "eval_rewards/repeat_penalty/std": 0.33662569580169827, "eval_rewards/repeat_floor/mean": 0.9596992272597092, "eval_rewards/repeat_floor/std": 0.04648636933416128, "eval_rewards/near_duplicate_penalty/mean": 0.9150083982027494, "eval_rewards/near_duplicate_penalty/std": 0.10893321180572876, "eval_rewards/opening_diversity/mean": 0.96364092368346, "eval_rewards/opening_diversity/std": 0.07593007643635456, "eval_rewards/distinct_2/mean": 0.7181056050153879, "eval_rewards/distinct_2/std": 0.3324068910800494, "eval_rewards/total_composite/mean": 0.16826352018576402, "eval_rewards/total_composite/std": 0.16927679972006723, "eval_reward": 0.16826352018576402, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.0662076072050975, "eval_sampling/sampling_logp_difference/max": 1.1472235459547777, "eval_sampling/importance_sampling_ratio/min": 0.3202722118451045, "eval_sampling/importance_sampling_ratio/mean": 1.01552990766672, "eval_sampling/importance_sampling_ratio/max": 1.5114481632526104, "eval_entropy": 0.7519237811748798, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.16826352018576402, "eval_reward_meter_mean": 0.5323957594541403, "eval_reward_meter_std": 0.3750814680869763, "eval_reward_count_adherence_mean": 0.8576028759662921, "eval_reward_count_adherence_std": 0.19899147462386352, "eval_reward_arabic_clean_mean": 0.8076923076923077, "eval_reward_arabic_clean_std": 0.39691325105153596, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9971153827813956, "eval_reward_arabic_floor_std": 0.008158923341677738, "eval_reward_count_floor_mean": 0.957280851327456, "eval_reward_count_floor_std": 0.0596974457685764, "eval_reward_lexical_plausibility_mean": 0.944066753754249, "eval_reward_lexical_plausibility_std": 0.12990799660866076, "eval_reward_repeat_penalty_mean": 0.6714496314525604, "eval_reward_repeat_penalty_std": 0.33662569580169827, "eval_reward_repeat_floor_mean": 0.9596992272597092, "eval_reward_repeat_floor_std": 0.04648636933416128, "eval_reward_near_duplicate_penalty_mean": 0.9150083982027494, "eval_reward_near_duplicate_penalty_std": 0.10893321180572876, "eval_reward_opening_diversity_mean": 0.96364092368346, "eval_reward_opening_diversity_std": 0.07593007643635456, "eval_reward_distinct_2_mean": 0.7181056050153879, "eval_reward_distinct_2_std": 0.3324068910800494, "eval_reward_judge_quality_mean": 0.34480769015275514, "eval_reward_judge_quality_std": 0.2326679011950126, "eval_reward_total_composite_mean": 0.16826352018576402, "eval_reward_total_composite_std": 0.16927679972006723} {"timestamp_utc": "2026-04-12T18:11:38Z", "mode": "train", "global_step": 601, "epoch": 0.03162991421504131, "loss": -0.1004, "grad_norm": 4.635842323303223, "learning_rate": 8.181818181818183e-06, "num_tokens": 1110662.0, "completions/mean_length": 110.75, "completions/min_length": 42.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 53.42857360839844, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.8872721791267395, "rewards/meter/std": 0.20902809500694275, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9427574872970581, "rewards/lexical_plausibility/std": 0.16190630197525024, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.9237461090087891, "rewards/repeat_penalty/std": 0.16513754427433014, "rewards/repeat_floor/mean": 0.9914565682411194, "rewards/repeat_floor/std": 0.018150677904486656, "rewards/near_duplicate_penalty/mean": 0.9758385419845581, "rewards/near_duplicate_penalty/std": 0.04522961378097534, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9661751389503479, "rewards/distinct_2/std": 0.07171893119812012, "rewards/total_composite/mean": 0.30826202034950256, "rewards/total_composite/std": 0.1486935317516327, "reward": 0.30826202034950256, "reward_std": 0.1486935168504715, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15270750224590302, "sampling/sampling_logp_difference/max": 1.7838517427444458, "sampling/importance_sampling_ratio/min": 0.1679898500442505, "sampling/importance_sampling_ratio/mean": 1.0060399770736694, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8088917434215546, "clip_ratio/low_mean": 0.025216706097126007, "clip_ratio/low_min": 0.025216706097126007, "clip_ratio/high_mean": 0.11960294283926487, "clip_ratio/high_max": 0.11960294283926487, "clip_ratio/region_mean": 0.14481964893639088, "reward_total_mean": 0.30826202034950256, "reward_meter_mean": 0.8872721791267395, "reward_meter_std": 0.20902809500694275, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9427574872970581, "reward_lexical_plausibility_std": 0.16190630197525024, "reward_repeat_penalty_mean": 0.9237461090087891, "reward_repeat_penalty_std": 0.16513754427433014, "reward_repeat_floor_mean": 0.9914565682411194, "reward_repeat_floor_std": 0.018150677904486656, "reward_near_duplicate_penalty_mean": 0.9758385419845581, "reward_near_duplicate_penalty_std": 0.04522961378097534, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9661751389503479, "reward_distinct_2_std": 0.07171893119812012, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.30826202034950256, "reward_total_composite_std": 0.1486935317516327} {"timestamp_utc": "2026-04-12T18:11:53Z", "mode": "train", "global_step": 602, "epoch": 0.031682543024051366, "loss": -0.0564, "grad_norm": 4.765085220336914, "learning_rate": 8.17878787878788e-06, "num_tokens": 1113831.0, "completions/mean_length": 243.125, "completions/min_length": 176.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 204.71429443359375, "completions/min_terminated_length": 176.0, "completions/max_terminated_length": 236.0, "rewards/meter/mean": 0.9532607197761536, "rewards/meter/std": 0.0884724035859108, "rewards/count_adherence/mean": 0.984375, "rewards/count_adherence/std": 0.04419417306780815, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.995312511920929, "rewards/count_floor/std": 0.013258260674774647, "rewards/lexical_plausibility/mean": 0.9606354236602783, "rewards/lexical_plausibility/std": 0.0829610824584961, "rewards/judge_quality/mean": 0.35874998569488525, "rewards/judge_quality/std": 0.2547512948513031, "rewards/repeat_penalty/mean": 0.5961198806762695, "rewards/repeat_penalty/std": 0.35815364122390747, "rewards/repeat_floor/mean": 0.950096845626831, "rewards/repeat_floor/std": 0.05337326228618622, "rewards/near_duplicate_penalty/mean": 0.9005410075187683, "rewards/near_duplicate_penalty/std": 0.11840029805898666, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.6321191787719727, "rewards/distinct_2/std": 0.35908475518226624, "rewards/total_composite/mean": 0.31084227561950684, "rewards/total_composite/std": 0.18292604386806488, "reward": 0.31084227561950684, "reward_std": 0.1829260289669037, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13875505328178406, "sampling/sampling_logp_difference/max": 1.8511505126953125, "sampling/importance_sampling_ratio/min": 0.15705636143684387, "sampling/importance_sampling_ratio/mean": 1.015142798423767, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7933779545128345, "clip_ratio/low_mean": 0.01934338128194213, "clip_ratio/low_min": 0.01934338128194213, "clip_ratio/high_mean": 0.08638909179717302, "clip_ratio/high_max": 0.08638909179717302, "clip_ratio/region_mean": 0.10573247307911515, "reward_total_mean": 0.31084227561950684, "reward_meter_mean": 0.9532607197761536, "reward_meter_std": 0.0884724035859108, "reward_count_adherence_mean": 0.984375, "reward_count_adherence_std": 0.04419417306780815, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.995312511920929, "reward_count_floor_std": 0.013258260674774647, "reward_lexical_plausibility_mean": 0.9606354236602783, "reward_lexical_plausibility_std": 0.0829610824584961, "reward_repeat_penalty_mean": 0.5961198806762695, "reward_repeat_penalty_std": 0.35815364122390747, "reward_repeat_floor_mean": 0.950096845626831, "reward_repeat_floor_std": 0.05337326228618622, "reward_near_duplicate_penalty_mean": 0.9005410075187683, "reward_near_duplicate_penalty_std": 0.11840029805898666, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.6321191787719727, "reward_distinct_2_std": 0.35908475518226624, "reward_judge_quality_mean": 0.35874998569488525, "reward_judge_quality_std": 0.2547512948513031, "reward_total_composite_mean": 0.31084227561950684, "reward_total_composite_std": 0.18292604386806488} {"timestamp_utc": "2026-04-12T18:12:06Z", "mode": "train", "global_step": 603, "epoch": 0.03173517183306142, "loss": -0.067, "grad_norm": 2.303831100463867, "learning_rate": 8.175757575757577e-06, "num_tokens": 1115309.0, "completions/mean_length": 285.75, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 59.5, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.40588515996932983, "rewards/meter/std": 0.4129186272621155, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.24800792336463928, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.07440238445997238, "rewards/lexical_plausibility/mean": 0.723495364189148, "rewards/lexical_plausibility/std": 0.2994970977306366, "rewards/judge_quality/mean": 0.24375000596046448, "rewards/judge_quality/std": 0.22109711170196533, "rewards/repeat_penalty/mean": 0.9916864633560181, "rewards/repeat_penalty/std": 0.00821265671402216, "rewards/repeat_floor/mean": 0.9987529516220093, "rewards/repeat_floor/std": 0.0012319015804678202, "rewards/near_duplicate_penalty/mean": 0.9916864633560181, "rewards/near_duplicate_penalty/std": 0.00821265671402216, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1255316138267517, "rewards/total_composite/std": 0.16291792690753937, "reward": 0.1255316138267517, "reward_std": 0.16291794180870056, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19537453353405, "sampling/sampling_logp_difference/max": 1.6980514526367188, "sampling/importance_sampling_ratio/min": 0.1830398440361023, "sampling/importance_sampling_ratio/mean": 1.0048465728759766, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7230313271284103, "clip_ratio/low_mean": 0.027272727340459824, "clip_ratio/low_min": 0.027272727340459824, "clip_ratio/high_mean": 0.060100482776761055, "clip_ratio/high_max": 0.060100482776761055, "clip_ratio/region_mean": 0.08737321011722088, "reward_total_mean": 0.1255316138267517, "reward_meter_mean": 0.40588515996932983, "reward_meter_std": 0.4129186272621155, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.24800792336463928, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.07440238445997238, "reward_lexical_plausibility_mean": 0.723495364189148, "reward_lexical_plausibility_std": 0.2994970977306366, "reward_repeat_penalty_mean": 0.9916864633560181, "reward_repeat_penalty_std": 0.00821265671402216, "reward_repeat_floor_mean": 0.9987529516220093, "reward_repeat_floor_std": 0.0012319015804678202, "reward_near_duplicate_penalty_mean": 0.9916864633560181, "reward_near_duplicate_penalty_std": 0.00821265671402216, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.24375000596046448, "reward_judge_quality_std": 0.22109711170196533, "reward_total_composite_mean": 0.1255316138267517, "reward_total_composite_std": 0.16291792690753937} {"timestamp_utc": "2026-04-12T18:12:20Z", "mode": "train", "global_step": 604, "epoch": 0.03178780064207147, "loss": -0.1091, "grad_norm": 2.0855977535247803, "learning_rate": 8.172727272727273e-06, "num_tokens": 1116861.0, "completions/mean_length": 228.0, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 57.60000228881836, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.7371097207069397, "rewards/meter/std": 0.44047844409942627, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8000662326812744, "rewards/lexical_plausibility/std": 0.26414236426353455, "rewards/judge_quality/mean": 0.4650000035762787, "rewards/judge_quality/std": 0.40486329793930054, "rewards/repeat_penalty/mean": 0.9048452377319336, "rewards/repeat_penalty/std": 0.1098768338561058, "rewards/repeat_floor/mean": 0.990536630153656, "rewards/repeat_floor/std": 0.01118460576981306, "rewards/near_duplicate_penalty/mean": 0.9740300178527832, "rewards/near_duplicate_penalty/std": 0.04160391539335251, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9589678049087524, "rewards/distinct_2/std": 0.058639682829380035, "rewards/total_composite/mean": 0.4332438111305237, "rewards/total_composite/std": 0.3999243378639221, "reward": 0.4332438111305237, "reward_std": 0.3999243378639221, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1707833707332611, "sampling/sampling_logp_difference/max": 2.1452465057373047, "sampling/importance_sampling_ratio/min": 0.11703918129205704, "sampling/importance_sampling_ratio/mean": 1.0064518451690674, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.672496497631073, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.11224611662328243, "clip_ratio/high_max": 0.11224611662328243, "clip_ratio/region_mean": 0.11224611662328243, "reward_total_mean": 0.4332438111305237, "reward_meter_mean": 0.7371097207069397, "reward_meter_std": 0.44047844409942627, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8000662326812744, "reward_lexical_plausibility_std": 0.26414236426353455, "reward_repeat_penalty_mean": 0.9048452377319336, "reward_repeat_penalty_std": 0.1098768338561058, "reward_repeat_floor_mean": 0.990536630153656, "reward_repeat_floor_std": 0.01118460576981306, "reward_near_duplicate_penalty_mean": 0.9740300178527832, "reward_near_duplicate_penalty_std": 0.04160391539335251, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9589678049087524, "reward_distinct_2_std": 0.058639682829380035, "reward_judge_quality_mean": 0.4650000035762787, "reward_judge_quality_std": 0.40486329793930054, "reward_total_composite_mean": 0.4332438111305237, "reward_total_composite_std": 0.3999243378639221} {"timestamp_utc": "2026-04-12T18:12:28Z", "mode": "train", "global_step": 605, "epoch": 0.03184042945108152, "loss": 0.0512, "grad_norm": 15.98936939239502, "learning_rate": 8.16969696969697e-06, "num_tokens": 1118599.0, "completions/mean_length": 42.25, "completions/min_length": 32.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.25, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.8217613697052002, "rewards/meter/std": 0.25633203983306885, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6675000190734863, "rewards/judge_quality/std": 0.26162952184677124, "rewards/repeat_penalty/mean": 0.9919407367706299, "rewards/repeat_penalty/std": 0.014203781262040138, "rewards/repeat_floor/mean": 0.9987910985946655, "rewards/repeat_floor/std": 0.002130561973899603, "rewards/near_duplicate_penalty/mean": 0.9919407367706299, "rewards/near_duplicate_penalty/std": 0.014203781262040138, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5653389692306519, "rewards/total_composite/std": 0.2998788058757782, "reward": 0.5653389692306519, "reward_std": 0.2998788058757782, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1631499081850052, "sampling/sampling_logp_difference/max": 1.499321460723877, "sampling/importance_sampling_ratio/min": 0.2232816219329834, "sampling/importance_sampling_ratio/mean": 1.0280369520187378, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.960242934525013, "clip_ratio/low_mean": 0.07336647715419531, "clip_ratio/low_min": 0.07336647715419531, "clip_ratio/high_mean": 0.0735264215618372, "clip_ratio/high_max": 0.0735264215618372, "clip_ratio/region_mean": 0.1468928987160325, "reward_total_mean": 0.5653389692306519, "reward_meter_mean": 0.8217613697052002, "reward_meter_std": 0.25633203983306885, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9919407367706299, "reward_repeat_penalty_std": 0.014203781262040138, "reward_repeat_floor_mean": 0.9987910985946655, "reward_repeat_floor_std": 0.002130561973899603, "reward_near_duplicate_penalty_mean": 0.9919407367706299, "reward_near_duplicate_penalty_std": 0.014203781262040138, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6675000190734863, "reward_judge_quality_std": 0.26162952184677124, "reward_total_composite_mean": 0.5653389692306519, "reward_total_composite_std": 0.2998788058757782} {"timestamp_utc": "2026-04-12T18:12:38Z", "mode": "train", "global_step": 606, "epoch": 0.031893058260091575, "loss": 0.0967, "grad_norm": 15.18116283416748, "learning_rate": 8.166666666666668e-06, "num_tokens": 1120925.0, "completions/mean_length": 92.75, "completions/min_length": 80.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 92.75, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.7198826670646667, "rewards/meter/std": 0.34873974323272705, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9399999976158142, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.8551812767982483, "rewards/repeat_penalty/std": 0.2196132391691208, "rewards/repeat_floor/mean": 0.9843515753746033, "rewards/repeat_floor/std": 0.024235205724835396, "rewards/near_duplicate_penalty/mean": 0.9675413370132446, "rewards/near_duplicate_penalty/std": 0.04756621643900871, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9010597467422485, "rewards/distinct_2/std": 0.13354972004890442, "rewards/total_composite/mean": 0.25184184312820435, "rewards/total_composite/std": 0.14223897457122803, "reward": 0.25184184312820435, "reward_std": 0.14223895967006683, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1485327035188675, "sampling/sampling_logp_difference/max": 3.1874661445617676, "sampling/importance_sampling_ratio/min": 0.04127632826566696, "sampling/importance_sampling_ratio/mean": 1.0177041292190552, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7814310044050217, "clip_ratio/low_mean": 0.077626409009099, "clip_ratio/low_min": 0.077626409009099, "clip_ratio/high_mean": 0.06050986424088478, "clip_ratio/high_max": 0.06050986424088478, "clip_ratio/region_mean": 0.1381362732499838, "reward_total_mean": 0.25184184312820435, "reward_meter_mean": 0.7198826670646667, "reward_meter_std": 0.34873974323272705, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9399999976158142, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8551812767982483, "reward_repeat_penalty_std": 0.2196132391691208, "reward_repeat_floor_mean": 0.9843515753746033, "reward_repeat_floor_std": 0.024235205724835396, "reward_near_duplicate_penalty_mean": 0.9675413370132446, "reward_near_duplicate_penalty_std": 0.04756621643900871, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9010597467422485, "reward_distinct_2_std": 0.13354972004890442, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.25184184312820435, "reward_total_composite_std": 0.14223897457122803} {"timestamp_utc": "2026-04-12T18:12:51Z", "mode": "train", "global_step": 607, "epoch": 0.03194568706910163, "loss": -0.0557, "grad_norm": 2.7290549278259277, "learning_rate": 8.163636363636365e-06, "num_tokens": 1122338.0, "completions/mean_length": 160.625, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 43.5, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.8931992053985596, "rewards/meter/std": 0.15338252484798431, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8617154359817505, "rewards/lexical_plausibility/std": 0.21377067267894745, "rewards/judge_quality/mean": 0.39249998331069946, "rewards/judge_quality/std": 0.3495609760284424, "rewards/repeat_penalty/mean": 0.922041118144989, "rewards/repeat_penalty/std": 0.21444439888000488, "rewards/repeat_floor/mean": 0.9909240007400513, "rewards/repeat_floor/std": 0.0247652567923069, "rewards/near_duplicate_penalty/mean": 0.9820936918258667, "rewards/near_duplicate_penalty/std": 0.04483920335769653, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9498327970504761, "rewards/distinct_2/std": 0.14189434051513672, "rewards/total_composite/mean": 0.35684460401535034, "rewards/total_composite/std": 0.32566359639167786, "reward": 0.35684460401535034, "reward_std": 0.32566359639167786, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1367790251970291, "sampling/sampling_logp_difference/max": 0.940155029296875, "sampling/importance_sampling_ratio/min": 0.39056727290153503, "sampling/importance_sampling_ratio/mean": 1.0394681692123413, "sampling/importance_sampling_ratio/max": 1.8137564659118652, "entropy": 0.8101457133889198, "clip_ratio/low_mean": 0.06992868706583977, "clip_ratio/low_min": 0.06992868706583977, "clip_ratio/high_mean": 0.03372093103826046, "clip_ratio/high_max": 0.03372093103826046, "clip_ratio/region_mean": 0.10364961810410023, "reward_total_mean": 0.35684460401535034, "reward_meter_mean": 0.8931992053985596, "reward_meter_std": 0.15338252484798431, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8617154359817505, "reward_lexical_plausibility_std": 0.21377067267894745, "reward_repeat_penalty_mean": 0.922041118144989, "reward_repeat_penalty_std": 0.21444439888000488, "reward_repeat_floor_mean": 0.9909240007400513, "reward_repeat_floor_std": 0.0247652567923069, "reward_near_duplicate_penalty_mean": 0.9820936918258667, "reward_near_duplicate_penalty_std": 0.04483920335769653, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9498327970504761, "reward_distinct_2_std": 0.14189434051513672, "reward_judge_quality_mean": 0.39249998331069946, "reward_judge_quality_std": 0.3495609760284424, "reward_total_composite_mean": 0.35684460401535034, "reward_total_composite_std": 0.32566359639167786} {"timestamp_utc": "2026-04-12T18:12:59Z", "mode": "train", "global_step": 608, "epoch": 0.03199831587811168, "loss": 0.0396, "grad_norm": 24.5108699798584, "learning_rate": 8.16060606060606e-06, "num_tokens": 1123720.0, "completions/mean_length": 20.75, "completions/min_length": 15.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.75, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.7343016862869263, "rewards/meter/std": 0.3321674168109894, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9093136787414551, "rewards/lexical_plausibility/std": 0.12747789919376373, "rewards/judge_quality/mean": 0.7425000071525574, "rewards/judge_quality/std": 0.36593323945999146, "rewards/repeat_penalty/mean": 0.7312376499176025, "rewards/repeat_penalty/std": 0.034962061792612076, "rewards/repeat_floor/mean": 0.9812475442886353, "rewards/repeat_floor/std": 0.0069924150593578815, "rewards/near_duplicate_penalty/mean": 0.9749835729598999, "rewards/near_duplicate_penalty/std": 0.046616096049547195, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5027918815612793, "rewards/total_composite/std": 0.37425485253334045, "reward": 0.5027918815612793, "reward_std": 0.37425482273101807, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1717093288898468, "sampling/sampling_logp_difference/max": 1.0389184951782227, "sampling/importance_sampling_ratio/min": 0.37201645970344543, "sampling/importance_sampling_ratio/mean": 1.0298277139663696, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.262733832001686, "clip_ratio/low_mean": 0.11354167014360428, "clip_ratio/low_min": 0.11354167014360428, "clip_ratio/high_mean": 0.09123792918398976, "clip_ratio/high_max": 0.09123792918398976, "clip_ratio/region_mean": 0.20477959932759404, "reward_total_mean": 0.5027918815612793, "reward_meter_mean": 0.7343016862869263, "reward_meter_std": 0.3321674168109894, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9093136787414551, "reward_lexical_plausibility_std": 0.12747789919376373, "reward_repeat_penalty_mean": 0.7312376499176025, "reward_repeat_penalty_std": 0.034962061792612076, "reward_repeat_floor_mean": 0.9812475442886353, "reward_repeat_floor_std": 0.0069924150593578815, "reward_near_duplicate_penalty_mean": 0.9749835729598999, "reward_near_duplicate_penalty_std": 0.046616096049547195, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7425000071525574, "reward_judge_quality_std": 0.36593323945999146, "reward_total_composite_mean": 0.5027918815612793, "reward_total_composite_std": 0.37425485253334045} {"timestamp_utc": "2026-04-12T18:13:13Z", "mode": "train", "global_step": 609, "epoch": 0.03205094468712173, "loss": -0.0634, "grad_norm": 1.8359025716781616, "learning_rate": 8.15757575757576e-06, "num_tokens": 1125237.0, "completions/mean_length": 220.625, "completions/min_length": 42.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 45.79999923706055, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.5188621282577515, "rewards/meter/std": 0.38950106501579285, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8139591217041016, "rewards/lexical_plausibility/std": 0.25860437750816345, "rewards/judge_quality/mean": 0.41750001907348633, "rewards/judge_quality/std": 0.3612182140350342, "rewards/repeat_penalty/mean": 0.940185546875, "rewards/repeat_penalty/std": 0.08511374145746231, "rewards/repeat_floor/mean": 0.9955215454101562, "rewards/repeat_floor/std": 0.005360755138099194, "rewards/near_duplicate_penalty/mean": 0.9994557499885559, "rewards/near_duplicate_penalty/std": 0.001539413700811565, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9719797372817993, "rewards/distinct_2/std": 0.038789909332990646, "rewards/total_composite/mean": 0.27569475769996643, "rewards/total_composite/std": 0.29816851019859314, "reward": 0.27569475769996643, "reward_std": 0.29816851019859314, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12758906185626984, "sampling/sampling_logp_difference/max": 1.1533756256103516, "sampling/importance_sampling_ratio/min": 0.3155696988105774, "sampling/importance_sampling_ratio/mean": 1.0322290658950806, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5662923827767372, "clip_ratio/low_mean": 0.005681818351149559, "clip_ratio/low_min": 0.005681818351149559, "clip_ratio/high_mean": 0.05644345190376043, "clip_ratio/high_max": 0.05644345190376043, "clip_ratio/region_mean": 0.06212527025490999, "reward_total_mean": 0.27569475769996643, "reward_meter_mean": 0.5188621282577515, "reward_meter_std": 0.38950106501579285, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8139591217041016, "reward_lexical_plausibility_std": 0.25860437750816345, "reward_repeat_penalty_mean": 0.940185546875, "reward_repeat_penalty_std": 0.08511374145746231, "reward_repeat_floor_mean": 0.9955215454101562, "reward_repeat_floor_std": 0.005360755138099194, "reward_near_duplicate_penalty_mean": 0.9994557499885559, "reward_near_duplicate_penalty_std": 0.001539413700811565, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9719797372817993, "reward_distinct_2_std": 0.038789909332990646, "reward_judge_quality_mean": 0.41750001907348633, "reward_judge_quality_std": 0.3612182140350342, "reward_total_composite_mean": 0.27569475769996643, "reward_total_composite_std": 0.29816851019859314} {"timestamp_utc": "2026-04-12T18:13:22Z", "mode": "train", "global_step": 610, "epoch": 0.032103573496131785, "loss": 0.0595, "grad_norm": 15.591653823852539, "learning_rate": 8.154545454545455e-06, "num_tokens": 1126775.0, "completions/mean_length": 39.25, "completions/min_length": 34.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.25, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.2954864203929901, "rewards/meter/std": 0.3326808214187622, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.7220776081085205, "rewards/repeat_penalty/std": 0.2202475517988205, "rewards/repeat_floor/mean": 0.9659847021102905, "rewards/repeat_floor/std": 0.026132816448807716, "rewards/near_duplicate_penalty/mean": 0.8857450485229492, "rewards/near_duplicate_penalty/std": 0.06554435938596725, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8749772310256958, "rewards/distinct_2/std": 0.10805743932723999, "rewards/total_composite/mean": 0.12010689824819565, "rewards/total_composite/std": 0.1389647275209427, "reward": 0.12010689824819565, "reward_std": 0.1389647126197815, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.168714702129364, "sampling/sampling_logp_difference/max": 1.9937443733215332, "sampling/importance_sampling_ratio/min": 0.21070608496665955, "sampling/importance_sampling_ratio/mean": 1.0192890167236328, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9132148772478104, "clip_ratio/low_mean": 0.09924495033919811, "clip_ratio/low_min": 0.09924495033919811, "clip_ratio/high_mean": 0.04909370839595795, "clip_ratio/high_max": 0.04909370839595795, "clip_ratio/region_mean": 0.14833865873515606, "reward_total_mean": 0.12010689824819565, "reward_meter_mean": 0.2954864203929901, "reward_meter_std": 0.3326808214187622, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7220776081085205, "reward_repeat_penalty_std": 0.2202475517988205, "reward_repeat_floor_mean": 0.9659847021102905, "reward_repeat_floor_std": 0.026132816448807716, "reward_near_duplicate_penalty_mean": 0.8857450485229492, "reward_near_duplicate_penalty_std": 0.06554435938596725, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8749772310256958, "reward_distinct_2_std": 0.10805743932723999, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.12010689824819565, "reward_total_composite_std": 0.1389647275209427} {"timestamp_utc": "2026-04-12T18:13:36Z", "mode": "train", "global_step": 611, "epoch": 0.03215620230514184, "loss": -0.0121, "grad_norm": 5.054934501647949, "learning_rate": 8.151515151515152e-06, "num_tokens": 1128256.0, "completions/mean_length": 85.125, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 24.142858505249023, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.46992820501327515, "rewards/meter/std": 0.5011417865753174, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9052891135215759, "rewards/lexical_plausibility/std": 0.15319178998470306, "rewards/judge_quality/mean": 0.8112499713897705, "rewards/judge_quality/std": 0.3075914680957794, "rewards/repeat_penalty/mean": 0.765625, "rewards/repeat_penalty/std": 0.1043153703212738, "rewards/repeat_floor/mean": 0.9837499856948853, "rewards/repeat_floor/std": 0.010938146151602268, "rewards/near_duplicate_penalty/mean": 0.9791666269302368, "rewards/near_duplicate_penalty/std": 0.0589255727827549, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4230913519859314, "rewards/total_composite/std": 0.4512261748313904, "reward": 0.4230913519859314, "reward_std": 0.4512261748313904, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20187486708164215, "sampling/sampling_logp_difference/max": 2.3587756156921387, "sampling/importance_sampling_ratio/min": 0.09453590214252472, "sampling/importance_sampling_ratio/mean": 1.0098243951797485, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1807630136609077, "clip_ratio/low_mean": 0.08234926871955395, "clip_ratio/low_min": 0.08234926871955395, "clip_ratio/high_mean": 0.12944189086556435, "clip_ratio/high_max": 0.12944189086556435, "clip_ratio/region_mean": 0.2117911595851183, "reward_total_mean": 0.4230913519859314, "reward_meter_mean": 0.46992820501327515, "reward_meter_std": 0.5011417865753174, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9052891135215759, "reward_lexical_plausibility_std": 0.15319178998470306, "reward_repeat_penalty_mean": 0.765625, "reward_repeat_penalty_std": 0.1043153703212738, "reward_repeat_floor_mean": 0.9837499856948853, "reward_repeat_floor_std": 0.010938146151602268, "reward_near_duplicate_penalty_mean": 0.9791666269302368, "reward_near_duplicate_penalty_std": 0.0589255727827549, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8112499713897705, "reward_judge_quality_std": 0.3075914680957794, "reward_total_composite_mean": 0.4230913519859314, "reward_total_composite_std": 0.4512261748313904} {"timestamp_utc": "2026-04-12T18:13:50Z", "mode": "train", "global_step": 612, "epoch": 0.03220883111415189, "loss": -0.0659, "grad_norm": 5.352459907531738, "learning_rate": 8.14848484848485e-06, "num_tokens": 1129831.0, "completions/mean_length": 102.875, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 44.42857360839844, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.6945694088935852, "rewards/meter/std": 0.40696218609809875, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9336939454078674, "rewards/lexical_plausibility/std": 0.1490423083305359, "rewards/judge_quality/mean": 0.5387499928474426, "rewards/judge_quality/std": 0.3358757197856903, "rewards/repeat_penalty/mean": 0.9519752264022827, "rewards/repeat_penalty/std": 0.08429176360368729, "rewards/repeat_floor/mean": 0.9956088066101074, "rewards/repeat_floor/std": 0.005327679682523012, "rewards/near_duplicate_penalty/mean": 0.9832252264022827, "rewards/near_duplicate_penalty/std": 0.022154025733470917, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.41193124651908875, "rewards/total_composite/std": 0.3424032926559448, "reward": 0.41193124651908875, "reward_std": 0.34240326285362244, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17750002443790436, "sampling/sampling_logp_difference/max": 2.2086310386657715, "sampling/importance_sampling_ratio/min": 0.1098509281873703, "sampling/importance_sampling_ratio/mean": 1.017673134803772, "sampling/importance_sampling_ratio/max": 1.9343492984771729, "entropy": 1.1710313633084297, "clip_ratio/low_mean": 0.0570170315913856, "clip_ratio/low_min": 0.0570170315913856, "clip_ratio/high_mean": 0.04812834318727255, "clip_ratio/high_max": 0.04812834318727255, "clip_ratio/region_mean": 0.10514537477865815, "reward_total_mean": 0.41193124651908875, "reward_meter_mean": 0.6945694088935852, "reward_meter_std": 0.40696218609809875, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9336939454078674, "reward_lexical_plausibility_std": 0.1490423083305359, "reward_repeat_penalty_mean": 0.9519752264022827, "reward_repeat_penalty_std": 0.08429176360368729, "reward_repeat_floor_mean": 0.9956088066101074, "reward_repeat_floor_std": 0.005327679682523012, "reward_near_duplicate_penalty_mean": 0.9832252264022827, "reward_near_duplicate_penalty_std": 0.022154025733470917, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5387499928474426, "reward_judge_quality_std": 0.3358757197856903, "reward_total_composite_mean": 0.41193124651908875, "reward_total_composite_std": 0.3424032926559448} {"timestamp_utc": "2026-04-12T18:13:58Z", "mode": "train", "global_step": 613, "epoch": 0.03226145992316194, "loss": -0.0477, "grad_norm": 18.587955474853516, "learning_rate": 8.145454545454547e-06, "num_tokens": 1131197.0, "completions/mean_length": 25.75, "completions/min_length": 17.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.75, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.9855853319168091, "rewards/meter/std": 0.018046841025352478, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.2512255907058716, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6646794080734253, "rewards/total_composite/std": 0.2433253824710846, "reward": 0.6646794080734253, "reward_std": 0.2433253824710846, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1340295821428299, "sampling/sampling_logp_difference/max": 1.0169172286987305, "sampling/importance_sampling_ratio/min": 0.36170831322669983, "sampling/importance_sampling_ratio/mean": 1.021571159362793, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0363589599728584, "clip_ratio/low_mean": 0.04903846140950918, "clip_ratio/low_min": 0.04903846140950918, "clip_ratio/high_mean": 0.08721532206982374, "clip_ratio/high_max": 0.08721532206982374, "clip_ratio/region_mean": 0.13625378347933292, "reward_total_mean": 0.6646794080734253, "reward_meter_mean": 0.9855853319168091, "reward_meter_std": 0.018046841025352478, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.2512255907058716, "reward_total_composite_mean": 0.6646794080734253, "reward_total_composite_std": 0.2433253824710846} {"timestamp_utc": "2026-04-12T18:14:11Z", "mode": "train", "global_step": 614, "epoch": 0.032314088732171994, "loss": 0.1047, "grad_norm": 3.284402370452881, "learning_rate": 8.142424242424242e-06, "num_tokens": 1133087.0, "completions/mean_length": 208.25, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 107.0, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 423.0, "rewards/meter/mean": 0.23793752491474152, "rewards/meter/std": 0.3073529601097107, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.37796446681022644, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.11338934302330017, "rewards/lexical_plausibility/mean": 0.778860330581665, "rewards/lexical_plausibility/std": 0.30687153339385986, "rewards/judge_quality/mean": 0.32749998569488525, "rewards/judge_quality/std": 0.38975268602371216, "rewards/repeat_penalty/mean": 0.9131630063056946, "rewards/repeat_penalty/std": 0.10829947143793106, "rewards/repeat_floor/mean": 0.9930588603019714, "rewards/repeat_floor/std": 0.0069914464838802814, "rewards/near_duplicate_penalty/mean": 0.9839702844619751, "rewards/near_duplicate_penalty/std": 0.0249447263777256, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.10655052959918976, "rewards/total_composite/std": 0.1975708156824112, "reward": 0.10655052959918976, "reward_std": 0.19757080078125, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14779411256313324, "sampling/sampling_logp_difference/max": 1.413313865661621, "sampling/importance_sampling_ratio/min": 0.24333555996418, "sampling/importance_sampling_ratio/mean": 1.0163108110427856, "sampling/importance_sampling_ratio/max": 1.90984308719635, "entropy": 1.836133986711502, "clip_ratio/low_mean": 0.07186457002535462, "clip_ratio/low_min": 0.07186457002535462, "clip_ratio/high_mean": 0.054079560562968254, "clip_ratio/high_max": 0.054079560562968254, "clip_ratio/region_mean": 0.12594413058832288, "reward_total_mean": 0.10655052959918976, "reward_meter_mean": 0.23793752491474152, "reward_meter_std": 0.3073529601097107, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.37796446681022644, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.11338934302330017, "reward_lexical_plausibility_mean": 0.778860330581665, "reward_lexical_plausibility_std": 0.30687153339385986, "reward_repeat_penalty_mean": 0.9131630063056946, "reward_repeat_penalty_std": 0.10829947143793106, "reward_repeat_floor_mean": 0.9930588603019714, "reward_repeat_floor_std": 0.0069914464838802814, "reward_near_duplicate_penalty_mean": 0.9839702844619751, "reward_near_duplicate_penalty_std": 0.0249447263777256, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.32749998569488525, "reward_judge_quality_std": 0.38975268602371216, "reward_total_composite_mean": 0.10655052959918976, "reward_total_composite_std": 0.1975708156824112} {"timestamp_utc": "2026-04-12T18:14:26Z", "mode": "train", "global_step": 615, "epoch": 0.03236671754118204, "loss": -0.0769, "grad_norm": 3.3002634048461914, "learning_rate": 8.139393939393941e-06, "num_tokens": 1134648.0, "completions/mean_length": 162.125, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 45.5, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.7952566742897034, "rewards/meter/std": 0.30946919322013855, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8860474824905396, "rewards/lexical_plausibility/std": 0.21209657192230225, "rewards/judge_quality/mean": 0.3787500262260437, "rewards/judge_quality/std": 0.2630283832550049, "rewards/repeat_penalty/mean": 0.9653246402740479, "rewards/repeat_penalty/std": 0.039832696318626404, "rewards/repeat_floor/mean": 0.9947987198829651, "rewards/repeat_floor/std": 0.0059749106876552105, "rewards/near_duplicate_penalty/mean": 0.9653246402740479, "rewards/near_duplicate_penalty/std": 0.039832696318626404, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3191142678260803, "rewards/total_composite/std": 0.22737827897071838, "reward": 0.3191142678260803, "reward_std": 0.22737827897071838, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17958132922649384, "sampling/sampling_logp_difference/max": 2.4698095321655273, "sampling/importance_sampling_ratio/min": 0.08460097014904022, "sampling/importance_sampling_ratio/mean": 1.0286587476730347, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9334373250603676, "clip_ratio/low_mean": 0.03500000014901161, "clip_ratio/low_min": 0.03500000014901161, "clip_ratio/high_mean": 0.11670032609254122, "clip_ratio/high_max": 0.11670032609254122, "clip_ratio/region_mean": 0.15170032624155283, "reward_total_mean": 0.3191142678260803, "reward_meter_mean": 0.7952566742897034, "reward_meter_std": 0.30946919322013855, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8860474824905396, "reward_lexical_plausibility_std": 0.21209657192230225, "reward_repeat_penalty_mean": 0.9653246402740479, "reward_repeat_penalty_std": 0.039832696318626404, "reward_repeat_floor_mean": 0.9947987198829651, "reward_repeat_floor_std": 0.0059749106876552105, "reward_near_duplicate_penalty_mean": 0.9653246402740479, "reward_near_duplicate_penalty_std": 0.039832696318626404, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3787500262260437, "reward_judge_quality_std": 0.2630283832550049, "reward_total_composite_mean": 0.3191142678260803, "reward_total_composite_std": 0.22737827897071838} {"timestamp_utc": "2026-04-12T18:14:34Z", "mode": "train", "global_step": 616, "epoch": 0.03241934635019209, "loss": 0.06, "grad_norm": 22.035568237304688, "learning_rate": 8.136363636363637e-06, "num_tokens": 1136371.0, "completions/mean_length": 52.375, "completions/min_length": 36.0, "completions/max_length": 70.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.5446590185165405, "rewards/meter/std": 0.32828229665756226, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5787500143051147, "rewards/judge_quality/std": 0.18216457962989807, "rewards/repeat_penalty/mean": 0.9390758872032166, "rewards/repeat_penalty/std": 0.043568190187215805, "rewards/repeat_floor/mean": 0.9933968186378479, "rewards/repeat_floor/std": 0.004565213806927204, "rewards/near_duplicate_penalty/mean": 0.982736349105835, "rewards/near_duplicate_penalty/std": 0.013402133248746395, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9554044008255005, "rewards/distinct_2/std": 0.03800548240542412, "rewards/total_composite/mean": 0.3447574973106384, "rewards/total_composite/std": 0.2765711545944214, "reward": 0.3447574973106384, "reward_std": 0.2765711545944214, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19323676824569702, "sampling/sampling_logp_difference/max": 2.2633309364318848, "sampling/importance_sampling_ratio/min": 0.10400348156690598, "sampling/importance_sampling_ratio/mean": 0.9937203526496887, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8703051880002022, "clip_ratio/low_mean": 0.0836385521106422, "clip_ratio/low_min": 0.0836385521106422, "clip_ratio/high_mean": 0.05730654764920473, "clip_ratio/high_max": 0.05730654764920473, "clip_ratio/region_mean": 0.14094509975984693, "reward_total_mean": 0.3447574973106384, "reward_meter_mean": 0.5446590185165405, "reward_meter_std": 0.32828229665756226, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9390758872032166, "reward_repeat_penalty_std": 0.043568190187215805, "reward_repeat_floor_mean": 0.9933968186378479, "reward_repeat_floor_std": 0.004565213806927204, "reward_near_duplicate_penalty_mean": 0.982736349105835, "reward_near_duplicate_penalty_std": 0.013402133248746395, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9554044008255005, "reward_distinct_2_std": 0.03800548240542412, "reward_judge_quality_mean": 0.5787500143051147, "reward_judge_quality_std": 0.18216457962989807, "reward_total_composite_mean": 0.3447574973106384, "reward_total_composite_std": 0.2765711545944214} {"timestamp_utc": "2026-04-12T18:14:48Z", "mode": "train", "global_step": 617, "epoch": 0.032471975159202145, "loss": -0.0628, "grad_norm": 6.196832180023193, "learning_rate": 8.133333333333334e-06, "num_tokens": 1138060.0, "completions/mean_length": 108.125, "completions/min_length": 24.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 50.42857360839844, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.885595440864563, "rewards/meter/std": 0.19156396389007568, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.940804660320282, "rewards/lexical_plausibility/std": 0.14384816586971283, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.32275325059890747, "rewards/repeat_penalty/mean": 0.8910260200500488, "rewards/repeat_penalty/std": 0.13816334307193756, "rewards/repeat_floor/mean": 0.9906647205352783, "rewards/repeat_floor/std": 0.011830944567918777, "rewards/near_duplicate_penalty/mean": 0.9871708154678345, "rewards/near_duplicate_penalty/std": 0.02127412147819996, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9593233466148376, "rewards/distinct_2/std": 0.046888317912817, "rewards/total_composite/mean": 0.4802056550979614, "rewards/total_composite/std": 0.304761677980423, "reward": 0.4802056550979614, "reward_std": 0.304761677980423, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.175881490111351, "sampling/sampling_logp_difference/max": 1.3144702911376953, "sampling/importance_sampling_ratio/min": 0.26861658692359924, "sampling/importance_sampling_ratio/mean": 0.9870852828025818, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9020218998193741, "clip_ratio/low_mean": 0.04474160494282842, "clip_ratio/low_min": 0.04474160494282842, "clip_ratio/high_mean": 0.06013353727757931, "clip_ratio/high_max": 0.06013353727757931, "clip_ratio/region_mean": 0.10487514222040772, "reward_total_mean": 0.4802056550979614, "reward_meter_mean": 0.885595440864563, "reward_meter_std": 0.19156396389007568, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.940804660320282, "reward_lexical_plausibility_std": 0.14384816586971283, "reward_repeat_penalty_mean": 0.8910260200500488, "reward_repeat_penalty_std": 0.13816334307193756, "reward_repeat_floor_mean": 0.9906647205352783, "reward_repeat_floor_std": 0.011830944567918777, "reward_near_duplicate_penalty_mean": 0.9871708154678345, "reward_near_duplicate_penalty_std": 0.02127412147819996, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9593233466148376, "reward_distinct_2_std": 0.046888317912817, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.32275325059890747, "reward_total_composite_mean": 0.4802056550979614, "reward_total_composite_std": 0.304761677980423} {"timestamp_utc": "2026-04-12T18:15:01Z", "mode": "train", "global_step": 618, "epoch": 0.0325246039682122, "loss": -0.0683, "grad_norm": 2.9688713550567627, "learning_rate": 8.130303030303031e-06, "num_tokens": 1139886.0, "completions/mean_length": 228.25, "completions/min_length": 52.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 58.0, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.597636878490448, "rewards/meter/std": 0.42831969261169434, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8042219877243042, "rewards/lexical_plausibility/std": 0.28561586141586304, "rewards/judge_quality/mean": 0.3087500035762787, "rewards/judge_quality/std": 0.2881684899330139, "rewards/repeat_penalty/mean": 0.9984383583068848, "rewards/repeat_penalty/std": 0.004417074378579855, "rewards/repeat_floor/mean": 0.9997657537460327, "rewards/repeat_floor/std": 0.0006625695386901498, "rewards/near_duplicate_penalty/mean": 0.9984383583068848, "rewards/near_duplicate_penalty/std": 0.004417074378579855, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2403298169374466, "rewards/total_composite/std": 0.2993147671222687, "reward": 0.2403298169374466, "reward_std": 0.2993147671222687, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18364804983139038, "sampling/sampling_logp_difference/max": 1.8630266189575195, "sampling/importance_sampling_ratio/min": 0.15520218014717102, "sampling/importance_sampling_ratio/mean": 1.0117346048355103, "sampling/importance_sampling_ratio/max": 1.911372184753418, "entropy": 0.9035596251487732, "clip_ratio/low_mean": 0.04995519667863846, "clip_ratio/low_min": 0.04995519667863846, "clip_ratio/high_mean": 0.07724963873624802, "clip_ratio/high_max": 0.07724963873624802, "clip_ratio/region_mean": 0.12720483541488647, "reward_total_mean": 0.2403298169374466, "reward_meter_mean": 0.597636878490448, "reward_meter_std": 0.42831969261169434, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8042219877243042, "reward_lexical_plausibility_std": 0.28561586141586304, "reward_repeat_penalty_mean": 0.9984383583068848, "reward_repeat_penalty_std": 0.004417074378579855, "reward_repeat_floor_mean": 0.9997657537460327, "reward_repeat_floor_std": 0.0006625695386901498, "reward_near_duplicate_penalty_mean": 0.9984383583068848, "reward_near_duplicate_penalty_std": 0.004417074378579855, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3087500035762787, "reward_judge_quality_std": 0.2881684899330139, "reward_total_composite_mean": 0.2403298169374466, "reward_total_composite_std": 0.2993147671222687} {"timestamp_utc": "2026-04-12T18:15:10Z", "mode": "train", "global_step": 619, "epoch": 0.03257723277722225, "loss": 0.0874, "grad_norm": 14.600446701049805, "learning_rate": 8.127272727272728e-06, "num_tokens": 1141776.0, "completions/mean_length": 64.25, "completions/min_length": 48.0, "completions/max_length": 81.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.25, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.7336498498916626, "rewards/meter/std": 0.3361385464668274, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9711818695068359, "rewards/repeat_penalty/std": 0.05532743036746979, "rewards/repeat_floor/mean": 0.9966529607772827, "rewards/repeat_floor/std": 0.005594935268163681, "rewards/near_duplicate_penalty/mean": 0.9881757497787476, "rewards/near_duplicate_penalty/std": 0.011149524711072445, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.241560697555542, "rewards/total_composite/std": 0.13178382813930511, "reward": 0.241560697555542, "reward_std": 0.1317838430404663, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1809169054031372, "sampling/sampling_logp_difference/max": 2.6580488681793213, "sampling/importance_sampling_ratio/min": 0.0700848326086998, "sampling/importance_sampling_ratio/mean": 1.0107845067977905, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0946395546197891, "clip_ratio/low_mean": 0.06394055904820561, "clip_ratio/low_min": 0.06394055904820561, "clip_ratio/high_mean": 0.06823549419641495, "clip_ratio/high_max": 0.06823549419641495, "clip_ratio/region_mean": 0.13217605324462056, "reward_total_mean": 0.241560697555542, "reward_meter_mean": 0.7336498498916626, "reward_meter_std": 0.3361385464668274, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9711818695068359, "reward_repeat_penalty_std": 0.05532743036746979, "reward_repeat_floor_mean": 0.9966529607772827, "reward_repeat_floor_std": 0.005594935268163681, "reward_near_duplicate_penalty_mean": 0.9881757497787476, "reward_near_duplicate_penalty_std": 0.011149524711072445, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.241560697555542, "reward_total_composite_std": 0.13178382813930511} {"timestamp_utc": "2026-04-12T18:15:24Z", "mode": "train", "global_step": 620, "epoch": 0.0326298615862323, "loss": -0.0402, "grad_norm": 5.1841020584106445, "learning_rate": 8.124242424242424e-06, "num_tokens": 1143734.0, "completions/mean_length": 130.75, "completions/min_length": 42.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 76.28572082519531, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.7234073281288147, "rewards/meter/std": 0.2889758050441742, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.053032997995615005, "rewards/lexical_plausibility/mean": 0.9526209831237793, "rewards/lexical_plausibility/std": 0.13400810956954956, "rewards/judge_quality/mean": 0.47999998927116394, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.7898324728012085, "rewards/repeat_penalty/std": 0.22097037732601166, "rewards/repeat_floor/mean": 0.9797949194908142, "rewards/repeat_floor/std": 0.019347619265317917, "rewards/near_duplicate_penalty/mean": 0.9350776672363281, "rewards/near_duplicate_penalty/std": 0.045264650136232376, "rewards/opening_diversity/mean": 0.984375, "rewards/opening_diversity/std": 0.0289318785071373, "rewards/distinct_2/mean": 0.8941197991371155, "rewards/distinct_2/std": 0.1336977779865265, "rewards/total_composite/mean": 0.28049683570861816, "rewards/total_composite/std": 0.19081680476665497, "reward": 0.28049683570861816, "reward_std": 0.19081680476665497, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13807980716228485, "sampling/sampling_logp_difference/max": 1.1613225936889648, "sampling/importance_sampling_ratio/min": 0.3130718469619751, "sampling/importance_sampling_ratio/mean": 1.0102351903915405, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.850733757019043, "clip_ratio/low_mean": 0.0496748685836792, "clip_ratio/low_min": 0.0496748685836792, "clip_ratio/high_mean": 0.08766865264624357, "clip_ratio/high_max": 0.08766865264624357, "clip_ratio/region_mean": 0.13734352122992277, "reward_total_mean": 0.28049683570861816, "reward_meter_mean": 0.7234073281288147, "reward_meter_std": 0.2889758050441742, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.053032997995615005, "reward_lexical_plausibility_mean": 0.9526209831237793, "reward_lexical_plausibility_std": 0.13400810956954956, "reward_repeat_penalty_mean": 0.7898324728012085, "reward_repeat_penalty_std": 0.22097037732601166, "reward_repeat_floor_mean": 0.9797949194908142, "reward_repeat_floor_std": 0.019347619265317917, "reward_near_duplicate_penalty_mean": 0.9350776672363281, "reward_near_duplicate_penalty_std": 0.045264650136232376, "reward_opening_diversity_mean": 0.984375, "reward_opening_diversity_std": 0.0289318785071373, "reward_distinct_2_mean": 0.8941197991371155, "reward_distinct_2_std": 0.1336977779865265, "reward_judge_quality_mean": 0.47999998927116394, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.28049683570861816, "reward_total_composite_std": 0.19081680476665497} {"timestamp_utc": "2026-04-12T18:15:39Z", "mode": "train", "global_step": 621, "epoch": 0.032682490395242354, "loss": -0.1467, "grad_norm": 2.7168047428131104, "learning_rate": 8.121212121212121e-06, "num_tokens": 1146001.0, "completions/mean_length": 183.375, "completions/min_length": 57.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 73.83333587646484, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 90.0, "rewards/meter/mean": 0.9033820629119873, "rewards/meter/std": 0.22243911027908325, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8878495693206787, "rewards/lexical_plausibility/std": 0.20941151678562164, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.1552647352218628, "rewards/repeat_penalty/mean": 0.8891706466674805, "rewards/repeat_penalty/std": 0.06366286426782608, "rewards/repeat_floor/mean": 0.9874754548072815, "rewards/repeat_floor/std": 0.006605308502912521, "rewards/near_duplicate_penalty/mean": 0.9622802734375, "rewards/near_duplicate_penalty/std": 0.017249030992388725, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9237045049667358, "rewards/distinct_2/std": 0.0581965409219265, "rewards/total_composite/mean": 0.29970651865005493, "rewards/total_composite/std": 0.14850907027721405, "reward": 0.29970651865005493, "reward_std": 0.14850907027721405, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16845576465129852, "sampling/sampling_logp_difference/max": 1.6724557876586914, "sampling/importance_sampling_ratio/min": 0.187785342335701, "sampling/importance_sampling_ratio/mean": 0.9902026653289795, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6718973368406296, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.1276545450091362, "clip_ratio/high_max": 0.1276545450091362, "clip_ratio/region_mean": 0.1276545450091362, "reward_total_mean": 0.29970651865005493, "reward_meter_mean": 0.9033820629119873, "reward_meter_std": 0.22243911027908325, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8878495693206787, "reward_lexical_plausibility_std": 0.20941151678562164, "reward_repeat_penalty_mean": 0.8891706466674805, "reward_repeat_penalty_std": 0.06366286426782608, "reward_repeat_floor_mean": 0.9874754548072815, "reward_repeat_floor_std": 0.006605308502912521, "reward_near_duplicate_penalty_mean": 0.9622802734375, "reward_near_duplicate_penalty_std": 0.017249030992388725, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9237045049667358, "reward_distinct_2_std": 0.0581965409219265, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.1552647352218628, "reward_total_composite_mean": 0.29970651865005493, "reward_total_composite_std": 0.14850907027721405} {"timestamp_utc": "2026-04-12T18:15:47Z", "mode": "train", "global_step": 622, "epoch": 0.03273511920425241, "loss": 0.0119, "grad_norm": 13.615230560302734, "learning_rate": 8.118181818181819e-06, "num_tokens": 1147420.0, "completions/mean_length": 51.375, "completions/min_length": 41.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.375, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.6384586095809937, "rewards/meter/std": 0.47671863436698914, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5375000238418579, "rewards/judge_quality/std": 0.2520062327384949, "rewards/repeat_penalty/mean": 0.7313476800918579, "rewards/repeat_penalty/std": 0.29345589876174927, "rewards/repeat_floor/mean": 0.9674400091171265, "rewards/repeat_floor/std": 0.0373542420566082, "rewards/near_duplicate_penalty/mean": 0.9219187498092651, "rewards/near_duplicate_penalty/std": 0.09316504001617432, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8308577537536621, "rewards/distinct_2/std": 0.1842360943555832, "rewards/total_composite/mean": 0.3183947205543518, "rewards/total_composite/std": 0.31174230575561523, "reward": 0.3183947205543518, "reward_std": 0.3117423355579376, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17254482209682465, "sampling/sampling_logp_difference/max": 1.3535106182098389, "sampling/importance_sampling_ratio/min": 0.2583317458629608, "sampling/importance_sampling_ratio/mean": 1.0363050699234009, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.272480845451355, "clip_ratio/low_mean": 0.06573247816413641, "clip_ratio/low_min": 0.06573247816413641, "clip_ratio/high_mean": 0.08048379793763161, "clip_ratio/high_max": 0.08048379793763161, "clip_ratio/region_mean": 0.14621627610176802, "reward_total_mean": 0.3183947205543518, "reward_meter_mean": 0.6384586095809937, "reward_meter_std": 0.47671863436698914, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7313476800918579, "reward_repeat_penalty_std": 0.29345589876174927, "reward_repeat_floor_mean": 0.9674400091171265, "reward_repeat_floor_std": 0.0373542420566082, "reward_near_duplicate_penalty_mean": 0.9219187498092651, "reward_near_duplicate_penalty_std": 0.09316504001617432, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8308577537536621, "reward_distinct_2_std": 0.1842360943555832, "reward_judge_quality_mean": 0.5375000238418579, "reward_judge_quality_std": 0.2520062327384949, "reward_total_composite_mean": 0.3183947205543518, "reward_total_composite_std": 0.31174230575561523} {"timestamp_utc": "2026-04-12T18:16:00Z", "mode": "train", "global_step": 623, "epoch": 0.03278774801326246, "loss": -0.0487, "grad_norm": 2.5123581886291504, "learning_rate": 8.115151515151516e-06, "num_tokens": 1148808.0, "completions/mean_length": 153.5, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 34.0, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.6920024156570435, "rewards/meter/std": 0.39770135283470154, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8688567876815796, "rewards/lexical_plausibility/std": 0.2448626011610031, "rewards/judge_quality/mean": 0.5262500047683716, "rewards/judge_quality/std": 0.36570626497268677, "rewards/repeat_penalty/mean": 0.9320791959762573, "rewards/repeat_penalty/std": 0.061871372163295746, "rewards/repeat_floor/mean": 0.9929609894752502, "rewards/repeat_floor/std": 0.0061057982966303825, "rewards/near_duplicate_penalty/mean": 0.9861485958099365, "rewards/near_duplicate_penalty/std": 0.010002936236560345, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.94487464427948, "rewards/distinct_2/std": 0.05666302144527435, "rewards/total_composite/mean": 0.39848634600639343, "rewards/total_composite/std": 0.3466055989265442, "reward": 0.39848634600639343, "reward_std": 0.3466055989265442, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1686234325170517, "sampling/sampling_logp_difference/max": 2.383777141571045, "sampling/importance_sampling_ratio/min": 0.09220165759325027, "sampling/importance_sampling_ratio/mean": 1.0037939548492432, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5634059682488441, "clip_ratio/low_mean": 0.02142857201397419, "clip_ratio/low_min": 0.02142857201397419, "clip_ratio/high_mean": 0.0881561990827322, "clip_ratio/high_max": 0.0881561990827322, "clip_ratio/region_mean": 0.10958477109670639, "reward_total_mean": 0.39848634600639343, "reward_meter_mean": 0.6920024156570435, "reward_meter_std": 0.39770135283470154, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8688567876815796, "reward_lexical_plausibility_std": 0.2448626011610031, "reward_repeat_penalty_mean": 0.9320791959762573, "reward_repeat_penalty_std": 0.061871372163295746, "reward_repeat_floor_mean": 0.9929609894752502, "reward_repeat_floor_std": 0.0061057982966303825, "reward_near_duplicate_penalty_mean": 0.9861485958099365, "reward_near_duplicate_penalty_std": 0.010002936236560345, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.94487464427948, "reward_distinct_2_std": 0.05666302144527435, "reward_judge_quality_mean": 0.5262500047683716, "reward_judge_quality_std": 0.36570626497268677, "reward_total_composite_mean": 0.39848634600639343, "reward_total_composite_std": 0.3466055989265442} {"timestamp_utc": "2026-04-12T18:16:14Z", "mode": "train", "global_step": 624, "epoch": 0.03284037682227251, "loss": -0.1316, "grad_norm": 2.875786781311035, "learning_rate": 8.112121212121213e-06, "num_tokens": 1150521.0, "completions/mean_length": 173.125, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 60.16666793823242, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 89.0, "rewards/meter/mean": 0.6622650027275085, "rewards/meter/std": 0.39949294924736023, "rewards/count_adherence/mean": 0.6666666865348816, "rewards/count_adherence/std": 0.2519763112068176, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8999999761581421, "rewards/count_floor/std": 0.07559289038181305, "rewards/lexical_plausibility/mean": 0.8699882626533508, "rewards/lexical_plausibility/std": 0.24216406047344208, "rewards/judge_quality/mean": 0.4037500023841858, "rewards/judge_quality/std": 0.26397714018821716, "rewards/repeat_penalty/mean": 0.9251468181610107, "rewards/repeat_penalty/std": 0.10896413773298264, "rewards/repeat_floor/mean": 0.9943970441818237, "rewards/repeat_floor/std": 0.006151876877993345, "rewards/near_duplicate_penalty/mean": 0.9876468181610107, "rewards/near_duplicate_penalty/std": 0.015654806047677994, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3148782551288605, "rewards/total_composite/std": 0.2211579531431198, "reward": 0.3148782551288605, "reward_std": 0.22115793824195862, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1675977110862732, "sampling/sampling_logp_difference/max": 1.4057464599609375, "sampling/importance_sampling_ratio/min": 0.24518397450447083, "sampling/importance_sampling_ratio/mean": 1.0625616312026978, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8187977820634842, "clip_ratio/low_mean": 0.04284227546304464, "clip_ratio/low_min": 0.04284227546304464, "clip_ratio/high_mean": 0.06946451030671597, "clip_ratio/high_max": 0.06946451030671597, "clip_ratio/region_mean": 0.11230678576976061, "reward_total_mean": 0.3148782551288605, "reward_meter_mean": 0.6622650027275085, "reward_meter_std": 0.39949294924736023, "reward_count_adherence_mean": 0.6666666865348816, "reward_count_adherence_std": 0.2519763112068176, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8999999761581421, "reward_count_floor_std": 0.07559289038181305, "reward_lexical_plausibility_mean": 0.8699882626533508, "reward_lexical_plausibility_std": 0.24216406047344208, "reward_repeat_penalty_mean": 0.9251468181610107, "reward_repeat_penalty_std": 0.10896413773298264, "reward_repeat_floor_mean": 0.9943970441818237, "reward_repeat_floor_std": 0.006151876877993345, "reward_near_duplicate_penalty_mean": 0.9876468181610107, "reward_near_duplicate_penalty_std": 0.015654806047677994, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4037500023841858, "reward_judge_quality_std": 0.26397714018821716, "reward_total_composite_mean": 0.3148782551288605, "reward_total_composite_std": 0.2211579531431198} {"timestamp_utc": "2026-04-12T18:16:23Z", "mode": "train", "global_step": 625, "epoch": 0.032893005631282564, "loss": 0.0678, "grad_norm": 16.772842407226562, "learning_rate": 8.10909090909091e-06, "num_tokens": 1152153.0, "completions/mean_length": 44.0, "completions/min_length": 33.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.0, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.7899090051651001, "rewards/meter/std": 0.25864115357398987, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6512500047683716, "rewards/judge_quality/std": 0.23259025812149048, "rewards/repeat_penalty/mean": 0.9366745352745056, "rewards/repeat_penalty/std": 0.14090968668460846, "rewards/repeat_floor/mean": 0.9933446049690247, "rewards/repeat_floor/std": 0.01317894458770752, "rewards/near_duplicate_penalty/mean": 0.9802762866020203, "rewards/near_duplicate_penalty/std": 0.023176228627562523, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9797570705413818, "rewards/distinct_2/std": 0.05725561082363129, "rewards/total_composite/mean": 0.5422884225845337, "rewards/total_composite/std": 0.31825241446495056, "reward": 0.5422884225845337, "reward_std": 0.3182523846626282, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14097292721271515, "sampling/sampling_logp_difference/max": 1.8590154647827148, "sampling/importance_sampling_ratio/min": 0.15582597255706787, "sampling/importance_sampling_ratio/mean": 1.0054686069488525, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9811501502990723, "clip_ratio/low_mean": 0.08203381858766079, "clip_ratio/low_min": 0.08203381858766079, "clip_ratio/high_mean": 0.048706404864788055, "clip_ratio/high_max": 0.048706404864788055, "clip_ratio/region_mean": 0.13074022345244884, "reward_total_mean": 0.5422884225845337, "reward_meter_mean": 0.7899090051651001, "reward_meter_std": 0.25864115357398987, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9366745352745056, "reward_repeat_penalty_std": 0.14090968668460846, "reward_repeat_floor_mean": 0.9933446049690247, "reward_repeat_floor_std": 0.01317894458770752, "reward_near_duplicate_penalty_mean": 0.9802762866020203, "reward_near_duplicate_penalty_std": 0.023176228627562523, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9797570705413818, "reward_distinct_2_std": 0.05725561082363129, "reward_judge_quality_mean": 0.6512500047683716, "reward_judge_quality_std": 0.23259025812149048, "reward_total_composite_mean": 0.5422884225845337, "reward_total_composite_std": 0.31825241446495056} {"timestamp_utc": "2026-04-12T18:16:37Z", "mode": "train", "global_step": 626, "epoch": 0.032945634440292616, "loss": -0.0771, "grad_norm": 2.380643844604492, "learning_rate": 8.106060606060606e-06, "num_tokens": 1153718.0, "completions/mean_length": 158.625, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 40.833335876464844, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.6858423948287964, "rewards/meter/std": 0.3974907696247101, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8820273876190186, "rewards/lexical_plausibility/std": 0.21894796192646027, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.30420562624931335, "rewards/repeat_penalty/mean": 0.9202359318733215, "rewards/repeat_penalty/std": 0.10980397462844849, "rewards/repeat_floor/mean": 0.9942066669464111, "rewards/repeat_floor/std": 0.006513233762234449, "rewards/near_duplicate_penalty/mean": 0.9922199249267578, "rewards/near_duplicate_penalty/std": 0.012621927075088024, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9902632236480713, "rewards/distinct_2/std": 0.02571846917271614, "rewards/total_composite/mean": 0.3047851622104645, "rewards/total_composite/std": 0.22900506854057312, "reward": 0.3047851622104645, "reward_std": 0.22900508344173431, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17130866646766663, "sampling/sampling_logp_difference/max": 2.774261236190796, "sampling/importance_sampling_ratio/min": 0.06239555776119232, "sampling/importance_sampling_ratio/mean": 1.0127062797546387, "sampling/importance_sampling_ratio/max": 1.9650647640228271, "entropy": 0.7918702214956284, "clip_ratio/low_mean": 0.013888888992369175, "clip_ratio/low_min": 0.013888888992369175, "clip_ratio/high_mean": 0.10613978188484907, "clip_ratio/high_max": 0.10613978188484907, "clip_ratio/region_mean": 0.12002867087721825, "reward_total_mean": 0.3047851622104645, "reward_meter_mean": 0.6858423948287964, "reward_meter_std": 0.3974907696247101, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8820273876190186, "reward_lexical_plausibility_std": 0.21894796192646027, "reward_repeat_penalty_mean": 0.9202359318733215, "reward_repeat_penalty_std": 0.10980397462844849, "reward_repeat_floor_mean": 0.9942066669464111, "reward_repeat_floor_std": 0.006513233762234449, "reward_near_duplicate_penalty_mean": 0.9922199249267578, "reward_near_duplicate_penalty_std": 0.012621927075088024, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9902632236480713, "reward_distinct_2_std": 0.02571846917271614, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.30420562624931335, "reward_total_composite_mean": 0.3047851622104645, "reward_total_composite_std": 0.22900506854057312} {"timestamp_utc": "2026-04-12T18:16:50Z", "mode": "train", "global_step": 627, "epoch": 0.03299826324930267, "loss": -0.0458, "grad_norm": 2.3469016551971436, "learning_rate": 8.103030303030303e-06, "num_tokens": 1155334.0, "completions/mean_length": 283.0, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 54.0, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.193363219499588, "rewards/meter/std": 0.16206784546375275, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.37796446681022644, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.11338934302330017, "rewards/lexical_plausibility/mean": 0.7676507234573364, "rewards/lexical_plausibility/std": 0.25055408477783203, "rewards/judge_quality/mean": 0.3424999713897705, "rewards/judge_quality/std": 0.38975268602371216, "rewards/repeat_penalty/mean": 0.9447952508926392, "rewards/repeat_penalty/std": 0.09382601827383041, "rewards/repeat_floor/mean": 0.9956594705581665, "rewards/repeat_floor/std": 0.0064465817995369434, "rewards/near_duplicate_penalty/mean": 0.994872510433197, "rewards/near_duplicate_penalty/std": 0.014502751640975475, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9811508059501648, "rewards/distinct_2/std": 0.05160851404070854, "rewards/total_composite/mean": 0.1001095250248909, "rewards/total_composite/std": 0.1601189821958542, "reward": 0.1001095250248909, "reward_std": 0.1601189821958542, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1514362096786499, "sampling/sampling_logp_difference/max": 1.0914926528930664, "sampling/importance_sampling_ratio/min": 0.33571502566337585, "sampling/importance_sampling_ratio/mean": 1.0199594497680664, "sampling/importance_sampling_ratio/max": 1.8444223403930664, "entropy": 0.4910387694835663, "clip_ratio/low_mean": 0.038455989211797714, "clip_ratio/low_min": 0.038455989211797714, "clip_ratio/high_mean": 0.029325180687010288, "clip_ratio/high_max": 0.029325180687010288, "clip_ratio/region_mean": 0.067781169898808, "reward_total_mean": 0.1001095250248909, "reward_meter_mean": 0.193363219499588, "reward_meter_std": 0.16206784546375275, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.37796446681022644, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.11338934302330017, "reward_lexical_plausibility_mean": 0.7676507234573364, "reward_lexical_plausibility_std": 0.25055408477783203, "reward_repeat_penalty_mean": 0.9447952508926392, "reward_repeat_penalty_std": 0.09382601827383041, "reward_repeat_floor_mean": 0.9956594705581665, "reward_repeat_floor_std": 0.0064465817995369434, "reward_near_duplicate_penalty_mean": 0.994872510433197, "reward_near_duplicate_penalty_std": 0.014502751640975475, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9811508059501648, "reward_distinct_2_std": 0.05160851404070854, "reward_judge_quality_mean": 0.3424999713897705, "reward_judge_quality_std": 0.38975268602371216, "reward_total_composite_mean": 0.1001095250248909, "reward_total_composite_std": 0.1601189821958542} {"timestamp_utc": "2026-04-12T18:17:00Z", "mode": "train", "global_step": 628, "epoch": 0.03305089205831272, "loss": -0.0437, "grad_norm": 11.550919532775879, "learning_rate": 8.1e-06, "num_tokens": 1157482.0, "completions/mean_length": 94.5, "completions/min_length": 72.0, "completions/max_length": 111.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 94.5, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 111.0, "rewards/meter/mean": 0.43770888447761536, "rewards/meter/std": 0.17247872054576874, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9929601550102234, "rewards/lexical_plausibility/std": 0.014150693081319332, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.22177450358867645, "rewards/repeat_penalty/mean": 0.9124069809913635, "rewards/repeat_penalty/std": 0.13274580240249634, "rewards/repeat_floor/mean": 0.9900774955749512, "rewards/repeat_floor/std": 0.014343813993036747, "rewards/near_duplicate_penalty/mean": 0.9725484848022461, "rewards/near_duplicate_penalty/std": 0.027609558776021004, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9355016350746155, "rewards/distinct_2/std": 0.11589191854000092, "rewards/total_composite/mean": 0.1530650556087494, "rewards/total_composite/std": 0.060808662325143814, "reward": 0.1530650556087494, "reward_std": 0.060808662325143814, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16860195994377136, "sampling/sampling_logp_difference/max": 3.2653942108154297, "sampling/importance_sampling_ratio/min": 0.03818188235163689, "sampling/importance_sampling_ratio/mean": 1.012155532836914, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8972285687923431, "clip_ratio/low_mean": 0.06858719978481531, "clip_ratio/low_min": 0.06858719978481531, "clip_ratio/high_mean": 0.06843694765120745, "clip_ratio/high_max": 0.06843694765120745, "clip_ratio/region_mean": 0.13702414743602276, "reward_total_mean": 0.1530650556087494, "reward_meter_mean": 0.43770888447761536, "reward_meter_std": 0.17247872054576874, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9929601550102234, "reward_lexical_plausibility_std": 0.014150693081319332, "reward_repeat_penalty_mean": 0.9124069809913635, "reward_repeat_penalty_std": 0.13274580240249634, "reward_repeat_floor_mean": 0.9900774955749512, "reward_repeat_floor_std": 0.014343813993036747, "reward_near_duplicate_penalty_mean": 0.9725484848022461, "reward_near_duplicate_penalty_std": 0.027609558776021004, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9355016350746155, "reward_distinct_2_std": 0.11589191854000092, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.22177450358867645, "reward_total_composite_mean": 0.1530650556087494, "reward_total_composite_std": 0.060808662325143814} {"timestamp_utc": "2026-04-12T18:17:09Z", "mode": "train", "global_step": 629, "epoch": 0.033103520867322773, "loss": 0.0558, "grad_norm": 14.109796524047852, "learning_rate": 8.096969696969698e-06, "num_tokens": 1159115.0, "completions/mean_length": 52.125, "completions/min_length": 40.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.125, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.696418285369873, "rewards/meter/std": 0.40393397212028503, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6512500047683716, "rewards/judge_quality/std": 0.27220991253852844, "rewards/repeat_penalty/mean": 0.9879008531570435, "rewards/repeat_penalty/std": 0.027250805869698524, "rewards/repeat_floor/mean": 0.9986053705215454, "rewards/repeat_floor/std": 0.002909204689785838, "rewards/near_duplicate_penalty/mean": 0.9951404333114624, "rewards/near_duplicate_penalty/std": 0.0072609977796673775, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9926035404205322, "rewards/distinct_2/std": 0.020920326933264732, "rewards/total_composite/mean": 0.5278056859970093, "rewards/total_composite/std": 0.40111443400382996, "reward": 0.5278056859970093, "reward_std": 0.40111443400382996, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15522265434265137, "sampling/sampling_logp_difference/max": 2.420238494873047, "sampling/importance_sampling_ratio/min": 0.08890041708946228, "sampling/importance_sampling_ratio/mean": 1.008543848991394, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9298888742923737, "clip_ratio/low_mean": 0.06552162393927574, "clip_ratio/low_min": 0.06552162393927574, "clip_ratio/high_mean": 0.07076923083513975, "clip_ratio/high_max": 0.07076923083513975, "clip_ratio/region_mean": 0.1362908547744155, "reward_total_mean": 0.5278056859970093, "reward_meter_mean": 0.696418285369873, "reward_meter_std": 0.40393397212028503, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9879008531570435, "reward_repeat_penalty_std": 0.027250805869698524, "reward_repeat_floor_mean": 0.9986053705215454, "reward_repeat_floor_std": 0.002909204689785838, "reward_near_duplicate_penalty_mean": 0.9951404333114624, "reward_near_duplicate_penalty_std": 0.0072609977796673775, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9926035404205322, "reward_distinct_2_std": 0.020920326933264732, "reward_judge_quality_mean": 0.6512500047683716, "reward_judge_quality_std": 0.27220991253852844, "reward_total_composite_mean": 0.5278056859970093, "reward_total_composite_std": 0.40111443400382996} {"timestamp_utc": "2026-04-12T18:17:18Z", "mode": "train", "global_step": 630, "epoch": 0.033156149676332826, "loss": 0.0252, "grad_norm": 12.736981391906738, "learning_rate": 8.093939393939395e-06, "num_tokens": 1160646.0, "completions/mean_length": 41.375, "completions/min_length": 33.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.375, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.9313610196113586, "rewards/meter/std": 0.09954942762851715, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.1642080545425415, "rewards/repeat_penalty/mean": 0.8535189628601074, "rewards/repeat_penalty/std": 0.24123379588127136, "rewards/repeat_floor/mean": 0.983771562576294, "rewards/repeat_floor/std": 0.023354189470410347, "rewards/near_duplicate_penalty/mean": 0.9401407241821289, "rewards/near_duplicate_penalty/std": 0.06618963181972504, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9402834177017212, "rewards/distinct_2/std": 0.11225500702857971, "rewards/total_composite/mean": 0.40136462450027466, "rewards/total_composite/std": 0.16953253746032715, "reward": 0.40136462450027466, "reward_std": 0.16953253746032715, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1317305564880371, "sampling/sampling_logp_difference/max": 1.3465065956115723, "sampling/importance_sampling_ratio/min": 0.26014748215675354, "sampling/importance_sampling_ratio/mean": 1.0096341371536255, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8016039058566093, "clip_ratio/low_mean": 0.07051901984959841, "clip_ratio/low_min": 0.07051901984959841, "clip_ratio/high_mean": 0.08341802190989256, "clip_ratio/high_max": 0.08341802190989256, "clip_ratio/region_mean": 0.15393704175949097, "reward_total_mean": 0.40136462450027466, "reward_meter_mean": 0.9313610196113586, "reward_meter_std": 0.09954942762851715, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8535189628601074, "reward_repeat_penalty_std": 0.24123379588127136, "reward_repeat_floor_mean": 0.983771562576294, "reward_repeat_floor_std": 0.023354189470410347, "reward_near_duplicate_penalty_mean": 0.9401407241821289, "reward_near_duplicate_penalty_std": 0.06618963181972504, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9402834177017212, "reward_distinct_2_std": 0.11225500702857971, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.1642080545425415, "reward_total_composite_mean": 0.40136462450027466, "reward_total_composite_std": 0.16953253746032715} {"timestamp_utc": "2026-04-12T18:17:33Z", "mode": "train", "global_step": 631, "epoch": 0.03320877848534288, "loss": -0.1075, "grad_norm": 2.931724786758423, "learning_rate": 8.090909090909092e-06, "num_tokens": 1162553.0, "completions/mean_length": 250.375, "completions/min_length": 81.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 93.4000015258789, "completions/min_terminated_length": 81.0, "completions/max_terminated_length": 107.0, "rewards/meter/mean": 0.27989137172698975, "rewards/meter/std": 0.3009420335292816, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.23299294710159302, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.06989788264036179, "rewards/lexical_plausibility/mean": 0.8564306497573853, "rewards/lexical_plausibility/std": 0.21001528203487396, "rewards/judge_quality/mean": 0.22500000894069672, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.8253175020217896, "rewards/repeat_penalty/std": 0.2620405852794647, "rewards/repeat_floor/mean": 0.9799808263778687, "rewards/repeat_floor/std": 0.02932579256594181, "rewards/near_duplicate_penalty/mean": 0.9481757283210754, "rewards/near_duplicate_penalty/std": 0.056299153715372086, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8639386892318726, "rewards/distinct_2/std": 0.23870481550693512, "rewards/total_composite/mean": 0.08268521726131439, "rewards/total_composite/std": 0.10065069049596786, "reward": 0.08268521726131439, "reward_std": 0.10065069049596786, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16391897201538086, "sampling/sampling_logp_difference/max": 1.7942862510681152, "sampling/importance_sampling_ratio/min": 0.16624607145786285, "sampling/importance_sampling_ratio/mean": 1.0135902166366577, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7055342271924019, "clip_ratio/low_mean": 0.04161974973976612, "clip_ratio/low_min": 0.04161974973976612, "clip_ratio/high_mean": 0.07705851644277573, "clip_ratio/high_max": 0.07705851644277573, "clip_ratio/region_mean": 0.11867826618254185, "reward_total_mean": 0.08268521726131439, "reward_meter_mean": 0.27989137172698975, "reward_meter_std": 0.3009420335292816, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.23299294710159302, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.06989788264036179, "reward_lexical_plausibility_mean": 0.8564306497573853, "reward_lexical_plausibility_std": 0.21001528203487396, "reward_repeat_penalty_mean": 0.8253175020217896, "reward_repeat_penalty_std": 0.2620405852794647, "reward_repeat_floor_mean": 0.9799808263778687, "reward_repeat_floor_std": 0.02932579256594181, "reward_near_duplicate_penalty_mean": 0.9481757283210754, "reward_near_duplicate_penalty_std": 0.056299153715372086, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8639386892318726, "reward_distinct_2_std": 0.23870481550693512, "reward_judge_quality_mean": 0.22500000894069672, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.08268521726131439, "reward_total_composite_std": 0.10065069049596786} {"timestamp_utc": "2026-04-12T18:17:43Z", "mode": "train", "global_step": 632, "epoch": 0.03326140729435293, "loss": 0.0396, "grad_norm": 10.458887100219727, "learning_rate": 8.08787878787879e-06, "num_tokens": 1164630.0, "completions/mean_length": 76.625, "completions/min_length": 67.0, "completions/max_length": 92.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 76.625, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.984645426273346, "rewards/meter/std": 0.02025916427373886, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9899553656578064, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9664424657821655, "rewards/repeat_penalty/std": 0.04354164004325867, "rewards/repeat_floor/mean": 0.995843768119812, "rewards/repeat_floor/std": 0.00489113898947835, "rewards/near_duplicate_penalty/mean": 0.9819217920303345, "rewards/near_duplicate_penalty/std": 0.01741056516766548, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839502573013306, "rewards/distinct_2/std": 0.03230852633714676, "rewards/total_composite/mean": 0.34018394351005554, "rewards/total_composite/std": 0.04311790689826012, "reward": 0.34018394351005554, "reward_std": 0.04311790317296982, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16201089322566986, "sampling/sampling_logp_difference/max": 2.309434175491333, "sampling/importance_sampling_ratio/min": 0.09931743144989014, "sampling/importance_sampling_ratio/mean": 1.0083796977996826, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8590324893593788, "clip_ratio/low_mean": 0.11193040199577808, "clip_ratio/low_min": 0.11193040199577808, "clip_ratio/high_mean": 0.03403242491185665, "clip_ratio/high_max": 0.03403242491185665, "clip_ratio/region_mean": 0.14596282690763474, "reward_total_mean": 0.34018394351005554, "reward_meter_mean": 0.984645426273346, "reward_meter_std": 0.02025916427373886, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9899553656578064, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9664424657821655, "reward_repeat_penalty_std": 0.04354164004325867, "reward_repeat_floor_mean": 0.995843768119812, "reward_repeat_floor_std": 0.00489113898947835, "reward_near_duplicate_penalty_mean": 0.9819217920303345, "reward_near_duplicate_penalty_std": 0.01741056516766548, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839502573013306, "reward_distinct_2_std": 0.03230852633714676, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.34018394351005554, "reward_total_composite_std": 0.04311790689826012} {"timestamp_utc": "2026-04-12T18:17:57Z", "mode": "train", "global_step": 633, "epoch": 0.03331403610336298, "loss": -0.0276, "grad_norm": 1.9008045196533203, "learning_rate": 8.084848484848485e-06, "num_tokens": 1166135.0, "completions/mean_length": 207.125, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 24.200000762939453, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.511986255645752, "rewards/meter/std": 0.48121657967567444, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.7669378519058228, "rewards/lexical_plausibility/std": 0.23855535686016083, "rewards/judge_quality/mean": 0.38875001668930054, "rewards/judge_quality/std": 0.4436355531215668, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24821455776691437, "rewards/total_composite/std": 0.37103891372680664, "reward": 0.24821455776691437, "reward_std": 0.37103888392448425, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1641748994588852, "sampling/sampling_logp_difference/max": 1.1376252174377441, "sampling/importance_sampling_ratio/min": 0.3205794394016266, "sampling/importance_sampling_ratio/mean": 1.0472924709320068, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.165491834282875, "clip_ratio/low_mean": 0.06007657293230295, "clip_ratio/low_min": 0.06007657293230295, "clip_ratio/high_mean": 0.04138370044529438, "clip_ratio/high_max": 0.04138370044529438, "clip_ratio/region_mean": 0.10146027337759733, "reward_total_mean": 0.24821455776691437, "reward_meter_mean": 0.511986255645752, "reward_meter_std": 0.48121657967567444, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.7669378519058228, "reward_lexical_plausibility_std": 0.23855535686016083, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38875001668930054, "reward_judge_quality_std": 0.4436355531215668, "reward_total_composite_mean": 0.24821455776691437, "reward_total_composite_std": 0.37103891372680664} {"timestamp_utc": "2026-04-12T18:18:05Z", "mode": "train", "global_step": 634, "epoch": 0.033366664912373036, "loss": 0.0847, "grad_norm": 12.01213264465332, "learning_rate": 8.081818181818182e-06, "num_tokens": 1167876.0, "completions/mean_length": 59.625, "completions/min_length": 47.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 59.625, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.4651067554950714, "rewards/meter/std": 0.36555662751197815, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.9450562000274658, "rewards/repeat_penalty/std": 0.026517393067479134, "rewards/repeat_floor/mean": 0.9947631359100342, "rewards/repeat_floor/std": 0.0021158012095838785, "rewards/near_duplicate_penalty/mean": 0.9952726364135742, "rewards/near_duplicate_penalty/std": 0.006237310823053122, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9496915936470032, "rewards/distinct_2/std": 0.03162623941898346, "rewards/total_composite/mean": 0.2696032226085663, "rewards/total_composite/std": 0.2899021804332733, "reward": 0.2696032226085663, "reward_std": 0.2899021506309509, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15532128512859344, "sampling/sampling_logp_difference/max": 2.546969413757324, "sampling/importance_sampling_ratio/min": 0.07831865549087524, "sampling/importance_sampling_ratio/mean": 0.9956446886062622, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.66331672295928, "clip_ratio/low_mean": 0.06250449735671282, "clip_ratio/low_min": 0.06250449735671282, "clip_ratio/high_mean": 0.06522547174245119, "clip_ratio/high_max": 0.06522547174245119, "clip_ratio/region_mean": 0.127729969099164, "reward_total_mean": 0.2696032226085663, "reward_meter_mean": 0.4651067554950714, "reward_meter_std": 0.36555662751197815, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9450562000274658, "reward_repeat_penalty_std": 0.026517393067479134, "reward_repeat_floor_mean": 0.9947631359100342, "reward_repeat_floor_std": 0.0021158012095838785, "reward_near_duplicate_penalty_mean": 0.9952726364135742, "reward_near_duplicate_penalty_std": 0.006237310823053122, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9496915936470032, "reward_distinct_2_std": 0.03162623941898346, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.2696032226085663, "reward_total_composite_std": 0.2899021804332733} {"timestamp_utc": "2026-04-12T18:18:14Z", "mode": "train", "global_step": 635, "epoch": 0.03341929372138309, "loss": 0.0591, "grad_norm": 14.6242036819458, "learning_rate": 8.07878787878788e-06, "num_tokens": 1169377.0, "completions/mean_length": 37.625, "completions/min_length": 30.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.625, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.2919130027294159, "rewards/meter/std": 0.39304572343826294, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7350000143051147, "rewards/judge_quality/std": 0.2655990719795227, "rewards/repeat_penalty/mean": 0.9970802068710327, "rewards/repeat_penalty/std": 0.0040726871229708195, "rewards/repeat_floor/mean": 0.9995620250701904, "rewards/repeat_floor/std": 0.0006109100650064647, "rewards/near_duplicate_penalty/mean": 0.9970802068710327, "rewards/near_duplicate_penalty/std": 0.0040726871229708195, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18419796228408813, "rewards/total_composite/std": 0.301580011844635, "reward": 0.18419796228408813, "reward_std": 0.301580011844635, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1748860478401184, "sampling/sampling_logp_difference/max": 1.8300681114196777, "sampling/importance_sampling_ratio/min": 0.16040264070034027, "sampling/importance_sampling_ratio/mean": 1.0145468711853027, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8902975171804428, "clip_ratio/low_mean": 0.1224973239004612, "clip_ratio/low_min": 0.1224973239004612, "clip_ratio/high_mean": 0.0573300588876009, "clip_ratio/high_max": 0.0573300588876009, "clip_ratio/region_mean": 0.1798273827880621, "reward_total_mean": 0.18419796228408813, "reward_meter_mean": 0.2919130027294159, "reward_meter_std": 0.39304572343826294, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9970802068710327, "reward_repeat_penalty_std": 0.0040726871229708195, "reward_repeat_floor_mean": 0.9995620250701904, "reward_repeat_floor_std": 0.0006109100650064647, "reward_near_duplicate_penalty_mean": 0.9970802068710327, "reward_near_duplicate_penalty_std": 0.0040726871229708195, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7350000143051147, "reward_judge_quality_std": 0.2655990719795227, "reward_total_composite_mean": 0.18419796228408813, "reward_total_composite_std": 0.301580011844635} {"timestamp_utc": "2026-04-12T18:18:28Z", "mode": "train", "global_step": 636, "epoch": 0.03347192253039314, "loss": -0.093, "grad_norm": 3.6681129932403564, "learning_rate": 8.075757575757577e-06, "num_tokens": 1171323.0, "completions/mean_length": 173.25, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 60.333335876464844, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.7711304426193237, "rewards/meter/std": 0.32977500557899475, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8590909242630005, "rewards/lexical_plausibility/std": 0.1982439011335373, "rewards/judge_quality/mean": 0.5600000023841858, "rewards/judge_quality/std": 0.4012124836444855, "rewards/repeat_penalty/mean": 0.9764533042907715, "rewards/repeat_penalty/std": 0.06421243399381638, "rewards/repeat_floor/mean": 0.9976084232330322, "rewards/repeat_floor/std": 0.006407818291336298, "rewards/near_duplicate_penalty/mean": 0.996201753616333, "rewards/near_duplicate_penalty/std": 0.008486887440085411, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9797570705413818, "rewards/distinct_2/std": 0.05725561082363129, "rewards/total_composite/mean": 0.44851696491241455, "rewards/total_composite/std": 0.35535600781440735, "reward": 0.44851696491241455, "reward_std": 0.35535597801208496, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14211297035217285, "sampling/sampling_logp_difference/max": 1.4528303146362305, "sampling/importance_sampling_ratio/min": 0.2339073121547699, "sampling/importance_sampling_ratio/mean": 1.0040576457977295, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.872333899140358, "clip_ratio/low_mean": 0.04713064804673195, "clip_ratio/low_min": 0.04713064804673195, "clip_ratio/high_mean": 0.04814477916806936, "clip_ratio/high_max": 0.04814477916806936, "clip_ratio/region_mean": 0.09527542721480131, "reward_total_mean": 0.44851696491241455, "reward_meter_mean": 0.7711304426193237, "reward_meter_std": 0.32977500557899475, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8590909242630005, "reward_lexical_plausibility_std": 0.1982439011335373, "reward_repeat_penalty_mean": 0.9764533042907715, "reward_repeat_penalty_std": 0.06421243399381638, "reward_repeat_floor_mean": 0.9976084232330322, "reward_repeat_floor_std": 0.006407818291336298, "reward_near_duplicate_penalty_mean": 0.996201753616333, "reward_near_duplicate_penalty_std": 0.008486887440085411, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9797570705413818, "reward_distinct_2_std": 0.05725561082363129, "reward_judge_quality_mean": 0.5600000023841858, "reward_judge_quality_std": 0.4012124836444855, "reward_total_composite_mean": 0.44851696491241455, "reward_total_composite_std": 0.35535600781440735} {"timestamp_utc": "2026-04-12T18:18:37Z", "mode": "train", "global_step": 637, "epoch": 0.03352455133940319, "loss": 0.0649, "grad_norm": 15.80407428741455, "learning_rate": 8.072727272727274e-06, "num_tokens": 1172911.0, "completions/mean_length": 39.5, "completions/min_length": 35.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.5, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.6007897257804871, "rewards/meter/std": 0.3716011345386505, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48749998211860657, "rewards/judge_quality/std": 0.1060660257935524, "rewards/repeat_penalty/mean": 0.9790390133857727, "rewards/repeat_penalty/std": 0.041826989501714706, "rewards/repeat_floor/mean": 0.9973326921463013, "rewards/repeat_floor/std": 0.004962644074112177, "rewards/near_duplicate_penalty/mean": 0.9877128005027771, "rewards/near_duplicate_penalty/std": 0.018546780571341515, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.3065003752708435, "rewards/total_composite/std": 0.22941149771213531, "reward": 0.3065003752708435, "reward_std": 0.22941149771213531, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1655583530664444, "sampling/sampling_logp_difference/max": 1.7887907028198242, "sampling/importance_sampling_ratio/min": 0.1671621948480606, "sampling/importance_sampling_ratio/mean": 1.002976894378662, "sampling/importance_sampling_ratio/max": 1.954919695854187, "entropy": 0.9274764209985733, "clip_ratio/low_mean": 0.06570768170058727, "clip_ratio/low_min": 0.06570768170058727, "clip_ratio/high_mean": 0.05936716962605715, "clip_ratio/high_max": 0.05936716962605715, "clip_ratio/region_mean": 0.12507485132664442, "reward_total_mean": 0.3065003752708435, "reward_meter_mean": 0.6007897257804871, "reward_meter_std": 0.3716011345386505, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9790390133857727, "reward_repeat_penalty_std": 0.041826989501714706, "reward_repeat_floor_mean": 0.9973326921463013, "reward_repeat_floor_std": 0.004962644074112177, "reward_near_duplicate_penalty_mean": 0.9877128005027771, "reward_near_duplicate_penalty_std": 0.018546780571341515, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.48749998211860657, "reward_judge_quality_std": 0.1060660257935524, "reward_total_composite_mean": 0.3065003752708435, "reward_total_composite_std": 0.22941149771213531} {"timestamp_utc": "2026-04-12T18:18:51Z", "mode": "train", "global_step": 638, "epoch": 0.03357718014841324, "loss": -0.1528, "grad_norm": 2.7844018936157227, "learning_rate": 8.069696969696971e-06, "num_tokens": 1174738.0, "completions/mean_length": 188.375, "completions/min_length": 72.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 80.5, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 88.0, "rewards/meter/mean": 0.20511597394943237, "rewards/meter/std": 0.12907274067401886, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.28149792551994324, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9343750476837158, "rewards/count_floor/std": 0.08444937318563461, "rewards/lexical_plausibility/mean": 0.8517034649848938, "rewards/lexical_plausibility/std": 0.2762708067893982, "rewards/judge_quality/mean": 0.35874998569488525, "rewards/judge_quality/std": 0.27105283737182617, "rewards/repeat_penalty/mean": 0.9351958632469177, "rewards/repeat_penalty/std": 0.08337276428937912, "rewards/repeat_floor/mean": 0.9945733547210693, "rewards/repeat_floor/std": 0.005232109688222408, "rewards/near_duplicate_penalty/mean": 0.9915031790733337, "rewards/near_duplicate_penalty/std": 0.010013229213654995, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9746991395950317, "rewards/distinct_2/std": 0.037408240139484406, "rewards/total_composite/mean": 0.07715211063623428, "rewards/total_composite/std": 0.05077496916055679, "reward": 0.07715211063623428, "reward_std": 0.05077496916055679, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1477160006761551, "sampling/sampling_logp_difference/max": 2.1589579582214355, "sampling/importance_sampling_ratio/min": 0.11544536054134369, "sampling/importance_sampling_ratio/mean": 0.9956884384155273, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5546809062361717, "clip_ratio/low_mean": 0.013888888992369175, "clip_ratio/low_min": 0.013888888992369175, "clip_ratio/high_mean": 0.09150512423366308, "clip_ratio/high_max": 0.09150512423366308, "clip_ratio/region_mean": 0.10539401322603226, "reward_total_mean": 0.07715211063623428, "reward_meter_mean": 0.20511597394943237, "reward_meter_std": 0.12907274067401886, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.28149792551994324, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9343750476837158, "reward_count_floor_std": 0.08444937318563461, "reward_lexical_plausibility_mean": 0.8517034649848938, "reward_lexical_plausibility_std": 0.2762708067893982, "reward_repeat_penalty_mean": 0.9351958632469177, "reward_repeat_penalty_std": 0.08337276428937912, "reward_repeat_floor_mean": 0.9945733547210693, "reward_repeat_floor_std": 0.005232109688222408, "reward_near_duplicate_penalty_mean": 0.9915031790733337, "reward_near_duplicate_penalty_std": 0.010013229213654995, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9746991395950317, "reward_distinct_2_std": 0.037408240139484406, "reward_judge_quality_mean": 0.35874998569488525, "reward_judge_quality_std": 0.27105283737182617, "reward_total_composite_mean": 0.07715211063623428, "reward_total_composite_std": 0.05077496916055679} {"timestamp_utc": "2026-04-12T18:18:59Z", "mode": "train", "global_step": 639, "epoch": 0.03362980895742329, "loss": -0.0928, "grad_norm": 12.352059364318848, "learning_rate": 8.066666666666667e-06, "num_tokens": 1176210.0, "completions/mean_length": 37.0, "completions/min_length": 18.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.557997465133667, "rewards/meter/std": 0.4295482635498047, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9237500429153442, "rewards/judge_quality/std": 0.01060659158974886, "rewards/repeat_penalty/mean": 0.9146258234977722, "rewards/repeat_penalty/std": 0.1343667358160019, "rewards/repeat_floor/mean": 0.990487813949585, "rewards/repeat_floor/std": 0.012669355608522892, "rewards/near_duplicate_penalty/mean": 0.9659851789474487, "rewards/near_duplicate_penalty/std": 0.02702588029205799, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9718337059020996, "rewards/distinct_2/std": 0.05414172261953354, "rewards/total_composite/mean": 0.5110194683074951, "rewards/total_composite/std": 0.39803242683410645, "reward": 0.5110194683074951, "reward_std": 0.39803239703178406, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16012847423553467, "sampling/sampling_logp_difference/max": 1.1732993125915527, "sampling/importance_sampling_ratio/min": 0.30934464931488037, "sampling/importance_sampling_ratio/mean": 0.9790233373641968, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8377412855625153, "clip_ratio/low_mean": 0.04780982993543148, "clip_ratio/low_min": 0.04780982993543148, "clip_ratio/high_mean": 0.10969540849328041, "clip_ratio/high_max": 0.10969540849328041, "clip_ratio/region_mean": 0.1575052384287119, "reward_total_mean": 0.5110194683074951, "reward_meter_mean": 0.557997465133667, "reward_meter_std": 0.4295482635498047, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9146258234977722, "reward_repeat_penalty_std": 0.1343667358160019, "reward_repeat_floor_mean": 0.990487813949585, "reward_repeat_floor_std": 0.012669355608522892, "reward_near_duplicate_penalty_mean": 0.9659851789474487, "reward_near_duplicate_penalty_std": 0.02702588029205799, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9718337059020996, "reward_distinct_2_std": 0.05414172261953354, "reward_judge_quality_mean": 0.9237500429153442, "reward_judge_quality_std": 0.01060659158974886, "reward_total_composite_mean": 0.5110194683074951, "reward_total_composite_std": 0.39803242683410645} {"timestamp_utc": "2026-04-12T18:19:08Z", "mode": "train", "global_step": 640, "epoch": 0.03368243776643334, "loss": 0.0464, "grad_norm": 16.527528762817383, "learning_rate": 8.063636363636364e-06, "num_tokens": 1177927.0, "completions/mean_length": 50.625, "completions/min_length": 46.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.625, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.9800794124603271, "rewards/meter/std": 0.011560414917767048, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7475000023841858, "rewards/judge_quality/std": 0.23468825221061707, "rewards/repeat_penalty/mean": 0.9642617702484131, "rewards/repeat_penalty/std": 0.042984336614608765, "rewards/repeat_floor/mean": 0.9960994124412537, "rewards/repeat_floor/std": 0.0045709069818258286, "rewards/near_duplicate_penalty/mean": 0.9893150329589844, "rewards/near_duplicate_penalty/std": 0.014057926833629608, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.974468469619751, "rewards/distinct_2/std": 0.03532608970999718, "rewards/total_composite/mean": 0.7300345301628113, "rewards/total_composite/std": 0.23006996512413025, "reward": 0.7300345301628113, "reward_std": 0.23006996512413025, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16267350316047668, "sampling/sampling_logp_difference/max": 1.480438232421875, "sampling/importance_sampling_ratio/min": 0.22753795981407166, "sampling/importance_sampling_ratio/mean": 1.0314425230026245, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9453489556908607, "clip_ratio/low_mean": 0.04160125646740198, "clip_ratio/low_min": 0.04160125646740198, "clip_ratio/high_mean": 0.09325505793094635, "clip_ratio/high_max": 0.09325505793094635, "clip_ratio/region_mean": 0.13485631439834833, "reward_total_mean": 0.7300345301628113, "reward_meter_mean": 0.9800794124603271, "reward_meter_std": 0.011560414917767048, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9642617702484131, "reward_repeat_penalty_std": 0.042984336614608765, "reward_repeat_floor_mean": 0.9960994124412537, "reward_repeat_floor_std": 0.0045709069818258286, "reward_near_duplicate_penalty_mean": 0.9893150329589844, "reward_near_duplicate_penalty_std": 0.014057926833629608, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.974468469619751, "reward_distinct_2_std": 0.03532608970999718, "reward_judge_quality_mean": 0.7475000023841858, "reward_judge_quality_std": 0.23468825221061707, "reward_total_composite_mean": 0.7300345301628113, "reward_total_composite_std": 0.23006996512413025} {"timestamp_utc": "2026-04-12T18:19:16Z", "mode": "train", "global_step": 641, "epoch": 0.033735066575443395, "loss": 0.1177, "grad_norm": 15.365981101989746, "learning_rate": 8.060606060606061e-06, "num_tokens": 1179713.0, "completions/mean_length": 48.25, "completions/min_length": 42.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.25, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.4804297387599945, "rewards/meter/std": 0.44888126850128174, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9308338165283203, "rewards/repeat_penalty/std": 0.07589451968669891, "rewards/repeat_floor/mean": 0.9913982152938843, "rewards/repeat_floor/std": 0.008873924612998962, "rewards/near_duplicate_penalty/mean": 0.9639303684234619, "rewards/near_duplicate_penalty/std": 0.031476281583309174, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9645408391952515, "rewards/distinct_2/std": 0.05330968648195267, "rewards/total_composite/mean": 0.19269824028015137, "rewards/total_composite/std": 0.17805632948875427, "reward": 0.19269824028015137, "reward_std": 0.17805634438991547, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17214347422122955, "sampling/sampling_logp_difference/max": 1.5031428337097168, "sampling/importance_sampling_ratio/min": 0.2224300056695938, "sampling/importance_sampling_ratio/mean": 1.0379966497421265, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1672176271677017, "clip_ratio/low_mean": 0.06790501344949007, "clip_ratio/low_min": 0.06790501344949007, "clip_ratio/high_mean": 0.07647515553981066, "clip_ratio/high_max": 0.07647515553981066, "clip_ratio/region_mean": 0.14438016898930073, "reward_total_mean": 0.19269824028015137, "reward_meter_mean": 0.4804297387599945, "reward_meter_std": 0.44888126850128174, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.9308338165283203, "reward_repeat_penalty_std": 0.07589451968669891, "reward_repeat_floor_mean": 0.9913982152938843, "reward_repeat_floor_std": 0.008873924612998962, "reward_near_duplicate_penalty_mean": 0.9639303684234619, "reward_near_duplicate_penalty_std": 0.031476281583309174, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9645408391952515, "reward_distinct_2_std": 0.05330968648195267, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.19269824028015137, "reward_total_composite_std": 0.17805632948875427} {"timestamp_utc": "2026-04-12T18:19:30Z", "mode": "train", "global_step": 642, "epoch": 0.03378769538445345, "loss": -0.0601, "grad_norm": 5.796260356903076, "learning_rate": 8.057575757575759e-06, "num_tokens": 1181116.0, "completions/mean_length": 89.375, "completions/min_length": 24.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 29.000001907348633, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.8147009611129761, "rewards/meter/std": 0.3297954201698303, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9335466027259827, "rewards/lexical_plausibility/std": 0.18795861303806305, "rewards/judge_quality/mean": 0.6762499809265137, "rewards/judge_quality/std": 0.32802167534828186, "rewards/repeat_penalty/mean": 0.9793533086776733, "rewards/repeat_penalty/std": 0.03178567439317703, "rewards/repeat_floor/mean": 0.9969362020492554, "rewards/repeat_floor/std": 0.0047591682523489, "rewards/near_duplicate_penalty/mean": 0.9799289703369141, "rewards/near_duplicate_penalty/std": 0.03166106343269348, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.999410092830658, "rewards/distinct_2/std": 0.001668488490395248, "rewards/total_composite/mean": 0.624222993850708, "rewards/total_composite/std": 0.32347583770751953, "reward": 0.624222993850708, "reward_std": 0.32347583770751953, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16572195291519165, "sampling/sampling_logp_difference/max": 1.5920886993408203, "sampling/importance_sampling_ratio/min": 0.20350012183189392, "sampling/importance_sampling_ratio/mean": 1.0216639041900635, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7823265567421913, "clip_ratio/low_mean": 0.045048702508211136, "clip_ratio/low_min": 0.045048702508211136, "clip_ratio/high_mean": 0.0937815411016345, "clip_ratio/high_max": 0.0937815411016345, "clip_ratio/region_mean": 0.13883024360984564, "reward_total_mean": 0.624222993850708, "reward_meter_mean": 0.8147009611129761, "reward_meter_std": 0.3297954201698303, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9335466027259827, "reward_lexical_plausibility_std": 0.18795861303806305, "reward_repeat_penalty_mean": 0.9793533086776733, "reward_repeat_penalty_std": 0.03178567439317703, "reward_repeat_floor_mean": 0.9969362020492554, "reward_repeat_floor_std": 0.0047591682523489, "reward_near_duplicate_penalty_mean": 0.9799289703369141, "reward_near_duplicate_penalty_std": 0.03166106343269348, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.999410092830658, "reward_distinct_2_std": 0.001668488490395248, "reward_judge_quality_mean": 0.6762499809265137, "reward_judge_quality_std": 0.32802167534828186, "reward_total_composite_mean": 0.624222993850708, "reward_total_composite_std": 0.32347583770751953} {"timestamp_utc": "2026-04-12T18:19:44Z", "mode": "train", "global_step": 643, "epoch": 0.0338403241934635, "loss": -0.0559, "grad_norm": 6.062872409820557, "learning_rate": 8.054545454545454e-06, "num_tokens": 1183203.0, "completions/mean_length": 134.875, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 81.0, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 132.0, "rewards/meter/mean": 0.8096573352813721, "rewards/meter/std": 0.27412208914756775, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.2519763112068176, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.07559289783239365, "rewards/lexical_plausibility/mean": 0.9307242631912231, "rewards/lexical_plausibility/std": 0.17208310961723328, "rewards/judge_quality/mean": 0.5387499928474426, "rewards/judge_quality/std": 0.3358757197856903, "rewards/repeat_penalty/mean": 0.947460412979126, "rewards/repeat_penalty/std": 0.08671032637357712, "rewards/repeat_floor/mean": 0.995560884475708, "rewards/repeat_floor/std": 0.005473115481436253, "rewards/near_duplicate_penalty/mean": 0.989499568939209, "rewards/near_duplicate_penalty/std": 0.010304414667189121, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9890109896659851, "rewards/distinct_2/std": 0.031081615015864372, "rewards/total_composite/mean": 0.4117696285247803, "rewards/total_composite/std": 0.303749680519104, "reward": 0.4117696285247803, "reward_std": 0.303749680519104, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13429448008537292, "sampling/sampling_logp_difference/max": 1.6167144775390625, "sampling/importance_sampling_ratio/min": 0.19854995608329773, "sampling/importance_sampling_ratio/mean": 1.0122401714324951, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8179492354393005, "clip_ratio/low_mean": 0.055725112557411194, "clip_ratio/low_min": 0.055725112557411194, "clip_ratio/high_mean": 0.06733083166182041, "clip_ratio/high_max": 0.06733083166182041, "clip_ratio/region_mean": 0.1230559442192316, "reward_total_mean": 0.4117696285247803, "reward_meter_mean": 0.8096573352813721, "reward_meter_std": 0.27412208914756775, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.2519763112068176, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.07559289783239365, "reward_lexical_plausibility_mean": 0.9307242631912231, "reward_lexical_plausibility_std": 0.17208310961723328, "reward_repeat_penalty_mean": 0.947460412979126, "reward_repeat_penalty_std": 0.08671032637357712, "reward_repeat_floor_mean": 0.995560884475708, "reward_repeat_floor_std": 0.005473115481436253, "reward_near_duplicate_penalty_mean": 0.989499568939209, "reward_near_duplicate_penalty_std": 0.010304414667189121, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9890109896659851, "reward_distinct_2_std": 0.031081615015864372, "reward_judge_quality_mean": 0.5387499928474426, "reward_judge_quality_std": 0.3358757197856903, "reward_total_composite_mean": 0.4117696285247803, "reward_total_composite_std": 0.303749680519104} {"timestamp_utc": "2026-04-12T18:19:58Z", "mode": "train", "global_step": 644, "epoch": 0.03389295300247355, "loss": -0.0233, "grad_norm": 4.525539875030518, "learning_rate": 8.051515151515153e-06, "num_tokens": 1184503.0, "completions/mean_length": 84.5, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 23.428571701049805, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.7014280557632446, "rewards/meter/std": 0.4130121171474457, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.933986246585846, "rewards/lexical_plausibility/std": 0.1867150366306305, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.35419678688049316, "rewards/repeat_penalty/mean": 0.7414772510528564, "rewards/repeat_penalty/std": 0.02410591021180153, "rewards/repeat_floor/mean": 0.9832954406738281, "rewards/repeat_floor/std": 0.004821178037673235, "rewards/near_duplicate_penalty/mean": 0.9886363744735718, "rewards/near_duplicate_penalty/std": 0.03214120864868164, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.42818528413772583, "rewards/total_composite/std": 0.4038875102996826, "reward": 0.42818528413772583, "reward_std": 0.40388745069503784, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1365523338317871, "sampling/sampling_logp_difference/max": 1.3165016174316406, "sampling/importance_sampling_ratio/min": 0.2680715024471283, "sampling/importance_sampling_ratio/mean": 1.0119614601135254, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7186261564493179, "clip_ratio/low_mean": 0.06812500022351742, "clip_ratio/low_min": 0.06812500022351742, "clip_ratio/high_mean": 0.0762648219242692, "clip_ratio/high_max": 0.0762648219242692, "clip_ratio/region_mean": 0.14438982214778662, "reward_total_mean": 0.42818528413772583, "reward_meter_mean": 0.7014280557632446, "reward_meter_std": 0.4130121171474457, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.933986246585846, "reward_lexical_plausibility_std": 0.1867150366306305, "reward_repeat_penalty_mean": 0.7414772510528564, "reward_repeat_penalty_std": 0.02410591021180153, "reward_repeat_floor_mean": 0.9832954406738281, "reward_repeat_floor_std": 0.004821178037673235, "reward_near_duplicate_penalty_mean": 0.9886363744735718, "reward_near_duplicate_penalty_std": 0.03214120864868164, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.35419678688049316, "reward_total_composite_mean": 0.42818528413772583, "reward_total_composite_std": 0.4038875102996826} {"timestamp_utc": "2026-04-12T18:20:06Z", "mode": "train", "global_step": 645, "epoch": 0.033945581811483605, "loss": 0.0436, "grad_norm": 30.82151985168457, "learning_rate": 8.048484848484849e-06, "num_tokens": 1185940.0, "completions/mean_length": 18.625, "completions/min_length": 15.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.625, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.9655370712280273, "rewards/meter/std": 0.02885575219988823, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41750001907348633, "rewards/judge_quality/std": 0.3366537094116211, "rewards/repeat_penalty/mean": 0.7392919659614563, "rewards/repeat_penalty/std": 0.030286915600299835, "rewards/repeat_floor/mean": 0.982858419418335, "rewards/repeat_floor/std": 0.006057387217879295, "rewards/near_duplicate_penalty/mean": 0.9857226014137268, "rewards/near_duplicate_penalty/std": 0.04038256034255028, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3927711844444275, "rewards/total_composite/std": 0.31311947107315063, "reward": 0.3927711844444275, "reward_std": 0.31311944127082825, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1656142771244049, "sampling/sampling_logp_difference/max": 1.7993075847625732, "sampling/importance_sampling_ratio/min": 0.16541339457035065, "sampling/importance_sampling_ratio/mean": 0.9998873472213745, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9678597524762154, "clip_ratio/low_mean": 0.08424375578761101, "clip_ratio/low_min": 0.08424375578761101, "clip_ratio/high_mean": 0.0791118424385786, "clip_ratio/high_max": 0.0791118424385786, "clip_ratio/region_mean": 0.1633555982261896, "reward_total_mean": 0.3927711844444275, "reward_meter_mean": 0.9655370712280273, "reward_meter_std": 0.02885575219988823, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7392919659614563, "reward_repeat_penalty_std": 0.030286915600299835, "reward_repeat_floor_mean": 0.982858419418335, "reward_repeat_floor_std": 0.006057387217879295, "reward_near_duplicate_penalty_mean": 0.9857226014137268, "reward_near_duplicate_penalty_std": 0.04038256034255028, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41750001907348633, "reward_judge_quality_std": 0.3366537094116211, "reward_total_composite_mean": 0.3927711844444275, "reward_total_composite_std": 0.31311947107315063} {"timestamp_utc": "2026-04-12T18:20:14Z", "mode": "train", "global_step": 646, "epoch": 0.03399821062049366, "loss": 0.0835, "grad_norm": 17.655353546142578, "learning_rate": 8.045454545454546e-06, "num_tokens": 1187454.0, "completions/mean_length": 26.25, "completions/min_length": 23.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.25, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.8672947287559509, "rewards/meter/std": 0.2532776892185211, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.2558424770832062, "rewards/repeat_penalty/mean": 0.7383207082748413, "rewards/repeat_penalty/std": 0.03303402662277222, "rewards/repeat_floor/mean": 0.982664167881012, "rewards/repeat_floor/std": 0.0066068135201931, "rewards/near_duplicate_penalty/mean": 0.9844275712966919, "rewards/near_duplicate_penalty/std": 0.044045377522706985, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5407683849334717, "rewards/total_composite/std": 0.30127987265586853, "reward": 0.5407683849334717, "reward_std": 0.30127984285354614, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14098912477493286, "sampling/sampling_logp_difference/max": 1.4134750366210938, "sampling/importance_sampling_ratio/min": 0.24329635500907898, "sampling/importance_sampling_ratio/mean": 1.015126347541809, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8547587618231773, "clip_ratio/low_mean": 0.07694461708888412, "clip_ratio/low_min": 0.07694461708888412, "clip_ratio/high_mean": 0.04282794566825032, "clip_ratio/high_max": 0.04282794566825032, "clip_ratio/region_mean": 0.11977256275713444, "reward_total_mean": 0.5407683849334717, "reward_meter_mean": 0.8672947287559509, "reward_meter_std": 0.2532776892185211, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7383207082748413, "reward_repeat_penalty_std": 0.03303402662277222, "reward_repeat_floor_mean": 0.982664167881012, "reward_repeat_floor_std": 0.0066068135201931, "reward_near_duplicate_penalty_mean": 0.9844275712966919, "reward_near_duplicate_penalty_std": 0.044045377522706985, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.2558424770832062, "reward_total_composite_mean": 0.5407683849334717, "reward_total_composite_std": 0.30127987265586853} {"timestamp_utc": "2026-04-12T18:20:24Z", "mode": "train", "global_step": 647, "epoch": 0.03405083942950371, "loss": -0.0292, "grad_norm": 10.391853332519531, "learning_rate": 8.042424242424243e-06, "num_tokens": 1189251.0, "completions/mean_length": 58.625, "completions/min_length": 41.0, "completions/max_length": 70.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.625, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.6281118392944336, "rewards/meter/std": 0.37566012144088745, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9382601976394653, "rewards/repeat_penalty/std": 0.05668553337454796, "rewards/repeat_floor/mean": 0.9934574365615845, "rewards/repeat_floor/std": 0.005714621394872665, "rewards/near_duplicate_penalty/mean": 0.9850168228149414, "rewards/near_duplicate_penalty/std": 0.012420056387782097, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.952276349067688, "rewards/distinct_2/std": 0.05141378566622734, "rewards/total_composite/mean": 0.2798583507537842, "rewards/total_composite/std": 0.16829027235507965, "reward": 0.2798583507537842, "reward_std": 0.16829027235507965, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13313207030296326, "sampling/sampling_logp_difference/max": 2.088466167449951, "sampling/importance_sampling_ratio/min": 0.12387699633836746, "sampling/importance_sampling_ratio/mean": 0.9937934279441833, "sampling/importance_sampling_ratio/max": 1.9726005792617798, "entropy": 0.7814536467194557, "clip_ratio/low_mean": 0.04677249863743782, "clip_ratio/low_min": 0.04677249863743782, "clip_ratio/high_mean": 0.08222942613065243, "clip_ratio/high_max": 0.08222942613065243, "clip_ratio/region_mean": 0.12900192476809025, "reward_total_mean": 0.2798583507537842, "reward_meter_mean": 0.6281118392944336, "reward_meter_std": 0.37566012144088745, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9382601976394653, "reward_repeat_penalty_std": 0.05668553337454796, "reward_repeat_floor_mean": 0.9934574365615845, "reward_repeat_floor_std": 0.005714621394872665, "reward_near_duplicate_penalty_mean": 0.9850168228149414, "reward_near_duplicate_penalty_std": 0.012420056387782097, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.952276349067688, "reward_distinct_2_std": 0.05141378566622734, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.2798583507537842, "reward_total_composite_std": 0.16829027235507965} {"timestamp_utc": "2026-04-12T18:20:32Z", "mode": "train", "global_step": 648, "epoch": 0.03410346823851376, "loss": 0.0954, "grad_norm": 21.5165958404541, "learning_rate": 8.03939393939394e-06, "num_tokens": 1190744.0, "completions/mean_length": 28.625, "completions/min_length": 26.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.625, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.28281521797180176, "rewards/meter/std": 0.2929595410823822, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8387500047683716, "rewards/judge_quality/std": 0.27869275212287903, "rewards/repeat_penalty/mean": 0.9794915914535522, "rewards/repeat_penalty/std": 0.024691898375749588, "rewards/repeat_floor/mean": 0.9969237446784973, "rewards/repeat_floor/std": 0.0037037809379398823, "rewards/near_duplicate_penalty/mean": 0.9794915914535522, "rewards/near_duplicate_penalty/std": 0.024691898375749588, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2579765021800995, "rewards/total_composite/std": 0.2762589752674103, "reward": 0.2579765021800995, "reward_std": 0.2762589752674103, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1504424512386322, "sampling/sampling_logp_difference/max": 1.6232399940490723, "sampling/importance_sampling_ratio/min": 0.24931108951568604, "sampling/importance_sampling_ratio/mean": 1.012108325958252, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6194121949374676, "clip_ratio/low_mean": 0.06246027257293463, "clip_ratio/low_min": 0.06246027257293463, "clip_ratio/high_mean": 0.04237891733646393, "clip_ratio/high_max": 0.04237891733646393, "clip_ratio/region_mean": 0.10483918990939856, "reward_total_mean": 0.2579765021800995, "reward_meter_mean": 0.28281521797180176, "reward_meter_std": 0.2929595410823822, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9794915914535522, "reward_repeat_penalty_std": 0.024691898375749588, "reward_repeat_floor_mean": 0.9969237446784973, "reward_repeat_floor_std": 0.0037037809379398823, "reward_near_duplicate_penalty_mean": 0.9794915914535522, "reward_near_duplicate_penalty_std": 0.024691898375749588, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8387500047683716, "reward_judge_quality_std": 0.27869275212287903, "reward_total_composite_mean": 0.2579765021800995, "reward_total_composite_std": 0.2762589752674103} {"timestamp_utc": "2026-04-12T18:20:43Z", "mode": "train", "global_step": 649, "epoch": 0.034156097047523815, "loss": 0.0498, "grad_norm": 11.147249221801758, "learning_rate": 8.036363636363636e-06, "num_tokens": 1192930.0, "completions/mean_length": 91.25, "completions/min_length": 81.0, "completions/max_length": 100.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 91.25, "completions/min_terminated_length": 81.0, "completions/max_terminated_length": 100.0, "rewards/meter/mean": 0.5871928334236145, "rewards/meter/std": 0.3409288227558136, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.10690449178218842, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9700000286102295, "rewards/count_floor/std": 0.03207135200500488, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5037499666213989, "rewards/judge_quality/std": 0.15202796459197998, "rewards/repeat_penalty/mean": 0.9305137991905212, "rewards/repeat_penalty/std": 0.10091582685709, "rewards/repeat_floor/mean": 0.9933023452758789, "rewards/repeat_floor/std": 0.007848613895475864, "rewards/near_duplicate_penalty/mean": 0.9761093258857727, "rewards/near_duplicate_penalty/std": 0.02028193138539791, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9653991460800171, "rewards/distinct_2/std": 0.05607825890183449, "rewards/total_composite/mean": 0.27145183086395264, "rewards/total_composite/std": 0.14429277181625366, "reward": 0.27145183086395264, "reward_std": 0.14429277181625366, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16846567392349243, "sampling/sampling_logp_difference/max": 2.271028518676758, "sampling/importance_sampling_ratio/min": 0.10320597141981125, "sampling/importance_sampling_ratio/mean": 0.992217481136322, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8758502081036568, "clip_ratio/low_mean": 0.041273620910942554, "clip_ratio/low_min": 0.041273620910942554, "clip_ratio/high_mean": 0.09511497523635626, "clip_ratio/high_max": 0.09511497523635626, "clip_ratio/region_mean": 0.1363885961472988, "reward_total_mean": 0.27145183086395264, "reward_meter_mean": 0.5871928334236145, "reward_meter_std": 0.3409288227558136, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.10690449178218842, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9700000286102295, "reward_count_floor_std": 0.03207135200500488, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9305137991905212, "reward_repeat_penalty_std": 0.10091582685709, "reward_repeat_floor_mean": 0.9933023452758789, "reward_repeat_floor_std": 0.007848613895475864, "reward_near_duplicate_penalty_mean": 0.9761093258857727, "reward_near_duplicate_penalty_std": 0.02028193138539791, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9653991460800171, "reward_distinct_2_std": 0.05607825890183449, "reward_judge_quality_mean": 0.5037499666213989, "reward_judge_quality_std": 0.15202796459197998, "reward_total_composite_mean": 0.27145183086395264, "reward_total_composite_std": 0.14429277181625366} {"timestamp_utc": "2026-04-12T18:20:51Z", "mode": "train", "global_step": 650, "epoch": 0.03420872585653387, "loss": 0.0087, "grad_norm": 23.668455123901367, "learning_rate": 8.033333333333335e-06, "num_tokens": 1194340.0, "completions/mean_length": 19.25, "completions/min_length": 16.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.25, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.8139858245849609, "rewards/meter/std": 0.21032409369945526, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6687500476837158, "rewards/judge_quality/std": 0.3589046001434326, "rewards/repeat_penalty/mean": 0.7229496240615845, "rewards/repeat_penalty/std": 0.07651007920503616, "rewards/repeat_floor/mean": 0.9795899391174316, "rewards/repeat_floor/std": 0.015302024781703949, "rewards/near_duplicate_penalty/mean": 0.9639328122138977, "rewards/near_duplicate_penalty/std": 0.10201343148946762, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5177667140960693, "rewards/total_composite/std": 0.3268375098705292, "reward": 0.5177667140960693, "reward_std": 0.3268374800682068, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1575707495212555, "sampling/sampling_logp_difference/max": 1.1000494956970215, "sampling/importance_sampling_ratio/min": 0.33285459876060486, "sampling/importance_sampling_ratio/mean": 1.0092663764953613, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0452252626419067, "clip_ratio/low_mean": 0.07959280535578728, "clip_ratio/low_min": 0.07959280535578728, "clip_ratio/high_mean": 0.08957219496369362, "clip_ratio/high_max": 0.08957219496369362, "clip_ratio/region_mean": 0.1691650003194809, "reward_total_mean": 0.5177667140960693, "reward_meter_mean": 0.8139858245849609, "reward_meter_std": 0.21032409369945526, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7229496240615845, "reward_repeat_penalty_std": 0.07651007920503616, "reward_repeat_floor_mean": 0.9795899391174316, "reward_repeat_floor_std": 0.015302024781703949, "reward_near_duplicate_penalty_mean": 0.9639328122138977, "reward_near_duplicate_penalty_std": 0.10201343148946762, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6687500476837158, "reward_judge_quality_std": 0.3589046001434326, "reward_total_composite_mean": 0.5177667140960693, "reward_total_composite_std": 0.3268375098705292} {"timestamp_utc": "2026-04-12T18:23:15Z", "mode": "eval", "global_step": 650, "epoch": 0.03420872585653387, "eval_loss": NaN, "eval_runtime": 143.429, "eval_samples_per_second": 0.725, "eval_steps_per_second": 0.091, "eval_num_tokens": 1194340.0, "eval_completions/mean_length": 172.4903846153846, "eval_completions/min_length": 42.23076923076923, "eval_completions/max_length": 394.46153846153845, "eval_completions/clipped_ratio": 0.07692307692307693, "eval_completions/mean_terminated_length": 144.15045870267429, "eval_completions/min_terminated_length": 42.23076923076923, "eval_completions/max_terminated_length": 306.2307692307692, "eval_rewards/meter/mean": 0.5530450894282415, "eval_rewards/meter/std": 0.37604402808042675, "eval_rewards/count_adherence/mean": 0.8929206407987155, "eval_rewards/count_adherence/std": 0.16625133930490568, "eval_rewards/arabic_clean/mean": 0.8653846153846154, "eval_rewards/arabic_clean/std": 0.2337347658780905, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9971153827813956, "eval_rewards/arabic_floor/std": 0.008158923341677738, "eval_rewards/count_floor/mean": 0.9678761867376474, "eval_rewards/count_floor/std": 0.049875402536529764, "eval_rewards/lexical_plausibility/mean": 0.9647191029328567, "eval_rewards/lexical_plausibility/std": 0.0759761416568206, "eval_rewards/judge_quality/mean": 0.3601923103515918, "eval_rewards/judge_quality/std": 0.2043610387123548, "eval_rewards/repeat_penalty/mean": 0.6630720587877127, "eval_rewards/repeat_penalty/std": 0.36234451601138484, "eval_rewards/repeat_floor/mean": 0.9590880824969366, "eval_rewards/repeat_floor/std": 0.049047087820676655, "eval_rewards/near_duplicate_penalty/mean": 0.9166562694769639, "eval_rewards/near_duplicate_penalty/std": 0.10195524646685673, "eval_rewards/opening_diversity/mean": 0.960006805566641, "eval_rewards/opening_diversity/std": 0.07581744271402176, "eval_rewards/distinct_2/mean": 0.7109913780139043, "eval_rewards/distinct_2/std": 0.3618535238962907, "eval_rewards/total_composite/mean": 0.18821023404598236, "eval_rewards/total_composite/std": 0.17175685069881952, "eval_reward": 0.18821023404598236, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.057632267475128174, "eval_sampling/sampling_logp_difference/max": 1.0790939331054688, "eval_sampling/importance_sampling_ratio/min": 0.3468034748847668, "eval_sampling/importance_sampling_ratio/mean": 1.0157257410196157, "eval_sampling/importance_sampling_ratio/max": 1.6122803688049316, "eval_entropy": 0.6549245073245122, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.18821023404598236, "eval_reward_meter_mean": 0.5530450894282415, "eval_reward_meter_std": 0.37604402808042675, "eval_reward_count_adherence_mean": 0.8929206407987155, "eval_reward_count_adherence_std": 0.16625133930490568, "eval_reward_arabic_clean_mean": 0.8653846153846154, "eval_reward_arabic_clean_std": 0.2337347658780905, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9971153827813956, "eval_reward_arabic_floor_std": 0.008158923341677738, "eval_reward_count_floor_mean": 0.9678761867376474, "eval_reward_count_floor_std": 0.049875402536529764, "eval_reward_lexical_plausibility_mean": 0.9647191029328567, "eval_reward_lexical_plausibility_std": 0.0759761416568206, "eval_reward_repeat_penalty_mean": 0.6630720587877127, "eval_reward_repeat_penalty_std": 0.36234451601138484, "eval_reward_repeat_floor_mean": 0.9590880824969366, "eval_reward_repeat_floor_std": 0.049047087820676655, "eval_reward_near_duplicate_penalty_mean": 0.9166562694769639, "eval_reward_near_duplicate_penalty_std": 0.10195524646685673, "eval_reward_opening_diversity_mean": 0.960006805566641, "eval_reward_opening_diversity_std": 0.07581744271402176, "eval_reward_distinct_2_mean": 0.7109913780139043, "eval_reward_distinct_2_std": 0.3618535238962907, "eval_reward_judge_quality_mean": 0.3601923103515918, "eval_reward_judge_quality_std": 0.2043610387123548, "eval_reward_total_composite_mean": 0.18821023404598236, "eval_reward_total_composite_std": 0.17175685069881952} {"timestamp_utc": "2026-04-12T18:23:31Z", "mode": "train", "global_step": 651, "epoch": 0.03426135466554392, "loss": -0.0388, "grad_norm": 2.5974252223968506, "learning_rate": 8.03030303030303e-06, "num_tokens": 1195733.0, "completions/mean_length": 149.125, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 28.166667938232422, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.6173913478851318, "rewards/meter/std": 0.4526126980781555, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.887458324432373, "rewards/lexical_plausibility/std": 0.20905417203903198, "rewards/judge_quality/mean": 0.643750011920929, "rewards/judge_quality/std": 0.40074706077575684, "rewards/repeat_penalty/mean": 0.7300152778625488, "rewards/repeat_penalty/std": 0.037389468401670456, "rewards/repeat_floor/mean": 0.9810030460357666, "rewards/repeat_floor/std": 0.007477888371795416, "rewards/near_duplicate_penalty/mean": 0.9733536243438721, "rewards/near_duplicate_penalty/std": 0.04985261708498001, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4706975817680359, "rewards/total_composite/std": 0.4523340165615082, "reward": 0.4706975817680359, "reward_std": 0.4523339867591858, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10816600173711777, "sampling/sampling_logp_difference/max": 0.9233765602111816, "sampling/importance_sampling_ratio/min": 0.39717569947242737, "sampling/importance_sampling_ratio/mean": 1.0162279605865479, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7349778488278389, "clip_ratio/low_mean": 0.045770203694701195, "clip_ratio/low_min": 0.045770203694701195, "clip_ratio/high_mean": 0.0504464297555387, "clip_ratio/high_max": 0.0504464297555387, "clip_ratio/region_mean": 0.0962166334502399, "reward_total_mean": 0.4706975817680359, "reward_meter_mean": 0.6173913478851318, "reward_meter_std": 0.4526126980781555, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.887458324432373, "reward_lexical_plausibility_std": 0.20905417203903198, "reward_repeat_penalty_mean": 0.7300152778625488, "reward_repeat_penalty_std": 0.037389468401670456, "reward_repeat_floor_mean": 0.9810030460357666, "reward_repeat_floor_std": 0.007477888371795416, "reward_near_duplicate_penalty_mean": 0.9733536243438721, "reward_near_duplicate_penalty_std": 0.04985261708498001, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.643750011920929, "reward_judge_quality_std": 0.40074706077575684, "reward_total_composite_mean": 0.4706975817680359, "reward_total_composite_std": 0.4523340165615082} {"timestamp_utc": "2026-04-12T18:23:39Z", "mode": "train", "global_step": 652, "epoch": 0.03431398347455397, "loss": 0.0121, "grad_norm": 17.63026237487793, "learning_rate": 8.027272727272728e-06, "num_tokens": 1197362.0, "completions/mean_length": 43.625, "completions/min_length": 39.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.625, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.13537968695163727, "rewards/meter/std": 0.10082083940505981, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45500001311302185, "rewards/judge_quality/std": 0.31883716583251953, "rewards/repeat_penalty/mean": 0.9507007002830505, "rewards/repeat_penalty/std": 0.054731372743844986, "rewards/repeat_floor/mean": 0.9936259984970093, "rewards/repeat_floor/std": 0.006548299919813871, "rewards/near_duplicate_penalty/mean": 0.9693484306335449, "rewards/near_duplicate_penalty/std": 0.02757902257144451, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9802631139755249, "rewards/distinct_2/std": 0.036561544984579086, "rewards/total_composite/mean": 0.07122999429702759, "rewards/total_composite/std": 0.07895796746015549, "reward": 0.07122999429702759, "reward_std": 0.07895796746015549, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1790056824684143, "sampling/sampling_logp_difference/max": 1.7705345153808594, "sampling/importance_sampling_ratio/min": 0.17024196684360504, "sampling/importance_sampling_ratio/mean": 1.005855917930603, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9491819888353348, "clip_ratio/low_mean": 0.10563959507271647, "clip_ratio/low_min": 0.10563959507271647, "clip_ratio/high_mean": 0.03306686133146286, "clip_ratio/high_max": 0.03306686133146286, "clip_ratio/region_mean": 0.13870645640417933, "reward_total_mean": 0.07122999429702759, "reward_meter_mean": 0.13537968695163727, "reward_meter_std": 0.10082083940505981, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9507007002830505, "reward_repeat_penalty_std": 0.054731372743844986, "reward_repeat_floor_mean": 0.9936259984970093, "reward_repeat_floor_std": 0.006548299919813871, "reward_near_duplicate_penalty_mean": 0.9693484306335449, "reward_near_duplicate_penalty_std": 0.02757902257144451, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9802631139755249, "reward_distinct_2_std": 0.036561544984579086, "reward_judge_quality_mean": 0.45500001311302185, "reward_judge_quality_std": 0.31883716583251953, "reward_total_composite_mean": 0.07122999429702759, "reward_total_composite_std": 0.07895796746015549} {"timestamp_utc": "2026-04-12T18:23:47Z", "mode": "train", "global_step": 653, "epoch": 0.034366612283564024, "loss": 0.0321, "grad_norm": 21.393150329589844, "learning_rate": 8.024242424242425e-06, "num_tokens": 1198911.0, "completions/mean_length": 38.625, "completions/min_length": 35.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.625, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.8580807447433472, "rewards/meter/std": 0.11206099390983582, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7900000214576721, "rewards/judge_quality/std": 0.24219238758087158, "rewards/repeat_penalty/mean": 0.8240015506744385, "rewards/repeat_penalty/std": 0.1576167792081833, "rewards/repeat_floor/mean": 0.9794058203697205, "rewards/repeat_floor/std": 0.015769105404615402, "rewards/near_duplicate_penalty/mean": 0.915531575679779, "rewards/near_duplicate_penalty/std": 0.058078352361917496, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9536231160163879, "rewards/distinct_2/std": 0.0537121407687664, "rewards/total_composite/mean": 0.6526845097541809, "rewards/total_composite/std": 0.1951036900281906, "reward": 0.6526845097541809, "reward_std": 0.1951036900281906, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1395138055086136, "sampling/sampling_logp_difference/max": 1.578580617904663, "sampling/importance_sampling_ratio/min": 0.20626765489578247, "sampling/importance_sampling_ratio/mean": 0.9674643278121948, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7222080230712891, "clip_ratio/low_mean": 0.03467680676840246, "clip_ratio/low_min": 0.03467680676840246, "clip_ratio/high_mean": 0.08485455485060811, "clip_ratio/high_max": 0.08485455485060811, "clip_ratio/region_mean": 0.11953136161901057, "reward_total_mean": 0.6526845097541809, "reward_meter_mean": 0.8580807447433472, "reward_meter_std": 0.11206099390983582, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8240015506744385, "reward_repeat_penalty_std": 0.1576167792081833, "reward_repeat_floor_mean": 0.9794058203697205, "reward_repeat_floor_std": 0.015769105404615402, "reward_near_duplicate_penalty_mean": 0.915531575679779, "reward_near_duplicate_penalty_std": 0.058078352361917496, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9536231160163879, "reward_distinct_2_std": 0.0537121407687664, "reward_judge_quality_mean": 0.7900000214576721, "reward_judge_quality_std": 0.24219238758087158, "reward_total_composite_mean": 0.6526845097541809, "reward_total_composite_std": 0.1951036900281906} {"timestamp_utc": "2026-04-12T18:23:56Z", "mode": "train", "global_step": 654, "epoch": 0.03441924109257408, "loss": 0.0812, "grad_norm": 16.97374153137207, "learning_rate": 8.021212121212122e-06, "num_tokens": 1200514.0, "completions/mean_length": 44.375, "completions/min_length": 39.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.375, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.7214658260345459, "rewards/meter/std": 0.38603147864341736, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.731249988079071, "rewards/judge_quality/std": 0.2623213827610016, "rewards/repeat_penalty/mean": 0.9975759387016296, "rewards/repeat_penalty/std": 0.004586003255099058, "rewards/repeat_floor/mean": 0.9996364116668701, "rewards/repeat_floor/std": 0.0006879009888507426, "rewards/near_duplicate_penalty/mean": 0.9975759387016296, "rewards/near_duplicate_penalty/std": 0.004586003255099058, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5430784821510315, "rewards/total_composite/std": 0.36221033334732056, "reward": 0.5430784821510315, "reward_std": 0.36221033334732056, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15669618546962738, "sampling/sampling_logp_difference/max": 2.4407830238342285, "sampling/importance_sampling_ratio/min": 0.08709262311458588, "sampling/importance_sampling_ratio/mean": 0.9790434837341309, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8368480801582336, "clip_ratio/low_mean": 0.0603094594553113, "clip_ratio/low_min": 0.0603094594553113, "clip_ratio/high_mean": 0.06950508616864681, "clip_ratio/high_max": 0.06950508616864681, "clip_ratio/region_mean": 0.1298145456239581, "reward_total_mean": 0.5430784821510315, "reward_meter_mean": 0.7214658260345459, "reward_meter_std": 0.38603147864341736, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9975759387016296, "reward_repeat_penalty_std": 0.004586003255099058, "reward_repeat_floor_mean": 0.9996364116668701, "reward_repeat_floor_std": 0.0006879009888507426, "reward_near_duplicate_penalty_mean": 0.9975759387016296, "reward_near_duplicate_penalty_std": 0.004586003255099058, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.731249988079071, "reward_judge_quality_std": 0.2623213827610016, "reward_total_composite_mean": 0.5430784821510315, "reward_total_composite_std": 0.36221033334732056} {"timestamp_utc": "2026-04-12T18:24:06Z", "mode": "train", "global_step": 655, "epoch": 0.03447186990158413, "loss": 0.0361, "grad_norm": 15.985350608825684, "learning_rate": 8.018181818181818e-06, "num_tokens": 1202280.0, "completions/mean_length": 49.75, "completions/min_length": 43.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 49.75, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.6333403587341309, "rewards/meter/std": 0.47195398807525635, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.2558424770832062, "rewards/repeat_penalty/mean": 0.9566726684570312, "rewards/repeat_penalty/std": 0.0907059758901596, "rewards/repeat_floor/mean": 0.9943370819091797, "rewards/repeat_floor/std": 0.012737623415887356, "rewards/near_duplicate_penalty/mean": 0.9732609987258911, "rewards/near_duplicate_penalty/std": 0.07100581377744675, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9816433191299438, "rewards/distinct_2/std": 0.03404124453663826, "rewards/total_composite/mean": 0.3853573203086853, "rewards/total_composite/std": 0.35687434673309326, "reward": 0.3853573203086853, "reward_std": 0.35687434673309326, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.174941286444664, "sampling/sampling_logp_difference/max": 2.0234832763671875, "sampling/importance_sampling_ratio/min": 0.13219419121742249, "sampling/importance_sampling_ratio/mean": 1.038133144378662, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9822410717606544, "clip_ratio/low_mean": 0.08968568500131369, "clip_ratio/low_min": 0.08968568500131369, "clip_ratio/high_mean": 0.06355504505336285, "clip_ratio/high_max": 0.06355504505336285, "clip_ratio/region_mean": 0.15324073005467653, "reward_total_mean": 0.3853573203086853, "reward_meter_mean": 0.6333403587341309, "reward_meter_std": 0.47195398807525635, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9566726684570312, "reward_repeat_penalty_std": 0.0907059758901596, "reward_repeat_floor_mean": 0.9943370819091797, "reward_repeat_floor_std": 0.012737623415887356, "reward_near_duplicate_penalty_mean": 0.9732609987258911, "reward_near_duplicate_penalty_std": 0.07100581377744675, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9816433191299438, "reward_distinct_2_std": 0.03404124453663826, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.2558424770832062, "reward_total_composite_mean": 0.3853573203086853, "reward_total_composite_std": 0.35687434673309326} {"timestamp_utc": "2026-04-12T18:24:16Z", "mode": "train", "global_step": 656, "epoch": 0.03452449871059418, "loss": 0.0567, "grad_norm": 19.898828506469727, "learning_rate": 8.015151515151515e-06, "num_tokens": 1204389.0, "completions/mean_length": 75.625, "completions/min_length": 62.0, "completions/max_length": 91.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 75.625, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.7478793859481812, "rewards/meter/std": 0.34890758991241455, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.04008918255567551, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9390250444412231, "rewards/repeat_penalty/std": 0.08215352892875671, "rewards/repeat_floor/mean": 0.9923896789550781, "rewards/repeat_floor/std": 0.009498625062406063, "rewards/near_duplicate_penalty/mean": 0.9681970477104187, "rewards/near_duplicate_penalty/std": 0.029523510485887527, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9684461951255798, "rewards/distinct_2/std": 0.058879781514406204, "rewards/total_composite/mean": 0.28587985038757324, "rewards/total_composite/std": 0.13996566832065582, "reward": 0.28587985038757324, "reward_std": 0.13996566832065582, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12708786129951477, "sampling/sampling_logp_difference/max": 2.4431800842285156, "sampling/importance_sampling_ratio/min": 0.08688411116600037, "sampling/importance_sampling_ratio/mean": 0.9986262321472168, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6703781709074974, "clip_ratio/low_mean": 0.03569597098976374, "clip_ratio/low_min": 0.03569597098976374, "clip_ratio/high_mean": 0.10775001719594002, "clip_ratio/high_max": 0.10775001719594002, "clip_ratio/region_mean": 0.14344598818570375, "reward_total_mean": 0.28587985038757324, "reward_meter_mean": 0.7478793859481812, "reward_meter_std": 0.34890758991241455, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.04008918255567551, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9390250444412231, "reward_repeat_penalty_std": 0.08215352892875671, "reward_repeat_floor_mean": 0.9923896789550781, "reward_repeat_floor_std": 0.009498625062406063, "reward_near_duplicate_penalty_mean": 0.9681970477104187, "reward_near_duplicate_penalty_std": 0.029523510485887527, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9684461951255798, "reward_distinct_2_std": 0.058879781514406204, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.28587985038757324, "reward_total_composite_std": 0.13996566832065582} {"timestamp_utc": "2026-04-12T18:24:28Z", "mode": "train", "global_step": 657, "epoch": 0.034577127519604234, "loss": 0.02, "grad_norm": 7.60475492477417, "learning_rate": 8.012121212121214e-06, "num_tokens": 1207249.0, "completions/mean_length": 156.5, "completions/min_length": 142.0, "completions/max_length": 177.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 156.5, "completions/min_terminated_length": 142.0, "completions/max_terminated_length": 177.0, "rewards/meter/mean": 0.9543006420135498, "rewards/meter/std": 0.031204799190163612, "rewards/count_adherence/mean": 0.8928571939468384, "rewards/count_adherence/std": 0.06613000482320786, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9678571224212646, "rewards/count_floor/std": 0.01983901485800743, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.5310271382331848, "rewards/repeat_penalty/std": 0.2053688019514084, "rewards/repeat_floor/mean": 0.9489916563034058, "rewards/repeat_floor/std": 0.024536121636629105, "rewards/near_duplicate_penalty/mean": 0.8843667507171631, "rewards/near_duplicate_penalty/std": 0.052286289632320404, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.625962495803833, "rewards/distinct_2/std": 0.19003194570541382, "rewards/total_composite/mean": 0.3189767003059387, "rewards/total_composite/std": 0.09191308915615082, "reward": 0.3189767003059387, "reward_std": 0.09191308170557022, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12917010486125946, "sampling/sampling_logp_difference/max": 3.227461814880371, "sampling/importance_sampling_ratio/min": 0.03965802863240242, "sampling/importance_sampling_ratio/mean": 0.9982758164405823, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6592458188533783, "clip_ratio/low_mean": 0.04193478776142001, "clip_ratio/low_min": 0.04193478776142001, "clip_ratio/high_mean": 0.06408673897385597, "clip_ratio/high_max": 0.06408673897385597, "clip_ratio/region_mean": 0.10602152673527598, "reward_total_mean": 0.3189767003059387, "reward_meter_mean": 0.9543006420135498, "reward_meter_std": 0.031204799190163612, "reward_count_adherence_mean": 0.8928571939468384, "reward_count_adherence_std": 0.06613000482320786, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9678571224212646, "reward_count_floor_std": 0.01983901485800743, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5310271382331848, "reward_repeat_penalty_std": 0.2053688019514084, "reward_repeat_floor_mean": 0.9489916563034058, "reward_repeat_floor_std": 0.024536121636629105, "reward_near_duplicate_penalty_mean": 0.8843667507171631, "reward_near_duplicate_penalty_std": 0.052286289632320404, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.625962495803833, "reward_distinct_2_std": 0.19003194570541382, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.3189767003059387, "reward_total_composite_std": 0.09191308915615082} {"timestamp_utc": "2026-04-12T18:24:37Z", "mode": "train", "global_step": 658, "epoch": 0.034629756328614286, "loss": 0.0536, "grad_norm": 11.497108459472656, "learning_rate": 8.00909090909091e-06, "num_tokens": 1209149.0, "completions/mean_length": 69.5, "completions/min_length": 46.0, "completions/max_length": 78.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 69.5, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 78.0, "rewards/meter/mean": 0.26256340742111206, "rewards/meter/std": 0.252474844455719, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5175000429153442, "rewards/judge_quality/std": 0.2522328794002533, "rewards/repeat_penalty/mean": 0.8825502991676331, "rewards/repeat_penalty/std": 0.11305183917284012, "rewards/repeat_floor/mean": 0.9860538244247437, "rewards/repeat_floor/std": 0.013264486566185951, "rewards/near_duplicate_penalty/mean": 0.953132152557373, "rewards/near_duplicate_penalty/std": 0.038152847439050674, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9231554865837097, "rewards/distinct_2/std": 0.08683669567108154, "rewards/total_composite/mean": 0.10729870200157166, "rewards/total_composite/std": 0.07448439300060272, "reward": 0.10729870200157166, "reward_std": 0.07448439300060272, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15363150835037231, "sampling/sampling_logp_difference/max": 1.8525729179382324, "sampling/importance_sampling_ratio/min": 0.15683312714099884, "sampling/importance_sampling_ratio/mean": 1.017725944519043, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9719163253903389, "clip_ratio/low_mean": 0.0824795812368393, "clip_ratio/low_min": 0.0824795812368393, "clip_ratio/high_mean": 0.07663781940937042, "clip_ratio/high_max": 0.07663781940937042, "clip_ratio/region_mean": 0.15911740064620972, "reward_total_mean": 0.10729870200157166, "reward_meter_mean": 0.26256340742111206, "reward_meter_std": 0.252474844455719, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8825502991676331, "reward_repeat_penalty_std": 0.11305183917284012, "reward_repeat_floor_mean": 0.9860538244247437, "reward_repeat_floor_std": 0.013264486566185951, "reward_near_duplicate_penalty_mean": 0.953132152557373, "reward_near_duplicate_penalty_std": 0.038152847439050674, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9231554865837097, "reward_distinct_2_std": 0.08683669567108154, "reward_judge_quality_mean": 0.5175000429153442, "reward_judge_quality_std": 0.2522328794002533, "reward_total_composite_mean": 0.10729870200157166, "reward_total_composite_std": 0.07448439300060272} {"timestamp_utc": "2026-04-12T18:24:46Z", "mode": "train", "global_step": 659, "epoch": 0.03468238513762434, "loss": 0.0404, "grad_norm": 8.06682300567627, "learning_rate": 8.006060606060607e-06, "num_tokens": 1211519.0, "completions/mean_length": 98.25, "completions/min_length": 93.0, "completions/max_length": 105.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 98.25, "completions/min_terminated_length": 93.0, "completions/max_terminated_length": 105.0, "rewards/meter/mean": 0.8991388082504272, "rewards/meter/std": 0.20196320116519928, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9399999976158142, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.24512389302253723, "rewards/repeat_penalty/mean": 0.8384352326393127, "rewards/repeat_penalty/std": 0.07862620055675507, "rewards/repeat_floor/mean": 0.9821255803108215, "rewards/repeat_floor/std": 0.008544066920876503, "rewards/near_duplicate_penalty/mean": 0.9539580345153809, "rewards/near_duplicate_penalty/std": 0.0216944869607687, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8781321048736572, "rewards/distinct_2/std": 0.07006164640188217, "rewards/total_composite/mean": 0.4534206986427307, "rewards/total_composite/std": 0.2501770257949829, "reward": 0.4534206986427307, "reward_std": 0.2501770555973053, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14626868069171906, "sampling/sampling_logp_difference/max": 2.8476009368896484, "sampling/importance_sampling_ratio/min": 0.05798326060175896, "sampling/importance_sampling_ratio/mean": 1.0070701837539673, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7126376032829285, "clip_ratio/low_mean": 0.0903792018070817, "clip_ratio/low_min": 0.0903792018070817, "clip_ratio/high_mean": 0.03862307220697403, "clip_ratio/high_max": 0.03862307220697403, "clip_ratio/region_mean": 0.12900227401405573, "reward_total_mean": 0.4534206986427307, "reward_meter_mean": 0.8991388082504272, "reward_meter_std": 0.20196320116519928, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9399999976158142, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8384352326393127, "reward_repeat_penalty_std": 0.07862620055675507, "reward_repeat_floor_mean": 0.9821255803108215, "reward_repeat_floor_std": 0.008544066920876503, "reward_near_duplicate_penalty_mean": 0.9539580345153809, "reward_near_duplicate_penalty_std": 0.0216944869607687, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8781321048736572, "reward_distinct_2_std": 0.07006164640188217, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.24512389302253723, "reward_total_composite_mean": 0.4534206986427307, "reward_total_composite_std": 0.2501770257949829} {"timestamp_utc": "2026-04-12T18:24:59Z", "mode": "train", "global_step": 660, "epoch": 0.03473501394663439, "loss": -0.0491, "grad_norm": 5.477097511291504, "learning_rate": 8.003030303030304e-06, "num_tokens": 1213052.0, "completions/mean_length": 96.625, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.28571701049805, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.5391556024551392, "rewards/meter/std": 0.48435178399086, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9576091766357422, "rewards/lexical_plausibility/std": 0.11989942193031311, "rewards/judge_quality/mean": 0.6187499761581421, "rewards/judge_quality/std": 0.3486069440841675, "rewards/repeat_penalty/mean": 0.9880307912826538, "rewards/repeat_penalty/std": 0.018162276595830917, "rewards/repeat_floor/mean": 0.9982045888900757, "rewards/repeat_floor/std": 0.0027243425138294697, "rewards/near_duplicate_penalty/mean": 0.9880307912826538, "rewards/near_duplicate_penalty/std": 0.018162276595830917, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4118770956993103, "rewards/total_composite/std": 0.4354664981365204, "reward": 0.4118770956993103, "reward_std": 0.4354664981365204, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17071758210659027, "sampling/sampling_logp_difference/max": 1.2555642127990723, "sampling/importance_sampling_ratio/min": 0.2887059152126312, "sampling/importance_sampling_ratio/mean": 1.0242204666137695, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.218810312449932, "clip_ratio/low_mean": 0.0668847281485796, "clip_ratio/low_min": 0.0668847281485796, "clip_ratio/high_mean": 0.08562177047133446, "clip_ratio/high_max": 0.08562177047133446, "clip_ratio/region_mean": 0.15250649861991405, "reward_total_mean": 0.4118770956993103, "reward_meter_mean": 0.5391556024551392, "reward_meter_std": 0.48435178399086, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9576091766357422, "reward_lexical_plausibility_std": 0.11989942193031311, "reward_repeat_penalty_mean": 0.9880307912826538, "reward_repeat_penalty_std": 0.018162276595830917, "reward_repeat_floor_mean": 0.9982045888900757, "reward_repeat_floor_std": 0.0027243425138294697, "reward_near_duplicate_penalty_mean": 0.9880307912826538, "reward_near_duplicate_penalty_std": 0.018162276595830917, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6187499761581421, "reward_judge_quality_std": 0.3486069440841675, "reward_total_composite_mean": 0.4118770956993103, "reward_total_composite_std": 0.4354664981365204} {"timestamp_utc": "2026-04-12T18:25:09Z", "mode": "train", "global_step": 661, "epoch": 0.034787642755644436, "loss": 0.005, "grad_norm": 12.345144271850586, "learning_rate": 8.000000000000001e-06, "num_tokens": 1214979.0, "completions/mean_length": 66.875, "completions/min_length": 58.0, "completions/max_length": 74.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 66.875, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.37197738885879517, "rewards/meter/std": 0.30547118186950684, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.11259915679693222, "rewards/repeat_penalty/mean": 0.868878960609436, "rewards/repeat_penalty/std": 0.20396563410758972, "rewards/repeat_floor/mean": 0.9853951334953308, "rewards/repeat_floor/std": 0.020186908543109894, "rewards/near_duplicate_penalty/mean": 0.9496092200279236, "rewards/near_duplicate_penalty/std": 0.04659753665328026, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9217078685760498, "rewards/distinct_2/std": 0.14931339025497437, "rewards/total_composite/mean": 0.14806479215621948, "rewards/total_composite/std": 0.14574910700321198, "reward": 0.14806479215621948, "reward_std": 0.14574910700321198, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1938203126192093, "sampling/sampling_logp_difference/max": 2.2001328468322754, "sampling/importance_sampling_ratio/min": 0.11078843474388123, "sampling/importance_sampling_ratio/mean": 0.9971727728843689, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0106062814593315, "clip_ratio/low_mean": 0.1024552658200264, "clip_ratio/low_min": 0.1024552658200264, "clip_ratio/high_mean": 0.07076810393482447, "clip_ratio/high_max": 0.07076810393482447, "clip_ratio/region_mean": 0.17322336975485086, "reward_total_mean": 0.14806479215621948, "reward_meter_mean": 0.37197738885879517, "reward_meter_std": 0.30547118186950684, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.868878960609436, "reward_repeat_penalty_std": 0.20396563410758972, "reward_repeat_floor_mean": 0.9853951334953308, "reward_repeat_floor_std": 0.020186908543109894, "reward_near_duplicate_penalty_mean": 0.9496092200279236, "reward_near_duplicate_penalty_std": 0.04659753665328026, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9217078685760498, "reward_distinct_2_std": 0.14931339025497437, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.11259915679693222, "reward_total_composite_mean": 0.14806479215621948, "reward_total_composite_std": 0.14574910700321198} {"timestamp_utc": "2026-04-12T18:25:17Z", "mode": "train", "global_step": 662, "epoch": 0.03484027156465449, "loss": 0.0818, "grad_norm": 19.352556228637695, "learning_rate": 7.996969696969697e-06, "num_tokens": 1216304.0, "completions/mean_length": 19.625, "completions/min_length": 16.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.625, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.7257665991783142, "rewards/meter/std": 0.36524754762649536, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.2737569510936737, "rewards/repeat_penalty/mean": 0.7424530386924744, "rewards/repeat_penalty/std": 0.01428307592868805, "rewards/repeat_floor/mean": 0.9834905862808228, "rewards/repeat_floor/std": 0.0028566198889166117, "rewards/near_duplicate_penalty/mean": 0.9899373650550842, "rewards/near_duplicate_penalty/std": 0.019044118002057076, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.36046797037124634, "rewards/total_composite/std": 0.2924782633781433, "reward": 0.36046797037124634, "reward_std": 0.2924782633781433, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1191195622086525, "sampling/sampling_logp_difference/max": 1.4371376037597656, "sampling/importance_sampling_ratio/min": 0.23760691285133362, "sampling/importance_sampling_ratio/mean": 1.0074163675308228, "sampling/importance_sampling_ratio/max": 1.9916117191314697, "entropy": 0.7898770570755005, "clip_ratio/low_mean": 0.0730695123784244, "clip_ratio/low_min": 0.0730695123784244, "clip_ratio/high_mean": 0.029389881063252687, "clip_ratio/high_max": 0.029389881063252687, "clip_ratio/region_mean": 0.1024593934416771, "reward_total_mean": 0.36046797037124634, "reward_meter_mean": 0.7257665991783142, "reward_meter_std": 0.36524754762649536, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7424530386924744, "reward_repeat_penalty_std": 0.01428307592868805, "reward_repeat_floor_mean": 0.9834905862808228, "reward_repeat_floor_std": 0.0028566198889166117, "reward_near_duplicate_penalty_mean": 0.9899373650550842, "reward_near_duplicate_penalty_std": 0.019044118002057076, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.2737569510936737, "reward_total_composite_mean": 0.36046797037124634, "reward_total_composite_std": 0.2924782633781433} {"timestamp_utc": "2026-04-12T18:25:26Z", "mode": "train", "global_step": 663, "epoch": 0.03489290037366454, "loss": 0.1183, "grad_norm": 11.3187894821167, "learning_rate": 7.993939393939396e-06, "num_tokens": 1218200.0, "completions/mean_length": 71.0, "completions/min_length": 46.0, "completions/max_length": 88.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 71.0, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 88.0, "rewards/meter/mean": 0.7428855299949646, "rewards/meter/std": 0.24329309165477753, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9718749523162842, "rewards/count_floor/std": 0.05580177903175354, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390502154827118, "rewards/repeat_penalty/mean": 0.7145324349403381, "rewards/repeat_penalty/std": 0.2663004994392395, "rewards/repeat_floor/mean": 0.9650921821594238, "rewards/repeat_floor/std": 0.032483767718076706, "rewards/near_duplicate_penalty/mean": 0.8942155241966248, "rewards/near_duplicate_penalty/std": 0.07663911581039429, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.7936513423919678, "rewards/distinct_2/std": 0.22877711057662964, "rewards/total_composite/mean": 0.3045590817928314, "rewards/total_composite/std": 0.16305504739284515, "reward": 0.3045590817928314, "reward_std": 0.16305504739284515, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1332339197397232, "sampling/sampling_logp_difference/max": 1.6979243755340576, "sampling/importance_sampling_ratio/min": 0.1830631047487259, "sampling/importance_sampling_ratio/mean": 1.0138534307479858, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8701349049806595, "clip_ratio/low_mean": 0.04047085391357541, "clip_ratio/low_min": 0.04047085391357541, "clip_ratio/high_mean": 0.09771819226443768, "clip_ratio/high_max": 0.09771819226443768, "clip_ratio/region_mean": 0.1381890461780131, "reward_total_mean": 0.3045590817928314, "reward_meter_mean": 0.7428855299949646, "reward_meter_std": 0.24329309165477753, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9718749523162842, "reward_count_floor_std": 0.05580177903175354, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7145324349403381, "reward_repeat_penalty_std": 0.2663004994392395, "reward_repeat_floor_mean": 0.9650921821594238, "reward_repeat_floor_std": 0.032483767718076706, "reward_near_duplicate_penalty_mean": 0.8942155241966248, "reward_near_duplicate_penalty_std": 0.07663911581039429, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.7936513423919678, "reward_distinct_2_std": 0.22877711057662964, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390502154827118, "reward_total_composite_mean": 0.3045590817928314, "reward_total_composite_std": 0.16305504739284515} {"timestamp_utc": "2026-04-12T18:25:40Z", "mode": "train", "global_step": 664, "epoch": 0.034945529182674594, "loss": -0.0174, "grad_norm": 6.1547770500183105, "learning_rate": 7.990909090909091e-06, "num_tokens": 1220048.0, "completions/mean_length": 130.0, "completions/min_length": 58.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 75.42857360839844, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 90.0, "rewards/meter/mean": 0.4293666481971741, "rewards/meter/std": 0.3880077302455902, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.04008918255567551, "rewards/lexical_plausibility/mean": 0.9557690620422363, "rewards/lexical_plausibility/std": 0.1251039057970047, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.1922609806060791, "rewards/repeat_penalty/mean": 0.9673750400543213, "rewards/repeat_penalty/std": 0.07846193760633469, "rewards/repeat_floor/mean": 0.9960489273071289, "rewards/repeat_floor/std": 0.009111514315009117, "rewards/near_duplicate_penalty/mean": 0.9854937195777893, "rewards/near_duplicate_penalty/std": 0.02757568471133709, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9802761077880859, "rewards/distinct_2/std": 0.05578751116991043, "rewards/total_composite/mean": 0.21620672941207886, "rewards/total_composite/std": 0.2470053881406784, "reward": 0.21620672941207886, "reward_std": 0.2470053732395172, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17725621163845062, "sampling/sampling_logp_difference/max": 1.9277033805847168, "sampling/importance_sampling_ratio/min": 0.14548194408416748, "sampling/importance_sampling_ratio/mean": 0.9795347452163696, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8164736106991768, "clip_ratio/low_mean": 0.06796471774578094, "clip_ratio/low_min": 0.06796471774578094, "clip_ratio/high_mean": 0.05850048363208771, "clip_ratio/high_max": 0.05850048363208771, "clip_ratio/region_mean": 0.12646520137786865, "reward_total_mean": 0.21620672941207886, "reward_meter_mean": 0.4293666481971741, "reward_meter_std": 0.3880077302455902, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.04008918255567551, "reward_lexical_plausibility_mean": 0.9557690620422363, "reward_lexical_plausibility_std": 0.1251039057970047, "reward_repeat_penalty_mean": 0.9673750400543213, "reward_repeat_penalty_std": 0.07846193760633469, "reward_repeat_floor_mean": 0.9960489273071289, "reward_repeat_floor_std": 0.009111514315009117, "reward_near_duplicate_penalty_mean": 0.9854937195777893, "reward_near_duplicate_penalty_std": 0.02757568471133709, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9802761077880859, "reward_distinct_2_std": 0.05578751116991043, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.1922609806060791, "reward_total_composite_mean": 0.21620672941207886, "reward_total_composite_std": 0.2470053881406784} {"timestamp_utc": "2026-04-12T18:25:55Z", "mode": "train", "global_step": 665, "epoch": 0.034998157991684646, "loss": -0.0639, "grad_norm": 2.945300579071045, "learning_rate": 7.987878787878789e-06, "num_tokens": 1221582.0, "completions/mean_length": 155.75, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.23700128495693207, "rewards/meter/std": 0.32466304302215576, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9007634520530701, "rewards/lexical_plausibility/std": 0.1845458298921585, "rewards/judge_quality/mean": 0.5762499570846558, "rewards/judge_quality/std": 0.3991396725177765, "rewards/repeat_penalty/mean": 0.9618940353393555, "rewards/repeat_penalty/std": 0.09047530591487885, "rewards/repeat_floor/mean": 0.9970256090164185, "rewards/repeat_floor/std": 0.005870083346962929, "rewards/near_duplicate_penalty/mean": 0.9926705360412598, "rewards/near_duplicate_penalty/std": 0.0076141818426549435, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.06932878494262695, "rewards/total_composite/std": 0.06364665925502777, "reward": 0.06932878494262695, "reward_std": 0.06364665180444717, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12925459444522858, "sampling/sampling_logp_difference/max": 1.3852972984313965, "sampling/importance_sampling_ratio/min": 0.25024938583374023, "sampling/importance_sampling_ratio/mean": 1.0308729410171509, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6449528858065605, "clip_ratio/low_mean": 0.048448532819747925, "clip_ratio/low_min": 0.048448532819747925, "clip_ratio/high_mean": 0.058286977000534534, "clip_ratio/high_max": 0.058286977000534534, "clip_ratio/region_mean": 0.10673550982028246, "reward_total_mean": 0.06932878494262695, "reward_meter_mean": 0.23700128495693207, "reward_meter_std": 0.32466304302215576, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9007634520530701, "reward_lexical_plausibility_std": 0.1845458298921585, "reward_repeat_penalty_mean": 0.9618940353393555, "reward_repeat_penalty_std": 0.09047530591487885, "reward_repeat_floor_mean": 0.9970256090164185, "reward_repeat_floor_std": 0.005870083346962929, "reward_near_duplicate_penalty_mean": 0.9926705360412598, "reward_near_duplicate_penalty_std": 0.0076141818426549435, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5762499570846558, "reward_judge_quality_std": 0.3991396725177765, "reward_total_composite_mean": 0.06932878494262695, "reward_total_composite_std": 0.06364665925502777} {"timestamp_utc": "2026-04-12T18:26:09Z", "mode": "train", "global_step": 666, "epoch": 0.0350507868006947, "loss": -0.0735, "grad_norm": 6.352017879486084, "learning_rate": 7.984848484848486e-06, "num_tokens": 1223199.0, "completions/mean_length": 105.125, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.000003814697266, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.5255693197250366, "rewards/meter/std": 0.35454121232032776, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9167780876159668, "rewards/lexical_plausibility/std": 0.160339817404747, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.16850179433822632, "rewards/repeat_penalty/mean": 0.8807878494262695, "rewards/repeat_penalty/std": 0.16998426616191864, "rewards/repeat_floor/mean": 0.986284077167511, "rewards/repeat_floor/std": 0.019304540008306503, "rewards/near_duplicate_penalty/mean": 0.9594157934188843, "rewards/near_duplicate_penalty/std": 0.049862559884786606, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9360747933387756, "rewards/distinct_2/std": 0.08389385044574738, "rewards/total_composite/mean": 0.20649249851703644, "rewards/total_composite/std": 0.14781621098518372, "reward": 0.20649249851703644, "reward_std": 0.14781621098518372, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15539716184139252, "sampling/sampling_logp_difference/max": 1.267641544342041, "sampling/importance_sampling_ratio/min": 0.28149473667144775, "sampling/importance_sampling_ratio/mean": 1.0176290273666382, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.932106114923954, "clip_ratio/low_mean": 0.05587620520964265, "clip_ratio/low_min": 0.05587620520964265, "clip_ratio/high_mean": 0.054037779569625854, "clip_ratio/high_max": 0.054037779569625854, "clip_ratio/region_mean": 0.1099139847792685, "reward_total_mean": 0.20649249851703644, "reward_meter_mean": 0.5255693197250366, "reward_meter_std": 0.35454121232032776, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9167780876159668, "reward_lexical_plausibility_std": 0.160339817404747, "reward_repeat_penalty_mean": 0.8807878494262695, "reward_repeat_penalty_std": 0.16998426616191864, "reward_repeat_floor_mean": 0.986284077167511, "reward_repeat_floor_std": 0.019304540008306503, "reward_near_duplicate_penalty_mean": 0.9594157934188843, "reward_near_duplicate_penalty_std": 0.049862559884786606, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9360747933387756, "reward_distinct_2_std": 0.08389385044574738, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.16850179433822632, "reward_total_composite_mean": 0.20649249851703644, "reward_total_composite_std": 0.14781621098518372} {"timestamp_utc": "2026-04-12T18:26:17Z", "mode": "train", "global_step": 667, "epoch": 0.03510341560970475, "loss": 0.0458, "grad_norm": 15.202601432800293, "learning_rate": 7.981818181818183e-06, "num_tokens": 1224678.0, "completions/mean_length": 43.875, "completions/min_length": 36.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.875, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.34886667132377625, "rewards/meter/std": 0.3690391182899475, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8224999904632568, "rewards/judge_quality/std": 0.2149917185306549, "rewards/repeat_penalty/mean": 0.9940017461776733, "rewards/repeat_penalty/std": 0.008982398547232151, "rewards/repeat_floor/mean": 0.9991002082824707, "rewards/repeat_floor/std": 0.0013473600847646594, "rewards/near_duplicate_penalty/mean": 0.9940017461776733, "rewards/near_duplicate_penalty/std": 0.008982398547232151, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.23189206421375275, "rewards/total_composite/std": 0.2210950255393982, "reward": 0.23189206421375275, "reward_std": 0.2210950255393982, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15299059450626373, "sampling/sampling_logp_difference/max": 2.9912333488464355, "sampling/importance_sampling_ratio/min": 0.050225455313920975, "sampling/importance_sampling_ratio/mean": 1.007691740989685, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8653842359781265, "clip_ratio/low_mean": 0.05927872471511364, "clip_ratio/low_min": 0.05927872471511364, "clip_ratio/high_mean": 0.0809075040742755, "clip_ratio/high_max": 0.0809075040742755, "clip_ratio/region_mean": 0.14018622878938913, "reward_total_mean": 0.23189206421375275, "reward_meter_mean": 0.34886667132377625, "reward_meter_std": 0.3690391182899475, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9940017461776733, "reward_repeat_penalty_std": 0.008982398547232151, "reward_repeat_floor_mean": 0.9991002082824707, "reward_repeat_floor_std": 0.0013473600847646594, "reward_near_duplicate_penalty_mean": 0.9940017461776733, "reward_near_duplicate_penalty_std": 0.008982398547232151, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8224999904632568, "reward_judge_quality_std": 0.2149917185306549, "reward_total_composite_mean": 0.23189206421375275, "reward_total_composite_std": 0.2210950255393982} {"timestamp_utc": "2026-04-12T18:26:31Z", "mode": "train", "global_step": 668, "epoch": 0.0351560444187148, "loss": -0.0703, "grad_norm": 4.15318489074707, "learning_rate": 7.978787878787879e-06, "num_tokens": 1226224.0, "completions/mean_length": 101.25, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 42.57143020629883, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.9759743213653564, "rewards/meter/std": 0.017037374898791313, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9503446817398071, "rewards/lexical_plausibility/std": 0.14044636487960815, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.30875036120414734, "rewards/repeat_penalty/mean": 0.9090670347213745, "rewards/repeat_penalty/std": 0.10325290262699127, "rewards/repeat_floor/mean": 0.9900355935096741, "rewards/repeat_floor/std": 0.010023010894656181, "rewards/near_duplicate_penalty/mean": 0.9582163095474243, "rewards/near_duplicate_penalty/std": 0.03900682181119919, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9797570705413818, "rewards/distinct_2/std": 0.05725561082363129, "rewards/total_composite/mean": 0.43802177906036377, "rewards/total_composite/std": 0.2764167785644531, "reward": 0.43802177906036377, "reward_std": 0.2764167785644531, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13032785058021545, "sampling/sampling_logp_difference/max": 1.1505379676818848, "sampling/importance_sampling_ratio/min": 0.31646648049354553, "sampling/importance_sampling_ratio/mean": 1.0114279985427856, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7039266526699066, "clip_ratio/low_mean": 0.0689329276792705, "clip_ratio/low_min": 0.0689329276792705, "clip_ratio/high_mean": 0.04873995203524828, "clip_ratio/high_max": 0.04873995203524828, "clip_ratio/region_mean": 0.11767287971451879, "reward_total_mean": 0.43802177906036377, "reward_meter_mean": 0.9759743213653564, "reward_meter_std": 0.017037374898791313, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9503446817398071, "reward_lexical_plausibility_std": 0.14044636487960815, "reward_repeat_penalty_mean": 0.9090670347213745, "reward_repeat_penalty_std": 0.10325290262699127, "reward_repeat_floor_mean": 0.9900355935096741, "reward_repeat_floor_std": 0.010023010894656181, "reward_near_duplicate_penalty_mean": 0.9582163095474243, "reward_near_duplicate_penalty_std": 0.03900682181119919, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9797570705413818, "reward_distinct_2_std": 0.05725561082363129, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.30875036120414734, "reward_total_composite_mean": 0.43802177906036377, "reward_total_composite_std": 0.2764167785644531} {"timestamp_utc": "2026-04-12T18:26:40Z", "mode": "train", "global_step": 669, "epoch": 0.035208673227724856, "loss": 0.0085, "grad_norm": 11.956597328186035, "learning_rate": 7.975757575757576e-06, "num_tokens": 1228293.0, "completions/mean_length": 65.625, "completions/min_length": 55.0, "completions/max_length": 80.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.625, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.6452656984329224, "rewards/meter/std": 0.3540770709514618, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.9240579009056091, "rewards/repeat_penalty/std": 0.1628832221031189, "rewards/repeat_floor/mean": 0.990271270275116, "rewards/repeat_floor/std": 0.0208668764680624, "rewards/near_duplicate_penalty/mean": 0.964903712272644, "rewards/near_duplicate_penalty/std": 0.06764344871044159, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9503968358039856, "rewards/distinct_2/std": 0.11965266615152359, "rewards/total_composite/mean": 0.3070964515209198, "rewards/total_composite/std": 0.23158514499664307, "reward": 0.3070964515209198, "reward_std": 0.23158514499664307, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1716596931219101, "sampling/sampling_logp_difference/max": 1.6606016159057617, "sampling/importance_sampling_ratio/min": 0.19002461433410645, "sampling/importance_sampling_ratio/mean": 1.0029100179672241, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0608155205845833, "clip_ratio/low_mean": 0.07844012696295977, "clip_ratio/low_min": 0.07844012696295977, "clip_ratio/high_mean": 0.09136004652827978, "clip_ratio/high_max": 0.09136004652827978, "clip_ratio/region_mean": 0.16980017349123955, "reward_total_mean": 0.3070964515209198, "reward_meter_mean": 0.6452656984329224, "reward_meter_std": 0.3540770709514618, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9240579009056091, "reward_repeat_penalty_std": 0.1628832221031189, "reward_repeat_floor_mean": 0.990271270275116, "reward_repeat_floor_std": 0.0208668764680624, "reward_near_duplicate_penalty_mean": 0.964903712272644, "reward_near_duplicate_penalty_std": 0.06764344871044159, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9503968358039856, "reward_distinct_2_std": 0.11965266615152359, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.3070964515209198, "reward_total_composite_std": 0.23158514499664307} {"timestamp_utc": "2026-04-12T18:26:49Z", "mode": "train", "global_step": 670, "epoch": 0.03526130203673491, "loss": 0.0393, "grad_norm": 17.505361557006836, "learning_rate": 7.972727272727273e-06, "num_tokens": 1229799.0, "completions/mean_length": 27.25, "completions/min_length": 23.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.25, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.8154100179672241, "rewards/meter/std": 0.3197248876094818, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.27969372272491455, "rewards/repeat_penalty/mean": 0.862553596496582, "rewards/repeat_penalty/std": 0.1551109403371811, "rewards/repeat_floor/mean": 0.984084963798523, "rewards/repeat_floor/std": 0.016064923256635666, "rewards/near_duplicate_penalty/mean": 0.9442561864852905, "rewards/near_duplicate_penalty/std": 0.04105212911963463, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9369060397148132, "rewards/distinct_2/std": 0.09271392226219177, "rewards/total_composite/mean": 0.4442387819290161, "rewards/total_composite/std": 0.2854630947113037, "reward": 0.4442387819290161, "reward_std": 0.2854630649089813, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15387241542339325, "sampling/sampling_logp_difference/max": 2.130800724029541, "sampling/importance_sampling_ratio/min": 0.1851322054862976, "sampling/importance_sampling_ratio/mean": 1.0311537981033325, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5915060341358185, "clip_ratio/low_mean": 0.11391397751867771, "clip_ratio/low_min": 0.11391397751867771, "clip_ratio/high_mean": 0.03840579837560654, "clip_ratio/high_max": 0.03840579837560654, "clip_ratio/region_mean": 0.15231977589428425, "reward_total_mean": 0.4442387819290161, "reward_meter_mean": 0.8154100179672241, "reward_meter_std": 0.3197248876094818, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.862553596496582, "reward_repeat_penalty_std": 0.1551109403371811, "reward_repeat_floor_mean": 0.984084963798523, "reward_repeat_floor_std": 0.016064923256635666, "reward_near_duplicate_penalty_mean": 0.9442561864852905, "reward_near_duplicate_penalty_std": 0.04105212911963463, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9369060397148132, "reward_distinct_2_std": 0.09271392226219177, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.27969372272491455, "reward_total_composite_mean": 0.4442387819290161, "reward_total_composite_std": 0.2854630947113037} {"timestamp_utc": "2026-04-12T18:27:02Z", "mode": "train", "global_step": 671, "epoch": 0.03531393084574496, "loss": -0.0711, "grad_norm": 6.52949333190918, "learning_rate": 7.96969696969697e-06, "num_tokens": 1231529.0, "completions/mean_length": 112.25, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 55.142860412597656, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.6141881346702576, "rewards/meter/std": 0.3707980513572693, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9398908019065857, "rewards/lexical_plausibility/std": 0.17001453042030334, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.892742931842804, "rewards/repeat_penalty/std": 0.1296996772289276, "rewards/repeat_floor/mean": 0.9892590045928955, "rewards/repeat_floor/std": 0.009078697301447392, "rewards/near_duplicate_penalty/mean": 0.958815336227417, "rewards/near_duplicate_penalty/std": 0.020125899463891983, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9492966532707214, "rewards/distinct_2/std": 0.07004464417695999, "rewards/total_composite/mean": 0.2518628239631653, "rewards/total_composite/std": 0.15881061553955078, "reward": 0.2518628239631653, "reward_std": 0.15881061553955078, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16067443788051605, "sampling/sampling_logp_difference/max": 2.0222206115722656, "sampling/importance_sampling_ratio/min": 0.13236121833324432, "sampling/importance_sampling_ratio/mean": 1.0222755670547485, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9634770527482033, "clip_ratio/low_mean": 0.0635985555127263, "clip_ratio/low_min": 0.0635985555127263, "clip_ratio/high_mean": 0.08093888964504004, "clip_ratio/high_max": 0.08093888964504004, "clip_ratio/region_mean": 0.14453744515776634, "reward_total_mean": 0.2518628239631653, "reward_meter_mean": 0.6141881346702576, "reward_meter_std": 0.3707980513572693, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9398908019065857, "reward_lexical_plausibility_std": 0.17001453042030334, "reward_repeat_penalty_mean": 0.892742931842804, "reward_repeat_penalty_std": 0.1296996772289276, "reward_repeat_floor_mean": 0.9892590045928955, "reward_repeat_floor_std": 0.009078697301447392, "reward_near_duplicate_penalty_mean": 0.958815336227417, "reward_near_duplicate_penalty_std": 0.020125899463891983, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9492966532707214, "reward_distinct_2_std": 0.07004464417695999, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.2518628239631653, "reward_total_composite_std": 0.15881061553955078} {"timestamp_utc": "2026-04-12T18:27:11Z", "mode": "train", "global_step": 672, "epoch": 0.03536655965475501, "loss": 0.0048, "grad_norm": 14.852743148803711, "learning_rate": 7.966666666666668e-06, "num_tokens": 1233204.0, "completions/mean_length": 50.375, "completions/min_length": 45.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.375, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.708685040473938, "rewards/meter/std": 0.2926980257034302, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.71875, "rewards/judge_quality/std": 0.2794605791568756, "rewards/repeat_penalty/mean": 0.9886763095855713, "rewards/repeat_penalty/std": 0.008414451964199543, "rewards/repeat_floor/mean": 0.9983013868331909, "rewards/repeat_floor/std": 0.001262169098481536, "rewards/near_duplicate_penalty/mean": 0.9886763095855713, "rewards/near_duplicate_penalty/std": 0.008414451964199543, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4904243052005768, "rewards/total_composite/std": 0.2901962101459503, "reward": 0.4904243052005768, "reward_std": 0.2901962399482727, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14661242067813873, "sampling/sampling_logp_difference/max": 1.7159264087677002, "sampling/importance_sampling_ratio/min": 0.17979709804058075, "sampling/importance_sampling_ratio/mean": 1.0275498628616333, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7641573995351791, "clip_ratio/low_mean": 0.10392376780509949, "clip_ratio/low_min": 0.10392376780509949, "clip_ratio/high_mean": 0.05837436392903328, "clip_ratio/high_max": 0.05837436392903328, "clip_ratio/region_mean": 0.16229813173413277, "reward_total_mean": 0.4904243052005768, "reward_meter_mean": 0.708685040473938, "reward_meter_std": 0.2926980257034302, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9886763095855713, "reward_repeat_penalty_std": 0.008414451964199543, "reward_repeat_floor_mean": 0.9983013868331909, "reward_repeat_floor_std": 0.001262169098481536, "reward_near_duplicate_penalty_mean": 0.9886763095855713, "reward_near_duplicate_penalty_std": 0.008414451964199543, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.71875, "reward_judge_quality_std": 0.2794605791568756, "reward_total_composite_mean": 0.4904243052005768, "reward_total_composite_std": 0.2901962101459503} {"timestamp_utc": "2026-04-12T18:27:18Z", "mode": "train", "global_step": 673, "epoch": 0.035419188463765065, "loss": -0.0381, "grad_norm": 20.308509826660156, "learning_rate": 7.963636363636365e-06, "num_tokens": 1234615.0, "completions/mean_length": 23.375, "completions/min_length": 19.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.375, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.6716791987419128, "rewards/meter/std": 0.44118791818618774, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.9624999761581421, "rewards/arabic_floor/std": 0.06943649053573608, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9635416269302368, "rewards/lexical_plausibility/std": 0.05970953777432442, "rewards/judge_quality/mean": 0.5512499809265137, "rewards/judge_quality/std": 0.3296508193016052, "rewards/repeat_penalty/mean": 0.7041395902633667, "rewards/repeat_penalty/std": 0.08856705576181412, "rewards/repeat_floor/mean": 0.9758279323577881, "rewards/repeat_floor/std": 0.01771341636776924, "rewards/near_duplicate_penalty/mean": 0.9388527870178223, "rewards/near_duplicate_penalty/std": 0.11808940768241882, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4570765197277069, "rewards/total_composite/std": 0.3698100447654724, "reward": 0.4570765197277069, "reward_std": 0.36981001496315, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16632592678070068, "sampling/sampling_logp_difference/max": 1.8005461692810059, "sampling/importance_sampling_ratio/min": 0.165208637714386, "sampling/importance_sampling_ratio/mean": 1.0142191648483276, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1466046571731567, "clip_ratio/low_mean": 0.08267162414267659, "clip_ratio/low_min": 0.08267162414267659, "clip_ratio/high_mean": 0.04982286598533392, "clip_ratio/high_max": 0.04982286598533392, "clip_ratio/region_mean": 0.1324944901280105, "reward_total_mean": 0.4570765197277069, "reward_meter_mean": 0.6716791987419128, "reward_meter_std": 0.44118791818618774, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.9624999761581421, "reward_arabic_floor_std": 0.06943649053573608, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9635416269302368, "reward_lexical_plausibility_std": 0.05970953777432442, "reward_repeat_penalty_mean": 0.7041395902633667, "reward_repeat_penalty_std": 0.08856705576181412, "reward_repeat_floor_mean": 0.9758279323577881, "reward_repeat_floor_std": 0.01771341636776924, "reward_near_duplicate_penalty_mean": 0.9388527870178223, "reward_near_duplicate_penalty_std": 0.11808940768241882, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5512499809265137, "reward_judge_quality_std": 0.3296508193016052, "reward_total_composite_mean": 0.4570765197277069, "reward_total_composite_std": 0.3698100447654724} {"timestamp_utc": "2026-04-12T18:27:33Z", "mode": "train", "global_step": 674, "epoch": 0.03547181727277512, "loss": -0.0736, "grad_norm": 5.6915693283081055, "learning_rate": 7.96060606060606e-06, "num_tokens": 1236181.0, "completions/mean_length": 105.75, "completions/min_length": 42.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.71428680419922, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.8384084701538086, "rewards/meter/std": 0.31080061197280884, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9239732027053833, "rewards/lexical_plausibility/std": 0.2150362730026245, "rewards/judge_quality/mean": 0.6424999833106995, "rewards/judge_quality/std": 0.3556382656097412, "rewards/repeat_penalty/mean": 0.9916764497756958, "rewards/repeat_penalty/std": 0.011654396541416645, "rewards/repeat_floor/mean": 0.9987514615058899, "rewards/repeat_floor/std": 0.0017481568502262235, "rewards/near_duplicate_penalty/mean": 0.9916764497756958, "rewards/near_duplicate_penalty/std": 0.011654396541416645, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5048578977584839, "rewards/total_composite/std": 0.369978129863739, "reward": 0.5048578977584839, "reward_std": 0.369978129863739, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12830685079097748, "sampling/sampling_logp_difference/max": 1.4864661693572998, "sampling/importance_sampling_ratio/min": 0.22617049515247345, "sampling/importance_sampling_ratio/mean": 1.0071234703063965, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8284262157976627, "clip_ratio/low_mean": 0.07619910221546888, "clip_ratio/low_min": 0.07619910221546888, "clip_ratio/high_mean": 0.05265436973422766, "clip_ratio/high_max": 0.05265436973422766, "clip_ratio/region_mean": 0.12885347194969654, "reward_total_mean": 0.5048578977584839, "reward_meter_mean": 0.8384084701538086, "reward_meter_std": 0.31080061197280884, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9239732027053833, "reward_lexical_plausibility_std": 0.2150362730026245, "reward_repeat_penalty_mean": 0.9916764497756958, "reward_repeat_penalty_std": 0.011654396541416645, "reward_repeat_floor_mean": 0.9987514615058899, "reward_repeat_floor_std": 0.0017481568502262235, "reward_near_duplicate_penalty_mean": 0.9916764497756958, "reward_near_duplicate_penalty_std": 0.011654396541416645, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6424999833106995, "reward_judge_quality_std": 0.3556382656097412, "reward_total_composite_mean": 0.5048578977584839, "reward_total_composite_std": 0.369978129863739} {"timestamp_utc": "2026-04-12T18:27:47Z", "mode": "train", "global_step": 675, "epoch": 0.03552444608178517, "loss": -0.1414, "grad_norm": 4.438897132873535, "learning_rate": 7.957575757575758e-06, "num_tokens": 1238134.0, "completions/mean_length": 135.125, "completions/min_length": 64.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 81.28572082519531, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.7689068913459778, "rewards/meter/std": 0.3179732859134674, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.2086307406425476, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.06258923560380936, "rewards/lexical_plausibility/mean": 0.9577388763427734, "rewards/lexical_plausibility/std": 0.11953240633010864, "rewards/judge_quality/mean": 0.5012499690055847, "rewards/judge_quality/std": 0.2806338369846344, "rewards/repeat_penalty/mean": 0.8501274585723877, "rewards/repeat_penalty/std": 0.11462368071079254, "rewards/repeat_floor/mean": 0.9848185181617737, "rewards/repeat_floor/std": 0.011386548168957233, "rewards/near_duplicate_penalty/mean": 0.9630175232887268, "rewards/near_duplicate_penalty/std": 0.030681267380714417, "rewards/opening_diversity/mean": 0.9609375, "rewards/opening_diversity/std": 0.08799287676811218, "rewards/distinct_2/mean": 0.9189959764480591, "rewards/distinct_2/std": 0.08283697813749313, "rewards/total_composite/mean": 0.38563209772109985, "rewards/total_composite/std": 0.23907926678657532, "reward": 0.38563209772109985, "reward_std": 0.23907926678657532, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13266560435295105, "sampling/sampling_logp_difference/max": 1.4092607498168945, "sampling/importance_sampling_ratio/min": 0.24432383477687836, "sampling/importance_sampling_ratio/mean": 1.0034555196762085, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7219468057155609, "clip_ratio/low_mean": 0.015625, "clip_ratio/low_min": 0.015625, "clip_ratio/high_mean": 0.11606972105801105, "clip_ratio/high_max": 0.11606972105801105, "clip_ratio/region_mean": 0.13169472105801105, "reward_total_mean": 0.38563209772109985, "reward_meter_mean": 0.7689068913459778, "reward_meter_std": 0.3179732859134674, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.2086307406425476, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.06258923560380936, "reward_lexical_plausibility_mean": 0.9577388763427734, "reward_lexical_plausibility_std": 0.11953240633010864, "reward_repeat_penalty_mean": 0.8501274585723877, "reward_repeat_penalty_std": 0.11462368071079254, "reward_repeat_floor_mean": 0.9848185181617737, "reward_repeat_floor_std": 0.011386548168957233, "reward_near_duplicate_penalty_mean": 0.9630175232887268, "reward_near_duplicate_penalty_std": 0.030681267380714417, "reward_opening_diversity_mean": 0.9609375, "reward_opening_diversity_std": 0.08799287676811218, "reward_distinct_2_mean": 0.9189959764480591, "reward_distinct_2_std": 0.08283697813749313, "reward_judge_quality_mean": 0.5012499690055847, "reward_judge_quality_std": 0.2806338369846344, "reward_total_composite_mean": 0.38563209772109985, "reward_total_composite_std": 0.23907926678657532} {"timestamp_utc": "2026-04-12T18:27:58Z", "mode": "train", "global_step": 676, "epoch": 0.03557707489079522, "loss": 0.0206, "grad_norm": 7.080842018127441, "learning_rate": 7.954545454545455e-06, "num_tokens": 1241062.0, "completions/mean_length": 186.0, "completions/min_length": 158.0, "completions/max_length": 210.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 186.0, "completions/min_terminated_length": 158.0, "completions/max_terminated_length": 210.0, "rewards/meter/mean": 0.3150366544723511, "rewards/meter/std": 0.21612221002578735, "rewards/count_adherence/mean": 0.930555522441864, "rewards/count_adherence/std": 0.08266931027173996, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9791666865348816, "rewards/count_floor/std": 0.024800799787044525, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.27125000953674316, "rewards/judge_quality/std": 0.2713162302970886, "rewards/repeat_penalty/mean": 0.1303415447473526, "rewards/repeat_penalty/std": 0.2778764069080353, "rewards/repeat_floor/mean": 0.8890479207038879, "rewards/repeat_floor/std": 0.04458707943558693, "rewards/near_duplicate_penalty/mean": 0.7908244132995605, "rewards/near_duplicate_penalty/std": 0.13213153183460236, "rewards/opening_diversity/mean": 0.956250011920929, "rewards/opening_diversity/std": 0.09038607776165009, "rewards/distinct_2/mean": 0.14499200880527496, "rewards/distinct_2/std": 0.2861138582229614, "rewards/total_composite/mean": 0.08844363689422607, "rewards/total_composite/std": 0.11938827484846115, "reward": 0.08844363689422607, "reward_std": 0.11938827484846115, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10392284393310547, "sampling/sampling_logp_difference/max": 7.570887088775635, "sampling/importance_sampling_ratio/min": 0.0005152351805008948, "sampling/importance_sampling_ratio/mean": 1.0054212808609009, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5497882030904293, "clip_ratio/low_mean": 0.0376412901096046, "clip_ratio/low_min": 0.0376412901096046, "clip_ratio/high_mean": 0.0315225669182837, "clip_ratio/high_max": 0.0315225669182837, "clip_ratio/region_mean": 0.0691638570278883, "reward_total_mean": 0.08844363689422607, "reward_meter_mean": 0.3150366544723511, "reward_meter_std": 0.21612221002578735, "reward_count_adherence_mean": 0.930555522441864, "reward_count_adherence_std": 0.08266931027173996, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9791666865348816, "reward_count_floor_std": 0.024800799787044525, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.1303415447473526, "reward_repeat_penalty_std": 0.2778764069080353, "reward_repeat_floor_mean": 0.8890479207038879, "reward_repeat_floor_std": 0.04458707943558693, "reward_near_duplicate_penalty_mean": 0.7908244132995605, "reward_near_duplicate_penalty_std": 0.13213153183460236, "reward_opening_diversity_mean": 0.956250011920929, "reward_opening_diversity_std": 0.09038607776165009, "reward_distinct_2_mean": 0.14499200880527496, "reward_distinct_2_std": 0.2861138582229614, "reward_judge_quality_mean": 0.27125000953674316, "reward_judge_quality_std": 0.2713162302970886, "reward_total_composite_mean": 0.08844363689422607, "reward_total_composite_std": 0.11938827484846115} {"timestamp_utc": "2026-04-12T18:28:07Z", "mode": "train", "global_step": 677, "epoch": 0.035629703699805275, "loss": 0.051, "grad_norm": 17.90215492248535, "learning_rate": 7.951515151515152e-06, "num_tokens": 1242564.0, "completions/mean_length": 39.75, "completions/min_length": 34.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.75, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.8788691759109497, "rewards/meter/std": 0.14421789348125458, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8062499761581421, "rewards/judge_quality/std": 0.22012579441070557, "rewards/repeat_penalty/mean": 0.9963901042938232, "rewards/repeat_penalty/std": 0.005558798089623451, "rewards/repeat_floor/mean": 0.9994585514068604, "rewards/repeat_floor/std": 0.0008338202023878694, "rewards/near_duplicate_penalty/mean": 0.9963901042938232, "rewards/near_duplicate_penalty/std": 0.005558798089623451, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6976757049560547, "rewards/total_composite/std": 0.2032840996980667, "reward": 0.6976757049560547, "reward_std": 0.2032841145992279, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15710601210594177, "sampling/sampling_logp_difference/max": 1.5675959587097168, "sampling/importance_sampling_ratio/min": 0.20854593813419342, "sampling/importance_sampling_ratio/mean": 0.999754786491394, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8704234212636948, "clip_ratio/low_mean": 0.04006779193878174, "clip_ratio/low_min": 0.04006779193878174, "clip_ratio/high_mean": 0.10357406362891197, "clip_ratio/high_max": 0.10357406362891197, "clip_ratio/region_mean": 0.1436418555676937, "reward_total_mean": 0.6976757049560547, "reward_meter_mean": 0.8788691759109497, "reward_meter_std": 0.14421789348125458, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9963901042938232, "reward_repeat_penalty_std": 0.005558798089623451, "reward_repeat_floor_mean": 0.9994585514068604, "reward_repeat_floor_std": 0.0008338202023878694, "reward_near_duplicate_penalty_mean": 0.9963901042938232, "reward_near_duplicate_penalty_std": 0.005558798089623451, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8062499761581421, "reward_judge_quality_std": 0.22012579441070557, "reward_total_composite_mean": 0.6976757049560547, "reward_total_composite_std": 0.2032840996980667} {"timestamp_utc": "2026-04-12T18:28:17Z", "mode": "train", "global_step": 678, "epoch": 0.03568233250881533, "loss": -0.0058, "grad_norm": 14.17061996459961, "learning_rate": 7.948484848484848e-06, "num_tokens": 1244675.0, "completions/mean_length": 86.875, "completions/min_length": 73.0, "completions/max_length": 113.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 86.875, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 113.0, "rewards/meter/mean": 0.4399971663951874, "rewards/meter/std": 0.31285810470581055, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9977678656578064, "rewards/lexical_plausibility/std": 0.006313450634479523, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.8435863256454468, "rewards/repeat_penalty/std": 0.17496798932552338, "rewards/repeat_floor/mean": 0.9819164276123047, "rewards/repeat_floor/std": 0.021712088957428932, "rewards/near_duplicate_penalty/mean": 0.9476750493049622, "rewards/near_duplicate_penalty/std": 0.061347994953393936, "rewards/opening_diversity/mean": 0.9609375, "rewards/opening_diversity/std": 0.08799287676811218, "rewards/distinct_2/mean": 0.9123215675354004, "rewards/distinct_2/std": 0.09288833290338516, "rewards/total_composite/mean": 0.14434631168842316, "rewards/total_composite/std": 0.1120925322175026, "reward": 0.14434631168842316, "reward_std": 0.1120925322175026, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19196632504463196, "sampling/sampling_logp_difference/max": 2.207411289215088, "sampling/importance_sampling_ratio/min": 0.10998500138521194, "sampling/importance_sampling_ratio/mean": 1.0036708116531372, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2945523113012314, "clip_ratio/low_mean": 0.07068119570612907, "clip_ratio/low_min": 0.07068119570612907, "clip_ratio/high_mean": 0.10044151172041893, "clip_ratio/high_max": 0.10044151172041893, "clip_ratio/region_mean": 0.171122707426548, "reward_total_mean": 0.14434631168842316, "reward_meter_mean": 0.4399971663951874, "reward_meter_std": 0.31285810470581055, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9977678656578064, "reward_lexical_plausibility_std": 0.006313450634479523, "reward_repeat_penalty_mean": 0.8435863256454468, "reward_repeat_penalty_std": 0.17496798932552338, "reward_repeat_floor_mean": 0.9819164276123047, "reward_repeat_floor_std": 0.021712088957428932, "reward_near_duplicate_penalty_mean": 0.9476750493049622, "reward_near_duplicate_penalty_std": 0.061347994953393936, "reward_opening_diversity_mean": 0.9609375, "reward_opening_diversity_std": 0.08799287676811218, "reward_distinct_2_mean": 0.9123215675354004, "reward_distinct_2_std": 0.09288833290338516, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.14434631168842316, "reward_total_composite_std": 0.1120925322175026} {"timestamp_utc": "2026-04-12T18:28:26Z", "mode": "train", "global_step": 679, "epoch": 0.03573496131782538, "loss": 0.0172, "grad_norm": 14.929986000061035, "learning_rate": 7.945454545454547e-06, "num_tokens": 1246508.0, "completions/mean_length": 48.125, "completions/min_length": 41.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.125, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.7493664026260376, "rewards/meter/std": 0.3446935713291168, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.23308108747005463, "rewards/repeat_penalty/mean": 0.9263632893562317, "rewards/repeat_penalty/std": 0.06771992146968842, "rewards/repeat_floor/mean": 0.9913603067398071, "rewards/repeat_floor/std": 0.00851268321275711, "rewards/near_duplicate_penalty/mean": 0.9698535203933716, "rewards/near_duplicate_penalty/std": 0.03847035765647888, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9542471170425415, "rewards/distinct_2/std": 0.038344256579875946, "rewards/total_composite/mean": 0.3571673631668091, "rewards/total_composite/std": 0.27758970856666565, "reward": 0.3571673631668091, "reward_std": 0.27758967876434326, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17775818705558777, "sampling/sampling_logp_difference/max": 1.6910442113876343, "sampling/importance_sampling_ratio/min": 0.18432694673538208, "sampling/importance_sampling_ratio/mean": 1.0141254663467407, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2454250678420067, "clip_ratio/low_mean": 0.14154711179435253, "clip_ratio/low_min": 0.14154711179435253, "clip_ratio/high_mean": 0.056379870511591434, "clip_ratio/high_max": 0.056379870511591434, "clip_ratio/region_mean": 0.19792698230594397, "reward_total_mean": 0.3571673631668091, "reward_meter_mean": 0.7493664026260376, "reward_meter_std": 0.3446935713291168, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9263632893562317, "reward_repeat_penalty_std": 0.06771992146968842, "reward_repeat_floor_mean": 0.9913603067398071, "reward_repeat_floor_std": 0.00851268321275711, "reward_near_duplicate_penalty_mean": 0.9698535203933716, "reward_near_duplicate_penalty_std": 0.03847035765647888, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9542471170425415, "reward_distinct_2_std": 0.038344256579875946, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.23308108747005463, "reward_total_composite_mean": 0.3571673631668091, "reward_total_composite_std": 0.27758970856666565} {"timestamp_utc": "2026-04-12T18:28:35Z", "mode": "train", "global_step": 680, "epoch": 0.03578759012683543, "loss": 0.1259, "grad_norm": 12.149139404296875, "learning_rate": 7.942424242424242e-06, "num_tokens": 1248589.0, "completions/mean_length": 72.125, "completions/min_length": 54.0, "completions/max_length": 92.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 72.125, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.9162817597389221, "rewards/meter/std": 0.10908091813325882, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.04008918255567551, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6212499737739563, "rewards/judge_quality/std": 0.2704724967479706, "rewards/repeat_penalty/mean": 0.9279419183731079, "rewards/repeat_penalty/std": 0.09104763716459274, "rewards/repeat_floor/mean": 0.9915457963943481, "rewards/repeat_floor/std": 0.01038378570228815, "rewards/near_duplicate_penalty/mean": 0.9716588258743286, "rewards/near_duplicate_penalty/std": 0.029558012261986732, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9532989859580994, "rewards/distinct_2/std": 0.06751921027898788, "rewards/total_composite/mean": 0.5090329647064209, "rewards/total_composite/std": 0.2099083662033081, "reward": 0.5090329647064209, "reward_std": 0.2099083513021469, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1614697277545929, "sampling/sampling_logp_difference/max": 1.658233642578125, "sampling/importance_sampling_ratio/min": 0.19047513604164124, "sampling/importance_sampling_ratio/mean": 1.0135349035263062, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.034816287457943, "clip_ratio/low_mean": 0.06443071644753218, "clip_ratio/low_min": 0.06443071644753218, "clip_ratio/high_mean": 0.09485700912773609, "clip_ratio/high_max": 0.09485700912773609, "clip_ratio/region_mean": 0.15928772557526827, "reward_total_mean": 0.5090329647064209, "reward_meter_mean": 0.9162817597389221, "reward_meter_std": 0.10908091813325882, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.04008918255567551, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9279419183731079, "reward_repeat_penalty_std": 0.09104763716459274, "reward_repeat_floor_mean": 0.9915457963943481, "reward_repeat_floor_std": 0.01038378570228815, "reward_near_duplicate_penalty_mean": 0.9716588258743286, "reward_near_duplicate_penalty_std": 0.029558012261986732, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9532989859580994, "reward_distinct_2_std": 0.06751921027898788, "reward_judge_quality_mean": 0.6212499737739563, "reward_judge_quality_std": 0.2704724967479706, "reward_total_composite_mean": 0.5090329647064209, "reward_total_composite_std": 0.2099083662033081} {"timestamp_utc": "2026-04-12T18:28:44Z", "mode": "train", "global_step": 681, "epoch": 0.035840218935845485, "loss": 0.0554, "grad_norm": 17.26517105102539, "learning_rate": 7.93939393939394e-06, "num_tokens": 1250063.0, "completions/mean_length": 31.25, "completions/min_length": 28.0, "completions/max_length": 34.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.25, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 34.0, "rewards/meter/mean": 0.5412427186965942, "rewards/meter/std": 0.4185452461242676, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7350000143051147, "rewards/judge_quality/std": 0.231084406375885, "rewards/repeat_penalty/mean": 0.9840534925460815, "rewards/repeat_penalty/std": 0.02079745940864086, "rewards/repeat_floor/mean": 0.9976080656051636, "rewards/repeat_floor/std": 0.0031196200288832188, "rewards/near_duplicate_penalty/mean": 0.9840534925460815, "rewards/near_duplicate_penalty/std": 0.02079745940864086, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4303084909915924, "rewards/total_composite/std": 0.351150780916214, "reward": 0.4303084909915924, "reward_std": 0.351150780916214, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14856000244617462, "sampling/sampling_logp_difference/max": 1.445095181465149, "sampling/importance_sampling_ratio/min": 0.23572365939617157, "sampling/importance_sampling_ratio/mean": 1.0016511678695679, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6426580920815468, "clip_ratio/low_mean": 0.09051120653748512, "clip_ratio/low_min": 0.09051120653748512, "clip_ratio/high_mean": 0.06935483776032925, "clip_ratio/high_max": 0.06935483776032925, "clip_ratio/region_mean": 0.15986604429781437, "reward_total_mean": 0.4303084909915924, "reward_meter_mean": 0.5412427186965942, "reward_meter_std": 0.4185452461242676, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9840534925460815, "reward_repeat_penalty_std": 0.02079745940864086, "reward_repeat_floor_mean": 0.9976080656051636, "reward_repeat_floor_std": 0.0031196200288832188, "reward_near_duplicate_penalty_mean": 0.9840534925460815, "reward_near_duplicate_penalty_std": 0.02079745940864086, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7350000143051147, "reward_judge_quality_std": 0.231084406375885, "reward_total_composite_mean": 0.4303084909915924, "reward_total_composite_std": 0.351150780916214} {"timestamp_utc": "2026-04-12T18:28:53Z", "mode": "train", "global_step": 682, "epoch": 0.03589284774485554, "loss": 0.1233, "grad_norm": 13.69466781616211, "learning_rate": 7.936363636363637e-06, "num_tokens": 1251682.0, "completions/mean_length": 42.375, "completions/min_length": 34.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.375, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.5714253783226013, "rewards/meter/std": 0.40181785821914673, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9871336221694946, "rewards/repeat_penalty/std": 0.013903828337788582, "rewards/repeat_floor/mean": 0.9980700016021729, "rewards/repeat_floor/std": 0.0020855737384408712, "rewards/near_duplicate_penalty/mean": 0.9871336221694946, "rewards/near_duplicate_penalty/std": 0.013903828337788582, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21997764706611633, "rewards/total_composite/std": 0.15484604239463806, "reward": 0.21997764706611633, "reward_std": 0.15484604239463806, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14972510933876038, "sampling/sampling_logp_difference/max": 3.900174617767334, "sampling/importance_sampling_ratio/min": 0.020238377153873444, "sampling/importance_sampling_ratio/mean": 0.9987576603889465, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6500987969338894, "clip_ratio/low_mean": 0.04316326603293419, "clip_ratio/low_min": 0.04316326603293419, "clip_ratio/high_mean": 0.10029766196385026, "clip_ratio/high_max": 0.10029766196385026, "clip_ratio/region_mean": 0.14346092799678445, "reward_total_mean": 0.21997764706611633, "reward_meter_mean": 0.5714253783226013, "reward_meter_std": 0.40181785821914673, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9871336221694946, "reward_repeat_penalty_std": 0.013903828337788582, "reward_repeat_floor_mean": 0.9980700016021729, "reward_repeat_floor_std": 0.0020855737384408712, "reward_near_duplicate_penalty_mean": 0.9871336221694946, "reward_near_duplicate_penalty_std": 0.013903828337788582, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.21997764706611633, "reward_total_composite_std": 0.15484604239463806} {"timestamp_utc": "2026-04-12T18:29:02Z", "mode": "train", "global_step": 683, "epoch": 0.03594547655386559, "loss": 0.0911, "grad_norm": 15.283223152160645, "learning_rate": 7.933333333333334e-06, "num_tokens": 1253254.0, "completions/mean_length": 43.5, "completions/min_length": 39.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.5, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.5645961165428162, "rewards/meter/std": 0.45666199922561646, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.2522329092025757, "rewards/repeat_penalty/mean": 0.9908082485198975, "rewards/repeat_penalty/std": 0.01736707240343094, "rewards/repeat_floor/mean": 0.9986212253570557, "rewards/repeat_floor/std": 0.002605058252811432, "rewards/near_duplicate_penalty/mean": 0.9908082485198975, "rewards/near_duplicate_penalty/std": 0.01736707240343094, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3609369397163391, "rewards/total_composite/std": 0.37903764843940735, "reward": 0.3609369397163391, "reward_std": 0.37903761863708496, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16934515535831451, "sampling/sampling_logp_difference/max": 1.6285791397094727, "sampling/importance_sampling_ratio/min": 0.1962081640958786, "sampling/importance_sampling_ratio/mean": 1.0413309335708618, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.252444252371788, "clip_ratio/low_mean": 0.07789652980864048, "clip_ratio/low_min": 0.07789652980864048, "clip_ratio/high_mean": 0.07041698787361383, "clip_ratio/high_max": 0.07041698787361383, "clip_ratio/region_mean": 0.14831351768225431, "reward_total_mean": 0.3609369397163391, "reward_meter_mean": 0.5645961165428162, "reward_meter_std": 0.45666199922561646, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9908082485198975, "reward_repeat_penalty_std": 0.01736707240343094, "reward_repeat_floor_mean": 0.9986212253570557, "reward_repeat_floor_std": 0.002605058252811432, "reward_near_duplicate_penalty_mean": 0.9908082485198975, "reward_near_duplicate_penalty_std": 0.01736707240343094, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.2522329092025757, "reward_total_composite_mean": 0.3609369397163391, "reward_total_composite_std": 0.37903764843940735} {"timestamp_utc": "2026-04-12T18:29:16Z", "mode": "train", "global_step": 684, "epoch": 0.035998105362875635, "loss": -0.01, "grad_norm": 5.522702217102051, "learning_rate": 7.930303030303031e-06, "num_tokens": 1254656.0, "completions/mean_length": 99.25, "completions/min_length": 30.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 40.28571701049805, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.6928744316101074, "rewards/meter/std": 0.4003216326236725, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.929033637046814, "rewards/lexical_plausibility/std": 0.20072321593761444, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.33342114090919495, "rewards/repeat_penalty/mean": 0.9981769323348999, "rewards/repeat_penalty/std": 0.004229435231536627, "rewards/repeat_floor/mean": 0.9997265338897705, "rewards/repeat_floor/std": 0.0006344058783724904, "rewards/near_duplicate_penalty/mean": 0.9981769323348999, "rewards/near_duplicate_penalty/std": 0.004229435231536627, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.49300721287727356, "rewards/total_composite/std": 0.365594744682312, "reward": 0.49300721287727356, "reward_std": 0.3655947148799896, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16682495176792145, "sampling/sampling_logp_difference/max": 1.26860511302948, "sampling/importance_sampling_ratio/min": 0.2812236249446869, "sampling/importance_sampling_ratio/mean": 1.0012701749801636, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.004506193101406, "clip_ratio/low_mean": 0.07665951643139124, "clip_ratio/low_min": 0.07665951643139124, "clip_ratio/high_mean": 0.09011470898985863, "clip_ratio/high_max": 0.09011470898985863, "clip_ratio/region_mean": 0.16677422542124987, "reward_total_mean": 0.49300721287727356, "reward_meter_mean": 0.6928744316101074, "reward_meter_std": 0.4003216326236725, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.929033637046814, "reward_lexical_plausibility_std": 0.20072321593761444, "reward_repeat_penalty_mean": 0.9981769323348999, "reward_repeat_penalty_std": 0.004229435231536627, "reward_repeat_floor_mean": 0.9997265338897705, "reward_repeat_floor_std": 0.0006344058783724904, "reward_near_duplicate_penalty_mean": 0.9981769323348999, "reward_near_duplicate_penalty_std": 0.004229435231536627, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.33342114090919495, "reward_total_composite_mean": 0.49300721287727356, "reward_total_composite_std": 0.365594744682312} {"timestamp_utc": "2026-04-12T18:29:25Z", "mode": "train", "global_step": 685, "epoch": 0.03605073417188569, "loss": 0.1524, "grad_norm": 14.242477416992188, "learning_rate": 7.927272727272729e-06, "num_tokens": 1256324.0, "completions/mean_length": 50.5, "completions/min_length": 33.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.5, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.48648005723953247, "rewards/meter/std": 0.33642902970314026, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175492912530899, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7012499570846558, "rewards/judge_quality/std": 0.21963852643966675, "rewards/repeat_penalty/mean": 0.972527027130127, "rewards/repeat_penalty/std": 0.038944847881793976, "rewards/repeat_floor/mean": 0.9969032406806946, "rewards/repeat_floor/std": 0.004063354805111885, "rewards/near_duplicate_penalty/mean": 0.9900432229042053, "rewards/near_duplicate_penalty/std": 0.01294527668505907, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9821861982345581, "rewards/distinct_2/std": 0.0333910807967186, "rewards/total_composite/mean": 0.36581742763519287, "rewards/total_composite/std": 0.2953268885612488, "reward": 0.36581742763519287, "reward_std": 0.2953268885612488, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1397547721862793, "sampling/sampling_logp_difference/max": 1.9408142566680908, "sampling/importance_sampling_ratio/min": 0.14358699321746826, "sampling/importance_sampling_ratio/mean": 0.9967378973960876, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.848524235188961, "clip_ratio/low_mean": 0.0710381967946887, "clip_ratio/low_min": 0.0710381967946887, "clip_ratio/high_mean": 0.0545843867585063, "clip_ratio/high_max": 0.0545843867585063, "clip_ratio/region_mean": 0.125622583553195, "reward_total_mean": 0.36581742763519287, "reward_meter_mean": 0.48648005723953247, "reward_meter_std": 0.33642902970314026, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175492912530899, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.972527027130127, "reward_repeat_penalty_std": 0.038944847881793976, "reward_repeat_floor_mean": 0.9969032406806946, "reward_repeat_floor_std": 0.004063354805111885, "reward_near_duplicate_penalty_mean": 0.9900432229042053, "reward_near_duplicate_penalty_std": 0.01294527668505907, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9821861982345581, "reward_distinct_2_std": 0.0333910807967186, "reward_judge_quality_mean": 0.7012499570846558, "reward_judge_quality_std": 0.21963852643966675, "reward_total_composite_mean": 0.36581742763519287, "reward_total_composite_std": 0.2953268885612488} {"timestamp_utc": "2026-04-12T18:29:35Z", "mode": "train", "global_step": 686, "epoch": 0.03610336298089574, "loss": 0.0025, "grad_norm": 7.851562023162842, "learning_rate": 7.924242424242426e-06, "num_tokens": 1259127.0, "completions/mean_length": 151.375, "completions/min_length": 124.0, "completions/max_length": 169.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 151.375, "completions/min_terminated_length": 124.0, "completions/max_terminated_length": 169.0, "rewards/meter/mean": 0.703392744064331, "rewards/meter/std": 0.3572615087032318, "rewards/count_adherence/mean": 0.910714328289032, "rewards/count_adherence/std": 0.07393559068441391, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9732142686843872, "rewards/count_floor/std": 0.022180693224072456, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.7438592910766602, "rewards/repeat_penalty/std": 0.11683720350265503, "rewards/repeat_floor/mean": 0.9738099575042725, "rewards/repeat_floor/std": 0.012238663621246815, "rewards/near_duplicate_penalty/mean": 0.9557079076766968, "rewards/near_duplicate_penalty/std": 0.026552172377705574, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7828199863433838, "rewards/distinct_2/std": 0.09453731775283813, "rewards/total_composite/mean": 0.24712425470352173, "rewards/total_composite/std": 0.1577533781528473, "reward": 0.24712425470352173, "reward_std": 0.1577533781528473, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1356942504644394, "sampling/sampling_logp_difference/max": 6.5828704833984375, "sampling/importance_sampling_ratio/min": 0.0013838711893185973, "sampling/importance_sampling_ratio/mean": 1.0152630805969238, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6535034105181694, "clip_ratio/low_mean": 0.0425669401884079, "clip_ratio/low_min": 0.0425669401884079, "clip_ratio/high_mean": 0.07818795926868916, "clip_ratio/high_max": 0.07818795926868916, "clip_ratio/region_mean": 0.12075489945709705, "reward_total_mean": 0.24712425470352173, "reward_meter_mean": 0.703392744064331, "reward_meter_std": 0.3572615087032318, "reward_count_adherence_mean": 0.910714328289032, "reward_count_adherence_std": 0.07393559068441391, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9732142686843872, "reward_count_floor_std": 0.022180693224072456, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7438592910766602, "reward_repeat_penalty_std": 0.11683720350265503, "reward_repeat_floor_mean": 0.9738099575042725, "reward_repeat_floor_std": 0.012238663621246815, "reward_near_duplicate_penalty_mean": 0.9557079076766968, "reward_near_duplicate_penalty_std": 0.026552172377705574, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7828199863433838, "reward_distinct_2_std": 0.09453731775283813, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.24712425470352173, "reward_total_composite_std": 0.1577533781528473} {"timestamp_utc": "2026-04-12T18:29:45Z", "mode": "train", "global_step": 687, "epoch": 0.03615599178990579, "loss": 0.006, "grad_norm": 10.999700546264648, "learning_rate": 7.921212121212122e-06, "num_tokens": 1261337.0, "completions/mean_length": 90.25, "completions/min_length": 77.0, "completions/max_length": 104.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 90.25, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.9758234620094299, "rewards/meter/std": 0.018658699467778206, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.8926434516906738, "rewards/repeat_penalty/std": 0.11182642728090286, "rewards/repeat_floor/mean": 0.9894065260887146, "rewards/repeat_floor/std": 0.009338720701634884, "rewards/near_duplicate_penalty/mean": 0.976697564125061, "rewards/near_duplicate_penalty/std": 0.01590649038553238, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9419655799865723, "rewards/distinct_2/std": 0.058997996151447296, "rewards/total_composite/mean": 0.5074703693389893, "rewards/total_composite/std": 0.21573084592819214, "reward": 0.5074703693389893, "reward_std": 0.21573083102703094, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1428309828042984, "sampling/sampling_logp_difference/max": 1.6901178359985352, "sampling/importance_sampling_ratio/min": 0.18449777364730835, "sampling/importance_sampling_ratio/mean": 1.0279263257980347, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9295486807823181, "clip_ratio/low_mean": 0.11103309225291014, "clip_ratio/low_min": 0.11103309225291014, "clip_ratio/high_mean": 0.03612903133034706, "clip_ratio/high_max": 0.03612903133034706, "clip_ratio/region_mean": 0.1471621235832572, "reward_total_mean": 0.5074703693389893, "reward_meter_mean": 0.9758234620094299, "reward_meter_std": 0.018658699467778206, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8926434516906738, "reward_repeat_penalty_std": 0.11182642728090286, "reward_repeat_floor_mean": 0.9894065260887146, "reward_repeat_floor_std": 0.009338720701634884, "reward_near_duplicate_penalty_mean": 0.976697564125061, "reward_near_duplicate_penalty_std": 0.01590649038553238, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9419655799865723, "reward_distinct_2_std": 0.058997996151447296, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.5074703693389893, "reward_total_composite_std": 0.21573084592819214} {"timestamp_utc": "2026-04-12T18:29:54Z", "mode": "train", "global_step": 688, "epoch": 0.036208620598915844, "loss": 0.1184, "grad_norm": 12.7700777053833, "learning_rate": 7.918181818181819e-06, "num_tokens": 1263043.0, "completions/mean_length": 53.25, "completions/min_length": 35.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.25, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.8128455877304077, "rewards/meter/std": 0.2773248553276062, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.9960116147994995, "rewards/repeat_penalty/std": 0.005399797111749649, "rewards/repeat_floor/mean": 0.9994017481803894, "rewards/repeat_floor/std": 0.0008099714759737253, "rewards/near_duplicate_penalty/mean": 0.9960116147994995, "rewards/near_duplicate_penalty/std": 0.005399797111749649, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4248201251029968, "rewards/total_composite/std": 0.1853087991476059, "reward": 0.4248201251029968, "reward_std": 0.1853087991476059, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14777840673923492, "sampling/sampling_logp_difference/max": 1.8677616119384766, "sampling/importance_sampling_ratio/min": 0.15446902811527252, "sampling/importance_sampling_ratio/mean": 1.0275275707244873, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0067977830767632, "clip_ratio/low_mean": 0.1133290845900774, "clip_ratio/low_min": 0.1133290845900774, "clip_ratio/high_mean": 0.06153661757707596, "clip_ratio/high_max": 0.06153661757707596, "clip_ratio/region_mean": 0.17486570216715336, "reward_total_mean": 0.4248201251029968, "reward_meter_mean": 0.8128455877304077, "reward_meter_std": 0.2773248553276062, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9960116147994995, "reward_repeat_penalty_std": 0.005399797111749649, "reward_repeat_floor_mean": 0.9994017481803894, "reward_repeat_floor_std": 0.0008099714759737253, "reward_near_duplicate_penalty_mean": 0.9960116147994995, "reward_near_duplicate_penalty_std": 0.005399797111749649, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.4248201251029968, "reward_total_composite_std": 0.1853087991476059} {"timestamp_utc": "2026-04-12T18:30:07Z", "mode": "train", "global_step": 689, "epoch": 0.0362612494079259, "loss": -0.0652, "grad_norm": 3.553575038909912, "learning_rate": 7.915151515151516e-06, "num_tokens": 1264624.0, "completions/mean_length": 162.625, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 46.16666793823242, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.7992570996284485, "rewards/meter/std": 0.33354029059410095, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8753854036331177, "rewards/lexical_plausibility/std": 0.21299925446510315, "rewards/judge_quality/mean": 0.5, "rewards/judge_quality/std": 0.33717310428619385, "rewards/repeat_penalty/mean": 0.9395312070846558, "rewards/repeat_penalty/std": 0.08119502663612366, "rewards/repeat_floor/mean": 0.9941484928131104, "rewards/repeat_floor/std": 0.004828337579965591, "rewards/near_duplicate_penalty/mean": 0.9779276847839355, "rewards/near_duplicate_penalty/std": 0.016341637820005417, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9926035404205322, "rewards/distinct_2/std": 0.020920326933264732, "rewards/total_composite/mean": 0.3845026195049286, "rewards/total_composite/std": 0.3312537372112274, "reward": 0.3845026195049286, "reward_std": 0.33125370740890503, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1796915978193283, "sampling/sampling_logp_difference/max": 2.060620069503784, "sampling/importance_sampling_ratio/min": 0.12737496197223663, "sampling/importance_sampling_ratio/mean": 0.9975326061248779, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7718779966235161, "clip_ratio/low_mean": 0.021276595070958138, "clip_ratio/low_min": 0.021276595070958138, "clip_ratio/high_mean": 0.10894730500876904, "clip_ratio/high_max": 0.10894730500876904, "clip_ratio/region_mean": 0.13022390007972717, "reward_total_mean": 0.3845026195049286, "reward_meter_mean": 0.7992570996284485, "reward_meter_std": 0.33354029059410095, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8753854036331177, "reward_lexical_plausibility_std": 0.21299925446510315, "reward_repeat_penalty_mean": 0.9395312070846558, "reward_repeat_penalty_std": 0.08119502663612366, "reward_repeat_floor_mean": 0.9941484928131104, "reward_repeat_floor_std": 0.004828337579965591, "reward_near_duplicate_penalty_mean": 0.9779276847839355, "reward_near_duplicate_penalty_std": 0.016341637820005417, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9926035404205322, "reward_distinct_2_std": 0.020920326933264732, "reward_judge_quality_mean": 0.5, "reward_judge_quality_std": 0.33717310428619385, "reward_total_composite_mean": 0.3845026195049286, "reward_total_composite_std": 0.3312537372112274} {"timestamp_utc": "2026-04-12T18:30:16Z", "mode": "train", "global_step": 690, "epoch": 0.03631387821693595, "loss": 0.0178, "grad_norm": 16.97161293029785, "learning_rate": 7.912121212121213e-06, "num_tokens": 1266125.0, "completions/mean_length": 41.625, "completions/min_length": 37.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.625, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.8607565760612488, "rewards/meter/std": 0.31258437037467957, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.731249988079071, "rewards/judge_quality/std": 0.2623213827610016, "rewards/repeat_penalty/mean": 0.9953497648239136, "rewards/repeat_penalty/std": 0.009349735453724861, "rewards/repeat_floor/mean": 0.9993025064468384, "rewards/repeat_floor/std": 0.0014024607371538877, "rewards/near_duplicate_penalty/mean": 0.9953497648239136, "rewards/near_duplicate_penalty/std": 0.009349735453724861, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6114264726638794, "rewards/total_composite/std": 0.3291594386100769, "reward": 0.6114264726638794, "reward_std": 0.3291594386100769, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15825603902339935, "sampling/sampling_logp_difference/max": 2.149714469909668, "sampling/importance_sampling_ratio/min": 0.11651741713285446, "sampling/importance_sampling_ratio/mean": 1.015402913093567, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8685256093740463, "clip_ratio/low_mean": 0.05555725609883666, "clip_ratio/low_min": 0.05555725609883666, "clip_ratio/high_mean": 0.0391608402132988, "clip_ratio/high_max": 0.0391608402132988, "clip_ratio/region_mean": 0.09471809631213546, "reward_total_mean": 0.6114264726638794, "reward_meter_mean": 0.8607565760612488, "reward_meter_std": 0.31258437037467957, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9953497648239136, "reward_repeat_penalty_std": 0.009349735453724861, "reward_repeat_floor_mean": 0.9993025064468384, "reward_repeat_floor_std": 0.0014024607371538877, "reward_near_duplicate_penalty_mean": 0.9953497648239136, "reward_near_duplicate_penalty_std": 0.009349735453724861, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.731249988079071, "reward_judge_quality_std": 0.2623213827610016, "reward_total_composite_mean": 0.6114264726638794, "reward_total_composite_std": 0.3291594386100769} {"timestamp_utc": "2026-04-12T18:30:24Z", "mode": "train", "global_step": 691, "epoch": 0.036366507025946, "loss": 0.0312, "grad_norm": 16.510276794433594, "learning_rate": 7.909090909090909e-06, "num_tokens": 1267799.0, "completions/mean_length": 45.25, "completions/min_length": 34.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.25, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.95619797706604, "rewards/meter/std": 0.05634555593132973, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47499996423721313, "rewards/judge_quality/std": 0.1164964810013771, "rewards/repeat_penalty/mean": 0.8895437717437744, "rewards/repeat_penalty/std": 0.09774777293205261, "rewards/repeat_floor/mean": 0.9860040545463562, "rewards/repeat_floor/std": 0.01214191410690546, "rewards/near_duplicate_penalty/mean": 0.9398403167724609, "rewards/near_duplicate_penalty/std": 0.052910350263118744, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9447554349899292, "rewards/distinct_2/std": 0.06508119404315948, "rewards/total_composite/mean": 0.4247620701789856, "rewards/total_composite/std": 0.10545188188552856, "reward": 0.4247620701789856, "reward_std": 0.10545188188552856, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16715498268604279, "sampling/sampling_logp_difference/max": 6.352803707122803, "sampling/importance_sampling_ratio/min": 0.0017418566858395934, "sampling/importance_sampling_ratio/mean": 1.036353588104248, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0210946649312973, "clip_ratio/low_mean": 0.11840536817908287, "clip_ratio/low_min": 0.11840536817908287, "clip_ratio/high_mean": 0.035920330323278904, "clip_ratio/high_max": 0.035920330323278904, "clip_ratio/region_mean": 0.15432569850236177, "reward_total_mean": 0.4247620701789856, "reward_meter_mean": 0.95619797706604, "reward_meter_std": 0.05634555593132973, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8895437717437744, "reward_repeat_penalty_std": 0.09774777293205261, "reward_repeat_floor_mean": 0.9860040545463562, "reward_repeat_floor_std": 0.01214191410690546, "reward_near_duplicate_penalty_mean": 0.9398403167724609, "reward_near_duplicate_penalty_std": 0.052910350263118744, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9447554349899292, "reward_distinct_2_std": 0.06508119404315948, "reward_judge_quality_mean": 0.47499996423721313, "reward_judge_quality_std": 0.1164964810013771, "reward_total_composite_mean": 0.4247620701789856, "reward_total_composite_std": 0.10545188188552856} {"timestamp_utc": "2026-04-12T18:30:40Z", "mode": "train", "global_step": 692, "epoch": 0.036419135834956054, "loss": -0.0861, "grad_norm": 4.097788333892822, "learning_rate": 7.906060606060608e-06, "num_tokens": 1269741.0, "completions/mean_length": 185.75, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 77.0, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 99.0, "rewards/meter/mean": 0.8153953552246094, "rewards/meter/std": 0.2948692739009857, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.2357022613286972, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.0707106813788414, "rewards/lexical_plausibility/mean": 0.8896616697311401, "rewards/lexical_plausibility/std": 0.20752596855163574, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.2815771996974945, "rewards/repeat_penalty/mean": 0.9806714653968811, "rewards/repeat_penalty/std": 0.036163244396448135, "rewards/repeat_floor/mean": 0.9976470470428467, "rewards/repeat_floor/std": 0.00391932250931859, "rewards/near_duplicate_penalty/mean": 0.9902307987213135, "rewards/near_duplicate_penalty/std": 0.010942477732896805, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990138053894043, "rewards/distinct_2/std": 0.027893755584955215, "rewards/total_composite/mean": 0.3053979277610779, "rewards/total_composite/std": 0.2750643789768219, "reward": 0.3053979277610779, "reward_std": 0.2750643491744995, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16998818516731262, "sampling/sampling_logp_difference/max": 1.905627727508545, "sampling/importance_sampling_ratio/min": 0.14872926473617554, "sampling/importance_sampling_ratio/mean": 1.0290447473526, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8471773117780685, "clip_ratio/low_mean": 0.03693396970629692, "clip_ratio/low_min": 0.03693396970629692, "clip_ratio/high_mean": 0.07972583174705505, "clip_ratio/high_max": 0.07972583174705505, "clip_ratio/region_mean": 0.11665980145335197, "reward_total_mean": 0.3053979277610779, "reward_meter_mean": 0.8153953552246094, "reward_meter_std": 0.2948692739009857, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.2357022613286972, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.0707106813788414, "reward_lexical_plausibility_mean": 0.8896616697311401, "reward_lexical_plausibility_std": 0.20752596855163574, "reward_repeat_penalty_mean": 0.9806714653968811, "reward_repeat_penalty_std": 0.036163244396448135, "reward_repeat_floor_mean": 0.9976470470428467, "reward_repeat_floor_std": 0.00391932250931859, "reward_near_duplicate_penalty_mean": 0.9902307987213135, "reward_near_duplicate_penalty_std": 0.010942477732896805, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990138053894043, "reward_distinct_2_std": 0.027893755584955215, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.2815771996974945, "reward_total_composite_mean": 0.3053979277610779, "reward_total_composite_std": 0.2750643789768219} {"timestamp_utc": "2026-04-12T18:30:54Z", "mode": "train", "global_step": 693, "epoch": 0.036471764643966106, "loss": -0.052, "grad_norm": 5.776697158813477, "learning_rate": 7.903030303030303e-06, "num_tokens": 1271228.0, "completions/mean_length": 95.875, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 36.42857360839844, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.7285749316215515, "rewards/meter/std": 0.323891282081604, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9372708797454834, "rewards/lexical_plausibility/std": 0.1774248480796814, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.20310094952583313, "rewards/repeat_penalty/mean": 0.9540948271751404, "rewards/repeat_penalty/std": 0.08570332825183868, "rewards/repeat_floor/mean": 0.9959267377853394, "rewards/repeat_floor/std": 0.0056337621062994, "rewards/near_duplicate_penalty/mean": 0.9853448271751404, "rewards/near_duplicate_penalty/std": 0.024069856852293015, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24386470019817352, "rewards/total_composite/std": 0.18078291416168213, "reward": 0.24386470019817352, "reward_std": 0.18078292906284332, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1864989697933197, "sampling/sampling_logp_difference/max": 2.0610222816467285, "sampling/importance_sampling_ratio/min": 0.12732374668121338, "sampling/importance_sampling_ratio/mean": 0.9933604598045349, "sampling/importance_sampling_ratio/max": 1.884401559829712, "entropy": 1.1467092335224152, "clip_ratio/low_mean": 0.06282679922878742, "clip_ratio/low_min": 0.06282679922878742, "clip_ratio/high_mean": 0.08883412554860115, "clip_ratio/high_max": 0.08883412554860115, "clip_ratio/region_mean": 0.15166092477738857, "reward_total_mean": 0.24386470019817352, "reward_meter_mean": 0.7285749316215515, "reward_meter_std": 0.323891282081604, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9372708797454834, "reward_lexical_plausibility_std": 0.1774248480796814, "reward_repeat_penalty_mean": 0.9540948271751404, "reward_repeat_penalty_std": 0.08570332825183868, "reward_repeat_floor_mean": 0.9959267377853394, "reward_repeat_floor_std": 0.0056337621062994, "reward_near_duplicate_penalty_mean": 0.9853448271751404, "reward_near_duplicate_penalty_std": 0.024069856852293015, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.20310094952583313, "reward_total_composite_mean": 0.24386470019817352, "reward_total_composite_std": 0.18078291416168213} {"timestamp_utc": "2026-04-12T18:31:02Z", "mode": "train", "global_step": 694, "epoch": 0.03652439345297616, "loss": 0.05, "grad_norm": 17.572412490844727, "learning_rate": 7.9e-06, "num_tokens": 1272788.0, "completions/mean_length": 33.0, "completions/min_length": 28.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.0, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.5327678918838501, "rewards/meter/std": 0.3950226306915283, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9881653785705566, "rewards/lexical_plausibility/std": 0.02336401864886284, "rewards/judge_quality/mean": 0.5512499809265137, "rewards/judge_quality/std": 0.3296508193016052, "rewards/repeat_penalty/mean": 0.9851109981536865, "rewards/repeat_penalty/std": 0.02075997181236744, "rewards/repeat_floor/mean": 0.9977666735649109, "rewards/repeat_floor/std": 0.0031139894854277372, "rewards/near_duplicate_penalty/mean": 0.9851109981536865, "rewards/near_duplicate_penalty/std": 0.02075997181236744, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.28674715757369995, "rewards/total_composite/std": 0.35322123765945435, "reward": 0.28674715757369995, "reward_std": 0.35322120785713196, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1541822850704193, "sampling/sampling_logp_difference/max": 2.0245985984802246, "sampling/importance_sampling_ratio/min": 0.13204683363437653, "sampling/importance_sampling_ratio/mean": 1.004731297492981, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.892720527946949, "clip_ratio/low_mean": 0.09476255066692829, "clip_ratio/low_min": 0.09476255066692829, "clip_ratio/high_mean": 0.023809524718672037, "clip_ratio/high_max": 0.023809524718672037, "clip_ratio/region_mean": 0.11857207538560033, "reward_total_mean": 0.28674715757369995, "reward_meter_mean": 0.5327678918838501, "reward_meter_std": 0.3950226306915283, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9881653785705566, "reward_lexical_plausibility_std": 0.02336401864886284, "reward_repeat_penalty_mean": 0.9851109981536865, "reward_repeat_penalty_std": 0.02075997181236744, "reward_repeat_floor_mean": 0.9977666735649109, "reward_repeat_floor_std": 0.0031139894854277372, "reward_near_duplicate_penalty_mean": 0.9851109981536865, "reward_near_duplicate_penalty_std": 0.02075997181236744, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5512499809265137, "reward_judge_quality_std": 0.3296508193016052, "reward_total_composite_mean": 0.28674715757369995, "reward_total_composite_std": 0.35322123765945435} {"timestamp_utc": "2026-04-12T18:31:13Z", "mode": "train", "global_step": 695, "epoch": 0.03657702226198621, "loss": 0.1389, "grad_norm": 16.48650550842285, "learning_rate": 7.896969696969698e-06, "num_tokens": 1274348.0, "completions/mean_length": 28.0, "completions/min_length": 22.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.0, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.8752923011779785, "rewards/meter/std": 0.20829828083515167, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9713541269302368, "rewards/lexical_plausibility/std": 0.05990393087267876, "rewards/judge_quality/mean": 0.6050000190734863, "rewards/judge_quality/std": 0.27244922518730164, "rewards/repeat_penalty/mean": 0.7911126613616943, "rewards/repeat_penalty/std": 0.088370680809021, "rewards/repeat_floor/mean": 0.9864853620529175, "rewards/repeat_floor/std": 0.005011714994907379, "rewards/near_duplicate_penalty/mean": 0.9953917264938354, "rewards/near_duplicate_penalty/std": 0.006611193995922804, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.4678093492984772, "rewards/total_composite/std": 0.254795640707016, "reward": 0.4678093492984772, "reward_std": 0.2547956109046936, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1850403994321823, "sampling/sampling_logp_difference/max": 1.6788057088851929, "sampling/importance_sampling_ratio/min": 0.18659669160842896, "sampling/importance_sampling_ratio/mean": 1.036389708518982, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3574261143803596, "clip_ratio/low_mean": 0.13032166846096516, "clip_ratio/low_min": 0.13032166846096516, "clip_ratio/high_mean": 0.04796765837818384, "clip_ratio/high_max": 0.04796765837818384, "clip_ratio/region_mean": 0.178289326839149, "reward_total_mean": 0.4678093492984772, "reward_meter_mean": 0.8752923011779785, "reward_meter_std": 0.20829828083515167, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9713541269302368, "reward_lexical_plausibility_std": 0.05990393087267876, "reward_repeat_penalty_mean": 0.7911126613616943, "reward_repeat_penalty_std": 0.088370680809021, "reward_repeat_floor_mean": 0.9864853620529175, "reward_repeat_floor_std": 0.005011714994907379, "reward_near_duplicate_penalty_mean": 0.9953917264938354, "reward_near_duplicate_penalty_std": 0.006611193995922804, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.6050000190734863, "reward_judge_quality_std": 0.27244922518730164, "reward_total_composite_mean": 0.4678093492984772, "reward_total_composite_std": 0.254795640707016} {"timestamp_utc": "2026-04-12T18:31:23Z", "mode": "train", "global_step": 696, "epoch": 0.036629651070996264, "loss": 0.0215, "grad_norm": 10.675210952758789, "learning_rate": 7.893939393939395e-06, "num_tokens": 1276593.0, "completions/mean_length": 79.625, "completions/min_length": 46.0, "completions/max_length": 115.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.625, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 115.0, "rewards/meter/mean": 0.8943508267402649, "rewards/meter/std": 0.23351480066776276, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.22160132229328156, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.06648040562868118, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390503644943237, "rewards/repeat_penalty/mean": 0.9841098785400391, "rewards/repeat_penalty/std": 0.020202450454235077, "rewards/repeat_floor/mean": 0.9979227781295776, "rewards/repeat_floor/std": 0.002310001291334629, "rewards/near_duplicate_penalty/mean": 0.9893572330474854, "rewards/near_duplicate_penalty/std": 0.010167546570301056, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9946581125259399, "rewards/distinct_2/std": 0.01510911900550127, "rewards/total_composite/mean": 0.3716614246368408, "rewards/total_composite/std": 0.20161238312721252, "reward": 0.3716614246368408, "reward_std": 0.20161235332489014, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1626281589269638, "sampling/sampling_logp_difference/max": 1.7982239723205566, "sampling/importance_sampling_ratio/min": 0.1655927300453186, "sampling/importance_sampling_ratio/mean": 1.0247689485549927, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.041448913514614, "clip_ratio/low_mean": 0.060205587185919285, "clip_ratio/low_min": 0.060205587185919285, "clip_ratio/high_mean": 0.09158066054806113, "clip_ratio/high_max": 0.09158066054806113, "clip_ratio/region_mean": 0.15178624773398042, "reward_total_mean": 0.3716614246368408, "reward_meter_mean": 0.8943508267402649, "reward_meter_std": 0.23351480066776276, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.22160132229328156, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.06648040562868118, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9841098785400391, "reward_repeat_penalty_std": 0.020202450454235077, "reward_repeat_floor_mean": 0.9979227781295776, "reward_repeat_floor_std": 0.002310001291334629, "reward_near_duplicate_penalty_mean": 0.9893572330474854, "reward_near_duplicate_penalty_std": 0.010167546570301056, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9946581125259399, "reward_distinct_2_std": 0.01510911900550127, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390503644943237, "reward_total_composite_mean": 0.3716614246368408, "reward_total_composite_std": 0.20161238312721252} {"timestamp_utc": "2026-04-12T18:31:37Z", "mode": "train", "global_step": 697, "epoch": 0.036682279880006316, "loss": 0.011, "grad_norm": 5.811776161193848, "learning_rate": 7.89090909090909e-06, "num_tokens": 1277995.0, "completions/mean_length": 94.25, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 34.57143020629883, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.5346740484237671, "rewards/meter/std": 0.48755258321762085, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 0.9386634826660156, "rewards/lexical_plausibility/std": 0.1734859049320221, "rewards/judge_quality/mean": 0.6299999952316284, "rewards/judge_quality/std": 0.3489985764026642, "rewards/repeat_penalty/mean": 0.8246878385543823, "rewards/repeat_penalty/std": 0.15275509655475616, "rewards/repeat_floor/mean": 0.9861825704574585, "rewards/repeat_floor/std": 0.016363805159926414, "rewards/near_duplicate_penalty/mean": 0.9788626432418823, "rewards/near_duplicate_penalty/std": 0.05838554725050926, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9650349617004395, "rewards/distinct_2/std": 0.09889606386423111, "rewards/total_composite/mean": 0.3222241997718811, "rewards/total_composite/std": 0.35222432017326355, "reward": 0.3222241997718811, "reward_std": 0.35222432017326355, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14557981491088867, "sampling/sampling_logp_difference/max": 1.6572270393371582, "sampling/importance_sampling_ratio/min": 0.19066695868968964, "sampling/importance_sampling_ratio/mean": 0.9892773628234863, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.86921776086092, "clip_ratio/low_mean": 0.027139748446643353, "clip_ratio/low_min": 0.027139748446643353, "clip_ratio/high_mean": 0.07627321360632777, "clip_ratio/high_max": 0.07627321360632777, "clip_ratio/region_mean": 0.10341296205297112, "reward_total_mean": 0.3222241997718811, "reward_meter_mean": 0.5346740484237671, "reward_meter_std": 0.48755258321762085, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 0.9386634826660156, "reward_lexical_plausibility_std": 0.1734859049320221, "reward_repeat_penalty_mean": 0.8246878385543823, "reward_repeat_penalty_std": 0.15275509655475616, "reward_repeat_floor_mean": 0.9861825704574585, "reward_repeat_floor_std": 0.016363805159926414, "reward_near_duplicate_penalty_mean": 0.9788626432418823, "reward_near_duplicate_penalty_std": 0.05838554725050926, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9650349617004395, "reward_distinct_2_std": 0.09889606386423111, "reward_judge_quality_mean": 0.6299999952316284, "reward_judge_quality_std": 0.3489985764026642, "reward_total_composite_mean": 0.3222241997718811, "reward_total_composite_std": 0.35222432017326355} {"timestamp_utc": "2026-04-12T18:31:51Z", "mode": "train", "global_step": 698, "epoch": 0.03673490868901637, "loss": -0.0414, "grad_norm": 1.8564060926437378, "learning_rate": 7.88787878787879e-06, "num_tokens": 1279502.0, "completions/mean_length": 154.375, "completions/min_length": 22.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 35.16666793823242, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.6102007627487183, "rewards/meter/std": 0.4394175410270691, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9030071496963501, "rewards/lexical_plausibility/std": 0.1839004009962082, "rewards/judge_quality/mean": 0.5074999928474426, "rewards/judge_quality/std": 0.3796144723892212, "rewards/repeat_penalty/mean": 0.8900975584983826, "rewards/repeat_penalty/std": 0.12551118433475494, "rewards/repeat_floor/mean": 0.9918233156204224, "rewards/repeat_floor/std": 0.008244846947491169, "rewards/near_duplicate_penalty/mean": 0.982988715171814, "rewards/near_duplicate_penalty/std": 0.031867094337940216, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3795780837535858, "rewards/total_composite/std": 0.3140793442726135, "reward": 0.3795780837535858, "reward_std": 0.3140793442726135, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16782984137535095, "sampling/sampling_logp_difference/max": 1.542236328125, "sampling/importance_sampling_ratio/min": 0.21390222012996674, "sampling/importance_sampling_ratio/mean": 1.003355860710144, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7542218193411827, "clip_ratio/low_mean": 0.027100469917058945, "clip_ratio/low_min": 0.027100469917058945, "clip_ratio/high_mean": 0.08988736011087894, "clip_ratio/high_max": 0.08988736011087894, "clip_ratio/region_mean": 0.11698783002793789, "reward_total_mean": 0.3795780837535858, "reward_meter_mean": 0.6102007627487183, "reward_meter_std": 0.4394175410270691, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9030071496963501, "reward_lexical_plausibility_std": 0.1839004009962082, "reward_repeat_penalty_mean": 0.8900975584983826, "reward_repeat_penalty_std": 0.12551118433475494, "reward_repeat_floor_mean": 0.9918233156204224, "reward_repeat_floor_std": 0.008244846947491169, "reward_near_duplicate_penalty_mean": 0.982988715171814, "reward_near_duplicate_penalty_std": 0.031867094337940216, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5074999928474426, "reward_judge_quality_std": 0.3796144723892212, "reward_total_composite_mean": 0.3795780837535858, "reward_total_composite_std": 0.3140793442726135} {"timestamp_utc": "2026-04-12T18:32:04Z", "mode": "train", "global_step": 699, "epoch": 0.03678753749802642, "loss": -0.1166, "grad_norm": 5.406973361968994, "learning_rate": 7.884848484848485e-06, "num_tokens": 1280998.0, "completions/mean_length": 95.0, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 35.42857360839844, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.8485106229782104, "rewards/meter/std": 0.25493329763412476, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 0.947380542755127, "rewards/lexical_plausibility/std": 0.148830384016037, "rewards/judge_quality/mean": 0.5712499618530273, "rewards/judge_quality/std": 0.3491392433643341, "rewards/repeat_penalty/mean": 0.7777508497238159, "rewards/repeat_penalty/std": 0.07377924025058746, "rewards/repeat_floor/mean": 0.9824823141098022, "rewards/repeat_floor/std": 0.0071553257293999195, "rewards/near_duplicate_penalty/mean": 0.9701954126358032, "rewards/near_duplicate_penalty/std": 0.0543275885283947, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9591997861862183, "rewards/distinct_2/std": 0.060878071933984756, "rewards/total_composite/mean": 0.49808424711227417, "rewards/total_composite/std": 0.3303817808628082, "reward": 0.49808424711227417, "reward_std": 0.3303817808628082, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16661261022090912, "sampling/sampling_logp_difference/max": 0.992431640625, "sampling/importance_sampling_ratio/min": 0.3706742525100708, "sampling/importance_sampling_ratio/mean": 1.0287952423095703, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4277740269899368, "clip_ratio/low_mean": 0.07378183864057064, "clip_ratio/low_min": 0.07378183864057064, "clip_ratio/high_mean": 0.09797375928610563, "clip_ratio/high_max": 0.09797375928610563, "clip_ratio/region_mean": 0.17175559792667627, "reward_total_mean": 0.49808424711227417, "reward_meter_mean": 0.8485106229782104, "reward_meter_std": 0.25493329763412476, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 0.947380542755127, "reward_lexical_plausibility_std": 0.148830384016037, "reward_repeat_penalty_mean": 0.7777508497238159, "reward_repeat_penalty_std": 0.07377924025058746, "reward_repeat_floor_mean": 0.9824823141098022, "reward_repeat_floor_std": 0.0071553257293999195, "reward_near_duplicate_penalty_mean": 0.9701954126358032, "reward_near_duplicate_penalty_std": 0.0543275885283947, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9591997861862183, "reward_distinct_2_std": 0.060878071933984756, "reward_judge_quality_mean": 0.5712499618530273, "reward_judge_quality_std": 0.3491392433643341, "reward_total_composite_mean": 0.49808424711227417, "reward_total_composite_std": 0.3303817808628082} {"timestamp_utc": "2026-04-12T18:32:19Z", "mode": "train", "global_step": 700, "epoch": 0.03684016630703647, "loss": -0.1291, "grad_norm": 3.2831649780273438, "learning_rate": 7.881818181818182e-06, "num_tokens": 1283048.0, "completions/mean_length": 200.25, "completions/min_length": 80.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 96.33333587646484, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 108.0, "rewards/meter/mean": 0.5204377174377441, "rewards/meter/std": 0.41852569580078125, "rewards/count_adherence/mean": 0.699999988079071, "rewards/count_adherence/std": 0.32071349024772644, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9100000262260437, "rewards/count_floor/std": 0.09621405601501465, "rewards/lexical_plausibility/mean": 0.8878356218338013, "rewards/lexical_plausibility/std": 0.20871137082576752, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.8468242883682251, "rewards/repeat_penalty/std": 0.11950872093439102, "rewards/repeat_floor/mean": 0.9871902465820312, "rewards/repeat_floor/std": 0.008598395623266697, "rewards/near_duplicate_penalty/mean": 0.9739341735839844, "rewards/near_duplicate_penalty/std": 0.022811613976955414, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9427787065505981, "rewards/distinct_2/std": 0.07691513746976852, "rewards/total_composite/mean": 0.1796427071094513, "rewards/total_composite/std": 0.14334683120250702, "reward": 0.1796427071094513, "reward_std": 0.14334683120250702, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18485522270202637, "sampling/sampling_logp_difference/max": 2.7764220237731934, "sampling/importance_sampling_ratio/min": 0.06226087734103203, "sampling/importance_sampling_ratio/mean": 0.9976781606674194, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7676830291748047, "clip_ratio/low_mean": 0.04419191926717758, "clip_ratio/low_min": 0.04419191926717758, "clip_ratio/high_mean": 0.08549442142248154, "clip_ratio/high_max": 0.08549442142248154, "clip_ratio/region_mean": 0.12968634068965912, "reward_total_mean": 0.1796427071094513, "reward_meter_mean": 0.5204377174377441, "reward_meter_std": 0.41852569580078125, "reward_count_adherence_mean": 0.699999988079071, "reward_count_adherence_std": 0.32071349024772644, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9100000262260437, "reward_count_floor_std": 0.09621405601501465, "reward_lexical_plausibility_mean": 0.8878356218338013, "reward_lexical_plausibility_std": 0.20871137082576752, "reward_repeat_penalty_mean": 0.8468242883682251, "reward_repeat_penalty_std": 0.11950872093439102, "reward_repeat_floor_mean": 0.9871902465820312, "reward_repeat_floor_std": 0.008598395623266697, "reward_near_duplicate_penalty_mean": 0.9739341735839844, "reward_near_duplicate_penalty_std": 0.022811613976955414, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9427787065505981, "reward_distinct_2_std": 0.07691513746976852, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.1796427071094513, "reward_total_composite_std": 0.14334683120250702} {"timestamp_utc": "2026-04-12T18:34:50Z", "mode": "eval", "global_step": 700, "epoch": 0.03684016630703647, "eval_loss": NaN, "eval_runtime": 150.9885, "eval_samples_per_second": 0.689, "eval_steps_per_second": 0.086, "eval_num_tokens": 1283048.0, "eval_completions/mean_length": 155.39423076923077, "eval_completions/min_length": 26.307692307692307, "eval_completions/max_length": 420.84615384615387, "eval_completions/clipped_ratio": 0.07692307692307693, "eval_completions/mean_terminated_length": 126.42720002394456, "eval_completions/min_terminated_length": 26.307692307692307, "eval_completions/max_terminated_length": 297.46153846153845, "eval_rewards/meter/mean": 0.5489744062607105, "eval_rewards/meter/std": 0.3748012941617232, "eval_rewards/count_adherence/mean": 0.7764834853319021, "eval_rewards/count_adherence/std": 0.24915027274535254, "eval_rewards/arabic_clean/mean": 0.875, "eval_rewards/arabic_clean/std": 0.2972002969338344, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 1.0, "eval_rewards/arabic_floor/std": 0.0, "eval_rewards/count_floor/mean": 0.932945035971128, "eval_rewards/count_floor/std": 0.07474507907262215, "eval_rewards/lexical_plausibility/mean": 0.9671332882000849, "eval_rewards/lexical_plausibility/std": 0.07702519601354232, "eval_rewards/judge_quality/mean": 0.4059615364441505, "eval_rewards/judge_quality/std": 0.2083253788833435, "eval_rewards/repeat_penalty/mean": 0.7792832301213191, "eval_rewards/repeat_penalty/std": 0.27835372720773405, "eval_rewards/repeat_floor/mean": 0.9773236971635085, "eval_rewards/repeat_floor/std": 0.0311901608052162, "eval_rewards/near_duplicate_penalty/mean": 0.9611879816422095, "eval_rewards/near_duplicate_penalty/std": 0.052638744218991354, "eval_rewards/opening_diversity/mean": 0.9583390080011808, "eval_rewards/opening_diversity/std": 0.08785006289298718, "eval_rewards/distinct_2/mean": 0.8405017302586482, "eval_rewards/distinct_2/std": 0.26118571483171904, "eval_rewards/total_composite/mean": 0.214217674273711, "eval_rewards/total_composite/std": 0.1935919368496308, "eval_reward": 0.214217674273711, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.07472726330161095, "eval_sampling/sampling_logp_difference/max": 1.1051650047302246, "eval_sampling/importance_sampling_ratio/min": 0.33584901919731724, "eval_sampling/importance_sampling_ratio/mean": 1.0187156383807843, "eval_sampling/importance_sampling_ratio/max": 1.5717311730751624, "eval_entropy": 0.8667431015234727, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.214217674273711, "eval_reward_meter_mean": 0.5489744062607105, "eval_reward_meter_std": 0.3748012941617232, "eval_reward_count_adherence_mean": 0.7764834853319021, "eval_reward_count_adherence_std": 0.24915027274535254, "eval_reward_arabic_clean_mean": 0.875, "eval_reward_arabic_clean_std": 0.2972002969338344, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 1.0, "eval_reward_arabic_floor_std": 0.0, "eval_reward_count_floor_mean": 0.932945035971128, "eval_reward_count_floor_std": 0.07474507907262215, "eval_reward_lexical_plausibility_mean": 0.9671332882000849, "eval_reward_lexical_plausibility_std": 0.07702519601354232, "eval_reward_repeat_penalty_mean": 0.7792832301213191, "eval_reward_repeat_penalty_std": 0.27835372720773405, "eval_reward_repeat_floor_mean": 0.9773236971635085, "eval_reward_repeat_floor_std": 0.0311901608052162, "eval_reward_near_duplicate_penalty_mean": 0.9611879816422095, "eval_reward_near_duplicate_penalty_std": 0.052638744218991354, "eval_reward_opening_diversity_mean": 0.9583390080011808, "eval_reward_opening_diversity_std": 0.08785006289298718, "eval_reward_distinct_2_mean": 0.8405017302586482, "eval_reward_distinct_2_std": 0.26118571483171904, "eval_reward_judge_quality_mean": 0.4059615364441505, "eval_reward_judge_quality_std": 0.2083253788833435, "eval_reward_total_composite_mean": 0.214217674273711, "eval_reward_total_composite_std": 0.1935919368496308} {"timestamp_utc": "2026-04-12T18:35:03Z", "mode": "train", "global_step": 701, "epoch": 0.036892795116046526, "loss": 0.027, "grad_norm": 19.635427474975586, "learning_rate": 7.87878787878788e-06, "num_tokens": 1284493.0, "completions/mean_length": 29.625, "completions/min_length": 18.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.625, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.6219130754470825, "rewards/meter/std": 0.35015761852264404, "rewards/count_adherence/mean": 0.5833333730697632, "rewards/count_adherence/std": 0.15430335700511932, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.875, "rewards/count_floor/std": 0.046290989965200424, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6100000143051147, "rewards/judge_quality/std": 0.3378080725669861, "rewards/repeat_penalty/mean": 0.8384596109390259, "rewards/repeat_penalty/std": 0.1622389703989029, "rewards/repeat_floor/mean": 0.9866820573806763, "rewards/repeat_floor/std": 0.013959908857941628, "rewards/near_duplicate_penalty/mean": 0.9744111895561218, "rewards/near_duplicate_penalty/std": 0.035747501999139786, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9780040383338928, "rewards/distinct_2/std": 0.04075079783797264, "rewards/total_composite/mean": 0.37776368856430054, "rewards/total_composite/std": 0.30817466974258423, "reward": 0.37776368856430054, "reward_std": 0.30817466974258423, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17166176438331604, "sampling/sampling_logp_difference/max": 1.7431252002716064, "sampling/importance_sampling_ratio/min": 0.17497271299362183, "sampling/importance_sampling_ratio/mean": 1.0168657302856445, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.26077351719141, "clip_ratio/low_mean": 0.08873770013451576, "clip_ratio/low_min": 0.08873770013451576, "clip_ratio/high_mean": 0.07787176314741373, "clip_ratio/high_max": 0.07787176314741373, "clip_ratio/region_mean": 0.1666094632819295, "reward_total_mean": 0.37776368856430054, "reward_meter_mean": 0.6219130754470825, "reward_meter_std": 0.35015761852264404, "reward_count_adherence_mean": 0.5833333730697632, "reward_count_adherence_std": 0.15430335700511932, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.875, "reward_count_floor_std": 0.046290989965200424, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8384596109390259, "reward_repeat_penalty_std": 0.1622389703989029, "reward_repeat_floor_mean": 0.9866820573806763, "reward_repeat_floor_std": 0.013959908857941628, "reward_near_duplicate_penalty_mean": 0.9744111895561218, "reward_near_duplicate_penalty_std": 0.035747501999139786, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9780040383338928, "reward_distinct_2_std": 0.04075079783797264, "reward_judge_quality_mean": 0.6100000143051147, "reward_judge_quality_std": 0.3378080725669861, "reward_total_composite_mean": 0.37776368856430054, "reward_total_composite_std": 0.30817466974258423} {"timestamp_utc": "2026-04-12T18:35:12Z", "mode": "train", "global_step": 702, "epoch": 0.03694542392505658, "loss": 0.1869, "grad_norm": 18.982019424438477, "learning_rate": 7.875757575757577e-06, "num_tokens": 1285975.0, "completions/mean_length": 36.25, "completions/min_length": 16.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.25, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.7270604372024536, "rewards/meter/std": 0.3584493100643158, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7225000262260437, "rewards/judge_quality/std": 0.28272905945777893, "rewards/repeat_penalty/mean": 0.9050331115722656, "rewards/repeat_penalty/std": 0.12842176854610443, "rewards/repeat_floor/mean": 0.9941924810409546, "rewards/repeat_floor/std": 0.007628065068274736, "rewards/near_duplicate_penalty/mean": 0.9987831115722656, "rewards/near_duplicate_penalty/std": 0.0034419645089656115, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5188474655151367, "rewards/total_composite/std": 0.35184794664382935, "reward": 0.5188474655151367, "reward_std": 0.35184794664382935, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16477331519126892, "sampling/sampling_logp_difference/max": 1.6497201919555664, "sampling/importance_sampling_ratio/min": 0.19210365414619446, "sampling/importance_sampling_ratio/mean": 1.0022728443145752, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0120640695095062, "clip_ratio/low_mean": 0.07160014472901821, "clip_ratio/low_min": 0.07160014472901821, "clip_ratio/high_mean": 0.10375485103577375, "clip_ratio/high_max": 0.10375485103577375, "clip_ratio/region_mean": 0.17535499576479197, "reward_total_mean": 0.5188474655151367, "reward_meter_mean": 0.7270604372024536, "reward_meter_std": 0.3584493100643158, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9050331115722656, "reward_repeat_penalty_std": 0.12842176854610443, "reward_repeat_floor_mean": 0.9941924810409546, "reward_repeat_floor_std": 0.007628065068274736, "reward_near_duplicate_penalty_mean": 0.9987831115722656, "reward_near_duplicate_penalty_std": 0.0034419645089656115, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7225000262260437, "reward_judge_quality_std": 0.28272905945777893, "reward_total_composite_mean": 0.5188474655151367, "reward_total_composite_std": 0.35184794664382935} {"timestamp_utc": "2026-04-12T18:35:21Z", "mode": "train", "global_step": 703, "epoch": 0.03699805273406663, "loss": 0.368, "grad_norm": 20.71617317199707, "learning_rate": 7.872727272727273e-06, "num_tokens": 1287520.0, "completions/mean_length": 35.125, "completions/min_length": 22.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.125, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.692795991897583, "rewards/meter/std": 0.3991662263870239, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7312500476837158, "rewards/judge_quality/std": 0.2623213827610016, "rewards/repeat_penalty/mean": 0.8719308972358704, "rewards/repeat_penalty/std": 0.13043223321437836, "rewards/repeat_floor/mean": 0.992039680480957, "rewards/repeat_floor/std": 0.0075578163377940655, "rewards/near_duplicate_penalty/mean": 0.9969308972358704, "rewards/near_duplicate_penalty/std": 0.005684043746441603, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.45557886362075806, "rewards/total_composite/std": 0.3125329315662384, "reward": 0.45557886362075806, "reward_std": 0.3125329315662384, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17352819442749023, "sampling/sampling_logp_difference/max": 1.6558523178100586, "sampling/importance_sampling_ratio/min": 0.19092924892902374, "sampling/importance_sampling_ratio/mean": 1.009139895439148, "sampling/importance_sampling_ratio/max": 1.898756980895996, "entropy": 1.1124054417014122, "clip_ratio/low_mean": 0.07493782881647348, "clip_ratio/low_min": 0.07493782881647348, "clip_ratio/high_mean": 0.08428030554205179, "clip_ratio/high_max": 0.08428030554205179, "clip_ratio/region_mean": 0.15921813435852528, "reward_total_mean": 0.45557886362075806, "reward_meter_mean": 0.692795991897583, "reward_meter_std": 0.3991662263870239, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8719308972358704, "reward_repeat_penalty_std": 0.13043223321437836, "reward_repeat_floor_mean": 0.992039680480957, "reward_repeat_floor_std": 0.0075578163377940655, "reward_near_duplicate_penalty_mean": 0.9969308972358704, "reward_near_duplicate_penalty_std": 0.005684043746441603, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7312500476837158, "reward_judge_quality_std": 0.2623213827610016, "reward_total_composite_mean": 0.45557886362075806, "reward_total_composite_std": 0.3125329315662384} {"timestamp_utc": "2026-04-12T18:35:31Z", "mode": "train", "global_step": 704, "epoch": 0.03705068154307668, "loss": 0.0259, "grad_norm": 15.125969886779785, "learning_rate": 7.86969696969697e-06, "num_tokens": 1289401.0, "completions/mean_length": 53.125, "completions/min_length": 33.0, "completions/max_length": 81.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.125, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.936540961265564, "rewards/meter/std": 0.13762077689170837, "rewards/count_adherence/mean": 0.5750000476837158, "rewards/count_adherence/std": 0.16690459847450256, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8725000023841858, "rewards/count_floor/std": 0.05007138103246689, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.8017673492431641, "rewards/repeat_penalty/std": 0.1994551420211792, "rewards/repeat_floor/mean": 0.9753243923187256, "rewards/repeat_floor/std": 0.02508958801627159, "rewards/near_duplicate_penalty/mean": 0.9145094156265259, "rewards/near_duplicate_penalty/std": 0.07198378443717957, "rewards/opening_diversity/mean": 0.9609375, "rewards/opening_diversity/std": 0.08799287676811218, "rewards/distinct_2/mean": 0.894352912902832, "rewards/distinct_2/std": 0.11988352984189987, "rewards/total_composite/mean": 0.3104194402694702, "rewards/total_composite/std": 0.07182146608829498, "reward": 0.3104194402694702, "reward_std": 0.07182146608829498, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1721804141998291, "sampling/sampling_logp_difference/max": 2.0726966857910156, "sampling/importance_sampling_ratio/min": 0.12584595382213593, "sampling/importance_sampling_ratio/mean": 1.0132428407669067, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2515020370483398, "clip_ratio/low_mean": 0.04043938894756138, "clip_ratio/low_min": 0.04043938894756138, "clip_ratio/high_mean": 0.07084248960018158, "clip_ratio/high_max": 0.07084248960018158, "clip_ratio/region_mean": 0.11128187854774296, "reward_total_mean": 0.3104194402694702, "reward_meter_mean": 0.936540961265564, "reward_meter_std": 0.13762077689170837, "reward_count_adherence_mean": 0.5750000476837158, "reward_count_adherence_std": 0.16690459847450256, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8725000023841858, "reward_count_floor_std": 0.05007138103246689, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8017673492431641, "reward_repeat_penalty_std": 0.1994551420211792, "reward_repeat_floor_mean": 0.9753243923187256, "reward_repeat_floor_std": 0.02508958801627159, "reward_near_duplicate_penalty_mean": 0.9145094156265259, "reward_near_duplicate_penalty_std": 0.07198378443717957, "reward_opening_diversity_mean": 0.9609375, "reward_opening_diversity_std": 0.08799287676811218, "reward_distinct_2_mean": 0.894352912902832, "reward_distinct_2_std": 0.11988352984189987, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.3104194402694702, "reward_total_composite_std": 0.07182146608829498} {"timestamp_utc": "2026-04-12T18:35:39Z", "mode": "train", "global_step": 705, "epoch": 0.037103310352086735, "loss": 0.0232, "grad_norm": 20.257781982421875, "learning_rate": 7.866666666666667e-06, "num_tokens": 1290791.0, "completions/mean_length": 24.75, "completions/min_length": 17.0, "completions/max_length": 35.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.75, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.8726639747619629, "rewards/meter/std": 0.32054951786994934, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9387500286102295, "rewards/judge_quality/std": 0.015526460483670235, "rewards/repeat_penalty/mean": 0.7448863983154297, "rewards/repeat_penalty/std": 0.014463555067777634, "rewards/repeat_floor/mean": 0.9839773178100586, "rewards/repeat_floor/std": 0.002892707008868456, "rewards/near_duplicate_penalty/mean": 0.9931818246841431, "rewards/near_duplicate_penalty/std": 0.01928473263978958, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.8081232309341431, "rewards/total_composite/std": 0.2979726493358612, "reward": 0.8081232309341431, "reward_std": 0.2979726195335388, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10279171913862228, "sampling/sampling_logp_difference/max": 0.6807451248168945, "sampling/importance_sampling_ratio/min": 0.506239652633667, "sampling/importance_sampling_ratio/mean": 1.0390857458114624, "sampling/importance_sampling_ratio/max": 1.703858733177185, "entropy": 0.9182189777493477, "clip_ratio/low_mean": 0.027173912152647972, "clip_ratio/low_min": 0.027173912152647972, "clip_ratio/high_mean": 0.08591826166957617, "clip_ratio/high_max": 0.08591826166957617, "clip_ratio/region_mean": 0.11309217382222414, "reward_total_mean": 0.8081232309341431, "reward_meter_mean": 0.8726639747619629, "reward_meter_std": 0.32054951786994934, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7448863983154297, "reward_repeat_penalty_std": 0.014463555067777634, "reward_repeat_floor_mean": 0.9839773178100586, "reward_repeat_floor_std": 0.002892707008868456, "reward_near_duplicate_penalty_mean": 0.9931818246841431, "reward_near_duplicate_penalty_std": 0.01928473263978958, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9387500286102295, "reward_judge_quality_std": 0.015526460483670235, "reward_total_composite_mean": 0.8081232309341431, "reward_total_composite_std": 0.2979726493358612} {"timestamp_utc": "2026-04-12T18:35:54Z", "mode": "train", "global_step": 706, "epoch": 0.03715593916109679, "loss": -0.1667, "grad_norm": 3.175297498703003, "learning_rate": 7.863636363636364e-06, "num_tokens": 1295726.0, "completions/mean_length": 387.875, "completions/min_length": 332.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 370.14288330078125, "completions/min_terminated_length": 332.0, "completions/max_terminated_length": 421.0, "rewards/meter/mean": 0.6071051359176636, "rewards/meter/std": 0.2364199310541153, "rewards/count_adherence/mean": 0.9097222089767456, "rewards/count_adherence/std": 0.07821588963270187, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9729167222976685, "rewards/count_floor/std": 0.02346477098762989, "rewards/lexical_plausibility/mean": 0.9849501848220825, "rewards/lexical_plausibility/std": 0.042567286640405655, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.48024994134902954, "rewards/repeat_penalty/std": 0.33926162123680115, "rewards/repeat_floor/mean": 0.9413257241249084, "rewards/repeat_floor/std": 0.04095407575368881, "rewards/near_duplicate_penalty/mean": 0.8847901821136475, "rewards/near_duplicate_penalty/std": 0.0914272889494896, "rewards/opening_diversity/mean": 0.9789685010910034, "rewards/opening_diversity/std": 0.03901910036802292, "rewards/distinct_2/mean": 0.5541009306907654, "rewards/distinct_2/std": 0.3065713942050934, "rewards/total_composite/mean": 0.17841105163097382, "rewards/total_composite/std": 0.09289226680994034, "reward": 0.17841105163097382, "reward_std": 0.09289226680994034, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12477786093950272, "sampling/sampling_logp_difference/max": 3.1812477111816406, "sampling/importance_sampling_ratio/min": 0.04153380170464516, "sampling/importance_sampling_ratio/mean": 1.0115275382995605, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6132855415344238, "clip_ratio/low_mean": 0.022465783171355724, "clip_ratio/low_min": 0.022465783171355724, "clip_ratio/high_mean": 0.07483852189034224, "clip_ratio/high_max": 0.07483852189034224, "clip_ratio/region_mean": 0.09730430506169796, "reward_total_mean": 0.17841105163097382, "reward_meter_mean": 0.6071051359176636, "reward_meter_std": 0.2364199310541153, "reward_count_adherence_mean": 0.9097222089767456, "reward_count_adherence_std": 0.07821588963270187, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9729167222976685, "reward_count_floor_std": 0.02346477098762989, "reward_lexical_plausibility_mean": 0.9849501848220825, "reward_lexical_plausibility_std": 0.042567286640405655, "reward_repeat_penalty_mean": 0.48024994134902954, "reward_repeat_penalty_std": 0.33926162123680115, "reward_repeat_floor_mean": 0.9413257241249084, "reward_repeat_floor_std": 0.04095407575368881, "reward_near_duplicate_penalty_mean": 0.8847901821136475, "reward_near_duplicate_penalty_std": 0.0914272889494896, "reward_opening_diversity_mean": 0.9789685010910034, "reward_opening_diversity_std": 0.03901910036802292, "reward_distinct_2_mean": 0.5541009306907654, "reward_distinct_2_std": 0.3065713942050934, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.17841105163097382, "reward_total_composite_std": 0.09289226680994034} {"timestamp_utc": "2026-04-12T18:36:08Z", "mode": "train", "global_step": 707, "epoch": 0.03720856797010683, "loss": 0.0803, "grad_norm": 4.710929870605469, "learning_rate": 7.860606060606062e-06, "num_tokens": 1297194.0, "completions/mean_length": 98.5, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 39.42857360839844, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.47339069843292236, "rewards/meter/std": 0.47370660305023193, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.1060660183429718, "rewards/lexical_plausibility/mean": 0.9365938901901245, "rewards/lexical_plausibility/std": 0.17933957278728485, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.25753986835479736, "rewards/repeat_penalty/mean": 0.8562992215156555, "rewards/repeat_penalty/std": 0.12594392895698547, "rewards/repeat_floor/mean": 0.9872283935546875, "rewards/repeat_floor/std": 0.011465528979897499, "rewards/near_duplicate_penalty/mean": 0.9612317681312561, "rewards/near_duplicate_penalty/std": 0.05465776473283768, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.2304283231496811, "rewards/total_composite/std": 0.27335724234580994, "reward": 0.2304283231496811, "reward_std": 0.27335724234580994, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15772601962089539, "sampling/sampling_logp_difference/max": 3.301652669906616, "sampling/importance_sampling_ratio/min": 0.03682226315140724, "sampling/importance_sampling_ratio/mean": 1.0255366563796997, "sampling/importance_sampling_ratio/max": 1.865495204925537, "entropy": 1.237963706254959, "clip_ratio/low_mean": 0.05942331533879042, "clip_ratio/low_min": 0.05942331533879042, "clip_ratio/high_mean": 0.08035714458674192, "clip_ratio/high_max": 0.08035714458674192, "clip_ratio/region_mean": 0.13978045992553234, "reward_total_mean": 0.2304283231496811, "reward_meter_mean": 0.47339069843292236, "reward_meter_std": 0.47370660305023193, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.1060660183429718, "reward_lexical_plausibility_mean": 0.9365938901901245, "reward_lexical_plausibility_std": 0.17933957278728485, "reward_repeat_penalty_mean": 0.8562992215156555, "reward_repeat_penalty_std": 0.12594392895698547, "reward_repeat_floor_mean": 0.9872283935546875, "reward_repeat_floor_std": 0.011465528979897499, "reward_near_duplicate_penalty_mean": 0.9612317681312561, "reward_near_duplicate_penalty_std": 0.05465776473283768, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.25753986835479736, "reward_total_composite_mean": 0.2304283231496811, "reward_total_composite_std": 0.27335724234580994} {"timestamp_utc": "2026-04-12T18:36:22Z", "mode": "train", "global_step": 708, "epoch": 0.037261196779116885, "loss": -0.007, "grad_norm": 2.5022945404052734, "learning_rate": 7.857575757575759e-06, "num_tokens": 1298702.0, "completions/mean_length": 208.5, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 26.399999618530273, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.28408458828926086, "rewards/meter/std": 0.3408469259738922, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.8075497150421143, "rewards/lexical_plausibility/std": 0.2512689530849457, "rewards/judge_quality/mean": 0.23375001549720764, "rewards/judge_quality/std": 0.29442134499549866, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.030608050525188446, "rewards/total_composite/std": 0.042746976017951965, "reward": 0.030608050525188446, "reward_std": 0.04274697229266167, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17112420499324799, "sampling/sampling_logp_difference/max": 1.025547981262207, "sampling/importance_sampling_ratio/min": 0.3585999310016632, "sampling/importance_sampling_ratio/mean": 1.0705456733703613, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.240393042564392, "clip_ratio/low_mean": 0.06395432632416487, "clip_ratio/low_min": 0.06395432632416487, "clip_ratio/high_mean": 0.02654682332649827, "clip_ratio/high_max": 0.02654682332649827, "clip_ratio/region_mean": 0.09050114965066314, "reward_total_mean": 0.030608050525188446, "reward_meter_mean": 0.28408458828926086, "reward_meter_std": 0.3408469259738922, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.8075497150421143, "reward_lexical_plausibility_std": 0.2512689530849457, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.23375001549720764, "reward_judge_quality_std": 0.29442134499549866, "reward_total_composite_mean": 0.030608050525188446, "reward_total_composite_std": 0.042746976017951965} {"timestamp_utc": "2026-04-12T18:36:36Z", "mode": "train", "global_step": 709, "epoch": 0.03731382558812694, "loss": -0.0131, "grad_norm": 5.288625240325928, "learning_rate": 7.854545454545454e-06, "num_tokens": 1300120.0, "completions/mean_length": 87.25, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 26.571430206298828, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.5989590883255005, "rewards/meter/std": 0.4722652733325958, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.08017837256193161, "rewards/lexical_plausibility/mean": 0.935215950012207, "rewards/lexical_plausibility/std": 0.18323691189289093, "rewards/judge_quality/mean": 0.6974999904632568, "rewards/judge_quality/std": 0.3388109505176544, "rewards/repeat_penalty/mean": 0.7610735297203064, "rewards/repeat_penalty/std": 0.11817479878664017, "rewards/repeat_floor/mean": 0.9808283448219299, "rewards/repeat_floor/std": 0.01071706973016262, "rewards/near_duplicate_penalty/mean": 0.9629229307174683, "rewards/near_duplicate_penalty/std": 0.052938204258680344, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9737762212753296, "rewards/distinct_2/std": 0.05202964320778847, "rewards/total_composite/mean": 0.41022107005119324, "rewards/total_composite/std": 0.34409695863723755, "reward": 0.41022107005119324, "reward_std": 0.34409695863723755, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16866233944892883, "sampling/sampling_logp_difference/max": 1.2423224449157715, "sampling/importance_sampling_ratio/min": 0.28871291875839233, "sampling/importance_sampling_ratio/mean": 1.0020458698272705, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9851214364171028, "clip_ratio/low_mean": 0.06666666828095913, "clip_ratio/low_min": 0.06666666828095913, "clip_ratio/high_mean": 0.09111069655045867, "clip_ratio/high_max": 0.09111069655045867, "clip_ratio/region_mean": 0.1577773648314178, "reward_total_mean": 0.41022107005119324, "reward_meter_mean": 0.5989590883255005, "reward_meter_std": 0.4722652733325958, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.08017837256193161, "reward_lexical_plausibility_mean": 0.935215950012207, "reward_lexical_plausibility_std": 0.18323691189289093, "reward_repeat_penalty_mean": 0.7610735297203064, "reward_repeat_penalty_std": 0.11817479878664017, "reward_repeat_floor_mean": 0.9808283448219299, "reward_repeat_floor_std": 0.01071706973016262, "reward_near_duplicate_penalty_mean": 0.9629229307174683, "reward_near_duplicate_penalty_std": 0.052938204258680344, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9737762212753296, "reward_distinct_2_std": 0.05202964320778847, "reward_judge_quality_mean": 0.6974999904632568, "reward_judge_quality_std": 0.3388109505176544, "reward_total_composite_mean": 0.41022107005119324, "reward_total_composite_std": 0.34409695863723755} {"timestamp_utc": "2026-04-12T18:36:44Z", "mode": "train", "global_step": 710, "epoch": 0.03736645439713699, "loss": 0.3582, "grad_norm": 18.180816650390625, "learning_rate": 7.851515151515152e-06, "num_tokens": 1301607.0, "completions/mean_length": 32.875, "completions/min_length": 21.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.875, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.5414481163024902, "rewards/meter/std": 0.3958565890789032, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.20951901376247406, "rewards/repeat_penalty/mean": 0.8426564931869507, "rewards/repeat_penalty/std": 0.12789233028888702, "rewards/repeat_floor/mean": 0.990460991859436, "rewards/repeat_floor/std": 0.007542266510426998, "rewards/near_duplicate_penalty/mean": 0.9989064931869507, "rewards/near_duplicate_penalty/std": 0.0024298341013491154, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1940850466489792, "rewards/total_composite/std": 0.13349927961826324, "reward": 0.1940850466489792, "reward_std": 0.13349927961826324, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1756649762392044, "sampling/sampling_logp_difference/max": 1.2156119346618652, "sampling/importance_sampling_ratio/min": 0.29652851819992065, "sampling/importance_sampling_ratio/mean": 1.0077542066574097, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4264952093362808, "clip_ratio/low_mean": 0.06860941834747791, "clip_ratio/low_min": 0.06860941834747791, "clip_ratio/high_mean": 0.08666666829958558, "clip_ratio/high_max": 0.08666666829958558, "clip_ratio/region_mean": 0.1552760866470635, "reward_total_mean": 0.1940850466489792, "reward_meter_mean": 0.5414481163024902, "reward_meter_std": 0.3958565890789032, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.8426564931869507, "reward_repeat_penalty_std": 0.12789233028888702, "reward_repeat_floor_mean": 0.990460991859436, "reward_repeat_floor_std": 0.007542266510426998, "reward_near_duplicate_penalty_mean": 0.9989064931869507, "reward_near_duplicate_penalty_std": 0.0024298341013491154, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.20951901376247406, "reward_total_composite_mean": 0.1940850466489792, "reward_total_composite_std": 0.13349927961826324} {"timestamp_utc": "2026-04-12T18:36:52Z", "mode": "train", "global_step": 711, "epoch": 0.03741908320614704, "loss": 0.0395, "grad_norm": 26.305583953857422, "learning_rate": 7.848484848484849e-06, "num_tokens": 1303032.0, "completions/mean_length": 19.125, "completions/min_length": 17.0, "completions/max_length": 20.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.125, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 20.0, "rewards/meter/mean": 0.9515354633331299, "rewards/meter/std": 0.06079068034887314, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45500001311302185, "rewards/judge_quality/std": 0.31883716583251953, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.42562514543533325, "rewards/total_composite/std": 0.30652469396591187, "reward": 0.42562514543533325, "reward_std": 0.30652469396591187, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18814878165721893, "sampling/sampling_logp_difference/max": 1.936065673828125, "sampling/importance_sampling_ratio/min": 0.14427043497562408, "sampling/importance_sampling_ratio/mean": 1.01978600025177, "sampling/importance_sampling_ratio/max": 1.8287224769592285, "entropy": 1.260237842798233, "clip_ratio/low_mean": 0.10735294269397855, "clip_ratio/low_min": 0.10735294269397855, "clip_ratio/high_mean": 0.01315789483487606, "clip_ratio/high_max": 0.01315789483487606, "clip_ratio/region_mean": 0.12051083752885461, "reward_total_mean": 0.42562514543533325, "reward_meter_mean": 0.9515354633331299, "reward_meter_std": 0.06079068034887314, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45500001311302185, "reward_judge_quality_std": 0.31883716583251953, "reward_total_composite_mean": 0.42562514543533325, "reward_total_composite_std": 0.30652469396591187} {"timestamp_utc": "2026-04-12T18:37:06Z", "mode": "train", "global_step": 712, "epoch": 0.037471712015157095, "loss": -0.0209, "grad_norm": 9.332262992858887, "learning_rate": 7.845454545454546e-06, "num_tokens": 1304732.0, "completions/mean_length": 93.5, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 33.71428680419922, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.39751294255256653, "rewards/meter/std": 0.41686782240867615, "rewards/count_adherence/mean": 0.3500000238418579, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8049999475479126, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 0.9586276412010193, "rewards/lexical_plausibility/std": 0.11701866239309311, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.8975834846496582, "rewards/repeat_penalty/std": 0.09574146568775177, "rewards/repeat_floor/mean": 0.9902625679969788, "rewards/repeat_floor/std": 0.005486474838107824, "rewards/near_duplicate_penalty/mean": 0.9600834846496582, "rewards/near_duplicate_penalty/std": 0.0384177640080452, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.07124805450439453, "rewards/total_composite/std": 0.09192438423633575, "reward": 0.07124805450439453, "reward_std": 0.09192438423633575, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.205689936876297, "sampling/sampling_logp_difference/max": 2.313621997833252, "sampling/importance_sampling_ratio/min": 0.0989023745059967, "sampling/importance_sampling_ratio/mean": 1.0081510543823242, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4003472030162811, "clip_ratio/low_mean": 0.13853716012090445, "clip_ratio/low_min": 0.13853716012090445, "clip_ratio/high_mean": 0.057444853708148, "clip_ratio/high_max": 0.057444853708148, "clip_ratio/region_mean": 0.19598201382905245, "reward_total_mean": 0.07124805450439453, "reward_meter_mean": 0.39751294255256653, "reward_meter_std": 0.41686782240867615, "reward_count_adherence_mean": 0.3500000238418579, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8049999475479126, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 0.9586276412010193, "reward_lexical_plausibility_std": 0.11701866239309311, "reward_repeat_penalty_mean": 0.8975834846496582, "reward_repeat_penalty_std": 0.09574146568775177, "reward_repeat_floor_mean": 0.9902625679969788, "reward_repeat_floor_std": 0.005486474838107824, "reward_near_duplicate_penalty_mean": 0.9600834846496582, "reward_near_duplicate_penalty_std": 0.0384177640080452, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.07124805450439453, "reward_total_composite_std": 0.09192438423633575} {"timestamp_utc": "2026-04-12T18:37:13Z", "mode": "train", "global_step": 713, "epoch": 0.03752434082416715, "loss": 0.084, "grad_norm": 22.027294158935547, "learning_rate": 7.842424242424243e-06, "num_tokens": 1306327.0, "completions/mean_length": 30.375, "completions/min_length": 27.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.375, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.4532663822174072, "rewards/meter/std": 0.35725316405296326, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5850000381469727, "rewards/judge_quality/std": 0.3660210967063904, "rewards/repeat_penalty/mean": 0.9391168355941772, "rewards/repeat_penalty/std": 0.15032248198986053, "rewards/repeat_floor/mean": 0.9943631887435913, "rewards/repeat_floor/std": 0.012695373967289925, "rewards/near_duplicate_penalty/mean": 0.9931401610374451, "rewards/near_duplicate_penalty/std": 0.009787586517632008, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9696356058120728, "rewards/distinct_2/std": 0.08588341623544693, "rewards/total_composite/mean": 0.3661108911037445, "rewards/total_composite/std": 0.3673224449157715, "reward": 0.3661108911037445, "reward_std": 0.3673224151134491, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16539311408996582, "sampling/sampling_logp_difference/max": 1.228032112121582, "sampling/importance_sampling_ratio/min": 0.29286831617355347, "sampling/importance_sampling_ratio/mean": 1.0022656917572021, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1031476855278015, "clip_ratio/low_mean": 0.0588333741761744, "clip_ratio/low_min": 0.0588333741761744, "clip_ratio/high_mean": 0.08416646718978882, "clip_ratio/high_max": 0.08416646718978882, "clip_ratio/region_mean": 0.14299984136596322, "reward_total_mean": 0.3661108911037445, "reward_meter_mean": 0.4532663822174072, "reward_meter_std": 0.35725316405296326, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9391168355941772, "reward_repeat_penalty_std": 0.15032248198986053, "reward_repeat_floor_mean": 0.9943631887435913, "reward_repeat_floor_std": 0.012695373967289925, "reward_near_duplicate_penalty_mean": 0.9931401610374451, "reward_near_duplicate_penalty_std": 0.009787586517632008, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9696356058120728, "reward_distinct_2_std": 0.08588341623544693, "reward_judge_quality_mean": 0.5850000381469727, "reward_judge_quality_std": 0.3660210967063904, "reward_total_composite_mean": 0.3661108911037445, "reward_total_composite_std": 0.3673224449157715} {"timestamp_utc": "2026-04-12T18:37:27Z", "mode": "train", "global_step": 714, "epoch": 0.0375769696331772, "loss": -0.0551, "grad_norm": 4.0953240394592285, "learning_rate": 7.83939393939394e-06, "num_tokens": 1307771.0, "completions/mean_length": 84.5, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 23.428571701049805, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.7046518325805664, "rewards/meter/std": 0.3900322914123535, "rewards/count_adherence/mean": 0.3333333432674408, "rewards/count_adherence/std": 0.1781741827726364, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.800000011920929, "rewards/count_floor/std": 0.05345224589109421, "rewards/lexical_plausibility/mean": 0.9429162740707397, "rewards/lexical_plausibility/std": 0.16145706176757812, "rewards/judge_quality/mean": 0.33375000953674316, "rewards/judge_quality/std": 0.2706572711467743, "rewards/repeat_penalty/mean": 0.7986282110214233, "rewards/repeat_penalty/std": 0.11976303160190582, "rewards/repeat_floor/mean": 0.9861440062522888, "rewards/repeat_floor/std": 0.009389491751790047, "rewards/near_duplicate_penalty/mean": 0.9826266765594482, "rewards/near_duplicate_penalty/std": 0.03939950838685036, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19854989647865295, "rewards/total_composite/std": 0.18255853652954102, "reward": 0.19854989647865295, "reward_std": 0.18255853652954102, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1470773071050644, "sampling/sampling_logp_difference/max": 1.5912961959838867, "sampling/importance_sampling_ratio/min": 0.2036614567041397, "sampling/importance_sampling_ratio/mean": 0.9956262707710266, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9586853459477425, "clip_ratio/low_mean": 0.08587185200303793, "clip_ratio/low_min": 0.08587185200303793, "clip_ratio/high_mean": 0.06704545579850674, "clip_ratio/high_max": 0.06704545579850674, "clip_ratio/region_mean": 0.15291730780154467, "reward_total_mean": 0.19854989647865295, "reward_meter_mean": 0.7046518325805664, "reward_meter_std": 0.3900322914123535, "reward_count_adherence_mean": 0.3333333432674408, "reward_count_adherence_std": 0.1781741827726364, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.800000011920929, "reward_count_floor_std": 0.05345224589109421, "reward_lexical_plausibility_mean": 0.9429162740707397, "reward_lexical_plausibility_std": 0.16145706176757812, "reward_repeat_penalty_mean": 0.7986282110214233, "reward_repeat_penalty_std": 0.11976303160190582, "reward_repeat_floor_mean": 0.9861440062522888, "reward_repeat_floor_std": 0.009389491751790047, "reward_near_duplicate_penalty_mean": 0.9826266765594482, "reward_near_duplicate_penalty_std": 0.03939950838685036, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.33375000953674316, "reward_judge_quality_std": 0.2706572711467743, "reward_total_composite_mean": 0.19854989647865295, "reward_total_composite_std": 0.18255853652954102} {"timestamp_utc": "2026-04-12T18:37:35Z", "mode": "train", "global_step": 715, "epoch": 0.03762959844218725, "loss": 0.2006, "grad_norm": 18.80209732055664, "learning_rate": 7.836363636363638e-06, "num_tokens": 1309272.0, "completions/mean_length": 26.625, "completions/min_length": 20.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.625, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.9644767045974731, "rewards/meter/std": 0.07078598439693451, "rewards/count_adherence/mean": 0.4166666865348816, "rewards/count_adherence/std": 0.15430335700511932, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8250000476837158, "rewards/count_floor/std": 0.046290989965200424, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4462500214576721, "rewards/judge_quality/std": 0.21738296747207642, "rewards/repeat_penalty/mean": 0.7123791575431824, "rewards/repeat_penalty/std": 0.1804841309785843, "rewards/repeat_floor/mean": 0.974851131439209, "rewards/repeat_floor/std": 0.02668357454240322, "rewards/near_duplicate_penalty/mean": 0.9565541744232178, "rewards/near_duplicate_penalty/std": 0.09183619916439056, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.938811182975769, "rewards/distinct_2/std": 0.12641409039497375, "rewards/total_composite/mean": 0.3323729634284973, "rewards/total_composite/std": 0.12196414172649384, "reward": 0.3323729634284973, "reward_std": 0.12196414917707443, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1371697336435318, "sampling/sampling_logp_difference/max": 1.8691492080688477, "sampling/importance_sampling_ratio/min": 0.15425483882427216, "sampling/importance_sampling_ratio/mean": 1.0337226390838623, "sampling/importance_sampling_ratio/max": 1.9927793741226196, "entropy": 0.8754261136054993, "clip_ratio/low_mean": 0.029415836557745934, "clip_ratio/low_min": 0.029415836557745934, "clip_ratio/high_mean": 0.06942287972196937, "clip_ratio/high_max": 0.06942287972196937, "clip_ratio/region_mean": 0.0988387162797153, "reward_total_mean": 0.3323729634284973, "reward_meter_mean": 0.9644767045974731, "reward_meter_std": 0.07078598439693451, "reward_count_adherence_mean": 0.4166666865348816, "reward_count_adherence_std": 0.15430335700511932, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8250000476837158, "reward_count_floor_std": 0.046290989965200424, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7123791575431824, "reward_repeat_penalty_std": 0.1804841309785843, "reward_repeat_floor_mean": 0.974851131439209, "reward_repeat_floor_std": 0.02668357454240322, "reward_near_duplicate_penalty_mean": 0.9565541744232178, "reward_near_duplicate_penalty_std": 0.09183619916439056, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.938811182975769, "reward_distinct_2_std": 0.12641409039497375, "reward_judge_quality_mean": 0.4462500214576721, "reward_judge_quality_std": 0.21738296747207642, "reward_total_composite_mean": 0.3323729634284973, "reward_total_composite_std": 0.12196414172649384} {"timestamp_utc": "2026-04-12T18:37:44Z", "mode": "train", "global_step": 716, "epoch": 0.037682227251197305, "loss": -0.0839, "grad_norm": 20.68985939025879, "learning_rate": 7.833333333333333e-06, "num_tokens": 1310694.0, "completions/mean_length": 27.75, "completions/min_length": 21.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.75, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.5627568960189819, "rewards/meter/std": 0.4417295753955841, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.984375, "rewards/lexical_plausibility/std": 0.0289318785071373, "rewards/judge_quality/mean": 0.5887500047683716, "rewards/judge_quality/std": 0.27740830183029175, "rewards/repeat_penalty/mean": 0.7838326692581177, "rewards/repeat_penalty/std": 0.15512166917324066, "rewards/repeat_floor/mean": 0.9830164909362793, "rewards/repeat_floor/std": 0.018982628360390663, "rewards/near_duplicate_penalty/mean": 0.961776852607727, "rewards/near_duplicate_penalty/std": 0.10811136662960052, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24523702263832092, "rewards/total_composite/std": 0.2448812872171402, "reward": 0.24523702263832092, "reward_std": 0.2448812574148178, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17926619946956635, "sampling/sampling_logp_difference/max": 2.0898122787475586, "sampling/importance_sampling_ratio/min": 0.12371035665273666, "sampling/importance_sampling_ratio/mean": 1.0460915565490723, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4967299550771713, "clip_ratio/low_mean": 0.05483974330127239, "clip_ratio/low_min": 0.05483974330127239, "clip_ratio/high_mean": 0.08721532393246889, "clip_ratio/high_max": 0.08721532393246889, "clip_ratio/region_mean": 0.14205506723374128, "reward_total_mean": 0.24523702263832092, "reward_meter_mean": 0.5627568960189819, "reward_meter_std": 0.4417295753955841, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.984375, "reward_lexical_plausibility_std": 0.0289318785071373, "reward_repeat_penalty_mean": 0.7838326692581177, "reward_repeat_penalty_std": 0.15512166917324066, "reward_repeat_floor_mean": 0.9830164909362793, "reward_repeat_floor_std": 0.018982628360390663, "reward_near_duplicate_penalty_mean": 0.961776852607727, "reward_near_duplicate_penalty_std": 0.10811136662960052, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5887500047683716, "reward_judge_quality_std": 0.27740830183029175, "reward_total_composite_mean": 0.24523702263832092, "reward_total_composite_std": 0.2448812872171402} {"timestamp_utc": "2026-04-12T18:37:59Z", "mode": "train", "global_step": 717, "epoch": 0.03773485606020736, "loss": -0.079, "grad_norm": 10.555947303771973, "learning_rate": 7.83030303030303e-06, "num_tokens": 1312456.0, "completions/mean_length": 168.25, "completions/min_length": 49.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 53.66666793823242, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.503504753112793, "rewards/meter/std": 0.3894895315170288, "rewards/count_adherence/mean": 0.65625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.8968750238418579, "rewards/count_floor/std": 0.05580179765820503, "rewards/lexical_plausibility/mean": 0.8695286512374878, "rewards/lexical_plausibility/std": 0.19863541424274445, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1767766922712326, "rewards/repeat_penalty/mean": 0.9882090091705322, "rewards/repeat_penalty/std": 0.01315134484320879, "rewards/repeat_floor/mean": 0.9982313513755798, "rewards/repeat_floor/std": 0.001972706289961934, "rewards/near_duplicate_penalty/mean": 0.9882090091705322, "rewards/near_duplicate_penalty/std": 0.01315134484320879, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18480104207992554, "rewards/total_composite/std": 0.1589871495962143, "reward": 0.18480104207992554, "reward_std": 0.1589871495962143, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16045673191547394, "sampling/sampling_logp_difference/max": 1.2664761543273926, "sampling/importance_sampling_ratio/min": 0.28182297945022583, "sampling/importance_sampling_ratio/mean": 1.010556697845459, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7875117212533951, "clip_ratio/low_mean": 0.038333334028720856, "clip_ratio/low_min": 0.038333334028720856, "clip_ratio/high_mean": 0.07271571457386017, "clip_ratio/high_max": 0.07271571457386017, "clip_ratio/region_mean": 0.11104904860258102, "reward_total_mean": 0.18480104207992554, "reward_meter_mean": 0.503504753112793, "reward_meter_std": 0.3894895315170288, "reward_count_adherence_mean": 0.65625, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.8968750238418579, "reward_count_floor_std": 0.05580179765820503, "reward_lexical_plausibility_mean": 0.8695286512374878, "reward_lexical_plausibility_std": 0.19863541424274445, "reward_repeat_penalty_mean": 0.9882090091705322, "reward_repeat_penalty_std": 0.01315134484320879, "reward_repeat_floor_mean": 0.9982313513755798, "reward_repeat_floor_std": 0.001972706289961934, "reward_near_duplicate_penalty_mean": 0.9882090091705322, "reward_near_duplicate_penalty_std": 0.01315134484320879, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1767766922712326, "reward_total_composite_mean": 0.18480104207992554, "reward_total_composite_std": 0.1589871495962143} {"timestamp_utc": "2026-04-12T18:38:13Z", "mode": "train", "global_step": 718, "epoch": 0.03778748486921741, "loss": -0.0327, "grad_norm": 3.4864449501037598, "learning_rate": 7.827272727272728e-06, "num_tokens": 1314017.0, "completions/mean_length": 144.125, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 21.5, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.6304418444633484, "rewards/meter/std": 0.48267027735710144, "rewards/count_adherence/mean": 0.28125, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.7843749523162842, "rewards/count_floor/std": 0.026516521349549294, "rewards/lexical_plausibility/mean": 0.8447605967521667, "rewards/lexical_plausibility/std": 0.24316036701202393, "rewards/judge_quality/mean": 0.3087500035762787, "rewards/judge_quality/std": 0.2881684899330139, "rewards/repeat_penalty/mean": 0.7706804871559143, "rewards/repeat_penalty/std": 0.0672103762626648, "rewards/repeat_floor/mean": 0.9851903319358826, "rewards/repeat_floor/std": 0.0026342247147113085, "rewards/near_duplicate_penalty/mean": 0.9891163110733032, "rewards/near_duplicate_penalty/std": 0.021902840584516525, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9994207620620728, "rewards/distinct_2/std": 0.0016383323818445206, "rewards/total_composite/mean": 0.135750412940979, "rewards/total_composite/std": 0.1332475244998932, "reward": 0.135750412940979, "reward_std": 0.1332475244998932, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15625827014446259, "sampling/sampling_logp_difference/max": 1.0226421356201172, "sampling/importance_sampling_ratio/min": 0.49665215611457825, "sampling/importance_sampling_ratio/mean": 1.056526780128479, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8905178010463715, "clip_ratio/low_mean": 0.03348370920866728, "clip_ratio/low_min": 0.03348370920866728, "clip_ratio/high_mean": 0.060065790079534054, "clip_ratio/high_max": 0.060065790079534054, "clip_ratio/region_mean": 0.09354949928820133, "reward_total_mean": 0.135750412940979, "reward_meter_mean": 0.6304418444633484, "reward_meter_std": 0.48267027735710144, "reward_count_adherence_mean": 0.28125, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.7843749523162842, "reward_count_floor_std": 0.026516521349549294, "reward_lexical_plausibility_mean": 0.8447605967521667, "reward_lexical_plausibility_std": 0.24316036701202393, "reward_repeat_penalty_mean": 0.7706804871559143, "reward_repeat_penalty_std": 0.0672103762626648, "reward_repeat_floor_mean": 0.9851903319358826, "reward_repeat_floor_std": 0.0026342247147113085, "reward_near_duplicate_penalty_mean": 0.9891163110733032, "reward_near_duplicate_penalty_std": 0.021902840584516525, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9994207620620728, "reward_distinct_2_std": 0.0016383323818445206, "reward_judge_quality_mean": 0.3087500035762787, "reward_judge_quality_std": 0.2881684899330139, "reward_total_composite_mean": 0.135750412940979, "reward_total_composite_std": 0.1332475244998932} {"timestamp_utc": "2026-04-12T18:38:27Z", "mode": "train", "global_step": 719, "epoch": 0.03784011367822746, "loss": -0.0403, "grad_norm": 6.253236293792725, "learning_rate": 7.824242424242425e-06, "num_tokens": 1315463.0, "completions/mean_length": 87.75, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 27.142858505249023, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.7696630954742432, "rewards/meter/std": 0.3979122042655945, "rewards/count_adherence/mean": 0.375, "rewards/count_adherence/std": 0.1178511381149292, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8125, "rewards/count_floor/std": 0.035355325788259506, "rewards/lexical_plausibility/mean": 0.9454492330551147, "rewards/lexical_plausibility/std": 0.1542929708957672, "rewards/judge_quality/mean": 0.28999999165534973, "rewards/judge_quality/std": 0.2899753749370575, "rewards/repeat_penalty/mean": 0.7734279632568359, "rewards/repeat_penalty/std": 0.06626439094543457, "rewards/repeat_floor/mean": 0.9857016801834106, "rewards/repeat_floor/std": 0.001984695205464959, "rewards/near_duplicate_penalty/mean": 0.9921779632568359, "rewards/near_duplicate_penalty/std": 0.02212395705282688, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12374009937047958, "rewards/total_composite/std": 0.10643817484378815, "reward": 0.12374009937047958, "reward_std": 0.10643817484378815, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17211350798606873, "sampling/sampling_logp_difference/max": 1.4356813430786133, "sampling/importance_sampling_ratio/min": 0.23795318603515625, "sampling/importance_sampling_ratio/mean": 1.044828176498413, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.346255600452423, "clip_ratio/low_mean": 0.05486994981765747, "clip_ratio/low_min": 0.05486994981765747, "clip_ratio/high_mean": 0.03685314720496535, "clip_ratio/high_max": 0.03685314720496535, "clip_ratio/region_mean": 0.09172309702262282, "reward_total_mean": 0.12374009937047958, "reward_meter_mean": 0.7696630954742432, "reward_meter_std": 0.3979122042655945, "reward_count_adherence_mean": 0.375, "reward_count_adherence_std": 0.1178511381149292, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8125, "reward_count_floor_std": 0.035355325788259506, "reward_lexical_plausibility_mean": 0.9454492330551147, "reward_lexical_plausibility_std": 0.1542929708957672, "reward_repeat_penalty_mean": 0.7734279632568359, "reward_repeat_penalty_std": 0.06626439094543457, "reward_repeat_floor_mean": 0.9857016801834106, "reward_repeat_floor_std": 0.001984695205464959, "reward_near_duplicate_penalty_mean": 0.9921779632568359, "reward_near_duplicate_penalty_std": 0.02212395705282688, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.28999999165534973, "reward_judge_quality_std": 0.2899753749370575, "reward_total_composite_mean": 0.12374009937047958, "reward_total_composite_std": 0.10643817484378815} {"timestamp_utc": "2026-04-12T18:38:40Z", "mode": "train", "global_step": 720, "epoch": 0.037892742487237514, "loss": -0.0619, "grad_norm": 2.590583324432373, "learning_rate": 7.821212121212122e-06, "num_tokens": 1316860.0, "completions/mean_length": 148.625, "completions/min_length": 26.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 27.5, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.7158470153808594, "rewards/meter/std": 0.4405026435852051, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.891234278678894, "rewards/lexical_plausibility/std": 0.2013997733592987, "rewards/judge_quality/mean": 0.6499999761581421, "rewards/judge_quality/std": 0.4242640733718872, "rewards/repeat_penalty/mean": 0.96875, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9981250166893005, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6014442443847656, "rewards/total_composite/std": 0.42559149861335754, "reward": 0.6014442443847656, "reward_std": 0.42559149861335754, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.095844566822052, "sampling/sampling_logp_difference/max": 1.1192054748535156, "sampling/importance_sampling_ratio/min": 0.3711637854576111, "sampling/importance_sampling_ratio/mean": 1.0188664197921753, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.26757000386714935, "clip_ratio/low_mean": 0.02777777798473835, "clip_ratio/low_min": 0.02777777798473835, "clip_ratio/high_mean": 0.04195601865649223, "clip_ratio/high_max": 0.04195601865649223, "clip_ratio/region_mean": 0.06973379664123058, "reward_total_mean": 0.6014442443847656, "reward_meter_mean": 0.7158470153808594, "reward_meter_std": 0.4405026435852051, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.891234278678894, "reward_lexical_plausibility_std": 0.2013997733592987, "reward_repeat_penalty_mean": 0.96875, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9981250166893005, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6499999761581421, "reward_judge_quality_std": 0.4242640733718872, "reward_total_composite_mean": 0.6014442443847656, "reward_total_composite_std": 0.42559149861335754} {"timestamp_utc": "2026-04-12T18:38:48Z", "mode": "train", "global_step": 721, "epoch": 0.03794537129624757, "loss": -0.0043, "grad_norm": 18.8549747467041, "learning_rate": 7.81818181818182e-06, "num_tokens": 1318356.0, "completions/mean_length": 32.0, "completions/min_length": 16.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.0, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.12932734191417694, "rewards/meter/std": 0.17947319149971008, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9312499761581421, "rewards/judge_quality/std": 0.015526460483670235, "rewards/repeat_penalty/mean": 0.9036004543304443, "rewards/repeat_penalty/std": 0.10398723185062408, "rewards/repeat_floor/mean": 0.9912065267562866, "rewards/repeat_floor/std": 0.008883717469871044, "rewards/near_duplicate_penalty/mean": 0.9849158525466919, "rewards/near_duplicate_penalty/std": 0.016506239771842957, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9482681155204773, "rewards/distinct_2/std": 0.07615123689174652, "rewards/total_composite/mean": 0.11863408237695694, "rewards/total_composite/std": 0.1647283434867859, "reward": 0.11863408237695694, "reward_std": 0.16472835838794708, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13476267457008362, "sampling/sampling_logp_difference/max": 1.7197775840759277, "sampling/importance_sampling_ratio/min": 0.2881323993206024, "sampling/importance_sampling_ratio/mean": 1.0299296379089355, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5904507488012314, "clip_ratio/low_mean": 0.06712105358019471, "clip_ratio/low_min": 0.06712105358019471, "clip_ratio/high_mean": 0.05870911106467247, "clip_ratio/high_max": 0.05870911106467247, "clip_ratio/region_mean": 0.12583016464486718, "reward_total_mean": 0.11863408237695694, "reward_meter_mean": 0.12932734191417694, "reward_meter_std": 0.17947319149971008, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9036004543304443, "reward_repeat_penalty_std": 0.10398723185062408, "reward_repeat_floor_mean": 0.9912065267562866, "reward_repeat_floor_std": 0.008883717469871044, "reward_near_duplicate_penalty_mean": 0.9849158525466919, "reward_near_duplicate_penalty_std": 0.016506239771842957, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9482681155204773, "reward_distinct_2_std": 0.07615123689174652, "reward_judge_quality_mean": 0.9312499761581421, "reward_judge_quality_std": 0.015526460483670235, "reward_total_composite_mean": 0.11863408237695694, "reward_total_composite_std": 0.1647283434867859} {"timestamp_utc": "2026-04-12T18:39:02Z", "mode": "train", "global_step": 722, "epoch": 0.03799800010525762, "loss": -0.0631, "grad_norm": 3.870074987411499, "learning_rate": 7.815151515151515e-06, "num_tokens": 1319716.0, "completions/mean_length": 82.0, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.571430206298828, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.8439614176750183, "rewards/meter/std": 0.3415564298629761, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.917374849319458, "rewards/lexical_plausibility/std": 0.17628265917301178, "rewards/judge_quality/mean": 0.7150000333786011, "rewards/judge_quality/std": 0.38052597641944885, "rewards/repeat_penalty/mean": 0.7113407850265503, "rewards/repeat_penalty/std": 0.059995025396347046, "rewards/repeat_floor/mean": 0.9780111312866211, "rewards/repeat_floor/std": 0.010424705222249031, "rewards/near_duplicate_penalty/mean": 0.9630230665206909, "rewards/near_duplicate_penalty/std": 0.05389808118343353, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.045327357947826385, "rewards/total_composite/mean": 0.56446373462677, "rewards/total_composite/std": 0.31382542848587036, "reward": 0.56446373462677, "reward_std": 0.31382542848587036, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13253246247768402, "sampling/sampling_logp_difference/max": 1.212634801864624, "sampling/importance_sampling_ratio/min": 0.297412633895874, "sampling/importance_sampling_ratio/mean": 1.0298932790756226, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8780987411737442, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.09667454473674297, "clip_ratio/high_max": 0.09667454473674297, "clip_ratio/region_mean": 0.09667454473674297, "reward_total_mean": 0.56446373462677, "reward_meter_mean": 0.8439614176750183, "reward_meter_std": 0.3415564298629761, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.917374849319458, "reward_lexical_plausibility_std": 0.17628265917301178, "reward_repeat_penalty_mean": 0.7113407850265503, "reward_repeat_penalty_std": 0.059995025396347046, "reward_repeat_floor_mean": 0.9780111312866211, "reward_repeat_floor_std": 0.010424705222249031, "reward_near_duplicate_penalty_mean": 0.9630230665206909, "reward_near_duplicate_penalty_std": 0.05389808118343353, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.045327357947826385, "reward_judge_quality_mean": 0.7150000333786011, "reward_judge_quality_std": 0.38052597641944885, "reward_total_composite_mean": 0.56446373462677, "reward_total_composite_std": 0.31382542848587036} {"timestamp_utc": "2026-04-12T18:39:18Z", "mode": "train", "global_step": 723, "epoch": 0.03805062891426767, "loss": -0.0304, "grad_norm": 5.2299323081970215, "learning_rate": 7.812121212121213e-06, "num_tokens": 1321095.0, "completions/mean_length": 84.375, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 23.285715103149414, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.6755993366241455, "rewards/meter/std": 0.43550217151641846, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9109703302383423, "rewards/lexical_plausibility/std": 0.1917761266231537, "rewards/judge_quality/mean": 0.7400000095367432, "rewards/judge_quality/std": 0.34280356764793396, "rewards/repeat_penalty/mean": 0.7712526321411133, "rewards/repeat_penalty/std": 0.09453253448009491, "rewards/repeat_floor/mean": 0.9848755598068237, "rewards/repeat_floor/std": 0.007286030799150467, "rewards/near_duplicate_penalty/mean": 0.986670196056366, "rewards/near_duplicate_penalty/std": 0.026991460472345352, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6099381446838379, "rewards/total_composite/std": 0.39566490054130554, "reward": 0.6099381446838379, "reward_std": 0.39566490054130554, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13940078020095825, "sampling/sampling_logp_difference/max": 0.8479976058006287, "sampling/importance_sampling_ratio/min": 0.42827165126800537, "sampling/importance_sampling_ratio/mean": 1.018211841583252, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8917571529746056, "clip_ratio/low_mean": 0.015224359463900328, "clip_ratio/low_min": 0.015224359463900328, "clip_ratio/high_mean": 0.09005434717983007, "clip_ratio/high_max": 0.09005434717983007, "clip_ratio/region_mean": 0.1052787066437304, "reward_total_mean": 0.6099381446838379, "reward_meter_mean": 0.6755993366241455, "reward_meter_std": 0.43550217151641846, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9109703302383423, "reward_lexical_plausibility_std": 0.1917761266231537, "reward_repeat_penalty_mean": 0.7712526321411133, "reward_repeat_penalty_std": 0.09453253448009491, "reward_repeat_floor_mean": 0.9848755598068237, "reward_repeat_floor_std": 0.007286030799150467, "reward_near_duplicate_penalty_mean": 0.986670196056366, "reward_near_duplicate_penalty_std": 0.026991460472345352, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7400000095367432, "reward_judge_quality_std": 0.34280356764793396, "reward_total_composite_mean": 0.6099381446838379, "reward_total_composite_std": 0.39566490054130554} {"timestamp_utc": "2026-04-12T18:39:35Z", "mode": "train", "global_step": 724, "epoch": 0.038103257723277724, "loss": -0.0272, "grad_norm": 5.167529106140137, "learning_rate": 7.80909090909091e-06, "num_tokens": 1322564.0, "completions/mean_length": 84.625, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 23.571430206298828, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.7411857843399048, "rewards/meter/std": 0.397968053817749, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9382473230361938, "rewards/lexical_plausibility/std": 0.17466284334659576, "rewards/judge_quality/mean": 0.5012500286102295, "rewards/judge_quality/std": 0.3744877576828003, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3536131680011749, "rewards/total_composite/std": 0.3555664122104645, "reward": 0.3536131680011749, "reward_std": 0.3555663824081421, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15759819746017456, "sampling/sampling_logp_difference/max": 1.3172483444213867, "sampling/importance_sampling_ratio/min": 0.2678713798522949, "sampling/importance_sampling_ratio/mean": 1.0373677015304565, "sampling/importance_sampling_ratio/max": 1.9701427221298218, "entropy": 1.4948654025793076, "clip_ratio/low_mean": 0.06809163186699152, "clip_ratio/low_min": 0.06809163186699152, "clip_ratio/high_mean": 0.07676573470234871, "clip_ratio/high_max": 0.07676573470234871, "clip_ratio/region_mean": 0.14485736656934023, "reward_total_mean": 0.3536131680011749, "reward_meter_mean": 0.7411857843399048, "reward_meter_std": 0.397968053817749, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9382473230361938, "reward_lexical_plausibility_std": 0.17466284334659576, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5012500286102295, "reward_judge_quality_std": 0.3744877576828003, "reward_total_composite_mean": 0.3536131680011749, "reward_total_composite_std": 0.3555664122104645} {"timestamp_utc": "2026-04-12T18:39:48Z", "mode": "train", "global_step": 725, "epoch": 0.038155886532287776, "loss": 0.0277, "grad_norm": 4.60774040222168, "learning_rate": 7.806060606060607e-06, "num_tokens": 1323938.0, "completions/mean_length": 81.75, "completions/min_length": 13.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.285715103149414, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.07172045856714249, "rewards/meter/std": 0.15121987462043762, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.938498854637146, "rewards/lexical_plausibility/std": 0.17395159602165222, "rewards/judge_quality/mean": 0.4925000071525574, "rewards/judge_quality/std": 0.33961114287376404, "rewards/repeat_penalty/mean": 0.7383946180343628, "rewards/repeat_penalty/std": 0.02443493902683258, "rewards/repeat_floor/mean": 0.9826788902282715, "rewards/repeat_floor/std": 0.004886987619102001, "rewards/near_duplicate_penalty/mean": 0.9845261573791504, "rewards/near_duplicate_penalty/std": 0.03257991746068001, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.04277218505740166, "rewards/total_composite/std": 0.09623362123966217, "reward": 0.04277218505740166, "reward_std": 0.09623362123966217, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18291820585727692, "sampling/sampling_logp_difference/max": 1.1260461807250977, "sampling/importance_sampling_ratio/min": 0.3243129849433899, "sampling/importance_sampling_ratio/mean": 1.0450856685638428, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4478702247142792, "clip_ratio/low_mean": 0.12467185966670513, "clip_ratio/low_min": 0.12467185966670513, "clip_ratio/high_mean": 0.0475961547344923, "clip_ratio/high_max": 0.0475961547344923, "clip_ratio/region_mean": 0.17226801440119743, "reward_total_mean": 0.04277218505740166, "reward_meter_mean": 0.07172045856714249, "reward_meter_std": 0.15121987462043762, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.938498854637146, "reward_lexical_plausibility_std": 0.17395159602165222, "reward_repeat_penalty_mean": 0.7383946180343628, "reward_repeat_penalty_std": 0.02443493902683258, "reward_repeat_floor_mean": 0.9826788902282715, "reward_repeat_floor_std": 0.004886987619102001, "reward_near_duplicate_penalty_mean": 0.9845261573791504, "reward_near_duplicate_penalty_std": 0.03257991746068001, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4925000071525574, "reward_judge_quality_std": 0.33961114287376404, "reward_total_composite_mean": 0.04277218505740166, "reward_total_composite_std": 0.09623362123966217} {"timestamp_utc": "2026-04-12T18:40:02Z", "mode": "train", "global_step": 726, "epoch": 0.03820851534129783, "loss": -0.0229, "grad_norm": 1.2339202165603638, "learning_rate": 7.803030303030303e-06, "num_tokens": 1325287.0, "completions/mean_length": 327.625, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 20.33333396911621, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.376447856426239, "rewards/meter/std": 0.3692064583301544, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.6865270733833313, "rewards/lexical_plausibility/std": 0.22714054584503174, "rewards/judge_quality/mean": 0.10625000298023224, "rewards/judge_quality/std": 0.11160357296466827, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.039985693991184235, "rewards/total_composite/std": 0.05159784108400345, "reward": 0.039985693991184235, "reward_std": 0.05159783735871315, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1866149753332138, "sampling/sampling_logp_difference/max": 1.3450794219970703, "sampling/importance_sampling_ratio/min": 0.26051902770996094, "sampling/importance_sampling_ratio/mean": 1.0675848722457886, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5679557621479034, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.08442942425608635, "clip_ratio/high_max": 0.08442942425608635, "clip_ratio/region_mean": 0.08442942425608635, "reward_total_mean": 0.039985693991184235, "reward_meter_mean": 0.376447856426239, "reward_meter_std": 0.3692064583301544, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.6865270733833313, "reward_lexical_plausibility_std": 0.22714054584503174, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.10625000298023224, "reward_judge_quality_std": 0.11160357296466827, "reward_total_composite_mean": 0.039985693991184235, "reward_total_composite_std": 0.05159784108400345} {"timestamp_utc": "2026-04-12T18:40:18Z", "mode": "train", "global_step": 727, "epoch": 0.03826114415030788, "loss": -0.0122, "grad_norm": 2.821991205215454, "learning_rate": 7.800000000000002e-06, "num_tokens": 1326843.0, "completions/mean_length": 144.5, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 22.0, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.3461433947086334, "rewards/meter/std": 0.40159371495246887, "rewards/count_adherence/mean": 0.17500001192092896, "rewards/count_adherence/std": 0.0707106813788414, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.7524999976158142, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.8556759357452393, "rewards/lexical_plausibility/std": 0.2235196977853775, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.18077215552330017, "rewards/repeat_penalty/mean": 0.7688470482826233, "rewards/repeat_penalty/std": 0.0959373190999031, "rewards/repeat_floor/mean": 0.9850017428398132, "rewards/repeat_floor/std": 0.006775653455406427, "rewards/near_duplicate_penalty/mean": 0.993584156036377, "rewards/near_duplicate_penalty/std": 0.015087136998772621, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.08100727945566177, "rewards/total_composite/std": 0.10784495621919632, "reward": 0.08100727945566177, "reward_std": 0.10784494876861572, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18328239023685455, "sampling/sampling_logp_difference/max": 1.1372299194335938, "sampling/importance_sampling_ratio/min": 0.32070618867874146, "sampling/importance_sampling_ratio/mean": 1.0604618787765503, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4922990500926971, "clip_ratio/low_mean": 0.07380952499806881, "clip_ratio/low_min": 0.07380952499806881, "clip_ratio/high_mean": 0.07006578985601664, "clip_ratio/high_max": 0.07006578985601664, "clip_ratio/region_mean": 0.14387531485408545, "reward_total_mean": 0.08100727945566177, "reward_meter_mean": 0.3461433947086334, "reward_meter_std": 0.40159371495246887, "reward_count_adherence_mean": 0.17500001192092896, "reward_count_adherence_std": 0.0707106813788414, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.7524999976158142, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.8556759357452393, "reward_lexical_plausibility_std": 0.2235196977853775, "reward_repeat_penalty_mean": 0.7688470482826233, "reward_repeat_penalty_std": 0.0959373190999031, "reward_repeat_floor_mean": 0.9850017428398132, "reward_repeat_floor_std": 0.006775653455406427, "reward_near_duplicate_penalty_mean": 0.993584156036377, "reward_near_duplicate_penalty_std": 0.015087136998772621, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.18077215552330017, "reward_total_composite_mean": 0.08100727945566177, "reward_total_composite_std": 0.10784495621919632} {"timestamp_utc": "2026-04-12T18:40:31Z", "mode": "train", "global_step": 728, "epoch": 0.038313772959317934, "loss": -0.0376, "grad_norm": 1.3681159019470215, "learning_rate": 7.796969696969697e-06, "num_tokens": 1328137.0, "completions/mean_length": 208.75, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 26.80000114440918, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.5654644966125488, "rewards/meter/std": 0.47302353382110596, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8394579887390137, "rewards/lexical_plausibility/std": 0.22180584073066711, "rewards/judge_quality/mean": 0.4300000071525574, "rewards/judge_quality/std": 0.42570948600769043, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3893899917602539, "rewards/total_composite/std": 0.43629246950149536, "reward": 0.3893899917602539, "reward_std": 0.43629246950149536, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16032110154628754, "sampling/sampling_logp_difference/max": 1.5410747528076172, "sampling/importance_sampling_ratio/min": 0.2141508162021637, "sampling/importance_sampling_ratio/mean": 1.0484509468078613, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8937837034463882, "clip_ratio/low_mean": 0.044871795922517776, "clip_ratio/low_min": 0.044871795922517776, "clip_ratio/high_mean": 0.05648065451532602, "clip_ratio/high_max": 0.05648065451532602, "clip_ratio/region_mean": 0.1013524504378438, "reward_total_mean": 0.3893899917602539, "reward_meter_mean": 0.5654644966125488, "reward_meter_std": 0.47302353382110596, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8394579887390137, "reward_lexical_plausibility_std": 0.22180584073066711, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4300000071525574, "reward_judge_quality_std": 0.42570948600769043, "reward_total_composite_mean": 0.3893899917602539, "reward_total_composite_std": 0.43629246950149536} {"timestamp_utc": "2026-04-12T18:40:47Z", "mode": "train", "global_step": 729, "epoch": 0.038366401768327986, "loss": -0.0243, "grad_norm": 1.1098401546478271, "learning_rate": 7.793939393939394e-06, "num_tokens": 1329551.0, "completions/mean_length": 329.75, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 26.0, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.33000853657722473, "rewards/meter/std": 0.37807002663612366, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.7095398902893066, "rewards/lexical_plausibility/std": 0.25487351417541504, "rewards/judge_quality/mean": 0.2549999952316284, "rewards/judge_quality/std": 0.3254886567592621, "rewards/repeat_penalty/mean": 0.8006408214569092, "rewards/repeat_penalty/std": 0.09557542949914932, "rewards/repeat_floor/mean": 0.9869711399078369, "rewards/repeat_floor/std": 0.004584609065204859, "rewards/near_duplicate_penalty/mean": 0.9881408214569092, "rewards/near_duplicate_penalty/std": 0.028710680082440376, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.06835195422172546, "rewards/total_composite/std": 0.11151061952114105, "reward": 0.06835195422172546, "reward_std": 0.11151061207056046, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1664460450410843, "sampling/sampling_logp_difference/max": 1.539482593536377, "sampling/importance_sampling_ratio/min": 0.214492067694664, "sampling/importance_sampling_ratio/mean": 1.0515148639678955, "sampling/importance_sampling_ratio/max": 1.8771865367889404, "entropy": 0.5704511851072311, "clip_ratio/low_mean": 0.02083333395421505, "clip_ratio/low_min": 0.02083333395421505, "clip_ratio/high_mean": 0.046875, "clip_ratio/high_max": 0.046875, "clip_ratio/region_mean": 0.06770833395421505, "reward_total_mean": 0.06835195422172546, "reward_meter_mean": 0.33000853657722473, "reward_meter_std": 0.37807002663612366, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.7095398902893066, "reward_lexical_plausibility_std": 0.25487351417541504, "reward_repeat_penalty_mean": 0.8006408214569092, "reward_repeat_penalty_std": 0.09557542949914932, "reward_repeat_floor_mean": 0.9869711399078369, "reward_repeat_floor_std": 0.004584609065204859, "reward_near_duplicate_penalty_mean": 0.9881408214569092, "reward_near_duplicate_penalty_std": 0.028710680082440376, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2549999952316284, "reward_judge_quality_std": 0.3254886567592621, "reward_total_composite_mean": 0.06835195422172546, "reward_total_composite_std": 0.11151061952114105} {"timestamp_utc": "2026-04-12T18:40:56Z", "mode": "train", "global_step": 730, "epoch": 0.03841903057733803, "loss": -0.0672, "grad_norm": 21.157039642333984, "learning_rate": 7.790909090909092e-06, "num_tokens": 1330947.0, "completions/mean_length": 19.5, "completions/min_length": 12.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.5, "completions/min_terminated_length": 12.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.7525069117546082, "rewards/meter/std": 0.3796283006668091, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9574281573295593, "rewards/lexical_plausibility/std": 0.09763853251934052, "rewards/judge_quality/mean": 0.41750001907348633, "rewards/judge_quality/std": 0.3236731290817261, "rewards/repeat_penalty/mean": 0.7707452774047852, "rewards/repeat_penalty/std": 0.09718868136405945, "rewards/repeat_floor/mean": 0.9847740530967712, "rewards/repeat_floor/std": 0.008511229418218136, "rewards/near_duplicate_penalty/mean": 0.9859936237335205, "rewards/near_duplicate_penalty/std": 0.03961591050028801, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33790332078933716, "rewards/total_composite/std": 0.3171427845954895, "reward": 0.33790332078933716, "reward_std": 0.3171428143978119, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1961711347103119, "sampling/sampling_logp_difference/max": 0.9623818397521973, "sampling/importance_sampling_ratio/min": 0.3819819688796997, "sampling/importance_sampling_ratio/mean": 1.0979080200195312, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.0567077547311783, "clip_ratio/low_mean": 0.13083964958786964, "clip_ratio/low_min": 0.13083964958786964, "clip_ratio/high_mean": 0.08909605676308274, "clip_ratio/high_max": 0.08909605676308274, "clip_ratio/region_mean": 0.2199357063509524, "reward_total_mean": 0.33790332078933716, "reward_meter_mean": 0.7525069117546082, "reward_meter_std": 0.3796283006668091, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9574281573295593, "reward_lexical_plausibility_std": 0.09763853251934052, "reward_repeat_penalty_mean": 0.7707452774047852, "reward_repeat_penalty_std": 0.09718868136405945, "reward_repeat_floor_mean": 0.9847740530967712, "reward_repeat_floor_std": 0.008511229418218136, "reward_near_duplicate_penalty_mean": 0.9859936237335205, "reward_near_duplicate_penalty_std": 0.03961591050028801, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41750001907348633, "reward_judge_quality_std": 0.3236731290817261, "reward_total_composite_mean": 0.33790332078933716, "reward_total_composite_std": 0.3171427845954895} {"timestamp_utc": "2026-04-12T18:41:09Z", "mode": "train", "global_step": 731, "epoch": 0.038471659386348084, "loss": -0.118, "grad_norm": 6.608311653137207, "learning_rate": 7.787878787878789e-06, "num_tokens": 1332451.0, "completions/mean_length": 87.0, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 26.285715103149414, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.15218953788280487, "rewards/meter/std": 0.333724707365036, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.08017837256193161, "rewards/lexical_plausibility/mean": 0.9375545978546143, "rewards/lexical_plausibility/std": 0.17662228643894196, "rewards/judge_quality/mean": 0.5787500143051147, "rewards/judge_quality/std": 0.38794100284576416, "rewards/repeat_penalty/mean": 0.84375, "rewards/repeat_penalty/std": 0.12938730418682098, "rewards/repeat_floor/mean": 0.9906250238418579, "rewards/repeat_floor/std": 0.00776322977617383, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11903752386569977, "rewards/total_composite/std": 0.26284700632095337, "reward": 0.11903752386569977, "reward_std": 0.26284700632095337, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15268048644065857, "sampling/sampling_logp_difference/max": 1.066246509552002, "sampling/importance_sampling_ratio/min": 0.34429842233657837, "sampling/importance_sampling_ratio/mean": 1.070543646812439, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1604615151882172, "clip_ratio/low_mean": 0.11805515456944704, "clip_ratio/low_min": 0.11805515456944704, "clip_ratio/high_mean": 0.050543476827442646, "clip_ratio/high_max": 0.050543476827442646, "clip_ratio/region_mean": 0.1685986313968897, "reward_total_mean": 0.11903752386569977, "reward_meter_mean": 0.15218953788280487, "reward_meter_std": 0.333724707365036, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.08017837256193161, "reward_lexical_plausibility_mean": 0.9375545978546143, "reward_lexical_plausibility_std": 0.17662228643894196, "reward_repeat_penalty_mean": 0.84375, "reward_repeat_penalty_std": 0.12938730418682098, "reward_repeat_floor_mean": 0.9906250238418579, "reward_repeat_floor_std": 0.00776322977617383, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5787500143051147, "reward_judge_quality_std": 0.38794100284576416, "reward_total_composite_mean": 0.11903752386569977, "reward_total_composite_std": 0.26284700632095337} {"timestamp_utc": "2026-04-12T18:41:25Z", "mode": "train", "global_step": 732, "epoch": 0.038524288195358136, "loss": -0.0242, "grad_norm": 0.8254483342170715, "learning_rate": 7.784848484848484e-06, "num_tokens": 1333798.0, "completions/mean_length": 327.375, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 19.666667938232422, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.26678141951560974, "rewards/meter/std": 0.3807927370071411, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.6831883192062378, "rewards/lexical_plausibility/std": 0.19720584154129028, "rewards/judge_quality/mean": 0.11250000447034836, "rewards/judge_quality/std": 0.1482035219669342, "rewards/repeat_penalty/mean": 0.7455357313156128, "rewards/repeat_penalty/std": 0.012626901268959045, "rewards/repeat_floor/mean": 0.9841071367263794, "rewards/repeat_floor/std": 0.002525375923141837, "rewards/near_duplicate_penalty/mean": 0.9940476417541504, "rewards/near_duplicate_penalty/std": 0.016835875809192657, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.043202705681324005, "rewards/total_composite/std": 0.06016030162572861, "reward": 0.043202705681324005, "reward_std": 0.06016030162572861, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22709383070468903, "sampling/sampling_logp_difference/max": 1.682027816772461, "sampling/importance_sampling_ratio/min": 0.1859964281320572, "sampling/importance_sampling_ratio/mean": 1.0534539222717285, "sampling/importance_sampling_ratio/max": 1.9848183393478394, "entropy": 0.7943100333213806, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.05545587558299303, "clip_ratio/high_max": 0.05545587558299303, "clip_ratio/region_mean": 0.05545587558299303, "reward_total_mean": 0.043202705681324005, "reward_meter_mean": 0.26678141951560974, "reward_meter_std": 0.3807927370071411, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.6831883192062378, "reward_lexical_plausibility_std": 0.19720584154129028, "reward_repeat_penalty_mean": 0.7455357313156128, "reward_repeat_penalty_std": 0.012626901268959045, "reward_repeat_floor_mean": 0.9841071367263794, "reward_repeat_floor_std": 0.002525375923141837, "reward_near_duplicate_penalty_mean": 0.9940476417541504, "reward_near_duplicate_penalty_std": 0.016835875809192657, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.11250000447034836, "reward_judge_quality_std": 0.1482035219669342, "reward_total_composite_mean": 0.043202705681324005, "reward_total_composite_std": 0.06016030162572861} {"timestamp_utc": "2026-04-12T18:41:39Z", "mode": "train", "global_step": 733, "epoch": 0.03857691700436819, "loss": -0.0337, "grad_norm": 1.1059763431549072, "learning_rate": 7.781818181818183e-06, "num_tokens": 1335295.0, "completions/mean_length": 145.125, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 22.83333396911621, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.7005734443664551, "rewards/meter/std": 0.420141339302063, "rewards/count_adherence/mean": 0.3125, "rewards/count_adherence/std": 0.22160132229328156, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.793749988079071, "rewards/count_floor/std": 0.06648041307926178, "rewards/lexical_plausibility/mean": 0.9005357027053833, "rewards/lexical_plausibility/std": 0.18748725950717926, "rewards/judge_quality/mean": 0.39250001311302185, "rewards/judge_quality/std": 0.3454500436782837, "rewards/repeat_penalty/mean": 0.8286024332046509, "rewards/repeat_penalty/std": 0.14752699434757233, "rewards/repeat_floor/mean": 0.9875989556312561, "rewards/repeat_floor/std": 0.013096061535179615, "rewards/near_duplicate_penalty/mean": 0.9798262119293213, "rewards/near_duplicate_penalty/std": 0.05683772265911102, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2666128873825073, "rewards/total_composite/std": 0.2470596432685852, "reward": 0.2666128873825073, "reward_std": 0.2470596432685852, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15543679893016815, "sampling/sampling_logp_difference/max": 1.2707390785217285, "sampling/importance_sampling_ratio/min": 0.2806241512298584, "sampling/importance_sampling_ratio/mean": 0.9980720281600952, "sampling/importance_sampling_ratio/max": 1.7403450012207031, "entropy": 0.7436570003628731, "clip_ratio/low_mean": 0.03405748726800084, "clip_ratio/low_min": 0.03405748726800084, "clip_ratio/high_mean": 0.06414473801851273, "clip_ratio/high_max": 0.06414473801851273, "clip_ratio/region_mean": 0.09820222528651357, "reward_total_mean": 0.2666128873825073, "reward_meter_mean": 0.7005734443664551, "reward_meter_std": 0.420141339302063, "reward_count_adherence_mean": 0.3125, "reward_count_adherence_std": 0.22160132229328156, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.793749988079071, "reward_count_floor_std": 0.06648041307926178, "reward_lexical_plausibility_mean": 0.9005357027053833, "reward_lexical_plausibility_std": 0.18748725950717926, "reward_repeat_penalty_mean": 0.8286024332046509, "reward_repeat_penalty_std": 0.14752699434757233, "reward_repeat_floor_mean": 0.9875989556312561, "reward_repeat_floor_std": 0.013096061535179615, "reward_near_duplicate_penalty_mean": 0.9798262119293213, "reward_near_duplicate_penalty_std": 0.05683772265911102, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.39250001311302185, "reward_judge_quality_std": 0.3454500436782837, "reward_total_composite_mean": 0.2666128873825073, "reward_total_composite_std": 0.2470596432685852} {"timestamp_utc": "2026-04-12T18:41:55Z", "mode": "train", "global_step": 734, "epoch": 0.03862954581337824, "loss": -0.008, "grad_norm": 0.5768758058547974, "learning_rate": 7.778787878787879e-06, "num_tokens": 1336934.0, "completions/mean_length": 449.875, "completions/min_length": 15.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 15.0, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 15.0, "rewards/meter/mean": 0.143520325422287, "rewards/meter/std": 0.24628643691539764, "rewards/count_adherence/mean": 0.15000000596046448, "rewards/count_adherence/std": 0.1414213627576828, "rewards/arabic_clean/mean": 0.125, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.625, "rewards/hard_gate/std": 0.5175492167472839, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.7450000047683716, "rewards/count_floor/std": 0.04242641106247902, "rewards/lexical_plausibility/mean": 0.5566787719726562, "rewards/lexical_plausibility/std": 0.18475589156150818, "rewards/judge_quality/mean": 0.05000000074505806, "rewards/judge_quality/std": 0.046291008591651917, "rewards/repeat_penalty/mean": 0.8745421171188354, "rewards/repeat_penalty/std": 0.1341254860162735, "rewards/repeat_floor/mean": 0.9924451112747192, "rewards/repeat_floor/std": 0.008077853359282017, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9993895292282104, "rewards/distinct_2/std": 0.0017267564544454217, "rewards/total_composite/mean": 0.011730743572115898, "rewards/total_composite/std": 0.02625987119972706, "reward": 0.011730743572115898, "reward_std": 0.026259873062372208, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.29687464237213135, "sampling/sampling_logp_difference/max": 1.0584502220153809, "sampling/importance_sampling_ratio/min": 0.3469931483268738, "sampling/importance_sampling_ratio/mean": 0.8634982109069824, "sampling/importance_sampling_ratio/max": 1.2256780862808228, "entropy": 0.17789536714553833, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.02500000037252903, "clip_ratio/high_max": 0.02500000037252903, "clip_ratio/region_mean": 0.02500000037252903, "reward_total_mean": 0.011730743572115898, "reward_meter_mean": 0.143520325422287, "reward_meter_std": 0.24628643691539764, "reward_count_adherence_mean": 0.15000000596046448, "reward_count_adherence_std": 0.1414213627576828, "reward_arabic_clean_mean": 0.125, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.625, "reward_hard_gate_std": 0.5175492167472839, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.7450000047683716, "reward_count_floor_std": 0.04242641106247902, "reward_lexical_plausibility_mean": 0.5566787719726562, "reward_lexical_plausibility_std": 0.18475589156150818, "reward_repeat_penalty_mean": 0.8745421171188354, "reward_repeat_penalty_std": 0.1341254860162735, "reward_repeat_floor_mean": 0.9924451112747192, "reward_repeat_floor_std": 0.008077853359282017, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9993895292282104, "reward_distinct_2_std": 0.0017267564544454217, "reward_judge_quality_mean": 0.05000000074505806, "reward_judge_quality_std": 0.046291008591651917, "reward_total_composite_mean": 0.011730743572115898, "reward_total_composite_std": 0.02625987119972706} {"timestamp_utc": "2026-04-12T18:42:09Z", "mode": "train", "global_step": 735, "epoch": 0.03868217462238829, "loss": 0.0181, "grad_norm": 3.2832353115081787, "learning_rate": 7.775757575757576e-06, "num_tokens": 1338817.0, "completions/mean_length": 97.375, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.142860412597656, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 93.0, "rewards/meter/mean": 0.7859209179878235, "rewards/meter/std": 0.36400628089904785, "rewards/count_adherence/mean": 0.30000001192092896, "rewards/count_adherence/std": 0.21380899846553802, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.7899999618530273, "rewards/count_floor/std": 0.06414270401000977, "rewards/lexical_plausibility/mean": 0.9369398355484009, "rewards/lexical_plausibility/std": 0.15466144680976868, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.7620465159416199, "rewards/repeat_penalty/std": 0.1048668697476387, "rewards/repeat_floor/mean": 0.9820486307144165, "rewards/repeat_floor/std": 0.011632430367171764, "rewards/near_duplicate_penalty/mean": 0.9737856388092041, "rewards/near_duplicate_penalty/std": 0.057021964341402054, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9692307710647583, "rewards/distinct_2/std": 0.08702851831912994, "rewards/total_composite/mean": 0.12267211079597473, "rewards/total_composite/std": 0.07322044670581818, "reward": 0.12267211079597473, "reward_std": 0.07322043925523758, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20950034260749817, "sampling/sampling_logp_difference/max": 3.6155519485473633, "sampling/importance_sampling_ratio/min": 0.026902073994278908, "sampling/importance_sampling_ratio/mean": 1.0456829071044922, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2990215495228767, "clip_ratio/low_mean": 0.11206033732742071, "clip_ratio/low_min": 0.11206033732742071, "clip_ratio/high_mean": 0.06185300089418888, "clip_ratio/high_max": 0.06185300089418888, "clip_ratio/region_mean": 0.1739133382216096, "reward_total_mean": 0.12267211079597473, "reward_meter_mean": 0.7859209179878235, "reward_meter_std": 0.36400628089904785, "reward_count_adherence_mean": 0.30000001192092896, "reward_count_adherence_std": 0.21380899846553802, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.7899999618530273, "reward_count_floor_std": 0.06414270401000977, "reward_lexical_plausibility_mean": 0.9369398355484009, "reward_lexical_plausibility_std": 0.15466144680976868, "reward_repeat_penalty_mean": 0.7620465159416199, "reward_repeat_penalty_std": 0.1048668697476387, "reward_repeat_floor_mean": 0.9820486307144165, "reward_repeat_floor_std": 0.011632430367171764, "reward_near_duplicate_penalty_mean": 0.9737856388092041, "reward_near_duplicate_penalty_std": 0.057021964341402054, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9692307710647583, "reward_distinct_2_std": 0.08702851831912994, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.12267211079597473, "reward_total_composite_std": 0.07322044670581818} {"timestamp_utc": "2026-04-12T18:42:23Z", "mode": "train", "global_step": 736, "epoch": 0.038734803431398346, "loss": -0.0214, "grad_norm": 2.325249195098877, "learning_rate": 7.772727272727273e-06, "num_tokens": 1340452.0, "completions/mean_length": 144.375, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 21.83333396911621, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.2917229235172272, "rewards/meter/std": 0.3761116564273834, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.858216404914856, "rewards/lexical_plausibility/std": 0.24734167754650116, "rewards/judge_quality/mean": 0.27125000953674316, "rewards/judge_quality/std": 0.28667742013931274, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12339712679386139, "rewards/total_composite/std": 0.259798139333725, "reward": 0.12339712679386139, "reward_std": 0.2597981095314026, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1476915031671524, "sampling/sampling_logp_difference/max": 1.0003724098205566, "sampling/importance_sampling_ratio/min": 0.36774247884750366, "sampling/importance_sampling_ratio/mean": 1.018509864807129, "sampling/importance_sampling_ratio/max": 1.9719990491867065, "entropy": 0.9392887651920319, "clip_ratio/low_mean": 0.08189863944426179, "clip_ratio/low_min": 0.08189863944426179, "clip_ratio/high_mean": 0.0416666679084301, "clip_ratio/high_max": 0.0416666679084301, "clip_ratio/region_mean": 0.12356530735269189, "reward_total_mean": 0.12339712679386139, "reward_meter_mean": 0.2917229235172272, "reward_meter_std": 0.3761116564273834, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.858216404914856, "reward_lexical_plausibility_std": 0.24734167754650116, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.27125000953674316, "reward_judge_quality_std": 0.28667742013931274, "reward_total_composite_mean": 0.12339712679386139, "reward_total_composite_std": 0.259798139333725} {"timestamp_utc": "2026-04-12T18:42:36Z", "mode": "train", "global_step": 737, "epoch": 0.0387874322404084, "loss": -0.008, "grad_norm": 4.003470420837402, "learning_rate": 7.76969696969697e-06, "num_tokens": 1341807.0, "completions/mean_length": 80.375, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 18.71428680419922, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.403460294008255, "rewards/meter/std": 0.3681066930294037, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9372429847717285, "rewards/lexical_plausibility/std": 0.1775035411119461, "rewards/judge_quality/mean": 0.2837500274181366, "rewards/judge_quality/std": 0.28278905153274536, "rewards/repeat_penalty/mean": 0.7007063627243042, "rewards/repeat_penalty/std": 0.09127402305603027, "rewards/repeat_floor/mean": 0.9751412868499756, "rewards/repeat_floor/std": 0.01825481653213501, "rewards/near_duplicate_penalty/mean": 0.9342751502990723, "rewards/near_duplicate_penalty/std": 0.12169872224330902, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.07287507504224777, "rewards/total_composite/std": 0.07762982696294785, "reward": 0.07287507504224777, "reward_std": 0.07762983441352844, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1422041952610016, "sampling/sampling_logp_difference/max": 0.9437007904052734, "sampling/importance_sampling_ratio/min": 0.3891848921775818, "sampling/importance_sampling_ratio/mean": 1.0433428287506104, "sampling/importance_sampling_ratio/max": 1.873073697090149, "entropy": 1.1322224661707878, "clip_ratio/low_mean": 0.05137844476848841, "clip_ratio/low_min": 0.05137844476848841, "clip_ratio/high_mean": 0.058654218912124634, "clip_ratio/high_max": 0.058654218912124634, "clip_ratio/region_mean": 0.11003266368061304, "reward_total_mean": 0.07287507504224777, "reward_meter_mean": 0.403460294008255, "reward_meter_std": 0.3681066930294037, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9372429847717285, "reward_lexical_plausibility_std": 0.1775035411119461, "reward_repeat_penalty_mean": 0.7007063627243042, "reward_repeat_penalty_std": 0.09127402305603027, "reward_repeat_floor_mean": 0.9751412868499756, "reward_repeat_floor_std": 0.01825481653213501, "reward_near_duplicate_penalty_mean": 0.9342751502990723, "reward_near_duplicate_penalty_std": 0.12169872224330902, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2837500274181366, "reward_judge_quality_std": 0.28278905153274536, "reward_total_composite_mean": 0.07287507504224777, "reward_total_composite_std": 0.07762982696294785} {"timestamp_utc": "2026-04-12T18:42:50Z", "mode": "train", "global_step": 738, "epoch": 0.03884006104941845, "loss": -0.0494, "grad_norm": 1.9637209177017212, "learning_rate": 7.766666666666666e-06, "num_tokens": 1343120.0, "completions/mean_length": 205.125, "completions/min_length": 14.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 21.0, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.6143946647644043, "rewards/meter/std": 0.46436938643455505, "rewards/count_adherence/mean": 0.3333333432674408, "rewards/count_adherence/std": 0.1781741827726364, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.800000011920929, "rewards/count_floor/std": 0.05345224589109421, "rewards/lexical_plausibility/mean": 0.7579483389854431, "rewards/lexical_plausibility/std": 0.2553488612174988, "rewards/judge_quality/mean": 0.18125000596046448, "rewards/judge_quality/std": 0.14865468442440033, "rewards/repeat_penalty/mean": 0.8125, "rewards/repeat_penalty/std": 0.1157275140285492, "rewards/repeat_floor/mean": 0.9887499809265137, "rewards/repeat_floor/std": 0.0069436440244317055, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12995028495788574, "rewards/total_composite/std": 0.12614144384860992, "reward": 0.12995028495788574, "reward_std": 0.12614144384860992, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17581558227539062, "sampling/sampling_logp_difference/max": 2.088022232055664, "sampling/importance_sampling_ratio/min": 0.12393199652433395, "sampling/importance_sampling_ratio/mean": 1.0554476976394653, "sampling/importance_sampling_ratio/max": 1.8839465379714966, "entropy": 1.0012018233537674, "clip_ratio/low_mean": 0.019736841320991516, "clip_ratio/low_min": 0.019736841320991516, "clip_ratio/high_mean": 0.06529190763831139, "clip_ratio/high_max": 0.06529190763831139, "clip_ratio/region_mean": 0.0850287489593029, "reward_total_mean": 0.12995028495788574, "reward_meter_mean": 0.6143946647644043, "reward_meter_std": 0.46436938643455505, "reward_count_adherence_mean": 0.3333333432674408, "reward_count_adherence_std": 0.1781741827726364, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.800000011920929, "reward_count_floor_std": 0.05345224589109421, "reward_lexical_plausibility_mean": 0.7579483389854431, "reward_lexical_plausibility_std": 0.2553488612174988, "reward_repeat_penalty_mean": 0.8125, "reward_repeat_penalty_std": 0.1157275140285492, "reward_repeat_floor_mean": 0.9887499809265137, "reward_repeat_floor_std": 0.0069436440244317055, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.18125000596046448, "reward_judge_quality_std": 0.14865468442440033, "reward_total_composite_mean": 0.12995028495788574, "reward_total_composite_std": 0.12614144384860992} {"timestamp_utc": "2026-04-12T18:43:04Z", "mode": "train", "global_step": 739, "epoch": 0.0388926898584285, "loss": -0.0193, "grad_norm": 1.348751187324524, "learning_rate": 7.763636363636364e-06, "num_tokens": 1344432.0, "completions/mean_length": 204.0, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 19.200000762939453, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.6815898418426514, "rewards/meter/std": 0.4493662118911743, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8145034313201904, "rewards/lexical_plausibility/std": 0.24308021366596222, "rewards/judge_quality/mean": 0.23375001549720764, "rewards/judge_quality/std": 0.31208688020706177, "rewards/repeat_penalty/mean": 0.7448081970214844, "rewards/repeat_penalty/std": 0.013514467515051365, "rewards/repeat_floor/mean": 0.9839916229248047, "rewards/repeat_floor/std": 0.002709784312173724, "rewards/near_duplicate_penalty/mean": 0.9935770630836487, "rewards/near_duplicate_penalty/std": 0.018166767433285713, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9995005130767822, "rewards/distinct_2/std": 0.0014128044713288546, "rewards/total_composite/mean": 0.18715158104896545, "rewards/total_composite/std": 0.2601436674594879, "reward": 0.18715158104896545, "reward_std": 0.2601436972618103, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1537979245185852, "sampling/sampling_logp_difference/max": 0.7707515954971313, "sampling/importance_sampling_ratio/min": 0.4626652002334595, "sampling/importance_sampling_ratio/mean": 1.0036507844924927, "sampling/importance_sampling_ratio/max": 1.7780812978744507, "entropy": 0.7506260052323341, "clip_ratio/low_mean": 0.04255952499806881, "clip_ratio/low_min": 0.04255952499806881, "clip_ratio/high_mean": 0.050245098769664764, "clip_ratio/high_max": 0.050245098769664764, "clip_ratio/region_mean": 0.09280462376773357, "reward_total_mean": 0.18715158104896545, "reward_meter_mean": 0.6815898418426514, "reward_meter_std": 0.4493662118911743, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8145034313201904, "reward_lexical_plausibility_std": 0.24308021366596222, "reward_repeat_penalty_mean": 0.7448081970214844, "reward_repeat_penalty_std": 0.013514467515051365, "reward_repeat_floor_mean": 0.9839916229248047, "reward_repeat_floor_std": 0.002709784312173724, "reward_near_duplicate_penalty_mean": 0.9935770630836487, "reward_near_duplicate_penalty_std": 0.018166767433285713, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9995005130767822, "reward_distinct_2_std": 0.0014128044713288546, "reward_judge_quality_mean": 0.23375001549720764, "reward_judge_quality_std": 0.31208688020706177, "reward_total_composite_mean": 0.18715158104896545, "reward_total_composite_std": 0.2601436674594879} {"timestamp_utc": "2026-04-12T18:43:12Z", "mode": "train", "global_step": 740, "epoch": 0.038945318667438555, "loss": -0.0108, "grad_norm": 19.96430206298828, "learning_rate": 7.76060606060606e-06, "num_tokens": 1345818.0, "completions/mean_length": 20.25, "completions/min_length": 15.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.25, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.20640191435813904, "rewards/meter/std": 0.3374778926372528, "rewards/count_adherence/mean": 0.3333333432674408, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.800000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.7469173073768616, "rewards/repeat_penalty/std": 0.00871915090829134, "rewards/repeat_floor/mean": 0.9843834638595581, "rewards/repeat_floor/std": 0.0017438469221815467, "rewards/near_duplicate_penalty/mean": 0.9958897829055786, "rewards/near_duplicate_penalty/std": 0.011625555343925953, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.028493516147136688, "rewards/total_composite/std": 0.038897447288036346, "reward": 0.028493516147136688, "reward_std": 0.038897447288036346, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1758432537317276, "sampling/sampling_logp_difference/max": 1.4410896301269531, "sampling/importance_sampling_ratio/min": 0.3202000856399536, "sampling/importance_sampling_ratio/mean": 1.0307332277297974, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9976207837462425, "clip_ratio/low_mean": 0.10916285635903478, "clip_ratio/low_min": 0.10916285635903478, "clip_ratio/high_mean": 0.0457251095212996, "clip_ratio/high_max": 0.0457251095212996, "clip_ratio/region_mean": 0.15488796588033438, "reward_total_mean": 0.028493516147136688, "reward_meter_mean": 0.20640191435813904, "reward_meter_std": 0.3374778926372528, "reward_count_adherence_mean": 0.3333333432674408, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.800000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7469173073768616, "reward_repeat_penalty_std": 0.00871915090829134, "reward_repeat_floor_mean": 0.9843834638595581, "reward_repeat_floor_std": 0.0017438469221815467, "reward_near_duplicate_penalty_mean": 0.9958897829055786, "reward_near_duplicate_penalty_std": 0.011625555343925953, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.028493516147136688, "reward_total_composite_std": 0.038897447288036346} {"timestamp_utc": "2026-04-12T18:43:23Z", "mode": "train", "global_step": 741, "epoch": 0.03899794747644861, "loss": 0.0525, "grad_norm": 23.208003997802734, "learning_rate": 7.757575757575758e-06, "num_tokens": 1347405.0, "completions/mean_length": 30.375, "completions/min_length": 27.0, "completions/max_length": 35.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.375, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.4057590067386627, "rewards/meter/std": 0.42456623911857605, "rewards/count_adherence/mean": 0.6666666865348816, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8999999761581421, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6599999666213989, "rewards/judge_quality/std": 0.3724053204059601, "rewards/repeat_penalty/mean": 0.9916204214096069, "rewards/repeat_penalty/std": 0.01294863410294056, "rewards/repeat_floor/mean": 0.9987430572509766, "rewards/repeat_floor/std": 0.0019422972109168768, "rewards/near_duplicate_penalty/mean": 0.9916204214096069, "rewards/near_duplicate_penalty/std": 0.01294863410294056, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1763792186975479, "rewards/total_composite/std": 0.23815672099590302, "reward": 0.1763792186975479, "reward_std": 0.23815672099590302, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14278177917003632, "sampling/sampling_logp_difference/max": 1.8892238140106201, "sampling/importance_sampling_ratio/min": 0.15118910372257233, "sampling/importance_sampling_ratio/mean": 1.0021116733551025, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8032214045524597, "clip_ratio/low_mean": 0.07851171866059303, "clip_ratio/low_min": 0.07851171866059303, "clip_ratio/high_mean": 0.030237268656492233, "clip_ratio/high_max": 0.030237268656492233, "clip_ratio/region_mean": 0.10874898731708527, "reward_total_mean": 0.1763792186975479, "reward_meter_mean": 0.4057590067386627, "reward_meter_std": 0.42456623911857605, "reward_count_adherence_mean": 0.6666666865348816, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8999999761581421, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9916204214096069, "reward_repeat_penalty_std": 0.01294863410294056, "reward_repeat_floor_mean": 0.9987430572509766, "reward_repeat_floor_std": 0.0019422972109168768, "reward_near_duplicate_penalty_mean": 0.9916204214096069, "reward_near_duplicate_penalty_std": 0.01294863410294056, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6599999666213989, "reward_judge_quality_std": 0.3724053204059601, "reward_total_composite_mean": 0.1763792186975479, "reward_total_composite_std": 0.23815672099590302} {"timestamp_utc": "2026-04-12T18:43:36Z", "mode": "train", "global_step": 742, "epoch": 0.03905057628545866, "loss": -0.0209, "grad_norm": 2.7749855518341064, "learning_rate": 7.754545454545455e-06, "num_tokens": 1348740.0, "completions/mean_length": 142.875, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 19.83333396911621, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.5375322103500366, "rewards/meter/std": 0.45469042658805847, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.7862309217453003, "rewards/lexical_plausibility/std": 0.2334330976009369, "rewards/judge_quality/mean": 0.35500001907348633, "rewards/judge_quality/std": 0.3702508807182312, "rewards/repeat_penalty/mean": 0.777212917804718, "rewards/repeat_penalty/std": 0.09072622656822205, "rewards/repeat_floor/mean": 0.9860675930976868, "rewards/repeat_floor/std": 0.006066360045224428, "rewards/near_duplicate_penalty/mean": 0.994617223739624, "rewards/near_duplicate_penalty/std": 0.015224790200591087, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2790070176124573, "rewards/total_composite/std": 0.37286657094955444, "reward": 0.2790070176124573, "reward_std": 0.37286657094955444, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21848545968532562, "sampling/sampling_logp_difference/max": 1.837364673614502, "sampling/importance_sampling_ratio/min": 0.15923650562763214, "sampling/importance_sampling_ratio/mean": 1.0234222412109375, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.452508419752121, "clip_ratio/low_mean": 0.10812952741980553, "clip_ratio/low_min": 0.10812952741980553, "clip_ratio/high_mean": 0.034307065419852734, "clip_ratio/high_max": 0.034307065419852734, "clip_ratio/region_mean": 0.14243659283965826, "reward_total_mean": 0.2790070176124573, "reward_meter_mean": 0.5375322103500366, "reward_meter_std": 0.45469042658805847, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.7862309217453003, "reward_lexical_plausibility_std": 0.2334330976009369, "reward_repeat_penalty_mean": 0.777212917804718, "reward_repeat_penalty_std": 0.09072622656822205, "reward_repeat_floor_mean": 0.9860675930976868, "reward_repeat_floor_std": 0.006066360045224428, "reward_near_duplicate_penalty_mean": 0.994617223739624, "reward_near_duplicate_penalty_std": 0.015224790200591087, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.35500001907348633, "reward_judge_quality_std": 0.3702508807182312, "reward_total_composite_mean": 0.2790070176124573, "reward_total_composite_std": 0.37286657094955444} {"timestamp_utc": "2026-04-12T18:43:52Z", "mode": "train", "global_step": 743, "epoch": 0.03910320509446871, "loss": 0.0012, "grad_norm": 2.8965985774993896, "learning_rate": 7.751515151515153e-06, "num_tokens": 1350035.0, "completions/mean_length": 148.875, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 27.83333396911621, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.5172783732414246, "rewards/meter/std": 0.41920652985572815, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 0.8744943141937256, "rewards/lexical_plausibility/std": 0.23269939422607422, "rewards/judge_quality/mean": 0.3799999952316284, "rewards/judge_quality/std": 0.35306817293167114, "rewards/repeat_penalty/mean": 0.8201873302459717, "rewards/repeat_penalty/std": 0.16938941180706024, "rewards/repeat_floor/mean": 0.984004020690918, "rewards/repeat_floor/std": 0.015525962226092815, "rewards/near_duplicate_penalty/mean": 0.9617943167686462, "rewards/near_duplicate_penalty/std": 0.04469265043735504, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9692763090133667, "rewards/distinct_2/std": 0.08328244090080261, "rewards/total_composite/mean": 0.16020092368125916, "rewards/total_composite/std": 0.24811586737632751, "reward": 0.16020092368125916, "reward_std": 0.24811585247516632, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16965435445308685, "sampling/sampling_logp_difference/max": 0.8831815719604492, "sampling/importance_sampling_ratio/min": 0.41346535086631775, "sampling/importance_sampling_ratio/mean": 1.0435234308242798, "sampling/importance_sampling_ratio/max": 1.9052214622497559, "entropy": 1.118041105568409, "clip_ratio/low_mean": 0.060724363662302494, "clip_ratio/low_min": 0.060724363662302494, "clip_ratio/high_mean": 0.03281250037252903, "clip_ratio/high_max": 0.03281250037252903, "clip_ratio/region_mean": 0.09353686403483152, "reward_total_mean": 0.16020092368125916, "reward_meter_mean": 0.5172783732414246, "reward_meter_std": 0.41920652985572815, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 0.8744943141937256, "reward_lexical_plausibility_std": 0.23269939422607422, "reward_repeat_penalty_mean": 0.8201873302459717, "reward_repeat_penalty_std": 0.16938941180706024, "reward_repeat_floor_mean": 0.984004020690918, "reward_repeat_floor_std": 0.015525962226092815, "reward_near_duplicate_penalty_mean": 0.9617943167686462, "reward_near_duplicate_penalty_std": 0.04469265043735504, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9692763090133667, "reward_distinct_2_std": 0.08328244090080261, "reward_judge_quality_mean": 0.3799999952316284, "reward_judge_quality_std": 0.35306817293167114, "reward_total_composite_mean": 0.16020092368125916, "reward_total_composite_std": 0.24811586737632751} {"timestamp_utc": "2026-04-12T18:44:09Z", "mode": "train", "global_step": 744, "epoch": 0.039155833903478765, "loss": -0.0973, "grad_norm": 2.975322961807251, "learning_rate": 7.74848484848485e-06, "num_tokens": 1352126.0, "completions/mean_length": 192.375, "completions/min_length": 25.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 85.83333587646484, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 200.0, "rewards/meter/mean": 0.8800060153007507, "rewards/meter/std": 0.259451687335968, "rewards/count_adherence/mean": 0.4305555820465088, "rewards/count_adherence/std": 0.32223591208457947, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8291666507720947, "rewards/count_floor/std": 0.09667076170444489, "rewards/lexical_plausibility/mean": 0.8968592286109924, "rewards/lexical_plausibility/std": 0.19558745622634888, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.7106995582580566, "rewards/repeat_penalty/std": 0.2822147309780121, "rewards/repeat_floor/mean": 0.9704732894897461, "rewards/repeat_floor/std": 0.032783858478069305, "rewards/near_duplicate_penalty/mean": 0.9459105730056763, "rewards/near_duplicate_penalty/std": 0.062300343066453934, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8037415146827698, "rewards/distinct_2/std": 0.292168527841568, "rewards/total_composite/mean": 0.1111559271812439, "rewards/total_composite/std": 0.07378222048282623, "reward": 0.1111559271812439, "reward_std": 0.07378222048282623, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15950749814510345, "sampling/sampling_logp_difference/max": 1.5414862632751465, "sampling/importance_sampling_ratio/min": 0.21406272053718567, "sampling/importance_sampling_ratio/mean": 1.0336241722106934, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.192721113562584, "clip_ratio/low_mean": 0.08326923102140427, "clip_ratio/low_min": 0.08326923102140427, "clip_ratio/high_mean": 0.08411479368805885, "clip_ratio/high_max": 0.08411479368805885, "clip_ratio/region_mean": 0.16738402470946312, "reward_total_mean": 0.1111559271812439, "reward_meter_mean": 0.8800060153007507, "reward_meter_std": 0.259451687335968, "reward_count_adherence_mean": 0.4305555820465088, "reward_count_adherence_std": 0.32223591208457947, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8291666507720947, "reward_count_floor_std": 0.09667076170444489, "reward_lexical_plausibility_mean": 0.8968592286109924, "reward_lexical_plausibility_std": 0.19558745622634888, "reward_repeat_penalty_mean": 0.7106995582580566, "reward_repeat_penalty_std": 0.2822147309780121, "reward_repeat_floor_mean": 0.9704732894897461, "reward_repeat_floor_std": 0.032783858478069305, "reward_near_duplicate_penalty_mean": 0.9459105730056763, "reward_near_duplicate_penalty_std": 0.062300343066453934, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8037415146827698, "reward_distinct_2_std": 0.292168527841568, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.1111559271812439, "reward_total_composite_std": 0.07378222048282623} {"timestamp_utc": "2026-04-12T18:44:16Z", "mode": "train", "global_step": 745, "epoch": 0.03920846271248882, "loss": 0.013, "grad_norm": 14.36792278289795, "learning_rate": 7.745454545454545e-06, "num_tokens": 1353491.0, "completions/mean_length": 19.625, "completions/min_length": 16.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.625, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.7133709788322449, "rewards/meter/std": 0.4207753539085388, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.27125000953674316, "rewards/judge_quality/std": 0.2713162302970886, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21824952960014343, "rewards/total_composite/std": 0.2779955565929413, "reward": 0.21824952960014343, "reward_std": 0.2779955565929413, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09859257936477661, "sampling/sampling_logp_difference/max": 1.220430612564087, "sampling/importance_sampling_ratio/min": 0.2951030433177948, "sampling/importance_sampling_ratio/mean": 0.9983386397361755, "sampling/importance_sampling_ratio/max": 1.7585811614990234, "entropy": 0.6698262840509415, "clip_ratio/low_mean": 0.06917613837867975, "clip_ratio/low_min": 0.06917613837867975, "clip_ratio/high_mean": 0.013194444589316845, "clip_ratio/high_max": 0.013194444589316845, "clip_ratio/region_mean": 0.0823705829679966, "reward_total_mean": 0.21824952960014343, "reward_meter_mean": 0.7133709788322449, "reward_meter_std": 0.4207753539085388, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.27125000953674316, "reward_judge_quality_std": 0.2713162302970886, "reward_total_composite_mean": 0.21824952960014343, "reward_total_composite_std": 0.2779955565929413} {"timestamp_utc": "2026-04-12T18:44:29Z", "mode": "train", "global_step": 746, "epoch": 0.03926109152149887, "loss": 0.0138, "grad_norm": 4.74420166015625, "learning_rate": 7.742424242424244e-06, "num_tokens": 1354978.0, "completions/mean_length": 83.875, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 22.71428680419922, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.5336765050888062, "rewards/meter/std": 0.4166505038738251, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.08017837256193161, "rewards/lexical_plausibility/mean": 0.9357050657272339, "rewards/lexical_plausibility/std": 0.15811949968338013, "rewards/judge_quality/mean": 0.41750001907348633, "rewards/judge_quality/std": 0.3366537392139435, "rewards/repeat_penalty/mean": 0.7642590403556824, "rewards/repeat_penalty/std": 0.13603028655052185, "rewards/repeat_floor/mean": 0.9807535409927368, "rewards/repeat_floor/std": 0.0151299349963665, "rewards/near_duplicate_penalty/mean": 0.9571796655654907, "rewards/near_duplicate_penalty/std": 0.08880757540464401, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.1489267647266388, "rewards/total_composite/std": 0.12230773270130157, "reward": 0.1489267647266388, "reward_std": 0.12230773270130157, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16524523496627808, "sampling/sampling_logp_difference/max": 2.02655029296875, "sampling/importance_sampling_ratio/min": 0.13178937137126923, "sampling/importance_sampling_ratio/mean": 0.9896193742752075, "sampling/importance_sampling_ratio/max": 1.637553334236145, "entropy": 1.0790852010250092, "clip_ratio/low_mean": 0.061038012616336346, "clip_ratio/low_min": 0.061038012616336346, "clip_ratio/high_mean": 0.05491946963593364, "clip_ratio/high_max": 0.05491946963593364, "clip_ratio/region_mean": 0.11595748225226998, "reward_total_mean": 0.1489267647266388, "reward_meter_mean": 0.5336765050888062, "reward_meter_std": 0.4166505038738251, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.08017837256193161, "reward_lexical_plausibility_mean": 0.9357050657272339, "reward_lexical_plausibility_std": 0.15811949968338013, "reward_repeat_penalty_mean": 0.7642590403556824, "reward_repeat_penalty_std": 0.13603028655052185, "reward_repeat_floor_mean": 0.9807535409927368, "reward_repeat_floor_std": 0.0151299349963665, "reward_near_duplicate_penalty_mean": 0.9571796655654907, "reward_near_duplicate_penalty_std": 0.08880757540464401, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.41750001907348633, "reward_judge_quality_std": 0.3366537392139435, "reward_total_composite_mean": 0.1489267647266388, "reward_total_composite_std": 0.12230773270130157} {"timestamp_utc": "2026-04-12T18:44:43Z", "mode": "train", "global_step": 747, "epoch": 0.03931372033050892, "loss": -0.0196, "grad_norm": 1.8384373188018799, "learning_rate": 7.73939393939394e-06, "num_tokens": 1356303.0, "completions/mean_length": 203.625, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 18.600000381469727, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.29425597190856934, "rewards/meter/std": 0.35729554295539856, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8731686472892761, "rewards/lexical_plausibility/std": 0.18030144274234772, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.15811388194561005, "rewards/repeat_penalty/mean": 0.7074088454246521, "rewards/repeat_penalty/std": 0.10268846154212952, "rewards/repeat_floor/mean": 0.9764817953109741, "rewards/repeat_floor/std": 0.020537693053483963, "rewards/near_duplicate_penalty/mean": 0.9432117938995361, "rewards/near_duplicate_penalty/std": 0.13691793382167816, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.068361297249794, "rewards/total_composite/std": 0.08780686557292938, "reward": 0.068361297249794, "reward_std": 0.08780687302350998, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.24706055223941803, "sampling/sampling_logp_difference/max": 1.7024469375610352, "sampling/importance_sampling_ratio/min": 0.18223705887794495, "sampling/importance_sampling_ratio/mean": 1.0187609195709229, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7845836654305458, "clip_ratio/low_mean": 0.0416666679084301, "clip_ratio/low_min": 0.0416666679084301, "clip_ratio/high_mean": 0.051934524439275265, "clip_ratio/high_max": 0.051934524439275265, "clip_ratio/region_mean": 0.09360119234770536, "reward_total_mean": 0.068361297249794, "reward_meter_mean": 0.29425597190856934, "reward_meter_std": 0.35729554295539856, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8731686472892761, "reward_lexical_plausibility_std": 0.18030144274234772, "reward_repeat_penalty_mean": 0.7074088454246521, "reward_repeat_penalty_std": 0.10268846154212952, "reward_repeat_floor_mean": 0.9764817953109741, "reward_repeat_floor_std": 0.020537693053483963, "reward_near_duplicate_penalty_mean": 0.9432117938995361, "reward_near_duplicate_penalty_std": 0.13691793382167816, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.15811388194561005, "reward_total_composite_mean": 0.068361297249794, "reward_total_composite_std": 0.08780686557292938} {"timestamp_utc": "2026-04-12T18:44:56Z", "mode": "train", "global_step": 748, "epoch": 0.039366349139518975, "loss": -0.0355, "grad_norm": 4.142660617828369, "learning_rate": 7.736363636363637e-06, "num_tokens": 1357745.0, "completions/mean_length": 84.25, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 23.142858505249023, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.8712382316589355, "rewards/meter/std": 0.3331470787525177, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9306751489639282, "rewards/lexical_plausibility/std": 0.19608032703399658, "rewards/judge_quality/mean": 0.5850000381469727, "rewards/judge_quality/std": 0.377548485994339, "rewards/repeat_penalty/mean": 0.7308650612831116, "rewards/repeat_penalty/std": 0.021784374490380287, "rewards/repeat_floor/mean": 0.981173038482666, "rewards/repeat_floor/std": 0.004356873221695423, "rewards/near_duplicate_penalty/mean": 0.974486768245697, "rewards/near_duplicate_penalty/std": 0.0290458295494318, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4792823791503906, "rewards/total_composite/std": 0.32279109954833984, "reward": 0.4792823791503906, "reward_std": 0.32279109954833984, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14162302017211914, "sampling/sampling_logp_difference/max": 0.8711061477661133, "sampling/importance_sampling_ratio/min": 0.41848838329315186, "sampling/importance_sampling_ratio/mean": 1.0485907793045044, "sampling/importance_sampling_ratio/max": 1.6908886432647705, "entropy": 1.1248897537589073, "clip_ratio/low_mean": 0.062224079854786396, "clip_ratio/low_min": 0.062224079854786396, "clip_ratio/high_mean": 0.06815711595118046, "clip_ratio/high_max": 0.06815711595118046, "clip_ratio/region_mean": 0.13038119580596685, "reward_total_mean": 0.4792823791503906, "reward_meter_mean": 0.8712382316589355, "reward_meter_std": 0.3331470787525177, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9306751489639282, "reward_lexical_plausibility_std": 0.19608032703399658, "reward_repeat_penalty_mean": 0.7308650612831116, "reward_repeat_penalty_std": 0.021784374490380287, "reward_repeat_floor_mean": 0.981173038482666, "reward_repeat_floor_std": 0.004356873221695423, "reward_near_duplicate_penalty_mean": 0.974486768245697, "reward_near_duplicate_penalty_std": 0.0290458295494318, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5850000381469727, "reward_judge_quality_std": 0.377548485994339, "reward_total_composite_mean": 0.4792823791503906, "reward_total_composite_std": 0.32279109954833984} {"timestamp_utc": "2026-04-12T18:45:10Z", "mode": "train", "global_step": 749, "epoch": 0.03941897794852903, "loss": -0.0524, "grad_norm": 5.769345760345459, "learning_rate": 7.733333333333334e-06, "num_tokens": 1359366.0, "completions/mean_length": 103.625, "completions/min_length": 15.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 45.28571701049805, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.5235595703125, "rewards/meter/std": 0.4026947617530823, "rewards/count_adherence/mean": 0.5250000357627869, "rewards/count_adherence/std": 0.26049405336380005, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8574999570846558, "rewards/count_floor/std": 0.07814821600914001, "rewards/lexical_plausibility/mean": 0.9598478078842163, "rewards/lexical_plausibility/std": 0.11356756091117859, "rewards/judge_quality/mean": 0.3187499940395355, "rewards/judge_quality/std": 0.16243129968643188, "rewards/repeat_penalty/mean": 0.8233376741409302, "rewards/repeat_penalty/std": 0.07907243818044662, "rewards/repeat_floor/mean": 0.982809841632843, "rewards/repeat_floor/std": 0.006920860148966312, "rewards/near_duplicate_penalty/mean": 0.9534773826599121, "rewards/near_duplicate_penalty/std": 0.040107861161231995, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9282026290893555, "rewards/distinct_2/std": 0.0812455490231514, "rewards/total_composite/mean": 0.1589653491973877, "rewards/total_composite/std": 0.14139433205127716, "reward": 0.1589653491973877, "reward_std": 0.14139433205127716, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18243052065372467, "sampling/sampling_logp_difference/max": 1.4429073333740234, "sampling/importance_sampling_ratio/min": 0.2362399399280548, "sampling/importance_sampling_ratio/mean": 1.0197663307189941, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2705709263682365, "clip_ratio/low_mean": 0.06131018325686455, "clip_ratio/low_min": 0.06131018325686455, "clip_ratio/high_mean": 0.11268244124948978, "clip_ratio/high_max": 0.11268244124948978, "clip_ratio/region_mean": 0.17399262450635433, "reward_total_mean": 0.1589653491973877, "reward_meter_mean": 0.5235595703125, "reward_meter_std": 0.4026947617530823, "reward_count_adherence_mean": 0.5250000357627869, "reward_count_adherence_std": 0.26049405336380005, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8574999570846558, "reward_count_floor_std": 0.07814821600914001, "reward_lexical_plausibility_mean": 0.9598478078842163, "reward_lexical_plausibility_std": 0.11356756091117859, "reward_repeat_penalty_mean": 0.8233376741409302, "reward_repeat_penalty_std": 0.07907243818044662, "reward_repeat_floor_mean": 0.982809841632843, "reward_repeat_floor_std": 0.006920860148966312, "reward_near_duplicate_penalty_mean": 0.9534773826599121, "reward_near_duplicate_penalty_std": 0.040107861161231995, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9282026290893555, "reward_distinct_2_std": 0.0812455490231514, "reward_judge_quality_mean": 0.3187499940395355, "reward_judge_quality_std": 0.16243129968643188, "reward_total_composite_mean": 0.1589653491973877, "reward_total_composite_std": 0.14139433205127716} {"timestamp_utc": "2026-04-12T18:45:24Z", "mode": "train", "global_step": 750, "epoch": 0.03947160675753908, "loss": -0.0335, "grad_norm": 4.7941670417785645, "learning_rate": 7.730303030303032e-06, "num_tokens": 1360788.0, "completions/mean_length": 84.75, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 23.71428680419922, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.47516119480133057, "rewards/meter/std": 0.42735129594802856, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9183794856071472, "rewards/lexical_plausibility/std": 0.15269480645656586, "rewards/judge_quality/mean": 0.35624998807907104, "rewards/judge_quality/std": 0.15221577882766724, "rewards/repeat_penalty/mean": 0.7543042898178101, "rewards/repeat_penalty/std": 0.26004454493522644, "rewards/repeat_floor/mean": 0.9735600352287292, "rewards/repeat_floor/std": 0.04295467212796211, "rewards/near_duplicate_penalty/mean": 0.8862333297729492, "rewards/near_duplicate_penalty/std": 0.27081748843193054, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15436387062072754, "rewards/total_composite/std": 0.13202892243862152, "reward": 0.15436387062072754, "reward_std": 0.13202892243862152, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20861199498176575, "sampling/sampling_logp_difference/max": 1.076934814453125, "sampling/importance_sampling_ratio/min": 0.34063804149627686, "sampling/importance_sampling_ratio/mean": 1.0120781660079956, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5639142394065857, "clip_ratio/low_mean": 0.06005434785038233, "clip_ratio/low_min": 0.06005434785038233, "clip_ratio/high_mean": 0.11765479855239391, "clip_ratio/high_max": 0.11765479855239391, "clip_ratio/region_mean": 0.17770914640277624, "reward_total_mean": 0.15436387062072754, "reward_meter_mean": 0.47516119480133057, "reward_meter_std": 0.42735129594802856, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9183794856071472, "reward_lexical_plausibility_std": 0.15269480645656586, "reward_repeat_penalty_mean": 0.7543042898178101, "reward_repeat_penalty_std": 0.26004454493522644, "reward_repeat_floor_mean": 0.9735600352287292, "reward_repeat_floor_std": 0.04295467212796211, "reward_near_duplicate_penalty_mean": 0.8862333297729492, "reward_near_duplicate_penalty_std": 0.27081748843193054, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.35624998807907104, "reward_judge_quality_std": 0.15221577882766724, "reward_total_composite_mean": 0.15436387062072754, "reward_total_composite_std": 0.13202892243862152} {"timestamp_utc": "2026-04-12T18:47:45Z", "mode": "eval", "global_step": 750, "epoch": 0.03947160675753908, "eval_loss": NaN, "eval_runtime": 140.7759, "eval_samples_per_second": 0.739, "eval_steps_per_second": 0.092, "eval_num_tokens": 1360788.0, "eval_completions/mean_length": 161.79807692307693, "eval_completions/min_length": 16.923076923076923, "eval_completions/max_length": 457.0, "eval_completions/clipped_ratio": 0.19230769230769232, "eval_completions/mean_terminated_length": 79.48965366070087, "eval_completions/min_terminated_length": 16.923076923076923, "eval_completions/max_terminated_length": 217.30769230769232, "eval_rewards/meter/mean": 0.4821709440304683, "eval_rewards/meter/std": 0.37727194222120136, "eval_rewards/count_adherence/mean": 0.5976877762721136, "eval_rewards/count_adherence/std": 0.3097472580579611, "eval_rewards/arabic_clean/mean": 0.7884615384615384, "eval_rewards/arabic_clean/std": 0.39074395253108096, "eval_rewards/hard_gate/mean": 0.9903846153846154, "eval_rewards/hard_gate/std": 0.027196414195574246, "eval_rewards/arabic_floor/mean": 0.9937499990830054, "eval_rewards/arabic_floor/std": 0.017677669341747578, "eval_rewards/count_floor/mean": 0.8793063393005958, "eval_rewards/count_floor/std": 0.09292416990949558, "eval_rewards/lexical_plausibility/mean": 0.9099988387181208, "eval_rewards/lexical_plausibility/std": 0.1679023699118541, "eval_rewards/judge_quality/mean": 0.3104807688639714, "eval_rewards/judge_quality/std": 0.24153148440214303, "eval_rewards/repeat_penalty/mean": 0.7412021710322454, "eval_rewards/repeat_penalty/std": 0.29337632484160936, "eval_rewards/repeat_floor/mean": 0.9711762620852544, "eval_rewards/repeat_floor/std": 0.03903098776936531, "eval_rewards/near_duplicate_penalty/mean": 0.9364464191290048, "eval_rewards/near_duplicate_penalty/std": 0.0943520564872485, "eval_rewards/opening_diversity/mean": 0.8834695265843318, "eval_rewards/opening_diversity/std": 0.18799234181642532, "eval_rewards/distinct_2/mean": 0.8633458797748272, "eval_rewards/distinct_2/std": 0.24834957002447203, "eval_rewards/total_composite/mean": 0.12990731230148903, "eval_rewards/total_composite/std": 0.1406358927488327, "eval_reward": 0.12990731230148903, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.08168218141564956, "eval_sampling/sampling_logp_difference/max": 1.0946788787841797, "eval_sampling/importance_sampling_ratio/min": 0.3392829161423903, "eval_sampling/importance_sampling_ratio/mean": 1.0242463533694928, "eval_sampling/importance_sampling_ratio/max": 1.6500817353908832, "eval_entropy": 0.9567869809957651, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.12990731230148903, "eval_reward_meter_mean": 0.4821709440304683, "eval_reward_meter_std": 0.37727194222120136, "eval_reward_count_adherence_mean": 0.5976877762721136, "eval_reward_count_adherence_std": 0.3097472580579611, "eval_reward_arabic_clean_mean": 0.7884615384615384, "eval_reward_arabic_clean_std": 0.39074395253108096, "eval_reward_hard_gate_mean": 0.9903846153846154, "eval_reward_hard_gate_std": 0.027196414195574246, "eval_reward_arabic_floor_mean": 0.9937499990830054, "eval_reward_arabic_floor_std": 0.017677669341747578, "eval_reward_count_floor_mean": 0.8793063393005958, "eval_reward_count_floor_std": 0.09292416990949558, "eval_reward_lexical_plausibility_mean": 0.9099988387181208, "eval_reward_lexical_plausibility_std": 0.1679023699118541, "eval_reward_repeat_penalty_mean": 0.7412021710322454, "eval_reward_repeat_penalty_std": 0.29337632484160936, "eval_reward_repeat_floor_mean": 0.9711762620852544, "eval_reward_repeat_floor_std": 0.03903098776936531, "eval_reward_near_duplicate_penalty_mean": 0.9364464191290048, "eval_reward_near_duplicate_penalty_std": 0.0943520564872485, "eval_reward_opening_diversity_mean": 0.8834695265843318, "eval_reward_opening_diversity_std": 0.18799234181642532, "eval_reward_distinct_2_mean": 0.8633458797748272, "eval_reward_distinct_2_std": 0.24834957002447203, "eval_reward_judge_quality_mean": 0.3104807688639714, "eval_reward_judge_quality_std": 0.24153148440214303, "eval_reward_total_composite_mean": 0.12990731230148903, "eval_reward_total_composite_std": 0.1406358927488327} {"timestamp_utc": "2026-04-12T18:48:01Z", "mode": "train", "global_step": 751, "epoch": 0.03952423556654913, "loss": -0.0475, "grad_norm": 2.932443380355835, "learning_rate": 7.727272727272727e-06, "num_tokens": 1362185.0, "completions/mean_length": 143.625, "completions/min_length": 15.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 20.83333396911621, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.3506571054458618, "rewards/meter/std": 0.302674263715744, "rewards/count_adherence/mean": 0.375, "rewards/count_adherence/std": 0.2136233150959015, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.8125, "rewards/count_floor/std": 0.06408698856830597, "rewards/lexical_plausibility/mean": 0.8737751841545105, "rewards/lexical_plausibility/std": 0.219232439994812, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.8220474123954773, "rewards/repeat_penalty/std": 0.10830463469028473, "rewards/repeat_floor/mean": 0.9879381656646729, "rewards/repeat_floor/std": 0.006480756681412458, "rewards/near_duplicate_penalty/mean": 0.9888750910758972, "rewards/near_duplicate_penalty/std": 0.02331627905368805, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9886877536773682, "rewards/distinct_2/std": 0.031995780766010284, "rewards/total_composite/mean": 0.04655265808105469, "rewards/total_composite/std": 0.04339646175503731, "reward": 0.04655265808105469, "reward_std": 0.043396465480327606, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19946685433387756, "sampling/sampling_logp_difference/max": 1.0557308197021484, "sampling/importance_sampling_ratio/min": 0.34793806076049805, "sampling/importance_sampling_ratio/mean": 1.045884370803833, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4028751850128174, "clip_ratio/low_mean": 0.040570175275206566, "clip_ratio/low_min": 0.040570175275206566, "clip_ratio/high_mean": 0.09315476473420858, "clip_ratio/high_max": 0.09315476473420858, "clip_ratio/region_mean": 0.13372494000941515, "reward_total_mean": 0.04655265808105469, "reward_meter_mean": 0.3506571054458618, "reward_meter_std": 0.302674263715744, "reward_count_adherence_mean": 0.375, "reward_count_adherence_std": 0.2136233150959015, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.8125, "reward_count_floor_std": 0.06408698856830597, "reward_lexical_plausibility_mean": 0.8737751841545105, "reward_lexical_plausibility_std": 0.219232439994812, "reward_repeat_penalty_mean": 0.8220474123954773, "reward_repeat_penalty_std": 0.10830463469028473, "reward_repeat_floor_mean": 0.9879381656646729, "reward_repeat_floor_std": 0.006480756681412458, "reward_near_duplicate_penalty_mean": 0.9888750910758972, "reward_near_duplicate_penalty_std": 0.02331627905368805, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9886877536773682, "reward_distinct_2_std": 0.031995780766010284, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.04655265808105469, "reward_total_composite_std": 0.04339646175503731} {"timestamp_utc": "2026-04-12T18:48:15Z", "mode": "train", "global_step": 752, "epoch": 0.039576864375559184, "loss": -0.0062, "grad_norm": 5.7732062339782715, "learning_rate": 7.724242424242424e-06, "num_tokens": 1363560.0, "completions/mean_length": 81.875, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.428571701049805, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.4490688741207123, "rewards/meter/std": 0.430948406457901, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9362407326698303, "rewards/lexical_plausibility/std": 0.15661919116973877, "rewards/judge_quality/mean": 0.33375000953674316, "rewards/judge_quality/std": 0.28101539611816406, "rewards/repeat_penalty/mean": 0.7414772510528564, "rewards/repeat_penalty/std": 0.02410591021180153, "rewards/repeat_floor/mean": 0.9832954406738281, "rewards/repeat_floor/std": 0.004821178037673235, "rewards/near_duplicate_penalty/mean": 0.9886363744735718, "rewards/near_duplicate_penalty/std": 0.03214120864868164, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18368887901306152, "rewards/total_composite/std": 0.2430846393108368, "reward": 0.18368887901306152, "reward_std": 0.2430846393108368, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18957577645778656, "sampling/sampling_logp_difference/max": 1.344736099243164, "sampling/importance_sampling_ratio/min": 0.2606084644794464, "sampling/importance_sampling_ratio/mean": 1.065350890159607, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.374651476740837, "clip_ratio/low_mean": 0.050879035610705614, "clip_ratio/low_min": 0.050879035610705614, "clip_ratio/high_mean": 0.039227413944900036, "clip_ratio/high_max": 0.039227413944900036, "clip_ratio/region_mean": 0.09010644955560565, "reward_total_mean": 0.18368887901306152, "reward_meter_mean": 0.4490688741207123, "reward_meter_std": 0.430948406457901, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9362407326698303, "reward_lexical_plausibility_std": 0.15661919116973877, "reward_repeat_penalty_mean": 0.7414772510528564, "reward_repeat_penalty_std": 0.02410591021180153, "reward_repeat_floor_mean": 0.9832954406738281, "reward_repeat_floor_std": 0.004821178037673235, "reward_near_duplicate_penalty_mean": 0.9886363744735718, "reward_near_duplicate_penalty_std": 0.03214120864868164, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.33375000953674316, "reward_judge_quality_std": 0.28101539611816406, "reward_total_composite_mean": 0.18368887901306152, "reward_total_composite_std": 0.2430846393108368} {"timestamp_utc": "2026-04-12T18:48:22Z", "mode": "train", "global_step": 753, "epoch": 0.03962949318456924, "loss": -0.0098, "grad_norm": 19.75664710998535, "learning_rate": 7.721212121212122e-06, "num_tokens": 1364939.0, "completions/mean_length": 20.375, "completions/min_length": 18.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.375, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.5459390878677368, "rewards/meter/std": 0.43266281485557556, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.875, "rewards/lexical_plausibility/std": 0.3535533845424652, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.28630343079566956, "rewards/repeat_penalty/mean": 0.7368881106376648, "rewards/repeat_penalty/std": 0.03708602488040924, "rewards/repeat_floor/mean": 0.983426570892334, "rewards/repeat_floor/std": 0.004450327716767788, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.24094471335411072, "rewards/total_composite/std": 0.2565024495124817, "reward": 0.24094471335411072, "reward_std": 0.2565024495124817, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1629667580127716, "sampling/sampling_logp_difference/max": 1.4346981048583984, "sampling/importance_sampling_ratio/min": 0.2381872683763504, "sampling/importance_sampling_ratio/mean": 1.0214160680770874, "sampling/importance_sampling_ratio/max": 1.8477272987365723, "entropy": 1.4788138717412949, "clip_ratio/low_mean": 0.07532467693090439, "clip_ratio/low_min": 0.07532467693090439, "clip_ratio/high_mean": 0.0680365702137351, "clip_ratio/high_max": 0.0680365702137351, "clip_ratio/region_mean": 0.1433612471446395, "reward_total_mean": 0.24094471335411072, "reward_meter_mean": 0.5459390878677368, "reward_meter_std": 0.43266281485557556, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.875, "reward_lexical_plausibility_std": 0.3535533845424652, "reward_repeat_penalty_mean": 0.7368881106376648, "reward_repeat_penalty_std": 0.03708602488040924, "reward_repeat_floor_mean": 0.983426570892334, "reward_repeat_floor_std": 0.004450327716767788, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.28630343079566956, "reward_total_composite_mean": 0.24094471335411072, "reward_total_composite_std": 0.2565024495124817} {"timestamp_utc": "2026-04-12T18:48:36Z", "mode": "train", "global_step": 754, "epoch": 0.03968212199357928, "loss": -0.0328, "grad_norm": 5.844229221343994, "learning_rate": 7.718181818181819e-06, "num_tokens": 1366630.0, "completions/mean_length": 95.375, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 35.85714340209961, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.6300411224365234, "rewards/meter/std": 0.41531339287757874, "rewards/count_adherence/mean": 0.5833333730697632, "rewards/count_adherence/std": 0.15430335700511932, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.875, "rewards/count_floor/std": 0.046290989965200424, "rewards/lexical_plausibility/mean": 0.9491525888442993, "rewards/lexical_plausibility/std": 0.14381824433803558, "rewards/judge_quality/mean": 0.41499999165534973, "rewards/judge_quality/std": 0.2517368495464325, "rewards/repeat_penalty/mean": 0.9001684188842773, "rewards/repeat_penalty/std": 0.12743665277957916, "rewards/repeat_floor/mean": 0.9909023642539978, "rewards/repeat_floor/std": 0.011028815992176533, "rewards/near_duplicate_penalty/mean": 0.9729430675506592, "rewards/near_duplicate_penalty/std": 0.039715174585580826, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9856764078140259, "rewards/distinct_2/std": 0.02661900594830513, "rewards/total_composite/mean": 0.27034127712249756, "rewards/total_composite/std": 0.2623963952064514, "reward": 0.27034127712249756, "reward_std": 0.2623963952064514, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15583452582359314, "sampling/sampling_logp_difference/max": 1.686234951019287, "sampling/importance_sampling_ratio/min": 0.185215562582016, "sampling/importance_sampling_ratio/mean": 1.0056499242782593, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8357549533247948, "clip_ratio/low_mean": 0.06000405736267567, "clip_ratio/low_min": 0.06000405736267567, "clip_ratio/high_mean": 0.03045112732797861, "clip_ratio/high_max": 0.03045112732797861, "clip_ratio/region_mean": 0.09045518469065428, "reward_total_mean": 0.27034127712249756, "reward_meter_mean": 0.6300411224365234, "reward_meter_std": 0.41531339287757874, "reward_count_adherence_mean": 0.5833333730697632, "reward_count_adherence_std": 0.15430335700511932, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.875, "reward_count_floor_std": 0.046290989965200424, "reward_lexical_plausibility_mean": 0.9491525888442993, "reward_lexical_plausibility_std": 0.14381824433803558, "reward_repeat_penalty_mean": 0.9001684188842773, "reward_repeat_penalty_std": 0.12743665277957916, "reward_repeat_floor_mean": 0.9909023642539978, "reward_repeat_floor_std": 0.011028815992176533, "reward_near_duplicate_penalty_mean": 0.9729430675506592, "reward_near_duplicate_penalty_std": 0.039715174585580826, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9856764078140259, "reward_distinct_2_std": 0.02661900594830513, "reward_judge_quality_mean": 0.41499999165534973, "reward_judge_quality_std": 0.2517368495464325, "reward_total_composite_mean": 0.27034127712249756, "reward_total_composite_std": 0.2623963952064514} {"timestamp_utc": "2026-04-12T18:48:49Z", "mode": "train", "global_step": 755, "epoch": 0.039734750802589335, "loss": -0.0229, "grad_norm": 3.789351224899292, "learning_rate": 7.715151515151516e-06, "num_tokens": 1368035.0, "completions/mean_length": 81.625, "completions/min_length": 14.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.142858505249023, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.3168658912181854, "rewards/meter/std": 0.3613809645175934, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9468423128128052, "rewards/lexical_plausibility/std": 0.1503526270389557, "rewards/judge_quality/mean": 0.5475000143051147, "rewards/judge_quality/std": 0.4066500961780548, "rewards/repeat_penalty/mean": 0.7781673073768616, "rewards/repeat_penalty/std": 0.0900484099984169, "rewards/repeat_floor/mean": 0.9862584471702576, "rewards/repeat_floor/std": 0.005814488511532545, "rewards/near_duplicate_penalty/mean": 0.9958897829055786, "rewards/near_duplicate_penalty/std": 0.011625555343925953, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16401417553424835, "rewards/total_composite/std": 0.27484244108200073, "reward": 0.16401417553424835, "reward_std": 0.27484241127967834, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1589149534702301, "sampling/sampling_logp_difference/max": 1.23565673828125, "sampling/importance_sampling_ratio/min": 0.2906438410282135, "sampling/importance_sampling_ratio/mean": 1.0463230609893799, "sampling/importance_sampling_ratio/max": 1.8723198175430298, "entropy": 1.4279182776808739, "clip_ratio/low_mean": 0.08604692062363029, "clip_ratio/low_min": 0.08604692062363029, "clip_ratio/high_mean": 0.02291666716337204, "clip_ratio/high_max": 0.02291666716337204, "clip_ratio/region_mean": 0.10896358778700233, "reward_total_mean": 0.16401417553424835, "reward_meter_mean": 0.3168658912181854, "reward_meter_std": 0.3613809645175934, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9468423128128052, "reward_lexical_plausibility_std": 0.1503526270389557, "reward_repeat_penalty_mean": 0.7781673073768616, "reward_repeat_penalty_std": 0.0900484099984169, "reward_repeat_floor_mean": 0.9862584471702576, "reward_repeat_floor_std": 0.005814488511532545, "reward_near_duplicate_penalty_mean": 0.9958897829055786, "reward_near_duplicate_penalty_std": 0.011625555343925953, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5475000143051147, "reward_judge_quality_std": 0.4066500961780548, "reward_total_composite_mean": 0.16401417553424835, "reward_total_composite_std": 0.27484244108200073} {"timestamp_utc": "2026-04-12T18:49:02Z", "mode": "train", "global_step": 756, "epoch": 0.03978737961159939, "loss": -0.0174, "grad_norm": 5.291820049285889, "learning_rate": 7.712121212121213e-06, "num_tokens": 1369236.0, "completions/mean_length": 83.125, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 21.85714340209961, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.46067625284194946, "rewards/meter/std": 0.46334439516067505, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9267593622207642, "rewards/lexical_plausibility/std": 0.20715588331222534, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.2840491831302643, "rewards/repeat_penalty/mean": 0.735744059085846, "rewards/repeat_penalty/std": 0.03279595449566841, "rewards/repeat_floor/mean": 0.9821488261222839, "rewards/repeat_floor/std": 0.006559199187904596, "rewards/near_duplicate_penalty/mean": 0.9809920787811279, "rewards/near_duplicate_penalty/std": 0.043727945536375046, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14458605647087097, "rewards/total_composite/std": 0.18077252805233002, "reward": 0.14458605647087097, "reward_std": 0.18077251315116882, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21747484803199768, "sampling/sampling_logp_difference/max": 1.2292728424072266, "sampling/importance_sampling_ratio/min": 0.2925052046775818, "sampling/importance_sampling_ratio/mean": 1.0790289640426636, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.625254675745964, "clip_ratio/low_mean": 0.10710093099623919, "clip_ratio/low_min": 0.10710093099623919, "clip_ratio/high_mean": 0.04680735990405083, "clip_ratio/high_max": 0.04680735990405083, "clip_ratio/region_mean": 0.15390829090029, "reward_total_mean": 0.14458605647087097, "reward_meter_mean": 0.46067625284194946, "reward_meter_std": 0.46334439516067505, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9267593622207642, "reward_lexical_plausibility_std": 0.20715588331222534, "reward_repeat_penalty_mean": 0.735744059085846, "reward_repeat_penalty_std": 0.03279595449566841, "reward_repeat_floor_mean": 0.9821488261222839, "reward_repeat_floor_std": 0.006559199187904596, "reward_near_duplicate_penalty_mean": 0.9809920787811279, "reward_near_duplicate_penalty_std": 0.043727945536375046, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.2840491831302643, "reward_total_composite_mean": 0.14458605647087097, "reward_total_composite_std": 0.18077252805233002} {"timestamp_utc": "2026-04-12T18:49:11Z", "mode": "train", "global_step": 757, "epoch": 0.03984000842060944, "loss": -0.1391, "grad_norm": 18.59693717956543, "learning_rate": 7.709090909090909e-06, "num_tokens": 1370688.0, "completions/mean_length": 24.5, "completions/min_length": 18.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.5, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.4819759726524353, "rewards/meter/std": 0.31004247069358826, "rewards/count_adherence/mean": 0.4166666865348816, "rewards/count_adherence/std": 0.15430335700511932, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8250000476837158, "rewards/count_floor/std": 0.046290989965200424, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.222898930311203, "rewards/repeat_penalty/mean": 0.72732013463974, "rewards/repeat_penalty/std": 0.053876038640737534, "rewards/repeat_floor/mean": 0.9797546863555908, "rewards/repeat_floor/std": 0.006581379100680351, "rewards/near_duplicate_penalty/mean": 0.9795132279396057, "rewards/near_duplicate_penalty/std": 0.03453369438648224, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9550296068191528, "rewards/distinct_2/std": 0.06208225339651108, "rewards/total_composite/mean": 0.1905805915594101, "rewards/total_composite/std": 0.2514793574810028, "reward": 0.1905805915594101, "reward_std": 0.2514793574810028, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18915100395679474, "sampling/sampling_logp_difference/max": 1.3864779472351074, "sampling/importance_sampling_ratio/min": 0.24995411932468414, "sampling/importance_sampling_ratio/mean": 1.0098398923873901, "sampling/importance_sampling_ratio/max": 1.930884838104248, "entropy": 1.3853571638464928, "clip_ratio/low_mean": 0.11050179274752736, "clip_ratio/low_min": 0.11050179274752736, "clip_ratio/high_mean": 0.053520623594522476, "clip_ratio/high_max": 0.053520623594522476, "clip_ratio/region_mean": 0.16402241634204984, "reward_total_mean": 0.1905805915594101, "reward_meter_mean": 0.4819759726524353, "reward_meter_std": 0.31004247069358826, "reward_count_adherence_mean": 0.4166666865348816, "reward_count_adherence_std": 0.15430335700511932, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8250000476837158, "reward_count_floor_std": 0.046290989965200424, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.72732013463974, "reward_repeat_penalty_std": 0.053876038640737534, "reward_repeat_floor_mean": 0.9797546863555908, "reward_repeat_floor_std": 0.006581379100680351, "reward_near_duplicate_penalty_mean": 0.9795132279396057, "reward_near_duplicate_penalty_std": 0.03453369438648224, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9550296068191528, "reward_distinct_2_std": 0.06208225339651108, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.222898930311203, "reward_total_composite_mean": 0.1905805915594101, "reward_total_composite_std": 0.2514793574810028} {"timestamp_utc": "2026-04-12T18:49:19Z", "mode": "train", "global_step": 758, "epoch": 0.03989263722961949, "loss": 0.0694, "grad_norm": 19.346956253051758, "learning_rate": 7.706060606060606e-06, "num_tokens": 1372126.0, "completions/mean_length": 20.75, "completions/min_length": 17.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.75, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.4748724699020386, "rewards/meter/std": 0.4451950490474701, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.6617925763130188, "rewards/lexical_plausibility/std": 0.2446226179599762, "rewards/judge_quality/mean": 0.48875001072883606, "rewards/judge_quality/std": 0.3665841519832611, "rewards/repeat_penalty/mean": 0.7433712482452393, "rewards/repeat_penalty/std": 0.018749047070741653, "rewards/repeat_floor/mean": 0.9836742877960205, "rewards/repeat_floor/std": 0.0037498052697628736, "rewards/near_duplicate_penalty/mean": 0.991161584854126, "rewards/near_duplicate_penalty/std": 0.024998728185892105, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14455866813659668, "rewards/total_composite/std": 0.17668859660625458, "reward": 0.14455866813659668, "reward_std": 0.17668859660625458, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18759851157665253, "sampling/sampling_logp_difference/max": 1.6440258026123047, "sampling/importance_sampling_ratio/min": 0.19320067763328552, "sampling/importance_sampling_ratio/mean": 1.0177215337753296, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5919382125139236, "clip_ratio/low_mean": 0.09926338586956263, "clip_ratio/low_min": 0.09926338586956263, "clip_ratio/high_mean": 0.0575396828353405, "clip_ratio/high_max": 0.0575396828353405, "clip_ratio/region_mean": 0.15680306870490313, "reward_total_mean": 0.14455866813659668, "reward_meter_mean": 0.4748724699020386, "reward_meter_std": 0.4451950490474701, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.6617925763130188, "reward_lexical_plausibility_std": 0.2446226179599762, "reward_repeat_penalty_mean": 0.7433712482452393, "reward_repeat_penalty_std": 0.018749047070741653, "reward_repeat_floor_mean": 0.9836742877960205, "reward_repeat_floor_std": 0.0037498052697628736, "reward_near_duplicate_penalty_mean": 0.991161584854126, "reward_near_duplicate_penalty_std": 0.024998728185892105, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48875001072883606, "reward_judge_quality_std": 0.3665841519832611, "reward_total_composite_mean": 0.14455866813659668, "reward_total_composite_std": 0.17668859660625458} {"timestamp_utc": "2026-04-12T18:49:34Z", "mode": "train", "global_step": 759, "epoch": 0.039945266038629544, "loss": -0.104, "grad_norm": 4.506317138671875, "learning_rate": 7.703030303030304e-06, "num_tokens": 1374570.0, "completions/mean_length": 184.5, "completions/min_length": 78.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 137.71429443359375, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 190.0, "rewards/meter/mean": 0.8124877214431763, "rewards/meter/std": 0.16841427981853485, "rewards/count_adherence/mean": 0.824999988079071, "rewards/count_adherence/std": 0.16690459847450256, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9474999904632568, "rewards/count_floor/std": 0.05007137358188629, "rewards/lexical_plausibility/mean": 0.9502505660057068, "rewards/lexical_plausibility/std": 0.1407126933336258, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.14880475401878357, "rewards/repeat_penalty/mean": 0.7897309064865112, "rewards/repeat_penalty/std": 0.18313255906105042, "rewards/repeat_floor/mean": 0.9783972501754761, "rewards/repeat_floor/std": 0.01762981154024601, "rewards/near_duplicate_penalty/mean": 0.9580878019332886, "rewards/near_duplicate_penalty/std": 0.018783865496516228, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.829822838306427, "rewards/distinct_2/std": 0.1714695394039154, "rewards/total_composite/mean": 0.24015222489833832, "rewards/total_composite/std": 0.11441846936941147, "reward": 0.24015222489833832, "reward_std": 0.11441846936941147, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1576281487941742, "sampling/sampling_logp_difference/max": 2.4853200912475586, "sampling/importance_sampling_ratio/min": 0.08329888433218002, "sampling/importance_sampling_ratio/mean": 1.0077157020568848, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7918769866228104, "clip_ratio/low_mean": 0.04094129614531994, "clip_ratio/low_min": 0.04094129614531994, "clip_ratio/high_mean": 0.10996764153242111, "clip_ratio/high_max": 0.10996764153242111, "clip_ratio/region_mean": 0.15090893767774105, "reward_total_mean": 0.24015222489833832, "reward_meter_mean": 0.8124877214431763, "reward_meter_std": 0.16841427981853485, "reward_count_adherence_mean": 0.824999988079071, "reward_count_adherence_std": 0.16690459847450256, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9474999904632568, "reward_count_floor_std": 0.05007137358188629, "reward_lexical_plausibility_mean": 0.9502505660057068, "reward_lexical_plausibility_std": 0.1407126933336258, "reward_repeat_penalty_mean": 0.7897309064865112, "reward_repeat_penalty_std": 0.18313255906105042, "reward_repeat_floor_mean": 0.9783972501754761, "reward_repeat_floor_std": 0.01762981154024601, "reward_near_duplicate_penalty_mean": 0.9580878019332886, "reward_near_duplicate_penalty_std": 0.018783865496516228, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.829822838306427, "reward_distinct_2_std": 0.1714695394039154, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.14880475401878357, "reward_total_composite_mean": 0.24015222489833832, "reward_total_composite_std": 0.11441846936941147} {"timestamp_utc": "2026-04-12T18:49:43Z", "mode": "train", "global_step": 760, "epoch": 0.039997894847639597, "loss": 0.0818, "grad_norm": 19.084365844726562, "learning_rate": 7.7e-06, "num_tokens": 1375952.0, "completions/mean_length": 18.75, "completions/min_length": 16.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.75, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.7186318635940552, "rewards/meter/std": 0.3999112546443939, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.36402514576911926, "rewards/repeat_penalty/mean": 0.5965873003005981, "rewards/repeat_penalty/std": 0.18547387421131134, "rewards/repeat_floor/mean": 0.9547529220581055, "rewards/repeat_floor/std": 0.03867047652602196, "rewards/near_duplicate_penalty/mean": 0.8332011699676514, "rewards/near_duplicate_penalty/std": 0.22255395352840424, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.941919207572937, "rewards/distinct_2/std": 0.08058978617191315, "rewards/total_composite/mean": 0.3209429979324341, "rewards/total_composite/std": 0.3452916443347931, "reward": 0.3209429979324341, "reward_std": 0.3452916145324707, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16951622068881989, "sampling/sampling_logp_difference/max": 1.3270177841186523, "sampling/importance_sampling_ratio/min": 0.26526719331741333, "sampling/importance_sampling_ratio/mean": 1.0366358757019043, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1174676269292831, "clip_ratio/low_mean": 0.11512605333700776, "clip_ratio/low_min": 0.11512605333700776, "clip_ratio/high_mean": 0.045036764815449715, "clip_ratio/high_max": 0.045036764815449715, "clip_ratio/region_mean": 0.16016281815245748, "reward_total_mean": 0.3209429979324341, "reward_meter_mean": 0.7186318635940552, "reward_meter_std": 0.3999112546443939, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5965873003005981, "reward_repeat_penalty_std": 0.18547387421131134, "reward_repeat_floor_mean": 0.9547529220581055, "reward_repeat_floor_std": 0.03867047652602196, "reward_near_duplicate_penalty_mean": 0.8332011699676514, "reward_near_duplicate_penalty_std": 0.22255395352840424, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.941919207572937, "reward_distinct_2_std": 0.08058978617191315, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.36402514576911926, "reward_total_composite_mean": 0.3209429979324341, "reward_total_composite_std": 0.3452916443347931} {"timestamp_utc": "2026-04-12T18:49:57Z", "mode": "train", "global_step": 761, "epoch": 0.04005052365664965, "loss": -0.0231, "grad_norm": 4.444335460662842, "learning_rate": 7.696969696969696e-06, "num_tokens": 1377264.0, "completions/mean_length": 83.0, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 21.71428680419922, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.6338531970977783, "rewards/meter/std": 0.4407992959022522, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9379624128341675, "rewards/lexical_plausibility/std": 0.17546886205673218, "rewards/judge_quality/mean": 0.5262500047683716, "rewards/judge_quality/std": 0.3537932336330414, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.38226625323295593, "rewards/total_composite/std": 0.3537594974040985, "reward": 0.38226625323295593, "reward_std": 0.3537594676017761, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18164275586605072, "sampling/sampling_logp_difference/max": 1.1295795440673828, "sampling/importance_sampling_ratio/min": 0.3735601305961609, "sampling/importance_sampling_ratio/mean": 1.0501426458358765, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2641790956258774, "clip_ratio/low_mean": 0.0896728141233325, "clip_ratio/low_min": 0.0896728141233325, "clip_ratio/high_mean": 0.0623641312122345, "clip_ratio/high_max": 0.0623641312122345, "clip_ratio/region_mean": 0.152036945335567, "reward_total_mean": 0.38226625323295593, "reward_meter_mean": 0.6338531970977783, "reward_meter_std": 0.4407992959022522, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9379624128341675, "reward_lexical_plausibility_std": 0.17546886205673218, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5262500047683716, "reward_judge_quality_std": 0.3537932336330414, "reward_total_composite_mean": 0.38226625323295593, "reward_total_composite_std": 0.3537594974040985} {"timestamp_utc": "2026-04-12T18:50:11Z", "mode": "train", "global_step": 762, "epoch": 0.0401031524656597, "loss": -0.0231, "grad_norm": 2.7324411869049072, "learning_rate": 7.693939393939395e-06, "num_tokens": 1378702.0, "completions/mean_length": 143.75, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 21.0, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.331742525100708, "rewards/meter/std": 0.3675425350666046, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.871656060218811, "rewards/lexical_plausibility/std": 0.17920765280723572, "rewards/judge_quality/mean": 0.34999996423721313, "rewards/judge_quality/std": 0.2070196568965912, "rewards/repeat_penalty/mean": 0.760830819606781, "rewards/repeat_penalty/std": 0.10899937152862549, "rewards/repeat_floor/mean": 0.9828301668167114, "rewards/repeat_floor/std": 0.012803645804524422, "rewards/near_duplicate_penalty/mean": 0.9730343818664551, "rewards/near_duplicate_penalty/std": 0.07378175109624863, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1149199828505516, "rewards/total_composite/std": 0.1412688046693802, "reward": 0.1149199828505516, "reward_std": 0.141268789768219, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14124970138072968, "sampling/sampling_logp_difference/max": 1.1507205963134766, "sampling/importance_sampling_ratio/min": 0.4002891778945923, "sampling/importance_sampling_ratio/mean": 1.0113756656646729, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0592435225844383, "clip_ratio/low_mean": 0.041125542018562555, "clip_ratio/low_min": 0.041125542018562555, "clip_ratio/high_mean": 0.04743392672389746, "clip_ratio/high_max": 0.04743392672389746, "clip_ratio/region_mean": 0.08855946874246001, "reward_total_mean": 0.1149199828505516, "reward_meter_mean": 0.331742525100708, "reward_meter_std": 0.3675425350666046, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.871656060218811, "reward_lexical_plausibility_std": 0.17920765280723572, "reward_repeat_penalty_mean": 0.760830819606781, "reward_repeat_penalty_std": 0.10899937152862549, "reward_repeat_floor_mean": 0.9828301668167114, "reward_repeat_floor_std": 0.012803645804524422, "reward_near_duplicate_penalty_mean": 0.9730343818664551, "reward_near_duplicate_penalty_std": 0.07378175109624863, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.34999996423721313, "reward_judge_quality_std": 0.2070196568965912, "reward_total_composite_mean": 0.1149199828505516, "reward_total_composite_std": 0.1412688046693802} {"timestamp_utc": "2026-04-12T18:50:20Z", "mode": "train", "global_step": 763, "epoch": 0.040155781274669754, "loss": -0.1787, "grad_norm": 18.535858154296875, "learning_rate": 7.690909090909091e-06, "num_tokens": 1380205.0, "completions/mean_length": 24.875, "completions/min_length": 16.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.875, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.7672863006591797, "rewards/meter/std": 0.3053992688655853, "rewards/count_adherence/mean": 0.4583333432674408, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8375000357627869, "rewards/count_floor/std": 0.0517548993229866, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.8299659490585327, "rewards/repeat_penalty/std": 0.13155357539653778, "rewards/repeat_floor/mean": 0.9881312847137451, "rewards/repeat_floor/std": 0.009411572478711605, "rewards/near_duplicate_penalty/mean": 0.983375072479248, "rewards/near_duplicate_penalty/std": 0.03218412771821022, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1267128735780716, "rewards/total_composite/std": 0.05846923589706421, "reward": 0.1267128735780716, "reward_std": 0.05846923217177391, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15891475975513458, "sampling/sampling_logp_difference/max": 1.1123703718185425, "sampling/importance_sampling_ratio/min": 0.33009979128837585, "sampling/importance_sampling_ratio/mean": 1.0086604356765747, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0872657150030136, "clip_ratio/low_mean": 0.10213108593598008, "clip_ratio/low_min": 0.10213108593598008, "clip_ratio/high_mean": 0.03632478695362806, "clip_ratio/high_max": 0.03632478695362806, "clip_ratio/region_mean": 0.13845587288960814, "reward_total_mean": 0.1267128735780716, "reward_meter_mean": 0.7672863006591797, "reward_meter_std": 0.3053992688655853, "reward_count_adherence_mean": 0.4583333432674408, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8375000357627869, "reward_count_floor_std": 0.0517548993229866, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8299659490585327, "reward_repeat_penalty_std": 0.13155357539653778, "reward_repeat_floor_mean": 0.9881312847137451, "reward_repeat_floor_std": 0.009411572478711605, "reward_near_duplicate_penalty_mean": 0.983375072479248, "reward_near_duplicate_penalty_std": 0.03218412771821022, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.1267128735780716, "reward_total_composite_std": 0.05846923589706421} {"timestamp_utc": "2026-04-12T18:50:29Z", "mode": "train", "global_step": 764, "epoch": 0.040208410083679806, "loss": 0.2131, "grad_norm": 22.37726593017578, "learning_rate": 7.687878787878788e-06, "num_tokens": 1381584.0, "completions/mean_length": 22.375, "completions/min_length": 14.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.375, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.5623931884765625, "rewards/meter/std": 0.3798246681690216, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.3184336721897125, "rewards/repeat_penalty/mean": 0.8179469704627991, "rewards/repeat_penalty/std": 0.12802553176879883, "rewards/repeat_floor/mean": 0.9861041307449341, "rewards/repeat_floor/std": 0.01027802936732769, "rewards/near_duplicate_penalty/mean": 0.9698607921600342, "rewards/near_duplicate_penalty/std": 0.0485549233853817, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.30107706785202026, "rewards/total_composite/std": 0.2895428240299225, "reward": 0.30107706785202026, "reward_std": 0.2895428240299225, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15181639790534973, "sampling/sampling_logp_difference/max": 1.1574530601501465, "sampling/importance_sampling_ratio/min": 0.3174467384815216, "sampling/importance_sampling_ratio/mean": 0.9998915195465088, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8709793724119663, "clip_ratio/low_mean": 0.09685446508228779, "clip_ratio/low_min": 0.09685446508228779, "clip_ratio/high_mean": 0.05131579004228115, "clip_ratio/high_max": 0.05131579004228115, "clip_ratio/region_mean": 0.14817025512456894, "reward_total_mean": 0.30107706785202026, "reward_meter_mean": 0.5623931884765625, "reward_meter_std": 0.3798246681690216, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8179469704627991, "reward_repeat_penalty_std": 0.12802553176879883, "reward_repeat_floor_mean": 0.9861041307449341, "reward_repeat_floor_std": 0.01027802936732769, "reward_near_duplicate_penalty_mean": 0.9698607921600342, "reward_near_duplicate_penalty_std": 0.0485549233853817, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.3184336721897125, "reward_total_composite_mean": 0.30107706785202026, "reward_total_composite_std": 0.2895428240299225} {"timestamp_utc": "2026-04-12T18:50:37Z", "mode": "train", "global_step": 765, "epoch": 0.04026103889268986, "loss": 0.0753, "grad_norm": 15.800399780273438, "learning_rate": 7.684848484848485e-06, "num_tokens": 1383197.0, "completions/mean_length": 22.625, "completions/min_length": 18.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.625, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.9605438709259033, "rewards/meter/std": 0.032537493854761124, "rewards/count_adherence/mean": 0.375, "rewards/count_adherence/std": 0.1178511381149292, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8125, "rewards/count_floor/std": 0.035355325788259506, "rewards/lexical_plausibility/mean": 0.953125, "rewards/lexical_plausibility/std": 0.13258251547813416, "rewards/judge_quality/mean": 0.35875001549720764, "rewards/judge_quality/std": 0.27105283737182617, "rewards/repeat_penalty/mean": 0.564224362373352, "rewards/repeat_penalty/std": 0.2216183990240097, "rewards/repeat_floor/mean": 0.9506906270980835, "rewards/repeat_floor/std": 0.03978775069117546, "rewards/near_duplicate_penalty/mean": 0.8543699979782104, "rewards/near_duplicate_penalty/std": 0.1575518399477005, "rewards/opening_diversity/mean": 0.703125, "rewards/opening_diversity/std": 0.13258251547813416, "rewards/distinct_2/mean": 0.8927515149116516, "rewards/distinct_2/std": 0.1609673798084259, "rewards/total_composite/mean": 0.2627718448638916, "rewards/total_composite/std": 0.19434994459152222, "reward": 0.2627718448638916, "reward_std": 0.1943499594926834, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13608522713184357, "sampling/sampling_logp_difference/max": 1.119798183441162, "sampling/importance_sampling_ratio/min": 0.32634562253952026, "sampling/importance_sampling_ratio/mean": 1.0080320835113525, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9093529507517815, "clip_ratio/low_mean": 0.06417606631293893, "clip_ratio/low_min": 0.06417606631293893, "clip_ratio/high_mean": 0.07747114170342684, "clip_ratio/high_max": 0.07747114170342684, "clip_ratio/region_mean": 0.14164720801636577, "reward_total_mean": 0.2627718448638916, "reward_meter_mean": 0.9605438709259033, "reward_meter_std": 0.032537493854761124, "reward_count_adherence_mean": 0.375, "reward_count_adherence_std": 0.1178511381149292, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8125, "reward_count_floor_std": 0.035355325788259506, "reward_lexical_plausibility_mean": 0.953125, "reward_lexical_plausibility_std": 0.13258251547813416, "reward_repeat_penalty_mean": 0.564224362373352, "reward_repeat_penalty_std": 0.2216183990240097, "reward_repeat_floor_mean": 0.9506906270980835, "reward_repeat_floor_std": 0.03978775069117546, "reward_near_duplicate_penalty_mean": 0.8543699979782104, "reward_near_duplicate_penalty_std": 0.1575518399477005, "reward_opening_diversity_mean": 0.703125, "reward_opening_diversity_std": 0.13258251547813416, "reward_distinct_2_mean": 0.8927515149116516, "reward_distinct_2_std": 0.1609673798084259, "reward_judge_quality_mean": 0.35875001549720764, "reward_judge_quality_std": 0.27105283737182617, "reward_total_composite_mean": 0.2627718448638916, "reward_total_composite_std": 0.19434994459152222} {"timestamp_utc": "2026-04-12T18:50:46Z", "mode": "train", "global_step": 766, "epoch": 0.04031366770169991, "loss": 0.0216, "grad_norm": 19.032678604125977, "learning_rate": 7.681818181818183e-06, "num_tokens": 1384716.0, "completions/mean_length": 21.875, "completions/min_length": 19.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.875, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.5013790726661682, "rewards/meter/std": 0.30632445216178894, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9652406573295593, "rewards/lexical_plausibility/std": 0.0983143076300621, "rewards/judge_quality/mean": 0.6937500238418579, "rewards/judge_quality/std": 0.32275325059890747, "rewards/repeat_penalty/mean": 0.7008553743362427, "rewards/repeat_penalty/std": 0.0752108246088028, "rewards/repeat_floor/mean": 0.9760586619377136, "rewards/repeat_floor/std": 0.01471381913870573, "rewards/near_duplicate_penalty/mean": 0.949266791343689, "rewards/near_duplicate_penalty/std": 0.10010528564453125, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.3125600814819336, "rewards/total_composite/std": 0.27480924129486084, "reward": 0.3125600814819336, "reward_std": 0.27480921149253845, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15522697567939758, "sampling/sampling_logp_difference/max": 1.051997184753418, "sampling/importance_sampling_ratio/min": 0.3492395579814911, "sampling/importance_sampling_ratio/mean": 1.0159152746200562, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.231025904417038, "clip_ratio/low_mean": 0.08325826842337847, "clip_ratio/low_min": 0.08325826842337847, "clip_ratio/high_mean": 0.04471343941986561, "clip_ratio/high_max": 0.04471343941986561, "clip_ratio/region_mean": 0.12797170784324408, "reward_total_mean": 0.3125600814819336, "reward_meter_mean": 0.5013790726661682, "reward_meter_std": 0.30632445216178894, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9652406573295593, "reward_lexical_plausibility_std": 0.0983143076300621, "reward_repeat_penalty_mean": 0.7008553743362427, "reward_repeat_penalty_std": 0.0752108246088028, "reward_repeat_floor_mean": 0.9760586619377136, "reward_repeat_floor_std": 0.01471381913870573, "reward_near_duplicate_penalty_mean": 0.949266791343689, "reward_near_duplicate_penalty_std": 0.10010528564453125, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.6937500238418579, "reward_judge_quality_std": 0.32275325059890747, "reward_total_composite_mean": 0.3125600814819336, "reward_total_composite_std": 0.27480924129486084} {"timestamp_utc": "2026-04-12T18:50:54Z", "mode": "train", "global_step": 767, "epoch": 0.04036629651070996, "loss": 0.047, "grad_norm": 21.347537994384766, "learning_rate": 7.678787878787878e-06, "num_tokens": 1386086.0, "completions/mean_length": 19.25, "completions/min_length": 17.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.25, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.9754035472869873, "rewards/meter/std": 0.016338838264346123, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.476250022649765, "rewards/judge_quality/std": 0.38119879364967346, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3886607885360718, "rewards/total_composite/std": 0.3102341890335083, "reward": 0.3886607885360718, "reward_std": 0.3102341592311859, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16929809749126434, "sampling/sampling_logp_difference/max": 1.5765259265899658, "sampling/importance_sampling_ratio/min": 0.2066919058561325, "sampling/importance_sampling_ratio/mean": 0.9983431100845337, "sampling/importance_sampling_ratio/max": 1.9500958919525146, "entropy": 0.8574133589863777, "clip_ratio/low_mean": 0.10224089957773685, "clip_ratio/low_min": 0.10224089957773685, "clip_ratio/high_mean": 0.05807072902098298, "clip_ratio/high_max": 0.05807072902098298, "clip_ratio/region_mean": 0.16031162859871984, "reward_total_mean": 0.3886607885360718, "reward_meter_mean": 0.9754035472869873, "reward_meter_std": 0.016338838264346123, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.476250022649765, "reward_judge_quality_std": 0.38119879364967346, "reward_total_composite_mean": 0.3886607885360718, "reward_total_composite_std": 0.3102341890335083} {"timestamp_utc": "2026-04-12T18:51:02Z", "mode": "train", "global_step": 768, "epoch": 0.040418925319720016, "loss": -0.0195, "grad_norm": 20.816057205200195, "learning_rate": 7.675757575757577e-06, "num_tokens": 1387476.0, "completions/mean_length": 24.75, "completions/min_length": 17.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.75, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.41209256649017334, "rewards/meter/std": 0.38532668352127075, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9887152910232544, "rewards/lexical_plausibility/std": 0.022863244637846947, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.33457863330841064, "rewards/repeat_penalty/mean": 0.8101656436920166, "rewards/repeat_penalty/std": 0.1115168109536171, "rewards/repeat_floor/mean": 0.988399863243103, "rewards/repeat_floor/std": 0.006339644081890583, "rewards/near_duplicate_penalty/mean": 0.9976656436920166, "rewards/near_duplicate_penalty/std": 0.0066026621498167515, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2490522861480713, "rewards/total_composite/std": 0.2924487590789795, "reward": 0.2490522861480713, "reward_std": 0.2924487888813019, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1720062792301178, "sampling/sampling_logp_difference/max": 1.9223260879516602, "sampling/importance_sampling_ratio/min": 0.14626634120941162, "sampling/importance_sampling_ratio/mean": 1.0118714570999146, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.984496034681797, "clip_ratio/low_mean": 0.08240398345515132, "clip_ratio/low_min": 0.08240398345515132, "clip_ratio/high_mean": 0.052736480720341206, "clip_ratio/high_max": 0.052736480720341206, "clip_ratio/region_mean": 0.13514046417549253, "reward_total_mean": 0.2490522861480713, "reward_meter_mean": 0.41209256649017334, "reward_meter_std": 0.38532668352127075, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9887152910232544, "reward_lexical_plausibility_std": 0.022863244637846947, "reward_repeat_penalty_mean": 0.8101656436920166, "reward_repeat_penalty_std": 0.1115168109536171, "reward_repeat_floor_mean": 0.988399863243103, "reward_repeat_floor_std": 0.006339644081890583, "reward_near_duplicate_penalty_mean": 0.9976656436920166, "reward_near_duplicate_penalty_std": 0.0066026621498167515, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.33457863330841064, "reward_total_composite_mean": 0.2490522861480713, "reward_total_composite_std": 0.2924487590789795} {"timestamp_utc": "2026-04-12T18:51:10Z", "mode": "train", "global_step": 769, "epoch": 0.04047155412873007, "loss": 0.0236, "grad_norm": 25.497764587402344, "learning_rate": 7.672727272727273e-06, "num_tokens": 1389023.0, "completions/mean_length": 19.375, "completions/min_length": 18.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.375, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.9459700584411621, "rewards/meter/std": 0.06000656634569168, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8487499952316284, "rewards/judge_quality/std": 0.20152544975280762, "rewards/repeat_penalty/mean": 0.7207263112068176, "rewards/repeat_penalty/std": 0.055174242705106735, "rewards/repeat_floor/mean": 0.9791452884674072, "rewards/repeat_floor/std": 0.011034860275685787, "rewards/near_duplicate_penalty/mean": 0.9609683752059937, "rewards/near_duplicate_penalty/std": 0.07356566190719604, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6651339530944824, "rewards/total_composite/std": 0.15791328251361847, "reward": 0.6651339530944824, "reward_std": 0.15791326761245728, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15176261961460114, "sampling/sampling_logp_difference/max": 1.8464980125427246, "sampling/importance_sampling_ratio/min": 0.15778878331184387, "sampling/importance_sampling_ratio/mean": 0.9938704967498779, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8959499150514603, "clip_ratio/low_mean": 0.01315789483487606, "clip_ratio/low_min": 0.01315789483487606, "clip_ratio/high_mean": 0.12202381249517202, "clip_ratio/high_max": 0.12202381249517202, "clip_ratio/region_mean": 0.13518170733004808, "reward_total_mean": 0.6651339530944824, "reward_meter_mean": 0.9459700584411621, "reward_meter_std": 0.06000656634569168, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7207263112068176, "reward_repeat_penalty_std": 0.055174242705106735, "reward_repeat_floor_mean": 0.9791452884674072, "reward_repeat_floor_std": 0.011034860275685787, "reward_near_duplicate_penalty_mean": 0.9609683752059937, "reward_near_duplicate_penalty_std": 0.07356566190719604, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8487499952316284, "reward_judge_quality_std": 0.20152544975280762, "reward_total_composite_mean": 0.6651339530944824, "reward_total_composite_std": 0.15791328251361847} {"timestamp_utc": "2026-04-12T18:51:19Z", "mode": "train", "global_step": 770, "epoch": 0.04052418293774012, "loss": -0.0293, "grad_norm": 13.898656845092773, "learning_rate": 7.66969696969697e-06, "num_tokens": 1390773.0, "completions/mean_length": 48.75, "completions/min_length": 37.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.75, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.5010685920715332, "rewards/meter/std": 0.4373815357685089, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.7499796152114868, "rewards/repeat_penalty/std": 0.14986592531204224, "rewards/repeat_floor/mean": 0.9721471071243286, "rewards/repeat_floor/std": 0.016216160729527473, "rewards/near_duplicate_penalty/mean": 0.9233490824699402, "rewards/near_duplicate_penalty/std": 0.030025022104382515, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8599413633346558, "rewards/distinct_2/std": 0.09072302281856537, "rewards/total_composite/mean": 0.14605870842933655, "rewards/total_composite/std": 0.14427883923053741, "reward": 0.14605870842933655, "reward_std": 0.14427883923053741, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.154762402176857, "sampling/sampling_logp_difference/max": 2.8827919960021973, "sampling/importance_sampling_ratio/min": 0.05597825348377228, "sampling/importance_sampling_ratio/mean": 0.9965939521789551, "sampling/importance_sampling_ratio/max": 1.865016222000122, "entropy": 0.8376650288701057, "clip_ratio/low_mean": 0.05851264717057347, "clip_ratio/low_min": 0.05851264717057347, "clip_ratio/high_mean": 0.05808691866695881, "clip_ratio/high_max": 0.05808691866695881, "clip_ratio/region_mean": 0.11659956583753228, "reward_total_mean": 0.14605870842933655, "reward_meter_mean": 0.5010685920715332, "reward_meter_std": 0.4373815357685089, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7499796152114868, "reward_repeat_penalty_std": 0.14986592531204224, "reward_repeat_floor_mean": 0.9721471071243286, "reward_repeat_floor_std": 0.016216160729527473, "reward_near_duplicate_penalty_mean": 0.9233490824699402, "reward_near_duplicate_penalty_std": 0.030025022104382515, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8599413633346558, "reward_distinct_2_std": 0.09072302281856537, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.14605870842933655, "reward_total_composite_std": 0.14427883923053741} {"timestamp_utc": "2026-04-12T18:51:32Z", "mode": "train", "global_step": 771, "epoch": 0.04057681174675017, "loss": 0.0163, "grad_norm": 5.95081901550293, "learning_rate": 7.666666666666667e-06, "num_tokens": 1394565.0, "completions/mean_length": 230.0, "completions/min_length": 46.0, "completions/max_length": 321.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 230.0, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 321.0, "rewards/meter/mean": 0.5900455713272095, "rewards/meter/std": 0.28857189416885376, "rewards/count_adherence/mean": 0.7578125, "rewards/count_adherence/std": 0.2681731879711151, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9273437261581421, "rewards/count_floor/std": 0.08045195043087006, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.4184042811393738, "rewards/repeat_penalty/std": 0.2967893183231354, "rewards/repeat_floor/mean": 0.9340304732322693, "rewards/repeat_floor/std": 0.04270326346158981, "rewards/near_duplicate_penalty/mean": 0.8616848587989807, "rewards/near_duplicate_penalty/std": 0.11876453459262848, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.49753016233444214, "rewards/distinct_2/std": 0.29442593455314636, "rewards/total_composite/mean": 0.12593936920166016, "rewards/total_composite/std": 0.06832549721002579, "reward": 0.12593936920166016, "reward_std": 0.06832549721002579, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13308840990066528, "sampling/sampling_logp_difference/max": 2.553238868713379, "sampling/importance_sampling_ratio/min": 0.07782917469739914, "sampling/importance_sampling_ratio/mean": 1.0099968910217285, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8225430846214294, "clip_ratio/low_mean": 0.07484854385256767, "clip_ratio/low_min": 0.07484854385256767, "clip_ratio/high_mean": 0.05350201576948166, "clip_ratio/high_max": 0.05350201576948166, "clip_ratio/region_mean": 0.12835055962204933, "reward_total_mean": 0.12593936920166016, "reward_meter_mean": 0.5900455713272095, "reward_meter_std": 0.28857189416885376, "reward_count_adherence_mean": 0.7578125, "reward_count_adherence_std": 0.2681731879711151, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9273437261581421, "reward_count_floor_std": 0.08045195043087006, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.4184042811393738, "reward_repeat_penalty_std": 0.2967893183231354, "reward_repeat_floor_mean": 0.9340304732322693, "reward_repeat_floor_std": 0.04270326346158981, "reward_near_duplicate_penalty_mean": 0.8616848587989807, "reward_near_duplicate_penalty_std": 0.11876453459262848, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.49753016233444214, "reward_distinct_2_std": 0.29442593455314636, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.12593936920166016, "reward_total_composite_std": 0.06832549721002579} {"timestamp_utc": "2026-04-12T18:51:46Z", "mode": "train", "global_step": 772, "epoch": 0.040629440555760225, "loss": -0.0801, "grad_norm": 6.436338901519775, "learning_rate": 7.663636363636364e-06, "num_tokens": 1396581.0, "completions/mean_length": 129.0, "completions/min_length": 67.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 74.28572082519531, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.19514545798301697, "rewards/meter/std": 0.19754625856876373, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.27368009090423584, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.08210402727127075, "rewards/lexical_plausibility/mean": 0.9324172735214233, "rewards/lexical_plausibility/std": 0.19115281105041504, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.8844287991523743, "rewards/repeat_penalty/std": 0.07957295328378677, "rewards/repeat_floor/mean": 0.9859362840652466, "rewards/repeat_floor/std": 0.008351316675543785, "rewards/near_duplicate_penalty/mean": 0.9252746105194092, "rewards/near_duplicate_penalty/std": 0.05803005024790764, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9891117811203003, "rewards/distinct_2/std": 0.020227652043104172, "rewards/total_composite/mean": 0.07932163774967194, "rewards/total_composite/std": 0.0918048620223999, "reward": 0.07932163774967194, "reward_std": 0.0918048620223999, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15314671397209167, "sampling/sampling_logp_difference/max": 2.5624470710754395, "sampling/importance_sampling_ratio/min": 0.07711579650640488, "sampling/importance_sampling_ratio/mean": 1.0120174884796143, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5992117673158646, "clip_ratio/low_mean": 0.10750545747578144, "clip_ratio/low_min": 0.10750545747578144, "clip_ratio/high_mean": 0.040029761381447315, "clip_ratio/high_max": 0.040029761381447315, "clip_ratio/region_mean": 0.14753521885722876, "reward_total_mean": 0.07932163774967194, "reward_meter_mean": 0.19514545798301697, "reward_meter_std": 0.19754625856876373, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.27368009090423584, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.08210402727127075, "reward_lexical_plausibility_mean": 0.9324172735214233, "reward_lexical_plausibility_std": 0.19115281105041504, "reward_repeat_penalty_mean": 0.8844287991523743, "reward_repeat_penalty_std": 0.07957295328378677, "reward_repeat_floor_mean": 0.9859362840652466, "reward_repeat_floor_std": 0.008351316675543785, "reward_near_duplicate_penalty_mean": 0.9252746105194092, "reward_near_duplicate_penalty_std": 0.05803005024790764, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9891117811203003, "reward_distinct_2_std": 0.020227652043104172, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.07932163774967194, "reward_total_composite_std": 0.0918048620223999} {"timestamp_utc": "2026-04-12T18:51:55Z", "mode": "train", "global_step": 773, "epoch": 0.04068206936477028, "loss": 0.0417, "grad_norm": 23.878934860229492, "learning_rate": 7.660606060606062e-06, "num_tokens": 1397985.0, "completions/mean_length": 26.5, "completions/min_length": 16.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.5, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.7131302952766418, "rewards/meter/std": 0.2686402499675751, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.5762500166893005, "rewards/judge_quality/std": 0.3882538676261902, "rewards/repeat_penalty/mean": 0.8704565763473511, "rewards/repeat_penalty/std": 0.1289837807416916, "rewards/repeat_floor/mean": 0.9918185472488403, "rewards/repeat_floor/std": 0.0073724305257201195, "rewards/near_duplicate_penalty/mean": 0.9954565763473511, "rewards/near_duplicate_penalty/std": 0.008819373324513435, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3349722623825073, "rewards/total_composite/std": 0.24952907860279083, "reward": 0.3349722623825073, "reward_std": 0.24952907860279083, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16240321099758148, "sampling/sampling_logp_difference/max": 1.4973726272583008, "sampling/importance_sampling_ratio/min": 0.22371718287467957, "sampling/importance_sampling_ratio/mean": 1.0314677953720093, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9310154989361763, "clip_ratio/low_mean": 0.07899436168372631, "clip_ratio/low_min": 0.07899436168372631, "clip_ratio/high_mean": 0.08602390484884381, "clip_ratio/high_max": 0.08602390484884381, "clip_ratio/region_mean": 0.16501826653257012, "reward_total_mean": 0.3349722623825073, "reward_meter_mean": 0.7131302952766418, "reward_meter_std": 0.2686402499675751, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.8704565763473511, "reward_repeat_penalty_std": 0.1289837807416916, "reward_repeat_floor_mean": 0.9918185472488403, "reward_repeat_floor_std": 0.0073724305257201195, "reward_near_duplicate_penalty_mean": 0.9954565763473511, "reward_near_duplicate_penalty_std": 0.008819373324513435, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5762500166893005, "reward_judge_quality_std": 0.3882538676261902, "reward_total_composite_mean": 0.3349722623825073, "reward_total_composite_std": 0.24952907860279083} {"timestamp_utc": "2026-04-12T18:52:03Z", "mode": "train", "global_step": 774, "epoch": 0.04073469817378033, "loss": 0.0013, "grad_norm": 17.045730590820312, "learning_rate": 7.657575757575757e-06, "num_tokens": 1399485.0, "completions/mean_length": 23.5, "completions/min_length": 19.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.5, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.8890976905822754, "rewards/meter/std": 0.2827149033546448, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.5212500095367432, "rewards/judge_quality/std": 0.27523693442344666, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.39331406354904175, "rewards/total_composite/std": 0.2601402699947357, "reward": 0.39331406354904175, "reward_std": 0.2601402699947357, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12740592658519745, "sampling/sampling_logp_difference/max": 1.1320905685424805, "sampling/importance_sampling_ratio/min": 0.3223586678504944, "sampling/importance_sampling_ratio/mean": 1.0031788349151611, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7947101294994354, "clip_ratio/low_mean": 0.06576450075954199, "clip_ratio/low_min": 0.06576450075954199, "clip_ratio/high_mean": 0.04166666604578495, "clip_ratio/high_max": 0.04166666604578495, "clip_ratio/region_mean": 0.10743116680532694, "reward_total_mean": 0.39331406354904175, "reward_meter_mean": 0.8890976905822754, "reward_meter_std": 0.2827149033546448, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5212500095367432, "reward_judge_quality_std": 0.27523693442344666, "reward_total_composite_mean": 0.39331406354904175, "reward_total_composite_std": 0.2601402699947357} {"timestamp_utc": "2026-04-12T18:52:12Z", "mode": "train", "global_step": 775, "epoch": 0.04078732698279038, "loss": 0.2762, "grad_norm": 19.8206729888916, "learning_rate": 7.654545454545456e-06, "num_tokens": 1400995.0, "completions/mean_length": 28.75, "completions/min_length": 12.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.75, "completions/min_terminated_length": 12.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.6935251951217651, "rewards/meter/std": 0.40879955887794495, "rewards/count_adherence/mean": 0.5416666865348816, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.862500011920929, "rewards/count_floor/std": 0.0517548993229866, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5387500524520874, "rewards/judge_quality/std": 0.3228638768196106, "rewards/repeat_penalty/mean": 0.8410468697547913, "rewards/repeat_penalty/std": 0.1193373054265976, "rewards/repeat_floor/mean": 0.986666202545166, "rewards/repeat_floor/std": 0.010483510792255402, "rewards/near_duplicate_penalty/mean": 0.9743757843971252, "rewards/near_duplicate_penalty/std": 0.03457370027899742, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9570537805557251, "rewards/distinct_2/std": 0.08207473903894424, "rewards/total_composite/mean": 0.3474574089050293, "rewards/total_composite/std": 0.31205835938453674, "reward": 0.3474574089050293, "reward_std": 0.31205835938453674, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1438266634941101, "sampling/sampling_logp_difference/max": 1.1797747611999512, "sampling/importance_sampling_ratio/min": 0.30734795331954956, "sampling/importance_sampling_ratio/mean": 1.004528284072876, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8478525876998901, "clip_ratio/low_mean": 0.08346232445910573, "clip_ratio/low_min": 0.08346232445910573, "clip_ratio/high_mean": 0.04856601823121309, "clip_ratio/high_max": 0.04856601823121309, "clip_ratio/region_mean": 0.13202834269031882, "reward_total_mean": 0.3474574089050293, "reward_meter_mean": 0.6935251951217651, "reward_meter_std": 0.40879955887794495, "reward_count_adherence_mean": 0.5416666865348816, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.862500011920929, "reward_count_floor_std": 0.0517548993229866, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8410468697547913, "reward_repeat_penalty_std": 0.1193373054265976, "reward_repeat_floor_mean": 0.986666202545166, "reward_repeat_floor_std": 0.010483510792255402, "reward_near_duplicate_penalty_mean": 0.9743757843971252, "reward_near_duplicate_penalty_std": 0.03457370027899742, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9570537805557251, "reward_distinct_2_std": 0.08207473903894424, "reward_judge_quality_mean": 0.5387500524520874, "reward_judge_quality_std": 0.3228638768196106, "reward_total_composite_mean": 0.3474574089050293, "reward_total_composite_std": 0.31205835938453674} {"timestamp_utc": "2026-04-12T18:52:20Z", "mode": "train", "global_step": 776, "epoch": 0.040839955791800435, "loss": 0.0504, "grad_norm": 13.736774444580078, "learning_rate": 7.651515151515152e-06, "num_tokens": 1402390.0, "completions/mean_length": 18.375, "completions/min_length": 18.0, "completions/max_length": 19.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.375, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 19.0, "rewards/meter/mean": 0.892931342124939, "rewards/meter/std": 0.2214132845401764, "rewards/count_adherence/mean": 0.25, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.7749999761581421, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.644318163394928, "rewards/repeat_penalty/std": 0.2624778747558594, "rewards/repeat_floor/mean": 0.9733480215072632, "rewards/repeat_floor/std": 0.026111982762813568, "rewards/near_duplicate_penalty/mean": 0.9703094959259033, "rewards/near_duplicate_penalty/std": 0.05516405403614044, "rewards/opening_diversity/mean": 0.65625, "rewards/opening_diversity/std": 0.2651650309562683, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.23547068238258362, "rewards/total_composite/std": 0.05812937766313553, "reward": 0.23547068238258362, "reward_std": 0.05812938138842583, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1799391359090805, "sampling/sampling_logp_difference/max": 1.858041763305664, "sampling/importance_sampling_ratio/min": 0.1559777706861496, "sampling/importance_sampling_ratio/mean": 0.9716464281082153, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8302898481488228, "clip_ratio/low_mean": 0.032894738018512726, "clip_ratio/low_min": 0.032894738018512726, "clip_ratio/high_mean": 0.13633040990680456, "clip_ratio/high_max": 0.13633040990680456, "clip_ratio/region_mean": 0.1692251479253173, "reward_total_mean": 0.23547068238258362, "reward_meter_mean": 0.892931342124939, "reward_meter_std": 0.2214132845401764, "reward_count_adherence_mean": 0.25, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.7749999761581421, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.644318163394928, "reward_repeat_penalty_std": 0.2624778747558594, "reward_repeat_floor_mean": 0.9733480215072632, "reward_repeat_floor_std": 0.026111982762813568, "reward_near_duplicate_penalty_mean": 0.9703094959259033, "reward_near_duplicate_penalty_std": 0.05516405403614044, "reward_opening_diversity_mean": 0.65625, "reward_opening_diversity_std": 0.2651650309562683, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.23547068238258362, "reward_total_composite_std": 0.05812937766313553} {"timestamp_utc": "2026-04-12T18:52:29Z", "mode": "train", "global_step": 777, "epoch": 0.04089258460081048, "loss": 0.0782, "grad_norm": 18.51751708984375, "learning_rate": 7.648484848484849e-06, "num_tokens": 1403824.0, "completions/mean_length": 20.25, "completions/min_length": 16.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.25, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.8164852261543274, "rewards/meter/std": 0.3480514883995056, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.7368881106376648, "rewards/repeat_penalty/std": 0.03708602488040924, "rewards/repeat_floor/mean": 0.983426570892334, "rewards/repeat_floor/std": 0.004450327716767788, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.25499558448791504, "rewards/total_composite/std": 0.1301426887512207, "reward": 0.25499558448791504, "reward_std": 0.1301426887512207, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14567610621452332, "sampling/sampling_logp_difference/max": 1.052895188331604, "sampling/importance_sampling_ratio/min": 0.3489260673522949, "sampling/importance_sampling_ratio/mean": 1.0312671661376953, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1905914917588234, "clip_ratio/low_mean": 0.051037549041211605, "clip_ratio/low_min": 0.051037549041211605, "clip_ratio/high_mean": 0.08946805074810982, "clip_ratio/high_max": 0.08946805074810982, "clip_ratio/region_mean": 0.14050559978932142, "reward_total_mean": 0.25499558448791504, "reward_meter_mean": 0.8164852261543274, "reward_meter_std": 0.3480514883995056, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.7368881106376648, "reward_repeat_penalty_std": 0.03708602488040924, "reward_repeat_floor_mean": 0.983426570892334, "reward_repeat_floor_std": 0.004450327716767788, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.25499558448791504, "reward_total_composite_std": 0.1301426887512207} {"timestamp_utc": "2026-04-12T18:52:36Z", "mode": "train", "global_step": 778, "epoch": 0.04094521340982053, "loss": -0.1217, "grad_norm": 20.82761573791504, "learning_rate": 7.645454545454546e-06, "num_tokens": 1405206.0, "completions/mean_length": 19.75, "completions/min_length": 12.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.75, "completions/min_terminated_length": 12.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.6180265545845032, "rewards/meter/std": 0.4441920816898346, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.75, "rewards/hard_gate/std": 0.4629100561141968, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.13887302577495575, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9312499761581421, "rewards/judge_quality/std": 0.015526460483670235, "rewards/repeat_penalty/mean": 0.7890859246253967, "rewards/repeat_penalty/std": 0.1365775465965271, "rewards/repeat_floor/mean": 0.9859402775764465, "rewards/repeat_floor/std": 0.00999416969716549, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9687812328338623, "rewards/distinct_2/std": 0.05835825204849243, "rewards/total_composite/mean": 0.564579963684082, "rewards/total_composite/std": 0.40636146068573, "reward": 0.564579963684082, "reward_std": 0.40636146068573, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1289128065109253, "sampling/sampling_logp_difference/max": 1.2647600173950195, "sampling/importance_sampling_ratio/min": 0.2823070287704468, "sampling/importance_sampling_ratio/mean": 0.982999324798584, "sampling/importance_sampling_ratio/max": 1.4815729856491089, "entropy": 0.6345707513391972, "clip_ratio/low_mean": 0.05520979035645723, "clip_ratio/low_min": 0.05520979035645723, "clip_ratio/high_mean": 0.05383971333503723, "clip_ratio/high_max": 0.05383971333503723, "clip_ratio/region_mean": 0.10904950369149446, "reward_total_mean": 0.564579963684082, "reward_meter_mean": 0.6180265545845032, "reward_meter_std": 0.4441920816898346, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.75, "reward_hard_gate_std": 0.4629100561141968, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.13887302577495575, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7890859246253967, "reward_repeat_penalty_std": 0.1365775465965271, "reward_repeat_floor_mean": 0.9859402775764465, "reward_repeat_floor_std": 0.00999416969716549, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9687812328338623, "reward_distinct_2_std": 0.05835825204849243, "reward_judge_quality_mean": 0.9312499761581421, "reward_judge_quality_std": 0.015526460483670235, "reward_total_composite_mean": 0.564579963684082, "reward_total_composite_std": 0.40636146068573} {"timestamp_utc": "2026-04-12T18:52:44Z", "mode": "train", "global_step": 779, "epoch": 0.040997842218830585, "loss": 0.0559, "grad_norm": 22.683591842651367, "learning_rate": 7.642424242424244e-06, "num_tokens": 1406452.0, "completions/mean_length": 26.75, "completions/min_length": 17.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.75, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.855337381362915, "rewards/meter/std": 0.3440517783164978, "rewards/count_adherence/mean": 0.34375, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8031250238418579, "rewards/count_floor/std": 0.038816213607788086, "rewards/lexical_plausibility/mean": 0.9713541269302368, "rewards/lexical_plausibility/std": 0.05990393087267876, "rewards/judge_quality/mean": 0.4424999952316284, "rewards/judge_quality/std": 0.32101404666900635, "rewards/repeat_penalty/mean": 0.809446394443512, "rewards/repeat_penalty/std": 0.10299328714609146, "rewards/repeat_floor/mean": 0.9855901002883911, "rewards/repeat_floor/std": 0.006884741596877575, "rewards/near_duplicate_penalty/mean": 0.9712417125701904, "rewards/near_duplicate_penalty/std": 0.04128456115722656, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9919871687889099, "rewards/distinct_2/std": 0.02266368828713894, "rewards/total_composite/mean": 0.29597342014312744, "rewards/total_composite/std": 0.2679290473461151, "reward": 0.29597342014312744, "reward_std": 0.2679290473461151, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17572063207626343, "sampling/sampling_logp_difference/max": 1.550114631652832, "sampling/importance_sampling_ratio/min": 0.21222363412380219, "sampling/importance_sampling_ratio/mean": 1.0125097036361694, "sampling/importance_sampling_ratio/max": 1.7293217182159424, "entropy": 1.4376767873764038, "clip_ratio/low_mean": 0.07957887835800648, "clip_ratio/low_min": 0.07957887835800648, "clip_ratio/high_mean": 0.08406385313719511, "clip_ratio/high_max": 0.08406385313719511, "clip_ratio/region_mean": 0.1636427314952016, "reward_total_mean": 0.29597342014312744, "reward_meter_mean": 0.855337381362915, "reward_meter_std": 0.3440517783164978, "reward_count_adherence_mean": 0.34375, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8031250238418579, "reward_count_floor_std": 0.038816213607788086, "reward_lexical_plausibility_mean": 0.9713541269302368, "reward_lexical_plausibility_std": 0.05990393087267876, "reward_repeat_penalty_mean": 0.809446394443512, "reward_repeat_penalty_std": 0.10299328714609146, "reward_repeat_floor_mean": 0.9855901002883911, "reward_repeat_floor_std": 0.006884741596877575, "reward_near_duplicate_penalty_mean": 0.9712417125701904, "reward_near_duplicate_penalty_std": 0.04128456115722656, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9919871687889099, "reward_distinct_2_std": 0.02266368828713894, "reward_judge_quality_mean": 0.4424999952316284, "reward_judge_quality_std": 0.32101404666900635, "reward_total_composite_mean": 0.29597342014312744, "reward_total_composite_std": 0.2679290473461151} {"timestamp_utc": "2026-04-12T18:52:52Z", "mode": "train", "global_step": 780, "epoch": 0.04105047102784064, "loss": 0.0862, "grad_norm": 21.682519912719727, "learning_rate": 7.639393939393939e-06, "num_tokens": 1407900.0, "completions/mean_length": 20.0, "completions/min_length": 18.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.0, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.9203027486801147, "rewards/meter/std": 0.16414465010166168, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4675000011920929, "rewards/judge_quality/std": 0.3890189230442047, "rewards/repeat_penalty/mean": 0.7219443321228027, "rewards/repeat_penalty/std": 0.06725989282131195, "rewards/repeat_floor/mean": 0.9793888926506042, "rewards/repeat_floor/std": 0.013451973907649517, "rewards/near_duplicate_penalty/mean": 0.9625924229621887, "rewards/near_duplicate_penalty/std": 0.08967985957860947, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3738017678260803, "rewards/total_composite/std": 0.32943981885910034, "reward": 0.3738017678260803, "reward_std": 0.32943978905677795, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15233810245990753, "sampling/sampling_logp_difference/max": 0.9184441566467285, "sampling/importance_sampling_ratio/min": 0.39913955330848694, "sampling/importance_sampling_ratio/mean": 1.0313408374786377, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.019579291343689, "clip_ratio/low_mean": 0.09335442213341594, "clip_ratio/low_min": 0.09335442213341594, "clip_ratio/high_mean": 0.020467836409807205, "clip_ratio/high_max": 0.020467836409807205, "clip_ratio/region_mean": 0.11382225854322314, "reward_total_mean": 0.3738017678260803, "reward_meter_mean": 0.9203027486801147, "reward_meter_std": 0.16414465010166168, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7219443321228027, "reward_repeat_penalty_std": 0.06725989282131195, "reward_repeat_floor_mean": 0.9793888926506042, "reward_repeat_floor_std": 0.013451973907649517, "reward_near_duplicate_penalty_mean": 0.9625924229621887, "reward_near_duplicate_penalty_std": 0.08967985957860947, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4675000011920929, "reward_judge_quality_std": 0.3890189230442047, "reward_total_composite_mean": 0.3738017678260803, "reward_total_composite_std": 0.32943981885910034} {"timestamp_utc": "2026-04-12T18:53:06Z", "mode": "train", "global_step": 781, "epoch": 0.04110309983685069, "loss": -0.0465, "grad_norm": 1.260072112083435, "learning_rate": 7.636363636363638e-06, "num_tokens": 1409366.0, "completions/mean_length": 149.25, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 28.33333396911621, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.7019569277763367, "rewards/meter/std": 0.4358839988708496, "rewards/count_adherence/mean": 0.28125, "rewards/count_adherence/std": 0.2086307406425476, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.7843749523162842, "rewards/count_floor/std": 0.06258922815322876, "rewards/lexical_plausibility/mean": 0.8568053841590881, "rewards/lexical_plausibility/std": 0.23534192144870758, "rewards/judge_quality/mean": 0.4025000035762787, "rewards/judge_quality/std": 0.2841905951499939, "rewards/repeat_penalty/mean": 0.8117424249649048, "rewards/repeat_penalty/std": 0.11433623731136322, "rewards/repeat_floor/mean": 0.9886363744735718, "rewards/repeat_floor/std": 0.006737613119184971, "rewards/near_duplicate_penalty/mean": 0.9992424249649048, "rewards/near_duplicate_penalty/std": 0.0021427457686513662, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2913835048675537, "rewards/total_composite/std": 0.21905705332756042, "reward": 0.2913835048675537, "reward_std": 0.21905705332756042, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15715575218200684, "sampling/sampling_logp_difference/max": 1.2289297580718994, "sampling/importance_sampling_ratio/min": 0.34187573194503784, "sampling/importance_sampling_ratio/mean": 1.0295498371124268, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7227039933204651, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.11323255952447653, "clip_ratio/high_max": 0.11323255952447653, "clip_ratio/region_mean": 0.11323255952447653, "reward_total_mean": 0.2913835048675537, "reward_meter_mean": 0.7019569277763367, "reward_meter_std": 0.4358839988708496, "reward_count_adherence_mean": 0.28125, "reward_count_adherence_std": 0.2086307406425476, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.7843749523162842, "reward_count_floor_std": 0.06258922815322876, "reward_lexical_plausibility_mean": 0.8568053841590881, "reward_lexical_plausibility_std": 0.23534192144870758, "reward_repeat_penalty_mean": 0.8117424249649048, "reward_repeat_penalty_std": 0.11433623731136322, "reward_repeat_floor_mean": 0.9886363744735718, "reward_repeat_floor_std": 0.006737613119184971, "reward_near_duplicate_penalty_mean": 0.9992424249649048, "reward_near_duplicate_penalty_std": 0.0021427457686513662, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4025000035762787, "reward_judge_quality_std": 0.2841905951499939, "reward_total_composite_mean": 0.2913835048675537, "reward_total_composite_std": 0.21905705332756042} {"timestamp_utc": "2026-04-12T18:53:14Z", "mode": "train", "global_step": 782, "epoch": 0.04115572864586074, "loss": -0.0101, "grad_norm": 18.58893585205078, "learning_rate": 7.633333333333334e-06, "num_tokens": 1410900.0, "completions/mean_length": 21.75, "completions/min_length": 19.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.75, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.9149412512779236, "rewards/meter/std": 0.18534734845161438, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5212500095367432, "rewards/judge_quality/std": 0.22369863092899323, "rewards/repeat_penalty/mean": 0.7145075798034668, "rewards/repeat_penalty/std": 0.054901186376810074, "rewards/repeat_floor/mean": 0.9779015183448792, "rewards/repeat_floor/std": 0.010980247519910336, "rewards/near_duplicate_penalty/mean": 0.9526767730712891, "rewards/near_duplicate_penalty/std": 0.07320158183574677, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.39992910623550415, "rewards/total_composite/std": 0.20364829897880554, "reward": 0.39992910623550415, "reward_std": 0.20364831387996674, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15350231528282166, "sampling/sampling_logp_difference/max": 1.6557645797729492, "sampling/importance_sampling_ratio/min": 0.19094599783420563, "sampling/importance_sampling_ratio/mean": 1.0164743661880493, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.043894425034523, "clip_ratio/low_mean": 0.09295454667881131, "clip_ratio/low_min": 0.09295454667881131, "clip_ratio/high_mean": 0.024027460254728794, "clip_ratio/high_max": 0.024027460254728794, "clip_ratio/region_mean": 0.1169820069335401, "reward_total_mean": 0.39992910623550415, "reward_meter_mean": 0.9149412512779236, "reward_meter_std": 0.18534734845161438, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7145075798034668, "reward_repeat_penalty_std": 0.054901186376810074, "reward_repeat_floor_mean": 0.9779015183448792, "reward_repeat_floor_std": 0.010980247519910336, "reward_near_duplicate_penalty_mean": 0.9526767730712891, "reward_near_duplicate_penalty_std": 0.07320158183574677, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5212500095367432, "reward_judge_quality_std": 0.22369863092899323, "reward_total_composite_mean": 0.39992910623550415, "reward_total_composite_std": 0.20364829897880554} {"timestamp_utc": "2026-04-12T18:53:22Z", "mode": "train", "global_step": 783, "epoch": 0.041208357454870795, "loss": -0.0432, "grad_norm": 18.332656860351562, "learning_rate": 7.630303030303031e-06, "num_tokens": 1412408.0, "completions/mean_length": 15.5, "completions/min_length": 13.0, "completions/max_length": 17.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 15.5, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 17.0, "rewards/meter/mean": 0.9762332439422607, "rewards/meter/std": 0.024528803303837776, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8650000095367432, "rewards/judge_quality/std": 0.16801361739635468, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7063689827919006, "rewards/total_composite/std": 0.13651399314403534, "reward": 0.7063689827919006, "reward_std": 0.13651399314403534, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13365532457828522, "sampling/sampling_logp_difference/max": 1.4031152725219727, "sampling/importance_sampling_ratio/min": 0.24582993984222412, "sampling/importance_sampling_ratio/mean": 1.006777286529541, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7066499292850494, "clip_ratio/low_mean": 0.008928571827709675, "clip_ratio/low_min": 0.008928571827709675, "clip_ratio/high_mean": 0.05147058889269829, "clip_ratio/high_max": 0.05147058889269829, "clip_ratio/region_mean": 0.06039916072040796, "reward_total_mean": 0.7063689827919006, "reward_meter_mean": 0.9762332439422607, "reward_meter_std": 0.024528803303837776, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8650000095367432, "reward_judge_quality_std": 0.16801361739635468, "reward_total_composite_mean": 0.7063689827919006, "reward_total_composite_std": 0.13651399314403534} {"timestamp_utc": "2026-04-12T18:53:30Z", "mode": "train", "global_step": 784, "epoch": 0.04126098626388085, "loss": -0.074, "grad_norm": 19.76032829284668, "learning_rate": 7.627272727272727e-06, "num_tokens": 1414020.0, "completions/mean_length": 25.5, "completions/min_length": 17.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.5, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.6522606611251831, "rewards/meter/std": 0.2949579358100891, "rewards/count_adherence/mean": 0.40625, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8218749761581421, "rewards/count_floor/std": 0.038816213607788086, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.20951901376247406, "rewards/repeat_penalty/mean": 0.865331768989563, "rewards/repeat_penalty/std": 0.1077810749411583, "rewards/repeat_floor/mean": 0.9888465404510498, "rewards/repeat_floor/std": 0.006757983472198248, "rewards/near_duplicate_penalty/mean": 0.9708355665206909, "rewards/near_duplicate_penalty/std": 0.032967522740364075, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9871795177459717, "rewards/distinct_2/std": 0.03626188635826111, "rewards/total_composite/mean": 0.2589820623397827, "rewards/total_composite/std": 0.2225312888622284, "reward": 0.2589820623397827, "reward_std": 0.2225312888622284, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1912866234779358, "sampling/sampling_logp_difference/max": 1.6955208778381348, "sampling/importance_sampling_ratio/min": 0.18350361287593842, "sampling/importance_sampling_ratio/mean": 0.9580504298210144, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.648014560341835, "clip_ratio/low_mean": 0.08849715208634734, "clip_ratio/low_min": 0.08849715208634734, "clip_ratio/high_mean": 0.0570512842386961, "clip_ratio/high_max": 0.0570512842386961, "clip_ratio/region_mean": 0.14554843632504344, "reward_total_mean": 0.2589820623397827, "reward_meter_mean": 0.6522606611251831, "reward_meter_std": 0.2949579358100891, "reward_count_adherence_mean": 0.40625, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8218749761581421, "reward_count_floor_std": 0.038816213607788086, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.865331768989563, "reward_repeat_penalty_std": 0.1077810749411583, "reward_repeat_floor_mean": 0.9888465404510498, "reward_repeat_floor_std": 0.006757983472198248, "reward_near_duplicate_penalty_mean": 0.9708355665206909, "reward_near_duplicate_penalty_std": 0.032967522740364075, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9871795177459717, "reward_distinct_2_std": 0.03626188635826111, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.20951901376247406, "reward_total_composite_mean": 0.2589820623397827, "reward_total_composite_std": 0.2225312888622284} {"timestamp_utc": "2026-04-12T18:53:38Z", "mode": "train", "global_step": 785, "epoch": 0.0413136150728909, "loss": -0.1302, "grad_norm": 17.985218048095703, "learning_rate": 7.6242424242424254e-06, "num_tokens": 1415606.0, "completions/mean_length": 30.25, "completions/min_length": 17.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.25, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.9774325489997864, "rewards/meter/std": 0.028761059045791626, "rewards/count_adherence/mean": 0.34375, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8031250238418579, "rewards/count_floor/std": 0.038816213607788086, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47999998927116394, "rewards/judge_quality/std": 0.28400203585624695, "rewards/repeat_penalty/mean": 0.7474256753921509, "rewards/repeat_penalty/std": 0.13144512474536896, "rewards/repeat_floor/mean": 0.9782500267028809, "rewards/repeat_floor/std": 0.015048199333250523, "rewards/near_duplicate_penalty/mean": 0.9494141340255737, "rewards/near_duplicate_penalty/std": 0.066337950527668, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9676434993743896, "rewards/distinct_2/std": 0.0638899877667427, "rewards/total_composite/mean": 0.37300124764442444, "rewards/total_composite/std": 0.23304860293865204, "reward": 0.37300124764442444, "reward_std": 0.23304857313632965, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15827888250350952, "sampling/sampling_logp_difference/max": 1.247124433517456, "sampling/importance_sampling_ratio/min": 0.28732985258102417, "sampling/importance_sampling_ratio/mean": 1.0281550884246826, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.024580493569374, "clip_ratio/low_mean": 0.1004318417981267, "clip_ratio/low_min": 0.1004318417981267, "clip_ratio/high_mean": 0.0513392873108387, "clip_ratio/high_max": 0.0513392873108387, "clip_ratio/region_mean": 0.1517711291089654, "reward_total_mean": 0.37300124764442444, "reward_meter_mean": 0.9774325489997864, "reward_meter_std": 0.028761059045791626, "reward_count_adherence_mean": 0.34375, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8031250238418579, "reward_count_floor_std": 0.038816213607788086, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7474256753921509, "reward_repeat_penalty_std": 0.13144512474536896, "reward_repeat_floor_mean": 0.9782500267028809, "reward_repeat_floor_std": 0.015048199333250523, "reward_near_duplicate_penalty_mean": 0.9494141340255737, "reward_near_duplicate_penalty_std": 0.066337950527668, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9676434993743896, "reward_distinct_2_std": 0.0638899877667427, "reward_judge_quality_mean": 0.47999998927116394, "reward_judge_quality_std": 0.28400203585624695, "reward_total_composite_mean": 0.37300124764442444, "reward_total_composite_std": 0.23304860293865204} {"timestamp_utc": "2026-04-12T18:53:48Z", "mode": "train", "global_step": 786, "epoch": 0.04136624388190095, "loss": -0.0504, "grad_norm": 11.129945755004883, "learning_rate": 7.621212121212122e-06, "num_tokens": 1417780.0, "completions/mean_length": 87.75, "completions/min_length": 64.0, "completions/max_length": 106.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.75, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.7454812526702881, "rewards/meter/std": 0.27467748522758484, "rewards/count_adherence/mean": 0.9166666269302368, "rewards/count_adherence/std": 0.1259881556034088, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.03779645636677742, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.6524744033813477, "rewards/repeat_penalty/std": 0.23615077137947083, "rewards/repeat_floor/mean": 0.9642062187194824, "rewards/repeat_floor/std": 0.025166330859065056, "rewards/near_duplicate_penalty/mean": 0.917383074760437, "rewards/near_duplicate_penalty/std": 0.046802930533885956, "rewards/opening_diversity/mean": 0.9955357313156128, "rewards/opening_diversity/std": 0.012626901268959045, "rewards/distinct_2/mean": 0.7429624795913696, "rewards/distinct_2/std": 0.21188749372959137, "rewards/total_composite/mean": 0.27600806951522827, "rewards/total_composite/std": 0.10370464622974396, "reward": 0.27600806951522827, "reward_std": 0.10370464622974396, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16440506279468536, "sampling/sampling_logp_difference/max": 3.912323236465454, "sampling/importance_sampling_ratio/min": 0.019993996247649193, "sampling/importance_sampling_ratio/mean": 1.0130337476730347, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7387968674302101, "clip_ratio/low_mean": 0.05429098196327686, "clip_ratio/low_min": 0.05429098196327686, "clip_ratio/high_mean": 0.06683196406811476, "clip_ratio/high_max": 0.06683196406811476, "clip_ratio/region_mean": 0.12112294603139162, "reward_total_mean": 0.27600806951522827, "reward_meter_mean": 0.7454812526702881, "reward_meter_std": 0.27467748522758484, "reward_count_adherence_mean": 0.9166666269302368, "reward_count_adherence_std": 0.1259881556034088, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.03779645636677742, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6524744033813477, "reward_repeat_penalty_std": 0.23615077137947083, "reward_repeat_floor_mean": 0.9642062187194824, "reward_repeat_floor_std": 0.025166330859065056, "reward_near_duplicate_penalty_mean": 0.917383074760437, "reward_near_duplicate_penalty_std": 0.046802930533885956, "reward_opening_diversity_mean": 0.9955357313156128, "reward_opening_diversity_std": 0.012626901268959045, "reward_distinct_2_mean": 0.7429624795913696, "reward_distinct_2_std": 0.21188749372959137, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.27600806951522827, "reward_total_composite_std": 0.10370464622974396} {"timestamp_utc": "2026-04-12T18:53:56Z", "mode": "train", "global_step": 787, "epoch": 0.041418872690911004, "loss": 0.0608, "grad_norm": 25.511476516723633, "learning_rate": 7.618181818181819e-06, "num_tokens": 1419155.0, "completions/mean_length": 20.875, "completions/min_length": 17.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.875, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.6830810308456421, "rewards/meter/std": 0.36726513504981995, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7599999904632568, "rewards/judge_quality/std": 0.31955328583717346, "rewards/repeat_penalty/mean": 0.7362592816352844, "rewards/repeat_penalty/std": 0.03886464238166809, "rewards/repeat_floor/mean": 0.9822518825531006, "rewards/repeat_floor/std": 0.007772932760417461, "rewards/near_duplicate_penalty/mean": 0.9816790223121643, "rewards/near_duplicate_penalty/std": 0.05181950703263283, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5857986211776733, "rewards/total_composite/std": 0.3785436153411865, "reward": 0.5857986211776733, "reward_std": 0.3785436153411865, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18615415692329407, "sampling/sampling_logp_difference/max": 1.6064338684082031, "sampling/importance_sampling_ratio/min": 0.2006017118692398, "sampling/importance_sampling_ratio/mean": 1.0401734113693237, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2724601104855537, "clip_ratio/low_mean": 0.07842246256768703, "clip_ratio/low_min": 0.07842246256768703, "clip_ratio/high_mean": 0.11835214169695973, "clip_ratio/high_max": 0.11835214169695973, "clip_ratio/region_mean": 0.19677460426464677, "reward_total_mean": 0.5857986211776733, "reward_meter_mean": 0.6830810308456421, "reward_meter_std": 0.36726513504981995, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7362592816352844, "reward_repeat_penalty_std": 0.03886464238166809, "reward_repeat_floor_mean": 0.9822518825531006, "reward_repeat_floor_std": 0.007772932760417461, "reward_near_duplicate_penalty_mean": 0.9816790223121643, "reward_near_duplicate_penalty_std": 0.05181950703263283, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7599999904632568, "reward_judge_quality_std": 0.31955328583717346, "reward_total_composite_mean": 0.5857986211776733, "reward_total_composite_std": 0.3785436153411865} {"timestamp_utc": "2026-04-12T18:54:04Z", "mode": "train", "global_step": 788, "epoch": 0.04147150149992106, "loss": 0.044, "grad_norm": 18.48018455505371, "learning_rate": 7.6151515151515155e-06, "num_tokens": 1420563.0, "completions/mean_length": 25.0, "completions/min_length": 23.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.0, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.7448182106018066, "rewards/meter/std": 0.41385018825531006, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9514399766921997, "rewards/lexical_plausibility/std": 0.09064352512359619, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.3384418189525604, "rewards/repeat_penalty/mean": 0.7196282148361206, "rewards/repeat_penalty/std": 0.06807498633861542, "rewards/repeat_floor/mean": 0.9789255857467651, "rewards/repeat_floor/std": 0.013615014031529427, "rewards/near_duplicate_penalty/mean": 0.959504246711731, "rewards/near_duplicate_penalty/std": 0.09076667577028275, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5100557804107666, "rewards/total_composite/std": 0.3952203392982483, "reward": 0.5100557804107666, "reward_std": 0.3952203392982483, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14302374422550201, "sampling/sampling_logp_difference/max": 1.2075798511505127, "sampling/importance_sampling_ratio/min": 0.32901689410209656, "sampling/importance_sampling_ratio/mean": 0.9992201924324036, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7803836241364479, "clip_ratio/low_mean": 0.05947115458548069, "clip_ratio/low_min": 0.05947115458548069, "clip_ratio/high_mean": 0.055292642675340176, "clip_ratio/high_max": 0.055292642675340176, "clip_ratio/region_mean": 0.11476379726082087, "reward_total_mean": 0.5100557804107666, "reward_meter_mean": 0.7448182106018066, "reward_meter_std": 0.41385018825531006, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9514399766921997, "reward_lexical_plausibility_std": 0.09064352512359619, "reward_repeat_penalty_mean": 0.7196282148361206, "reward_repeat_penalty_std": 0.06807498633861542, "reward_repeat_floor_mean": 0.9789255857467651, "reward_repeat_floor_std": 0.013615014031529427, "reward_near_duplicate_penalty_mean": 0.959504246711731, "reward_near_duplicate_penalty_std": 0.09076667577028275, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.3384418189525604, "reward_total_composite_mean": 0.5100557804107666, "reward_total_composite_std": 0.3952203392982483} {"timestamp_utc": "2026-04-12T18:54:13Z", "mode": "train", "global_step": 789, "epoch": 0.04152413030893111, "loss": -0.0437, "grad_norm": 20.2589168548584, "learning_rate": 7.612121212121213e-06, "num_tokens": 1422221.0, "completions/mean_length": 41.25, "completions/min_length": 25.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.25, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.7006809711456299, "rewards/meter/std": 0.378921777009964, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9298311471939087, "rewards/repeat_penalty/std": 0.09482555836439133, "rewards/repeat_floor/mean": 0.9919579029083252, "rewards/repeat_floor/std": 0.00876479409635067, "rewards/near_duplicate_penalty/mean": 0.9686388373374939, "rewards/near_duplicate_penalty/std": 0.01773165911436081, "rewards/opening_diversity/mean": 0.9821428656578064, "rewards/opening_diversity/std": 0.05050762742757797, "rewards/distinct_2/mean": 0.9748168587684631, "rewards/distinct_2/std": 0.048887718468904495, "rewards/total_composite/mean": 0.28199052810668945, "rewards/total_composite/std": 0.15307407081127167, "reward": 0.28199052810668945, "reward_std": 0.15307407081127167, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19265636801719666, "sampling/sampling_logp_difference/max": 1.7889890670776367, "sampling/importance_sampling_ratio/min": 0.1671290546655655, "sampling/importance_sampling_ratio/mean": 0.9828406572341919, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6921148151159286, "clip_ratio/low_mean": 0.07544191926717758, "clip_ratio/low_min": 0.07544191926717758, "clip_ratio/high_mean": 0.12784320954233408, "clip_ratio/high_max": 0.12784320954233408, "clip_ratio/region_mean": 0.20328512880951166, "reward_total_mean": 0.28199052810668945, "reward_meter_mean": 0.7006809711456299, "reward_meter_std": 0.378921777009964, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9298311471939087, "reward_repeat_penalty_std": 0.09482555836439133, "reward_repeat_floor_mean": 0.9919579029083252, "reward_repeat_floor_std": 0.00876479409635067, "reward_near_duplicate_penalty_mean": 0.9686388373374939, "reward_near_duplicate_penalty_std": 0.01773165911436081, "reward_opening_diversity_mean": 0.9821428656578064, "reward_opening_diversity_std": 0.05050762742757797, "reward_distinct_2_mean": 0.9748168587684631, "reward_distinct_2_std": 0.048887718468904495, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.28199052810668945, "reward_total_composite_std": 0.15307407081127167} {"timestamp_utc": "2026-04-12T18:54:24Z", "mode": "train", "global_step": 790, "epoch": 0.04157675911794116, "loss": 0.3816, "grad_norm": 7.537034034729004, "learning_rate": 7.609090909090909e-06, "num_tokens": 1424783.0, "completions/mean_length": 138.25, "completions/min_length": 24.0, "completions/max_length": 226.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 138.25, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 226.0, "rewards/meter/mean": 0.9772459864616394, "rewards/meter/std": 0.024871040135622025, "rewards/count_adherence/mean": 0.6805555820465088, "rewards/count_adherence/std": 0.3868996798992157, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9041666388511658, "rewards/count_floor/std": 0.11606989800930023, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.3546792268753052, "rewards/repeat_penalty/std": 0.39633709192276, "rewards/repeat_floor/mean": 0.9023541808128357, "rewards/repeat_floor/std": 0.07556961476802826, "rewards/near_duplicate_penalty/mean": 0.7567660212516785, "rewards/near_duplicate_penalty/std": 0.20138370990753174, "rewards/opening_diversity/mean": 0.8033853769302368, "rewards/opening_diversity/std": 0.27091559767723083, "rewards/distinct_2/mean": 0.45151287317276, "rewards/distinct_2/std": 0.41189688444137573, "rewards/total_composite/mean": 0.23552927374839783, "rewards/total_composite/std": 0.10092758387327194, "reward": 0.23552927374839783, "reward_std": 0.10092758387327194, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11563397943973541, "sampling/sampling_logp_difference/max": 1.9845504760742188, "sampling/importance_sampling_ratio/min": 0.13744238018989563, "sampling/importance_sampling_ratio/mean": 1.0082074403762817, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6662660092115402, "clip_ratio/low_mean": 0.025670488364994526, "clip_ratio/low_min": 0.025670488364994526, "clip_ratio/high_mean": 0.09135061781853437, "clip_ratio/high_max": 0.09135061781853437, "clip_ratio/region_mean": 0.1170211061835289, "reward_total_mean": 0.23552927374839783, "reward_meter_mean": 0.9772459864616394, "reward_meter_std": 0.024871040135622025, "reward_count_adherence_mean": 0.6805555820465088, "reward_count_adherence_std": 0.3868996798992157, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9041666388511658, "reward_count_floor_std": 0.11606989800930023, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.3546792268753052, "reward_repeat_penalty_std": 0.39633709192276, "reward_repeat_floor_mean": 0.9023541808128357, "reward_repeat_floor_std": 0.07556961476802826, "reward_near_duplicate_penalty_mean": 0.7567660212516785, "reward_near_duplicate_penalty_std": 0.20138370990753174, "reward_opening_diversity_mean": 0.8033853769302368, "reward_opening_diversity_std": 0.27091559767723083, "reward_distinct_2_mean": 0.45151287317276, "reward_distinct_2_std": 0.41189688444137573, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.23552927374839783, "reward_total_composite_std": 0.10092758387327194} {"timestamp_utc": "2026-04-12T18:54:32Z", "mode": "train", "global_step": 791, "epoch": 0.041629387926951214, "loss": -0.0084, "grad_norm": 15.763554573059082, "learning_rate": 7.606060606060606e-06, "num_tokens": 1426446.0, "completions/mean_length": 31.875, "completions/min_length": 18.0, "completions/max_length": 76.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.875, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.9808659553527832, "rewards/meter/std": 0.01319903414696455, "rewards/count_adherence/mean": 0.2750000059604645, "rewards/count_adherence/std": 0.14880476891994476, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.7824999690055847, "rewards/count_floor/std": 0.04464143142104149, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.24136148393154144, "rewards/repeat_penalty/mean": 0.6188188791275024, "rewards/repeat_penalty/std": 0.19888631999492645, "rewards/repeat_floor/mean": 0.9593135714530945, "rewards/repeat_floor/std": 0.03195086866617203, "rewards/near_duplicate_penalty/mean": 0.8738785982131958, "rewards/near_duplicate_penalty/std": 0.14913766086101532, "rewards/opening_diversity/mean": 0.7946428656578064, "rewards/opening_diversity/std": 0.09105392545461655, "rewards/distinct_2/mean": 0.8950357437133789, "rewards/distinct_2/std": 0.14770591259002686, "rewards/total_composite/mean": 0.29286256432533264, "rewards/total_composite/std": 0.17971602082252502, "reward": 0.29286256432533264, "reward_std": 0.17971602082252502, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16245712339878082, "sampling/sampling_logp_difference/max": 1.6938426494598389, "sampling/importance_sampling_ratio/min": 0.18381184339523315, "sampling/importance_sampling_ratio/mean": 1.0143431425094604, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9917872846126556, "clip_ratio/low_mean": 0.06146375695243478, "clip_ratio/low_min": 0.06146375695243478, "clip_ratio/high_mean": 0.04757246468216181, "clip_ratio/high_max": 0.04757246468216181, "clip_ratio/region_mean": 0.10903622163459659, "reward_total_mean": 0.29286256432533264, "reward_meter_mean": 0.9808659553527832, "reward_meter_std": 0.01319903414696455, "reward_count_adherence_mean": 0.2750000059604645, "reward_count_adherence_std": 0.14880476891994476, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.7824999690055847, "reward_count_floor_std": 0.04464143142104149, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.6188188791275024, "reward_repeat_penalty_std": 0.19888631999492645, "reward_repeat_floor_mean": 0.9593135714530945, "reward_repeat_floor_std": 0.03195086866617203, "reward_near_duplicate_penalty_mean": 0.8738785982131958, "reward_near_duplicate_penalty_std": 0.14913766086101532, "reward_opening_diversity_mean": 0.7946428656578064, "reward_opening_diversity_std": 0.09105392545461655, "reward_distinct_2_mean": 0.8950357437133789, "reward_distinct_2_std": 0.14770591259002686, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.24136148393154144, "reward_total_composite_mean": 0.29286256432533264, "reward_total_composite_std": 0.17971602082252502} {"timestamp_utc": "2026-04-12T18:54:41Z", "mode": "train", "global_step": 792, "epoch": 0.041682016735961266, "loss": 0.1101, "grad_norm": 19.253833770751953, "learning_rate": 7.603030303030303e-06, "num_tokens": 1428138.0, "completions/mean_length": 32.5, "completions/min_length": 21.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.5, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.9065608978271484, "rewards/meter/std": 0.24304506182670593, "rewards/count_adherence/mean": 0.34375, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8031250238418579, "rewards/count_floor/std": 0.038816213607788086, "rewards/lexical_plausibility/mean": 0.995192289352417, "rewards/lexical_plausibility/std": 0.013598216697573662, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.8103132843971252, "rewards/repeat_penalty/std": 0.1503400355577469, "rewards/repeat_floor/mean": 0.9843347072601318, "rewards/repeat_floor/std": 0.015232930891215801, "rewards/near_duplicate_penalty/mean": 0.9580647945404053, "rewards/near_duplicate_penalty/std": 0.0765187069773674, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24058473110198975, "rewards/total_composite/std": 0.10412845760583878, "reward": 0.24058473110198975, "reward_std": 0.10412845760583878, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18579772114753723, "sampling/sampling_logp_difference/max": 1.3998298645019531, "sampling/importance_sampling_ratio/min": 0.2466389387845993, "sampling/importance_sampling_ratio/mean": 1.0183417797088623, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1508845165371895, "clip_ratio/low_mean": 0.061420829966664314, "clip_ratio/low_min": 0.061420829966664314, "clip_ratio/high_mean": 0.11376503109931946, "clip_ratio/high_max": 0.11376503109931946, "clip_ratio/region_mean": 0.17518586106598377, "reward_total_mean": 0.24058473110198975, "reward_meter_mean": 0.9065608978271484, "reward_meter_std": 0.24304506182670593, "reward_count_adherence_mean": 0.34375, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8031250238418579, "reward_count_floor_std": 0.038816213607788086, "reward_lexical_plausibility_mean": 0.995192289352417, "reward_lexical_plausibility_std": 0.013598216697573662, "reward_repeat_penalty_mean": 0.8103132843971252, "reward_repeat_penalty_std": 0.1503400355577469, "reward_repeat_floor_mean": 0.9843347072601318, "reward_repeat_floor_std": 0.015232930891215801, "reward_near_duplicate_penalty_mean": 0.9580647945404053, "reward_near_duplicate_penalty_std": 0.0765187069773674, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.24058473110198975, "reward_total_composite_std": 0.10412845760583878} {"timestamp_utc": "2026-04-12T18:54:49Z", "mode": "train", "global_step": 793, "epoch": 0.04173464554497132, "loss": -0.0045, "grad_norm": 33.363319396972656, "learning_rate": 7.600000000000001e-06, "num_tokens": 1429496.0, "completions/mean_length": 17.75, "completions/min_length": 13.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.75, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.5651530027389526, "rewards/meter/std": 0.41453009843826294, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.953125, "rewards/lexical_plausibility/std": 0.13258251547813416, "rewards/judge_quality/mean": 0.8762500286102295, "rewards/judge_quality/std": 0.1728696972131729, "rewards/repeat_penalty/mean": 0.7601220607757568, "rewards/repeat_penalty/std": 0.028629617765545845, "rewards/repeat_floor/mean": 0.9842380285263062, "rewards/repeat_floor/std": 0.0021551367826759815, "rewards/near_duplicate_penalty/mean": 0.9892076253890991, "rewards/near_duplicate_penalty/std": 0.03052542544901371, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9886877536773682, "rewards/distinct_2/std": 0.031995780766010284, "rewards/total_composite/mean": 0.4184347987174988, "rewards/total_composite/std": 0.3332328498363495, "reward": 0.4184347987174988, "reward_std": 0.3332328498363495, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15353116393089294, "sampling/sampling_logp_difference/max": 1.4581780433654785, "sampling/importance_sampling_ratio/min": 0.3867521584033966, "sampling/importance_sampling_ratio/mean": 1.0651296377182007, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7655248232185841, "clip_ratio/low_mean": 0.10860514268279076, "clip_ratio/low_min": 0.10860514268279076, "clip_ratio/high_mean": 0.04757834831252694, "clip_ratio/high_max": 0.04757834831252694, "clip_ratio/region_mean": 0.1561834909953177, "reward_total_mean": 0.4184347987174988, "reward_meter_mean": 0.5651530027389526, "reward_meter_std": 0.41453009843826294, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.953125, "reward_lexical_plausibility_std": 0.13258251547813416, "reward_repeat_penalty_mean": 0.7601220607757568, "reward_repeat_penalty_std": 0.028629617765545845, "reward_repeat_floor_mean": 0.9842380285263062, "reward_repeat_floor_std": 0.0021551367826759815, "reward_near_duplicate_penalty_mean": 0.9892076253890991, "reward_near_duplicate_penalty_std": 0.03052542544901371, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9886877536773682, "reward_distinct_2_std": 0.031995780766010284, "reward_judge_quality_mean": 0.8762500286102295, "reward_judge_quality_std": 0.1728696972131729, "reward_total_composite_mean": 0.4184347987174988, "reward_total_composite_std": 0.3332328498363495} {"timestamp_utc": "2026-04-12T18:54:58Z", "mode": "train", "global_step": 794, "epoch": 0.04178727435398137, "loss": -0.0253, "grad_norm": 23.46124267578125, "learning_rate": 7.596969696969697e-06, "num_tokens": 1430999.0, "completions/mean_length": 19.875, "completions/min_length": 17.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.875, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.9850809574127197, "rewards/meter/std": 0.005409306846559048, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.699721097946167, "rewards/repeat_penalty/std": 0.09741540998220444, "rewards/repeat_floor/mean": 0.9753839373588562, "rewards/repeat_floor/std": 0.018439989537000656, "rewards/near_duplicate_penalty/mean": 0.9463824033737183, "rewards/near_duplicate_penalty/std": 0.09973803162574768, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.3930644989013672, "rewards/total_composite/std": 0.24613673985004425, "reward": 0.3930644989013672, "reward_std": 0.24613673985004425, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1470496654510498, "sampling/sampling_logp_difference/max": 1.793107509613037, "sampling/importance_sampling_ratio/min": 0.1664421409368515, "sampling/importance_sampling_ratio/mean": 0.9975727796554565, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.788835734128952, "clip_ratio/low_mean": 0.0747162033803761, "clip_ratio/low_min": 0.0747162033803761, "clip_ratio/high_mean": 0.05014822259545326, "clip_ratio/high_max": 0.05014822259545326, "clip_ratio/region_mean": 0.12486442597582936, "reward_total_mean": 0.3930644989013672, "reward_meter_mean": 0.9850809574127197, "reward_meter_std": 0.005409306846559048, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.699721097946167, "reward_repeat_penalty_std": 0.09741540998220444, "reward_repeat_floor_mean": 0.9753839373588562, "reward_repeat_floor_std": 0.018439989537000656, "reward_near_duplicate_penalty_mean": 0.9463824033737183, "reward_near_duplicate_penalty_std": 0.09973803162574768, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.3930644989013672, "reward_total_composite_std": 0.24613673985004425} {"timestamp_utc": "2026-04-12T18:55:05Z", "mode": "train", "global_step": 795, "epoch": 0.041839903162991424, "loss": -0.013, "grad_norm": 18.708932876586914, "learning_rate": 7.593939393939395e-06, "num_tokens": 1432507.0, "completions/mean_length": 24.5, "completions/min_length": 18.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.5, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.5848500728607178, "rewards/meter/std": 0.29298242926597595, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9312499761581421, "rewards/judge_quality/std": 0.015526460483670235, "rewards/repeat_penalty/mean": 0.8162202835083008, "rewards/repeat_penalty/std": 0.10509595274925232, "rewards/repeat_floor/mean": 0.9873518943786621, "rewards/repeat_floor/std": 0.006554624531418085, "rewards/near_duplicate_penalty/mean": 0.988213062286377, "rewards/near_duplicate_penalty/std": 0.021667474880814552, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9832775592803955, "rewards/distinct_2/std": 0.0472981221973896, "rewards/total_composite/mean": 0.46388813853263855, "rewards/total_composite/std": 0.22653377056121826, "reward": 0.46388813853263855, "reward_std": 0.22653377056121826, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15578028559684753, "sampling/sampling_logp_difference/max": 2.1698503494262695, "sampling/importance_sampling_ratio/min": 0.11419470608234406, "sampling/importance_sampling_ratio/mean": 1.0178667306900024, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8114653304219246, "clip_ratio/low_mean": 0.06194380950182676, "clip_ratio/low_min": 0.06194380950182676, "clip_ratio/high_mean": 0.05900621181353927, "clip_ratio/high_max": 0.05900621181353927, "clip_ratio/region_mean": 0.12095002131536603, "reward_total_mean": 0.46388813853263855, "reward_meter_mean": 0.5848500728607178, "reward_meter_std": 0.29298242926597595, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8162202835083008, "reward_repeat_penalty_std": 0.10509595274925232, "reward_repeat_floor_mean": 0.9873518943786621, "reward_repeat_floor_std": 0.006554624531418085, "reward_near_duplicate_penalty_mean": 0.988213062286377, "reward_near_duplicate_penalty_std": 0.021667474880814552, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9832775592803955, "reward_distinct_2_std": 0.0472981221973896, "reward_judge_quality_mean": 0.9312499761581421, "reward_judge_quality_std": 0.015526460483670235, "reward_total_composite_mean": 0.46388813853263855, "reward_total_composite_std": 0.22653377056121826} {"timestamp_utc": "2026-04-12T18:55:14Z", "mode": "train", "global_step": 796, "epoch": 0.041892531972001476, "loss": 0.0494, "grad_norm": 16.400909423828125, "learning_rate": 7.590909090909091e-06, "num_tokens": 1434292.0, "completions/mean_length": 36.125, "completions/min_length": 33.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.125, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.7702640891075134, "rewards/meter/std": 0.3129320740699768, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.9930901527404785, "rewards/repeat_penalty/std": 0.008361689746379852, "rewards/repeat_floor/mean": 0.9989635348320007, "rewards/repeat_floor/std": 0.0012542513431981206, "rewards/near_duplicate_penalty/mean": 0.9930901527404785, "rewards/near_duplicate_penalty/std": 0.008361689746379852, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27638447284698486, "rewards/total_composite/std": 0.1023259311914444, "reward": 0.27638447284698486, "reward_std": 0.102325938642025, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2024848759174347, "sampling/sampling_logp_difference/max": 2.381497621536255, "sampling/importance_sampling_ratio/min": 0.0924120768904686, "sampling/importance_sampling_ratio/mean": 0.9887649416923523, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2036852315068245, "clip_ratio/low_mean": 0.04448198340833187, "clip_ratio/low_min": 0.04448198340833187, "clip_ratio/high_mean": 0.1774127334356308, "clip_ratio/high_max": 0.1774127334356308, "clip_ratio/region_mean": 0.22189471684396267, "reward_total_mean": 0.27638447284698486, "reward_meter_mean": 0.7702640891075134, "reward_meter_std": 0.3129320740699768, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9930901527404785, "reward_repeat_penalty_std": 0.008361689746379852, "reward_repeat_floor_mean": 0.9989635348320007, "reward_repeat_floor_std": 0.0012542513431981206, "reward_near_duplicate_penalty_mean": 0.9930901527404785, "reward_near_duplicate_penalty_std": 0.008361689746379852, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.27638447284698486, "reward_total_composite_std": 0.1023259311914444} {"timestamp_utc": "2026-04-12T18:55:23Z", "mode": "train", "global_step": 797, "epoch": 0.04194516078101153, "loss": -0.1661, "grad_norm": 18.46236228942871, "learning_rate": 7.587878787878788e-06, "num_tokens": 1436009.0, "completions/mean_length": 42.625, "completions/min_length": 19.0, "completions/max_length": 84.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.625, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.6396142840385437, "rewards/meter/std": 0.24471114575862885, "rewards/count_adherence/mean": 0.3958333432674408, "rewards/count_adherence/std": 0.19795581698417664, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8187500238418579, "rewards/count_floor/std": 0.05938674136996269, "rewards/lexical_plausibility/mean": 0.9418402910232544, "rewards/lexical_plausibility/std": 0.12996836006641388, "rewards/judge_quality/mean": 0.3087500035762787, "rewards/judge_quality/std": 0.2728912830352783, "rewards/repeat_penalty/mean": 0.8997710943222046, "rewards/repeat_penalty/std": 0.12221883237361908, "rewards/repeat_floor/mean": 0.9906902313232422, "rewards/repeat_floor/std": 0.009867928922176361, "rewards/near_duplicate_penalty/mean": 0.9690076112747192, "rewards/near_duplicate_penalty/std": 0.03308709338307381, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.18128123879432678, "rewards/total_composite/std": 0.19653424620628357, "reward": 0.18128123879432678, "reward_std": 0.19653426110744476, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17326223850250244, "sampling/sampling_logp_difference/max": 1.9223346710205078, "sampling/importance_sampling_ratio/min": 0.14626507461071014, "sampling/importance_sampling_ratio/mean": 1.0231902599334717, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7868901789188385, "clip_ratio/low_mean": 0.13473488576710224, "clip_ratio/low_min": 0.13473488576710224, "clip_ratio/high_mean": 0.04135572165250778, "clip_ratio/high_max": 0.04135572165250778, "clip_ratio/region_mean": 0.17609060741961002, "reward_total_mean": 0.18128123879432678, "reward_meter_mean": 0.6396142840385437, "reward_meter_std": 0.24471114575862885, "reward_count_adherence_mean": 0.3958333432674408, "reward_count_adherence_std": 0.19795581698417664, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8187500238418579, "reward_count_floor_std": 0.05938674136996269, "reward_lexical_plausibility_mean": 0.9418402910232544, "reward_lexical_plausibility_std": 0.12996836006641388, "reward_repeat_penalty_mean": 0.8997710943222046, "reward_repeat_penalty_std": 0.12221883237361908, "reward_repeat_floor_mean": 0.9906902313232422, "reward_repeat_floor_std": 0.009867928922176361, "reward_near_duplicate_penalty_mean": 0.9690076112747192, "reward_near_duplicate_penalty_std": 0.03308709338307381, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.3087500035762787, "reward_judge_quality_std": 0.2728912830352783, "reward_total_composite_mean": 0.18128123879432678, "reward_total_composite_std": 0.19653424620628357} {"timestamp_utc": "2026-04-12T18:55:31Z", "mode": "train", "global_step": 798, "epoch": 0.04199778959002158, "loss": -0.0038, "grad_norm": 20.410425186157227, "learning_rate": 7.584848484848486e-06, "num_tokens": 1437513.0, "completions/mean_length": 25.0, "completions/min_length": 21.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.0, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.7125061750411987, "rewards/meter/std": 0.40914562344551086, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7437499761581421, "rewards/judge_quality/std": 0.2432481348514557, "rewards/repeat_penalty/mean": 0.749517560005188, "rewards/repeat_penalty/std": 0.001364483148790896, "rewards/repeat_floor/mean": 0.9849035143852234, "rewards/repeat_floor/std": 0.00027290082653053105, "rewards/near_duplicate_penalty/mean": 0.999356746673584, "rewards/near_duplicate_penalty/std": 0.0018193108262494206, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4167323112487793, "rewards/total_composite/std": 0.2952266037464142, "reward": 0.4167323112487793, "reward_std": 0.2952266037464142, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15916723012924194, "sampling/sampling_logp_difference/max": 1.1265678405761719, "sampling/importance_sampling_ratio/min": 0.3241438567638397, "sampling/importance_sampling_ratio/mean": 1.0218888521194458, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0149695873260498, "clip_ratio/low_mean": 0.0910462555475533, "clip_ratio/low_min": 0.0910462555475533, "clip_ratio/high_mean": 0.03993055643513799, "clip_ratio/high_max": 0.03993055643513799, "clip_ratio/region_mean": 0.1309768119826913, "reward_total_mean": 0.4167323112487793, "reward_meter_mean": 0.7125061750411987, "reward_meter_std": 0.40914562344551086, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.749517560005188, "reward_repeat_penalty_std": 0.001364483148790896, "reward_repeat_floor_mean": 0.9849035143852234, "reward_repeat_floor_std": 0.00027290082653053105, "reward_near_duplicate_penalty_mean": 0.999356746673584, "reward_near_duplicate_penalty_std": 0.0018193108262494206, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7437499761581421, "reward_judge_quality_std": 0.2432481348514557, "reward_total_composite_mean": 0.4167323112487793, "reward_total_composite_std": 0.2952266037464142} {"timestamp_utc": "2026-04-12T18:55:38Z", "mode": "train", "global_step": 799, "epoch": 0.04205041839903163, "loss": 0.109, "grad_norm": 17.887121200561523, "learning_rate": 7.581818181818183e-06, "num_tokens": 1438926.0, "completions/mean_length": 20.625, "completions/min_length": 17.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.625, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.8786775469779968, "rewards/meter/std": 0.27019941806793213, "rewards/count_adherence/mean": 0.3333333432674408, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.800000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41750001907348633, "rewards/judge_quality/std": 0.3236731290817261, "rewards/repeat_penalty/mean": 0.7480332255363464, "rewards/repeat_penalty/std": 0.005562899634242058, "rewards/repeat_floor/mean": 0.9846066236495972, "rewards/repeat_floor/std": 0.0011125925229862332, "rewards/near_duplicate_penalty/mean": 0.9973776340484619, "rewards/near_duplicate_penalty/std": 0.007417213171720505, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.25092214345932007, "rewards/total_composite/std": 0.19736409187316895, "reward": 0.25092214345932007, "reward_std": 0.19736410677433014, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14094756543636322, "sampling/sampling_logp_difference/max": 1.2471961975097656, "sampling/importance_sampling_ratio/min": 0.2873092293739319, "sampling/importance_sampling_ratio/mean": 1.0189201831817627, "sampling/importance_sampling_ratio/max": 1.57198166847229, "entropy": 1.0235275998711586, "clip_ratio/low_mean": 0.10895504243671894, "clip_ratio/low_min": 0.10895504243671894, "clip_ratio/high_mean": 0.07022058963775635, "clip_ratio/high_max": 0.07022058963775635, "clip_ratio/region_mean": 0.1791756320744753, "reward_total_mean": 0.25092214345932007, "reward_meter_mean": 0.8786775469779968, "reward_meter_std": 0.27019941806793213, "reward_count_adherence_mean": 0.3333333432674408, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.800000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7480332255363464, "reward_repeat_penalty_std": 0.005562899634242058, "reward_repeat_floor_mean": 0.9846066236495972, "reward_repeat_floor_std": 0.0011125925229862332, "reward_near_duplicate_penalty_mean": 0.9973776340484619, "reward_near_duplicate_penalty_std": 0.007417213171720505, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41750001907348633, "reward_judge_quality_std": 0.3236731290817261, "reward_total_composite_mean": 0.25092214345932007, "reward_total_composite_std": 0.19736409187316895} {"timestamp_utc": "2026-04-12T18:55:47Z", "mode": "train", "global_step": 800, "epoch": 0.04210304720804168, "loss": 0.0704, "grad_norm": 24.220542907714844, "learning_rate": 7.57878787878788e-06, "num_tokens": 1440451.0, "completions/mean_length": 23.625, "completions/min_length": 20.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.625, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.9771468639373779, "rewards/meter/std": 0.034696560353040695, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.7439630627632141, "rewards/repeat_penalty/std": 0.011203979142010212, "rewards/repeat_floor/mean": 0.9837926626205444, "rewards/repeat_floor/std": 0.0022408016957342625, "rewards/near_duplicate_penalty/mean": 0.9919507503509521, "rewards/near_duplicate_penalty/std": 0.014938644133508205, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.29844123125076294, "rewards/total_composite/std": 0.0860796570777893, "reward": 0.29844123125076294, "reward_std": 0.0860796645283699, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16077981889247894, "sampling/sampling_logp_difference/max": 1.5124053955078125, "sampling/importance_sampling_ratio/min": 0.22037924826145172, "sampling/importance_sampling_ratio/mean": 1.0170494318008423, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3279575258493423, "clip_ratio/low_mean": 0.07468993868678808, "clip_ratio/low_min": 0.07468993868678808, "clip_ratio/high_mean": 0.046363635919988155, "clip_ratio/high_max": 0.046363635919988155, "clip_ratio/region_mean": 0.12105357460677624, "reward_total_mean": 0.29844123125076294, "reward_meter_mean": 0.9771468639373779, "reward_meter_std": 0.034696560353040695, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.7439630627632141, "reward_repeat_penalty_std": 0.011203979142010212, "reward_repeat_floor_mean": 0.9837926626205444, "reward_repeat_floor_std": 0.0022408016957342625, "reward_near_duplicate_penalty_mean": 0.9919507503509521, "reward_near_duplicate_penalty_std": 0.014938644133508205, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.29844123125076294, "reward_total_composite_std": 0.0860796570777893} {"timestamp_utc": "2026-04-12T18:57:37Z", "mode": "eval", "global_step": 800, "epoch": 0.04210304720804168, "eval_loss": NaN, "eval_runtime": 110.6364, "eval_samples_per_second": 0.94, "eval_steps_per_second": 0.118, "eval_num_tokens": 1440451.0, "eval_completions/mean_length": 100.07692307692308, "eval_completions/min_length": 18.46153846153846, "eval_completions/max_length": 280.0769230769231, "eval_completions/clipped_ratio": 0.019230769230769232, "eval_completions/mean_terminated_length": 92.75137446476863, "eval_completions/min_terminated_length": 18.46153846153846, "eval_completions/max_terminated_length": 252.0, "eval_rewards/meter/mean": 0.6896416499064519, "eval_rewards/meter/std": 0.3716986041802626, "eval_rewards/count_adherence/mean": 0.6200550198554993, "eval_rewards/count_adherence/std": 0.30198927452931035, "eval_rewards/arabic_clean/mean": 0.9423076923076923, "eval_rewards/arabic_clean/std": 0.12140072079805228, "eval_rewards/hard_gate/mean": 0.9903846153846154, "eval_rewards/hard_gate/std": 0.027196414195574246, "eval_rewards/arabic_floor/mean": 1.0, "eval_rewards/arabic_floor/std": 0.0, "eval_rewards/count_floor/mean": 0.886016492660229, "eval_rewards/count_floor/std": 0.09059677788844475, "eval_rewards/lexical_plausibility/mean": 0.989690349652217, "eval_rewards/lexical_plausibility/std": 0.02916010025028999, "eval_rewards/judge_quality/mean": 0.3920192260008592, "eval_rewards/judge_quality/std": 0.19813704719910255, "eval_rewards/repeat_penalty/mean": 0.6619293185380789, "eval_rewards/repeat_penalty/std": 0.25210404797242236, "eval_rewards/repeat_floor/mean": 0.9658236366051894, "eval_rewards/repeat_floor/std": 0.031848148406984716, "eval_rewards/near_duplicate_penalty/mean": 0.9338104174687312, "eval_rewards/near_duplicate_penalty/std": 0.07629959844052792, "eval_rewards/opening_diversity/mean": 0.883915364742279, "eval_rewards/opening_diversity/std": 0.13033672307546323, "eval_rewards/distinct_2/mean": 0.8079682359328637, "eval_rewards/distinct_2/std": 0.2624016593282039, "eval_rewards/total_composite/mean": 0.2375198000898728, "eval_rewards/total_composite/std": 0.19253497742689574, "eval_reward": 0.2375198000898728, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.07209557724686769, "eval_sampling/sampling_logp_difference/max": 1.008132164294903, "eval_sampling/importance_sampling_ratio/min": 0.37383420077654034, "eval_sampling/importance_sampling_ratio/mean": 1.0177982128583467, "eval_sampling/importance_sampling_ratio/max": 1.4980343763644879, "eval_entropy": 0.8217866466595576, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.2375198000898728, "eval_reward_meter_mean": 0.6896416499064519, "eval_reward_meter_std": 0.3716986041802626, "eval_reward_count_adherence_mean": 0.6200550198554993, "eval_reward_count_adherence_std": 0.30198927452931035, "eval_reward_arabic_clean_mean": 0.9423076923076923, "eval_reward_arabic_clean_std": 0.12140072079805228, "eval_reward_hard_gate_mean": 0.9903846153846154, "eval_reward_hard_gate_std": 0.027196414195574246, "eval_reward_arabic_floor_mean": 1.0, "eval_reward_arabic_floor_std": 0.0, "eval_reward_count_floor_mean": 0.886016492660229, "eval_reward_count_floor_std": 0.09059677788844475, "eval_reward_lexical_plausibility_mean": 0.989690349652217, "eval_reward_lexical_plausibility_std": 0.02916010025028999, "eval_reward_repeat_penalty_mean": 0.6619293185380789, "eval_reward_repeat_penalty_std": 0.25210404797242236, "eval_reward_repeat_floor_mean": 0.9658236366051894, "eval_reward_repeat_floor_std": 0.031848148406984716, "eval_reward_near_duplicate_penalty_mean": 0.9338104174687312, "eval_reward_near_duplicate_penalty_std": 0.07629959844052792, "eval_reward_opening_diversity_mean": 0.883915364742279, "eval_reward_opening_diversity_std": 0.13033672307546323, "eval_reward_distinct_2_mean": 0.8079682359328637, "eval_reward_distinct_2_std": 0.2624016593282039, "eval_reward_judge_quality_mean": 0.3920192260008592, "eval_reward_judge_quality_std": 0.19813704719910255, "eval_reward_total_composite_mean": 0.2375198000898728, "eval_reward_total_composite_std": 0.19253497742689574} {"timestamp_utc": "2026-04-12T18:57:50Z", "mode": "train", "global_step": 801, "epoch": 0.04215567601705173, "loss": 0.0564, "grad_norm": 11.878886222839355, "learning_rate": 7.5757575757575764e-06, "num_tokens": 1442159.0, "completions/mean_length": 36.5, "completions/min_length": 22.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.5, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.9927767515182495, "rewards/meter/std": 0.005641669034957886, "rewards/count_adherence/mean": 0.34375, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8031250238418579, "rewards/count_floor/std": 0.038816213607788086, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.38374999165534973, "rewards/judge_quality/std": 0.24076886475086212, "rewards/repeat_penalty/mean": 0.7536890506744385, "rewards/repeat_penalty/std": 0.16974732279777527, "rewards/repeat_floor/mean": 0.9775967597961426, "rewards/repeat_floor/std": 0.021494954824447632, "rewards/near_duplicate_penalty/mean": 0.9495554566383362, "rewards/near_duplicate_penalty/std": 0.07761404663324356, "rewards/opening_diversity/mean": 0.831250011920929, "rewards/opening_diversity/std": 0.11630471050739288, "rewards/distinct_2/mean": 0.9476495981216431, "rewards/distinct_2/std": 0.09696105867624283, "rewards/total_composite/mean": 0.29813772439956665, "rewards/total_composite/std": 0.18174539506435394, "reward": 0.29813772439956665, "reward_std": 0.18174538016319275, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1707857996225357, "sampling/sampling_logp_difference/max": 1.5292596817016602, "sampling/importance_sampling_ratio/min": 0.21669605374336243, "sampling/importance_sampling_ratio/mean": 1.0212535858154297, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1316742971539497, "clip_ratio/low_mean": 0.15517114102840424, "clip_ratio/low_min": 0.15517114102840424, "clip_ratio/high_mean": 0.052759742364287376, "clip_ratio/high_max": 0.052759742364287376, "clip_ratio/region_mean": 0.2079308833926916, "reward_total_mean": 0.29813772439956665, "reward_meter_mean": 0.9927767515182495, "reward_meter_std": 0.005641669034957886, "reward_count_adherence_mean": 0.34375, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8031250238418579, "reward_count_floor_std": 0.038816213607788086, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7536890506744385, "reward_repeat_penalty_std": 0.16974732279777527, "reward_repeat_floor_mean": 0.9775967597961426, "reward_repeat_floor_std": 0.021494954824447632, "reward_near_duplicate_penalty_mean": 0.9495554566383362, "reward_near_duplicate_penalty_std": 0.07761404663324356, "reward_opening_diversity_mean": 0.831250011920929, "reward_opening_diversity_std": 0.11630471050739288, "reward_distinct_2_mean": 0.9476495981216431, "reward_distinct_2_std": 0.09696105867624283, "reward_judge_quality_mean": 0.38374999165534973, "reward_judge_quality_std": 0.24076886475086212, "reward_total_composite_mean": 0.29813772439956665, "reward_total_composite_std": 0.18174539506435394} {"timestamp_utc": "2026-04-12T18:57:58Z", "mode": "train", "global_step": 802, "epoch": 0.042208304826061784, "loss": -0.0634, "grad_norm": 23.30038070678711, "learning_rate": 7.572727272727274e-06, "num_tokens": 1443757.0, "completions/mean_length": 20.75, "completions/min_length": 11.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.75, "completions/min_terminated_length": 11.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.3598850965499878, "rewards/meter/std": 0.4232175648212433, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.75, "rewards/hard_gate/std": 0.4629100561141968, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.13887302577495575, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.7764204740524292, "rewards/repeat_penalty/std": 0.14579880237579346, "rewards/repeat_floor/mean": 0.9815341234207153, "rewards/repeat_floor/std": 0.014780850149691105, "rewards/near_duplicate_penalty/mean": 0.9518939256668091, "rewards/near_duplicate_penalty/std": 0.06941288709640503, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.10499314963817596, "rewards/total_composite/std": 0.12517425417900085, "reward": 0.10499314963817596, "reward_std": 0.12517425417900085, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16747726500034332, "sampling/sampling_logp_difference/max": 1.394655704498291, "sampling/importance_sampling_ratio/min": 0.24791836738586426, "sampling/importance_sampling_ratio/mean": 1.0148138999938965, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0280520394444466, "clip_ratio/low_mean": 0.0721969697624445, "clip_ratio/low_min": 0.0721969697624445, "clip_ratio/high_mean": 0.06514550279825926, "clip_ratio/high_max": 0.06514550279825926, "clip_ratio/region_mean": 0.13734247256070375, "reward_total_mean": 0.10499314963817596, "reward_meter_mean": 0.3598850965499878, "reward_meter_std": 0.4232175648212433, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.75, "reward_hard_gate_std": 0.4629100561141968, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.13887302577495575, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7764204740524292, "reward_repeat_penalty_std": 0.14579880237579346, "reward_repeat_floor_mean": 0.9815341234207153, "reward_repeat_floor_std": 0.014780850149691105, "reward_near_duplicate_penalty_mean": 0.9518939256668091, "reward_near_duplicate_penalty_std": 0.06941288709640503, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.10499314963817596, "reward_total_composite_std": 0.12517425417900085} {"timestamp_utc": "2026-04-12T18:58:05Z", "mode": "train", "global_step": 803, "epoch": 0.042260933635071836, "loss": 0.1123, "grad_norm": 23.425832748413086, "learning_rate": 7.56969696969697e-06, "num_tokens": 1445090.0, "completions/mean_length": 21.625, "completions/min_length": 18.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.625, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.8531711101531982, "rewards/meter/std": 0.342794805765152, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7975000143051147, "rewards/judge_quality/std": 0.2471408098936081, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6548610329627991, "rewards/total_composite/std": 0.34972184896469116, "reward": 0.6548610329627991, "reward_std": 0.3497218191623688, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12653936445713043, "sampling/sampling_logp_difference/max": 0.9467382431030273, "sampling/importance_sampling_ratio/min": 0.3880045413970947, "sampling/importance_sampling_ratio/mean": 1.0381673574447632, "sampling/importance_sampling_ratio/max": 1.8500672578811646, "entropy": 1.0275596976280212, "clip_ratio/low_mean": 0.04130434803664684, "clip_ratio/low_min": 0.04130434803664684, "clip_ratio/high_mean": 0.05765319149941206, "clip_ratio/high_max": 0.05765319149941206, "clip_ratio/region_mean": 0.0989575395360589, "reward_total_mean": 0.6548610329627991, "reward_meter_mean": 0.8531711101531982, "reward_meter_std": 0.342794805765152, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7975000143051147, "reward_judge_quality_std": 0.2471408098936081, "reward_total_composite_mean": 0.6548610329627991, "reward_total_composite_std": 0.34972184896469116} {"timestamp_utc": "2026-04-12T18:58:18Z", "mode": "train", "global_step": 804, "epoch": 0.04231356244408189, "loss": -0.014, "grad_norm": 4.55588436126709, "learning_rate": 7.566666666666667e-06, "num_tokens": 1446354.0, "completions/mean_length": 79.0, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 17.142858505249023, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 19.0, "rewards/meter/mean": 0.6146837472915649, "rewards/meter/std": 0.45543384552001953, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.951554000377655, "rewards/lexical_plausibility/std": 0.13702602684497833, "rewards/judge_quality/mean": 0.5262500047683716, "rewards/judge_quality/std": 0.35379326343536377, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32480186223983765, "rewards/total_composite/std": 0.3363499343395233, "reward": 0.32480186223983765, "reward_std": 0.3363499343395233, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17231829464435577, "sampling/sampling_logp_difference/max": 0.9110507965087891, "sampling/importance_sampling_ratio/min": 0.4021014869213104, "sampling/importance_sampling_ratio/mean": 1.05978524684906, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9506350383162498, "clip_ratio/low_mean": 0.08088235463947058, "clip_ratio/low_min": 0.08088235463947058, "clip_ratio/high_mean": 0.07962461328133941, "clip_ratio/high_max": 0.07962461328133941, "clip_ratio/region_mean": 0.16050696792080998, "reward_total_mean": 0.32480186223983765, "reward_meter_mean": 0.6146837472915649, "reward_meter_std": 0.45543384552001953, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.951554000377655, "reward_lexical_plausibility_std": 0.13702602684497833, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5262500047683716, "reward_judge_quality_std": 0.35379326343536377, "reward_total_composite_mean": 0.32480186223983765, "reward_total_composite_std": 0.3363499343395233} {"timestamp_utc": "2026-04-12T18:58:26Z", "mode": "train", "global_step": 805, "epoch": 0.04236619125309194, "loss": 0.003, "grad_norm": 19.495641708374023, "learning_rate": 7.563636363636364e-06, "num_tokens": 1447637.0, "completions/mean_length": 19.375, "completions/min_length": 15.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.375, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.9700566530227661, "rewards/meter/std": 0.04708840325474739, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5387500524520874, "rewards/judge_quality/std": 0.3358757197856903, "rewards/repeat_penalty/mean": 0.7480332255363464, "rewards/repeat_penalty/std": 0.005562899634242058, "rewards/repeat_floor/mean": 0.9846066236495972, "rewards/repeat_floor/std": 0.0011125925229862332, "rewards/near_duplicate_penalty/mean": 0.9973776340484619, "rewards/near_duplicate_penalty/std": 0.007417213171720505, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4391022324562073, "rewards/total_composite/std": 0.2897334098815918, "reward": 0.4391022324562073, "reward_std": 0.2897334098815918, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11404381692409515, "sampling/sampling_logp_difference/max": 0.9312906265258789, "sampling/importance_sampling_ratio/min": 0.3940448462963104, "sampling/importance_sampling_ratio/mean": 1.0381765365600586, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7706129997968674, "clip_ratio/low_mean": 0.09775410033762455, "clip_ratio/low_min": 0.09775410033762455, "clip_ratio/high_mean": 0.05393518693745136, "clip_ratio/high_max": 0.05393518693745136, "clip_ratio/region_mean": 0.1516892872750759, "reward_total_mean": 0.4391022324562073, "reward_meter_mean": 0.9700566530227661, "reward_meter_std": 0.04708840325474739, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7480332255363464, "reward_repeat_penalty_std": 0.005562899634242058, "reward_repeat_floor_mean": 0.9846066236495972, "reward_repeat_floor_std": 0.0011125925229862332, "reward_near_duplicate_penalty_mean": 0.9973776340484619, "reward_near_duplicate_penalty_std": 0.007417213171720505, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5387500524520874, "reward_judge_quality_std": 0.3358757197856903, "reward_total_composite_mean": 0.4391022324562073, "reward_total_composite_std": 0.2897334098815918} {"timestamp_utc": "2026-04-12T18:58:34Z", "mode": "train", "global_step": 806, "epoch": 0.04241882006210199, "loss": -0.0149, "grad_norm": 18.91968536376953, "learning_rate": 7.560606060606062e-06, "num_tokens": 1449163.0, "completions/mean_length": 26.75, "completions/min_length": 23.0, "completions/max_length": 35.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.75, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.545417070388794, "rewards/meter/std": 0.29303255677223206, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9387500286102295, "rewards/judge_quality/std": 0.015526460483670235, "rewards/repeat_penalty/mean": 0.9581937789916992, "rewards/repeat_penalty/std": 0.025177184492349625, "rewards/repeat_floor/mean": 0.9937291145324707, "rewards/repeat_floor/std": 0.003776577301323414, "rewards/near_duplicate_penalty/mean": 0.9581937789916992, "rewards/near_duplicate_penalty/std": 0.025177184492349625, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5101175308227539, "rewards/total_composite/std": 0.27494683861732483, "reward": 0.5101175308227539, "reward_std": 0.27494683861732483, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12949466705322266, "sampling/sampling_logp_difference/max": 1.5344762802124023, "sampling/importance_sampling_ratio/min": 0.21556855738162994, "sampling/importance_sampling_ratio/mean": 0.985395610332489, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5876073054969311, "clip_ratio/low_mean": 0.04502249648794532, "clip_ratio/low_min": 0.04502249648794532, "clip_ratio/high_mean": 0.04750000033527613, "clip_ratio/high_max": 0.04750000033527613, "clip_ratio/region_mean": 0.09252249682322145, "reward_total_mean": 0.5101175308227539, "reward_meter_mean": 0.545417070388794, "reward_meter_std": 0.29303255677223206, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9581937789916992, "reward_repeat_penalty_std": 0.025177184492349625, "reward_repeat_floor_mean": 0.9937291145324707, "reward_repeat_floor_std": 0.003776577301323414, "reward_near_duplicate_penalty_mean": 0.9581937789916992, "reward_near_duplicate_penalty_std": 0.025177184492349625, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9387500286102295, "reward_judge_quality_std": 0.015526460483670235, "reward_total_composite_mean": 0.5101175308227539, "reward_total_composite_std": 0.27494683861732483} {"timestamp_utc": "2026-04-12T18:58:43Z", "mode": "train", "global_step": 807, "epoch": 0.042471448871112046, "loss": 0.3515, "grad_norm": 19.447965621948242, "learning_rate": 7.557575757575758e-06, "num_tokens": 1451024.0, "completions/mean_length": 34.625, "completions/min_length": 17.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.625, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.5784199833869934, "rewards/meter/std": 0.4045107960700989, "rewards/count_adherence/mean": 0.4375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.831250011920929, "rewards/count_floor/std": 0.05303302779793739, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6762499809265137, "rewards/judge_quality/std": 0.2707628309726715, "rewards/repeat_penalty/mean": 0.877953290939331, "rewards/repeat_penalty/std": 0.14206625521183014, "rewards/repeat_floor/mean": 0.9894434809684753, "rewards/repeat_floor/std": 0.012300090864300728, "rewards/near_duplicate_penalty/mean": 0.9671230316162109, "rewards/near_duplicate_penalty/std": 0.051729150116443634, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3764670491218567, "rewards/total_composite/std": 0.3131535053253174, "reward": 0.3764670491218567, "reward_std": 0.31315353512763977, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17660307884216309, "sampling/sampling_logp_difference/max": 1.5156049728393555, "sampling/importance_sampling_ratio/min": 0.21967525780200958, "sampling/importance_sampling_ratio/mean": 1.0280940532684326, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.951075442135334, "clip_ratio/low_mean": 0.10332360491156578, "clip_ratio/low_min": 0.10332360491156578, "clip_ratio/high_mean": 0.06471755588427186, "clip_ratio/high_max": 0.06471755588427186, "clip_ratio/region_mean": 0.16804116079583764, "reward_total_mean": 0.3764670491218567, "reward_meter_mean": 0.5784199833869934, "reward_meter_std": 0.4045107960700989, "reward_count_adherence_mean": 0.4375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.831250011920929, "reward_count_floor_std": 0.05303302779793739, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.877953290939331, "reward_repeat_penalty_std": 0.14206625521183014, "reward_repeat_floor_mean": 0.9894434809684753, "reward_repeat_floor_std": 0.012300090864300728, "reward_near_duplicate_penalty_mean": 0.9671230316162109, "reward_near_duplicate_penalty_std": 0.051729150116443634, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6762499809265137, "reward_judge_quality_std": 0.2707628309726715, "reward_total_composite_mean": 0.3764670491218567, "reward_total_composite_std": 0.3131535053253174} {"timestamp_utc": "2026-04-12T18:58:51Z", "mode": "train", "global_step": 808, "epoch": 0.0425240776801221, "loss": 0.0823, "grad_norm": 19.021160125732422, "learning_rate": 7.5545454545454555e-06, "num_tokens": 1452329.0, "completions/mean_length": 22.125, "completions/min_length": 16.0, "completions/max_length": 28.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.125, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.4860062897205353, "rewards/meter/std": 0.4817962050437927, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8350000381469727, "rewards/judge_quality/std": 0.27717968821525574, "rewards/repeat_penalty/mean": 0.6842336654663086, "rewards/repeat_penalty/std": 0.09754367172718048, "rewards/repeat_floor/mean": 0.9721978902816772, "rewards/repeat_floor/std": 0.01882293075323105, "rewards/near_duplicate_penalty/mean": 0.9228942394256592, "rewards/near_duplicate_penalty/std": 0.11104470491409302, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9862637519836426, "rewards/distinct_2/std": 0.0388520210981369, "rewards/total_composite/mean": 0.42997312545776367, "rewards/total_composite/std": 0.44086191058158875, "reward": 0.42997312545776367, "reward_std": 0.44086188077926636, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17718452215194702, "sampling/sampling_logp_difference/max": 2.492250442504883, "sampling/importance_sampling_ratio/min": 0.08272358775138855, "sampling/importance_sampling_ratio/mean": 1.0032590627670288, "sampling/importance_sampling_ratio/max": 1.846886396408081, "entropy": 1.052128829061985, "clip_ratio/low_mean": 0.07777014747262001, "clip_ratio/low_min": 0.07777014747262001, "clip_ratio/high_mean": 0.07617374509572983, "clip_ratio/high_max": 0.07617374509572983, "clip_ratio/region_mean": 0.15394389256834984, "reward_total_mean": 0.42997312545776367, "reward_meter_mean": 0.4860062897205353, "reward_meter_std": 0.4817962050437927, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6842336654663086, "reward_repeat_penalty_std": 0.09754367172718048, "reward_repeat_floor_mean": 0.9721978902816772, "reward_repeat_floor_std": 0.01882293075323105, "reward_near_duplicate_penalty_mean": 0.9228942394256592, "reward_near_duplicate_penalty_std": 0.11104470491409302, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9862637519836426, "reward_distinct_2_std": 0.0388520210981369, "reward_judge_quality_mean": 0.8350000381469727, "reward_judge_quality_std": 0.27717968821525574, "reward_total_composite_mean": 0.42997312545776367, "reward_total_composite_std": 0.44086191058158875} {"timestamp_utc": "2026-04-12T18:58:59Z", "mode": "train", "global_step": 809, "epoch": 0.04257670648913215, "loss": 0.0949, "grad_norm": 25.848854064941406, "learning_rate": 7.551515151515152e-06, "num_tokens": 1453771.0, "completions/mean_length": 20.25, "completions/min_length": 16.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.25, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.6410830616950989, "rewards/meter/std": 0.4693940281867981, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7562500238418579, "rewards/judge_quality/std": 0.31717222929000854, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.40862423181533813, "rewards/total_composite/std": 0.3837718963623047, "reward": 0.40862423181533813, "reward_std": 0.3837718665599823, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17167606949806213, "sampling/sampling_logp_difference/max": 1.4852440357208252, "sampling/importance_sampling_ratio/min": 0.22644707560539246, "sampling/importance_sampling_ratio/mean": 1.0281985998153687, "sampling/importance_sampling_ratio/max": 1.703879475593567, "entropy": 1.3407299667596817, "clip_ratio/low_mean": 0.08878105599433184, "clip_ratio/low_min": 0.08878105599433184, "clip_ratio/high_mean": 0.09265541657805443, "clip_ratio/high_max": 0.09265541657805443, "clip_ratio/region_mean": 0.18143647257238626, "reward_total_mean": 0.40862423181533813, "reward_meter_mean": 0.6410830616950989, "reward_meter_std": 0.4693940281867981, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7562500238418579, "reward_judge_quality_std": 0.31717222929000854, "reward_total_composite_mean": 0.40862423181533813, "reward_total_composite_std": 0.3837718963623047} {"timestamp_utc": "2026-04-12T18:59:07Z", "mode": "train", "global_step": 810, "epoch": 0.0426293352981422, "loss": -0.004, "grad_norm": 19.20218276977539, "learning_rate": 7.548484848484849e-06, "num_tokens": 1455207.0, "completions/mean_length": 22.5, "completions/min_length": 16.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.5, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.9356511831283569, "rewards/meter/std": 0.06340444833040237, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47999998927116394, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.6993392705917358, "rewards/repeat_penalty/std": 0.07444862276315689, "rewards/repeat_floor/mean": 0.9758293628692627, "rewards/repeat_floor/std": 0.014460408128798008, "rewards/near_duplicate_penalty/mean": 0.9484779834747314, "rewards/near_duplicate_penalty/std": 0.09841844439506531, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.045327357947826385, "rewards/total_composite/mean": 0.3734077513217926, "rewards/total_composite/std": 0.2502562701702118, "reward": 0.3734077513217926, "reward_std": 0.2502562701702118, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15154768526554108, "sampling/sampling_logp_difference/max": 1.2297334671020508, "sampling/importance_sampling_ratio/min": 0.292370468378067, "sampling/importance_sampling_ratio/mean": 1.00874924659729, "sampling/importance_sampling_ratio/max": 1.7784370183944702, "entropy": 0.9116416499018669, "clip_ratio/low_mean": 0.11185723450034857, "clip_ratio/low_min": 0.11185723450034857, "clip_ratio/high_mean": 0.00657894741743803, "clip_ratio/high_max": 0.00657894741743803, "clip_ratio/region_mean": 0.1184361819177866, "reward_total_mean": 0.3734077513217926, "reward_meter_mean": 0.9356511831283569, "reward_meter_std": 0.06340444833040237, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6993392705917358, "reward_repeat_penalty_std": 0.07444862276315689, "reward_repeat_floor_mean": 0.9758293628692627, "reward_repeat_floor_std": 0.014460408128798008, "reward_near_duplicate_penalty_mean": 0.9484779834747314, "reward_near_duplicate_penalty_std": 0.09841844439506531, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.045327357947826385, "reward_judge_quality_mean": 0.47999998927116394, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.3734077513217926, "reward_total_composite_std": 0.2502562701702118} {"timestamp_utc": "2026-04-12T18:59:17Z", "mode": "train", "global_step": 811, "epoch": 0.042681964107152255, "loss": 0.4295, "grad_norm": 14.159217834472656, "learning_rate": 7.545454545454546e-06, "num_tokens": 1457361.0, "completions/mean_length": 47.25, "completions/min_length": 23.0, "completions/max_length": 124.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.25, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 124.0, "rewards/meter/mean": 0.9171833992004395, "rewards/meter/std": 0.2167324274778366, "rewards/count_adherence/mean": 0.2678571343421936, "rewards/count_adherence/std": 0.23458294570446014, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.7803571224212646, "rewards/count_floor/std": 0.07037486881017685, "rewards/lexical_plausibility/mean": 0.96875, "rewards/lexical_plausibility/std": 0.0883883461356163, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.6697031259536743, "rewards/repeat_penalty/std": 0.11168906092643738, "rewards/repeat_floor/mean": 0.9688522219657898, "rewards/repeat_floor/std": 0.02090632915496826, "rewards/near_duplicate_penalty/mean": 0.9268824458122253, "rewards/near_duplicate_penalty/std": 0.10454464703798294, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9007759690284729, "rewards/distinct_2/std": 0.13997726142406464, "rewards/total_composite/mean": 0.20380830764770508, "rewards/total_composite/std": 0.09110172092914581, "reward": 0.20380830764770508, "reward_std": 0.09110172837972641, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17390233278274536, "sampling/sampling_logp_difference/max": 1.7461357116699219, "sampling/importance_sampling_ratio/min": 0.2534649968147278, "sampling/importance_sampling_ratio/mean": 1.001904845237732, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0507089421153069, "clip_ratio/low_mean": 0.04173261485993862, "clip_ratio/low_min": 0.04173261485993862, "clip_ratio/high_mean": 0.0699902456253767, "clip_ratio/high_max": 0.0699902456253767, "clip_ratio/region_mean": 0.11172286048531532, "reward_total_mean": 0.20380830764770508, "reward_meter_mean": 0.9171833992004395, "reward_meter_std": 0.2167324274778366, "reward_count_adherence_mean": 0.2678571343421936, "reward_count_adherence_std": 0.23458294570446014, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.7803571224212646, "reward_count_floor_std": 0.07037486881017685, "reward_lexical_plausibility_mean": 0.96875, "reward_lexical_plausibility_std": 0.0883883461356163, "reward_repeat_penalty_mean": 0.6697031259536743, "reward_repeat_penalty_std": 0.11168906092643738, "reward_repeat_floor_mean": 0.9688522219657898, "reward_repeat_floor_std": 0.02090632915496826, "reward_near_duplicate_penalty_mean": 0.9268824458122253, "reward_near_duplicate_penalty_std": 0.10454464703798294, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9007759690284729, "reward_distinct_2_std": 0.13997726142406464, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.20380830764770508, "reward_total_composite_std": 0.09110172092914581} {"timestamp_utc": "2026-04-12T18:59:25Z", "mode": "train", "global_step": 812, "epoch": 0.04273459291616231, "loss": 0.1732, "grad_norm": 16.96632957458496, "learning_rate": 7.542424242424244e-06, "num_tokens": 1458933.0, "completions/mean_length": 28.5, "completions/min_length": 21.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.5, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.8495146632194519, "rewards/meter/std": 0.2902800738811493, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9752674102783203, "rewards/lexical_plausibility/std": 0.06995441019535065, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.268537700176239, "rewards/repeat_penalty/mean": 0.6847589612007141, "rewards/repeat_penalty/std": 0.1333535611629486, "rewards/repeat_floor/mean": 0.9746805429458618, "rewards/repeat_floor/std": 0.02138371393084526, "rewards/near_duplicate_penalty/mean": 0.9695277214050293, "rewards/near_duplicate_penalty/std": 0.062313929200172424, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9152930974960327, "rewards/distinct_2/std": 0.19306930899620056, "rewards/total_composite/mean": 0.2691442668437958, "rewards/total_composite/std": 0.23518584668636322, "reward": 0.2691442668437958, "reward_std": 0.23518583178520203, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1595873236656189, "sampling/sampling_logp_difference/max": 1.6597552299499512, "sampling/importance_sampling_ratio/min": 0.1901855319738388, "sampling/importance_sampling_ratio/mean": 1.0176295042037964, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0433703511953354, "clip_ratio/low_mean": 0.06702722702175379, "clip_ratio/low_min": 0.06702722702175379, "clip_ratio/high_mean": 0.05598343722522259, "clip_ratio/high_max": 0.05598343722522259, "clip_ratio/region_mean": 0.12301066424697638, "reward_total_mean": 0.2691442668437958, "reward_meter_mean": 0.8495146632194519, "reward_meter_std": 0.2902800738811493, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9752674102783203, "reward_lexical_plausibility_std": 0.06995441019535065, "reward_repeat_penalty_mean": 0.6847589612007141, "reward_repeat_penalty_std": 0.1333535611629486, "reward_repeat_floor_mean": 0.9746805429458618, "reward_repeat_floor_std": 0.02138371393084526, "reward_near_duplicate_penalty_mean": 0.9695277214050293, "reward_near_duplicate_penalty_std": 0.062313929200172424, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9152930974960327, "reward_distinct_2_std": 0.19306930899620056, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.268537700176239, "reward_total_composite_mean": 0.2691442668437958, "reward_total_composite_std": 0.23518584668636322} {"timestamp_utc": "2026-04-12T18:59:39Z", "mode": "train", "global_step": 813, "epoch": 0.04278722172517236, "loss": -0.0351, "grad_norm": 4.430045127868652, "learning_rate": 7.53939393939394e-06, "num_tokens": 1460651.0, "completions/mean_length": 83.75, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 22.571430206298828, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.8289089202880859, "rewards/meter/std": 0.26676511764526367, "rewards/count_adherence/mean": 0.28125, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.7843749523162842, "rewards/count_floor/std": 0.026516521349549294, "rewards/lexical_plausibility/mean": 0.9499424695968628, "rewards/lexical_plausibility/std": 0.14158403873443604, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.1552647352218628, "rewards/repeat_penalty/mean": 0.7628153562545776, "rewards/repeat_penalty/std": 0.10193809121847153, "rewards/repeat_floor/mean": 0.9840642213821411, "rewards/repeat_floor/std": 0.008201684802770615, "rewards/near_duplicate_penalty/mean": 0.9901372194290161, "rewards/near_duplicate_penalty/std": 0.025879662483930588, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.21908780932426453, "rewards/total_composite/std": 0.13027232885360718, "reward": 0.21908780932426453, "reward_std": 0.13027232885360718, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1934020221233368, "sampling/sampling_logp_difference/max": 1.2168521881103516, "sampling/importance_sampling_ratio/min": 0.2961609661579132, "sampling/importance_sampling_ratio/mean": 1.024492859840393, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3589426279067993, "clip_ratio/low_mean": 0.03375000040978193, "clip_ratio/low_min": 0.03375000040978193, "clip_ratio/high_mean": 0.14882544800639153, "clip_ratio/high_max": 0.14882544800639153, "clip_ratio/region_mean": 0.18257544841617346, "reward_total_mean": 0.21908780932426453, "reward_meter_mean": 0.8289089202880859, "reward_meter_std": 0.26676511764526367, "reward_count_adherence_mean": 0.28125, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.7843749523162842, "reward_count_floor_std": 0.026516521349549294, "reward_lexical_plausibility_mean": 0.9499424695968628, "reward_lexical_plausibility_std": 0.14158403873443604, "reward_repeat_penalty_mean": 0.7628153562545776, "reward_repeat_penalty_std": 0.10193809121847153, "reward_repeat_floor_mean": 0.9840642213821411, "reward_repeat_floor_std": 0.008201684802770615, "reward_near_duplicate_penalty_mean": 0.9901372194290161, "reward_near_duplicate_penalty_std": 0.025879662483930588, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.1552647352218628, "reward_total_composite_mean": 0.21908780932426453, "reward_total_composite_std": 0.13027232885360718} {"timestamp_utc": "2026-04-12T18:59:53Z", "mode": "train", "global_step": 814, "epoch": 0.04283985053418241, "loss": -0.1966, "grad_norm": 4.813582420349121, "learning_rate": 7.536363636363637e-06, "num_tokens": 1462491.0, "completions/mean_length": 107.0, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 49.142860412597656, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.7007884383201599, "rewards/meter/std": 0.27218306064605713, "rewards/count_adherence/mean": 0.44999998807907104, "rewards/count_adherence/std": 0.20701968669891357, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8350000381469727, "rewards/count_floor/std": 0.06210590526461601, "rewards/lexical_plausibility/mean": 0.9431955814361572, "rewards/lexical_plausibility/std": 0.16066719591617584, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.8224967122077942, "rewards/repeat_penalty/std": 0.15461789071559906, "rewards/repeat_floor/mean": 0.9810358881950378, "rewards/repeat_floor/std": 0.018225310370326042, "rewards/near_duplicate_penalty/mean": 0.9384067058563232, "rewards/near_duplicate_penalty/std": 0.0786098837852478, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9336100220680237, "rewards/distinct_2/std": 0.08975629508495331, "rewards/total_composite/mean": 0.16635443270206451, "rewards/total_composite/std": 0.09484672546386719, "reward": 0.16635443270206451, "reward_std": 0.09484672546386719, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14266599714756012, "sampling/sampling_logp_difference/max": 1.5299382209777832, "sampling/importance_sampling_ratio/min": 0.21654905378818512, "sampling/importance_sampling_ratio/mean": 1.0361651182174683, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9007492735981941, "clip_ratio/low_mean": 0.019736841320991516, "clip_ratio/low_min": 0.019736841320991516, "clip_ratio/high_mean": 0.11878337897360325, "clip_ratio/high_max": 0.11878337897360325, "clip_ratio/region_mean": 0.13852022029459476, "reward_total_mean": 0.16635443270206451, "reward_meter_mean": 0.7007884383201599, "reward_meter_std": 0.27218306064605713, "reward_count_adherence_mean": 0.44999998807907104, "reward_count_adherence_std": 0.20701968669891357, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8350000381469727, "reward_count_floor_std": 0.06210590526461601, "reward_lexical_plausibility_mean": 0.9431955814361572, "reward_lexical_plausibility_std": 0.16066719591617584, "reward_repeat_penalty_mean": 0.8224967122077942, "reward_repeat_penalty_std": 0.15461789071559906, "reward_repeat_floor_mean": 0.9810358881950378, "reward_repeat_floor_std": 0.018225310370326042, "reward_near_duplicate_penalty_mean": 0.9384067058563232, "reward_near_duplicate_penalty_std": 0.0786098837852478, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9336100220680237, "reward_distinct_2_std": 0.08975629508495331, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.16635443270206451, "reward_total_composite_std": 0.09484672546386719} {"timestamp_utc": "2026-04-12T19:00:03Z", "mode": "train", "global_step": 815, "epoch": 0.042892479343192465, "loss": 0.0999, "grad_norm": 12.627212524414062, "learning_rate": 7.533333333333334e-06, "num_tokens": 1464546.0, "completions/mean_length": 64.875, "completions/min_length": 48.0, "completions/max_length": 84.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.875, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.5496289730072021, "rewards/meter/std": 0.29180029034614563, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.10690449178218842, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9399999976158142, "rewards/count_floor/std": 0.03207135200500488, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.24136146903038025, "rewards/repeat_penalty/mean": 0.8907186388969421, "rewards/repeat_penalty/std": 0.08900643140077591, "rewards/repeat_floor/mean": 0.9878484010696411, "rewards/repeat_floor/std": 0.009585205465555191, "rewards/near_duplicate_penalty/mean": 0.9671115875244141, "rewards/near_duplicate_penalty/std": 0.0205213725566864, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9197964668273926, "rewards/distinct_2/std": 0.07553186267614365, "rewards/total_composite/mean": 0.2369551658630371, "rewards/total_composite/std": 0.2612629532814026, "reward": 0.2369551658630371, "reward_std": 0.2612629532814026, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19140778481960297, "sampling/sampling_logp_difference/max": 1.78289794921875, "sampling/importance_sampling_ratio/min": 0.17033539712429047, "sampling/importance_sampling_ratio/mean": 0.9856112003326416, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0083779841661453, "clip_ratio/low_mean": 0.09884848818182945, "clip_ratio/low_min": 0.09884848818182945, "clip_ratio/high_mean": 0.06275434233248234, "clip_ratio/high_max": 0.06275434233248234, "clip_ratio/region_mean": 0.1616028305143118, "reward_total_mean": 0.2369551658630371, "reward_meter_mean": 0.5496289730072021, "reward_meter_std": 0.29180029034614563, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.10690449178218842, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9399999976158142, "reward_count_floor_std": 0.03207135200500488, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8907186388969421, "reward_repeat_penalty_std": 0.08900643140077591, "reward_repeat_floor_mean": 0.9878484010696411, "reward_repeat_floor_std": 0.009585205465555191, "reward_near_duplicate_penalty_mean": 0.9671115875244141, "reward_near_duplicate_penalty_std": 0.0205213725566864, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9197964668273926, "reward_distinct_2_std": 0.07553186267614365, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.24136146903038025, "reward_total_composite_mean": 0.2369551658630371, "reward_total_composite_std": 0.2612629532814026} {"timestamp_utc": "2026-04-12T19:00:11Z", "mode": "train", "global_step": 816, "epoch": 0.04294510815220252, "loss": 0.0736, "grad_norm": 22.224498748779297, "learning_rate": 7.530303030303031e-06, "num_tokens": 1465961.0, "completions/mean_length": 19.875, "completions/min_length": 18.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.875, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.6954392194747925, "rewards/meter/std": 0.411810040473938, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.731249988079071, "rewards/judge_quality/std": 0.2623213827610016, "rewards/repeat_penalty/mean": 0.7489533424377441, "rewards/repeat_penalty/std": 0.0029603736475110054, "rewards/repeat_floor/mean": 0.9847906827926636, "rewards/repeat_floor/std": 0.0005920789553783834, "rewards/near_duplicate_penalty/mean": 0.9986044764518738, "rewards/near_duplicate_penalty/std": 0.003947157878428698, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.546711802482605, "rewards/total_composite/std": 0.38904139399528503, "reward": 0.546711802482605, "reward_std": 0.38904139399528503, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.216852068901062, "sampling/sampling_logp_difference/max": 1.6973917484283447, "sampling/importance_sampling_ratio/min": 0.18316063284873962, "sampling/importance_sampling_ratio/mean": 1.036706805229187, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4984114170074463, "clip_ratio/low_mean": 0.08459596149623394, "clip_ratio/low_min": 0.08459596149623394, "clip_ratio/high_mean": 0.0734127014875412, "clip_ratio/high_max": 0.0734127014875412, "clip_ratio/region_mean": 0.15800866298377514, "reward_total_mean": 0.546711802482605, "reward_meter_mean": 0.6954392194747925, "reward_meter_std": 0.411810040473938, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7489533424377441, "reward_repeat_penalty_std": 0.0029603736475110054, "reward_repeat_floor_mean": 0.9847906827926636, "reward_repeat_floor_std": 0.0005920789553783834, "reward_near_duplicate_penalty_mean": 0.9986044764518738, "reward_near_duplicate_penalty_std": 0.003947157878428698, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.731249988079071, "reward_judge_quality_std": 0.2623213827610016, "reward_total_composite_mean": 0.546711802482605, "reward_total_composite_std": 0.38904139399528503} {"timestamp_utc": "2026-04-12T19:00:19Z", "mode": "train", "global_step": 817, "epoch": 0.04299773696121257, "loss": -0.0327, "grad_norm": 20.363027572631836, "learning_rate": 7.5272727272727274e-06, "num_tokens": 1467463.0, "completions/mean_length": 18.75, "completions/min_length": 16.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.75, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.9814982414245605, "rewards/meter/std": 0.012693759053945541, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.684036135673523, "rewards/repeat_penalty/std": 0.11495808511972427, "rewards/repeat_floor/mean": 0.9692908525466919, "rewards/repeat_floor/std": 0.01916888728737831, "rewards/near_duplicate_penalty/mean": 0.899031400680542, "rewards/near_duplicate_penalty/std": 0.10563550889492035, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9729020595550537, "rewards/distinct_2/std": 0.05291995406150818, "rewards/total_composite/mean": 0.2501251697540283, "rewards/total_composite/std": 0.1132427453994751, "reward": 0.2501251697540283, "reward_std": 0.1132427453994751, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1789841502904892, "sampling/sampling_logp_difference/max": 1.7048187255859375, "sampling/importance_sampling_ratio/min": 0.1818053424358368, "sampling/importance_sampling_ratio/mean": 1.0218631029129028, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2871474474668503, "clip_ratio/low_mean": 0.06093750009313226, "clip_ratio/low_min": 0.06093750009313226, "clip_ratio/high_mean": 0.11934603471308947, "clip_ratio/high_max": 0.11934603471308947, "clip_ratio/region_mean": 0.18028353480622172, "reward_total_mean": 0.2501251697540283, "reward_meter_mean": 0.9814982414245605, "reward_meter_std": 0.012693759053945541, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.684036135673523, "reward_repeat_penalty_std": 0.11495808511972427, "reward_repeat_floor_mean": 0.9692908525466919, "reward_repeat_floor_std": 0.01916888728737831, "reward_near_duplicate_penalty_mean": 0.899031400680542, "reward_near_duplicate_penalty_std": 0.10563550889492035, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9729020595550537, "reward_distinct_2_std": 0.05291995406150818, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.2501251697540283, "reward_total_composite_std": 0.1132427453994751} {"timestamp_utc": "2026-04-12T19:00:28Z", "mode": "train", "global_step": 818, "epoch": 0.04305036577022262, "loss": 0.0782, "grad_norm": 18.549962997436523, "learning_rate": 7.524242424242425e-06, "num_tokens": 1468952.0, "completions/mean_length": 32.125, "completions/min_length": 29.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.125, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.3971840739250183, "rewards/meter/std": 0.3852846622467041, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.22177450358867645, "rewards/repeat_penalty/mean": 0.9718365669250488, "rewards/repeat_penalty/std": 0.06021438539028168, "rewards/repeat_floor/mean": 0.996390700340271, "rewards/repeat_floor/std": 0.007331717759370804, "rewards/near_duplicate_penalty/mean": 0.983630359172821, "rewards/near_duplicate_penalty/std": 0.028202861547470093, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9871795177459717, "rewards/distinct_2/std": 0.03626188635826111, "rewards/total_composite/mean": 0.17902232706546783, "rewards/total_composite/std": 0.17599532008171082, "reward": 0.17902232706546783, "reward_std": 0.17599530518054962, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1546567678451538, "sampling/sampling_logp_difference/max": 1.7123899459838867, "sampling/importance_sampling_ratio/min": 0.18043406307697296, "sampling/importance_sampling_ratio/mean": 1.0096814632415771, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8197788000106812, "clip_ratio/low_mean": 0.08430119324475527, "clip_ratio/low_min": 0.08430119324475527, "clip_ratio/high_mean": 0.054463294334709644, "clip_ratio/high_max": 0.054463294334709644, "clip_ratio/region_mean": 0.1387644875794649, "reward_total_mean": 0.17902232706546783, "reward_meter_mean": 0.3971840739250183, "reward_meter_std": 0.3852846622467041, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9718365669250488, "reward_repeat_penalty_std": 0.06021438539028168, "reward_repeat_floor_mean": 0.996390700340271, "reward_repeat_floor_std": 0.007331717759370804, "reward_near_duplicate_penalty_mean": 0.983630359172821, "reward_near_duplicate_penalty_std": 0.028202861547470093, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9871795177459717, "reward_distinct_2_std": 0.03626188635826111, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.22177450358867645, "reward_total_composite_mean": 0.17902232706546783, "reward_total_composite_std": 0.17599532008171082} {"timestamp_utc": "2026-04-12T19:00:36Z", "mode": "train", "global_step": 819, "epoch": 0.043102994579232674, "loss": 0.0129, "grad_norm": 17.536701202392578, "learning_rate": 7.521212121212121e-06, "num_tokens": 1470437.0, "completions/mean_length": 22.625, "completions/min_length": 17.0, "completions/max_length": 30.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.625, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.8637288808822632, "rewards/meter/std": 0.2945989668369293, "rewards/count_adherence/mean": 0.3333333432674408, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.800000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.966911792755127, "rewards/lexical_plausibility/std": 0.09358766674995422, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14961546659469604, "rewards/total_composite/std": 0.10412398725748062, "reward": 0.14961546659469604, "reward_std": 0.10412398725748062, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20420442521572113, "sampling/sampling_logp_difference/max": 2.08994197845459, "sampling/importance_sampling_ratio/min": 0.12369430810213089, "sampling/importance_sampling_ratio/mean": 1.0211299657821655, "sampling/importance_sampling_ratio/max": 1.8783628940582275, "entropy": 1.736636683344841, "clip_ratio/low_mean": 0.1538101639598608, "clip_ratio/low_min": 0.1538101639598608, "clip_ratio/high_mean": 0.047173911705613136, "clip_ratio/high_max": 0.047173911705613136, "clip_ratio/region_mean": 0.20098407566547394, "reward_total_mean": 0.14961546659469604, "reward_meter_mean": 0.8637288808822632, "reward_meter_std": 0.2945989668369293, "reward_count_adherence_mean": 0.3333333432674408, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.800000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.966911792755127, "reward_lexical_plausibility_std": 0.09358766674995422, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.14961546659469604, "reward_total_composite_std": 0.10412398725748062} {"timestamp_utc": "2026-04-12T19:00:49Z", "mode": "train", "global_step": 820, "epoch": 0.04315562338824273, "loss": -0.0244, "grad_norm": 4.032950401306152, "learning_rate": 7.518181818181819e-06, "num_tokens": 1471966.0, "completions/mean_length": 90.125, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 29.85714340209961, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.7555403709411621, "rewards/meter/std": 0.4275420606136322, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9685947895050049, "rewards/lexical_plausibility/std": 0.08882737159729004, "rewards/judge_quality/mean": 0.5850000381469727, "rewards/judge_quality/std": 0.377548485994339, "rewards/repeat_penalty/mean": 0.7073977589607239, "rewards/repeat_penalty/std": 0.10778601467609406, "rewards/repeat_floor/mean": 0.974085807800293, "rewards/repeat_floor/std": 0.01888308674097061, "rewards/near_duplicate_penalty/mean": 0.9309778213500977, "rewards/near_duplicate_penalty/std": 0.10524194687604904, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9729344844818115, "rewards/distinct_2/std": 0.05020807683467865, "rewards/total_composite/mean": 0.3957326114177704, "rewards/total_composite/std": 0.3144020140171051, "reward": 0.3957326114177704, "reward_std": 0.3144020140171051, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1674242466688156, "sampling/sampling_logp_difference/max": 1.392251968383789, "sampling/importance_sampling_ratio/min": 0.2485150396823883, "sampling/importance_sampling_ratio/mean": 1.0011268854141235, "sampling/importance_sampling_ratio/max": 1.9608087539672852, "entropy": 1.1507271006703377, "clip_ratio/low_mean": 0.06778190191835165, "clip_ratio/low_min": 0.06778190191835165, "clip_ratio/high_mean": 0.05017857253551483, "clip_ratio/high_max": 0.05017857253551483, "clip_ratio/region_mean": 0.11796047445386648, "reward_total_mean": 0.3957326114177704, "reward_meter_mean": 0.7555403709411621, "reward_meter_std": 0.4275420606136322, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9685947895050049, "reward_lexical_plausibility_std": 0.08882737159729004, "reward_repeat_penalty_mean": 0.7073977589607239, "reward_repeat_penalty_std": 0.10778601467609406, "reward_repeat_floor_mean": 0.974085807800293, "reward_repeat_floor_std": 0.01888308674097061, "reward_near_duplicate_penalty_mean": 0.9309778213500977, "reward_near_duplicate_penalty_std": 0.10524194687604904, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9729344844818115, "reward_distinct_2_std": 0.05020807683467865, "reward_judge_quality_mean": 0.5850000381469727, "reward_judge_quality_std": 0.377548485994339, "reward_total_composite_mean": 0.3957326114177704, "reward_total_composite_std": 0.3144020140171051} {"timestamp_utc": "2026-04-12T19:01:02Z", "mode": "train", "global_step": 821, "epoch": 0.04320825219725278, "loss": -0.017, "grad_norm": 4.432583808898926, "learning_rate": 7.515151515151516e-06, "num_tokens": 1473251.0, "completions/mean_length": 85.625, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 24.71428680419922, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.7224617600440979, "rewards/meter/std": 0.444905549287796, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9313076734542847, "rewards/lexical_plausibility/std": 0.1397034376859665, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.2728912830352783, "rewards/repeat_penalty/mean": 0.7402052283287048, "rewards/repeat_penalty/std": 0.027703819796442986, "rewards/repeat_floor/mean": 0.9830410480499268, "rewards/repeat_floor/std": 0.005540772341191769, "rewards/near_duplicate_penalty/mean": 0.9869402647018433, "rewards/near_duplicate_penalty/std": 0.03693840652704239, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.226249560713768, "rewards/total_composite/std": 0.19705277681350708, "reward": 0.226249560713768, "reward_std": 0.19705277681350708, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21654000878334045, "sampling/sampling_logp_difference/max": 1.2811155319213867, "sampling/importance_sampling_ratio/min": 0.27772730588912964, "sampling/importance_sampling_ratio/mean": 1.099709153175354, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.6918454021215439, "clip_ratio/low_mean": 0.054286833852529526, "clip_ratio/low_min": 0.054286833852529526, "clip_ratio/high_mean": 0.09520121151581407, "clip_ratio/high_max": 0.09520121151581407, "clip_ratio/region_mean": 0.1494880453683436, "reward_total_mean": 0.226249560713768, "reward_meter_mean": 0.7224617600440979, "reward_meter_std": 0.444905549287796, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9313076734542847, "reward_lexical_plausibility_std": 0.1397034376859665, "reward_repeat_penalty_mean": 0.7402052283287048, "reward_repeat_penalty_std": 0.027703819796442986, "reward_repeat_floor_mean": 0.9830410480499268, "reward_repeat_floor_std": 0.005540772341191769, "reward_near_duplicate_penalty_mean": 0.9869402647018433, "reward_near_duplicate_penalty_std": 0.03693840652704239, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.2728912830352783, "reward_total_composite_mean": 0.226249560713768, "reward_total_composite_std": 0.19705277681350708} {"timestamp_utc": "2026-04-12T19:01:16Z", "mode": "train", "global_step": 822, "epoch": 0.04326088100626283, "loss": 0.0059, "grad_norm": 4.892788410186768, "learning_rate": 7.512121212121213e-06, "num_tokens": 1474815.0, "completions/mean_length": 92.5, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 32.57143020629883, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.8654338121414185, "rewards/meter/std": 0.28509634733200073, "rewards/count_adherence/mean": 0.40625, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8218749761581421, "rewards/count_floor/std": 0.038816213607788086, "rewards/lexical_plausibility/mean": 0.9496781229972839, "rewards/lexical_plausibility/std": 0.1423318088054657, "rewards/judge_quality/mean": 0.4675000011920929, "rewards/judge_quality/std": 0.3160809278488159, "rewards/repeat_penalty/mean": 0.789899468421936, "rewards/repeat_penalty/std": 0.2299429476261139, "rewards/repeat_floor/mean": 0.976887047290802, "rewards/repeat_floor/std": 0.029898732900619507, "rewards/near_duplicate_penalty/mean": 0.9189907312393188, "rewards/near_duplicate_penalty/std": 0.11814222484827042, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9615384340286255, "rewards/distinct_2/std": 0.10878565162420273, "rewards/total_composite/mean": 0.3553149104118347, "rewards/total_composite/std": 0.23925107717514038, "reward": 0.3553149104118347, "reward_std": 0.23925107717514038, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15001611411571503, "sampling/sampling_logp_difference/max": 1.400146245956421, "sampling/importance_sampling_ratio/min": 0.24656091630458832, "sampling/importance_sampling_ratio/mean": 1.0442984104156494, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9598062038421631, "clip_ratio/low_mean": 0.05434782616794109, "clip_ratio/low_min": 0.05434782616794109, "clip_ratio/high_mean": 0.10035935696214437, "clip_ratio/high_max": 0.10035935696214437, "clip_ratio/region_mean": 0.15470718313008547, "reward_total_mean": 0.3553149104118347, "reward_meter_mean": 0.8654338121414185, "reward_meter_std": 0.28509634733200073, "reward_count_adherence_mean": 0.40625, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8218749761581421, "reward_count_floor_std": 0.038816213607788086, "reward_lexical_plausibility_mean": 0.9496781229972839, "reward_lexical_plausibility_std": 0.1423318088054657, "reward_repeat_penalty_mean": 0.789899468421936, "reward_repeat_penalty_std": 0.2299429476261139, "reward_repeat_floor_mean": 0.976887047290802, "reward_repeat_floor_std": 0.029898732900619507, "reward_near_duplicate_penalty_mean": 0.9189907312393188, "reward_near_duplicate_penalty_std": 0.11814222484827042, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9615384340286255, "reward_distinct_2_std": 0.10878565162420273, "reward_judge_quality_mean": 0.4675000011920929, "reward_judge_quality_std": 0.3160809278488159, "reward_total_composite_mean": 0.3553149104118347, "reward_total_composite_std": 0.23925107717514038} {"timestamp_utc": "2026-04-12T19:01:30Z", "mode": "train", "global_step": 823, "epoch": 0.04331350981527288, "loss": -0.0354, "grad_norm": 1.747131586074829, "learning_rate": 7.509090909090909e-06, "num_tokens": 1476076.0, "completions/mean_length": 213.625, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 34.60000228881836, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.5255786776542664, "rewards/meter/std": 0.42836275696754456, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 0.8589390516281128, "rewards/lexical_plausibility/std": 0.2013278305530548, "rewards/judge_quality/mean": 0.3087500035762787, "rewards/judge_quality/std": 0.3026755750179291, "rewards/repeat_penalty/mean": 0.7820367813110352, "rewards/repeat_penalty/std": 0.13554362952709198, "rewards/repeat_floor/mean": 0.983207106590271, "rewards/repeat_floor/std": 0.011739317327737808, "rewards/near_duplicate_penalty/mean": 0.9688335657119751, "rewards/near_duplicate_penalty/std": 0.03714458644390106, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9903568625450134, "rewards/distinct_2/std": 0.02574104629456997, "rewards/total_composite/mean": 0.21174120903015137, "rewards/total_composite/std": 0.24407526850700378, "reward": 0.21174120903015137, "reward_std": 0.24407526850700378, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17617204785346985, "sampling/sampling_logp_difference/max": 1.3265776634216309, "sampling/importance_sampling_ratio/min": 0.2653839588165283, "sampling/importance_sampling_ratio/mean": 1.0312964916229248, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9010612815618515, "clip_ratio/low_mean": 0.03791291266679764, "clip_ratio/low_min": 0.03791291266679764, "clip_ratio/high_mean": 0.05412115249782801, "clip_ratio/high_max": 0.05412115249782801, "clip_ratio/region_mean": 0.09203406516462564, "reward_total_mean": 0.21174120903015137, "reward_meter_mean": 0.5255786776542664, "reward_meter_std": 0.42836275696754456, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 0.8589390516281128, "reward_lexical_plausibility_std": 0.2013278305530548, "reward_repeat_penalty_mean": 0.7820367813110352, "reward_repeat_penalty_std": 0.13554362952709198, "reward_repeat_floor_mean": 0.983207106590271, "reward_repeat_floor_std": 0.011739317327737808, "reward_near_duplicate_penalty_mean": 0.9688335657119751, "reward_near_duplicate_penalty_std": 0.03714458644390106, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9903568625450134, "reward_distinct_2_std": 0.02574104629456997, "reward_judge_quality_mean": 0.3087500035762787, "reward_judge_quality_std": 0.3026755750179291, "reward_total_composite_mean": 0.21174120903015137, "reward_total_composite_std": 0.24407526850700378} {"timestamp_utc": "2026-04-12T19:01:45Z", "mode": "train", "global_step": 824, "epoch": 0.04336613862428293, "loss": -0.023, "grad_norm": 2.2957868576049805, "learning_rate": 7.5060606060606065e-06, "num_tokens": 1477451.0, "completions/mean_length": 207.875, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 25.399999618530273, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 34.0, "rewards/meter/mean": 0.435158371925354, "rewards/meter/std": 0.4625847637653351, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.7725337743759155, "rewards/lexical_plausibility/std": 0.2591196894645691, "rewards/judge_quality/mean": 0.36125001311302185, "rewards/judge_quality/std": 0.3782077431678772, "rewards/repeat_penalty/mean": 0.8146295547485352, "rewards/repeat_penalty/std": 0.1268990933895111, "rewards/repeat_floor/mean": 0.9856278896331787, "rewards/repeat_floor/std": 0.010767897590994835, "rewards/near_duplicate_penalty/mean": 0.9666858911514282, "rewards/near_duplicate_penalty/std": 0.05830582231283188, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1266794353723526, "rewards/total_composite/std": 0.24408572912216187, "reward": 0.1266794353723526, "reward_std": 0.24408569931983948, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.224935382604599, "sampling/sampling_logp_difference/max": 1.225947380065918, "sampling/importance_sampling_ratio/min": 0.2934795320034027, "sampling/importance_sampling_ratio/mean": 1.0713961124420166, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2053080052137375, "clip_ratio/low_mean": 0.07659837417304516, "clip_ratio/low_min": 0.07659837417304516, "clip_ratio/high_mean": 0.036445013247430325, "clip_ratio/high_max": 0.036445013247430325, "clip_ratio/region_mean": 0.11304338742047548, "reward_total_mean": 0.1266794353723526, "reward_meter_mean": 0.435158371925354, "reward_meter_std": 0.4625847637653351, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.7725337743759155, "reward_lexical_plausibility_std": 0.2591196894645691, "reward_repeat_penalty_mean": 0.8146295547485352, "reward_repeat_penalty_std": 0.1268990933895111, "reward_repeat_floor_mean": 0.9856278896331787, "reward_repeat_floor_std": 0.010767897590994835, "reward_near_duplicate_penalty_mean": 0.9666858911514282, "reward_near_duplicate_penalty_std": 0.05830582231283188, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36125001311302185, "reward_judge_quality_std": 0.3782077431678772, "reward_total_composite_mean": 0.1266794353723526, "reward_total_composite_std": 0.24408572912216187} {"timestamp_utc": "2026-04-12T19:01:58Z", "mode": "train", "global_step": 825, "epoch": 0.04341876743329298, "loss": -0.0418, "grad_norm": 4.6135382652282715, "learning_rate": 7.503030303030303e-06, "num_tokens": 1478858.0, "completions/mean_length": 83.875, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 22.71428680419922, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.9282773733139038, "rewards/meter/std": 0.1416764110326767, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9474941492080688, "rewards/lexical_plausibility/std": 0.1485089808702469, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.33161941170692444, "rewards/repeat_penalty/mean": 0.7089676260948181, "rewards/repeat_penalty/std": 0.08527421951293945, "rewards/repeat_floor/mean": 0.977798342704773, "rewards/repeat_floor/std": 0.014461321756243706, "rewards/near_duplicate_penalty/mean": 0.9673733711242676, "rewards/near_duplicate_penalty/std": 0.06057348847389221, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9743589758872986, "rewards/distinct_2/std": 0.07252377271652222, "rewards/total_composite/mean": 0.5850933790206909, "rewards/total_composite/std": 0.3361518085002899, "reward": 0.5850933790206909, "reward_std": 0.33615177869796753, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1841418296098709, "sampling/sampling_logp_difference/max": 1.4703569412231445, "sampling/importance_sampling_ratio/min": 0.22984343767166138, "sampling/importance_sampling_ratio/mean": 1.0410012006759644, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.361395351588726, "clip_ratio/low_mean": 0.06971343979239464, "clip_ratio/low_min": 0.06971343979239464, "clip_ratio/high_mean": 0.06624579289928079, "clip_ratio/high_max": 0.06624579289928079, "clip_ratio/region_mean": 0.13595923269167542, "reward_total_mean": 0.5850933790206909, "reward_meter_mean": 0.9282773733139038, "reward_meter_std": 0.1416764110326767, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9474941492080688, "reward_lexical_plausibility_std": 0.1485089808702469, "reward_repeat_penalty_mean": 0.7089676260948181, "reward_repeat_penalty_std": 0.08527421951293945, "reward_repeat_floor_mean": 0.977798342704773, "reward_repeat_floor_std": 0.014461321756243706, "reward_near_duplicate_penalty_mean": 0.9673733711242676, "reward_near_duplicate_penalty_std": 0.06057348847389221, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9743589758872986, "reward_distinct_2_std": 0.07252377271652222, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.33161941170692444, "reward_total_composite_mean": 0.5850933790206909, "reward_total_composite_std": 0.3361518085002899} {"timestamp_utc": "2026-04-12T19:02:12Z", "mode": "train", "global_step": 826, "epoch": 0.043471396242303034, "loss": -0.0405, "grad_norm": 5.854129791259766, "learning_rate": 7.500000000000001e-06, "num_tokens": 1480228.0, "completions/mean_length": 82.25, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.85714340209961, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.7147685289382935, "rewards/meter/std": 0.37668249011039734, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9501920938491821, "rewards/lexical_plausibility/std": 0.11767436563968658, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.7453800439834595, "rewards/repeat_penalty/std": 0.11828261613845825, "rewards/repeat_floor/mean": 0.9798123836517334, "rewards/repeat_floor/std": 0.014985439367592335, "rewards/near_duplicate_penalty/mean": 0.9535229206085205, "rewards/near_duplicate_penalty/std": 0.08709587901830673, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9989878535270691, "rewards/distinct_2/std": 0.002862782683223486, "rewards/total_composite/mean": 0.1379672884941101, "rewards/total_composite/std": 0.12172599136829376, "reward": 0.1379672884941101, "reward_std": 0.12172599136829376, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20663116872310638, "sampling/sampling_logp_difference/max": 1.4144797325134277, "sampling/importance_sampling_ratio/min": 0.24305203557014465, "sampling/importance_sampling_ratio/mean": 1.019883632659912, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.525448977947235, "clip_ratio/low_mean": 0.12825261894613504, "clip_ratio/low_min": 0.12825261894613504, "clip_ratio/high_mean": 0.04304029420018196, "clip_ratio/high_max": 0.04304029420018196, "clip_ratio/region_mean": 0.171292913146317, "reward_total_mean": 0.1379672884941101, "reward_meter_mean": 0.7147685289382935, "reward_meter_std": 0.37668249011039734, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9501920938491821, "reward_lexical_plausibility_std": 0.11767436563968658, "reward_repeat_penalty_mean": 0.7453800439834595, "reward_repeat_penalty_std": 0.11828261613845825, "reward_repeat_floor_mean": 0.9798123836517334, "reward_repeat_floor_std": 0.014985439367592335, "reward_near_duplicate_penalty_mean": 0.9535229206085205, "reward_near_duplicate_penalty_std": 0.08709587901830673, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9989878535270691, "reward_distinct_2_std": 0.002862782683223486, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.1379672884941101, "reward_total_composite_std": 0.12172599136829376} {"timestamp_utc": "2026-04-12T19:02:25Z", "mode": "train", "global_step": 827, "epoch": 0.04352402505131309, "loss": -0.1259, "grad_norm": 3.371136426925659, "learning_rate": 7.496969696969698e-06, "num_tokens": 1482059.0, "completions/mean_length": 167.875, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 53.16666793823242, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.649419903755188, "rewards/meter/std": 0.3531789481639862, "rewards/count_adherence/mean": 0.4750000238418579, "rewards/count_adherence/std": 0.2121320515871048, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8424999713897705, "rewards/count_floor/std": 0.06363961845636368, "rewards/lexical_plausibility/mean": 0.896161675453186, "rewards/lexical_plausibility/std": 0.19566257297992706, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213627576828, "rewards/repeat_penalty/mean": 0.8028115034103394, "rewards/repeat_penalty/std": 0.18067368865013123, "rewards/repeat_floor/mean": 0.9785290360450745, "rewards/repeat_floor/std": 0.0209575854241848, "rewards/near_duplicate_penalty/mean": 0.9310684204101562, "rewards/near_duplicate_penalty/std": 0.07439356297254562, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9179863929748535, "rewards/distinct_2/std": 0.13890817761421204, "rewards/total_composite/mean": 0.15409380197525024, "rewards/total_composite/std": 0.1144634485244751, "reward": 0.15409380197525024, "reward_std": 0.1144634485244751, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17851325869560242, "sampling/sampling_logp_difference/max": 1.5433738231658936, "sampling/importance_sampling_ratio/min": 0.25876614451408386, "sampling/importance_sampling_ratio/mean": 1.0627481937408447, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2568029761314392, "clip_ratio/low_mean": 0.0489986059255898, "clip_ratio/low_min": 0.0489986059255898, "clip_ratio/high_mean": 0.06642530579119921, "clip_ratio/high_max": 0.06642530579119921, "clip_ratio/region_mean": 0.11542391171678901, "reward_total_mean": 0.15409380197525024, "reward_meter_mean": 0.649419903755188, "reward_meter_std": 0.3531789481639862, "reward_count_adherence_mean": 0.4750000238418579, "reward_count_adherence_std": 0.2121320515871048, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8424999713897705, "reward_count_floor_std": 0.06363961845636368, "reward_lexical_plausibility_mean": 0.896161675453186, "reward_lexical_plausibility_std": 0.19566257297992706, "reward_repeat_penalty_mean": 0.8028115034103394, "reward_repeat_penalty_std": 0.18067368865013123, "reward_repeat_floor_mean": 0.9785290360450745, "reward_repeat_floor_std": 0.0209575854241848, "reward_near_duplicate_penalty_mean": 0.9310684204101562, "reward_near_duplicate_penalty_std": 0.07439356297254562, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9179863929748535, "reward_distinct_2_std": 0.13890817761421204, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213627576828, "reward_total_composite_mean": 0.15409380197525024, "reward_total_composite_std": 0.1144634485244751} {"timestamp_utc": "2026-04-12T19:02:39Z", "mode": "train", "global_step": 828, "epoch": 0.04357665386032314, "loss": -0.0484, "grad_norm": 4.912237167358398, "learning_rate": 7.493939393939395e-06, "num_tokens": 1483665.0, "completions/mean_length": 100.75, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.3973170518875122, "rewards/meter/std": 0.3878973424434662, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9215686917304993, "rewards/lexical_plausibility/std": 0.15877632796764374, "rewards/judge_quality/mean": 0.3212500214576721, "rewards/judge_quality/std": 0.2721048891544342, "rewards/repeat_penalty/mean": 0.9658288955688477, "rewards/repeat_penalty/std": 0.03947308659553528, "rewards/repeat_floor/mean": 0.9948743581771851, "rewards/repeat_floor/std": 0.005920974537730217, "rewards/near_duplicate_penalty/mean": 0.9658288955688477, "rewards/near_duplicate_penalty/std": 0.03947308659553528, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15168119966983795, "rewards/total_composite/std": 0.1791079193353653, "reward": 0.15168119966983795, "reward_std": 0.1791079193353653, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16855451464653015, "sampling/sampling_logp_difference/max": 1.5621957778930664, "sampling/importance_sampling_ratio/min": 0.2096751630306244, "sampling/importance_sampling_ratio/mean": 1.021122932434082, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2351923137903214, "clip_ratio/low_mean": 0.09063656628131866, "clip_ratio/low_min": 0.09063656628131866, "clip_ratio/high_mean": 0.04285037983208895, "clip_ratio/high_max": 0.04285037983208895, "clip_ratio/region_mean": 0.1334869461134076, "reward_total_mean": 0.15168119966983795, "reward_meter_mean": 0.3973170518875122, "reward_meter_std": 0.3878973424434662, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9215686917304993, "reward_lexical_plausibility_std": 0.15877632796764374, "reward_repeat_penalty_mean": 0.9658288955688477, "reward_repeat_penalty_std": 0.03947308659553528, "reward_repeat_floor_mean": 0.9948743581771851, "reward_repeat_floor_std": 0.005920974537730217, "reward_near_duplicate_penalty_mean": 0.9658288955688477, "reward_near_duplicate_penalty_std": 0.03947308659553528, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3212500214576721, "reward_judge_quality_std": 0.2721048891544342, "reward_total_composite_mean": 0.15168119966983795, "reward_total_composite_std": 0.1791079193353653} {"timestamp_utc": "2026-04-12T19:02:52Z", "mode": "train", "global_step": 829, "epoch": 0.04362928266933319, "loss": -0.0172, "grad_norm": 3.951854944229126, "learning_rate": 7.490909090909092e-06, "num_tokens": 1485180.0, "completions/mean_length": 85.375, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 24.428571701049805, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.8694266080856323, "rewards/meter/std": 0.34493935108184814, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9419781565666199, "rewards/lexical_plausibility/std": 0.16411055624485016, "rewards/judge_quality/mean": 0.38374999165534973, "rewards/judge_quality/std": 0.2579555809497833, "rewards/repeat_penalty/mean": 0.6539329290390015, "rewards/repeat_penalty/std": 0.10353017598390579, "rewards/repeat_floor/mean": 0.9666889905929565, "rewards/repeat_floor/std": 0.01966666430234909, "rewards/near_duplicate_penalty/mean": 0.8944945335388184, "rewards/near_duplicate_penalty/std": 0.11550140380859375, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9723865985870361, "rewards/distinct_2/std": 0.051303714513778687, "rewards/total_composite/mean": 0.2763935625553131, "rewards/total_composite/std": 0.23508165776729584, "reward": 0.2763935625553131, "reward_std": 0.23508165776729584, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16341540217399597, "sampling/sampling_logp_difference/max": 1.1937992572784424, "sampling/importance_sampling_ratio/min": 0.3030676245689392, "sampling/importance_sampling_ratio/mean": 1.0650129318237305, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2643106579780579, "clip_ratio/low_mean": 0.06530423276126385, "clip_ratio/low_min": 0.06530423276126385, "clip_ratio/high_mean": 0.08446558006107807, "clip_ratio/high_max": 0.08446558006107807, "clip_ratio/region_mean": 0.14976981282234192, "reward_total_mean": 0.2763935625553131, "reward_meter_mean": 0.8694266080856323, "reward_meter_std": 0.34493935108184814, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9419781565666199, "reward_lexical_plausibility_std": 0.16411055624485016, "reward_repeat_penalty_mean": 0.6539329290390015, "reward_repeat_penalty_std": 0.10353017598390579, "reward_repeat_floor_mean": 0.9666889905929565, "reward_repeat_floor_std": 0.01966666430234909, "reward_near_duplicate_penalty_mean": 0.8944945335388184, "reward_near_duplicate_penalty_std": 0.11550140380859375, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9723865985870361, "reward_distinct_2_std": 0.051303714513778687, "reward_judge_quality_mean": 0.38374999165534973, "reward_judge_quality_std": 0.2579555809497833, "reward_total_composite_mean": 0.2763935625553131, "reward_total_composite_std": 0.23508165776729584} {"timestamp_utc": "2026-04-12T19:03:00Z", "mode": "train", "global_step": 830, "epoch": 0.043681911478343244, "loss": -0.0495, "grad_norm": 15.028091430664062, "learning_rate": 7.487878787878788e-06, "num_tokens": 1486573.0, "completions/mean_length": 30.125, "completions/min_length": 18.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.125, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.7560732364654541, "rewards/meter/std": 0.38195741176605225, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6937500238418579, "rewards/judge_quality/std": 0.32275325059890747, "rewards/repeat_penalty/mean": 0.8598579168319702, "rewards/repeat_penalty/std": 0.11858725547790527, "rewards/repeat_floor/mean": 0.9902286529541016, "rewards/repeat_floor/std": 0.006109093781560659, "rewards/near_duplicate_penalty/mean": 0.9848579168319702, "rewards/near_duplicate_penalty/std": 0.023067161440849304, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4428815245628357, "rewards/total_composite/std": 0.3357965052127838, "reward": 0.4428815245628357, "reward_std": 0.3357965052127838, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18034382164478302, "sampling/sampling_logp_difference/max": 2.771963357925415, "sampling/importance_sampling_ratio/min": 0.06253910064697266, "sampling/importance_sampling_ratio/mean": 1.0282163619995117, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4569306150078773, "clip_ratio/low_mean": 0.10260999295860529, "clip_ratio/low_min": 0.10260999295860529, "clip_ratio/high_mean": 0.07610336877405643, "clip_ratio/high_max": 0.07610336877405643, "clip_ratio/region_mean": 0.17871336173266172, "reward_total_mean": 0.4428815245628357, "reward_meter_mean": 0.7560732364654541, "reward_meter_std": 0.38195741176605225, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8598579168319702, "reward_repeat_penalty_std": 0.11858725547790527, "reward_repeat_floor_mean": 0.9902286529541016, "reward_repeat_floor_std": 0.006109093781560659, "reward_near_duplicate_penalty_mean": 0.9848579168319702, "reward_near_duplicate_penalty_std": 0.023067161440849304, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6937500238418579, "reward_judge_quality_std": 0.32275325059890747, "reward_total_composite_mean": 0.4428815245628357, "reward_total_composite_std": 0.3357965052127838} {"timestamp_utc": "2026-04-12T19:03:12Z", "mode": "train", "global_step": 831, "epoch": 0.043734540287353296, "loss": -0.0022, "grad_norm": 4.951153755187988, "learning_rate": 7.484848484848486e-06, "num_tokens": 1487930.0, "completions/mean_length": 82.625, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 21.285715103149414, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.4101417660713196, "rewards/meter/std": 0.4823291301727295, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9279738068580627, "rewards/lexical_plausibility/std": 0.17980211973190308, "rewards/judge_quality/mean": 0.5262500047683716, "rewards/judge_quality/std": 0.3414648175239563, "rewards/repeat_penalty/mean": 0.7275309562683105, "rewards/repeat_penalty/std": 0.06355194747447968, "rewards/repeat_floor/mean": 0.980506181716919, "rewards/repeat_floor/std": 0.012710394337773323, "rewards/near_duplicate_penalty/mean": 0.9700413346290588, "rewards/near_duplicate_penalty/std": 0.0847359448671341, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2975137233734131, "rewards/total_composite/std": 0.38895219564437866, "reward": 0.2975137233734131, "reward_std": 0.38895219564437866, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1963077336549759, "sampling/sampling_logp_difference/max": 1.481719970703125, "sampling/importance_sampling_ratio/min": 0.2272465080022812, "sampling/importance_sampling_ratio/mean": 1.046219825744629, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4422542601823807, "clip_ratio/low_mean": 0.07865530252456665, "clip_ratio/low_min": 0.07865530252456665, "clip_ratio/high_mean": 0.0575396828353405, "clip_ratio/high_max": 0.0575396828353405, "clip_ratio/region_mean": 0.13619498535990715, "reward_total_mean": 0.2975137233734131, "reward_meter_mean": 0.4101417660713196, "reward_meter_std": 0.4823291301727295, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9279738068580627, "reward_lexical_plausibility_std": 0.17980211973190308, "reward_repeat_penalty_mean": 0.7275309562683105, "reward_repeat_penalty_std": 0.06355194747447968, "reward_repeat_floor_mean": 0.980506181716919, "reward_repeat_floor_std": 0.012710394337773323, "reward_near_duplicate_penalty_mean": 0.9700413346290588, "reward_near_duplicate_penalty_std": 0.0847359448671341, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5262500047683716, "reward_judge_quality_std": 0.3414648175239563, "reward_total_composite_mean": 0.2975137233734131, "reward_total_composite_std": 0.38895219564437866} {"timestamp_utc": "2026-04-12T19:03:20Z", "mode": "train", "global_step": 832, "epoch": 0.04378716909636335, "loss": 0.1042, "grad_norm": 21.915010452270508, "learning_rate": 7.481818181818182e-06, "num_tokens": 1489385.0, "completions/mean_length": 28.875, "completions/min_length": 15.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.875, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.7020453810691833, "rewards/meter/std": 0.4006826877593994, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.8433008790016174, "rewards/repeat_penalty/std": 0.11093761026859283, "rewards/repeat_floor/mean": 0.9854938387870789, "rewards/repeat_floor/std": 0.009750976227223873, "rewards/near_duplicate_penalty/mean": 0.9518063068389893, "rewards/near_duplicate_penalty/std": 0.05563024803996086, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9816433191299438, "rewards/distinct_2/std": 0.03404124453663826, "rewards/total_composite/mean": 0.2792567312717438, "rewards/total_composite/std": 0.16881141066551208, "reward": 0.2792567312717438, "reward_std": 0.16881141066551208, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19659152626991272, "sampling/sampling_logp_difference/max": 1.4823060035705566, "sampling/importance_sampling_ratio/min": 0.22711338102817535, "sampling/importance_sampling_ratio/mean": 1.0340520143508911, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2338368371129036, "clip_ratio/low_mean": 0.05188230890780687, "clip_ratio/low_min": 0.05188230890780687, "clip_ratio/high_mean": 0.10351192578673363, "clip_ratio/high_max": 0.10351192578673363, "clip_ratio/region_mean": 0.1553942346945405, "reward_total_mean": 0.2792567312717438, "reward_meter_mean": 0.7020453810691833, "reward_meter_std": 0.4006826877593994, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8433008790016174, "reward_repeat_penalty_std": 0.11093761026859283, "reward_repeat_floor_mean": 0.9854938387870789, "reward_repeat_floor_std": 0.009750976227223873, "reward_near_duplicate_penalty_mean": 0.9518063068389893, "reward_near_duplicate_penalty_std": 0.05563024803996086, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9816433191299438, "reward_distinct_2_std": 0.03404124453663826, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.2792567312717438, "reward_total_composite_std": 0.16881141066551208} {"timestamp_utc": "2026-04-12T19:03:34Z", "mode": "train", "global_step": 833, "epoch": 0.0438397979053734, "loss": -0.0401, "grad_norm": 1.4332927465438843, "learning_rate": 7.47878787878788e-06, "num_tokens": 1491117.0, "completions/mean_length": 273.5, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 35.0, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.894349217414856, "rewards/meter/std": 0.19056905806064606, "rewards/count_adherence/mean": 0.45000001788139343, "rewards/count_adherence/std": 0.23299294710159302, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.8349999785423279, "rewards/count_floor/std": 0.06989789009094238, "rewards/lexical_plausibility/mean": 0.8141950368881226, "rewards/lexical_plausibility/std": 0.20056737959384918, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.8730959892272949, "rewards/repeat_penalty/std": 0.1404113918542862, "rewards/repeat_floor/mean": 0.9892293810844421, "rewards/repeat_floor/std": 0.01229516789317131, "rewards/near_duplicate_penalty/mean": 0.9713583588600159, "rewards/near_duplicate_penalty/std": 0.04979393258690834, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.990562379360199, "rewards/distinct_2/std": 0.02513767220079899, "rewards/total_composite/mean": 0.1059030294418335, "rewards/total_composite/std": 0.08801984786987305, "reward": 0.1059030294418335, "reward_std": 0.08801984041929245, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18387942016124725, "sampling/sampling_logp_difference/max": 0.9939770698547363, "sampling/importance_sampling_ratio/min": 0.4053056538105011, "sampling/importance_sampling_ratio/mean": 1.087215542793274, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9216035902500153, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.06770982779562473, "clip_ratio/high_max": 0.06770982779562473, "clip_ratio/region_mean": 0.06770982779562473, "reward_total_mean": 0.1059030294418335, "reward_meter_mean": 0.894349217414856, "reward_meter_std": 0.19056905806064606, "reward_count_adherence_mean": 0.45000001788139343, "reward_count_adherence_std": 0.23299294710159302, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.8349999785423279, "reward_count_floor_std": 0.06989789009094238, "reward_lexical_plausibility_mean": 0.8141950368881226, "reward_lexical_plausibility_std": 0.20056737959384918, "reward_repeat_penalty_mean": 0.8730959892272949, "reward_repeat_penalty_std": 0.1404113918542862, "reward_repeat_floor_mean": 0.9892293810844421, "reward_repeat_floor_std": 0.01229516789317131, "reward_near_duplicate_penalty_mean": 0.9713583588600159, "reward_near_duplicate_penalty_std": 0.04979393258690834, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.990562379360199, "reward_distinct_2_std": 0.02513767220079899, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.1059030294418335, "reward_total_composite_std": 0.08801984786987305} {"timestamp_utc": "2026-04-12T19:03:49Z", "mode": "train", "global_step": 834, "epoch": 0.04389242671438345, "loss": -0.092, "grad_norm": 7.298940658569336, "learning_rate": 7.4757575757575765e-06, "num_tokens": 1493009.0, "completions/mean_length": 109.5, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 52.000003814697266, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.6640127897262573, "rewards/meter/std": 0.3662632405757904, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9455872178077698, "rewards/lexical_plausibility/std": 0.15390260517597198, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1922609806060791, "rewards/repeat_penalty/mean": 0.8738936185836792, "rewards/repeat_penalty/std": 0.07922649383544922, "rewards/repeat_floor/mean": 0.9838800430297852, "rewards/repeat_floor/std": 0.009779521264135838, "rewards/near_duplicate_penalty/mean": 0.9276025295257568, "rewards/near_duplicate_penalty/std": 0.04741376265883446, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9415521025657654, "rewards/distinct_2/std": 0.06024651601910591, "rewards/total_composite/mean": 0.1933053433895111, "rewards/total_composite/std": 0.1433020532131195, "reward": 0.1933053433895111, "reward_std": 0.1433020681142807, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.156411275267601, "sampling/sampling_logp_difference/max": 1.525448203086853, "sampling/importance_sampling_ratio/min": 0.21752354502677917, "sampling/importance_sampling_ratio/mean": 1.0328177213668823, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9312049373984337, "clip_ratio/low_mean": 0.0673882495611906, "clip_ratio/low_min": 0.0673882495611906, "clip_ratio/high_mean": 0.05761074647307396, "clip_ratio/high_max": 0.05761074647307396, "clip_ratio/region_mean": 0.12499899603426456, "reward_total_mean": 0.1933053433895111, "reward_meter_mean": 0.6640127897262573, "reward_meter_std": 0.3662632405757904, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9455872178077698, "reward_lexical_plausibility_std": 0.15390260517597198, "reward_repeat_penalty_mean": 0.8738936185836792, "reward_repeat_penalty_std": 0.07922649383544922, "reward_repeat_floor_mean": 0.9838800430297852, "reward_repeat_floor_std": 0.009779521264135838, "reward_near_duplicate_penalty_mean": 0.9276025295257568, "reward_near_duplicate_penalty_std": 0.04741376265883446, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9415521025657654, "reward_distinct_2_std": 0.06024651601910591, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1922609806060791, "reward_total_composite_mean": 0.1933053433895111, "reward_total_composite_std": 0.1433020532131195} {"timestamp_utc": "2026-04-12T19:04:03Z", "mode": "train", "global_step": 835, "epoch": 0.043945055523393506, "loss": -0.0257, "grad_norm": 3.7628729343414307, "learning_rate": 7.472727272727274e-06, "num_tokens": 1494785.0, "completions/mean_length": 92.0, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 32.0, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 93.0, "rewards/meter/mean": 0.9261429905891418, "rewards/meter/std": 0.1502811312675476, "rewards/count_adherence/mean": 0.2750000059604645, "rewards/count_adherence/std": 0.2121320366859436, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.7825000286102295, "rewards/count_floor/std": 0.06363961845636368, "rewards/lexical_plausibility/mean": 0.9328755140304565, "rewards/lexical_plausibility/std": 0.18985673785209656, "rewards/judge_quality/mean": 0.4674999713897705, "rewards/judge_quality/std": 0.3022179901599884, "rewards/repeat_penalty/mean": 0.7128247618675232, "rewards/repeat_penalty/std": 0.05981914699077606, "rewards/repeat_floor/mean": 0.9769024848937988, "rewards/repeat_floor/std": 0.011665260419249535, "rewards/near_duplicate_penalty/mean": 0.9585079550743103, "rewards/near_duplicate_penalty/std": 0.05751679837703705, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9583480954170227, "rewards/distinct_2/std": 0.08286898583173752, "rewards/total_composite/mean": 0.3452942371368408, "rewards/total_composite/std": 0.2219136357307434, "reward": 0.3452942371368408, "reward_std": 0.22191362082958221, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13392537832260132, "sampling/sampling_logp_difference/max": 1.2734620571136475, "sampling/importance_sampling_ratio/min": 0.2798610329627991, "sampling/importance_sampling_ratio/mean": 1.0565990209579468, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8899519741535187, "clip_ratio/low_mean": 0.10612781345844269, "clip_ratio/low_min": 0.10612781345844269, "clip_ratio/high_mean": 0.030208333861082792, "clip_ratio/high_max": 0.030208333861082792, "clip_ratio/region_mean": 0.13633614731952548, "reward_total_mean": 0.3452942371368408, "reward_meter_mean": 0.9261429905891418, "reward_meter_std": 0.1502811312675476, "reward_count_adherence_mean": 0.2750000059604645, "reward_count_adherence_std": 0.2121320366859436, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.7825000286102295, "reward_count_floor_std": 0.06363961845636368, "reward_lexical_plausibility_mean": 0.9328755140304565, "reward_lexical_plausibility_std": 0.18985673785209656, "reward_repeat_penalty_mean": 0.7128247618675232, "reward_repeat_penalty_std": 0.05981914699077606, "reward_repeat_floor_mean": 0.9769024848937988, "reward_repeat_floor_std": 0.011665260419249535, "reward_near_duplicate_penalty_mean": 0.9585079550743103, "reward_near_duplicate_penalty_std": 0.05751679837703705, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9583480954170227, "reward_distinct_2_std": 0.08286898583173752, "reward_judge_quality_mean": 0.4674999713897705, "reward_judge_quality_std": 0.3022179901599884, "reward_total_composite_mean": 0.3452942371368408, "reward_total_composite_std": 0.2219136357307434} {"timestamp_utc": "2026-04-12T19:04:11Z", "mode": "train", "global_step": 836, "epoch": 0.04399768433240356, "loss": 0.0434, "grad_norm": 15.561553001403809, "learning_rate": 7.46969696969697e-06, "num_tokens": 1496297.0, "completions/mean_length": 35.0, "completions/min_length": 22.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.0, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.859635591506958, "rewards/meter/std": 0.3367502987384796, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.27969372272491455, "rewards/repeat_penalty/mean": 0.9460607767105103, "rewards/repeat_penalty/std": 0.0891919881105423, "rewards/repeat_floor/mean": 0.9952001571655273, "rewards/repeat_floor/std": 0.006399350706487894, "rewards/near_duplicate_penalty/mean": 0.9859956502914429, "rewards/near_duplicate_penalty/std": 0.020329361781477928, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.42820051312446594, "rewards/total_composite/std": 0.3306257426738739, "reward": 0.42820051312446594, "reward_std": 0.3306257426738739, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16682808101177216, "sampling/sampling_logp_difference/max": 1.4321937561035156, "sampling/importance_sampling_ratio/min": 0.238784521818161, "sampling/importance_sampling_ratio/mean": 1.0416346788406372, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.441406436264515, "clip_ratio/low_mean": 0.06633158819749951, "clip_ratio/low_min": 0.06633158819749951, "clip_ratio/high_mean": 0.07771610654890537, "clip_ratio/high_max": 0.07771610654890537, "clip_ratio/region_mean": 0.1440476947464049, "reward_total_mean": 0.42820051312446594, "reward_meter_mean": 0.859635591506958, "reward_meter_std": 0.3367502987384796, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9460607767105103, "reward_repeat_penalty_std": 0.0891919881105423, "reward_repeat_floor_mean": 0.9952001571655273, "reward_repeat_floor_std": 0.006399350706487894, "reward_near_duplicate_penalty_mean": 0.9859956502914429, "reward_near_duplicate_penalty_std": 0.020329361781477928, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.27969372272491455, "reward_total_composite_mean": 0.42820051312446594, "reward_total_composite_std": 0.3306257426738739} {"timestamp_utc": "2026-04-12T19:04:25Z", "mode": "train", "global_step": 837, "epoch": 0.04405031314141361, "loss": -0.0316, "grad_norm": 5.0076398849487305, "learning_rate": 7.4666666666666675e-06, "num_tokens": 1497699.0, "completions/mean_length": 86.25, "completions/min_length": 22.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 25.428571701049805, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.863968014717102, "rewards/meter/std": 0.3293401300907135, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9573074579238892, "rewards/lexical_plausibility/std": 0.1207527220249176, "rewards/judge_quality/mean": 0.5762499570846558, "rewards/judge_quality/std": 0.3882538676261902, "rewards/repeat_penalty/mean": 0.7407181262969971, "rewards/repeat_penalty/std": 0.023893872275948524, "rewards/repeat_floor/mean": 0.9832043647766113, "rewards/repeat_floor/std": 0.0047911605797708035, "rewards/near_duplicate_penalty/mean": 0.9886363744735718, "rewards/near_duplicate_penalty/std": 0.03214120864868164, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9989878535270691, "rewards/distinct_2/std": 0.002862782683223486, "rewards/total_composite/mean": 0.5511993169784546, "rewards/total_composite/std": 0.38762637972831726, "reward": 0.5511993169784546, "reward_std": 0.38762637972831726, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19810850918293, "sampling/sampling_logp_difference/max": 1.3831443786621094, "sampling/importance_sampling_ratio/min": 0.25078874826431274, "sampling/importance_sampling_ratio/mean": 1.0525456666946411, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4116116017103195, "clip_ratio/low_mean": 0.0786894503980875, "clip_ratio/low_min": 0.0786894503980875, "clip_ratio/high_mean": 0.08216579630970955, "clip_ratio/high_max": 0.08216579630970955, "clip_ratio/region_mean": 0.16085524670779705, "reward_total_mean": 0.5511993169784546, "reward_meter_mean": 0.863968014717102, "reward_meter_std": 0.3293401300907135, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9573074579238892, "reward_lexical_plausibility_std": 0.1207527220249176, "reward_repeat_penalty_mean": 0.7407181262969971, "reward_repeat_penalty_std": 0.023893872275948524, "reward_repeat_floor_mean": 0.9832043647766113, "reward_repeat_floor_std": 0.0047911605797708035, "reward_near_duplicate_penalty_mean": 0.9886363744735718, "reward_near_duplicate_penalty_std": 0.03214120864868164, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9989878535270691, "reward_distinct_2_std": 0.002862782683223486, "reward_judge_quality_mean": 0.5762499570846558, "reward_judge_quality_std": 0.3882538676261902, "reward_total_composite_mean": 0.5511993169784546, "reward_total_composite_std": 0.38762637972831726} {"timestamp_utc": "2026-04-12T19:04:38Z", "mode": "train", "global_step": 838, "epoch": 0.04410294195042366, "loss": -0.1328, "grad_norm": 2.026712417602539, "learning_rate": 7.463636363636364e-06, "num_tokens": 1499613.0, "completions/mean_length": 109.25, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.71428680419922, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 121.0, "rewards/meter/mean": 0.8534479141235352, "rewards/meter/std": 0.346881240606308, "rewards/count_adherence/mean": 0.2916666865348816, "rewards/count_adherence/std": 0.2920915186405182, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.7875000238418579, "rewards/count_floor/std": 0.08762745559215546, "rewards/lexical_plausibility/mean": 0.9461221694946289, "rewards/lexical_plausibility/std": 0.15238943696022034, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.6931389570236206, "rewards/repeat_penalty/std": 0.22456727921962738, "rewards/repeat_floor/mean": 0.9684528112411499, "rewards/repeat_floor/std": 0.037759359925985336, "rewards/near_duplicate_penalty/mean": 0.913510799407959, "rewards/near_duplicate_penalty/std": 0.1730053871870041, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8977908492088318, "rewards/distinct_2/std": 0.15520550310611725, "rewards/total_composite/mean": 0.25702720880508423, "rewards/total_composite/std": 0.10999058932065964, "reward": 0.25702720880508423, "reward_std": 0.10999057441949844, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14010226726531982, "sampling/sampling_logp_difference/max": 1.5988950729370117, "sampling/importance_sampling_ratio/min": 0.20211972296237946, "sampling/importance_sampling_ratio/mean": 1.0227127075195312, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.005738541483879, "clip_ratio/low_mean": 0.020208333153277636, "clip_ratio/low_min": 0.020208333153277636, "clip_ratio/high_mean": 0.06495158607140183, "clip_ratio/high_max": 0.06495158607140183, "clip_ratio/region_mean": 0.08515991922467947, "reward_total_mean": 0.25702720880508423, "reward_meter_mean": 0.8534479141235352, "reward_meter_std": 0.346881240606308, "reward_count_adherence_mean": 0.2916666865348816, "reward_count_adherence_std": 0.2920915186405182, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.7875000238418579, "reward_count_floor_std": 0.08762745559215546, "reward_lexical_plausibility_mean": 0.9461221694946289, "reward_lexical_plausibility_std": 0.15238943696022034, "reward_repeat_penalty_mean": 0.6931389570236206, "reward_repeat_penalty_std": 0.22456727921962738, "reward_repeat_floor_mean": 0.9684528112411499, "reward_repeat_floor_std": 0.037759359925985336, "reward_near_duplicate_penalty_mean": 0.913510799407959, "reward_near_duplicate_penalty_std": 0.1730053871870041, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8977908492088318, "reward_distinct_2_std": 0.15520550310611725, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.25702720880508423, "reward_total_composite_std": 0.10999058932065964} {"timestamp_utc": "2026-04-12T19:04:52Z", "mode": "train", "global_step": 839, "epoch": 0.044155570759433715, "loss": -0.0398, "grad_norm": 2.6468305587768555, "learning_rate": 7.460606060606061e-06, "num_tokens": 1501046.0, "completions/mean_length": 148.125, "completions/min_length": 15.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 26.83333396911621, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.5430874824523926, "rewards/meter/std": 0.42536190152168274, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.37796446681022644, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.11338934302330017, "rewards/lexical_plausibility/mean": 0.8956800103187561, "rewards/lexical_plausibility/std": 0.19437187910079956, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.3543177545070648, "rewards/repeat_penalty/mean": 0.9212819337844849, "rewards/repeat_penalty/std": 0.10672668367624283, "rewards/repeat_floor/mean": 0.9938173294067383, "rewards/repeat_floor/std": 0.005868623033165932, "rewards/near_duplicate_penalty/mean": 0.9837819337844849, "rewards/near_duplicate_penalty/std": 0.017736751586198807, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1994948834180832, "rewards/total_composite/std": 0.1772877722978592, "reward": 0.1994948834180832, "reward_std": 0.1772877722978592, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1593082994222641, "sampling/sampling_logp_difference/max": 1.3116185665130615, "sampling/importance_sampling_ratio/min": 0.26938366889953613, "sampling/importance_sampling_ratio/mean": 1.0183340311050415, "sampling/importance_sampling_ratio/max": 1.8916113376617432, "entropy": 0.7173252999782562, "clip_ratio/low_mean": 0.031547619961202145, "clip_ratio/low_min": 0.031547619961202145, "clip_ratio/high_mean": 0.09393939655274153, "clip_ratio/high_max": 0.09393939655274153, "clip_ratio/region_mean": 0.12548701651394367, "reward_total_mean": 0.1994948834180832, "reward_meter_mean": 0.5430874824523926, "reward_meter_std": 0.42536190152168274, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.37796446681022644, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.11338934302330017, "reward_lexical_plausibility_mean": 0.8956800103187561, "reward_lexical_plausibility_std": 0.19437187910079956, "reward_repeat_penalty_mean": 0.9212819337844849, "reward_repeat_penalty_std": 0.10672668367624283, "reward_repeat_floor_mean": 0.9938173294067383, "reward_repeat_floor_std": 0.005868623033165932, "reward_near_duplicate_penalty_mean": 0.9837819337844849, "reward_near_duplicate_penalty_std": 0.017736751586198807, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.3543177545070648, "reward_total_composite_mean": 0.1994948834180832, "reward_total_composite_std": 0.1772877722978592} {"timestamp_utc": "2026-04-12T19:05:05Z", "mode": "train", "global_step": 840, "epoch": 0.04420819956844377, "loss": -0.0813, "grad_norm": 2.4004197120666504, "learning_rate": 7.4575757575757575e-06, "num_tokens": 1502738.0, "completions/mean_length": 153.5, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 34.0, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.7789326906204224, "rewards/meter/std": 0.39128315448760986, "rewards/count_adherence/mean": 0.40625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8218749761581421, "rewards/count_floor/std": 0.05580180510878563, "rewards/lexical_plausibility/mean": 0.8987300395965576, "rewards/lexical_plausibility/std": 0.18911586701869965, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.8428071737289429, "rewards/repeat_penalty/std": 0.1011408269405365, "rewards/repeat_floor/mean": 0.988522469997406, "rewards/repeat_floor/std": 0.004091145470738411, "rewards/near_duplicate_penalty/mean": 0.9826459884643555, "rewards/near_duplicate_penalty/std": 0.019330358132719994, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9847284555435181, "rewards/distinct_2/std": 0.029517238959670067, "rewards/total_composite/mean": 0.20652464032173157, "rewards/total_composite/std": 0.14455179870128632, "reward": 0.20652464032173157, "reward_std": 0.14455178380012512, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16030967235565186, "sampling/sampling_logp_difference/max": 1.276998519897461, "sampling/importance_sampling_ratio/min": 0.2788730561733246, "sampling/importance_sampling_ratio/mean": 0.9825403690338135, "sampling/importance_sampling_ratio/max": 1.8128416538238525, "entropy": 0.8350357115268707, "clip_ratio/low_mean": 0.012195121496915817, "clip_ratio/low_min": 0.012195121496915817, "clip_ratio/high_mean": 0.11779505293816328, "clip_ratio/high_max": 0.11779505293816328, "clip_ratio/region_mean": 0.1299901744350791, "reward_total_mean": 0.20652464032173157, "reward_meter_mean": 0.7789326906204224, "reward_meter_std": 0.39128315448760986, "reward_count_adherence_mean": 0.40625, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8218749761581421, "reward_count_floor_std": 0.05580180510878563, "reward_lexical_plausibility_mean": 0.8987300395965576, "reward_lexical_plausibility_std": 0.18911586701869965, "reward_repeat_penalty_mean": 0.8428071737289429, "reward_repeat_penalty_std": 0.1011408269405365, "reward_repeat_floor_mean": 0.988522469997406, "reward_repeat_floor_std": 0.004091145470738411, "reward_near_duplicate_penalty_mean": 0.9826459884643555, "reward_near_duplicate_penalty_std": 0.019330358132719994, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9847284555435181, "reward_distinct_2_std": 0.029517238959670067, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.20652464032173157, "reward_total_composite_std": 0.14455179870128632} {"timestamp_utc": "2026-04-12T19:05:14Z", "mode": "train", "global_step": 841, "epoch": 0.04426082837745382, "loss": 0.0059, "grad_norm": 16.900815963745117, "learning_rate": 7.454545454545456e-06, "num_tokens": 1504198.0, "completions/mean_length": 24.5, "completions/min_length": 21.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.5, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.8961358070373535, "rewards/meter/std": 0.26502135396003723, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.6599999666213989, "rewards/judge_quality/std": 0.30956190824508667, "rewards/repeat_penalty/mean": 0.7792832255363464, "rewards/repeat_penalty/std": 0.08935283869504929, "rewards/repeat_floor/mean": 0.9864816665649414, "rewards/repeat_floor/std": 0.005572130437940359, "rewards/near_duplicate_penalty/mean": 0.9973776340484619, "rewards/near_duplicate_penalty/std": 0.007417213171720505, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5365504026412964, "rewards/total_composite/std": 0.28162628412246704, "reward": 0.5365504026412964, "reward_std": 0.28162631392478943, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13926811516284943, "sampling/sampling_logp_difference/max": 1.2954695224761963, "sampling/importance_sampling_ratio/min": 0.2737692892551422, "sampling/importance_sampling_ratio/mean": 1.0077086687088013, "sampling/importance_sampling_ratio/max": 1.8900736570358276, "entropy": 1.2510548532009125, "clip_ratio/low_mean": 0.04569361265748739, "clip_ratio/low_min": 0.04569361265748739, "clip_ratio/high_mean": 0.07435035659000278, "clip_ratio/high_max": 0.07435035659000278, "clip_ratio/region_mean": 0.12004396924749017, "reward_total_mean": 0.5365504026412964, "reward_meter_mean": 0.8961358070373535, "reward_meter_std": 0.26502135396003723, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.7792832255363464, "reward_repeat_penalty_std": 0.08935283869504929, "reward_repeat_floor_mean": 0.9864816665649414, "reward_repeat_floor_std": 0.005572130437940359, "reward_near_duplicate_penalty_mean": 0.9973776340484619, "reward_near_duplicate_penalty_std": 0.007417213171720505, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6599999666213989, "reward_judge_quality_std": 0.30956190824508667, "reward_total_composite_mean": 0.5365504026412964, "reward_total_composite_std": 0.28162628412246704} {"timestamp_utc": "2026-04-12T19:05:27Z", "mode": "train", "global_step": 842, "epoch": 0.04431345718646387, "loss": -0.1469, "grad_norm": 3.475796937942505, "learning_rate": 7.451515151515152e-06, "num_tokens": 1506110.0, "completions/mean_length": 104.0, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 45.71428680419922, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.8337839841842651, "rewards/meter/std": 0.31833702325820923, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.22160132229328156, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.06648041307926178, "rewards/lexical_plausibility/mean": 0.9493201971054077, "rewards/lexical_plausibility/std": 0.1433442085981369, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.18850918114185333, "rewards/repeat_penalty/mean": 0.8963936567306519, "rewards/repeat_penalty/std": 0.11243993043899536, "rewards/repeat_floor/mean": 0.9904098510742188, "rewards/repeat_floor/std": 0.008146839216351509, "rewards/near_duplicate_penalty/mean": 0.9678531289100647, "rewards/near_duplicate_penalty/std": 0.02587353065609932, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9886877536773682, "rewards/distinct_2/std": 0.031995780766010284, "rewards/total_composite/mean": 0.29200267791748047, "rewards/total_composite/std": 0.16657792031764984, "reward": 0.29200267791748047, "reward_std": 0.16657790541648865, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14423060417175293, "sampling/sampling_logp_difference/max": 1.0531961917877197, "sampling/importance_sampling_ratio/min": 0.3488210439682007, "sampling/importance_sampling_ratio/mean": 1.0366005897521973, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1190107315778732, "clip_ratio/low_mean": 0.0438988097012043, "clip_ratio/low_min": 0.0438988097012043, "clip_ratio/high_mean": 0.08323159534484148, "clip_ratio/high_max": 0.08323159534484148, "clip_ratio/region_mean": 0.12713040504604578, "reward_total_mean": 0.29200267791748047, "reward_meter_mean": 0.8337839841842651, "reward_meter_std": 0.31833702325820923, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.22160132229328156, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.06648041307926178, "reward_lexical_plausibility_mean": 0.9493201971054077, "reward_lexical_plausibility_std": 0.1433442085981369, "reward_repeat_penalty_mean": 0.8963936567306519, "reward_repeat_penalty_std": 0.11243993043899536, "reward_repeat_floor_mean": 0.9904098510742188, "reward_repeat_floor_std": 0.008146839216351509, "reward_near_duplicate_penalty_mean": 0.9678531289100647, "reward_near_duplicate_penalty_std": 0.02587353065609932, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9886877536773682, "reward_distinct_2_std": 0.031995780766010284, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.18850918114185333, "reward_total_composite_mean": 0.29200267791748047, "reward_total_composite_std": 0.16657792031764984} {"timestamp_utc": "2026-04-12T19:05:42Z", "mode": "train", "global_step": 843, "epoch": 0.044366085995473925, "loss": -0.0795, "grad_norm": 3.2899844646453857, "learning_rate": 7.448484848484849e-06, "num_tokens": 1507628.0, "completions/mean_length": 87.75, "completions/min_length": 25.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 27.142858505249023, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 30.0, "rewards/meter/mean": 0.8925532102584839, "rewards/meter/std": 0.2252667397260666, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9658455848693848, "rewards/lexical_plausibility/std": 0.09660319238901138, "rewards/judge_quality/mean": 0.7524999976158142, "rewards/judge_quality/std": 0.32805708050727844, "rewards/repeat_penalty/mean": 0.7741244435310364, "rewards/repeat_penalty/std": 0.09342192858457565, "rewards/repeat_floor/mean": 0.9854499101638794, "rewards/repeat_floor/std": 0.0071049463003873825, "rewards/near_duplicate_penalty/mean": 0.9904992580413818, "rewards/near_duplicate_penalty/std": 0.02687215805053711, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6136301755905151, "rewards/total_composite/std": 0.28744563460350037, "reward": 0.6136301755905151, "reward_std": 0.28744563460350037, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17705973982810974, "sampling/sampling_logp_difference/max": 2.3522167205810547, "sampling/importance_sampling_ratio/min": 0.09515798836946487, "sampling/importance_sampling_ratio/mean": 1.0532846450805664, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0713282823562622, "clip_ratio/low_mean": 0.024038461968302727, "clip_ratio/low_min": 0.024038461968302727, "clip_ratio/high_mean": 0.14989417977631092, "clip_ratio/high_max": 0.14989417977631092, "clip_ratio/region_mean": 0.17393264174461365, "reward_total_mean": 0.6136301755905151, "reward_meter_mean": 0.8925532102584839, "reward_meter_std": 0.2252667397260666, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9658455848693848, "reward_lexical_plausibility_std": 0.09660319238901138, "reward_repeat_penalty_mean": 0.7741244435310364, "reward_repeat_penalty_std": 0.09342192858457565, "reward_repeat_floor_mean": 0.9854499101638794, "reward_repeat_floor_std": 0.0071049463003873825, "reward_near_duplicate_penalty_mean": 0.9904992580413818, "reward_near_duplicate_penalty_std": 0.02687215805053711, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7524999976158142, "reward_judge_quality_std": 0.32805708050727844, "reward_total_composite_mean": 0.6136301755905151, "reward_total_composite_std": 0.28744563460350037} {"timestamp_utc": "2026-04-12T19:05:55Z", "mode": "train", "global_step": 844, "epoch": 0.04441871480448398, "loss": -0.0654, "grad_norm": 3.3934338092803955, "learning_rate": 7.445454545454546e-06, "num_tokens": 1509111.0, "completions/mean_length": 85.375, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 24.428571701049805, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.859717845916748, "rewards/meter/std": 0.34734803438186646, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9550939798355103, "rewards/lexical_plausibility/std": 0.1270134598016739, "rewards/judge_quality/mean": 0.5637499690055847, "rewards/judge_quality/std": 0.32275325059890747, "rewards/repeat_penalty/mean": 0.6278575658798218, "rewards/repeat_penalty/std": 0.2103126049041748, "rewards/repeat_floor/mean": 0.9592983722686768, "rewards/repeat_floor/std": 0.03865781053900719, "rewards/near_duplicate_penalty/mean": 0.8725221157073975, "rewards/near_duplicate_penalty/std": 0.14677858352661133, "rewards/opening_diversity/mean": 0.734375, "rewards/opening_diversity/std": 0.16952534019947052, "rewards/distinct_2/mean": 0.93730628490448, "rewards/distinct_2/std": 0.12876898050308228, "rewards/total_composite/mean": 0.4694211483001709, "rewards/total_composite/std": 0.29148513078689575, "reward": 0.4694211483001709, "reward_std": 0.29148513078689575, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10539094358682632, "sampling/sampling_logp_difference/max": 1.079148292541504, "sampling/importance_sampling_ratio/min": 0.339884877204895, "sampling/importance_sampling_ratio/mean": 1.0035425424575806, "sampling/importance_sampling_ratio/max": 1.9466650485992432, "entropy": 0.7305092141032219, "clip_ratio/low_mean": 0.043347952887415886, "clip_ratio/low_min": 0.043347952887415886, "clip_ratio/high_mean": 0.04401119751855731, "clip_ratio/high_max": 0.04401119751855731, "clip_ratio/region_mean": 0.0873591504059732, "reward_total_mean": 0.4694211483001709, "reward_meter_mean": 0.859717845916748, "reward_meter_std": 0.34734803438186646, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9550939798355103, "reward_lexical_plausibility_std": 0.1270134598016739, "reward_repeat_penalty_mean": 0.6278575658798218, "reward_repeat_penalty_std": 0.2103126049041748, "reward_repeat_floor_mean": 0.9592983722686768, "reward_repeat_floor_std": 0.03865781053900719, "reward_near_duplicate_penalty_mean": 0.8725221157073975, "reward_near_duplicate_penalty_std": 0.14677858352661133, "reward_opening_diversity_mean": 0.734375, "reward_opening_diversity_std": 0.16952534019947052, "reward_distinct_2_mean": 0.93730628490448, "reward_distinct_2_std": 0.12876898050308228, "reward_judge_quality_mean": 0.5637499690055847, "reward_judge_quality_std": 0.32275325059890747, "reward_total_composite_mean": 0.4694211483001709, "reward_total_composite_std": 0.29148513078689575} {"timestamp_utc": "2026-04-12T19:06:09Z", "mode": "train", "global_step": 845, "epoch": 0.04447134361349403, "loss": -0.0596, "grad_norm": 2.4339377880096436, "learning_rate": 7.442424242424243e-06, "num_tokens": 1510783.0, "completions/mean_length": 167.0, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 52.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.2763864994049072, "rewards/meter/std": 0.2573143243789673, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 0.882985532283783, "rewards/lexical_plausibility/std": 0.16474157571792603, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.9563765525817871, "rewards/repeat_penalty/std": 0.06135902926325798, "rewards/repeat_floor/mean": 0.9949256777763367, "rewards/repeat_floor/std": 0.006504016928374767, "rewards/near_duplicate_penalty/mean": 0.9824104905128479, "rewards/near_duplicate_penalty/std": 0.014516990631818771, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9729344844818115, "rewards/distinct_2/std": 0.05020807683467865, "rewards/total_composite/mean": 0.05921619385480881, "rewards/total_composite/std": 0.04154956713318825, "reward": 0.05921619385480881, "reward_std": 0.04154956713318825, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13828082382678986, "sampling/sampling_logp_difference/max": 1.2101831436157227, "sampling/importance_sampling_ratio/min": 0.298142671585083, "sampling/importance_sampling_ratio/mean": 1.0267951488494873, "sampling/importance_sampling_ratio/max": 1.8265711069107056, "entropy": 0.9513723403215408, "clip_ratio/low_mean": 0.037676410749554634, "clip_ratio/low_min": 0.037676410749554634, "clip_ratio/high_mean": 0.0447845128364861, "clip_ratio/high_max": 0.0447845128364861, "clip_ratio/region_mean": 0.08246092358604074, "reward_total_mean": 0.05921619385480881, "reward_meter_mean": 0.2763864994049072, "reward_meter_std": 0.2573143243789673, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 0.882985532283783, "reward_lexical_plausibility_std": 0.16474157571792603, "reward_repeat_penalty_mean": 0.9563765525817871, "reward_repeat_penalty_std": 0.06135902926325798, "reward_repeat_floor_mean": 0.9949256777763367, "reward_repeat_floor_std": 0.006504016928374767, "reward_near_duplicate_penalty_mean": 0.9824104905128479, "reward_near_duplicate_penalty_std": 0.014516990631818771, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9729344844818115, "reward_distinct_2_std": 0.05020807683467865, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.05921619385480881, "reward_total_composite_std": 0.04154956713318825} {"timestamp_utc": "2026-04-12T19:06:17Z", "mode": "train", "global_step": 846, "epoch": 0.044523972422504075, "loss": 0.0301, "grad_norm": 18.674097061157227, "learning_rate": 7.439393939393939e-06, "num_tokens": 1512310.0, "completions/mean_length": 27.875, "completions/min_length": 15.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.875, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.7191743850708008, "rewards/meter/std": 0.29383939504623413, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5762500166893005, "rewards/judge_quality/std": 0.30123260617256165, "rewards/repeat_penalty/mean": 0.7390232086181641, "rewards/repeat_penalty/std": 0.16861271858215332, "rewards/repeat_floor/mean": 0.9765577912330627, "rewards/repeat_floor/std": 0.01894167996942997, "rewards/near_duplicate_penalty/mean": 0.9490758180618286, "rewards/near_duplicate_penalty/std": 0.06547746807336807, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9494047164916992, "rewards/distinct_2/std": 0.07473616302013397, "rewards/total_composite/mean": 0.3512076139450073, "rewards/total_composite/std": 0.23876644670963287, "reward": 0.3512076139450073, "reward_std": 0.23876643180847168, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12690965831279755, "sampling/sampling_logp_difference/max": 2.050009250640869, "sampling/importance_sampling_ratio/min": 0.12873370945453644, "sampling/importance_sampling_ratio/mean": 0.9970605969429016, "sampling/importance_sampling_ratio/max": 1.8812642097473145, "entropy": 0.7203164547681808, "clip_ratio/low_mean": 0.07454182393848896, "clip_ratio/low_min": 0.07454182393848896, "clip_ratio/high_mean": 0.06880877818912268, "clip_ratio/high_max": 0.06880877818912268, "clip_ratio/region_mean": 0.14335060212761164, "reward_total_mean": 0.3512076139450073, "reward_meter_mean": 0.7191743850708008, "reward_meter_std": 0.29383939504623413, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7390232086181641, "reward_repeat_penalty_std": 0.16861271858215332, "reward_repeat_floor_mean": 0.9765577912330627, "reward_repeat_floor_std": 0.01894167996942997, "reward_near_duplicate_penalty_mean": 0.9490758180618286, "reward_near_duplicate_penalty_std": 0.06547746807336807, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9494047164916992, "reward_distinct_2_std": 0.07473616302013397, "reward_judge_quality_mean": 0.5762500166893005, "reward_judge_quality_std": 0.30123260617256165, "reward_total_composite_mean": 0.3512076139450073, "reward_total_composite_std": 0.23876644670963287} {"timestamp_utc": "2026-04-12T19:06:25Z", "mode": "train", "global_step": 847, "epoch": 0.04457660123151413, "loss": 0.0944, "grad_norm": 18.91111183166504, "learning_rate": 7.4363636363636375e-06, "num_tokens": 1513697.0, "completions/mean_length": 25.375, "completions/min_length": 17.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.375, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.8375080823898315, "rewards/meter/std": 0.32897061109542847, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.6353042721748352, "rewards/repeat_penalty/std": 0.1329401582479477, "rewards/repeat_floor/mean": 0.9605028629302979, "rewards/repeat_floor/std": 0.019854148849844933, "rewards/near_duplicate_penalty/mean": 0.8545929193496704, "rewards/near_duplicate_penalty/std": 0.11463391035795212, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9493215084075928, "rewards/distinct_2/std": 0.07687065005302429, "rewards/total_composite/mean": 0.25261372327804565, "rewards/total_composite/std": 0.12922576069831848, "reward": 0.25261372327804565, "reward_std": 0.12922576069831848, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1647508293390274, "sampling/sampling_logp_difference/max": 1.8061351776123047, "sampling/importance_sampling_ratio/min": 0.16428786516189575, "sampling/importance_sampling_ratio/mean": 1.0099539756774902, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8246480226516724, "clip_ratio/low_mean": 0.054459065198898315, "clip_ratio/low_min": 0.054459065198898315, "clip_ratio/high_mean": 0.11747966380789876, "clip_ratio/high_max": 0.11747966380789876, "clip_ratio/region_mean": 0.17193872900679708, "reward_total_mean": 0.25261372327804565, "reward_meter_mean": 0.8375080823898315, "reward_meter_std": 0.32897061109542847, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6353042721748352, "reward_repeat_penalty_std": 0.1329401582479477, "reward_repeat_floor_mean": 0.9605028629302979, "reward_repeat_floor_std": 0.019854148849844933, "reward_near_duplicate_penalty_mean": 0.8545929193496704, "reward_near_duplicate_penalty_std": 0.11463391035795212, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9493215084075928, "reward_distinct_2_std": 0.07687065005302429, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.25261372327804565, "reward_total_composite_std": 0.12922576069831848} {"timestamp_utc": "2026-04-12T19:06:34Z", "mode": "train", "global_step": 848, "epoch": 0.04462923004052418, "loss": 0.0029, "grad_norm": 15.614718437194824, "learning_rate": 7.433333333333334e-06, "num_tokens": 1515224.0, "completions/mean_length": 33.875, "completions/min_length": 28.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.875, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.5524039268493652, "rewards/meter/std": 0.4421142339706421, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.9797122478485107, "rewards/repeat_penalty/std": 0.030837321653962135, "rewards/repeat_floor/mean": 0.9969568252563477, "rewards/repeat_floor/std": 0.0046256063506007195, "rewards/near_duplicate_penalty/mean": 0.9797122478485107, "rewards/near_duplicate_penalty/std": 0.030837321653962135, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2150241732597351, "rewards/total_composite/std": 0.18644297122955322, "reward": 0.2150241732597351, "reward_std": 0.18644297122955322, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1725483387708664, "sampling/sampling_logp_difference/max": 2.9017302989959717, "sampling/importance_sampling_ratio/min": 0.054928094148635864, "sampling/importance_sampling_ratio/mean": 1.0425009727478027, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1987946033477783, "clip_ratio/low_mean": 0.0832839971408248, "clip_ratio/low_min": 0.0832839971408248, "clip_ratio/high_mean": 0.07823642995208502, "clip_ratio/high_max": 0.07823642995208502, "clip_ratio/region_mean": 0.1615204270929098, "reward_total_mean": 0.2150241732597351, "reward_meter_mean": 0.5524039268493652, "reward_meter_std": 0.4421142339706421, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9797122478485107, "reward_repeat_penalty_std": 0.030837321653962135, "reward_repeat_floor_mean": 0.9969568252563477, "reward_repeat_floor_std": 0.0046256063506007195, "reward_near_duplicate_penalty_mean": 0.9797122478485107, "reward_near_duplicate_penalty_std": 0.030837321653962135, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.2150241732597351, "reward_total_composite_std": 0.18644297122955322} {"timestamp_utc": "2026-04-12T19:06:48Z", "mode": "train", "global_step": 849, "epoch": 0.04468185884953423, "loss": -0.0386, "grad_norm": 5.820818901062012, "learning_rate": 7.430303030303031e-06, "num_tokens": 1516771.0, "completions/mean_length": 89.375, "completions/min_length": 26.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 29.000001907348633, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.43082544207572937, "rewards/meter/std": 0.41046732664108276, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9545419812202454, "rewards/lexical_plausibility/std": 0.1056101992726326, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.2585087716579437, "rewards/repeat_penalty/mean": 0.944037675857544, "rewards/repeat_penalty/std": 0.04582136869430542, "rewards/repeat_floor/mean": 0.992429792881012, "rewards/repeat_floor/std": 0.006118534132838249, "rewards/near_duplicate_penalty/mean": 0.9577739834785461, "rewards/near_duplicate_penalty/std": 0.04377095773816109, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9862637519836426, "rewards/distinct_2/std": 0.0388520210981369, "rewards/total_composite/mean": 0.18160486221313477, "rewards/total_composite/std": 0.17931190133094788, "reward": 0.18160486221313477, "reward_std": 0.17931188642978668, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1891181915998459, "sampling/sampling_logp_difference/max": 2.019103527069092, "sampling/importance_sampling_ratio/min": 0.1327744424343109, "sampling/importance_sampling_ratio/mean": 0.9903258085250854, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7362756803631783, "clip_ratio/low_mean": 0.0722704716026783, "clip_ratio/low_min": 0.0722704716026783, "clip_ratio/high_mean": 0.12103262916207314, "clip_ratio/high_max": 0.12103262916207314, "clip_ratio/region_mean": 0.19330310076475143, "reward_total_mean": 0.18160486221313477, "reward_meter_mean": 0.43082544207572937, "reward_meter_std": 0.41046732664108276, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9545419812202454, "reward_lexical_plausibility_std": 0.1056101992726326, "reward_repeat_penalty_mean": 0.944037675857544, "reward_repeat_penalty_std": 0.04582136869430542, "reward_repeat_floor_mean": 0.992429792881012, "reward_repeat_floor_std": 0.006118534132838249, "reward_near_duplicate_penalty_mean": 0.9577739834785461, "reward_near_duplicate_penalty_std": 0.04377095773816109, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9862637519836426, "reward_distinct_2_std": 0.0388520210981369, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.2585087716579437, "reward_total_composite_mean": 0.18160486221313477, "reward_total_composite_std": 0.17931190133094788} {"timestamp_utc": "2026-04-12T19:06:56Z", "mode": "train", "global_step": 850, "epoch": 0.044734487658544285, "loss": -0.0926, "grad_norm": 29.220003128051758, "learning_rate": 7.4272727272727275e-06, "num_tokens": 1518245.0, "completions/mean_length": 24.25, "completions/min_length": 19.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.25, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.9903374910354614, "rewards/meter/std": 0.006952945608645678, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.7323012948036194, "rewards/repeat_penalty/std": 0.11840531975030899, "rewards/repeat_floor/mean": 0.9781587719917297, "rewards/repeat_floor/std": 0.017474928870797157, "rewards/near_duplicate_penalty/mean": 0.9538556337356567, "rewards/near_duplicate_penalty/std": 0.08808069676160812, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9800602793693542, "rewards/distinct_2/std": 0.04028116911649704, "rewards/total_composite/mean": 0.32705873250961304, "rewards/total_composite/std": 0.09604796022176743, "reward": 0.32705873250961304, "reward_std": 0.09604796022176743, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15786370635032654, "sampling/sampling_logp_difference/max": 2.3714892864227295, "sampling/importance_sampling_ratio/min": 0.09334160387516022, "sampling/importance_sampling_ratio/mean": 1.0329214334487915, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0143160820007324, "clip_ratio/low_mean": 0.046266235411167145, "clip_ratio/low_min": 0.046266235411167145, "clip_ratio/high_mean": 0.08138676919043064, "clip_ratio/high_max": 0.08138676919043064, "clip_ratio/region_mean": 0.12765300460159779, "reward_total_mean": 0.32705873250961304, "reward_meter_mean": 0.9903374910354614, "reward_meter_std": 0.006952945608645678, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7323012948036194, "reward_repeat_penalty_std": 0.11840531975030899, "reward_repeat_floor_mean": 0.9781587719917297, "reward_repeat_floor_std": 0.017474928870797157, "reward_near_duplicate_penalty_mean": 0.9538556337356567, "reward_near_duplicate_penalty_std": 0.08808069676160812, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9800602793693542, "reward_distinct_2_std": 0.04028116911649704, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.32705873250961304, "reward_total_composite_std": 0.09604796022176743} {"timestamp_utc": "2026-04-12T19:08:58Z", "mode": "eval", "global_step": 850, "epoch": 0.044734487658544285, "eval_loss": NaN, "eval_runtime": 122.3217, "eval_samples_per_second": 0.85, "eval_steps_per_second": 0.106, "eval_num_tokens": 1518245.0, "eval_completions/mean_length": 119.89423076923077, "eval_completions/min_length": 24.153846153846153, "eval_completions/max_length": 344.0769230769231, "eval_completions/clipped_ratio": 0.04807692307692308, "eval_completions/mean_terminated_length": 99.59478114201472, "eval_completions/min_terminated_length": 24.153846153846153, "eval_completions/max_terminated_length": 236.0, "eval_rewards/meter/mean": 0.5940083219454839, "eval_rewards/meter/std": 0.3709836029089414, "eval_rewards/count_adherence/mean": 0.7718354509426997, "eval_rewards/count_adherence/std": 0.21803476202946442, "eval_rewards/arabic_clean/mean": 0.9230769230769231, "eval_rewards/arabic_clean/std": 0.21757131356459397, "eval_rewards/hard_gate/mean": 0.9903846153846154, "eval_rewards/hard_gate/std": 0.027196414195574246, "eval_rewards/arabic_floor/mean": 0.9956730741720933, "eval_rewards/arabic_floor/std": 0.012238385012516608, "eval_rewards/count_floor/mean": 0.9315506219863892, "eval_rewards/count_floor/std": 0.0654104257432314, "eval_rewards/lexical_plausibility/mean": 0.9737811409510099, "eval_rewards/lexical_plausibility/std": 0.07229006003874999, "eval_rewards/judge_quality/mean": 0.3463461444928096, "eval_rewards/judge_quality/std": 0.1750354331273299, "eval_rewards/repeat_penalty/mean": 0.6587543166600741, "eval_rewards/repeat_penalty/std": 0.31394536048173904, "eval_rewards/repeat_floor/mean": 0.9617704107211187, "eval_rewards/repeat_floor/std": 0.03857633424922824, "eval_rewards/near_duplicate_penalty/mean": 0.916577540911161, "eval_rewards/near_duplicate_penalty/std": 0.0802127426633468, "eval_rewards/opening_diversity/mean": 0.9571698904037476, "eval_rewards/opening_diversity/std": 0.08214899517882329, "eval_rewards/distinct_2/mean": 0.7428175623600299, "eval_rewards/distinct_2/std": 0.3078934856905387, "eval_rewards/total_composite/mean": 0.1832546075949302, "eval_rewards/total_composite/std": 0.15364239307550284, "eval_reward": 0.1832546075949302, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.0761807497877341, "eval_sampling/sampling_logp_difference/max": 1.1380724540123572, "eval_sampling/importance_sampling_ratio/min": 0.32706615443413073, "eval_sampling/importance_sampling_ratio/mean": 1.0208074037845318, "eval_sampling/importance_sampling_ratio/max": 1.5621135968428392, "eval_entropy": 0.9077165310199444, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.1832546075949302, "eval_reward_meter_mean": 0.5940083219454839, "eval_reward_meter_std": 0.3709836029089414, "eval_reward_count_adherence_mean": 0.7718354509426997, "eval_reward_count_adherence_std": 0.21803476202946442, "eval_reward_arabic_clean_mean": 0.9230769230769231, "eval_reward_arabic_clean_std": 0.21757131356459397, "eval_reward_hard_gate_mean": 0.9903846153846154, "eval_reward_hard_gate_std": 0.027196414195574246, "eval_reward_arabic_floor_mean": 0.9956730741720933, "eval_reward_arabic_floor_std": 0.012238385012516608, "eval_reward_count_floor_mean": 0.9315506219863892, "eval_reward_count_floor_std": 0.0654104257432314, "eval_reward_lexical_plausibility_mean": 0.9737811409510099, "eval_reward_lexical_plausibility_std": 0.07229006003874999, "eval_reward_repeat_penalty_mean": 0.6587543166600741, "eval_reward_repeat_penalty_std": 0.31394536048173904, "eval_reward_repeat_floor_mean": 0.9617704107211187, "eval_reward_repeat_floor_std": 0.03857633424922824, "eval_reward_near_duplicate_penalty_mean": 0.916577540911161, "eval_reward_near_duplicate_penalty_std": 0.0802127426633468, "eval_reward_opening_diversity_mean": 0.9571698904037476, "eval_reward_opening_diversity_std": 0.08214899517882329, "eval_reward_distinct_2_mean": 0.7428175623600299, "eval_reward_distinct_2_std": 0.3078934856905387, "eval_reward_judge_quality_mean": 0.3463461444928096, "eval_reward_judge_quality_std": 0.1750354331273299, "eval_reward_total_composite_mean": 0.1832546075949302, "eval_reward_total_composite_std": 0.15364239307550284} {"timestamp_utc": "2026-04-12T19:09:10Z", "mode": "train", "global_step": 851, "epoch": 0.04478711646755434, "loss": 0.0403, "grad_norm": 16.429882049560547, "learning_rate": 7.424242424242425e-06, "num_tokens": 1519875.0, "completions/mean_length": 42.75, "completions/min_length": 34.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.75, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.6129672527313232, "rewards/meter/std": 0.3593083620071411, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9181331396102905, "rewards/repeat_penalty/std": 0.10355643182992935, "rewards/repeat_floor/mean": 0.9904378652572632, "rewards/repeat_floor/std": 0.010766570456326008, "rewards/near_duplicate_penalty/mean": 0.9653908014297485, "rewards/near_duplicate_penalty/std": 0.023855308070778847, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.9597697257995605, "rewards/distinct_2/std": 0.06292783468961716, "rewards/total_composite/mean": 0.2604284882545471, "rewards/total_composite/std": 0.14449924230575562, "reward": 0.2604284882545471, "reward_std": 0.14449924230575562, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15844325721263885, "sampling/sampling_logp_difference/max": 1.6276932954788208, "sampling/importance_sampling_ratio/min": 0.1963820457458496, "sampling/importance_sampling_ratio/mean": 0.9931143522262573, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9619476944208145, "clip_ratio/low_mean": 0.05755591858178377, "clip_ratio/low_min": 0.05755591858178377, "clip_ratio/high_mean": 0.11028680298477411, "clip_ratio/high_max": 0.11028680298477411, "clip_ratio/region_mean": 0.16784272156655788, "reward_total_mean": 0.2604284882545471, "reward_meter_mean": 0.6129672527313232, "reward_meter_std": 0.3593083620071411, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9181331396102905, "reward_repeat_penalty_std": 0.10355643182992935, "reward_repeat_floor_mean": 0.9904378652572632, "reward_repeat_floor_std": 0.010766570456326008, "reward_near_duplicate_penalty_mean": 0.9653908014297485, "reward_near_duplicate_penalty_std": 0.023855308070778847, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.9597697257995605, "reward_distinct_2_std": 0.06292783468961716, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.2604284882545471, "reward_total_composite_std": 0.14449924230575562} {"timestamp_utc": "2026-04-12T19:09:18Z", "mode": "train", "global_step": 852, "epoch": 0.04483974527656439, "loss": 0.0665, "grad_norm": 18.8461971282959, "learning_rate": 7.421212121212121e-06, "num_tokens": 1521304.0, "completions/mean_length": 28.625, "completions/min_length": 24.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.625, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.48669493198394775, "rewards/meter/std": 0.23172593116760254, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.2558424770832062, "rewards/repeat_penalty/mean": 0.9849555492401123, "rewards/repeat_penalty/std": 0.015864934772253036, "rewards/repeat_floor/mean": 0.9977433681488037, "rewards/repeat_floor/std": 0.0023797410540282726, "rewards/near_duplicate_penalty/mean": 0.9849555492401123, "rewards/near_duplicate_penalty/std": 0.015864934772253036, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2910352945327759, "rewards/total_composite/std": 0.1671823114156723, "reward": 0.2910352945327759, "reward_std": 0.1671823114156723, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1417986899614334, "sampling/sampling_logp_difference/max": 1.6381053924560547, "sampling/importance_sampling_ratio/min": 0.19434790313243866, "sampling/importance_sampling_ratio/mean": 1.0088468790054321, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5967523828148842, "clip_ratio/low_mean": 0.08824086841195822, "clip_ratio/low_min": 0.08824086841195822, "clip_ratio/high_mean": 0.05666666757315397, "clip_ratio/high_max": 0.05666666757315397, "clip_ratio/region_mean": 0.1449075359851122, "reward_total_mean": 0.2910352945327759, "reward_meter_mean": 0.48669493198394775, "reward_meter_std": 0.23172593116760254, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9849555492401123, "reward_repeat_penalty_std": 0.015864934772253036, "reward_repeat_floor_mean": 0.9977433681488037, "reward_repeat_floor_std": 0.0023797410540282726, "reward_near_duplicate_penalty_mean": 0.9849555492401123, "reward_near_duplicate_penalty_std": 0.015864934772253036, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.2558424770832062, "reward_total_composite_mean": 0.2910352945327759, "reward_total_composite_std": 0.1671823114156723} {"timestamp_utc": "2026-04-12T19:09:38Z", "mode": "train", "global_step": 853, "epoch": 0.04489237408557444, "loss": 0.1965, "grad_norm": 17.48162841796875, "learning_rate": 7.4181818181818185e-06, "num_tokens": 1522861.0, "completions/mean_length": 33.625, "completions/min_length": 17.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.625, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.7731637358665466, "rewards/meter/std": 0.32478925585746765, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.21756774187088013, "rewards/repeat_penalty/mean": 0.881607711315155, "rewards/repeat_penalty/std": 0.08464014530181885, "rewards/repeat_floor/mean": 0.9868205785751343, "rewards/repeat_floor/std": 0.008759504184126854, "rewards/near_duplicate_penalty/mean": 0.9466404318809509, "rewards/near_duplicate_penalty/std": 0.049804121255874634, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9633283615112305, "rewards/distinct_2/std": 0.039248231798410416, "rewards/total_composite/mean": 0.42103052139282227, "rewards/total_composite/std": 0.21232201159000397, "reward": 0.42103052139282227, "reward_std": 0.21232201159000397, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1721251755952835, "sampling/sampling_logp_difference/max": 1.676363468170166, "sampling/importance_sampling_ratio/min": 0.18705295026302338, "sampling/importance_sampling_ratio/mean": 1.0126187801361084, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0633443146944046, "clip_ratio/low_mean": 0.04480971675366163, "clip_ratio/low_min": 0.04480971675366163, "clip_ratio/high_mean": 0.09278519544750452, "clip_ratio/high_max": 0.09278519544750452, "clip_ratio/region_mean": 0.13759491220116615, "reward_total_mean": 0.42103052139282227, "reward_meter_mean": 0.7731637358665466, "reward_meter_std": 0.32478925585746765, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.881607711315155, "reward_repeat_penalty_std": 0.08464014530181885, "reward_repeat_floor_mean": 0.9868205785751343, "reward_repeat_floor_std": 0.008759504184126854, "reward_near_duplicate_penalty_mean": 0.9466404318809509, "reward_near_duplicate_penalty_std": 0.049804121255874634, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9633283615112305, "reward_distinct_2_std": 0.039248231798410416, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.21756774187088013, "reward_total_composite_mean": 0.42103052139282227, "reward_total_composite_std": 0.21232201159000397} {"timestamp_utc": "2026-04-12T19:09:52Z", "mode": "train", "global_step": 854, "epoch": 0.044945002894584495, "loss": -0.058, "grad_norm": 4.439054489135742, "learning_rate": 7.415151515151515e-06, "num_tokens": 1524362.0, "completions/mean_length": 97.625, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.42857360839844, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.7083907723426819, "rewards/meter/std": 0.41697582602500916, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.953191876411438, "rewards/lexical_plausibility/std": 0.13239336013793945, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.9339249134063721, "rewards/repeat_penalty/std": 0.0925673320889473, "rewards/repeat_floor/mean": 0.9913167953491211, "rewards/repeat_floor/std": 0.011540849693119526, "rewards/near_duplicate_penalty/mean": 0.9588955640792847, "rewards/near_duplicate_penalty/std": 0.04725971445441246, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9720279574394226, "rewards/distinct_2/std": 0.05644134432077408, "rewards/total_composite/mean": 0.28051459789276123, "rewards/total_composite/std": 0.1796312928199768, "reward": 0.28051459789276123, "reward_std": 0.1796312779188156, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14446556568145752, "sampling/sampling_logp_difference/max": 1.145294189453125, "sampling/importance_sampling_ratio/min": 0.3181303143501282, "sampling/importance_sampling_ratio/mean": 1.0005576610565186, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9032696560025215, "clip_ratio/low_mean": 0.02806441579014063, "clip_ratio/low_min": 0.02806441579014063, "clip_ratio/high_mean": 0.09225909784436226, "clip_ratio/high_max": 0.09225909784436226, "clip_ratio/region_mean": 0.12032351363450289, "reward_total_mean": 0.28051459789276123, "reward_meter_mean": 0.7083907723426819, "reward_meter_std": 0.41697582602500916, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.953191876411438, "reward_lexical_plausibility_std": 0.13239336013793945, "reward_repeat_penalty_mean": 0.9339249134063721, "reward_repeat_penalty_std": 0.0925673320889473, "reward_repeat_floor_mean": 0.9913167953491211, "reward_repeat_floor_std": 0.011540849693119526, "reward_near_duplicate_penalty_mean": 0.9588955640792847, "reward_near_duplicate_penalty_std": 0.04725971445441246, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9720279574394226, "reward_distinct_2_std": 0.05644134432077408, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.28051459789276123, "reward_total_composite_std": 0.1796312928199768} {"timestamp_utc": "2026-04-12T19:10:05Z", "mode": "train", "global_step": 855, "epoch": 0.04499763170359455, "loss": -0.0112, "grad_norm": 4.827568531036377, "learning_rate": 7.412121212121213e-06, "num_tokens": 1525901.0, "completions/mean_length": 90.375, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 30.142858505249023, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.6936649084091187, "rewards/meter/std": 0.41528838872909546, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 0.9342831969261169, "rewards/lexical_plausibility/std": 0.11025092750787735, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.25753986835479736, "rewards/repeat_penalty/mean": 0.8837237358093262, "rewards/repeat_penalty/std": 0.12036402523517609, "rewards/repeat_floor/mean": 0.9920949935913086, "rewards/repeat_floor/std": 0.007197240367531776, "rewards/near_duplicate_penalty/mean": 0.9957888126373291, "rewards/near_duplicate_penalty/std": 0.008139593526721, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9816849827766418, "rewards/distinct_2/std": 0.05180269479751587, "rewards/total_composite/mean": 0.2913930416107178, "rewards/total_composite/std": 0.2611802816390991, "reward": 0.2913930416107178, "reward_std": 0.26118025183677673, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16113024950027466, "sampling/sampling_logp_difference/max": 1.1160130500793457, "sampling/importance_sampling_ratio/min": 0.3275832533836365, "sampling/importance_sampling_ratio/mean": 1.023898959159851, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.16659776866436, "clip_ratio/low_mean": 0.04225318972021341, "clip_ratio/low_min": 0.04225318972021341, "clip_ratio/high_mean": 0.05241228174418211, "clip_ratio/high_max": 0.05241228174418211, "clip_ratio/region_mean": 0.09466547146439552, "reward_total_mean": 0.2913930416107178, "reward_meter_mean": 0.6936649084091187, "reward_meter_std": 0.41528838872909546, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 0.9342831969261169, "reward_lexical_plausibility_std": 0.11025092750787735, "reward_repeat_penalty_mean": 0.8837237358093262, "reward_repeat_penalty_std": 0.12036402523517609, "reward_repeat_floor_mean": 0.9920949935913086, "reward_repeat_floor_std": 0.007197240367531776, "reward_near_duplicate_penalty_mean": 0.9957888126373291, "reward_near_duplicate_penalty_std": 0.008139593526721, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9816849827766418, "reward_distinct_2_std": 0.05180269479751587, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.25753986835479736, "reward_total_composite_mean": 0.2913930416107178, "reward_total_composite_std": 0.2611802816390991} {"timestamp_utc": "2026-04-12T19:10:14Z", "mode": "train", "global_step": 856, "epoch": 0.0450502605126046, "loss": -0.024, "grad_norm": 18.634891510009766, "learning_rate": 7.40909090909091e-06, "num_tokens": 1527271.0, "completions/mean_length": 22.25, "completions/min_length": 20.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.25, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.9949920773506165, "rewards/meter/std": 0.001823427272029221, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9047181606292725, "rewards/lexical_plausibility/std": 0.17645813524723053, "rewards/judge_quality/mean": 0.4674999713897705, "rewards/judge_quality/std": 0.3022179901599884, "rewards/repeat_penalty/mean": 0.667992115020752, "rewards/repeat_penalty/std": 0.1552628129720688, "rewards/repeat_floor/mean": 0.9699516296386719, "rewards/repeat_floor/std": 0.031173698604106903, "rewards/near_duplicate_penalty/mean": 0.9386887550354004, "rewards/near_duplicate_penalty/std": 0.14516063034534454, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9349817037582397, "rewards/distinct_2/std": 0.10918577760457993, "rewards/total_composite/mean": 0.4552363157272339, "rewards/total_composite/std": 0.29889899492263794, "reward": 0.4552363157272339, "reward_std": 0.29889899492263794, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19031181931495667, "sampling/sampling_logp_difference/max": 1.3144540786743164, "sampling/importance_sampling_ratio/min": 0.26862093806266785, "sampling/importance_sampling_ratio/mean": 0.9980427622795105, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0378254055976868, "clip_ratio/low_mean": 0.07619047863408923, "clip_ratio/low_min": 0.07619047863408923, "clip_ratio/high_mean": 0.07451923191547394, "clip_ratio/high_max": 0.07451923191547394, "clip_ratio/region_mean": 0.15070971054956317, "reward_total_mean": 0.4552363157272339, "reward_meter_mean": 0.9949920773506165, "reward_meter_std": 0.001823427272029221, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9047181606292725, "reward_lexical_plausibility_std": 0.17645813524723053, "reward_repeat_penalty_mean": 0.667992115020752, "reward_repeat_penalty_std": 0.1552628129720688, "reward_repeat_floor_mean": 0.9699516296386719, "reward_repeat_floor_std": 0.031173698604106903, "reward_near_duplicate_penalty_mean": 0.9386887550354004, "reward_near_duplicate_penalty_std": 0.14516063034534454, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9349817037582397, "reward_distinct_2_std": 0.10918577760457993, "reward_judge_quality_mean": 0.4674999713897705, "reward_judge_quality_std": 0.3022179901599884, "reward_total_composite_mean": 0.4552363157272339, "reward_total_composite_std": 0.29889899492263794} {"timestamp_utc": "2026-04-12T19:10:28Z", "mode": "train", "global_step": 857, "epoch": 0.04510288932161465, "loss": -0.064, "grad_norm": 5.120342254638672, "learning_rate": 7.406060606060607e-06, "num_tokens": 1528686.0, "completions/mean_length": 94.875, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 35.28571701049805, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.43202874064445496, "rewards/meter/std": 0.2548648416996002, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9484158158302307, "rewards/lexical_plausibility/std": 0.1459021121263504, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.18850918114185333, "rewards/repeat_penalty/mean": 0.9160827398300171, "rewards/repeat_penalty/std": 0.18514809012413025, "rewards/repeat_floor/mean": 0.9891101121902466, "rewards/repeat_floor/std": 0.02300209552049637, "rewards/near_duplicate_penalty/mean": 0.9556350708007812, "rewards/near_duplicate_penalty/std": 0.07480573654174805, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9737762212753296, "rewards/distinct_2/std": 0.07417204976081848, "rewards/total_composite/mean": 0.1700025349855423, "rewards/total_composite/std": 0.12248846888542175, "reward": 0.1700025349855423, "reward_std": 0.12248846143484116, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16652749478816986, "sampling/sampling_logp_difference/max": 1.5494086742401123, "sampling/importance_sampling_ratio/min": 0.2123735249042511, "sampling/importance_sampling_ratio/mean": 1.01360023021698, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9056715667247772, "clip_ratio/low_mean": 0.03661616239696741, "clip_ratio/low_min": 0.03661616239696741, "clip_ratio/high_mean": 0.0843220204114914, "clip_ratio/high_max": 0.0843220204114914, "clip_ratio/region_mean": 0.1209381828084588, "reward_total_mean": 0.1700025349855423, "reward_meter_mean": 0.43202874064445496, "reward_meter_std": 0.2548648416996002, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9484158158302307, "reward_lexical_plausibility_std": 0.1459021121263504, "reward_repeat_penalty_mean": 0.9160827398300171, "reward_repeat_penalty_std": 0.18514809012413025, "reward_repeat_floor_mean": 0.9891101121902466, "reward_repeat_floor_std": 0.02300209552049637, "reward_near_duplicate_penalty_mean": 0.9556350708007812, "reward_near_duplicate_penalty_std": 0.07480573654174805, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9737762212753296, "reward_distinct_2_std": 0.07417204976081848, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.18850918114185333, "reward_total_composite_mean": 0.1700025349855423, "reward_total_composite_std": 0.12248846888542175} {"timestamp_utc": "2026-04-12T19:10:41Z", "mode": "train", "global_step": 858, "epoch": 0.045155518130624704, "loss": -0.0678, "grad_norm": 4.318520545959473, "learning_rate": 7.403030303030304e-06, "num_tokens": 1530227.0, "completions/mean_length": 91.625, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 31.571430206298828, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.7368934154510498, "rewards/meter/std": 0.41320157051086426, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9618405103683472, "rewards/lexical_plausibility/std": 0.10793144255876541, "rewards/judge_quality/mean": 0.36500000953674316, "rewards/judge_quality/std": 0.27139851450920105, "rewards/repeat_penalty/mean": 0.8467693328857422, "rewards/repeat_penalty/std": 0.1273772269487381, "rewards/repeat_floor/mean": 0.985733687877655, "rewards/repeat_floor/std": 0.011612470261752605, "rewards/near_duplicate_penalty/mean": 0.9524245262145996, "rewards/near_duplicate_penalty/std": 0.05922013148665428, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9832775592803955, "rewards/distinct_2/std": 0.0472981221973896, "rewards/total_composite/mean": 0.22769123315811157, "rewards/total_composite/std": 0.1319492608308792, "reward": 0.22769123315811157, "reward_std": 0.13194924592971802, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1802298128604889, "sampling/sampling_logp_difference/max": 1.210554599761963, "sampling/importance_sampling_ratio/min": 0.3580833077430725, "sampling/importance_sampling_ratio/mean": 1.0397518873214722, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9694603458046913, "clip_ratio/low_mean": 0.056907894089818, "clip_ratio/low_min": 0.056907894089818, "clip_ratio/high_mean": 0.11477100383490324, "clip_ratio/high_max": 0.11477100383490324, "clip_ratio/region_mean": 0.17167889792472124, "reward_total_mean": 0.22769123315811157, "reward_meter_mean": 0.7368934154510498, "reward_meter_std": 0.41320157051086426, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9618405103683472, "reward_lexical_plausibility_std": 0.10793144255876541, "reward_repeat_penalty_mean": 0.8467693328857422, "reward_repeat_penalty_std": 0.1273772269487381, "reward_repeat_floor_mean": 0.985733687877655, "reward_repeat_floor_std": 0.011612470261752605, "reward_near_duplicate_penalty_mean": 0.9524245262145996, "reward_near_duplicate_penalty_std": 0.05922013148665428, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9832775592803955, "reward_distinct_2_std": 0.0472981221973896, "reward_judge_quality_mean": 0.36500000953674316, "reward_judge_quality_std": 0.27139851450920105, "reward_total_composite_mean": 0.22769123315811157, "reward_total_composite_std": 0.1319492608308792} {"timestamp_utc": "2026-04-12T19:10:50Z", "mode": "train", "global_step": 859, "epoch": 0.04520814693963476, "loss": 0.0709, "grad_norm": 17.332473754882812, "learning_rate": 7.4e-06, "num_tokens": 1531665.0, "completions/mean_length": 30.75, "completions/min_length": 16.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.75, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.7409610748291016, "rewards/meter/std": 0.4215104281902313, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.837775468826294, "rewards/repeat_penalty/std": 0.15606820583343506, "rewards/repeat_floor/mean": 0.984778881072998, "rewards/repeat_floor/std": 0.01476488821208477, "rewards/near_duplicate_penalty/mean": 0.9613751769065857, "rewards/near_duplicate_penalty/std": 0.041865818202495575, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9577505588531494, "rewards/distinct_2/std": 0.061652857810258865, "rewards/total_composite/mean": 0.34708037972450256, "rewards/total_composite/std": 0.23397400975227356, "reward": 0.34708037972450256, "reward_std": 0.23397399485111237, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17871926724910736, "sampling/sampling_logp_difference/max": 2.5530452728271484, "sampling/importance_sampling_ratio/min": 0.07784424722194672, "sampling/importance_sampling_ratio/mean": 1.0164144039154053, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9876235574483871, "clip_ratio/low_mean": 0.043884568847715855, "clip_ratio/low_min": 0.043884568847715855, "clip_ratio/high_mean": 0.10760150942951441, "clip_ratio/high_max": 0.10760150942951441, "clip_ratio/region_mean": 0.15148607827723026, "reward_total_mean": 0.34708037972450256, "reward_meter_mean": 0.7409610748291016, "reward_meter_std": 0.4215104281902313, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.837775468826294, "reward_repeat_penalty_std": 0.15606820583343506, "reward_repeat_floor_mean": 0.984778881072998, "reward_repeat_floor_std": 0.01476488821208477, "reward_near_duplicate_penalty_mean": 0.9613751769065857, "reward_near_duplicate_penalty_std": 0.041865818202495575, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9577505588531494, "reward_distinct_2_std": 0.061652857810258865, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.34708037972450256, "reward_total_composite_std": 0.23397400975227356} {"timestamp_utc": "2026-04-12T19:10:59Z", "mode": "train", "global_step": 860, "epoch": 0.04526077574864481, "loss": 0.109, "grad_norm": 24.974897384643555, "learning_rate": 7.396969696969698e-06, "num_tokens": 1533306.0, "completions/mean_length": 33.125, "completions/min_length": 24.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.125, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.6976901292800903, "rewards/meter/std": 0.2908549904823303, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9856323003768921, "rewards/repeat_penalty/std": 0.022808540612459183, "rewards/repeat_floor/mean": 0.9978448152542114, "rewards/repeat_floor/std": 0.0034212765749543905, "rewards/near_duplicate_penalty/mean": 0.9856323003768921, "rewards/near_duplicate_penalty/std": 0.022808540612459183, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.25643959641456604, "rewards/total_composite/std": 0.10720512270927429, "reward": 0.25643959641456604, "reward_std": 0.1072051152586937, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2010492980480194, "sampling/sampling_logp_difference/max": 2.270589828491211, "sampling/importance_sampling_ratio/min": 0.10325125604867935, "sampling/importance_sampling_ratio/mean": 1.0106351375579834, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9329140707850456, "clip_ratio/low_mean": 0.08431525342166424, "clip_ratio/low_min": 0.08431525342166424, "clip_ratio/high_mean": 0.12070085853338242, "clip_ratio/high_max": 0.12070085853338242, "clip_ratio/region_mean": 0.20501611195504665, "reward_total_mean": 0.25643959641456604, "reward_meter_mean": 0.6976901292800903, "reward_meter_std": 0.2908549904823303, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9856323003768921, "reward_repeat_penalty_std": 0.022808540612459183, "reward_repeat_floor_mean": 0.9978448152542114, "reward_repeat_floor_std": 0.0034212765749543905, "reward_near_duplicate_penalty_mean": 0.9856323003768921, "reward_near_duplicate_penalty_std": 0.022808540612459183, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.25643959641456604, "reward_total_composite_std": 0.10720512270927429} {"timestamp_utc": "2026-04-12T19:11:08Z", "mode": "train", "global_step": 861, "epoch": 0.04531340455765486, "loss": 0.0785, "grad_norm": 16.73429298400879, "learning_rate": 7.393939393939395e-06, "num_tokens": 1534955.0, "completions/mean_length": 37.125, "completions/min_length": 18.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.125, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.8543132543563843, "rewards/meter/std": 0.3133929371833801, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6212499737739563, "rewards/judge_quality/std": 0.26626721024513245, "rewards/repeat_penalty/mean": 0.9071429967880249, "rewards/repeat_penalty/std": 0.09249752014875412, "rewards/repeat_floor/mean": 0.9906789064407349, "rewards/repeat_floor/std": 0.008230502717196941, "rewards/near_duplicate_penalty/mean": 0.9711740016937256, "rewards/near_duplicate_penalty/std": 0.032110974192619324, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9653087854385376, "rewards/distinct_2/std": 0.049989111721515656, "rewards/total_composite/mean": 0.5404928922653198, "rewards/total_composite/std": 0.331277996301651, "reward": 0.5404928922653198, "reward_std": 0.3312779664993286, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13502705097198486, "sampling/sampling_logp_difference/max": 1.8205838203430176, "sampling/importance_sampling_ratio/min": 0.16193118691444397, "sampling/importance_sampling_ratio/mean": 0.9921262264251709, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8673032820224762, "clip_ratio/low_mean": 0.051648352295160294, "clip_ratio/low_min": 0.051648352295160294, "clip_ratio/high_mean": 0.04333420004695654, "clip_ratio/high_max": 0.04333420004695654, "clip_ratio/region_mean": 0.09498255234211683, "reward_total_mean": 0.5404928922653198, "reward_meter_mean": 0.8543132543563843, "reward_meter_std": 0.3133929371833801, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9071429967880249, "reward_repeat_penalty_std": 0.09249752014875412, "reward_repeat_floor_mean": 0.9906789064407349, "reward_repeat_floor_std": 0.008230502717196941, "reward_near_duplicate_penalty_mean": 0.9711740016937256, "reward_near_duplicate_penalty_std": 0.032110974192619324, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9653087854385376, "reward_distinct_2_std": 0.049989111721515656, "reward_judge_quality_mean": 0.6212499737739563, "reward_judge_quality_std": 0.26626721024513245, "reward_total_composite_mean": 0.5404928922653198, "reward_total_composite_std": 0.331277996301651} {"timestamp_utc": "2026-04-12T19:11:22Z", "mode": "train", "global_step": 862, "epoch": 0.045366033366664914, "loss": -0.0413, "grad_norm": 5.6746039390563965, "learning_rate": 7.390909090909092e-06, "num_tokens": 1536590.0, "completions/mean_length": 107.375, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 49.57143020629883, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.5889490842819214, "rewards/meter/std": 0.40843716263771057, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9343750476837158, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 0.9559023976325989, "rewards/lexical_plausibility/std": 0.12472687661647797, "rewards/judge_quality/mean": 0.3212500214576721, "rewards/judge_quality/std": 0.2773052752017975, "rewards/repeat_penalty/mean": 0.9557989239692688, "rewards/repeat_penalty/std": 0.04557191953063011, "rewards/repeat_floor/mean": 0.9942553043365479, "rewards/repeat_floor/std": 0.005345368292182684, "rewards/near_duplicate_penalty/mean": 0.9718118906021118, "rewards/near_duplicate_penalty/std": 0.0204855315387249, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9831501841545105, "rewards/distinct_2/std": 0.031356681138277054, "rewards/total_composite/mean": 0.20572629570960999, "rewards/total_composite/std": 0.24233824014663696, "reward": 0.20572629570960999, "reward_std": 0.24233825504779816, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1550081968307495, "sampling/sampling_logp_difference/max": 1.634211778640747, "sampling/importance_sampling_ratio/min": 0.19510610401630402, "sampling/importance_sampling_ratio/mean": 1.0181303024291992, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7492427676916122, "clip_ratio/low_mean": 0.06888403557240963, "clip_ratio/low_min": 0.06888403557240963, "clip_ratio/high_mean": 0.05245192348957062, "clip_ratio/high_max": 0.05245192348957062, "clip_ratio/region_mean": 0.12133595906198025, "reward_total_mean": 0.20572629570960999, "reward_meter_mean": 0.5889490842819214, "reward_meter_std": 0.40843716263771057, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9343750476837158, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 0.9559023976325989, "reward_lexical_plausibility_std": 0.12472687661647797, "reward_repeat_penalty_mean": 0.9557989239692688, "reward_repeat_penalty_std": 0.04557191953063011, "reward_repeat_floor_mean": 0.9942553043365479, "reward_repeat_floor_std": 0.005345368292182684, "reward_near_duplicate_penalty_mean": 0.9718118906021118, "reward_near_duplicate_penalty_std": 0.0204855315387249, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9831501841545105, "reward_distinct_2_std": 0.031356681138277054, "reward_judge_quality_mean": 0.3212500214576721, "reward_judge_quality_std": 0.2773052752017975, "reward_total_composite_mean": 0.20572629570960999, "reward_total_composite_std": 0.24233824014663696} {"timestamp_utc": "2026-04-12T19:11:31Z", "mode": "train", "global_step": 863, "epoch": 0.045418662175674966, "loss": 0.0265, "grad_norm": 13.635979652404785, "learning_rate": 7.3878787878787885e-06, "num_tokens": 1538093.0, "completions/mean_length": 36.875, "completions/min_length": 19.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.875, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.755847692489624, "rewards/meter/std": 0.25042101740837097, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.2558424770832062, "rewards/repeat_penalty/mean": 0.9187597036361694, "rewards/repeat_penalty/std": 0.08145544677972794, "rewards/repeat_floor/mean": 0.9906264543533325, "rewards/repeat_floor/std": 0.007059456314891577, "rewards/near_duplicate_penalty/mean": 0.9500097036361694, "rewards/near_duplicate_penalty/std": 0.04892057552933693, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4313575029373169, "rewards/total_composite/std": 0.21279199421405792, "reward": 0.4313575029373169, "reward_std": 0.21279196441173553, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1790132075548172, "sampling/sampling_logp_difference/max": 2.265141248703003, "sampling/importance_sampling_ratio/min": 0.10381536930799484, "sampling/importance_sampling_ratio/mean": 1.0040229558944702, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0147500038146973, "clip_ratio/low_mean": 0.08506417460739613, "clip_ratio/low_min": 0.08506417460739613, "clip_ratio/high_mean": 0.07293621078133583, "clip_ratio/high_max": 0.07293621078133583, "clip_ratio/region_mean": 0.15800038538873196, "reward_total_mean": 0.4313575029373169, "reward_meter_mean": 0.755847692489624, "reward_meter_std": 0.25042101740837097, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9187597036361694, "reward_repeat_penalty_std": 0.08145544677972794, "reward_repeat_floor_mean": 0.9906264543533325, "reward_repeat_floor_std": 0.007059456314891577, "reward_near_duplicate_penalty_mean": 0.9500097036361694, "reward_near_duplicate_penalty_std": 0.04892057552933693, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.2558424770832062, "reward_total_composite_mean": 0.4313575029373169, "reward_total_composite_std": 0.21279199421405792} {"timestamp_utc": "2026-04-12T19:11:38Z", "mode": "train", "global_step": 864, "epoch": 0.04547129098468502, "loss": 0.0288, "grad_norm": 21.118820190429688, "learning_rate": 7.384848484848486e-06, "num_tokens": 1539482.0, "completions/mean_length": 20.625, "completions/min_length": 19.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.625, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.7514198422431946, "rewards/meter/std": 0.39766955375671387, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6799999475479126, "rewards/judge_quality/std": 0.2747986316680908, "rewards/repeat_penalty/mean": 0.7259435653686523, "rewards/repeat_penalty/std": 0.04471856728196144, "rewards/repeat_floor/mean": 0.9801887273788452, "rewards/repeat_floor/std": 0.008943723514676094, "rewards/near_duplicate_penalty/mean": 0.9679248332977295, "rewards/near_duplicate_penalty/std": 0.05962476134300232, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.48981940746307373, "rewards/total_composite/std": 0.34963035583496094, "reward": 0.48981940746307373, "reward_std": 0.34963035583496094, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13045021891593933, "sampling/sampling_logp_difference/max": 1.0673611164093018, "sampling/importance_sampling_ratio/min": 0.34391486644744873, "sampling/importance_sampling_ratio/mean": 1.041421890258789, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8075439110398293, "clip_ratio/low_mean": 0.06896146619692445, "clip_ratio/low_min": 0.06896146619692445, "clip_ratio/high_mean": 0.04229323333129287, "clip_ratio/high_max": 0.04229323333129287, "clip_ratio/region_mean": 0.11125469952821732, "reward_total_mean": 0.48981940746307373, "reward_meter_mean": 0.7514198422431946, "reward_meter_std": 0.39766955375671387, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7259435653686523, "reward_repeat_penalty_std": 0.04471856728196144, "reward_repeat_floor_mean": 0.9801887273788452, "reward_repeat_floor_std": 0.008943723514676094, "reward_near_duplicate_penalty_mean": 0.9679248332977295, "reward_near_duplicate_penalty_std": 0.05962476134300232, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6799999475479126, "reward_judge_quality_std": 0.2747986316680908, "reward_total_composite_mean": 0.48981940746307373, "reward_total_composite_std": 0.34963035583496094} {"timestamp_utc": "2026-04-12T19:11:52Z", "mode": "train", "global_step": 865, "epoch": 0.04552391979369507, "loss": -0.0887, "grad_norm": 5.104220390319824, "learning_rate": 7.381818181818182e-06, "num_tokens": 1541910.0, "completions/mean_length": 162.5, "completions/min_length": 95.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 112.5714340209961, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 139.0, "rewards/meter/mean": 0.8013204336166382, "rewards/meter/std": 0.2830294072628021, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.07636035233736038, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9571428298950195, "rewards/count_floor/std": 0.022908104583621025, "rewards/lexical_plausibility/mean": 0.9757699966430664, "rewards/lexical_plausibility/std": 0.0685328021645546, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.27742189168930054, "rewards/repeat_penalty/std": 0.23724889755249023, "rewards/repeat_floor/mean": 0.8951751589775085, "rewards/repeat_floor/std": 0.07160430401563644, "rewards/near_duplicate_penalty/mean": 0.7448532581329346, "rewards/near_duplicate_penalty/std": 0.22116361558437347, "rewards/opening_diversity/mean": 0.8401442170143127, "rewards/opening_diversity/std": 0.2642263174057007, "rewards/distinct_2/mean": 0.36709436774253845, "rewards/distinct_2/std": 0.2868894338607788, "rewards/total_composite/mean": 0.09057766199111938, "rewards/total_composite/std": 0.03686390817165375, "reward": 0.09057766199111938, "reward_std": 0.03686390817165375, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11240290105342865, "sampling/sampling_logp_difference/max": 3.373406171798706, "sampling/importance_sampling_ratio/min": 0.034272700548172, "sampling/importance_sampling_ratio/mean": 1.00165593624115, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5945057608187199, "clip_ratio/low_mean": 0.0151869161054492, "clip_ratio/low_min": 0.0151869161054492, "clip_ratio/high_mean": 0.0843690219335258, "clip_ratio/high_max": 0.0843690219335258, "clip_ratio/region_mean": 0.099555938038975, "reward_total_mean": 0.09057766199111938, "reward_meter_mean": 0.8013204336166382, "reward_meter_std": 0.2830294072628021, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.07636035233736038, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9571428298950195, "reward_count_floor_std": 0.022908104583621025, "reward_lexical_plausibility_mean": 0.9757699966430664, "reward_lexical_plausibility_std": 0.0685328021645546, "reward_repeat_penalty_mean": 0.27742189168930054, "reward_repeat_penalty_std": 0.23724889755249023, "reward_repeat_floor_mean": 0.8951751589775085, "reward_repeat_floor_std": 0.07160430401563644, "reward_near_duplicate_penalty_mean": 0.7448532581329346, "reward_near_duplicate_penalty_std": 0.22116361558437347, "reward_opening_diversity_mean": 0.8401442170143127, "reward_opening_diversity_std": 0.2642263174057007, "reward_distinct_2_mean": 0.36709436774253845, "reward_distinct_2_std": 0.2868894338607788, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.09057766199111938, "reward_total_composite_std": 0.03686390817165375} {"timestamp_utc": "2026-04-12T19:12:00Z", "mode": "train", "global_step": 866, "epoch": 0.04557654860270512, "loss": 0.0512, "grad_norm": 23.65655517578125, "learning_rate": 7.378787878787879e-06, "num_tokens": 1543481.0, "completions/mean_length": 27.375, "completions/min_length": 25.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.375, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.5662153959274292, "rewards/meter/std": 0.34931254386901855, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7100000381469727, "rewards/judge_quality/std": 0.23384979367256165, "rewards/repeat_penalty/mean": 0.9695297479629517, "rewards/repeat_penalty/std": 0.062252357602119446, "rewards/repeat_floor/mean": 0.9961713552474976, "rewards/repeat_floor/std": 0.007383969612419605, "rewards/near_duplicate_penalty/mean": 0.9833513498306274, "rewards/near_duplicate_penalty/std": 0.02826262079179287, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.3762473464012146, "rewards/total_composite/std": 0.2378154695034027, "reward": 0.3762473464012146, "reward_std": 0.2378154695034027, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16126790642738342, "sampling/sampling_logp_difference/max": 2.372018814086914, "sampling/importance_sampling_ratio/min": 0.09329219162464142, "sampling/importance_sampling_ratio/mean": 0.9962642192840576, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.903374083340168, "clip_ratio/low_mean": 0.07348901219666004, "clip_ratio/low_min": 0.07348901219666004, "clip_ratio/high_mean": 0.08042203634977341, "clip_ratio/high_max": 0.08042203634977341, "clip_ratio/region_mean": 0.15391104854643345, "reward_total_mean": 0.3762473464012146, "reward_meter_mean": 0.5662153959274292, "reward_meter_std": 0.34931254386901855, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9695297479629517, "reward_repeat_penalty_std": 0.062252357602119446, "reward_repeat_floor_mean": 0.9961713552474976, "reward_repeat_floor_std": 0.007383969612419605, "reward_near_duplicate_penalty_mean": 0.9833513498306274, "reward_near_duplicate_penalty_std": 0.02826262079179287, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.7100000381469727, "reward_judge_quality_std": 0.23384979367256165, "reward_total_composite_mean": 0.3762473464012146, "reward_total_composite_std": 0.2378154695034027} {"timestamp_utc": "2026-04-12T19:12:08Z", "mode": "train", "global_step": 867, "epoch": 0.045629177411715176, "loss": 0.0654, "grad_norm": 23.61690330505371, "learning_rate": 7.375757575757576e-06, "num_tokens": 1545039.0, "completions/mean_length": 29.75, "completions/min_length": 27.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.75, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.46958133578300476, "rewards/meter/std": 0.3885764181613922, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9350000023841858, "rewards/judge_quality/std": 0.0160356592386961, "rewards/repeat_penalty/mean": 0.9995629191398621, "rewards/repeat_penalty/std": 0.0012362091802060604, "rewards/repeat_floor/mean": 0.9999344348907471, "rewards/repeat_floor/std": 0.0001854250585893169, "rewards/near_duplicate_penalty/mean": 0.9995629191398621, "rewards/near_duplicate_penalty/std": 0.0012362091802060604, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4419003129005432, "rewards/total_composite/std": 0.36857014894485474, "reward": 0.4419003129005432, "reward_std": 0.36857014894485474, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11949307471513748, "sampling/sampling_logp_difference/max": 2.093111038208008, "sampling/importance_sampling_ratio/min": 0.12330294400453568, "sampling/importance_sampling_ratio/mean": 0.9952176213264465, "sampling/importance_sampling_ratio/max": 1.5812885761260986, "entropy": 0.5339246280491352, "clip_ratio/low_mean": 0.04908218001946807, "clip_ratio/low_min": 0.04908218001946807, "clip_ratio/high_mean": 0.09117965400218964, "clip_ratio/high_max": 0.09117965400218964, "clip_ratio/region_mean": 0.1402618340216577, "reward_total_mean": 0.4419003129005432, "reward_meter_mean": 0.46958133578300476, "reward_meter_std": 0.3885764181613922, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9995629191398621, "reward_repeat_penalty_std": 0.0012362091802060604, "reward_repeat_floor_mean": 0.9999344348907471, "reward_repeat_floor_std": 0.0001854250585893169, "reward_near_duplicate_penalty_mean": 0.9995629191398621, "reward_near_duplicate_penalty_std": 0.0012362091802060604, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9350000023841858, "reward_judge_quality_std": 0.0160356592386961, "reward_total_composite_mean": 0.4419003129005432, "reward_total_composite_std": 0.36857014894485474} {"timestamp_utc": "2026-04-12T19:12:21Z", "mode": "train", "global_step": 868, "epoch": 0.04568180622072523, "loss": -0.0494, "grad_norm": 5.872175693511963, "learning_rate": 7.372727272727274e-06, "num_tokens": 1546567.0, "completions/mean_length": 98.0, "completions/min_length": 30.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.85714340209961, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.2153160572052002, "rewards/meter/std": 0.3381102681159973, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.9605072140693665, "rewards/lexical_plausibility/std": 0.11170248687267303, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9477797746658325, "rewards/repeat_penalty/std": 0.04624565318226814, "rewards/repeat_floor/mean": 0.9939553737640381, "rewards/repeat_floor/std": 0.0046444605104625225, "rewards/near_duplicate_penalty/mean": 0.97865891456604, "rewards/near_duplicate_penalty/std": 0.01389516144990921, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9684065580368042, "rewards/distinct_2/std": 0.044430434703826904, "rewards/total_composite/mean": 0.08430136740207672, "rewards/total_composite/std": 0.14996010065078735, "reward": 0.08430136740207672, "reward_std": 0.14996007084846497, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.148210808634758, "sampling/sampling_logp_difference/max": 1.4876470565795898, "sampling/importance_sampling_ratio/min": 0.22590357065200806, "sampling/importance_sampling_ratio/mean": 0.9940487146377563, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6033209711313248, "clip_ratio/low_mean": 0.08633532654494047, "clip_ratio/low_min": 0.08633532654494047, "clip_ratio/high_mean": 0.04233511723577976, "clip_ratio/high_max": 0.04233511723577976, "clip_ratio/region_mean": 0.12867044378072023, "reward_total_mean": 0.08430136740207672, "reward_meter_mean": 0.2153160572052002, "reward_meter_std": 0.3381102681159973, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.9605072140693665, "reward_lexical_plausibility_std": 0.11170248687267303, "reward_repeat_penalty_mean": 0.9477797746658325, "reward_repeat_penalty_std": 0.04624565318226814, "reward_repeat_floor_mean": 0.9939553737640381, "reward_repeat_floor_std": 0.0046444605104625225, "reward_near_duplicate_penalty_mean": 0.97865891456604, "reward_near_duplicate_penalty_std": 0.01389516144990921, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9684065580368042, "reward_distinct_2_std": 0.044430434703826904, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.08430136740207672, "reward_total_composite_std": 0.14996010065078735} {"timestamp_utc": "2026-04-12T19:12:34Z", "mode": "train", "global_step": 869, "epoch": 0.045734435029735274, "loss": -0.0467, "grad_norm": 4.988476753234863, "learning_rate": 7.36969696969697e-06, "num_tokens": 1548184.0, "completions/mean_length": 106.125, "completions/min_length": 28.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 48.142860412597656, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.6716678142547607, "rewards/meter/std": 0.359855055809021, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.9578310251235962, "rewards/lexical_plausibility/std": 0.11927188187837601, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.9183489680290222, "rewards/repeat_penalty/std": 0.08904451131820679, "rewards/repeat_floor/mean": 0.9906047582626343, "rewards/repeat_floor/std": 0.009944959543645382, "rewards/near_duplicate_penalty/mean": 0.9705090522766113, "rewards/near_duplicate_penalty/std": 0.02776431478559971, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9447595477104187, "rewards/distinct_2/std": 0.06738081574440002, "rewards/total_composite/mean": 0.17086133360862732, "rewards/total_composite/std": 0.13022080063819885, "reward": 0.17086133360862732, "reward_std": 0.13022080063819885, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18647263944149017, "sampling/sampling_logp_difference/max": 1.8996200561523438, "sampling/importance_sampling_ratio/min": 0.14962546527385712, "sampling/importance_sampling_ratio/mean": 0.9904005527496338, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.973294161260128, "clip_ratio/low_mean": 0.09361335076391697, "clip_ratio/low_min": 0.09361335076391697, "clip_ratio/high_mean": 0.03989813104271889, "clip_ratio/high_max": 0.03989813104271889, "clip_ratio/region_mean": 0.13351148180663586, "reward_total_mean": 0.17086133360862732, "reward_meter_mean": 0.6716678142547607, "reward_meter_std": 0.359855055809021, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.9578310251235962, "reward_lexical_plausibility_std": 0.11927188187837601, "reward_repeat_penalty_mean": 0.9183489680290222, "reward_repeat_penalty_std": 0.08904451131820679, "reward_repeat_floor_mean": 0.9906047582626343, "reward_repeat_floor_std": 0.009944959543645382, "reward_near_duplicate_penalty_mean": 0.9705090522766113, "reward_near_duplicate_penalty_std": 0.02776431478559971, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9447595477104187, "reward_distinct_2_std": 0.06738081574440002, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.17086133360862732, "reward_total_composite_std": 0.13022080063819885} {"timestamp_utc": "2026-04-12T19:12:48Z", "mode": "train", "global_step": 870, "epoch": 0.045787063838745326, "loss": -0.043, "grad_norm": 3.4905426502227783, "learning_rate": 7.3666666666666676e-06, "num_tokens": 1550053.0, "completions/mean_length": 189.625, "completions/min_length": 62.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 82.16667175292969, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.22927355766296387, "rewards/meter/std": 0.17436650395393372, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9399999976158142, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9318444728851318, "rewards/lexical_plausibility/std": 0.12274092435836792, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.6991857290267944, "rewards/repeat_penalty/std": 0.3495412766933441, "rewards/repeat_floor/mean": 0.9626133441925049, "rewards/repeat_floor/std": 0.04534195736050606, "rewards/near_duplicate_penalty/mean": 0.9125322103500366, "rewards/near_duplicate_penalty/std": 0.0874033272266388, "rewards/opening_diversity/mean": 0.921875, "rewards/opening_diversity/std": 0.17598575353622437, "rewards/distinct_2/mean": 0.7824562788009644, "rewards/distinct_2/std": 0.2682415246963501, "rewards/total_composite/mean": 0.04961996525526047, "rewards/total_composite/std": 0.057361848652362823, "reward": 0.04961996525526047, "reward_std": 0.057361844927072525, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20023545622825623, "sampling/sampling_logp_difference/max": 1.6970524787902832, "sampling/importance_sampling_ratio/min": 0.18322278559207916, "sampling/importance_sampling_ratio/mean": 1.036204218864441, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1511788666248322, "clip_ratio/low_mean": 0.048418208956718445, "clip_ratio/low_min": 0.048418208956718445, "clip_ratio/high_mean": 0.08592762146145105, "clip_ratio/high_max": 0.08592762146145105, "clip_ratio/region_mean": 0.1343458304181695, "reward_total_mean": 0.04961996525526047, "reward_meter_mean": 0.22927355766296387, "reward_meter_std": 0.17436650395393372, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9399999976158142, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9318444728851318, "reward_lexical_plausibility_std": 0.12274092435836792, "reward_repeat_penalty_mean": 0.6991857290267944, "reward_repeat_penalty_std": 0.3495412766933441, "reward_repeat_floor_mean": 0.9626133441925049, "reward_repeat_floor_std": 0.04534195736050606, "reward_near_duplicate_penalty_mean": 0.9125322103500366, "reward_near_duplicate_penalty_std": 0.0874033272266388, "reward_opening_diversity_mean": 0.921875, "reward_opening_diversity_std": 0.17598575353622437, "reward_distinct_2_mean": 0.7824562788009644, "reward_distinct_2_std": 0.2682415246963501, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.04961996525526047, "reward_total_composite_std": 0.057361848652362823} {"timestamp_utc": "2026-04-12T19:12:57Z", "mode": "train", "global_step": 871, "epoch": 0.04583969264775538, "loss": -0.0201, "grad_norm": 16.500547409057617, "learning_rate": 7.363636363636364e-06, "num_tokens": 1551586.0, "completions/mean_length": 37.625, "completions/min_length": 18.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.625, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7750052809715271, "rewards/meter/std": 0.3972945809364319, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.24512389302253723, "rewards/repeat_penalty/mean": 0.8672630190849304, "rewards/repeat_penalty/std": 0.10418357700109482, "rewards/repeat_floor/mean": 0.9845211505889893, "rewards/repeat_floor/std": 0.01130314078181982, "rewards/near_duplicate_penalty/mean": 0.931851863861084, "rewards/near_duplicate_penalty/std": 0.05389080569148064, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9624260663986206, "rewards/distinct_2/std": 0.07107843458652496, "rewards/total_composite/mean": 0.3773953914642334, "rewards/total_composite/std": 0.24919314682483673, "reward": 0.3773953914642334, "reward_std": 0.24919313192367554, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16073720157146454, "sampling/sampling_logp_difference/max": 2.2238855361938477, "sampling/importance_sampling_ratio/min": 0.10818792134523392, "sampling/importance_sampling_ratio/mean": 1.0057411193847656, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8519498854875565, "clip_ratio/low_mean": 0.0675589069724083, "clip_ratio/low_min": 0.0675589069724083, "clip_ratio/high_mean": 0.04549406748265028, "clip_ratio/high_max": 0.04549406748265028, "clip_ratio/region_mean": 0.11305297445505857, "reward_total_mean": 0.3773953914642334, "reward_meter_mean": 0.7750052809715271, "reward_meter_std": 0.3972945809364319, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8672630190849304, "reward_repeat_penalty_std": 0.10418357700109482, "reward_repeat_floor_mean": 0.9845211505889893, "reward_repeat_floor_std": 0.01130314078181982, "reward_near_duplicate_penalty_mean": 0.931851863861084, "reward_near_duplicate_penalty_std": 0.05389080569148064, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9624260663986206, "reward_distinct_2_std": 0.07107843458652496, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.24512389302253723, "reward_total_composite_mean": 0.3773953914642334, "reward_total_composite_std": 0.24919314682483673} {"timestamp_utc": "2026-04-12T19:13:06Z", "mode": "train", "global_step": 872, "epoch": 0.04589232145676543, "loss": -0.0567, "grad_norm": 19.357362747192383, "learning_rate": 7.360606060606061e-06, "num_tokens": 1553228.0, "completions/mean_length": 32.25, "completions/min_length": 16.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.25, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.8034600615501404, "rewards/meter/std": 0.30390915274620056, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5887500047683716, "rewards/judge_quality/std": 0.27740830183029175, "rewards/repeat_penalty/mean": 0.8482853174209595, "rewards/repeat_penalty/std": 0.16881361603736877, "rewards/repeat_floor/mean": 0.979885458946228, "rewards/repeat_floor/std": 0.02209554985165596, "rewards/near_duplicate_penalty/mean": 0.9054011702537537, "rewards/near_duplicate_penalty/std": 0.09223775565624237, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9550033211708069, "rewards/distinct_2/std": 0.05283082276582718, "rewards/total_composite/mean": 0.4801190495491028, "rewards/total_composite/std": 0.33508336544036865, "reward": 0.4801190495491028, "reward_std": 0.33508336544036865, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1537906527519226, "sampling/sampling_logp_difference/max": 2.0069661140441895, "sampling/importance_sampling_ratio/min": 0.1343958079814911, "sampling/importance_sampling_ratio/mean": 1.0011324882507324, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8896751999855042, "clip_ratio/low_mean": 0.07757065468467772, "clip_ratio/low_min": 0.07757065468467772, "clip_ratio/high_mean": 0.05026374477893114, "clip_ratio/high_max": 0.05026374477893114, "clip_ratio/region_mean": 0.12783439946360886, "reward_total_mean": 0.4801190495491028, "reward_meter_mean": 0.8034600615501404, "reward_meter_std": 0.30390915274620056, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8482853174209595, "reward_repeat_penalty_std": 0.16881361603736877, "reward_repeat_floor_mean": 0.979885458946228, "reward_repeat_floor_std": 0.02209554985165596, "reward_near_duplicate_penalty_mean": 0.9054011702537537, "reward_near_duplicate_penalty_std": 0.09223775565624237, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9550033211708069, "reward_distinct_2_std": 0.05283082276582718, "reward_judge_quality_mean": 0.5887500047683716, "reward_judge_quality_std": 0.27740830183029175, "reward_total_composite_mean": 0.4801190495491028, "reward_total_composite_std": 0.33508336544036865} {"timestamp_utc": "2026-04-12T19:13:21Z", "mode": "train", "global_step": 873, "epoch": 0.04594495026577548, "loss": 0.0241, "grad_norm": 7.038979530334473, "learning_rate": 7.357575757575758e-06, "num_tokens": 1554761.0, "completions/mean_length": 85.625, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 24.71428680419922, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.749538779258728, "rewards/meter/std": 0.4065682888031006, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.13887302577495575, "rewards/lexical_plausibility/mean": 0.9514477252960205, "rewards/lexical_plausibility/std": 0.1141868606209755, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.2840491831302643, "rewards/repeat_penalty/mean": 0.7762438654899597, "rewards/repeat_penalty/std": 0.1221478059887886, "rewards/repeat_floor/mean": 0.9819340705871582, "rewards/repeat_floor/std": 0.010640923865139484, "rewards/near_duplicate_penalty/mean": 0.9545605182647705, "rewards/near_duplicate_penalty/std": 0.04778008162975311, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3044961094856262, "rewards/total_composite/std": 0.2873344123363495, "reward": 0.3044961094856262, "reward_std": 0.2873344123363495, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17623257637023926, "sampling/sampling_logp_difference/max": 1.8010578155517578, "sampling/importance_sampling_ratio/min": 0.16512413322925568, "sampling/importance_sampling_ratio/mean": 1.0417358875274658, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2829299345612526, "clip_ratio/low_mean": 0.028685898054391146, "clip_ratio/low_min": 0.028685898054391146, "clip_ratio/high_mean": 0.08574879262596369, "clip_ratio/high_max": 0.08574879262596369, "clip_ratio/region_mean": 0.11443469068035483, "reward_total_mean": 0.3044961094856262, "reward_meter_mean": 0.749538779258728, "reward_meter_std": 0.4065682888031006, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.13887302577495575, "reward_lexical_plausibility_mean": 0.9514477252960205, "reward_lexical_plausibility_std": 0.1141868606209755, "reward_repeat_penalty_mean": 0.7762438654899597, "reward_repeat_penalty_std": 0.1221478059887886, "reward_repeat_floor_mean": 0.9819340705871582, "reward_repeat_floor_std": 0.010640923865139484, "reward_near_duplicate_penalty_mean": 0.9545605182647705, "reward_near_duplicate_penalty_std": 0.04778008162975311, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.2840491831302643, "reward_total_composite_mean": 0.3044961094856262, "reward_total_composite_std": 0.2873344123363495} {"timestamp_utc": "2026-04-12T19:13:32Z", "mode": "train", "global_step": 874, "epoch": 0.045997579074785536, "loss": 0.0361, "grad_norm": 6.368078231811523, "learning_rate": 7.354545454545456e-06, "num_tokens": 1558003.0, "completions/mean_length": 166.25, "completions/min_length": 135.0, "completions/max_length": 205.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 166.25, "completions/min_terminated_length": 135.0, "completions/max_terminated_length": 205.0, "rewards/meter/mean": 0.7665997743606567, "rewards/meter/std": 0.19188617169857025, "rewards/count_adherence/mean": 0.925000011920929, "rewards/count_adherence/std": 0.10350984334945679, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9775000214576721, "rewards/count_floor/std": 0.03105293959379196, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.4261830449104309, "rewards/repeat_penalty/std": 0.2072986215353012, "rewards/repeat_floor/mean": 0.9325563907623291, "rewards/repeat_floor/std": 0.0313393771648407, "rewards/near_duplicate_penalty/mean": 0.8621490597724915, "rewards/near_duplicate_penalty/std": 0.0647788792848587, "rewards/opening_diversity/mean": 0.9624999761581421, "rewards/opening_diversity/std": 0.1060660257935524, "rewards/distinct_2/mean": 0.505378246307373, "rewards/distinct_2/std": 0.19852392375469208, "rewards/total_composite/mean": 0.20223039388656616, "rewards/total_composite/std": 0.10624415427446365, "reward": 0.20223039388656616, "reward_std": 0.10624415427446365, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1410389542579651, "sampling/sampling_logp_difference/max": 3.2784266471862793, "sampling/importance_sampling_ratio/min": 0.037687502801418304, "sampling/importance_sampling_ratio/mean": 1.0044747591018677, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9199883863329887, "clip_ratio/low_mean": 0.0591319790109992, "clip_ratio/low_min": 0.0591319790109992, "clip_ratio/high_mean": 0.0784632358700037, "clip_ratio/high_max": 0.0784632358700037, "clip_ratio/region_mean": 0.1375952148810029, "reward_total_mean": 0.20223039388656616, "reward_meter_mean": 0.7665997743606567, "reward_meter_std": 0.19188617169857025, "reward_count_adherence_mean": 0.925000011920929, "reward_count_adherence_std": 0.10350984334945679, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9775000214576721, "reward_count_floor_std": 0.03105293959379196, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.4261830449104309, "reward_repeat_penalty_std": 0.2072986215353012, "reward_repeat_floor_mean": 0.9325563907623291, "reward_repeat_floor_std": 0.0313393771648407, "reward_near_duplicate_penalty_mean": 0.8621490597724915, "reward_near_duplicate_penalty_std": 0.0647788792848587, "reward_opening_diversity_mean": 0.9624999761581421, "reward_opening_diversity_std": 0.1060660257935524, "reward_distinct_2_mean": 0.505378246307373, "reward_distinct_2_std": 0.19852392375469208, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.20223039388656616, "reward_total_composite_std": 0.10624415427446365} {"timestamp_utc": "2026-04-12T19:13:41Z", "mode": "train", "global_step": 875, "epoch": 0.04605020788379559, "loss": -0.092, "grad_norm": 11.503551483154297, "learning_rate": 7.351515151515151e-06, "num_tokens": 1560242.0, "completions/mean_length": 71.875, "completions/min_length": 22.0, "completions/max_length": 98.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 71.875, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.9875743389129639, "rewards/meter/std": 0.018453437834978104, "rewards/count_adherence/mean": 0.6499999761581421, "rewards/count_adherence/std": 0.2777460515499115, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8949999809265137, "rewards/count_floor/std": 0.08332381397485733, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.7421561479568481, "rewards/repeat_penalty/std": 0.1999952644109726, "rewards/repeat_floor/mean": 0.9704427719116211, "rewards/repeat_floor/std": 0.028293592855334282, "rewards/near_duplicate_penalty/mean": 0.9162959456443787, "rewards/near_duplicate_penalty/std": 0.11142666637897491, "rewards/opening_diversity/mean": 0.9296875, "rewards/opening_diversity/std": 0.1129826009273529, "rewards/distinct_2/mean": 0.8579676151275635, "rewards/distinct_2/std": 0.12484433501958847, "rewards/total_composite/mean": 0.3413340449333191, "rewards/total_composite/std": 0.04577485844492912, "reward": 0.3413340449333191, "reward_std": 0.04577486589550972, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14321988821029663, "sampling/sampling_logp_difference/max": 1.9944705963134766, "sampling/importance_sampling_ratio/min": 0.13608567416667938, "sampling/importance_sampling_ratio/mean": 0.9968971014022827, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9085503965616226, "clip_ratio/low_mean": 0.1005949666723609, "clip_ratio/low_min": 0.1005949666723609, "clip_ratio/high_mean": 0.055285826325416565, "clip_ratio/high_max": 0.055285826325416565, "clip_ratio/region_mean": 0.15588079299777746, "reward_total_mean": 0.3413340449333191, "reward_meter_mean": 0.9875743389129639, "reward_meter_std": 0.018453437834978104, "reward_count_adherence_mean": 0.6499999761581421, "reward_count_adherence_std": 0.2777460515499115, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8949999809265137, "reward_count_floor_std": 0.08332381397485733, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7421561479568481, "reward_repeat_penalty_std": 0.1999952644109726, "reward_repeat_floor_mean": 0.9704427719116211, "reward_repeat_floor_std": 0.028293592855334282, "reward_near_duplicate_penalty_mean": 0.9162959456443787, "reward_near_duplicate_penalty_std": 0.11142666637897491, "reward_opening_diversity_mean": 0.9296875, "reward_opening_diversity_std": 0.1129826009273529, "reward_distinct_2_mean": 0.8579676151275635, "reward_distinct_2_std": 0.12484433501958847, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.3413340449333191, "reward_total_composite_std": 0.04577485844492912} {"timestamp_utc": "2026-04-12T19:13:52Z", "mode": "train", "global_step": 876, "epoch": 0.04610283669280564, "loss": -0.095, "grad_norm": 9.276765823364258, "learning_rate": 7.348484848484849e-06, "num_tokens": 1562697.0, "completions/mean_length": 73.875, "completions/min_length": 28.0, "completions/max_length": 89.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 73.875, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 89.0, "rewards/meter/mean": 0.9826794862747192, "rewards/meter/std": 0.02156369574368, "rewards/count_adherence/mean": 0.675000011920929, "rewards/count_adherence/std": 0.2121320515871048, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9024999737739563, "rewards/count_floor/std": 0.06363961100578308, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.31512606143951416, "rewards/repeat_penalty/std": 0.24519988894462585, "rewards/repeat_floor/mean": 0.9055250883102417, "rewards/repeat_floor/std": 0.05129530653357506, "rewards/near_duplicate_penalty/mean": 0.7299025058746338, "rewards/near_duplicate_penalty/std": 0.2182547152042389, "rewards/opening_diversity/mean": 0.9084821343421936, "rewards/opening_diversity/std": 0.1367267221212387, "rewards/distinct_2/mean": 0.4614526629447937, "rewards/distinct_2/std": 0.23033969104290009, "rewards/total_composite/mean": 0.2057122439146042, "rewards/total_composite/std": 0.09926880896091461, "reward": 0.2057122439146042, "reward_std": 0.09926880151033401, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10832500457763672, "sampling/sampling_logp_difference/max": 3.4130635261535645, "sampling/importance_sampling_ratio/min": 0.35713186860084534, "sampling/importance_sampling_ratio/mean": 1.035207748413086, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8915101364254951, "clip_ratio/low_mean": 0.04373576492071152, "clip_ratio/low_min": 0.04373576492071152, "clip_ratio/high_mean": 0.04673337284475565, "clip_ratio/high_max": 0.04673337284475565, "clip_ratio/region_mean": 0.09046913776546717, "reward_total_mean": 0.2057122439146042, "reward_meter_mean": 0.9826794862747192, "reward_meter_std": 0.02156369574368, "reward_count_adherence_mean": 0.675000011920929, "reward_count_adherence_std": 0.2121320515871048, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9024999737739563, "reward_count_floor_std": 0.06363961100578308, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.31512606143951416, "reward_repeat_penalty_std": 0.24519988894462585, "reward_repeat_floor_mean": 0.9055250883102417, "reward_repeat_floor_std": 0.05129530653357506, "reward_near_duplicate_penalty_mean": 0.7299025058746338, "reward_near_duplicate_penalty_std": 0.2182547152042389, "reward_opening_diversity_mean": 0.9084821343421936, "reward_opening_diversity_std": 0.1367267221212387, "reward_distinct_2_mean": 0.4614526629447937, "reward_distinct_2_std": 0.23033969104290009, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.2057122439146042, "reward_total_composite_std": 0.09926880896091461} {"timestamp_utc": "2026-04-12T19:14:00Z", "mode": "train", "global_step": 877, "epoch": 0.04615546550181569, "loss": 0.031, "grad_norm": 26.927339553833008, "learning_rate": 7.345454545454546e-06, "num_tokens": 1564002.0, "completions/mean_length": 16.125, "completions/min_length": 14.0, "completions/max_length": 20.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.125, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 20.0, "rewards/meter/mean": 0.9322580099105835, "rewards/meter/std": 0.10376407206058502, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7649999856948853, "rewards/judge_quality/std": 0.29799333214759827, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6960526704788208, "rewards/total_composite/std": 0.2776948809623718, "reward": 0.6960526704788208, "reward_std": 0.27769485116004944, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.137740820646286, "sampling/sampling_logp_difference/max": 1.3927980661392212, "sampling/importance_sampling_ratio/min": 0.24837934970855713, "sampling/importance_sampling_ratio/mean": 1.0237650871276855, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9306323155760765, "clip_ratio/low_mean": 0.0396446087397635, "clip_ratio/low_min": 0.0396446087397635, "clip_ratio/high_mean": 0.10573792364448309, "clip_ratio/high_max": 0.10573792364448309, "clip_ratio/region_mean": 0.1453825323842466, "reward_total_mean": 0.6960526704788208, "reward_meter_mean": 0.9322580099105835, "reward_meter_std": 0.10376407206058502, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7649999856948853, "reward_judge_quality_std": 0.29799333214759827, "reward_total_composite_mean": 0.6960526704788208, "reward_total_composite_std": 0.2776948809623718} {"timestamp_utc": "2026-04-12T19:14:10Z", "mode": "train", "global_step": 878, "epoch": 0.046208094310825745, "loss": -0.0036, "grad_norm": 12.388447761535645, "learning_rate": 7.342424242424243e-06, "num_tokens": 1565817.0, "completions/mean_length": 57.875, "completions/min_length": 49.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.875, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.542432427406311, "rewards/meter/std": 0.371094673871994, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4387500286102295, "rewards/judge_quality/std": 0.3985128700733185, "rewards/repeat_penalty/mean": 0.9952296018600464, "rewards/repeat_penalty/std": 0.009135845117270947, "rewards/repeat_floor/mean": 0.9992844462394714, "rewards/repeat_floor/std": 0.001370378420688212, "rewards/near_duplicate_penalty/mean": 0.9952296018600464, "rewards/near_duplicate_penalty/std": 0.009135845117270947, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21066735684871674, "rewards/total_composite/std": 0.27830126881599426, "reward": 0.21066735684871674, "reward_std": 0.27830126881599426, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11187071353197098, "sampling/sampling_logp_difference/max": 1.6696062088012695, "sampling/importance_sampling_ratio/min": 0.18832120299339294, "sampling/importance_sampling_ratio/mean": 1.0375959873199463, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7789190337061882, "clip_ratio/low_mean": 0.0972730815410614, "clip_ratio/low_min": 0.0972730815410614, "clip_ratio/high_mean": 0.008196720853447914, "clip_ratio/high_max": 0.008196720853447914, "clip_ratio/region_mean": 0.10546980239450932, "reward_total_mean": 0.21066735684871674, "reward_meter_mean": 0.542432427406311, "reward_meter_std": 0.371094673871994, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9952296018600464, "reward_repeat_penalty_std": 0.009135845117270947, "reward_repeat_floor_mean": 0.9992844462394714, "reward_repeat_floor_std": 0.001370378420688212, "reward_near_duplicate_penalty_mean": 0.9952296018600464, "reward_near_duplicate_penalty_std": 0.009135845117270947, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4387500286102295, "reward_judge_quality_std": 0.3985128700733185, "reward_total_composite_mean": 0.21066735684871674, "reward_total_composite_std": 0.27830126881599426} {"timestamp_utc": "2026-04-12T19:14:18Z", "mode": "train", "global_step": 879, "epoch": 0.0462607231198358, "loss": 0.0157, "grad_norm": 25.1612606048584, "learning_rate": 7.3393939393939395e-06, "num_tokens": 1567193.0, "completions/mean_length": 24.0, "completions/min_length": 21.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 24.0, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.607140064239502, "rewards/meter/std": 0.3807227909564972, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6599999666213989, "rewards/judge_quality/std": 0.2805097699165344, "rewards/repeat_penalty/mean": 0.9357510805130005, "rewards/repeat_penalty/std": 0.08802963048219681, "rewards/repeat_floor/mean": 0.9910063147544861, "rewards/repeat_floor/std": 0.011473841033875942, "rewards/near_duplicate_penalty/mean": 0.9505317211151123, "rewards/near_duplicate_penalty/std": 0.04951261356472969, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.3787187933921814, "rewards/total_composite/std": 0.2884226143360138, "reward": 0.3787187933921814, "reward_std": 0.2884226143360138, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.190205916762352, "sampling/sampling_logp_difference/max": 2.4015331268310547, "sampling/importance_sampling_ratio/min": 0.09057898074388504, "sampling/importance_sampling_ratio/mean": 1.0315871238708496, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.704744964838028, "clip_ratio/low_mean": 0.08622023742645979, "clip_ratio/low_min": 0.08622023742645979, "clip_ratio/high_mean": 0.08312920713797212, "clip_ratio/high_max": 0.08312920713797212, "clip_ratio/region_mean": 0.1693494445644319, "reward_total_mean": 0.3787187933921814, "reward_meter_mean": 0.607140064239502, "reward_meter_std": 0.3807227909564972, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9357510805130005, "reward_repeat_penalty_std": 0.08802963048219681, "reward_repeat_floor_mean": 0.9910063147544861, "reward_repeat_floor_std": 0.011473841033875942, "reward_near_duplicate_penalty_mean": 0.9505317211151123, "reward_near_duplicate_penalty_std": 0.04951261356472969, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.6599999666213989, "reward_judge_quality_std": 0.2805097699165344, "reward_total_composite_mean": 0.3787187933921814, "reward_total_composite_std": 0.2884226143360138} {"timestamp_utc": "2026-04-12T19:14:29Z", "mode": "train", "global_step": 880, "epoch": 0.04631335192884585, "loss": 0.0227, "grad_norm": 5.945997714996338, "learning_rate": 7.336363636363637e-06, "num_tokens": 1569920.0, "completions/mean_length": 132.875, "completions/min_length": 103.0, "completions/max_length": 165.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 132.875, "completions/min_terminated_length": 103.0, "completions/max_terminated_length": 165.0, "rewards/meter/mean": 0.5385571718215942, "rewards/meter/std": 0.37893539667129517, "rewards/count_adherence/mean": 0.9125000238418579, "rewards/count_adherence/std": 0.06408699601888657, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9737499952316284, "rewards/count_floor/std": 0.01922609470784664, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.08628641068935394, "rewards/repeat_penalty/std": 0.09096816182136536, "rewards/repeat_floor/mean": 0.8775551915168762, "rewards/repeat_floor/std": 0.024921759963035583, "rewards/near_duplicate_penalty/mean": 0.7272076606750488, "rewards/near_duplicate_penalty/std": 0.06567627936601639, "rewards/opening_diversity/mean": 0.9173793792724609, "rewards/opening_diversity/std": 0.08697489649057388, "rewards/distinct_2/mean": 0.14923608303070068, "rewards/distinct_2/std": 0.146689772605896, "rewards/total_composite/mean": 0.0990256667137146, "rewards/total_composite/std": 0.08351548761129379, "reward": 0.0990256667137146, "reward_std": 0.08351548761129379, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09959546476602554, "sampling/sampling_logp_difference/max": 2.3838906288146973, "sampling/importance_sampling_ratio/min": 0.0921911969780922, "sampling/importance_sampling_ratio/mean": 1.007084608078003, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5856452696025372, "clip_ratio/low_mean": 0.034149602986872196, "clip_ratio/low_min": 0.034149602986872196, "clip_ratio/high_mean": 0.036335236858576536, "clip_ratio/high_max": 0.036335236858576536, "clip_ratio/region_mean": 0.07048483984544873, "reward_total_mean": 0.0990256667137146, "reward_meter_mean": 0.5385571718215942, "reward_meter_std": 0.37893539667129517, "reward_count_adherence_mean": 0.9125000238418579, "reward_count_adherence_std": 0.06408699601888657, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9737499952316284, "reward_count_floor_std": 0.01922609470784664, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.08628641068935394, "reward_repeat_penalty_std": 0.09096816182136536, "reward_repeat_floor_mean": 0.8775551915168762, "reward_repeat_floor_std": 0.024921759963035583, "reward_near_duplicate_penalty_mean": 0.7272076606750488, "reward_near_duplicate_penalty_std": 0.06567627936601639, "reward_opening_diversity_mean": 0.9173793792724609, "reward_opening_diversity_std": 0.08697489649057388, "reward_distinct_2_mean": 0.14923608303070068, "reward_distinct_2_std": 0.146689772605896, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.0990256667137146, "reward_total_composite_std": 0.08351548761129379} {"timestamp_utc": "2026-04-12T19:14:37Z", "mode": "train", "global_step": 881, "epoch": 0.0463659807378559, "loss": 0.0372, "grad_norm": 21.14667510986328, "learning_rate": 7.333333333333333e-06, "num_tokens": 1571431.0, "completions/mean_length": 18.875, "completions/min_length": 17.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.875, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.7041109800338745, "rewards/meter/std": 0.43137630820274353, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.7100000381469727, "rewards/judge_quality/std": 0.3123185336589813, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.446069598197937, "rewards/total_composite/std": 0.3866676986217499, "reward": 0.446069598197937, "reward_std": 0.3866676986217499, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15217608213424683, "sampling/sampling_logp_difference/max": 1.1450872421264648, "sampling/importance_sampling_ratio/min": 0.3181961476802826, "sampling/importance_sampling_ratio/mean": 0.9864500761032104, "sampling/importance_sampling_ratio/max": 1.7654838562011719, "entropy": 1.2468656301498413, "clip_ratio/low_mean": 0.0709261978045106, "clip_ratio/low_min": 0.0709261978045106, "clip_ratio/high_mean": 0.05462184967473149, "clip_ratio/high_max": 0.05462184967473149, "clip_ratio/region_mean": 0.1255480474792421, "reward_total_mean": 0.446069598197937, "reward_meter_mean": 0.7041109800338745, "reward_meter_std": 0.43137630820274353, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7100000381469727, "reward_judge_quality_std": 0.3123185336589813, "reward_total_composite_mean": 0.446069598197937, "reward_total_composite_std": 0.3866676986217499} {"timestamp_utc": "2026-04-12T19:14:50Z", "mode": "train", "global_step": 882, "epoch": 0.046418609546865955, "loss": -0.0125, "grad_norm": 1.9595142602920532, "learning_rate": 7.330303030303031e-06, "num_tokens": 1572818.0, "completions/mean_length": 263.375, "completions/min_length": 14.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 14.75, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 17.0, "rewards/meter/mean": 0.1281031370162964, "rewards/meter/std": 0.3201996684074402, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.774090051651001, "rewards/lexical_plausibility/std": 0.18709072470664978, "rewards/judge_quality/mean": 0.38625001907348633, "rewards/judge_quality/std": 0.45226216316223145, "rewards/repeat_penalty/mean": 0.8080371618270874, "rewards/repeat_penalty/std": 0.11912072449922562, "rewards/repeat_floor/mean": 0.9878881573677063, "rewards/repeat_floor/std": 0.007844987325370312, "rewards/near_duplicate_penalty/mean": 0.9945987462997437, "rewards/near_duplicate_penalty/std": 0.01527698989957571, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9994259476661682, "rewards/distinct_2/std": 0.0016236650990322232, "rewards/total_composite/mean": 0.02596518024802208, "rewards/total_composite/std": 0.0494607649743557, "reward": 0.02596518024802208, "reward_std": 0.049460768699645996, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16541264951229095, "sampling/sampling_logp_difference/max": 0.8870255947113037, "sampling/importance_sampling_ratio/min": 0.4118790328502655, "sampling/importance_sampling_ratio/mean": 1.0033903121948242, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5232321918010712, "clip_ratio/low_mean": 0.07142857275903225, "clip_ratio/low_min": 0.07142857275903225, "clip_ratio/high_mean": 0.023634454235434532, "clip_ratio/high_max": 0.023634454235434532, "clip_ratio/region_mean": 0.09506302699446678, "reward_total_mean": 0.02596518024802208, "reward_meter_mean": 0.1281031370162964, "reward_meter_std": 0.3201996684074402, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.774090051651001, "reward_lexical_plausibility_std": 0.18709072470664978, "reward_repeat_penalty_mean": 0.8080371618270874, "reward_repeat_penalty_std": 0.11912072449922562, "reward_repeat_floor_mean": 0.9878881573677063, "reward_repeat_floor_std": 0.007844987325370312, "reward_near_duplicate_penalty_mean": 0.9945987462997437, "reward_near_duplicate_penalty_std": 0.01527698989957571, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9994259476661682, "reward_distinct_2_std": 0.0016236650990322232, "reward_judge_quality_mean": 0.38625001907348633, "reward_judge_quality_std": 0.45226216316223145, "reward_total_composite_mean": 0.02596518024802208, "reward_total_composite_std": 0.0494607649743557} {"timestamp_utc": "2026-04-12T19:15:04Z", "mode": "train", "global_step": 883, "epoch": 0.04647123835587601, "loss": -0.0228, "grad_norm": 3.174278736114502, "learning_rate": 7.3272727272727285e-06, "num_tokens": 1574342.0, "completions/mean_length": 157.5, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 39.333335876464844, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.11787182092666626, "rewards/meter/std": 0.1051332876086235, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8745204210281372, "rewards/lexical_plausibility/std": 0.20271295309066772, "rewards/judge_quality/mean": 0.5137500166893005, "rewards/judge_quality/std": 0.3703642189502716, "rewards/repeat_penalty/mean": 0.9847168922424316, "rewards/repeat_penalty/std": 0.03703960031270981, "rewards/repeat_floor/mean": 0.9978303909301758, "rewards/repeat_floor/std": 0.0052101886831223965, "rewards/near_duplicate_penalty/mean": 0.9871079921722412, "rewards/near_duplicate_penalty/std": 0.030315378680825233, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9973800182342529, "rewards/distinct_2/std": 0.007410469930619001, "rewards/total_composite/mean": 0.07036422193050385, "rewards/total_composite/std": 0.10603836923837662, "reward": 0.07036422193050385, "reward_std": 0.10603835433721542, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18420745432376862, "sampling/sampling_logp_difference/max": 2.062805652618408, "sampling/importance_sampling_ratio/min": 0.12709687650203705, "sampling/importance_sampling_ratio/mean": 1.0141772031784058, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9522935003042221, "clip_ratio/low_mean": 0.0976778669282794, "clip_ratio/low_min": 0.0976778669282794, "clip_ratio/high_mean": 0.05233253724873066, "clip_ratio/high_max": 0.05233253724873066, "clip_ratio/region_mean": 0.15001040417701006, "reward_total_mean": 0.07036422193050385, "reward_meter_mean": 0.11787182092666626, "reward_meter_std": 0.1051332876086235, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8745204210281372, "reward_lexical_plausibility_std": 0.20271295309066772, "reward_repeat_penalty_mean": 0.9847168922424316, "reward_repeat_penalty_std": 0.03703960031270981, "reward_repeat_floor_mean": 0.9978303909301758, "reward_repeat_floor_std": 0.0052101886831223965, "reward_near_duplicate_penalty_mean": 0.9871079921722412, "reward_near_duplicate_penalty_std": 0.030315378680825233, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9973800182342529, "reward_distinct_2_std": 0.007410469930619001, "reward_judge_quality_mean": 0.5137500166893005, "reward_judge_quality_std": 0.3703642189502716, "reward_total_composite_mean": 0.07036422193050385, "reward_total_composite_std": 0.10603836923837662} {"timestamp_utc": "2026-04-12T19:15:18Z", "mode": "train", "global_step": 884, "epoch": 0.04652386716488606, "loss": -0.1543, "grad_norm": 3.139519214630127, "learning_rate": 7.324242424242425e-06, "num_tokens": 1576288.0, "completions/mean_length": 189.25, "completions/min_length": 76.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 81.66667175292969, "completions/min_terminated_length": 76.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.8730491399765015, "rewards/meter/std": 0.1392127275466919, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9399999976158142, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9090895652770996, "rewards/lexical_plausibility/std": 0.1704242080450058, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.7702693939208984, "rewards/repeat_penalty/std": 0.12146493047475815, "rewards/repeat_floor/mean": 0.9743232727050781, "rewards/repeat_floor/std": 0.012096121907234192, "rewards/near_duplicate_penalty/mean": 0.9344332218170166, "rewards/near_duplicate_penalty/std": 0.011053124442696571, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.8291887044906616, "rewards/distinct_2/std": 0.11819184571504593, "rewards/total_composite/mean": 0.23385152220726013, "rewards/total_composite/std": 0.12986473739147186, "reward": 0.23385152220726013, "reward_std": 0.12986473739147186, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14850276708602905, "sampling/sampling_logp_difference/max": 2.5442075729370117, "sampling/importance_sampling_ratio/min": 0.07853526622056961, "sampling/importance_sampling_ratio/mean": 1.0233300924301147, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7174096181988716, "clip_ratio/low_mean": 0.01151315774768591, "clip_ratio/low_min": 0.01151315774768591, "clip_ratio/high_mean": 0.07357755722478032, "clip_ratio/high_max": 0.07357755722478032, "clip_ratio/region_mean": 0.08509071497246623, "reward_total_mean": 0.23385152220726013, "reward_meter_mean": 0.8730491399765015, "reward_meter_std": 0.1392127275466919, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9399999976158142, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9090895652770996, "reward_lexical_plausibility_std": 0.1704242080450058, "reward_repeat_penalty_mean": 0.7702693939208984, "reward_repeat_penalty_std": 0.12146493047475815, "reward_repeat_floor_mean": 0.9743232727050781, "reward_repeat_floor_std": 0.012096121907234192, "reward_near_duplicate_penalty_mean": 0.9344332218170166, "reward_near_duplicate_penalty_std": 0.011053124442696571, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.8291887044906616, "reward_distinct_2_std": 0.11819184571504593, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.23385152220726013, "reward_total_composite_std": 0.12986473739147186} {"timestamp_utc": "2026-04-12T19:15:33Z", "mode": "train", "global_step": 885, "epoch": 0.04657649597389611, "loss": -0.0652, "grad_norm": 1.9510021209716797, "learning_rate": 7.321212121212122e-06, "num_tokens": 1577752.0, "completions/mean_length": 218.0, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 41.60000228881836, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.7423527240753174, "rewards/meter/std": 0.24679777026176453, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175492912530899, "rewards/lexical_plausibility/mean": 0.8737708926200867, "rewards/lexical_plausibility/std": 0.16459837555885315, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.18077215552330017, "rewards/repeat_penalty/mean": 0.9060587882995605, "rewards/repeat_penalty/std": 0.14735999703407288, "rewards/repeat_floor/mean": 0.9902509450912476, "rewards/repeat_floor/std": 0.011406295001506805, "rewards/near_duplicate_penalty/mean": 0.957493782043457, "rewards/near_duplicate_penalty/std": 0.031095990911126137, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9625208377838135, "rewards/distinct_2/std": 0.08306626975536346, "rewards/total_composite/mean": 0.16588640213012695, "rewards/total_composite/std": 0.1439305692911148, "reward": 0.16588640213012695, "reward_std": 0.1439305692911148, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1448756605386734, "sampling/sampling_logp_difference/max": 1.2516169548034668, "sampling/importance_sampling_ratio/min": 0.28604191541671753, "sampling/importance_sampling_ratio/mean": 1.014423131942749, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6253417953848839, "clip_ratio/low_mean": 0.04021598957479, "clip_ratio/low_min": 0.04021598957479, "clip_ratio/high_mean": 0.061585801653563976, "clip_ratio/high_max": 0.061585801653563976, "clip_ratio/region_mean": 0.10180179122835398, "reward_total_mean": 0.16588640213012695, "reward_meter_mean": 0.7423527240753174, "reward_meter_std": 0.24679777026176453, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175492912530899, "reward_lexical_plausibility_mean": 0.8737708926200867, "reward_lexical_plausibility_std": 0.16459837555885315, "reward_repeat_penalty_mean": 0.9060587882995605, "reward_repeat_penalty_std": 0.14735999703407288, "reward_repeat_floor_mean": 0.9902509450912476, "reward_repeat_floor_std": 0.011406295001506805, "reward_near_duplicate_penalty_mean": 0.957493782043457, "reward_near_duplicate_penalty_std": 0.031095990911126137, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9625208377838135, "reward_distinct_2_std": 0.08306626975536346, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.18077215552330017, "reward_total_composite_mean": 0.16588640213012695, "reward_total_composite_std": 0.1439305692911148} {"timestamp_utc": "2026-04-12T19:15:48Z", "mode": "train", "global_step": 886, "epoch": 0.046629124782906164, "loss": -0.0421, "grad_norm": 5.369659423828125, "learning_rate": 7.3181818181818186e-06, "num_tokens": 1579313.0, "completions/mean_length": 96.125, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 36.71428680419922, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.3362264633178711, "rewards/meter/std": 0.38697749376296997, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9562819600105286, "rewards/lexical_plausibility/std": 0.11593372374773026, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9162084460258484, "rewards/repeat_penalty/std": 0.08807915449142456, "rewards/repeat_floor/mean": 0.9913227558135986, "rewards/repeat_floor/std": 0.007231482770293951, "rewards/near_duplicate_penalty/mean": 0.9675122499465942, "rewards/near_duplicate_penalty/std": 0.029377853497862816, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9785662889480591, "rewards/distinct_2/std": 0.03976902738213539, "rewards/total_composite/mean": 0.1362835168838501, "rewards/total_composite/std": 0.1556205302476883, "reward": 0.1362835168838501, "reward_std": 0.1556205302476883, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13743160665035248, "sampling/sampling_logp_difference/max": 1.3717479705810547, "sampling/importance_sampling_ratio/min": 0.25366318225860596, "sampling/importance_sampling_ratio/mean": 1.024179458618164, "sampling/importance_sampling_ratio/max": 1.7470049858093262, "entropy": 0.7761737704277039, "clip_ratio/low_mean": 0.07000825181603432, "clip_ratio/low_min": 0.07000825181603432, "clip_ratio/high_mean": 0.05300951562821865, "clip_ratio/high_max": 0.05300951562821865, "clip_ratio/region_mean": 0.12301776744425297, "reward_total_mean": 0.1362835168838501, "reward_meter_mean": 0.3362264633178711, "reward_meter_std": 0.38697749376296997, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9562819600105286, "reward_lexical_plausibility_std": 0.11593372374773026, "reward_repeat_penalty_mean": 0.9162084460258484, "reward_repeat_penalty_std": 0.08807915449142456, "reward_repeat_floor_mean": 0.9913227558135986, "reward_repeat_floor_std": 0.007231482770293951, "reward_near_duplicate_penalty_mean": 0.9675122499465942, "reward_near_duplicate_penalty_std": 0.029377853497862816, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9785662889480591, "reward_distinct_2_std": 0.03976902738213539, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.1362835168838501, "reward_total_composite_std": 0.1556205302476883} {"timestamp_utc": "2026-04-12T19:15:57Z", "mode": "train", "global_step": 887, "epoch": 0.04668175359191622, "loss": 0.083, "grad_norm": 10.571259498596191, "learning_rate": 7.315151515151516e-06, "num_tokens": 1581050.0, "completions/mean_length": 60.125, "completions/min_length": 50.0, "completions/max_length": 109.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.125, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 109.0, "rewards/meter/mean": 0.33594268560409546, "rewards/meter/std": 0.2705962359905243, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.3208470940589905, "rewards/repeat_penalty/mean": 0.7862205505371094, "rewards/repeat_penalty/std": 0.2621435225009918, "rewards/repeat_floor/mean": 0.9746034741401672, "rewards/repeat_floor/std": 0.030592938885092735, "rewards/near_duplicate_penalty/mean": 0.9286086559295654, "rewards/near_duplicate_penalty/std": 0.05637591704726219, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8368022441864014, "rewards/distinct_2/std": 0.2516466975212097, "rewards/total_composite/mean": 0.19157472252845764, "rewards/total_composite/std": 0.22701068222522736, "reward": 0.19157472252845764, "reward_std": 0.22701066732406616, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13616812229156494, "sampling/sampling_logp_difference/max": 2.5768704414367676, "sampling/importance_sampling_ratio/min": 0.07601151615381241, "sampling/importance_sampling_ratio/mean": 1.007124900817871, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8027744293212891, "clip_ratio/low_mean": 0.06500709755346179, "clip_ratio/low_min": 0.06500709755346179, "clip_ratio/high_mean": 0.04464669618755579, "clip_ratio/high_max": 0.04464669618755579, "clip_ratio/region_mean": 0.10965379374101758, "reward_total_mean": 0.19157472252845764, "reward_meter_mean": 0.33594268560409546, "reward_meter_std": 0.2705962359905243, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7862205505371094, "reward_repeat_penalty_std": 0.2621435225009918, "reward_repeat_floor_mean": 0.9746034741401672, "reward_repeat_floor_std": 0.030592938885092735, "reward_near_duplicate_penalty_mean": 0.9286086559295654, "reward_near_duplicate_penalty_std": 0.05637591704726219, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8368022441864014, "reward_distinct_2_std": 0.2516466975212097, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.3208470940589905, "reward_total_composite_mean": 0.19157472252845764, "reward_total_composite_std": 0.22701068222522736} {"timestamp_utc": "2026-04-12T19:16:11Z", "mode": "train", "global_step": 888, "epoch": 0.04673438240092627, "loss": -0.0432, "grad_norm": 1.5164231061935425, "learning_rate": 7.312121212121212e-06, "num_tokens": 1582644.0, "completions/mean_length": 456.25, "completions/min_length": 66.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 66.0, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.6885676383972168, "rewards/meter/std": 0.4023575782775879, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.29124119877815247, "rewards/arabic_clean/mean": 0.125, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.08737237006425858, "rewards/lexical_plausibility/mean": 0.7418726682662964, "rewards/lexical_plausibility/std": 0.11394708603620529, "rewards/judge_quality/mean": 0.07500000298023224, "rewards/judge_quality/std": 0.11338933557271957, "rewards/repeat_penalty/mean": 0.8229809999465942, "rewards/repeat_penalty/std": 0.14408570528030396, "rewards/repeat_floor/mean": 0.9849258661270142, "rewards/repeat_floor/std": 0.012617240659892559, "rewards/near_duplicate_penalty/mean": 0.9663236737251282, "rewards/near_duplicate_penalty/std": 0.03803425282239914, "rewards/opening_diversity/mean": 0.8779761791229248, "rewards/opening_diversity/std": 0.14010241627693176, "rewards/distinct_2/mean": 0.9699857831001282, "rewards/distinct_2/std": 0.05932611972093582, "rewards/total_composite/mean": 0.0594598613679409, "rewards/total_composite/std": 0.10353420674800873, "reward": 0.0594598613679409, "reward_std": 0.10353420674800873, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16618087887763977, "sampling/sampling_logp_difference/max": 1.071451187133789, "sampling/importance_sampling_ratio/min": 0.3425111174583435, "sampling/importance_sampling_ratio/mean": 1.049685001373291, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.14603425562381744, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.011363636702299118, "clip_ratio/high_max": 0.011363636702299118, "clip_ratio/region_mean": 0.011363636702299118, "reward_total_mean": 0.0594598613679409, "reward_meter_mean": 0.6885676383972168, "reward_meter_std": 0.4023575782775879, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.29124119877815247, "reward_arabic_clean_mean": 0.125, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.08737237006425858, "reward_lexical_plausibility_mean": 0.7418726682662964, "reward_lexical_plausibility_std": 0.11394708603620529, "reward_repeat_penalty_mean": 0.8229809999465942, "reward_repeat_penalty_std": 0.14408570528030396, "reward_repeat_floor_mean": 0.9849258661270142, "reward_repeat_floor_std": 0.012617240659892559, "reward_near_duplicate_penalty_mean": 0.9663236737251282, "reward_near_duplicate_penalty_std": 0.03803425282239914, "reward_opening_diversity_mean": 0.8779761791229248, "reward_opening_diversity_std": 0.14010241627693176, "reward_distinct_2_mean": 0.9699857831001282, "reward_distinct_2_std": 0.05932611972093582, "reward_judge_quality_mean": 0.07500000298023224, "reward_judge_quality_std": 0.11338933557271957, "reward_total_composite_mean": 0.0594598613679409, "reward_total_composite_std": 0.10353420674800873} {"timestamp_utc": "2026-04-12T19:16:25Z", "mode": "train", "global_step": 889, "epoch": 0.04678701120993632, "loss": 0.0156, "grad_norm": 5.1369194984436035, "learning_rate": 7.30909090909091e-06, "num_tokens": 1585146.0, "completions/mean_length": 161.75, "completions/min_length": 97.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 111.71429443359375, "completions/min_terminated_length": 97.0, "completions/max_terminated_length": 146.0, "rewards/meter/mean": 0.520438551902771, "rewards/meter/std": 0.44028639793395996, "rewards/count_adherence/mean": 0.8035714626312256, "rewards/count_adherence/std": 0.10628911107778549, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9410713911056519, "rewards/count_floor/std": 0.03188672661781311, "rewards/lexical_plausibility/mean": 0.9573183059692383, "rewards/lexical_plausibility/std": 0.12072212249040604, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.22867102921009064, "rewards/repeat_penalty/std": 0.2610289752483368, "rewards/repeat_floor/mean": 0.8779460191726685, "rewards/repeat_floor/std": 0.06991404294967651, "rewards/near_duplicate_penalty/mean": 0.6592497825622559, "rewards/near_duplicate_penalty/std": 0.2152763456106186, "rewards/opening_diversity/mean": 0.807508111000061, "rewards/opening_diversity/std": 0.23668500781059265, "rewards/distinct_2/mean": 0.34008944034576416, "rewards/distinct_2/std": 0.3077734410762787, "rewards/total_composite/mean": 0.09737002849578857, "rewards/total_composite/std": 0.10020838677883148, "reward": 0.09737002849578857, "reward_std": 0.10020838677883148, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11012234538793564, "sampling/sampling_logp_difference/max": 2.440465211868286, "sampling/importance_sampling_ratio/min": 0.08712030947208405, "sampling/importance_sampling_ratio/mean": 0.99152010679245, "sampling/importance_sampling_ratio/max": 1.9557863473892212, "entropy": 0.6145061030983925, "clip_ratio/low_mean": 0.026263192296028137, "clip_ratio/low_min": 0.026263192296028137, "clip_ratio/high_mean": 0.07299808692187071, "clip_ratio/high_max": 0.07299808692187071, "clip_ratio/region_mean": 0.09926127921789885, "reward_total_mean": 0.09737002849578857, "reward_meter_mean": 0.520438551902771, "reward_meter_std": 0.44028639793395996, "reward_count_adherence_mean": 0.8035714626312256, "reward_count_adherence_std": 0.10628911107778549, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9410713911056519, "reward_count_floor_std": 0.03188672661781311, "reward_lexical_plausibility_mean": 0.9573183059692383, "reward_lexical_plausibility_std": 0.12072212249040604, "reward_repeat_penalty_mean": 0.22867102921009064, "reward_repeat_penalty_std": 0.2610289752483368, "reward_repeat_floor_mean": 0.8779460191726685, "reward_repeat_floor_std": 0.06991404294967651, "reward_near_duplicate_penalty_mean": 0.6592497825622559, "reward_near_duplicate_penalty_std": 0.2152763456106186, "reward_opening_diversity_mean": 0.807508111000061, "reward_opening_diversity_std": 0.23668500781059265, "reward_distinct_2_mean": 0.34008944034576416, "reward_distinct_2_std": 0.3077734410762787, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.09737002849578857, "reward_total_composite_std": 0.10020838677883148} {"timestamp_utc": "2026-04-12T19:16:39Z", "mode": "train", "global_step": 890, "epoch": 0.046839640018946374, "loss": -0.1014, "grad_norm": 1.881895661354065, "learning_rate": 7.306060606060607e-06, "num_tokens": 1586957.0, "completions/mean_length": 297.375, "completions/min_length": 78.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 82.75, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.6624069809913635, "rewards/meter/std": 0.40717947483062744, "rewards/count_adherence/mean": 0.7000000476837158, "rewards/count_adherence/std": 0.3023715913295746, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9099999666213989, "rewards/count_floor/std": 0.09071147441864014, "rewards/lexical_plausibility/mean": 0.8344358801841736, "rewards/lexical_plausibility/std": 0.18998073041439056, "rewards/judge_quality/mean": 0.18125000596046448, "rewards/judge_quality/std": 0.17512750625610352, "rewards/repeat_penalty/mean": 0.7679789066314697, "rewards/repeat_penalty/std": 0.284628689289093, "rewards/repeat_floor/mean": 0.9727243781089783, "rewards/repeat_floor/std": 0.03439345583319664, "rewards/near_duplicate_penalty/mean": 0.9201740026473999, "rewards/near_duplicate_penalty/std": 0.07724828273057938, "rewards/opening_diversity/mean": 0.871874988079071, "rewards/opening_diversity/std": 0.24474385380744934, "rewards/distinct_2/mean": 0.9153976440429688, "rewards/distinct_2/std": 0.1134895533323288, "rewards/total_composite/mean": 0.1020907312631607, "rewards/total_composite/std": 0.11728008091449738, "reward": 0.1020907312631607, "reward_std": 0.11728007346391678, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14078360795974731, "sampling/sampling_logp_difference/max": 1.666956901550293, "sampling/importance_sampling_ratio/min": 0.18882077932357788, "sampling/importance_sampling_ratio/mean": 1.0064233541488647, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5357254147529602, "clip_ratio/low_mean": 0.009615384973585606, "clip_ratio/low_min": 0.009615384973585606, "clip_ratio/high_mean": 0.05034242570400238, "clip_ratio/high_max": 0.05034242570400238, "clip_ratio/region_mean": 0.059957810677587986, "reward_total_mean": 0.1020907312631607, "reward_meter_mean": 0.6624069809913635, "reward_meter_std": 0.40717947483062744, "reward_count_adherence_mean": 0.7000000476837158, "reward_count_adherence_std": 0.3023715913295746, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9099999666213989, "reward_count_floor_std": 0.09071147441864014, "reward_lexical_plausibility_mean": 0.8344358801841736, "reward_lexical_plausibility_std": 0.18998073041439056, "reward_repeat_penalty_mean": 0.7679789066314697, "reward_repeat_penalty_std": 0.284628689289093, "reward_repeat_floor_mean": 0.9727243781089783, "reward_repeat_floor_std": 0.03439345583319664, "reward_near_duplicate_penalty_mean": 0.9201740026473999, "reward_near_duplicate_penalty_std": 0.07724828273057938, "reward_opening_diversity_mean": 0.871874988079071, "reward_opening_diversity_std": 0.24474385380744934, "reward_distinct_2_mean": 0.9153976440429688, "reward_distinct_2_std": 0.1134895533323288, "reward_judge_quality_mean": 0.18125000596046448, "reward_judge_quality_std": 0.17512750625610352, "reward_total_composite_mean": 0.1020907312631607, "reward_total_composite_std": 0.11728008091449738} {"timestamp_utc": "2026-04-12T19:16:53Z", "mode": "train", "global_step": 891, "epoch": 0.046892268827956426, "loss": -0.1214, "grad_norm": 4.463621616363525, "learning_rate": 7.303030303030304e-06, "num_tokens": 1588814.0, "completions/mean_length": 125.125, "completions/min_length": 59.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 69.85714721679688, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.8792005777359009, "rewards/meter/std": 0.1741088628768921, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9465920925140381, "rewards/lexical_plausibility/std": 0.13618627190589905, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.5569837093353271, "rewards/repeat_penalty/std": 0.3384759724140167, "rewards/repeat_floor/mean": 0.9390017986297607, "rewards/repeat_floor/std": 0.05249625816941261, "rewards/near_duplicate_penalty/mean": 0.8076207637786865, "rewards/near_duplicate_penalty/std": 0.14858025312423706, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.31160587072372437, "rewards/distinct_2/mean": 0.7887073755264282, "rewards/distinct_2/std": 0.18778012692928314, "rewards/total_composite/mean": 0.2400050163269043, "rewards/total_composite/std": 0.11523940414190292, "reward": 0.2400050163269043, "reward_std": 0.11523939669132233, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14740332961082458, "sampling/sampling_logp_difference/max": 2.7489712238311768, "sampling/importance_sampling_ratio/min": 0.0639936625957489, "sampling/importance_sampling_ratio/mean": 1.0004315376281738, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7213696390390396, "clip_ratio/low_mean": 0.02547417301684618, "clip_ratio/low_min": 0.02547417301684618, "clip_ratio/high_mean": 0.085636455565691, "clip_ratio/high_max": 0.085636455565691, "clip_ratio/region_mean": 0.11111062858253717, "reward_total_mean": 0.2400050163269043, "reward_meter_mean": 0.8792005777359009, "reward_meter_std": 0.1741088628768921, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9465920925140381, "reward_lexical_plausibility_std": 0.13618627190589905, "reward_repeat_penalty_mean": 0.5569837093353271, "reward_repeat_penalty_std": 0.3384759724140167, "reward_repeat_floor_mean": 0.9390017986297607, "reward_repeat_floor_std": 0.05249625816941261, "reward_near_duplicate_penalty_mean": 0.8076207637786865, "reward_near_duplicate_penalty_std": 0.14858025312423706, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.31160587072372437, "reward_distinct_2_mean": 0.7887073755264282, "reward_distinct_2_std": 0.18778012692928314, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.2400050163269043, "reward_total_composite_std": 0.11523940414190292} {"timestamp_utc": "2026-04-12T19:17:12Z", "mode": "train", "global_step": 892, "epoch": 0.04694489763696648, "loss": -0.0341, "grad_norm": 2.5688624382019043, "learning_rate": 7.3e-06, "num_tokens": 1590283.0, "completions/mean_length": 154.625, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 35.5, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.5335460901260376, "rewards/meter/std": 0.48206907510757446, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9092497229576111, "rewards/lexical_plausibility/std": 0.168043315410614, "rewards/judge_quality/mean": 0.4424999952316284, "rewards/judge_quality/std": 0.3340979516506195, "rewards/repeat_penalty/mean": 0.8412985801696777, "rewards/repeat_penalty/std": 0.18187516927719116, "rewards/repeat_floor/mean": 0.9852879047393799, "rewards/repeat_floor/std": 0.019465075805783272, "rewards/near_duplicate_penalty/mean": 0.97127366065979, "rewards/near_duplicate_penalty/std": 0.0466519370675087, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9469095468521118, "rewards/distinct_2/std": 0.09718659520149231, "rewards/total_composite/mean": 0.2621089816093445, "rewards/total_composite/std": 0.2744298279285431, "reward": 0.2621089816093445, "reward_std": 0.2744298279285431, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16270951926708221, "sampling/sampling_logp_difference/max": 1.796198844909668, "sampling/importance_sampling_ratio/min": 0.1659284085035324, "sampling/importance_sampling_ratio/mean": 1.0161446332931519, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8777428865432739, "clip_ratio/low_mean": 0.03945652116090059, "clip_ratio/low_min": 0.03945652116090059, "clip_ratio/high_mean": 0.08518800977617502, "clip_ratio/high_max": 0.08518800977617502, "clip_ratio/region_mean": 0.12464453093707561, "reward_total_mean": 0.2621089816093445, "reward_meter_mean": 0.5335460901260376, "reward_meter_std": 0.48206907510757446, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9092497229576111, "reward_lexical_plausibility_std": 0.168043315410614, "reward_repeat_penalty_mean": 0.8412985801696777, "reward_repeat_penalty_std": 0.18187516927719116, "reward_repeat_floor_mean": 0.9852879047393799, "reward_repeat_floor_std": 0.019465075805783272, "reward_near_duplicate_penalty_mean": 0.97127366065979, "reward_near_duplicate_penalty_std": 0.0466519370675087, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9469095468521118, "reward_distinct_2_std": 0.09718659520149231, "reward_judge_quality_mean": 0.4424999952316284, "reward_judge_quality_std": 0.3340979516506195, "reward_total_composite_mean": 0.2621089816093445, "reward_total_composite_std": 0.2744298279285431} {"timestamp_utc": "2026-04-12T19:17:21Z", "mode": "train", "global_step": 893, "epoch": 0.046997526445976524, "loss": -0.0423, "grad_norm": 16.598234176635742, "learning_rate": 7.296969696969698e-06, "num_tokens": 1591919.0, "completions/mean_length": 37.5, "completions/min_length": 29.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.5, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.8038854598999023, "rewards/meter/std": 0.3313772976398468, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24706491827964783, "rewards/repeat_penalty/mean": 0.6009575128555298, "rewards/repeat_penalty/std": 0.39226582646369934, "rewards/repeat_floor/mean": 0.9393091201782227, "rewards/repeat_floor/std": 0.07334894686937332, "rewards/near_duplicate_penalty/mean": 0.8244130611419678, "rewards/near_duplicate_penalty/std": 0.22831372916698456, "rewards/opening_diversity/mean": 0.768750011920929, "rewards/opening_diversity/std": 0.26415297389030457, "rewards/distinct_2/mean": 0.7724685668945312, "rewards/distinct_2/std": 0.2670818865299225, "rewards/total_composite/mean": 0.2674075961112976, "rewards/total_composite/std": 0.15334029495716095, "reward": 0.2674075961112976, "reward_std": 0.15334029495716095, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19589951634407043, "sampling/sampling_logp_difference/max": 2.0359065532684326, "sampling/importance_sampling_ratio/min": 0.13056208193302155, "sampling/importance_sampling_ratio/mean": 1.026831030845642, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1646473929286003, "clip_ratio/low_mean": 0.06571322120726109, "clip_ratio/low_min": 0.06571322120726109, "clip_ratio/high_mean": 0.08612309023737907, "clip_ratio/high_max": 0.08612309023737907, "clip_ratio/region_mean": 0.15183631144464016, "reward_total_mean": 0.2674075961112976, "reward_meter_mean": 0.8038854598999023, "reward_meter_std": 0.3313772976398468, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.6009575128555298, "reward_repeat_penalty_std": 0.39226582646369934, "reward_repeat_floor_mean": 0.9393091201782227, "reward_repeat_floor_std": 0.07334894686937332, "reward_near_duplicate_penalty_mean": 0.8244130611419678, "reward_near_duplicate_penalty_std": 0.22831372916698456, "reward_opening_diversity_mean": 0.768750011920929, "reward_opening_diversity_std": 0.26415297389030457, "reward_distinct_2_mean": 0.7724685668945312, "reward_distinct_2_std": 0.2670818865299225, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24706491827964783, "reward_total_composite_mean": 0.2674075961112976, "reward_total_composite_std": 0.15334029495716095} {"timestamp_utc": "2026-04-12T19:17:31Z", "mode": "train", "global_step": 894, "epoch": 0.04705015525498658, "loss": 0.1559, "grad_norm": 10.017705917358398, "learning_rate": 7.293939393939394e-06, "num_tokens": 1594311.0, "completions/mean_length": 97.0, "completions/min_length": 41.0, "completions/max_length": 152.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 97.0, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 152.0, "rewards/meter/mean": 0.7279128432273865, "rewards/meter/std": 0.3662586510181427, "rewards/count_adherence/mean": 0.7291666269302368, "rewards/count_adherence/std": 0.1767766773700714, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.918749988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.24379447102546692, "rewards/repeat_penalty/std": 0.23227240145206451, "rewards/repeat_floor/mean": 0.8775709867477417, "rewards/repeat_floor/std": 0.07003941386938095, "rewards/near_duplicate_penalty/mean": 0.6747478246688843, "rewards/near_duplicate_penalty/std": 0.20920851826667786, "rewards/opening_diversity/mean": 0.7244791984558105, "rewards/opening_diversity/std": 0.3409140706062317, "rewards/distinct_2/mean": 0.36544474959373474, "rewards/distinct_2/std": 0.2325313836336136, "rewards/total_composite/mean": 0.0848173201084137, "rewards/total_composite/std": 0.039417754858732224, "reward": 0.0848173201084137, "reward_std": 0.039417751133441925, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1081172302365303, "sampling/sampling_logp_difference/max": 4.45536994934082, "sampling/importance_sampling_ratio/min": 0.011616022326052189, "sampling/importance_sampling_ratio/mean": 1.0248385667800903, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7483176216483116, "clip_ratio/low_mean": 0.04287295136600733, "clip_ratio/low_min": 0.04287295136600733, "clip_ratio/high_mean": 0.07209587749093771, "clip_ratio/high_max": 0.07209587749093771, "clip_ratio/region_mean": 0.11496882885694504, "reward_total_mean": 0.0848173201084137, "reward_meter_mean": 0.7279128432273865, "reward_meter_std": 0.3662586510181427, "reward_count_adherence_mean": 0.7291666269302368, "reward_count_adherence_std": 0.1767766773700714, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.918749988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.24379447102546692, "reward_repeat_penalty_std": 0.23227240145206451, "reward_repeat_floor_mean": 0.8775709867477417, "reward_repeat_floor_std": 0.07003941386938095, "reward_near_duplicate_penalty_mean": 0.6747478246688843, "reward_near_duplicate_penalty_std": 0.20920851826667786, "reward_opening_diversity_mean": 0.7244791984558105, "reward_opening_diversity_std": 0.3409140706062317, "reward_distinct_2_mean": 0.36544474959373474, "reward_distinct_2_std": 0.2325313836336136, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.0848173201084137, "reward_total_composite_std": 0.039417754858732224} {"timestamp_utc": "2026-04-12T19:17:44Z", "mode": "train", "global_step": 895, "epoch": 0.04710278406399663, "loss": -0.0245, "grad_norm": 10.260034561157227, "learning_rate": 7.290909090909092e-06, "num_tokens": 1595761.0, "completions/mean_length": 91.25, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 31.142858505249023, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.7115216255187988, "rewards/meter/std": 0.3363083302974701, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9287829399108887, "rewards/lexical_plausibility/std": 0.20143233239650726, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.14880475401878357, "rewards/repeat_penalty/mean": 0.7423636317253113, "rewards/repeat_penalty/std": 0.28592798113822937, "rewards/repeat_floor/mean": 0.9711732864379883, "rewards/repeat_floor/std": 0.030263379216194153, "rewards/near_duplicate_penalty/mean": 0.9118344783782959, "rewards/near_duplicate_penalty/std": 0.07457102090120316, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8891459703445435, "rewards/distinct_2/std": 0.1339576095342636, "rewards/total_composite/mean": 0.21806921064853668, "rewards/total_composite/std": 0.1697385460138321, "reward": 0.21806921064853668, "reward_std": 0.1697385460138321, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14132149517536163, "sampling/sampling_logp_difference/max": 1.754323959350586, "sampling/importance_sampling_ratio/min": 0.17302417755126953, "sampling/importance_sampling_ratio/mean": 1.0358550548553467, "sampling/importance_sampling_ratio/max": 1.7814950942993164, "entropy": 0.8144881129264832, "clip_ratio/low_mean": 0.05141128972172737, "clip_ratio/low_min": 0.05141128972172737, "clip_ratio/high_mean": 0.06525601074099541, "clip_ratio/high_max": 0.06525601074099541, "clip_ratio/region_mean": 0.11666730046272278, "reward_total_mean": 0.21806921064853668, "reward_meter_mean": 0.7115216255187988, "reward_meter_std": 0.3363083302974701, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9287829399108887, "reward_lexical_plausibility_std": 0.20143233239650726, "reward_repeat_penalty_mean": 0.7423636317253113, "reward_repeat_penalty_std": 0.28592798113822937, "reward_repeat_floor_mean": 0.9711732864379883, "reward_repeat_floor_std": 0.030263379216194153, "reward_near_duplicate_penalty_mean": 0.9118344783782959, "reward_near_duplicate_penalty_std": 0.07457102090120316, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8891459703445435, "reward_distinct_2_std": 0.1339576095342636, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.14880475401878357, "reward_total_composite_mean": 0.21806921064853668, "reward_total_composite_std": 0.1697385460138321} {"timestamp_utc": "2026-04-12T19:17:58Z", "mode": "train", "global_step": 896, "epoch": 0.04715541287300668, "loss": -0.0778, "grad_norm": 1.8823866844177246, "learning_rate": 7.287878787878789e-06, "num_tokens": 1597392.0, "completions/mean_length": 164.875, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 49.16666793823242, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.9314152002334595, "rewards/meter/std": 0.15830190479755402, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9106531739234924, "rewards/lexical_plausibility/std": 0.16617372632026672, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.2314550131559372, "rewards/repeat_penalty/mean": 0.7977739572525024, "rewards/repeat_penalty/std": 0.25435206294059753, "rewards/repeat_floor/mean": 0.9763270020484924, "rewards/repeat_floor/std": 0.030593838542699814, "rewards/near_duplicate_penalty/mean": 0.9393112659454346, "rewards/near_duplicate_penalty/std": 0.0704958438873291, "rewards/opening_diversity/mean": 0.925000011920929, "rewards/opening_diversity/std": 0.11338934302330017, "rewards/distinct_2/mean": 0.888114333152771, "rewards/distinct_2/std": 0.15373705327510834, "rewards/total_composite/mean": 0.3430384397506714, "rewards/total_composite/std": 0.22983165085315704, "reward": 0.3430384397506714, "reward_std": 0.22983163595199585, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13058602809906006, "sampling/sampling_logp_difference/max": 1.4625039100646973, "sampling/importance_sampling_ratio/min": 0.2316555231809616, "sampling/importance_sampling_ratio/mean": 1.0431114435195923, "sampling/importance_sampling_ratio/max": 1.8963088989257812, "entropy": 0.8591323718428612, "clip_ratio/low_mean": 0.018145160749554634, "clip_ratio/low_min": 0.018145160749554634, "clip_ratio/high_mean": 0.07727300748229027, "clip_ratio/high_max": 0.07727300748229027, "clip_ratio/region_mean": 0.0954181682318449, "reward_total_mean": 0.3430384397506714, "reward_meter_mean": 0.9314152002334595, "reward_meter_std": 0.15830190479755402, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9106531739234924, "reward_lexical_plausibility_std": 0.16617372632026672, "reward_repeat_penalty_mean": 0.7977739572525024, "reward_repeat_penalty_std": 0.25435206294059753, "reward_repeat_floor_mean": 0.9763270020484924, "reward_repeat_floor_std": 0.030593838542699814, "reward_near_duplicate_penalty_mean": 0.9393112659454346, "reward_near_duplicate_penalty_std": 0.0704958438873291, "reward_opening_diversity_mean": 0.925000011920929, "reward_opening_diversity_std": 0.11338934302330017, "reward_distinct_2_mean": 0.888114333152771, "reward_distinct_2_std": 0.15373705327510834, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.2314550131559372, "reward_total_composite_mean": 0.3430384397506714, "reward_total_composite_std": 0.22983165085315704} {"timestamp_utc": "2026-04-12T19:18:07Z", "mode": "train", "global_step": 897, "epoch": 0.047208041682016734, "loss": 0.041, "grad_norm": 16.027273178100586, "learning_rate": 7.284848484848486e-06, "num_tokens": 1598876.0, "completions/mean_length": 40.5, "completions/min_length": 31.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.9046456813812256, "rewards/meter/std": 0.13706478476524353, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.29999998211860657, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.7206360697746277, "rewards/repeat_penalty/std": 0.28052711486816406, "rewards/repeat_floor/mean": 0.9680224657058716, "rewards/repeat_floor/std": 0.03394155576825142, "rewards/near_duplicate_penalty/mean": 0.8939769268035889, "rewards/near_duplicate_penalty/std": 0.10728864371776581, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8630656003952026, "rewards/distinct_2/std": 0.15047280490398407, "rewards/total_composite/mean": 0.25389695167541504, "rewards/total_composite/std": 0.11473076045513153, "reward": 0.25389695167541504, "reward_std": 0.11473074555397034, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15610337257385254, "sampling/sampling_logp_difference/max": 1.4549541473388672, "sampling/importance_sampling_ratio/min": 0.2334110587835312, "sampling/importance_sampling_ratio/mean": 1.0133109092712402, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.24332857131958, "clip_ratio/low_mean": 0.06171528622508049, "clip_ratio/low_min": 0.06171528622508049, "clip_ratio/high_mean": 0.09191965963691473, "clip_ratio/high_max": 0.09191965963691473, "clip_ratio/region_mean": 0.15363494586199522, "reward_total_mean": 0.25389695167541504, "reward_meter_mean": 0.9046456813812256, "reward_meter_std": 0.13706478476524353, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7206360697746277, "reward_repeat_penalty_std": 0.28052711486816406, "reward_repeat_floor_mean": 0.9680224657058716, "reward_repeat_floor_std": 0.03394155576825142, "reward_near_duplicate_penalty_mean": 0.8939769268035889, "reward_near_duplicate_penalty_std": 0.10728864371776581, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8630656003952026, "reward_distinct_2_std": 0.15047280490398407, "reward_judge_quality_mean": 0.29999998211860657, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.25389695167541504, "reward_total_composite_std": 0.11473076045513153} {"timestamp_utc": "2026-04-12T19:18:16Z", "mode": "train", "global_step": 898, "epoch": 0.047260670491026786, "loss": -0.0027, "grad_norm": 14.411706924438477, "learning_rate": 7.281818181818182e-06, "num_tokens": 1600376.0, "completions/mean_length": 41.5, "completions/min_length": 38.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.5, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.7468670010566711, "rewards/meter/std": 0.3747076392173767, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.2522329092025757, "rewards/repeat_penalty/mean": 0.542788028717041, "rewards/repeat_penalty/std": 0.2442883551120758, "rewards/repeat_floor/mean": 0.9461007118225098, "rewards/repeat_floor/std": 0.029961973428726196, "rewards/near_duplicate_penalty/mean": 0.8603014945983887, "rewards/near_duplicate_penalty/std": 0.0887211263179779, "rewards/opening_diversity/mean": 0.765625, "rewards/opening_diversity/std": 0.19408094882965088, "rewards/distinct_2/mean": 0.7902001738548279, "rewards/distinct_2/std": 0.10351910442113876, "rewards/total_composite/mean": 0.39872249960899353, "rewards/total_composite/std": 0.3332768380641937, "reward": 0.39872249960899353, "reward_std": 0.3332768380641937, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11950510740280151, "sampling/sampling_logp_difference/max": 1.0952110290527344, "sampling/importance_sampling_ratio/min": 0.3344690203666687, "sampling/importance_sampling_ratio/mean": 0.9956321716308594, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7607012093067169, "clip_ratio/low_mean": 0.07318657310679555, "clip_ratio/low_min": 0.07318657310679555, "clip_ratio/high_mean": 0.050496033392846584, "clip_ratio/high_max": 0.050496033392846584, "clip_ratio/region_mean": 0.12368260649964213, "reward_total_mean": 0.39872249960899353, "reward_meter_mean": 0.7468670010566711, "reward_meter_std": 0.3747076392173767, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.542788028717041, "reward_repeat_penalty_std": 0.2442883551120758, "reward_repeat_floor_mean": 0.9461007118225098, "reward_repeat_floor_std": 0.029961973428726196, "reward_near_duplicate_penalty_mean": 0.8603014945983887, "reward_near_duplicate_penalty_std": 0.0887211263179779, "reward_opening_diversity_mean": 0.765625, "reward_opening_diversity_std": 0.19408094882965088, "reward_distinct_2_mean": 0.7902001738548279, "reward_distinct_2_std": 0.10351910442113876, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.2522329092025757, "reward_total_composite_mean": 0.39872249960899353, "reward_total_composite_std": 0.3332768380641937} {"timestamp_utc": "2026-04-12T19:18:29Z", "mode": "train", "global_step": 899, "epoch": 0.04731329930003684, "loss": -0.0262, "grad_norm": 4.141161918640137, "learning_rate": 7.2787878787878795e-06, "num_tokens": 1601723.0, "completions/mean_length": 81.375, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 19.85714340209961, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.6805827617645264, "rewards/meter/std": 0.42947661876678467, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9612054824829102, "rewards/lexical_plausibility/std": 0.10972744971513748, "rewards/judge_quality/mean": 0.6100000143051147, "rewards/judge_quality/std": 0.3543202877044678, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4398835599422455, "rewards/total_composite/std": 0.37205806374549866, "reward": 0.4398835599422455, "reward_std": 0.37205806374549866, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19168579578399658, "sampling/sampling_logp_difference/max": 1.7755107879638672, "sampling/importance_sampling_ratio/min": 0.16939689218997955, "sampling/importance_sampling_ratio/mean": 1.0172382593154907, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3149924129247665, "clip_ratio/low_mean": 0.10765664838254452, "clip_ratio/low_min": 0.10765664838254452, "clip_ratio/high_mean": 0.03098370973020792, "clip_ratio/high_max": 0.03098370973020792, "clip_ratio/region_mean": 0.13864035811275244, "reward_total_mean": 0.4398835599422455, "reward_meter_mean": 0.6805827617645264, "reward_meter_std": 0.42947661876678467, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9612054824829102, "reward_lexical_plausibility_std": 0.10972744971513748, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6100000143051147, "reward_judge_quality_std": 0.3543202877044678, "reward_total_composite_mean": 0.4398835599422455, "reward_total_composite_std": 0.37205806374549866} {"timestamp_utc": "2026-04-12T19:18:38Z", "mode": "train", "global_step": 900, "epoch": 0.04736592810904689, "loss": 0.1995, "grad_norm": 14.915257453918457, "learning_rate": 7.275757575757576e-06, "num_tokens": 1603219.0, "completions/mean_length": 36.0, "completions/min_length": 20.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.0, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.40367305278778076, "rewards/meter/std": 0.37825754284858704, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.909568727016449, "rewards/repeat_penalty/std": 0.1032397598028183, "rewards/repeat_floor/mean": 0.9930744171142578, "rewards/repeat_floor/std": 0.005789777263998985, "rewards/near_duplicate_penalty/mean": 0.9893404245376587, "rewards/near_duplicate_penalty/std": 0.009705417789518833, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9824812412261963, "rewards/distinct_2/std": 0.03248300403356552, "rewards/total_composite/mean": 0.1482512354850769, "rewards/total_composite/std": 0.11045444011688232, "reward": 0.1482512354850769, "reward_std": 0.11045444011688232, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16865186393260956, "sampling/sampling_logp_difference/max": 1.6643738746643066, "sampling/importance_sampling_ratio/min": 0.18930914998054504, "sampling/importance_sampling_ratio/mean": 1.0059375762939453, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1139141097664833, "clip_ratio/low_mean": 0.07056170515716076, "clip_ratio/low_min": 0.07056170515716076, "clip_ratio/high_mean": 0.05067640822380781, "clip_ratio/high_max": 0.05067640822380781, "clip_ratio/region_mean": 0.12123811338096857, "reward_total_mean": 0.1482512354850769, "reward_meter_mean": 0.40367305278778076, "reward_meter_std": 0.37825754284858704, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.909568727016449, "reward_repeat_penalty_std": 0.1032397598028183, "reward_repeat_floor_mean": 0.9930744171142578, "reward_repeat_floor_std": 0.005789777263998985, "reward_near_duplicate_penalty_mean": 0.9893404245376587, "reward_near_duplicate_penalty_std": 0.009705417789518833, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9824812412261963, "reward_distinct_2_std": 0.03248300403356552, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.1482512354850769, "reward_total_composite_std": 0.11045444011688232} {"timestamp_utc": "2026-04-12T19:21:15Z", "mode": "eval", "global_step": 900, "epoch": 0.04736592810904689, "eval_loss": NaN, "eval_runtime": 156.8828, "eval_samples_per_second": 0.663, "eval_steps_per_second": 0.083, "eval_num_tokens": 1603219.0, "eval_completions/mean_length": 163.98076923076923, "eval_completions/min_length": 31.23076923076923, "eval_completions/max_length": 471.3076923076923, "eval_completions/clipped_ratio": 0.14423076923076922, "eval_completions/mean_terminated_length": 104.68800706129808, "eval_completions/min_terminated_length": 31.23076923076923, "eval_completions/max_terminated_length": 216.84615384615384, "eval_rewards/meter/mean": 0.42765475465701175, "eval_rewards/meter/std": 0.37613093852996826, "eval_rewards/count_adherence/mean": 0.8173322219115037, "eval_rewards/count_adherence/std": 0.19084912767777076, "eval_rewards/arabic_clean/mean": 0.8269230769230769, "eval_rewards/arabic_clean/std": 0.35383587846389186, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9971153827813956, "eval_rewards/arabic_floor/std": 0.008158923341677738, "eval_rewards/count_floor/mean": 0.9451996729924128, "eval_rewards/count_floor/std": 0.05725473781617788, "eval_rewards/lexical_plausibility/mean": 0.9505092685039227, "eval_rewards/lexical_plausibility/std": 0.10913157921570998, "eval_rewards/judge_quality/mean": 0.2812500022924863, "eval_rewards/judge_quality/std": 0.21458769618318632, "eval_rewards/repeat_penalty/mean": 0.4704929475600903, "eval_rewards/repeat_penalty/std": 0.35082630125375897, "eval_rewards/repeat_floor/mean": 0.9265837761072012, "eval_rewards/repeat_floor/std": 0.06258979840920521, "eval_rewards/near_duplicate_penalty/mean": 0.8103658235990084, "eval_rewards/near_duplicate_penalty/std": 0.18106824732743776, "eval_rewards/opening_diversity/mean": 0.8588235561664288, "eval_rewards/opening_diversity/std": 0.20346174732996866, "eval_rewards/distinct_2/mean": 0.5944387568877294, "eval_rewards/distinct_2/std": 0.3562886818097188, "eval_rewards/total_composite/mean": 0.1092161713884427, "eval_rewards/total_composite/std": 0.13914034028465933, "eval_reward": 0.1092161713884427, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.059689754190353245, "eval_sampling/sampling_logp_difference/max": 1.034017196068397, "eval_sampling/importance_sampling_ratio/min": 0.3621820853306697, "eval_sampling/importance_sampling_ratio/mean": 1.0169028410544763, "eval_sampling/importance_sampling_ratio/max": 1.5208639731773963, "eval_entropy": 0.6558135564510639, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.1092161713884427, "eval_reward_meter_mean": 0.42765475465701175, "eval_reward_meter_std": 0.37613093852996826, "eval_reward_count_adherence_mean": 0.8173322219115037, "eval_reward_count_adherence_std": 0.19084912767777076, "eval_reward_arabic_clean_mean": 0.8269230769230769, "eval_reward_arabic_clean_std": 0.35383587846389186, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9971153827813956, "eval_reward_arabic_floor_std": 0.008158923341677738, "eval_reward_count_floor_mean": 0.9451996729924128, "eval_reward_count_floor_std": 0.05725473781617788, "eval_reward_lexical_plausibility_mean": 0.9505092685039227, "eval_reward_lexical_plausibility_std": 0.10913157921570998, "eval_reward_repeat_penalty_mean": 0.4704929475600903, "eval_reward_repeat_penalty_std": 0.35082630125375897, "eval_reward_repeat_floor_mean": 0.9265837761072012, "eval_reward_repeat_floor_std": 0.06258979840920521, "eval_reward_near_duplicate_penalty_mean": 0.8103658235990084, "eval_reward_near_duplicate_penalty_std": 0.18106824732743776, "eval_reward_opening_diversity_mean": 0.8588235561664288, "eval_reward_opening_diversity_std": 0.20346174732996866, "eval_reward_distinct_2_mean": 0.5944387568877294, "eval_reward_distinct_2_std": 0.3562886818097188, "eval_reward_judge_quality_mean": 0.2812500022924863, "eval_reward_judge_quality_std": 0.21458769618318632, "eval_reward_total_composite_mean": 0.1092161713884427, "eval_reward_total_composite_std": 0.13914034028465933} {"timestamp_utc": "2026-04-12T19:21:28Z", "mode": "train", "global_step": 901, "epoch": 0.047418556918056944, "loss": 0.0128, "grad_norm": 14.927328109741211, "learning_rate": 7.272727272727273e-06, "num_tokens": 1604996.0, "completions/mean_length": 46.125, "completions/min_length": 33.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.125, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.6611801981925964, "rewards/meter/std": 0.3047296702861786, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3837500214576721, "rewards/judge_quality/std": 0.2285943329334259, "rewards/repeat_penalty/mean": 0.6565814018249512, "rewards/repeat_penalty/std": 0.2637769281864166, "rewards/repeat_floor/mean": 0.9578031301498413, "rewards/repeat_floor/std": 0.034190621227025986, "rewards/near_duplicate_penalty/mean": 0.883475661277771, "rewards/near_duplicate_penalty/std": 0.09240245819091797, "rewards/opening_diversity/mean": 0.8984375, "rewards/opening_diversity/std": 0.12472067028284073, "rewards/distinct_2/mean": 0.7930607795715332, "rewards/distinct_2/std": 0.17247456312179565, "rewards/total_composite/mean": 0.24497410655021667, "rewards/total_composite/std": 0.22584471106529236, "reward": 0.24497410655021667, "reward_std": 0.22584472596645355, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13213300704956055, "sampling/sampling_logp_difference/max": 2.4206185340881348, "sampling/importance_sampling_ratio/min": 0.08886662870645523, "sampling/importance_sampling_ratio/mean": 1.0153093338012695, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9030940532684326, "clip_ratio/low_mean": 0.04073049547150731, "clip_ratio/low_min": 0.04073049547150731, "clip_ratio/high_mean": 0.06071013957262039, "clip_ratio/high_max": 0.06071013957262039, "clip_ratio/region_mean": 0.1014406350441277, "reward_total_mean": 0.24497410655021667, "reward_meter_mean": 0.6611801981925964, "reward_meter_std": 0.3047296702861786, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6565814018249512, "reward_repeat_penalty_std": 0.2637769281864166, "reward_repeat_floor_mean": 0.9578031301498413, "reward_repeat_floor_std": 0.034190621227025986, "reward_near_duplicate_penalty_mean": 0.883475661277771, "reward_near_duplicate_penalty_std": 0.09240245819091797, "reward_opening_diversity_mean": 0.8984375, "reward_opening_diversity_std": 0.12472067028284073, "reward_distinct_2_mean": 0.7930607795715332, "reward_distinct_2_std": 0.17247456312179565, "reward_judge_quality_mean": 0.3837500214576721, "reward_judge_quality_std": 0.2285943329334259, "reward_total_composite_mean": 0.24497410655021667, "reward_total_composite_std": 0.22584471106529236} {"timestamp_utc": "2026-04-12T19:21:40Z", "mode": "train", "global_step": 902, "epoch": 0.047471185727066996, "loss": -0.0042, "grad_norm": 10.568100929260254, "learning_rate": 7.26969696969697e-06, "num_tokens": 1606848.0, "completions/mean_length": 62.5, "completions/min_length": 45.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 62.5, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.8505071997642517, "rewards/meter/std": 0.28576141595840454, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.6060097813606262, "rewards/repeat_penalty/std": 0.2631150186061859, "rewards/repeat_floor/mean": 0.9498291015625, "rewards/repeat_floor/std": 0.043091047555208206, "rewards/near_duplicate_penalty/mean": 0.850010871887207, "rewards/near_duplicate_penalty/std": 0.13662436604499817, "rewards/opening_diversity/mean": 0.9196428656578064, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.7460992336273193, "rewards/distinct_2/std": 0.20074522495269775, "rewards/total_composite/mean": 0.25891658663749695, "rewards/total_composite/std": 0.11678348481655121, "reward": 0.25891658663749695, "reward_std": 0.1167834922671318, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.134932741522789, "sampling/sampling_logp_difference/max": 1.8648953437805176, "sampling/importance_sampling_ratio/min": 0.15491242706775665, "sampling/importance_sampling_ratio/mean": 1.0250189304351807, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9565348699688911, "clip_ratio/low_mean": 0.03921568766236305, "clip_ratio/low_min": 0.03921568766236305, "clip_ratio/high_mean": 0.09171149600297213, "clip_ratio/high_max": 0.09171149600297213, "clip_ratio/region_mean": 0.13092718366533518, "reward_total_mean": 0.25891658663749695, "reward_meter_mean": 0.8505071997642517, "reward_meter_std": 0.28576141595840454, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6060097813606262, "reward_repeat_penalty_std": 0.2631150186061859, "reward_repeat_floor_mean": 0.9498291015625, "reward_repeat_floor_std": 0.043091047555208206, "reward_near_duplicate_penalty_mean": 0.850010871887207, "reward_near_duplicate_penalty_std": 0.13662436604499817, "reward_opening_diversity_mean": 0.9196428656578064, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.7460992336273193, "reward_distinct_2_std": 0.20074522495269775, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.25891658663749695, "reward_total_composite_std": 0.11678348481655121} {"timestamp_utc": "2026-04-12T19:21:58Z", "mode": "train", "global_step": 903, "epoch": 0.04752381453607705, "loss": -0.0929, "grad_norm": 2.662440776824951, "learning_rate": 7.266666666666668e-06, "num_tokens": 1608512.0, "completions/mean_length": 230.0, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 60.79999923706055, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.7251635789871216, "rewards/meter/std": 0.3493713140487671, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.1602174937725067, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.934374988079071, "rewards/count_floor/std": 0.04806524142622948, "rewards/lexical_plausibility/mean": 0.8431609869003296, "rewards/lexical_plausibility/std": 0.22001656889915466, "rewards/judge_quality/mean": 0.16250000894069672, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.884110152721405, "rewards/repeat_penalty/std": 0.0890854001045227, "rewards/repeat_floor/mean": 0.9862861633300781, "rewards/repeat_floor/std": 0.01029918435961008, "rewards/near_duplicate_penalty/mean": 0.9471815824508667, "rewards/near_duplicate_penalty/std": 0.037550702691078186, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.9439880847930908, "rewards/distinct_2/std": 0.06266674399375916, "rewards/total_composite/mean": 0.10940331220626831, "rewards/total_composite/std": 0.09299742430448532, "reward": 0.10940331220626831, "reward_std": 0.09299741685390472, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19197878241539001, "sampling/sampling_logp_difference/max": 1.816019058227539, "sampling/importance_sampling_ratio/min": 0.1626720428466797, "sampling/importance_sampling_ratio/mean": 1.0411927700042725, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.026407465338707, "clip_ratio/low_mean": 0.02358490601181984, "clip_ratio/low_min": 0.02358490601181984, "clip_ratio/high_mean": 0.09216949716210365, "clip_ratio/high_max": 0.09216949716210365, "clip_ratio/region_mean": 0.11575440317392349, "reward_total_mean": 0.10940331220626831, "reward_meter_mean": 0.7251635789871216, "reward_meter_std": 0.3493713140487671, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.1602174937725067, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.934374988079071, "reward_count_floor_std": 0.04806524142622948, "reward_lexical_plausibility_mean": 0.8431609869003296, "reward_lexical_plausibility_std": 0.22001656889915466, "reward_repeat_penalty_mean": 0.884110152721405, "reward_repeat_penalty_std": 0.0890854001045227, "reward_repeat_floor_mean": 0.9862861633300781, "reward_repeat_floor_std": 0.01029918435961008, "reward_near_duplicate_penalty_mean": 0.9471815824508667, "reward_near_duplicate_penalty_std": 0.037550702691078186, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.9439880847930908, "reward_distinct_2_std": 0.06266674399375916, "reward_judge_quality_mean": 0.16250000894069672, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.10940331220626831, "reward_total_composite_std": 0.09299742430448532} {"timestamp_utc": "2026-04-12T19:22:11Z", "mode": "train", "global_step": 904, "epoch": 0.0475764433450871, "loss": -0.0469, "grad_norm": 5.912710189819336, "learning_rate": 7.263636363636364e-06, "num_tokens": 1609908.0, "completions/mean_length": 93.5, "completions/min_length": 30.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 33.71428680419922, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.5049070119857788, "rewards/meter/std": 0.4599471390247345, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.957805871963501, "rewards/lexical_plausibility/std": 0.11934302002191544, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.30514341592788696, "rewards/repeat_penalty/mean": 0.9901989698410034, "rewards/repeat_penalty/std": 0.015121985226869583, "rewards/repeat_floor/mean": 0.998529851436615, "rewards/repeat_floor/std": 0.0022683022543787956, "rewards/near_duplicate_penalty/mean": 0.9901989698410034, "rewards/near_duplicate_penalty/std": 0.015121985226869583, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.253612756729126, "rewards/total_composite/std": 0.25815820693969727, "reward": 0.253612756729126, "reward_std": 0.25815820693969727, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14818434417247772, "sampling/sampling_logp_difference/max": 1.5815479755401611, "sampling/importance_sampling_ratio/min": 0.21555957198143005, "sampling/importance_sampling_ratio/mean": 1.011784315109253, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7499367445707321, "clip_ratio/low_mean": 0.016145833767950535, "clip_ratio/low_min": 0.016145833767950535, "clip_ratio/high_mean": 0.05803346075117588, "clip_ratio/high_max": 0.05803346075117588, "clip_ratio/region_mean": 0.07417929451912642, "reward_total_mean": 0.253612756729126, "reward_meter_mean": 0.5049070119857788, "reward_meter_std": 0.4599471390247345, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.957805871963501, "reward_lexical_plausibility_std": 0.11934302002191544, "reward_repeat_penalty_mean": 0.9901989698410034, "reward_repeat_penalty_std": 0.015121985226869583, "reward_repeat_floor_mean": 0.998529851436615, "reward_repeat_floor_std": 0.0022683022543787956, "reward_near_duplicate_penalty_mean": 0.9901989698410034, "reward_near_duplicate_penalty_std": 0.015121985226869583, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.30514341592788696, "reward_total_composite_mean": 0.253612756729126, "reward_total_composite_std": 0.25815820693969727} {"timestamp_utc": "2026-04-12T19:22:20Z", "mode": "train", "global_step": 905, "epoch": 0.04762907215409715, "loss": 0.0399, "grad_norm": 13.982442855834961, "learning_rate": 7.260606060606061e-06, "num_tokens": 1611771.0, "completions/mean_length": 40.875, "completions/min_length": 30.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.875, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.1939105987548828, "rewards/meter/std": 0.31769174337387085, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.05175493285059929, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.5864450335502625, "rewards/repeat_penalty/std": 0.19441701471805573, "rewards/repeat_floor/mean": 0.9565856456756592, "rewards/repeat_floor/std": 0.02301929146051407, "rewards/near_duplicate_penalty/mean": 0.8873894810676575, "rewards/near_duplicate_penalty/std": 0.06870521605014801, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8094695210456848, "rewards/distinct_2/std": 0.1260429471731186, "rewards/total_composite/mean": 0.06114654242992401, "rewards/total_composite/std": 0.09451024234294891, "reward": 0.06114654242992401, "reward_std": 0.09451024234294891, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1358642429113388, "sampling/sampling_logp_difference/max": 1.6681842803955078, "sampling/importance_sampling_ratio/min": 0.1885891705751419, "sampling/importance_sampling_ratio/mean": 1.0365381240844727, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7639429569244385, "clip_ratio/low_mean": 0.07807393930852413, "clip_ratio/low_min": 0.07807393930852413, "clip_ratio/high_mean": 0.030741626396775246, "clip_ratio/high_max": 0.030741626396775246, "clip_ratio/region_mean": 0.10881556570529938, "reward_total_mean": 0.06114654242992401, "reward_meter_mean": 0.1939105987548828, "reward_meter_std": 0.31769174337387085, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.05175493285059929, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.5864450335502625, "reward_repeat_penalty_std": 0.19441701471805573, "reward_repeat_floor_mean": 0.9565856456756592, "reward_repeat_floor_std": 0.02301929146051407, "reward_near_duplicate_penalty_mean": 0.8873894810676575, "reward_near_duplicate_penalty_std": 0.06870521605014801, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8094695210456848, "reward_distinct_2_std": 0.1260429471731186, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.06114654242992401, "reward_total_composite_std": 0.09451024234294891} {"timestamp_utc": "2026-04-12T19:22:34Z", "mode": "train", "global_step": 906, "epoch": 0.047681700963107206, "loss": -0.1174, "grad_norm": 3.9887447357177734, "learning_rate": 7.257575757575758e-06, "num_tokens": 1613798.0, "completions/mean_length": 139.375, "completions/min_length": 56.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 86.14286041259766, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 97.0, "rewards/meter/mean": 0.6583786606788635, "rewards/meter/std": 0.35448578000068665, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 0.9676902294158936, "rewards/lexical_plausibility/std": 0.09138572961091995, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.7100282907485962, "rewards/repeat_penalty/std": 0.27022063732147217, "rewards/repeat_floor/mean": 0.9633342027664185, "rewards/repeat_floor/std": 0.042829982936382294, "rewards/near_duplicate_penalty/mean": 0.9010794162750244, "rewards/near_duplicate_penalty/std": 0.13472360372543335, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.7783033847808838, "rewards/distinct_2/std": 0.20225897431373596, "rewards/total_composite/mean": 0.1825007200241089, "rewards/total_composite/std": 0.11758004128932953, "reward": 0.1825007200241089, "reward_std": 0.11758004128932953, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13918501138687134, "sampling/sampling_logp_difference/max": 2.9872148036956787, "sampling/importance_sampling_ratio/min": 0.05042769014835358, "sampling/importance_sampling_ratio/mean": 1.006597638130188, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8042197227478027, "clip_ratio/low_mean": 0.07502768700942397, "clip_ratio/low_min": 0.07502768700942397, "clip_ratio/high_mean": 0.05760060250759125, "clip_ratio/high_max": 0.05760060250759125, "clip_ratio/region_mean": 0.13262828951701522, "reward_total_mean": 0.1825007200241089, "reward_meter_mean": 0.6583786606788635, "reward_meter_std": 0.35448578000068665, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 0.9676902294158936, "reward_lexical_plausibility_std": 0.09138572961091995, "reward_repeat_penalty_mean": 0.7100282907485962, "reward_repeat_penalty_std": 0.27022063732147217, "reward_repeat_floor_mean": 0.9633342027664185, "reward_repeat_floor_std": 0.042829982936382294, "reward_near_duplicate_penalty_mean": 0.9010794162750244, "reward_near_duplicate_penalty_std": 0.13472360372543335, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.7783033847808838, "reward_distinct_2_std": 0.20225897431373596, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.1825007200241089, "reward_total_composite_std": 0.11758004128932953} {"timestamp_utc": "2026-04-12T19:22:43Z", "mode": "train", "global_step": 907, "epoch": 0.04773432977211726, "loss": 0.2505, "grad_norm": 19.770160675048828, "learning_rate": 7.254545454545455e-06, "num_tokens": 1615236.0, "completions/mean_length": 25.75, "completions/min_length": 16.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.75, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.06526508927345276, "rewards/meter/std": 0.04139859601855278, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.5175492167472839, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.15526476502418518, "rewards/lexical_plausibility/mean": 0.9713541269302368, "rewards/lexical_plausibility/std": 0.05990393087267876, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.6929816007614136, "rewards/repeat_penalty/std": 0.21932563185691833, "rewards/repeat_floor/mean": 0.9714167714118958, "rewards/repeat_floor/std": 0.025788577273488045, "rewards/near_duplicate_penalty/mean": 0.9219865798950195, "rewards/near_duplicate_penalty/std": 0.10779546201229095, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9374309778213501, "rewards/distinct_2/std": 0.14701072871685028, "rewards/total_composite/mean": 0.017753588035702705, "rewards/total_composite/std": 0.016435202211141586, "reward": 0.017753588035702705, "reward_std": 0.016435202211141586, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16366185247898102, "sampling/sampling_logp_difference/max": 1.3756822347640991, "sampling/importance_sampling_ratio/min": 0.2526671588420868, "sampling/importance_sampling_ratio/mean": 1.012420654296875, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.24896989017725, "clip_ratio/low_mean": 0.0977272754535079, "clip_ratio/low_min": 0.0977272754535079, "clip_ratio/high_mean": 0.03125, "clip_ratio/high_max": 0.03125, "clip_ratio/region_mean": 0.1289772754535079, "reward_total_mean": 0.017753588035702705, "reward_meter_mean": 0.06526508927345276, "reward_meter_std": 0.04139859601855278, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.5175492167472839, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.15526476502418518, "reward_lexical_plausibility_mean": 0.9713541269302368, "reward_lexical_plausibility_std": 0.05990393087267876, "reward_repeat_penalty_mean": 0.6929816007614136, "reward_repeat_penalty_std": 0.21932563185691833, "reward_repeat_floor_mean": 0.9714167714118958, "reward_repeat_floor_std": 0.025788577273488045, "reward_near_duplicate_penalty_mean": 0.9219865798950195, "reward_near_duplicate_penalty_std": 0.10779546201229095, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9374309778213501, "reward_distinct_2_std": 0.14701072871685028, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.017753588035702705, "reward_total_composite_std": 0.016435202211141586} {"timestamp_utc": "2026-04-12T19:22:57Z", "mode": "train", "global_step": 908, "epoch": 0.04778695858112731, "loss": -0.0337, "grad_norm": 15.10283374786377, "learning_rate": 7.251515151515151e-06, "num_tokens": 1616807.0, "completions/mean_length": 98.375, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 39.28571701049805, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.6321123838424683, "rewards/meter/std": 0.2811214029788971, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9574733972549438, "rewards/lexical_plausibility/std": 0.1202833354473114, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.16690458357334137, "rewards/repeat_penalty/mean": 0.8837242722511292, "rewards/repeat_penalty/std": 0.24979446828365326, "rewards/repeat_floor/mean": 0.9870565533638, "rewards/repeat_floor/std": 0.024856988340616226, "rewards/near_duplicate_penalty/mean": 0.9571062326431274, "rewards/near_duplicate_penalty/std": 0.04875440523028374, "rewards/opening_diversity/mean": 0.921875, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.9797570705413818, "rewards/distinct_2/std": 0.05725561082363129, "rewards/total_composite/mean": 0.1716843545436859, "rewards/total_composite/std": 0.11949339509010315, "reward": 0.1716843545436859, "reward_std": 0.11949339509010315, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18133169412612915, "sampling/sampling_logp_difference/max": 2.038975715637207, "sampling/importance_sampling_ratio/min": 0.13016197085380554, "sampling/importance_sampling_ratio/mean": 1.0067718029022217, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9734255075454712, "clip_ratio/low_mean": 0.06737266108393669, "clip_ratio/low_min": 0.06737266108393669, "clip_ratio/high_mean": 0.10661562532186508, "clip_ratio/high_max": 0.10661562532186508, "clip_ratio/region_mean": 0.17398828640580177, "reward_total_mean": 0.1716843545436859, "reward_meter_mean": 0.6321123838424683, "reward_meter_std": 0.2811214029788971, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9574733972549438, "reward_lexical_plausibility_std": 0.1202833354473114, "reward_repeat_penalty_mean": 0.8837242722511292, "reward_repeat_penalty_std": 0.24979446828365326, "reward_repeat_floor_mean": 0.9870565533638, "reward_repeat_floor_std": 0.024856988340616226, "reward_near_duplicate_penalty_mean": 0.9571062326431274, "reward_near_duplicate_penalty_std": 0.04875440523028374, "reward_opening_diversity_mean": 0.921875, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.9797570705413818, "reward_distinct_2_std": 0.05725561082363129, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.16690458357334137, "reward_total_composite_mean": 0.1716843545436859, "reward_total_composite_std": 0.11949339509010315} {"timestamp_utc": "2026-04-12T19:23:12Z", "mode": "train", "global_step": 909, "epoch": 0.04783958739013736, "loss": -0.0551, "grad_norm": 3.51112699508667, "learning_rate": 7.2484848484848495e-06, "num_tokens": 1618883.0, "completions/mean_length": 244.5, "completions/min_length": 67.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 84.0, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.5140498876571655, "rewards/meter/std": 0.36049869656562805, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.18516401946544647, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.940000057220459, "rewards/count_floor/std": 0.05554921180009842, "rewards/lexical_plausibility/mean": 0.8891571760177612, "rewards/lexical_plausibility/std": 0.16540585458278656, "rewards/judge_quality/mean": 0.13124999403953552, "rewards/judge_quality/std": 0.1066954955458641, "rewards/repeat_penalty/mean": 0.6409416198730469, "rewards/repeat_penalty/std": 0.39120203256607056, "rewards/repeat_floor/mean": 0.9426136016845703, "rewards/repeat_floor/std": 0.07456691563129425, "rewards/near_duplicate_penalty/mean": 0.8410364389419556, "rewards/near_duplicate_penalty/std": 0.1904403567314148, "rewards/opening_diversity/mean": 0.8742897510528564, "rewards/opening_diversity/std": 0.22970367968082428, "rewards/distinct_2/mean": 0.7111193537712097, "rewards/distinct_2/std": 0.36678844690322876, "rewards/total_composite/mean": 0.06978833675384521, "rewards/total_composite/std": 0.1033511683344841, "reward": 0.06978833675384521, "reward_std": 0.1033511683344841, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14205285906791687, "sampling/sampling_logp_difference/max": 2.3772497177124023, "sampling/importance_sampling_ratio/min": 0.09280547499656677, "sampling/importance_sampling_ratio/mean": 1.0200109481811523, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.558080542832613, "clip_ratio/low_mean": 0.036580849438905716, "clip_ratio/low_min": 0.036580849438905716, "clip_ratio/high_mean": 0.024484342895448208, "clip_ratio/high_max": 0.024484342895448208, "clip_ratio/region_mean": 0.061065192334353924, "reward_total_mean": 0.06978833675384521, "reward_meter_mean": 0.5140498876571655, "reward_meter_std": 0.36049869656562805, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.18516401946544647, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.940000057220459, "reward_count_floor_std": 0.05554921180009842, "reward_lexical_plausibility_mean": 0.8891571760177612, "reward_lexical_plausibility_std": 0.16540585458278656, "reward_repeat_penalty_mean": 0.6409416198730469, "reward_repeat_penalty_std": 0.39120203256607056, "reward_repeat_floor_mean": 0.9426136016845703, "reward_repeat_floor_std": 0.07456691563129425, "reward_near_duplicate_penalty_mean": 0.8410364389419556, "reward_near_duplicate_penalty_std": 0.1904403567314148, "reward_opening_diversity_mean": 0.8742897510528564, "reward_opening_diversity_std": 0.22970367968082428, "reward_distinct_2_mean": 0.7111193537712097, "reward_distinct_2_std": 0.36678844690322876, "reward_judge_quality_mean": 0.13124999403953552, "reward_judge_quality_std": 0.1066954955458641, "reward_total_composite_mean": 0.06978833675384521, "reward_total_composite_std": 0.1033511683344841} {"timestamp_utc": "2026-04-12T19:23:28Z", "mode": "train", "global_step": 910, "epoch": 0.047892216199147415, "loss": -0.0488, "grad_norm": 3.6321957111358643, "learning_rate": 7.245454545454546e-06, "num_tokens": 1620482.0, "completions/mean_length": 159.875, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 42.5, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.5518388152122498, "rewards/meter/std": 0.431120365858078, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9289302229881287, "rewards/lexical_plausibility/std": 0.1316879838705063, "rewards/judge_quality/mean": 0.48875001072883606, "rewards/judge_quality/std": 0.38926443457603455, "rewards/repeat_penalty/mean": 0.9867567420005798, "rewards/repeat_penalty/std": 0.03295497968792915, "rewards/repeat_floor/mean": 0.9985635280609131, "rewards/repeat_floor/std": 0.0034054333809763193, "rewards/near_duplicate_penalty/mean": 0.9961925745010376, "rewards/near_duplicate_penalty/std": 0.007286599837243557, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.24825844168663025, "rewards/total_composite/std": 0.31368914246559143, "reward": 0.24825844168663025, "reward_std": 0.31368911266326904, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13701516389846802, "sampling/sampling_logp_difference/max": 1.120093822479248, "sampling/importance_sampling_ratio/min": 0.37801021337509155, "sampling/importance_sampling_ratio/mean": 1.0397045612335205, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6110581383109093, "clip_ratio/low_mean": 0.04854899179190397, "clip_ratio/low_min": 0.04854899179190397, "clip_ratio/high_mean": 0.04152823984622955, "clip_ratio/high_max": 0.04152823984622955, "clip_ratio/region_mean": 0.09007723163813353, "reward_total_mean": 0.24825844168663025, "reward_meter_mean": 0.5518388152122498, "reward_meter_std": 0.431120365858078, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9289302229881287, "reward_lexical_plausibility_std": 0.1316879838705063, "reward_repeat_penalty_mean": 0.9867567420005798, "reward_repeat_penalty_std": 0.03295497968792915, "reward_repeat_floor_mean": 0.9985635280609131, "reward_repeat_floor_std": 0.0034054333809763193, "reward_near_duplicate_penalty_mean": 0.9961925745010376, "reward_near_duplicate_penalty_std": 0.007286599837243557, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.48875001072883606, "reward_judge_quality_std": 0.38926443457603455, "reward_total_composite_mean": 0.24825844168663025, "reward_total_composite_std": 0.31368914246559143} {"timestamp_utc": "2026-04-12T19:23:38Z", "mode": "train", "global_step": 911, "epoch": 0.04794484500815747, "loss": 0.1152, "grad_norm": 17.10910415649414, "learning_rate": 7.242424242424243e-06, "num_tokens": 1621955.0, "completions/mean_length": 33.125, "completions/min_length": 16.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.125, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.8175361752510071, "rewards/meter/std": 0.2913716435432434, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9928355813026428, "rewards/lexical_plausibility/std": 0.020263994112610817, "rewards/judge_quality/mean": 0.5175000429153442, "rewards/judge_quality/std": 0.26868730783462524, "rewards/repeat_penalty/mean": 0.9153796434402466, "rewards/repeat_penalty/std": 0.11607661843299866, "rewards/repeat_floor/mean": 0.9938516616821289, "rewards/repeat_floor/std": 0.007939220406115055, "rewards/near_duplicate_penalty/mean": 0.9940446019172668, "rewards/near_duplicate_penalty/std": 0.011787589639425278, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9832775592803955, "rewards/distinct_2/std": 0.0472981221973896, "rewards/total_composite/mean": 0.40861278772354126, "rewards/total_composite/std": 0.24489811062812805, "reward": 0.40861278772354126, "reward_std": 0.24489811062812805, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19116827845573425, "sampling/sampling_logp_difference/max": 1.6085829734802246, "sampling/importance_sampling_ratio/min": 0.2001710683107376, "sampling/importance_sampling_ratio/mean": 1.0210844278335571, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2049486115574837, "clip_ratio/low_mean": 0.08096088282763958, "clip_ratio/low_min": 0.08096088282763958, "clip_ratio/high_mean": 0.14603892713785172, "clip_ratio/high_max": 0.14603892713785172, "clip_ratio/region_mean": 0.2269998099654913, "reward_total_mean": 0.40861278772354126, "reward_meter_mean": 0.8175361752510071, "reward_meter_std": 0.2913716435432434, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9928355813026428, "reward_lexical_plausibility_std": 0.020263994112610817, "reward_repeat_penalty_mean": 0.9153796434402466, "reward_repeat_penalty_std": 0.11607661843299866, "reward_repeat_floor_mean": 0.9938516616821289, "reward_repeat_floor_std": 0.007939220406115055, "reward_near_duplicate_penalty_mean": 0.9940446019172668, "reward_near_duplicate_penalty_std": 0.011787589639425278, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9832775592803955, "reward_distinct_2_std": 0.0472981221973896, "reward_judge_quality_mean": 0.5175000429153442, "reward_judge_quality_std": 0.26868730783462524, "reward_total_composite_mean": 0.40861278772354126, "reward_total_composite_std": 0.24489811062812805} {"timestamp_utc": "2026-04-12T19:23:48Z", "mode": "train", "global_step": 912, "epoch": 0.04799747381716752, "loss": -0.0437, "grad_norm": 15.735276222229004, "learning_rate": 7.2393939393939404e-06, "num_tokens": 1623304.0, "completions/mean_length": 28.625, "completions/min_length": 24.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.625, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.5129578113555908, "rewards/meter/std": 0.37983524799346924, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.22177450358867645, "rewards/repeat_penalty/mean": 0.9517156481742859, "rewards/repeat_penalty/std": 0.13215535879135132, "rewards/repeat_floor/mean": 0.9952853918075562, "rewards/repeat_floor/std": 0.012677213177084923, "rewards/near_duplicate_penalty/mean": 0.987479567527771, "rewards/near_duplicate_penalty/std": 0.031165635213255882, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.22096094489097595, "rewards/total_composite/std": 0.19184307754039764, "reward": 0.22096094489097595, "reward_std": 0.19184306263923645, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16369909048080444, "sampling/sampling_logp_difference/max": 1.1884865760803223, "sampling/importance_sampling_ratio/min": 0.30468204617500305, "sampling/importance_sampling_ratio/mean": 1.0196163654327393, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9141949564218521, "clip_ratio/low_mean": 0.07289101183414459, "clip_ratio/low_min": 0.07289101183414459, "clip_ratio/high_mean": 0.0879049114882946, "clip_ratio/high_max": 0.0879049114882946, "clip_ratio/region_mean": 0.1607959233224392, "reward_total_mean": 0.22096094489097595, "reward_meter_mean": 0.5129578113555908, "reward_meter_std": 0.37983524799346924, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9517156481742859, "reward_repeat_penalty_std": 0.13215535879135132, "reward_repeat_floor_mean": 0.9952853918075562, "reward_repeat_floor_std": 0.012677213177084923, "reward_near_duplicate_penalty_mean": 0.987479567527771, "reward_near_duplicate_penalty_std": 0.031165635213255882, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.22177450358867645, "reward_total_composite_mean": 0.22096094489097595, "reward_total_composite_std": 0.19184307754039764} {"timestamp_utc": "2026-04-12T19:24:02Z", "mode": "train", "global_step": 913, "epoch": 0.04805010262617757, "loss": -0.0474, "grad_norm": 5.727684020996094, "learning_rate": 7.236363636363637e-06, "num_tokens": 1625039.0, "completions/mean_length": 106.875, "completions/min_length": 39.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 49.000003814697266, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.41863495111465454, "rewards/meter/std": 0.4023495316505432, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 0.9539152383804321, "rewards/lexical_plausibility/std": 0.13034749031066895, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.6094663143157959, "rewards/repeat_penalty/std": 0.22540996968746185, "rewards/repeat_floor/mean": 0.9550163149833679, "rewards/repeat_floor/std": 0.027856511995196342, "rewards/near_duplicate_penalty/mean": 0.8774460554122925, "rewards/near_duplicate_penalty/std": 0.08431324362754822, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.7669378519058228, "rewards/distinct_2/std": 0.18185408413410187, "rewards/total_composite/mean": 0.055691204965114594, "rewards/total_composite/std": 0.05289734899997711, "reward": 0.055691204965114594, "reward_std": 0.05289734899997711, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1409750133752823, "sampling/sampling_logp_difference/max": 1.8814221620559692, "sampling/importance_sampling_ratio/min": 0.15237325429916382, "sampling/importance_sampling_ratio/mean": 1.0115469694137573, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7962162271142006, "clip_ratio/low_mean": 0.044459800235927105, "clip_ratio/low_min": 0.044459800235927105, "clip_ratio/high_mean": 0.046875000931322575, "clip_ratio/high_max": 0.046875000931322575, "clip_ratio/region_mean": 0.09133480116724968, "reward_total_mean": 0.055691204965114594, "reward_meter_mean": 0.41863495111465454, "reward_meter_std": 0.4023495316505432, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 0.9539152383804321, "reward_lexical_plausibility_std": 0.13034749031066895, "reward_repeat_penalty_mean": 0.6094663143157959, "reward_repeat_penalty_std": 0.22540996968746185, "reward_repeat_floor_mean": 0.9550163149833679, "reward_repeat_floor_std": 0.027856511995196342, "reward_near_duplicate_penalty_mean": 0.8774460554122925, "reward_near_duplicate_penalty_std": 0.08431324362754822, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.7669378519058228, "reward_distinct_2_std": 0.18185408413410187, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.055691204965114594, "reward_total_composite_std": 0.05289734899997711} {"timestamp_utc": "2026-04-12T19:24:14Z", "mode": "train", "global_step": 914, "epoch": 0.048102731435187625, "loss": -0.0209, "grad_norm": 8.038836479187012, "learning_rate": 7.233333333333334e-06, "num_tokens": 1627553.0, "completions/mean_length": 119.25, "completions/min_length": 23.0, "completions/max_length": 148.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 119.25, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 148.0, "rewards/meter/mean": 0.8334822654724121, "rewards/meter/std": 0.23967531323432922, "rewards/count_adherence/mean": 0.671875, "rewards/count_adherence/std": 0.22097088396549225, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.901562511920929, "rewards/count_floor/std": 0.06629125773906708, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.32043540477752686, "rewards/repeat_penalty/std": 0.19843009114265442, "rewards/repeat_floor/mean": 0.9110767841339111, "rewards/repeat_floor/std": 0.044244445860385895, "rewards/near_duplicate_penalty/mean": 0.7726829051971436, "rewards/near_duplicate_penalty/std": 0.12587784230709076, "rewards/opening_diversity/mean": 0.890625, "rewards/opening_diversity/std": 0.18221724033355713, "rewards/distinct_2/mean": 0.4637429416179657, "rewards/distinct_2/std": 0.2513948678970337, "rewards/total_composite/mean": 0.1342175006866455, "rewards/total_composite/std": 0.07074952870607376, "reward": 0.1342175006866455, "reward_std": 0.07074952125549316, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13308842480182648, "sampling/sampling_logp_difference/max": 1.8935027122497559, "sampling/importance_sampling_ratio/min": 0.15054357051849365, "sampling/importance_sampling_ratio/mean": 1.0097712278366089, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6534483358263969, "clip_ratio/low_mean": 0.0673923552967608, "clip_ratio/low_min": 0.0673923552967608, "clip_ratio/high_mean": 0.031618923880159855, "clip_ratio/high_max": 0.031618923880159855, "clip_ratio/region_mean": 0.09901127917692065, "reward_total_mean": 0.1342175006866455, "reward_meter_mean": 0.8334822654724121, "reward_meter_std": 0.23967531323432922, "reward_count_adherence_mean": 0.671875, "reward_count_adherence_std": 0.22097088396549225, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.901562511920929, "reward_count_floor_std": 0.06629125773906708, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.32043540477752686, "reward_repeat_penalty_std": 0.19843009114265442, "reward_repeat_floor_mean": 0.9110767841339111, "reward_repeat_floor_std": 0.044244445860385895, "reward_near_duplicate_penalty_mean": 0.7726829051971436, "reward_near_duplicate_penalty_std": 0.12587784230709076, "reward_opening_diversity_mean": 0.890625, "reward_opening_diversity_std": 0.18221724033355713, "reward_distinct_2_mean": 0.4637429416179657, "reward_distinct_2_std": 0.2513948678970337, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.1342175006866455, "reward_total_composite_std": 0.07074952870607376} {"timestamp_utc": "2026-04-12T19:24:23Z", "mode": "train", "global_step": 915, "epoch": 0.04815536024419768, "loss": 0.048, "grad_norm": 10.597201347351074, "learning_rate": 7.2303030303030305e-06, "num_tokens": 1629415.0, "completions/mean_length": 55.75, "completions/min_length": 46.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.75, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.11782373487949371, "rewards/meter/std": 0.15586894750595093, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5212500095367432, "rewards/judge_quality/std": 0.3094436228275299, "rewards/repeat_penalty/mean": 0.8395186066627502, "rewards/repeat_penalty/std": 0.2252216339111328, "rewards/repeat_floor/mean": 0.9809199571609497, "rewards/repeat_floor/std": 0.026184694841504097, "rewards/near_duplicate_penalty/mean": 0.9340975284576416, "rewards/near_duplicate_penalty/std": 0.07946949452161789, "rewards/opening_diversity/mean": 0.9765625, "rewards/opening_diversity/std": 0.032346826046705246, "rewards/distinct_2/mean": 0.9134615659713745, "rewards/distinct_2/std": 0.14002475142478943, "rewards/total_composite/mean": 0.08347926288843155, "rewards/total_composite/std": 0.13637875020503998, "reward": 0.08347926288843155, "reward_std": 0.13637875020503998, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10143669694662094, "sampling/sampling_logp_difference/max": 1.5763344764709473, "sampling/importance_sampling_ratio/min": 0.20673148334026337, "sampling/importance_sampling_ratio/mean": 1.0131306648254395, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.576223261654377, "clip_ratio/low_mean": 0.05960719892755151, "clip_ratio/low_min": 0.05960719892755151, "clip_ratio/high_mean": 0.019539337139576674, "clip_ratio/high_max": 0.019539337139576674, "clip_ratio/region_mean": 0.07914653606712818, "reward_total_mean": 0.08347926288843155, "reward_meter_mean": 0.11782373487949371, "reward_meter_std": 0.15586894750595093, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8395186066627502, "reward_repeat_penalty_std": 0.2252216339111328, "reward_repeat_floor_mean": 0.9809199571609497, "reward_repeat_floor_std": 0.026184694841504097, "reward_near_duplicate_penalty_mean": 0.9340975284576416, "reward_near_duplicate_penalty_std": 0.07946949452161789, "reward_opening_diversity_mean": 0.9765625, "reward_opening_diversity_std": 0.032346826046705246, "reward_distinct_2_mean": 0.9134615659713745, "reward_distinct_2_std": 0.14002475142478943, "reward_judge_quality_mean": 0.5212500095367432, "reward_judge_quality_std": 0.3094436228275299, "reward_total_composite_mean": 0.08347926288843155, "reward_total_composite_std": 0.13637875020503998} {"timestamp_utc": "2026-04-12T19:24:37Z", "mode": "train", "global_step": 916, "epoch": 0.04820798905320772, "loss": -0.0626, "grad_norm": 7.1197357177734375, "learning_rate": 7.227272727272729e-06, "num_tokens": 1631803.0, "completions/mean_length": 183.5, "completions/min_length": 114.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 136.57144165039062, "completions/min_terminated_length": 114.0, "completions/max_terminated_length": 153.0, "rewards/meter/mean": 0.6531333923339844, "rewards/meter/std": 0.33623582124710083, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.23754698038101196, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.07126409560441971, "rewards/lexical_plausibility/mean": 0.9599512815475464, "rewards/lexical_plausibility/std": 0.07999832928180695, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.32311004400253296, "rewards/repeat_penalty/std": 0.35683465003967285, "rewards/repeat_floor/mean": 0.9192783236503601, "rewards/repeat_floor/std": 0.05014077201485634, "rewards/near_duplicate_penalty/mean": 0.8367998600006104, "rewards/near_duplicate_penalty/std": 0.09752444922924042, "rewards/opening_diversity/mean": 0.9750000238418579, "rewards/opening_diversity/std": 0.04629101976752281, "rewards/distinct_2/mean": 0.3917592465877533, "rewards/distinct_2/std": 0.38457441329956055, "rewards/total_composite/mean": 0.09356064349412918, "rewards/total_composite/std": 0.09753771871328354, "reward": 0.09356064349412918, "reward_std": 0.09753771871328354, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12213119864463806, "sampling/sampling_logp_difference/max": 2.6143012046813965, "sampling/importance_sampling_ratio/min": 0.073218934237957, "sampling/importance_sampling_ratio/mean": 1.0072952508926392, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6170133873820305, "clip_ratio/low_mean": 0.03932244423776865, "clip_ratio/low_min": 0.03932244423776865, "clip_ratio/high_mean": 0.061362046748399734, "clip_ratio/high_max": 0.061362046748399734, "clip_ratio/region_mean": 0.10068449098616838, "reward_total_mean": 0.09356064349412918, "reward_meter_mean": 0.6531333923339844, "reward_meter_std": 0.33623582124710083, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.23754698038101196, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.07126409560441971, "reward_lexical_plausibility_mean": 0.9599512815475464, "reward_lexical_plausibility_std": 0.07999832928180695, "reward_repeat_penalty_mean": 0.32311004400253296, "reward_repeat_penalty_std": 0.35683465003967285, "reward_repeat_floor_mean": 0.9192783236503601, "reward_repeat_floor_std": 0.05014077201485634, "reward_near_duplicate_penalty_mean": 0.8367998600006104, "reward_near_duplicate_penalty_std": 0.09752444922924042, "reward_opening_diversity_mean": 0.9750000238418579, "reward_opening_diversity_std": 0.04629101976752281, "reward_distinct_2_mean": 0.3917592465877533, "reward_distinct_2_std": 0.38457441329956055, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.09356064349412918, "reward_total_composite_std": 0.09753771871328354} {"timestamp_utc": "2026-04-12T19:24:54Z", "mode": "train", "global_step": 917, "epoch": 0.048260617862217775, "loss": 0.0158, "grad_norm": 4.974209308624268, "learning_rate": 7.224242424242425e-06, "num_tokens": 1633506.0, "completions/mean_length": 102.875, "completions/min_length": 30.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 44.42857360839844, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.3541560173034668, "rewards/meter/std": 0.4033718407154083, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.9388551712036133, "rewards/lexical_plausibility/std": 0.17294375598430634, "rewards/judge_quality/mean": 0.27125000953674316, "rewards/judge_quality/std": 0.28667742013931274, "rewards/repeat_penalty/mean": 0.6628930568695068, "rewards/repeat_penalty/std": 0.20800966024398804, "rewards/repeat_floor/mean": 0.9601958394050598, "rewards/repeat_floor/std": 0.024883992969989777, "rewards/near_duplicate_penalty/mean": 0.890661895275116, "rewards/near_duplicate_penalty/std": 0.06234469637274742, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8024621605873108, "rewards/distinct_2/std": 0.13615424931049347, "rewards/total_composite/mean": 0.15337839722633362, "rewards/total_composite/std": 0.27499744296073914, "reward": 0.15337839722633362, "reward_std": 0.27499744296073914, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18709489703178406, "sampling/sampling_logp_difference/max": 1.9674787521362305, "sampling/importance_sampling_ratio/min": 0.13980890810489655, "sampling/importance_sampling_ratio/mean": 1.0322145223617554, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9502277672290802, "clip_ratio/low_mean": 0.08572155516594648, "clip_ratio/low_min": 0.08572155516594648, "clip_ratio/high_mean": 0.05032051540911198, "clip_ratio/high_max": 0.05032051540911198, "clip_ratio/region_mean": 0.13604207057505846, "reward_total_mean": 0.15337839722633362, "reward_meter_mean": 0.3541560173034668, "reward_meter_std": 0.4033718407154083, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.9388551712036133, "reward_lexical_plausibility_std": 0.17294375598430634, "reward_repeat_penalty_mean": 0.6628930568695068, "reward_repeat_penalty_std": 0.20800966024398804, "reward_repeat_floor_mean": 0.9601958394050598, "reward_repeat_floor_std": 0.024883992969989777, "reward_near_duplicate_penalty_mean": 0.890661895275116, "reward_near_duplicate_penalty_std": 0.06234469637274742, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8024621605873108, "reward_distinct_2_std": 0.13615424931049347, "reward_judge_quality_mean": 0.27125000953674316, "reward_judge_quality_std": 0.28667742013931274, "reward_total_composite_mean": 0.15337839722633362, "reward_total_composite_std": 0.27499744296073914} {"timestamp_utc": "2026-04-12T19:25:08Z", "mode": "train", "global_step": 918, "epoch": 0.04831324667122783, "loss": -0.0404, "grad_norm": 3.647557258605957, "learning_rate": 7.221212121212122e-06, "num_tokens": 1634856.0, "completions/mean_length": 83.75, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 22.571430206298828, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.5454115867614746, "rewards/meter/std": 0.4758901000022888, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9623986482620239, "rewards/lexical_plausibility/std": 0.08399605005979538, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.16690458357334137, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16828002035617828, "rewards/total_composite/std": 0.17661982774734497, "reward": 0.16828002035617828, "reward_std": 0.17661982774734497, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14703625440597534, "sampling/sampling_logp_difference/max": 1.6368846893310547, "sampling/importance_sampling_ratio/min": 0.19458529353141785, "sampling/importance_sampling_ratio/mean": 1.0103979110717773, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.860602855682373, "clip_ratio/low_mean": 0.06764069385826588, "clip_ratio/low_min": 0.06764069385826588, "clip_ratio/high_mean": 0.06905594561249018, "clip_ratio/high_max": 0.06905594561249018, "clip_ratio/region_mean": 0.13669663947075605, "reward_total_mean": 0.16828002035617828, "reward_meter_mean": 0.5454115867614746, "reward_meter_std": 0.4758901000022888, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9623986482620239, "reward_lexical_plausibility_std": 0.08399605005979538, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.16690458357334137, "reward_total_composite_mean": 0.16828002035617828, "reward_total_composite_std": 0.17661982774734497} {"timestamp_utc": "2026-04-12T19:25:19Z", "mode": "train", "global_step": 919, "epoch": 0.04836587548023788, "loss": -0.0298, "grad_norm": 11.700063705444336, "learning_rate": 7.218181818181819e-06, "num_tokens": 1636297.0, "completions/mean_length": 35.125, "completions/min_length": 31.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.125, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.24146994948387146, "rewards/meter/std": 0.2094639390707016, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3837500214576721, "rewards/judge_quality/std": 0.24076886475086212, "rewards/repeat_penalty/mean": 0.7204203605651855, "rewards/repeat_penalty/std": 0.23886586725711823, "rewards/repeat_floor/mean": 0.9617202281951904, "rewards/repeat_floor/std": 0.03448401391506195, "rewards/near_duplicate_penalty/mean": 0.8409971594810486, "rewards/near_duplicate_penalty/std": 0.12362983077764511, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8813408017158508, "rewards/distinct_2/std": 0.12492332607507706, "rewards/total_composite/mean": 0.1139337420463562, "rewards/total_composite/std": 0.13872671127319336, "reward": 0.1139337420463562, "reward_std": 0.13872671127319336, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11376723647117615, "sampling/sampling_logp_difference/max": 3.1247811317443848, "sampling/importance_sampling_ratio/min": 0.04394655302166939, "sampling/importance_sampling_ratio/mean": 1.0136206150054932, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7129223123192787, "clip_ratio/low_mean": 0.04757504374720156, "clip_ratio/low_min": 0.04757504374720156, "clip_ratio/high_mean": 0.04945064848288894, "clip_ratio/high_max": 0.04945064848288894, "clip_ratio/region_mean": 0.0970256922300905, "reward_total_mean": 0.1139337420463562, "reward_meter_mean": 0.24146994948387146, "reward_meter_std": 0.2094639390707016, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7204203605651855, "reward_repeat_penalty_std": 0.23886586725711823, "reward_repeat_floor_mean": 0.9617202281951904, "reward_repeat_floor_std": 0.03448401391506195, "reward_near_duplicate_penalty_mean": 0.8409971594810486, "reward_near_duplicate_penalty_std": 0.12362983077764511, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8813408017158508, "reward_distinct_2_std": 0.12492332607507706, "reward_judge_quality_mean": 0.3837500214576721, "reward_judge_quality_std": 0.24076886475086212, "reward_total_composite_mean": 0.1139337420463562, "reward_total_composite_std": 0.13872671127319336} {"timestamp_utc": "2026-04-12T19:25:28Z", "mode": "train", "global_step": 920, "epoch": 0.04841850428924793, "loss": 0.2338, "grad_norm": 20.58114242553711, "learning_rate": 7.215151515151516e-06, "num_tokens": 1637623.0, "completions/mean_length": 23.75, "completions/min_length": 17.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.75, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.6520994901657104, "rewards/meter/std": 0.3819913864135742, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.2558424770832062, "rewards/repeat_penalty/mean": 0.7563884258270264, "rewards/repeat_penalty/std": 0.06048721447587013, "rewards/repeat_floor/mean": 0.9820820093154907, "rewards/repeat_floor/std": 0.0050341845490038395, "rewards/near_duplicate_penalty/mean": 0.982519805431366, "rewards/near_duplicate_penalty/std": 0.032421257346868515, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9550449848175049, "rewards/distinct_2/std": 0.06571410596370697, "rewards/total_composite/mean": 0.3310341238975525, "rewards/total_composite/std": 0.21665610373020172, "reward": 0.3310341238975525, "reward_std": 0.21665608882904053, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16083046793937683, "sampling/sampling_logp_difference/max": 1.895230770111084, "sampling/importance_sampling_ratio/min": 0.30498144030570984, "sampling/importance_sampling_ratio/mean": 1.015960931777954, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9854451939463615, "clip_ratio/low_mean": 0.0378510388545692, "clip_ratio/low_min": 0.0378510388545692, "clip_ratio/high_mean": 0.1030723275616765, "clip_ratio/high_max": 0.1030723275616765, "clip_ratio/region_mean": 0.1409233664162457, "reward_total_mean": 0.3310341238975525, "reward_meter_mean": 0.6520994901657104, "reward_meter_std": 0.3819913864135742, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7563884258270264, "reward_repeat_penalty_std": 0.06048721447587013, "reward_repeat_floor_mean": 0.9820820093154907, "reward_repeat_floor_std": 0.0050341845490038395, "reward_near_duplicate_penalty_mean": 0.982519805431366, "reward_near_duplicate_penalty_std": 0.032421257346868515, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9550449848175049, "reward_distinct_2_std": 0.06571410596370697, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.2558424770832062, "reward_total_composite_mean": 0.3310341238975525, "reward_total_composite_std": 0.21665610373020172} {"timestamp_utc": "2026-04-12T19:25:37Z", "mode": "train", "global_step": 921, "epoch": 0.048471133098257985, "loss": 0.0547, "grad_norm": 10.257909774780273, "learning_rate": 7.212121212121212e-06, "num_tokens": 1639603.0, "completions/mean_length": 70.5, "completions/min_length": 66.0, "completions/max_length": 80.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 70.5, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.24497263133525848, "rewards/meter/std": 0.2819669544696808, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9474999904632568, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.3018253445625305, "rewards/repeat_penalty/std": 0.25132858753204346, "rewards/repeat_floor/mean": 0.9001807570457458, "rewards/repeat_floor/std": 0.059470199048519135, "rewards/near_duplicate_penalty/mean": 0.7772849202156067, "rewards/near_duplicate_penalty/std": 0.16345053911209106, "rewards/opening_diversity/mean": 0.628125011920929, "rewards/opening_diversity/std": 0.2580619752407074, "rewards/distinct_2/mean": 0.5100057125091553, "rewards/distinct_2/std": 0.27947521209716797, "rewards/total_composite/mean": 0.052619487047195435, "rewards/total_composite/std": 0.07346183061599731, "reward": 0.052619487047195435, "reward_std": 0.07346183061599731, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13194158673286438, "sampling/sampling_logp_difference/max": 2.478618621826172, "sampling/importance_sampling_ratio/min": 0.08385898172855377, "sampling/importance_sampling_ratio/mean": 1.0079710483551025, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7592105269432068, "clip_ratio/low_mean": 0.08315952587872744, "clip_ratio/low_min": 0.08315952587872744, "clip_ratio/high_mean": 0.02538364566862583, "clip_ratio/high_max": 0.02538364566862583, "clip_ratio/region_mean": 0.10854317154735327, "reward_total_mean": 0.052619487047195435, "reward_meter_mean": 0.24497263133525848, "reward_meter_std": 0.2819669544696808, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9474999904632568, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.3018253445625305, "reward_repeat_penalty_std": 0.25132858753204346, "reward_repeat_floor_mean": 0.9001807570457458, "reward_repeat_floor_std": 0.059470199048519135, "reward_near_duplicate_penalty_mean": 0.7772849202156067, "reward_near_duplicate_penalty_std": 0.16345053911209106, "reward_opening_diversity_mean": 0.628125011920929, "reward_opening_diversity_std": 0.2580619752407074, "reward_distinct_2_mean": 0.5100057125091553, "reward_distinct_2_std": 0.27947521209716797, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.052619487047195435, "reward_total_composite_std": 0.07346183061599731} {"timestamp_utc": "2026-04-12T19:25:46Z", "mode": "train", "global_step": 922, "epoch": 0.04852376190726804, "loss": -0.0017, "grad_norm": 15.81523609161377, "learning_rate": 7.2090909090909104e-06, "num_tokens": 1641206.0, "completions/mean_length": 33.375, "completions/min_length": 30.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.375, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.3166966736316681, "rewards/meter/std": 0.38948431611061096, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5087499618530273, "rewards/judge_quality/std": 0.2811424434185028, "rewards/repeat_penalty/mean": 0.8077449798583984, "rewards/repeat_penalty/std": 0.16329263150691986, "rewards/repeat_floor/mean": 0.9776030778884888, "rewards/repeat_floor/std": 0.015670295804739, "rewards/near_duplicate_penalty/mean": 0.9165524840354919, "rewards/near_duplicate_penalty/std": 0.04324489086866379, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9318910241127014, "rewards/distinct_2/std": 0.0807490199804306, "rewards/total_composite/mean": 0.12235023081302643, "rewards/total_composite/std": 0.13654646277427673, "reward": 0.12235023081302643, "reward_std": 0.13654646277427673, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12699806690216064, "sampling/sampling_logp_difference/max": 1.7624311447143555, "sampling/importance_sampling_ratio/min": 0.17162710428237915, "sampling/importance_sampling_ratio/mean": 1.005696415901184, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7293168902397156, "clip_ratio/low_mean": 0.0682261842302978, "clip_ratio/low_min": 0.0682261842302978, "clip_ratio/high_mean": 0.06333085335791111, "clip_ratio/high_max": 0.06333085335791111, "clip_ratio/region_mean": 0.1315570375882089, "reward_total_mean": 0.12235023081302643, "reward_meter_mean": 0.3166966736316681, "reward_meter_std": 0.38948431611061096, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8077449798583984, "reward_repeat_penalty_std": 0.16329263150691986, "reward_repeat_floor_mean": 0.9776030778884888, "reward_repeat_floor_std": 0.015670295804739, "reward_near_duplicate_penalty_mean": 0.9165524840354919, "reward_near_duplicate_penalty_std": 0.04324489086866379, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9318910241127014, "reward_distinct_2_std": 0.0807490199804306, "reward_judge_quality_mean": 0.5087499618530273, "reward_judge_quality_std": 0.2811424434185028, "reward_total_composite_mean": 0.12235023081302643, "reward_total_composite_std": 0.13654646277427673} {"timestamp_utc": "2026-04-12T19:25:55Z", "mode": "train", "global_step": 923, "epoch": 0.04857639071627809, "loss": 0.023, "grad_norm": 18.954689025878906, "learning_rate": 7.206060606060606e-06, "num_tokens": 1642783.0, "completions/mean_length": 27.125, "completions/min_length": 21.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.125, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.5961880683898926, "rewards/meter/std": 0.4088229835033417, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.7672998905181885, "rewards/repeat_penalty/std": 0.14997050166130066, "rewards/repeat_floor/mean": 0.9812946319580078, "rewards/repeat_floor/std": 0.019519859924912453, "rewards/near_duplicate_penalty/mean": 0.9676051139831543, "rewards/near_duplicate_penalty/std": 0.08506648987531662, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9711538553237915, "rewards/distinct_2/std": 0.05723259598016739, "rewards/total_composite/mean": 0.22934095561504364, "rewards/total_composite/std": 0.2348758727312088, "reward": 0.22934095561504364, "reward_std": 0.2348758727312088, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14124515652656555, "sampling/sampling_logp_difference/max": 1.8496522903442383, "sampling/importance_sampling_ratio/min": 0.15729184448719025, "sampling/importance_sampling_ratio/mean": 1.015867829322815, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8634953424334526, "clip_ratio/low_mean": 0.05253623332828283, "clip_ratio/low_min": 0.05253623332828283, "clip_ratio/high_mean": 0.053854302037507296, "clip_ratio/high_max": 0.053854302037507296, "clip_ratio/region_mean": 0.10639053536579013, "reward_total_mean": 0.22934095561504364, "reward_meter_mean": 0.5961880683898926, "reward_meter_std": 0.4088229835033417, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7672998905181885, "reward_repeat_penalty_std": 0.14997050166130066, "reward_repeat_floor_mean": 0.9812946319580078, "reward_repeat_floor_std": 0.019519859924912453, "reward_near_duplicate_penalty_mean": 0.9676051139831543, "reward_near_duplicate_penalty_std": 0.08506648987531662, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9711538553237915, "reward_distinct_2_std": 0.05723259598016739, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.22934095561504364, "reward_total_composite_std": 0.2348758727312088} {"timestamp_utc": "2026-04-12T19:26:09Z", "mode": "train", "global_step": 924, "epoch": 0.04862901952528814, "loss": -0.0842, "grad_norm": 5.369450092315674, "learning_rate": 7.203030303030304e-06, "num_tokens": 1644342.0, "completions/mean_length": 91.875, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 31.85714340209961, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.7182058095932007, "rewards/meter/std": 0.3672333359718323, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9414045810699463, "rewards/lexical_plausibility/std": 0.16573286056518555, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.8725728988647461, "rewards/repeat_penalty/std": 0.13889358937740326, "rewards/repeat_floor/mean": 0.9896508455276489, "rewards/repeat_floor/std": 0.011627145111560822, "rewards/near_duplicate_penalty/mean": 0.9781209230422974, "rewards/near_duplicate_penalty/std": 0.03966702148318291, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.045327357947826385, "rewards/total_composite/mean": 0.1930149793624878, "rewards/total_composite/std": 0.14683732390403748, "reward": 0.1930149793624878, "reward_std": 0.14683730900287628, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17910854518413544, "sampling/sampling_logp_difference/max": 1.6146667003631592, "sampling/importance_sampling_ratio/min": 0.19895696640014648, "sampling/importance_sampling_ratio/mean": 1.0262075662612915, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1495482996106148, "clip_ratio/low_mean": 0.06895678862929344, "clip_ratio/low_min": 0.06895678862929344, "clip_ratio/high_mean": 0.06418128684163094, "clip_ratio/high_max": 0.06418128684163094, "clip_ratio/region_mean": 0.13313807547092438, "reward_total_mean": 0.1930149793624878, "reward_meter_mean": 0.7182058095932007, "reward_meter_std": 0.3672333359718323, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9414045810699463, "reward_lexical_plausibility_std": 0.16573286056518555, "reward_repeat_penalty_mean": 0.8725728988647461, "reward_repeat_penalty_std": 0.13889358937740326, "reward_repeat_floor_mean": 0.9896508455276489, "reward_repeat_floor_std": 0.011627145111560822, "reward_near_duplicate_penalty_mean": 0.9781209230422974, "reward_near_duplicate_penalty_std": 0.03966702148318291, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.045327357947826385, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.1930149793624878, "reward_total_composite_std": 0.14683732390403748} {"timestamp_utc": "2026-04-12T19:26:23Z", "mode": "train", "global_step": 925, "epoch": 0.048681648334298194, "loss": -0.0084, "grad_norm": 4.7378830909729, "learning_rate": 7.2000000000000005e-06, "num_tokens": 1645972.0, "completions/mean_length": 101.75, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.142860412597656, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.15823863446712494, "rewards/meter/std": 0.17890150845050812, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 0.9619423747062683, "rewards/lexical_plausibility/std": 0.10764322429895401, "rewards/judge_quality/mean": 0.5162500143051147, "rewards/judge_quality/std": 0.2672044336795807, "rewards/repeat_penalty/mean": 0.7766191959381104, "rewards/repeat_penalty/std": 0.2135908305644989, "rewards/repeat_floor/mean": 0.9733813405036926, "rewards/repeat_floor/std": 0.023051032796502113, "rewards/near_duplicate_penalty/mean": 0.903794527053833, "rewards/near_duplicate_penalty/std": 0.0657821074128151, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8645795583724976, "rewards/distinct_2/std": 0.16796272993087769, "rewards/total_composite/mean": 0.06841225922107697, "rewards/total_composite/std": 0.08258438110351562, "reward": 0.06841225922107697, "reward_std": 0.08258438110351562, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12552478909492493, "sampling/sampling_logp_difference/max": 1.2614984512329102, "sampling/importance_sampling_ratio/min": 0.2832292914390564, "sampling/importance_sampling_ratio/mean": 1.014461636543274, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.833333745598793, "clip_ratio/low_mean": 0.07326135924085975, "clip_ratio/low_min": 0.07326135924085975, "clip_ratio/high_mean": 0.03728070296347141, "clip_ratio/high_max": 0.03728070296347141, "clip_ratio/region_mean": 0.11054206220433116, "reward_total_mean": 0.06841225922107697, "reward_meter_mean": 0.15823863446712494, "reward_meter_std": 0.17890150845050812, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 0.9619423747062683, "reward_lexical_plausibility_std": 0.10764322429895401, "reward_repeat_penalty_mean": 0.7766191959381104, "reward_repeat_penalty_std": 0.2135908305644989, "reward_repeat_floor_mean": 0.9733813405036926, "reward_repeat_floor_std": 0.023051032796502113, "reward_near_duplicate_penalty_mean": 0.903794527053833, "reward_near_duplicate_penalty_std": 0.0657821074128151, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8645795583724976, "reward_distinct_2_std": 0.16796272993087769, "reward_judge_quality_mean": 0.5162500143051147, "reward_judge_quality_std": 0.2672044336795807, "reward_total_composite_mean": 0.06841225922107697, "reward_total_composite_std": 0.08258438110351562} {"timestamp_utc": "2026-04-12T19:26:37Z", "mode": "train", "global_step": 926, "epoch": 0.04873427714330825, "loss": -0.0729, "grad_norm": 2.65804123878479, "learning_rate": 7.196969696969698e-06, "num_tokens": 1647528.0, "completions/mean_length": 225.5, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 53.60000228881836, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.3696368932723999, "rewards/meter/std": 0.3880865275859833, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.2519763112068176, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.07559289783239365, "rewards/lexical_plausibility/mean": 0.8377869129180908, "rewards/lexical_plausibility/std": 0.22775839269161224, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.18077215552330017, "rewards/repeat_penalty/mean": 0.936210036277771, "rewards/repeat_penalty/std": 0.09846557676792145, "rewards/repeat_floor/mean": 0.9940980076789856, "rewards/repeat_floor/std": 0.008051811717450619, "rewards/near_duplicate_penalty/mean": 0.9833345413208008, "rewards/near_duplicate_penalty/std": 0.02137635461986065, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.983031690120697, "rewards/distinct_2/std": 0.04799367114901543, "rewards/total_composite/mean": 0.13293004035949707, "rewards/total_composite/std": 0.16459985077381134, "reward": 0.13293004035949707, "reward_std": 0.16459985077381134, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19071801006793976, "sampling/sampling_logp_difference/max": 2.3512825965881348, "sampling/importance_sampling_ratio/min": 0.09524691849946976, "sampling/importance_sampling_ratio/mean": 1.0463134050369263, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8124346882104874, "clip_ratio/low_mean": 0.022188347298651934, "clip_ratio/low_min": 0.022188347298651934, "clip_ratio/high_mean": 0.03940536640584469, "clip_ratio/high_max": 0.03940536640584469, "clip_ratio/region_mean": 0.06159371370449662, "reward_total_mean": 0.13293004035949707, "reward_meter_mean": 0.3696368932723999, "reward_meter_std": 0.3880865275859833, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.2519763112068176, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.07559289783239365, "reward_lexical_plausibility_mean": 0.8377869129180908, "reward_lexical_plausibility_std": 0.22775839269161224, "reward_repeat_penalty_mean": 0.936210036277771, "reward_repeat_penalty_std": 0.09846557676792145, "reward_repeat_floor_mean": 0.9940980076789856, "reward_repeat_floor_std": 0.008051811717450619, "reward_near_duplicate_penalty_mean": 0.9833345413208008, "reward_near_duplicate_penalty_std": 0.02137635461986065, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.983031690120697, "reward_distinct_2_std": 0.04799367114901543, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.18077215552330017, "reward_total_composite_mean": 0.13293004035949707, "reward_total_composite_std": 0.16459985077381134} {"timestamp_utc": "2026-04-12T19:26:50Z", "mode": "train", "global_step": 927, "epoch": 0.0487869059523183, "loss": -0.0277, "grad_norm": 4.465095520019531, "learning_rate": 7.193939393939394e-06, "num_tokens": 1648892.0, "completions/mean_length": 81.5, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.0, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.9119614958763123, "rewards/meter/std": 0.21772506833076477, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9544011354446411, "rewards/lexical_plausibility/std": 0.1289730668067932, "rewards/judge_quality/mean": 0.24625001847743988, "rewards/judge_quality/std": 0.2774340510368347, "rewards/repeat_penalty/mean": 0.7469173073768616, "rewards/repeat_penalty/std": 0.00871915090829134, "rewards/repeat_floor/mean": 0.9843834638595581, "rewards/repeat_floor/std": 0.0017438469221815467, "rewards/near_duplicate_penalty/mean": 0.9958897829055786, "rewards/near_duplicate_penalty/std": 0.011625555343925953, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20090323686599731, "rewards/total_composite/std": 0.23400413990020752, "reward": 0.20090323686599731, "reward_std": 0.23400413990020752, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14231418073177338, "sampling/sampling_logp_difference/max": 1.2070648670196533, "sampling/importance_sampling_ratio/min": 0.29907381534576416, "sampling/importance_sampling_ratio/mean": 1.0327887535095215, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1380844712257385, "clip_ratio/low_mean": 0.06239557405933738, "clip_ratio/low_min": 0.06239557405933738, "clip_ratio/high_mean": 0.03060640674084425, "clip_ratio/high_max": 0.03060640674084425, "clip_ratio/region_mean": 0.09300198080018163, "reward_total_mean": 0.20090323686599731, "reward_meter_mean": 0.9119614958763123, "reward_meter_std": 0.21772506833076477, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9544011354446411, "reward_lexical_plausibility_std": 0.1289730668067932, "reward_repeat_penalty_mean": 0.7469173073768616, "reward_repeat_penalty_std": 0.00871915090829134, "reward_repeat_floor_mean": 0.9843834638595581, "reward_repeat_floor_std": 0.0017438469221815467, "reward_near_duplicate_penalty_mean": 0.9958897829055786, "reward_near_duplicate_penalty_std": 0.011625555343925953, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.24625001847743988, "reward_judge_quality_std": 0.2774340510368347, "reward_total_composite_mean": 0.20090323686599731, "reward_total_composite_std": 0.23400413990020752} {"timestamp_utc": "2026-04-12T19:26:59Z", "mode": "train", "global_step": 928, "epoch": 0.04883953476132835, "loss": 0.1078, "grad_norm": 15.49630069732666, "learning_rate": 7.1909090909090914e-06, "num_tokens": 1650338.0, "completions/mean_length": 38.75, "completions/min_length": 32.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.75, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.42397141456604004, "rewards/meter/std": 0.4718492925167084, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.35602855682373047, "rewards/repeat_penalty/std": 0.3165453374385834, "rewards/repeat_floor/mean": 0.9027478694915771, "rewards/repeat_floor/std": 0.07226752489805222, "rewards/near_duplicate_penalty/mean": 0.7224303483963013, "rewards/near_duplicate_penalty/std": 0.27404770255088806, "rewards/opening_diversity/mean": 0.640625, "rewards/opening_diversity/std": 0.23563650250434875, "rewards/distinct_2/mean": 0.6216205954551697, "rewards/distinct_2/std": 0.2848329246044159, "rewards/total_composite/mean": 0.09111328423023224, "rewards/total_composite/std": 0.11265230178833008, "reward": 0.09111328423023224, "reward_std": 0.11265230178833008, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11080250889062881, "sampling/sampling_logp_difference/max": 1.2789342403411865, "sampling/importance_sampling_ratio/min": 0.27833378314971924, "sampling/importance_sampling_ratio/mean": 1.0121363401412964, "sampling/importance_sampling_ratio/max": 1.9798465967178345, "entropy": 0.751460611820221, "clip_ratio/low_mean": 0.042764355428516865, "clip_ratio/low_min": 0.042764355428516865, "clip_ratio/high_mean": 0.04218073608353734, "clip_ratio/high_max": 0.04218073608353734, "clip_ratio/region_mean": 0.0849450915120542, "reward_total_mean": 0.09111328423023224, "reward_meter_mean": 0.42397141456604004, "reward_meter_std": 0.4718492925167084, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.35602855682373047, "reward_repeat_penalty_std": 0.3165453374385834, "reward_repeat_floor_mean": 0.9027478694915771, "reward_repeat_floor_std": 0.07226752489805222, "reward_near_duplicate_penalty_mean": 0.7224303483963013, "reward_near_duplicate_penalty_std": 0.27404770255088806, "reward_opening_diversity_mean": 0.640625, "reward_opening_diversity_std": 0.23563650250434875, "reward_distinct_2_mean": 0.6216205954551697, "reward_distinct_2_std": 0.2848329246044159, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.09111328423023224, "reward_total_composite_std": 0.11265230178833008} {"timestamp_utc": "2026-04-12T19:27:08Z", "mode": "train", "global_step": 929, "epoch": 0.048892163570338404, "loss": 0.2541, "grad_norm": 11.848160743713379, "learning_rate": 7.187878787878788e-06, "num_tokens": 1651993.0, "completions/mean_length": 41.875, "completions/min_length": 20.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.875, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.6769824028015137, "rewards/meter/std": 0.3021802306175232, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.29546841979026794, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.08864052593708038, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.855697751045227, "rewards/repeat_penalty/std": 0.1298636645078659, "rewards/repeat_floor/mean": 0.9862238168716431, "rewards/repeat_floor/std": 0.014152740128338337, "rewards/near_duplicate_penalty/mean": 0.96401047706604, "rewards/near_duplicate_penalty/std": 0.05547286197543144, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9485810995101929, "rewards/distinct_2/std": 0.08081252127885818, "rewards/total_composite/mean": 0.2899732291698456, "rewards/total_composite/std": 0.1964443475008011, "reward": 0.2899732291698456, "reward_std": 0.1964443176984787, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11191190034151077, "sampling/sampling_logp_difference/max": 2.764425039291382, "sampling/importance_sampling_ratio/min": 0.06301231682300568, "sampling/importance_sampling_ratio/mean": 1.0081783533096313, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6256960667669773, "clip_ratio/low_mean": 0.048545082565397024, "clip_ratio/low_min": 0.048545082565397024, "clip_ratio/high_mean": 0.05867794528603554, "clip_ratio/high_max": 0.05867794528603554, "clip_ratio/region_mean": 0.10722302785143256, "reward_total_mean": 0.2899732291698456, "reward_meter_mean": 0.6769824028015137, "reward_meter_std": 0.3021802306175232, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.29546841979026794, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.08864052593708038, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.855697751045227, "reward_repeat_penalty_std": 0.1298636645078659, "reward_repeat_floor_mean": 0.9862238168716431, "reward_repeat_floor_std": 0.014152740128338337, "reward_near_duplicate_penalty_mean": 0.96401047706604, "reward_near_duplicate_penalty_std": 0.05547286197543144, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9485810995101929, "reward_distinct_2_std": 0.08081252127885818, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.2899732291698456, "reward_total_composite_std": 0.1964443475008011} {"timestamp_utc": "2026-04-12T19:27:22Z", "mode": "train", "global_step": 930, "epoch": 0.048944792379348456, "loss": -0.055, "grad_norm": 3.5176053047180176, "learning_rate": 7.184848484848486e-06, "num_tokens": 1653591.0, "completions/mean_length": 167.75, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 53.0, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.3827265501022339, "rewards/meter/std": 0.3244231641292572, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9070299863815308, "rewards/lexical_plausibility/std": 0.17688804864883423, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.8969683647155762, "rewards/repeat_penalty/std": 0.09577226638793945, "rewards/repeat_floor/mean": 0.9901719093322754, "rewards/repeat_floor/std": 0.0072926925495266914, "rewards/near_duplicate_penalty/mean": 0.9601371884346008, "rewards/near_duplicate_penalty/std": 0.026828937232494354, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9572371244430542, "rewards/distinct_2/std": 0.053154509514570236, "rewards/total_composite/mean": 0.0810088962316513, "rewards/total_composite/std": 0.08484596014022827, "reward": 0.0810088962316513, "reward_std": 0.08484595268964767, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1922956258058548, "sampling/sampling_logp_difference/max": 1.2328667640686035, "sampling/importance_sampling_ratio/min": 0.29145583510398865, "sampling/importance_sampling_ratio/mean": 1.0240886211395264, "sampling/importance_sampling_ratio/max": 1.9131968021392822, "entropy": 1.2628989219665527, "clip_ratio/low_mean": 0.06400027498602867, "clip_ratio/low_min": 0.06400027498602867, "clip_ratio/high_mean": 0.08033769205212593, "clip_ratio/high_max": 0.08033769205212593, "clip_ratio/region_mean": 0.1443379670381546, "reward_total_mean": 0.0810088962316513, "reward_meter_mean": 0.3827265501022339, "reward_meter_std": 0.3244231641292572, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9070299863815308, "reward_lexical_plausibility_std": 0.17688804864883423, "reward_repeat_penalty_mean": 0.8969683647155762, "reward_repeat_penalty_std": 0.09577226638793945, "reward_repeat_floor_mean": 0.9901719093322754, "reward_repeat_floor_std": 0.0072926925495266914, "reward_near_duplicate_penalty_mean": 0.9601371884346008, "reward_near_duplicate_penalty_std": 0.026828937232494354, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9572371244430542, "reward_distinct_2_std": 0.053154509514570236, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.0810088962316513, "reward_total_composite_std": 0.08484596014022827} {"timestamp_utc": "2026-04-12T19:27:31Z", "mode": "train", "global_step": 931, "epoch": 0.04899742118835851, "loss": 0.0754, "grad_norm": 14.462099075317383, "learning_rate": 7.181818181818182e-06, "num_tokens": 1655152.0, "completions/mean_length": 40.125, "completions/min_length": 30.0, "completions/max_length": 59.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.125, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.5972735285758972, "rewards/meter/std": 0.4042917788028717, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.19668231904506683, "rewards/repeat_penalty/mean": 0.8369426131248474, "rewards/repeat_penalty/std": 0.2847599387168884, "rewards/repeat_floor/mean": 0.9788985848426819, "rewards/repeat_floor/std": 0.038716524839401245, "rewards/near_duplicate_penalty/mean": 0.9422450065612793, "rewards/near_duplicate_penalty/std": 0.09756415337324142, "rewards/opening_diversity/mean": 0.921875, "rewards/opening_diversity/std": 0.22097088396549225, "rewards/distinct_2/mean": 0.9138815402984619, "rewards/distinct_2/std": 0.13255546987056732, "rewards/total_composite/mean": 0.2229437232017517, "rewards/total_composite/std": 0.12855421006679535, "reward": 0.2229437232017517, "reward_std": 0.12855419516563416, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11774379760026932, "sampling/sampling_logp_difference/max": 1.618084192276001, "sampling/importance_sampling_ratio/min": 0.19827820360660553, "sampling/importance_sampling_ratio/mean": 1.0261934995651245, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8934935554862022, "clip_ratio/low_mean": 0.04492550063878298, "clip_ratio/low_min": 0.04492550063878298, "clip_ratio/high_mean": 0.10349396243691444, "clip_ratio/high_max": 0.10349396243691444, "clip_ratio/region_mean": 0.14841946307569742, "reward_total_mean": 0.2229437232017517, "reward_meter_mean": 0.5972735285758972, "reward_meter_std": 0.4042917788028717, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8369426131248474, "reward_repeat_penalty_std": 0.2847599387168884, "reward_repeat_floor_mean": 0.9788985848426819, "reward_repeat_floor_std": 0.038716524839401245, "reward_near_duplicate_penalty_mean": 0.9422450065612793, "reward_near_duplicate_penalty_std": 0.09756415337324142, "reward_opening_diversity_mean": 0.921875, "reward_opening_diversity_std": 0.22097088396549225, "reward_distinct_2_mean": 0.9138815402984619, "reward_distinct_2_std": 0.13255546987056732, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.19668231904506683, "reward_total_composite_mean": 0.2229437232017517, "reward_total_composite_std": 0.12855421006679535} {"timestamp_utc": "2026-04-12T19:27:46Z", "mode": "train", "global_step": 932, "epoch": 0.04905004999736856, "loss": -0.0486, "grad_norm": 1.9425721168518066, "learning_rate": 7.17878787878788e-06, "num_tokens": 1656700.0, "completions/mean_length": 145.5, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 23.33333396911621, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.9154078364372253, "rewards/meter/std": 0.12859348952770233, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9230225086212158, "rewards/lexical_plausibility/std": 0.14301204681396484, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1767766922712326, "rewards/repeat_penalty/mean": 0.8125, "rewards/repeat_penalty/std": 0.1157275140285492, "rewards/repeat_floor/mean": 0.9887499809265137, "rewards/repeat_floor/std": 0.0069436440244317055, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.23230081796646118, "rewards/total_composite/std": 0.1508869230747223, "reward": 0.23230081796646118, "reward_std": 0.1508869230747223, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15069572627544403, "sampling/sampling_logp_difference/max": 0.9685931205749512, "sampling/importance_sampling_ratio/min": 0.37961673736572266, "sampling/importance_sampling_ratio/mean": 1.0240278244018555, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.934409961104393, "clip_ratio/low_mean": 0.015625, "clip_ratio/low_min": 0.015625, "clip_ratio/high_mean": 0.10361413098871708, "clip_ratio/high_max": 0.10361413098871708, "clip_ratio/region_mean": 0.11923913098871708, "reward_total_mean": 0.23230081796646118, "reward_meter_mean": 0.9154078364372253, "reward_meter_std": 0.12859348952770233, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9230225086212158, "reward_lexical_plausibility_std": 0.14301204681396484, "reward_repeat_penalty_mean": 0.8125, "reward_repeat_penalty_std": 0.1157275140285492, "reward_repeat_floor_mean": 0.9887499809265137, "reward_repeat_floor_std": 0.0069436440244317055, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1767766922712326, "reward_total_composite_mean": 0.23230081796646118, "reward_total_composite_std": 0.1508869230747223} {"timestamp_utc": "2026-04-12T19:28:00Z", "mode": "train", "global_step": 933, "epoch": 0.049102678806378613, "loss": -0.0018, "grad_norm": 4.698115825653076, "learning_rate": 7.175757575757576e-06, "num_tokens": 1658291.0, "completions/mean_length": 104.875, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 46.71428680419922, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.22150354087352753, "rewards/meter/std": 0.2616729438304901, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9202638864517212, "rewards/lexical_plausibility/std": 0.15705610811710358, "rewards/judge_quality/mean": 0.6412500143051147, "rewards/judge_quality/std": 0.40417245030403137, "rewards/repeat_penalty/mean": 0.9221000671386719, "rewards/repeat_penalty/std": 0.07147147506475449, "rewards/repeat_floor/mean": 0.991619348526001, "rewards/repeat_floor/std": 0.007712433114647865, "rewards/near_duplicate_penalty/mean": 0.9801720380783081, "rewards/near_duplicate_penalty/std": 0.019732806831598282, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9399279356002808, "rewards/distinct_2/std": 0.05639173462986946, "rewards/total_composite/mean": 0.16178405284881592, "rewards/total_composite/std": 0.2549450397491455, "reward": 0.16178405284881592, "reward_std": 0.2549450397491455, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15619610249996185, "sampling/sampling_logp_difference/max": 3.191709518432617, "sampling/importance_sampling_ratio/min": 0.12825708091259003, "sampling/importance_sampling_ratio/mean": 1.0248557329177856, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9056680053472519, "clip_ratio/low_mean": 0.08119824156165123, "clip_ratio/low_min": 0.08119824156165123, "clip_ratio/high_mean": 0.04029933363199234, "clip_ratio/high_max": 0.04029933363199234, "clip_ratio/region_mean": 0.12149757519364357, "reward_total_mean": 0.16178405284881592, "reward_meter_mean": 0.22150354087352753, "reward_meter_std": 0.2616729438304901, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9202638864517212, "reward_lexical_plausibility_std": 0.15705610811710358, "reward_repeat_penalty_mean": 0.9221000671386719, "reward_repeat_penalty_std": 0.07147147506475449, "reward_repeat_floor_mean": 0.991619348526001, "reward_repeat_floor_std": 0.007712433114647865, "reward_near_duplicate_penalty_mean": 0.9801720380783081, "reward_near_duplicate_penalty_std": 0.019732806831598282, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9399279356002808, "reward_distinct_2_std": 0.05639173462986946, "reward_judge_quality_mean": 0.6412500143051147, "reward_judge_quality_std": 0.40417245030403137, "reward_total_composite_mean": 0.16178405284881592, "reward_total_composite_std": 0.2549450397491455} {"timestamp_utc": "2026-04-12T19:28:09Z", "mode": "train", "global_step": 934, "epoch": 0.049155307615388666, "loss": 0.0094, "grad_norm": 22.757076263427734, "learning_rate": 7.172727272727273e-06, "num_tokens": 1659744.0, "completions/mean_length": 18.625, "completions/min_length": 16.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.625, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.7352614402770996, "rewards/meter/std": 0.29680031538009644, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8362500667572021, "rewards/judge_quality/std": 0.23688077926635742, "rewards/repeat_penalty/mean": 0.6889147162437439, "rewards/repeat_penalty/std": 0.10295876860618591, "rewards/repeat_floor/mean": 0.9727829694747925, "rewards/repeat_floor/std": 0.020591754466295242, "rewards/near_duplicate_penalty/mean": 0.9185529947280884, "rewards/near_duplicate_penalty/std": 0.13727836310863495, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5794228911399841, "rewards/total_composite/std": 0.287330687046051, "reward": 0.5794228911399841, "reward_std": 0.28733065724372864, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13337747752666473, "sampling/sampling_logp_difference/max": 1.0140495300292969, "sampling/importance_sampling_ratio/min": 0.36274704337120056, "sampling/importance_sampling_ratio/mean": 1.0323998928070068, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0619853287935257, "clip_ratio/low_mean": 0.04961622832342982, "clip_ratio/low_min": 0.04961622832342982, "clip_ratio/high_mean": 0.08143520634621382, "clip_ratio/high_max": 0.08143520634621382, "clip_ratio/region_mean": 0.13105143466964364, "reward_total_mean": 0.5794228911399841, "reward_meter_mean": 0.7352614402770996, "reward_meter_std": 0.29680031538009644, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6889147162437439, "reward_repeat_penalty_std": 0.10295876860618591, "reward_repeat_floor_mean": 0.9727829694747925, "reward_repeat_floor_std": 0.020591754466295242, "reward_near_duplicate_penalty_mean": 0.9185529947280884, "reward_near_duplicate_penalty_std": 0.13727836310863495, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8362500667572021, "reward_judge_quality_std": 0.23688077926635742, "reward_total_composite_mean": 0.5794228911399841, "reward_total_composite_std": 0.287330687046051} {"timestamp_utc": "2026-04-12T19:28:20Z", "mode": "train", "global_step": 935, "epoch": 0.04920793642439872, "loss": 0.0096, "grad_norm": 22.159223556518555, "learning_rate": 7.16969696969697e-06, "num_tokens": 1661219.0, "completions/mean_length": 28.375, "completions/min_length": 25.0, "completions/max_length": 34.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.375, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 34.0, "rewards/meter/mean": 0.6256688833236694, "rewards/meter/std": 0.3753491938114166, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.706250011920929, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.9661613702774048, "rewards/repeat_penalty/std": 0.0639868751168251, "rewards/repeat_floor/mean": 0.995513379573822, "rewards/repeat_floor/std": 0.008002697490155697, "rewards/near_duplicate_penalty/mean": 0.9777815341949463, "rewards/near_duplicate_penalty/std": 0.03342784568667412, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9871795177459717, "rewards/distinct_2/std": 0.03626188635826111, "rewards/total_composite/mean": 0.4539850354194641, "rewards/total_composite/std": 0.3794321119785309, "reward": 0.4539850354194641, "reward_std": 0.3794320821762085, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.126794695854187, "sampling/sampling_logp_difference/max": 1.9264278411865234, "sampling/importance_sampling_ratio/min": 0.14566762745380402, "sampling/importance_sampling_ratio/mean": 1.0171736478805542, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6241744309663773, "clip_ratio/low_mean": 0.0650077536702156, "clip_ratio/low_min": 0.0650077536702156, "clip_ratio/high_mean": 0.04758361866697669, "clip_ratio/high_max": 0.04758361866697669, "clip_ratio/region_mean": 0.1125913723371923, "reward_total_mean": 0.4539850354194641, "reward_meter_mean": 0.6256688833236694, "reward_meter_std": 0.3753491938114166, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9661613702774048, "reward_repeat_penalty_std": 0.0639868751168251, "reward_repeat_floor_mean": 0.995513379573822, "reward_repeat_floor_std": 0.008002697490155697, "reward_near_duplicate_penalty_mean": 0.9777815341949463, "reward_near_duplicate_penalty_std": 0.03342784568667412, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9871795177459717, "reward_distinct_2_std": 0.03626188635826111, "reward_judge_quality_mean": 0.706250011920929, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.4539850354194641, "reward_total_composite_std": 0.3794321119785309} {"timestamp_utc": "2026-04-12T19:28:34Z", "mode": "train", "global_step": 936, "epoch": 0.04926056523340877, "loss": -0.0706, "grad_norm": 2.846550941467285, "learning_rate": 7.166666666666667e-06, "num_tokens": 1662629.0, "completions/mean_length": 158.25, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 40.333335876464844, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.6912367343902588, "rewards/meter/std": 0.3497598171234131, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8528701663017273, "rewards/lexical_plausibility/std": 0.2725129723548889, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.9377641677856445, "rewards/repeat_penalty/std": 0.08006878197193146, "rewards/repeat_floor/mean": 0.9920282363891602, "rewards/repeat_floor/std": 0.009480367414653301, "rewards/near_duplicate_penalty/mean": 0.9638878107070923, "rewards/near_duplicate_penalty/std": 0.03365929797291756, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.971611738204956, "rewards/distinct_2/std": 0.056806087493896484, "rewards/total_composite/mean": 0.1744149923324585, "rewards/total_composite/std": 0.1357843279838562, "reward": 0.1744149923324585, "reward_std": 0.1357843279838562, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1601579189300537, "sampling/sampling_logp_difference/max": 1.1780023574829102, "sampling/importance_sampling_ratio/min": 0.30789318680763245, "sampling/importance_sampling_ratio/mean": 1.0185701847076416, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0627938359975815, "clip_ratio/low_mean": 0.029645269736647606, "clip_ratio/low_min": 0.029645269736647606, "clip_ratio/high_mean": 0.07594627793878317, "clip_ratio/high_max": 0.07594627793878317, "clip_ratio/region_mean": 0.10559154767543077, "reward_total_mean": 0.1744149923324585, "reward_meter_mean": 0.6912367343902588, "reward_meter_std": 0.3497598171234131, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8528701663017273, "reward_lexical_plausibility_std": 0.2725129723548889, "reward_repeat_penalty_mean": 0.9377641677856445, "reward_repeat_penalty_std": 0.08006878197193146, "reward_repeat_floor_mean": 0.9920282363891602, "reward_repeat_floor_std": 0.009480367414653301, "reward_near_duplicate_penalty_mean": 0.9638878107070923, "reward_near_duplicate_penalty_std": 0.03365929797291756, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.971611738204956, "reward_distinct_2_std": 0.056806087493896484, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.1744149923324585, "reward_total_composite_std": 0.1357843279838562} {"timestamp_utc": "2026-04-12T19:28:47Z", "mode": "train", "global_step": 937, "epoch": 0.04931319404241882, "loss": -0.0842, "grad_norm": 4.684035778045654, "learning_rate": 7.163636363636363e-06, "num_tokens": 1664126.0, "completions/mean_length": 97.125, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.85714340209961, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.7876128554344177, "rewards/meter/std": 0.26310455799102783, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.957014799118042, "rewards/lexical_plausibility/std": 0.12158055603504181, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1505940556526184, "rewards/repeat_penalty/mean": 0.8698775768280029, "rewards/repeat_penalty/std": 0.17616939544677734, "rewards/repeat_floor/mean": 0.9855564832687378, "rewards/repeat_floor/std": 0.01942961849272251, "rewards/near_duplicate_penalty/mean": 0.9460172057151794, "rewards/near_duplicate_penalty/std": 0.06474689394235611, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9711538553237915, "rewards/distinct_2/std": 0.0815892368555069, "rewards/total_composite/mean": 0.23081491887569427, "rewards/total_composite/std": 0.13306322693824768, "reward": 0.23081491887569427, "reward_std": 0.13306322693824768, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1624113917350769, "sampling/sampling_logp_difference/max": 1.279693365097046, "sampling/importance_sampling_ratio/min": 0.27812254428863525, "sampling/importance_sampling_ratio/mean": 1.0237486362457275, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0300191193819046, "clip_ratio/low_mean": 0.04493092838674784, "clip_ratio/low_min": 0.04493092838674784, "clip_ratio/high_mean": 0.08559286501258612, "clip_ratio/high_max": 0.08559286501258612, "clip_ratio/region_mean": 0.13052379339933395, "reward_total_mean": 0.23081491887569427, "reward_meter_mean": 0.7876128554344177, "reward_meter_std": 0.26310455799102783, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.957014799118042, "reward_lexical_plausibility_std": 0.12158055603504181, "reward_repeat_penalty_mean": 0.8698775768280029, "reward_repeat_penalty_std": 0.17616939544677734, "reward_repeat_floor_mean": 0.9855564832687378, "reward_repeat_floor_std": 0.01942961849272251, "reward_near_duplicate_penalty_mean": 0.9460172057151794, "reward_near_duplicate_penalty_std": 0.06474689394235611, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9711538553237915, "reward_distinct_2_std": 0.0815892368555069, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1505940556526184, "reward_total_composite_mean": 0.23081491887569427, "reward_total_composite_std": 0.13306322693824768} {"timestamp_utc": "2026-04-12T19:29:01Z", "mode": "train", "global_step": 938, "epoch": 0.049365822851428875, "loss": -0.0571, "grad_norm": 2.6473395824432373, "learning_rate": 7.1606060606060615e-06, "num_tokens": 1665748.0, "completions/mean_length": 154.75, "completions/min_length": 26.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 35.66666793823242, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.3612874150276184, "rewards/meter/std": 0.39760667085647583, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.907730221748352, "rewards/lexical_plausibility/std": 0.1780407875776291, "rewards/judge_quality/mean": 0.4300000071525574, "rewards/judge_quality/std": 0.335644394159317, "rewards/repeat_penalty/mean": 0.8570314645767212, "rewards/repeat_penalty/std": 0.13955850899219513, "rewards/repeat_floor/mean": 0.9853149652481079, "rewards/repeat_floor/std": 0.013978006318211555, "rewards/near_duplicate_penalty/mean": 0.950524091720581, "rewards/near_duplicate_penalty/std": 0.06395603716373444, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9609594345092773, "rewards/distinct_2/std": 0.0558197945356369, "rewards/total_composite/mean": 0.13955768942832947, "rewards/total_composite/std": 0.13091062009334564, "reward": 0.13955768942832947, "reward_std": 0.13091060519218445, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1684911847114563, "sampling/sampling_logp_difference/max": 2.065189838409424, "sampling/importance_sampling_ratio/min": 0.1267942190170288, "sampling/importance_sampling_ratio/mean": 1.0257047414779663, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6408987268805504, "clip_ratio/low_mean": 0.0464743603952229, "clip_ratio/low_min": 0.0464743603952229, "clip_ratio/high_mean": 0.05412051361054182, "clip_ratio/high_max": 0.05412051361054182, "clip_ratio/region_mean": 0.10059487400576472, "reward_total_mean": 0.13955768942832947, "reward_meter_mean": 0.3612874150276184, "reward_meter_std": 0.39760667085647583, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.907730221748352, "reward_lexical_plausibility_std": 0.1780407875776291, "reward_repeat_penalty_mean": 0.8570314645767212, "reward_repeat_penalty_std": 0.13955850899219513, "reward_repeat_floor_mean": 0.9853149652481079, "reward_repeat_floor_std": 0.013978006318211555, "reward_near_duplicate_penalty_mean": 0.950524091720581, "reward_near_duplicate_penalty_std": 0.06395603716373444, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9609594345092773, "reward_distinct_2_std": 0.0558197945356369, "reward_judge_quality_mean": 0.4300000071525574, "reward_judge_quality_std": 0.335644394159317, "reward_total_composite_mean": 0.13955768942832947, "reward_total_composite_std": 0.13091062009334564} {"timestamp_utc": "2026-04-12T19:29:15Z", "mode": "train", "global_step": 939, "epoch": 0.04941845166043892, "loss": -0.0472, "grad_norm": 4.579878330230713, "learning_rate": 7.157575757575758e-06, "num_tokens": 1667290.0, "completions/mean_length": 95.75, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 36.28571701049805, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.5754709243774414, "rewards/meter/std": 0.35846441984176636, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9475219249725342, "rewards/lexical_plausibility/std": 0.14843030273914337, "rewards/judge_quality/mean": 0.6262500286102295, "rewards/judge_quality/std": 0.3452095687389374, "rewards/repeat_penalty/mean": 0.6471267342567444, "rewards/repeat_penalty/std": 0.17849737405776978, "rewards/repeat_floor/mean": 0.963615894317627, "rewards/repeat_floor/std": 0.021028872579336166, "rewards/near_duplicate_penalty/mean": 0.9201711416244507, "rewards/near_duplicate_penalty/std": 0.04978715255856514, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8537800908088684, "rewards/distinct_2/std": 0.11982870101928711, "rewards/total_composite/mean": 0.38300296664237976, "rewards/total_composite/std": 0.3078805208206177, "reward": 0.38300296664237976, "reward_std": 0.3078805208206177, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1256883144378662, "sampling/sampling_logp_difference/max": 0.9241501092910767, "sampling/importance_sampling_ratio/min": 0.39686858654022217, "sampling/importance_sampling_ratio/mean": 1.0176739692687988, "sampling/importance_sampling_ratio/max": 1.9200845956802368, "entropy": 0.6841282397508621, "clip_ratio/low_mean": 0.02996472967788577, "clip_ratio/low_min": 0.02996472967788577, "clip_ratio/high_mean": 0.06550312554463744, "clip_ratio/high_max": 0.06550312554463744, "clip_ratio/region_mean": 0.09546785522252321, "reward_total_mean": 0.38300296664237976, "reward_meter_mean": 0.5754709243774414, "reward_meter_std": 0.35846441984176636, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9475219249725342, "reward_lexical_plausibility_std": 0.14843030273914337, "reward_repeat_penalty_mean": 0.6471267342567444, "reward_repeat_penalty_std": 0.17849737405776978, "reward_repeat_floor_mean": 0.963615894317627, "reward_repeat_floor_std": 0.021028872579336166, "reward_near_duplicate_penalty_mean": 0.9201711416244507, "reward_near_duplicate_penalty_std": 0.04978715255856514, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8537800908088684, "reward_distinct_2_std": 0.11982870101928711, "reward_judge_quality_mean": 0.6262500286102295, "reward_judge_quality_std": 0.3452095687389374, "reward_total_composite_mean": 0.38300296664237976, "reward_total_composite_std": 0.3078805208206177} {"timestamp_utc": "2026-04-12T19:29:29Z", "mode": "train", "global_step": 940, "epoch": 0.04947108046944897, "loss": -0.0455, "grad_norm": 2.4794535636901855, "learning_rate": 7.154545454545455e-06, "num_tokens": 1668995.0, "completions/mean_length": 225.125, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 53.0, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.8009392023086548, "rewards/meter/std": 0.34026679396629333, "rewards/count_adherence/mean": 0.6666666865348816, "rewards/count_adherence/std": 0.30860671401023865, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8999999761581421, "rewards/count_floor/std": 0.09258200228214264, "rewards/lexical_plausibility/mean": 0.853161096572876, "rewards/lexical_plausibility/std": 0.20306220650672913, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.7446501851081848, "rewards/repeat_penalty/std": 0.29569900035858154, "rewards/repeat_floor/mean": 0.970337986946106, "rewards/repeat_floor/std": 0.04130903631448746, "rewards/near_duplicate_penalty/mean": 0.9298611879348755, "rewards/near_duplicate_penalty/std": 0.09926348179578781, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.155838742852211, "rewards/distinct_2/mean": 0.8706530928611755, "rewards/distinct_2/std": 0.21183568239212036, "rewards/total_composite/mean": 0.13488975167274475, "rewards/total_composite/std": 0.12976008653640747, "reward": 0.13488975167274475, "reward_std": 0.12976008653640747, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1553594022989273, "sampling/sampling_logp_difference/max": 2.8208189010620117, "sampling/importance_sampling_ratio/min": 0.059557151049375534, "sampling/importance_sampling_ratio/mean": 1.025700330734253, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7399625405669212, "clip_ratio/low_mean": 0.045493897050619125, "clip_ratio/low_min": 0.045493897050619125, "clip_ratio/high_mean": 0.02914167894050479, "clip_ratio/high_max": 0.02914167894050479, "clip_ratio/region_mean": 0.07463557599112391, "reward_total_mean": 0.13488975167274475, "reward_meter_mean": 0.8009392023086548, "reward_meter_std": 0.34026679396629333, "reward_count_adherence_mean": 0.6666666865348816, "reward_count_adherence_std": 0.30860671401023865, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8999999761581421, "reward_count_floor_std": 0.09258200228214264, "reward_lexical_plausibility_mean": 0.853161096572876, "reward_lexical_plausibility_std": 0.20306220650672913, "reward_repeat_penalty_mean": 0.7446501851081848, "reward_repeat_penalty_std": 0.29569900035858154, "reward_repeat_floor_mean": 0.970337986946106, "reward_repeat_floor_std": 0.04130903631448746, "reward_near_duplicate_penalty_mean": 0.9298611879348755, "reward_near_duplicate_penalty_std": 0.09926348179578781, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.155838742852211, "reward_distinct_2_mean": 0.8706530928611755, "reward_distinct_2_std": 0.21183568239212036, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.13488975167274475, "reward_total_composite_std": 0.12976008653640747} {"timestamp_utc": "2026-04-12T19:29:44Z", "mode": "train", "global_step": 941, "epoch": 0.049523709278459026, "loss": -0.0797, "grad_norm": 1.528396725654602, "learning_rate": 7.151515151515152e-06, "num_tokens": 1670416.0, "completions/mean_length": 280.625, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 49.25, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.6363770961761475, "rewards/meter/std": 0.35401707887649536, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.05175493285059929, "rewards/lexical_plausibility/mean": 0.780329704284668, "rewards/lexical_plausibility/std": 0.23699282109737396, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.21380899846553802, "rewards/repeat_penalty/mean": 0.901418924331665, "rewards/repeat_penalty/std": 0.12053182721138, "rewards/repeat_floor/mean": 0.988824188709259, "rewards/repeat_floor/std": 0.013290772214531898, "rewards/near_duplicate_penalty/mean": 0.965886652469635, "rewards/near_duplicate_penalty/std": 0.03909238800406456, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.941012978553772, "rewards/distinct_2/std": 0.07635874301195145, "rewards/total_composite/mean": 0.195618137717247, "rewards/total_composite/std": 0.19238482415676117, "reward": 0.195618137717247, "reward_std": 0.19238482415676117, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13922935724258423, "sampling/sampling_logp_difference/max": 1.459977149963379, "sampling/importance_sampling_ratio/min": 0.23224158585071564, "sampling/importance_sampling_ratio/mean": 1.022443413734436, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5502031892538071, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.08355611423030496, "clip_ratio/high_max": 0.08355611423030496, "clip_ratio/region_mean": 0.08355611423030496, "reward_total_mean": 0.195618137717247, "reward_meter_mean": 0.6363770961761475, "reward_meter_std": 0.35401707887649536, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.05175493285059929, "reward_lexical_plausibility_mean": 0.780329704284668, "reward_lexical_plausibility_std": 0.23699282109737396, "reward_repeat_penalty_mean": 0.901418924331665, "reward_repeat_penalty_std": 0.12053182721138, "reward_repeat_floor_mean": 0.988824188709259, "reward_repeat_floor_std": 0.013290772214531898, "reward_near_duplicate_penalty_mean": 0.965886652469635, "reward_near_duplicate_penalty_std": 0.03909238800406456, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.941012978553772, "reward_distinct_2_std": 0.07635874301195145, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.21380899846553802, "reward_total_composite_mean": 0.195618137717247, "reward_total_composite_std": 0.19238482415676117} {"timestamp_utc": "2026-04-12T19:29:59Z", "mode": "train", "global_step": 942, "epoch": 0.04957633808746908, "loss": -0.06, "grad_norm": 4.63368558883667, "learning_rate": 7.148484848484849e-06, "num_tokens": 1672114.0, "completions/mean_length": 173.25, "completions/min_length": 57.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 60.333335876464844, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.5495532751083374, "rewards/meter/std": 0.3860201835632324, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 0.8999386429786682, "rewards/lexical_plausibility/std": 0.18630100786685944, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.8315969109535217, "rewards/repeat_penalty/std": 0.1564721018075943, "rewards/repeat_floor/mean": 0.9792554974555969, "rewards/repeat_floor/std": 0.019118284806609154, "rewards/near_duplicate_penalty/mean": 0.926944375038147, "rewards/near_duplicate_penalty/std": 0.05962273105978966, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8912646770477295, "rewards/distinct_2/std": 0.12045878916978836, "rewards/total_composite/mean": 0.10068076848983765, "rewards/total_composite/std": 0.09677880257368088, "reward": 0.10068076848983765, "reward_std": 0.09677879512310028, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16810256242752075, "sampling/sampling_logp_difference/max": 2.708258628845215, "sampling/importance_sampling_ratio/min": 0.06665277481079102, "sampling/importance_sampling_ratio/mean": 1.0213956832885742, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7796542420983315, "clip_ratio/low_mean": 0.06385566294193268, "clip_ratio/low_min": 0.06385566294193268, "clip_ratio/high_mean": 0.037737186066806316, "clip_ratio/high_max": 0.037737186066806316, "clip_ratio/region_mean": 0.101592849008739, "reward_total_mean": 0.10068076848983765, "reward_meter_mean": 0.5495532751083374, "reward_meter_std": 0.3860201835632324, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 0.8999386429786682, "reward_lexical_plausibility_std": 0.18630100786685944, "reward_repeat_penalty_mean": 0.8315969109535217, "reward_repeat_penalty_std": 0.1564721018075943, "reward_repeat_floor_mean": 0.9792554974555969, "reward_repeat_floor_std": 0.019118284806609154, "reward_near_duplicate_penalty_mean": 0.926944375038147, "reward_near_duplicate_penalty_std": 0.05962273105978966, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8912646770477295, "reward_distinct_2_std": 0.12045878916978836, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.10068076848983765, "reward_total_composite_std": 0.09677880257368088} {"timestamp_utc": "2026-04-12T19:30:14Z", "mode": "train", "global_step": 943, "epoch": 0.04962896689647913, "loss": -0.0734, "grad_norm": 1.6541037559509277, "learning_rate": 7.145454545454547e-06, "num_tokens": 1673680.0, "completions/mean_length": 219.75, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 44.400001525878906, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.5324200391769409, "rewards/meter/std": 0.34049493074417114, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8362206816673279, "rewards/lexical_plausibility/std": 0.23431777954101562, "rewards/judge_quality/mean": 0.21875, "rewards/judge_quality/std": 0.17512750625610352, "rewards/repeat_penalty/mean": 0.8054771423339844, "rewards/repeat_penalty/std": 0.16741535067558289, "rewards/repeat_floor/mean": 0.9801266193389893, "rewards/repeat_floor/std": 0.019427379593253136, "rewards/near_duplicate_penalty/mean": 0.9438799619674683, "rewards/near_duplicate_penalty/std": 0.0614447183907032, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9352185726165771, "rewards/distinct_2/std": 0.09087558090686798, "rewards/total_composite/mean": 0.14134326577186584, "rewards/total_composite/std": 0.13784575462341309, "reward": 0.14134326577186584, "reward_std": 0.13784575462341309, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16657239198684692, "sampling/sampling_logp_difference/max": 1.5688648223876953, "sampling/importance_sampling_ratio/min": 0.2082814872264862, "sampling/importance_sampling_ratio/mean": 1.0320324897766113, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8716687113046646, "clip_ratio/low_mean": 0.02445652149617672, "clip_ratio/low_min": 0.02445652149617672, "clip_ratio/high_mean": 0.07158573903143406, "clip_ratio/high_max": 0.07158573903143406, "clip_ratio/region_mean": 0.09604226052761078, "reward_total_mean": 0.14134326577186584, "reward_meter_mean": 0.5324200391769409, "reward_meter_std": 0.34049493074417114, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8362206816673279, "reward_lexical_plausibility_std": 0.23431777954101562, "reward_repeat_penalty_mean": 0.8054771423339844, "reward_repeat_penalty_std": 0.16741535067558289, "reward_repeat_floor_mean": 0.9801266193389893, "reward_repeat_floor_std": 0.019427379593253136, "reward_near_duplicate_penalty_mean": 0.9438799619674683, "reward_near_duplicate_penalty_std": 0.0614447183907032, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9352185726165771, "reward_distinct_2_std": 0.09087558090686798, "reward_judge_quality_mean": 0.21875, "reward_judge_quality_std": 0.17512750625610352, "reward_total_composite_mean": 0.14134326577186584, "reward_total_composite_std": 0.13784575462341309} {"timestamp_utc": "2026-04-12T19:30:23Z", "mode": "train", "global_step": 944, "epoch": 0.04968159570548918, "loss": 0.0123, "grad_norm": 15.0864896774292, "learning_rate": 7.142424242424243e-06, "num_tokens": 1675394.0, "completions/mean_length": 26.25, "completions/min_length": 24.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.25, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.47471821308135986, "rewards/meter/std": 0.3976638913154602, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.5175000429153442, "rewards/judge_quality/std": 0.2988907992839813, "rewards/repeat_penalty/mean": 0.745326578617096, "rewards/repeat_penalty/std": 0.1761200875043869, "rewards/repeat_floor/mean": 0.9686992168426514, "rewards/repeat_floor/std": 0.022518165409564972, "rewards/near_duplicate_penalty/mean": 0.8890085220336914, "rewards/near_duplicate_penalty/std": 0.06082123890519142, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8788655400276184, "rewards/distinct_2/std": 0.09237746149301529, "rewards/total_composite/mean": 0.24461592733860016, "rewards/total_composite/std": 0.2185964286327362, "reward": 0.24461592733860016, "reward_std": 0.218596413731575, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1147134006023407, "sampling/sampling_logp_difference/max": 1.083981990814209, "sampling/importance_sampling_ratio/min": 0.3382459282875061, "sampling/importance_sampling_ratio/mean": 1.0304076671600342, "sampling/importance_sampling_ratio/max": 1.9772380590438843, "entropy": 0.6096719056367874, "clip_ratio/low_mean": 0.04892857093364, "clip_ratio/low_min": 0.04892857093364, "clip_ratio/high_mean": 0.05568356392905116, "clip_ratio/high_max": 0.05568356392905116, "clip_ratio/region_mean": 0.10461213486269116, "reward_total_mean": 0.24461592733860016, "reward_meter_mean": 0.47471821308135986, "reward_meter_std": 0.3976638913154602, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.745326578617096, "reward_repeat_penalty_std": 0.1761200875043869, "reward_repeat_floor_mean": 0.9686992168426514, "reward_repeat_floor_std": 0.022518165409564972, "reward_near_duplicate_penalty_mean": 0.8890085220336914, "reward_near_duplicate_penalty_std": 0.06082123890519142, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8788655400276184, "reward_distinct_2_std": 0.09237746149301529, "reward_judge_quality_mean": 0.5175000429153442, "reward_judge_quality_std": 0.2988907992839813, "reward_total_composite_mean": 0.24461592733860016, "reward_total_composite_std": 0.2185964286327362} {"timestamp_utc": "2026-04-12T19:30:33Z", "mode": "train", "global_step": 945, "epoch": 0.049734224514499235, "loss": 0.0621, "grad_norm": 12.124125480651855, "learning_rate": 7.1393939393939405e-06, "num_tokens": 1677534.0, "completions/mean_length": 86.5, "completions/min_length": 80.0, "completions/max_length": 103.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 86.5, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 103.0, "rewards/meter/mean": 0.7432481646537781, "rewards/meter/std": 0.28944098949432373, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.74357008934021, "rewards/repeat_penalty/std": 0.17146047949790955, "rewards/repeat_floor/mean": 0.9709051251411438, "rewards/repeat_floor/std": 0.01959552988409996, "rewards/near_duplicate_penalty/mean": 0.9234217405319214, "rewards/near_duplicate_penalty/std": 0.04708775505423546, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.804354190826416, "rewards/distinct_2/std": 0.14099173247814178, "rewards/total_composite/mean": 0.29450181126594543, "rewards/total_composite/std": 0.1559145450592041, "reward": 0.29450181126594543, "reward_std": 0.1559145450592041, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1454910784959793, "sampling/sampling_logp_difference/max": 2.71665358543396, "sampling/importance_sampling_ratio/min": 0.06609556823968887, "sampling/importance_sampling_ratio/mean": 1.0035830736160278, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6880360022187233, "clip_ratio/low_mean": 0.03264713007956743, "clip_ratio/low_min": 0.03264713007956743, "clip_ratio/high_mean": 0.08935249224305153, "clip_ratio/high_max": 0.08935249224305153, "clip_ratio/region_mean": 0.12199962232261896, "reward_total_mean": 0.29450181126594543, "reward_meter_mean": 0.7432481646537781, "reward_meter_std": 0.28944098949432373, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.74357008934021, "reward_repeat_penalty_std": 0.17146047949790955, "reward_repeat_floor_mean": 0.9709051251411438, "reward_repeat_floor_std": 0.01959552988409996, "reward_near_duplicate_penalty_mean": 0.9234217405319214, "reward_near_duplicate_penalty_std": 0.04708775505423546, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.804354190826416, "reward_distinct_2_std": 0.14099173247814178, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.29450181126594543, "reward_total_composite_std": 0.1559145450592041} {"timestamp_utc": "2026-04-12T19:30:42Z", "mode": "train", "global_step": 946, "epoch": 0.04978685332350929, "loss": -0.0179, "grad_norm": 10.980562210083008, "learning_rate": 7.136363636363637e-06, "num_tokens": 1679246.0, "completions/mean_length": 39.0, "completions/min_length": 23.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.0, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.776240885257721, "rewards/meter/std": 0.33104467391967773, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41750001907348633, "rewards/judge_quality/std": 0.3366537094116211, "rewards/repeat_penalty/mean": 0.7612777948379517, "rewards/repeat_penalty/std": 0.19857537746429443, "rewards/repeat_floor/mean": 0.9745221138000488, "rewards/repeat_floor/std": 0.022732319310307503, "rewards/near_duplicate_penalty/mean": 0.941365659236908, "rewards/near_duplicate_penalty/std": 0.05276405066251755, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8563030958175659, "rewards/distinct_2/std": 0.16082361340522766, "rewards/total_composite/mean": 0.2662997841835022, "rewards/total_composite/std": 0.25945690274238586, "reward": 0.2662997841835022, "reward_std": 0.25945690274238586, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14707358181476593, "sampling/sampling_logp_difference/max": 2.3706791400909424, "sampling/importance_sampling_ratio/min": 0.09341725707054138, "sampling/importance_sampling_ratio/mean": 1.0250524282455444, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9912973940372467, "clip_ratio/low_mean": 0.11727049294859171, "clip_ratio/low_min": 0.11727049294859171, "clip_ratio/high_mean": 0.0397529061883688, "clip_ratio/high_max": 0.0397529061883688, "clip_ratio/region_mean": 0.1570233991369605, "reward_total_mean": 0.2662997841835022, "reward_meter_mean": 0.776240885257721, "reward_meter_std": 0.33104467391967773, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7612777948379517, "reward_repeat_penalty_std": 0.19857537746429443, "reward_repeat_floor_mean": 0.9745221138000488, "reward_repeat_floor_std": 0.022732319310307503, "reward_near_duplicate_penalty_mean": 0.941365659236908, "reward_near_duplicate_penalty_std": 0.05276405066251755, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8563030958175659, "reward_distinct_2_std": 0.16082361340522766, "reward_judge_quality_mean": 0.41750001907348633, "reward_judge_quality_std": 0.3366537094116211, "reward_total_composite_mean": 0.2662997841835022, "reward_total_composite_std": 0.25945690274238586} {"timestamp_utc": "2026-04-12T19:30:52Z", "mode": "train", "global_step": 947, "epoch": 0.04983948213251934, "loss": 0.0416, "grad_norm": 11.462865829467773, "learning_rate": 7.133333333333334e-06, "num_tokens": 1680896.0, "completions/mean_length": 40.25, "completions/min_length": 36.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.25, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.524586021900177, "rewards/meter/std": 0.4112315773963928, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.8523638248443604, "rewards/repeat_penalty/std": 0.1372341513633728, "rewards/repeat_floor/mean": 0.9850330352783203, "rewards/repeat_floor/std": 0.012364797294139862, "rewards/near_duplicate_penalty/mean": 0.956728458404541, "rewards/near_duplicate_penalty/std": 0.03769984096288681, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9474858045578003, "rewards/distinct_2/std": 0.0465642586350441, "rewards/total_composite/mean": 0.18610750138759613, "rewards/total_composite/std": 0.18198786675930023, "reward": 0.18610750138759613, "reward_std": 0.18198786675930023, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18754582107067108, "sampling/sampling_logp_difference/max": 1.3779113292694092, "sampling/importance_sampling_ratio/min": 0.25210458040237427, "sampling/importance_sampling_ratio/mean": 1.0283889770507812, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3841508403420448, "clip_ratio/low_mean": 0.12969746626913548, "clip_ratio/low_min": 0.12969746626913548, "clip_ratio/high_mean": 0.07959495019167662, "clip_ratio/high_max": 0.07959495019167662, "clip_ratio/region_mean": 0.2092924164608121, "reward_total_mean": 0.18610750138759613, "reward_meter_mean": 0.524586021900177, "reward_meter_std": 0.4112315773963928, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.8523638248443604, "reward_repeat_penalty_std": 0.1372341513633728, "reward_repeat_floor_mean": 0.9850330352783203, "reward_repeat_floor_std": 0.012364797294139862, "reward_near_duplicate_penalty_mean": 0.956728458404541, "reward_near_duplicate_penalty_std": 0.03769984096288681, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9474858045578003, "reward_distinct_2_std": 0.0465642586350441, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.18610750138759613, "reward_total_composite_std": 0.18198786675930023} {"timestamp_utc": "2026-04-12T19:31:03Z", "mode": "train", "global_step": 948, "epoch": 0.04989211094152939, "loss": 0.0791, "grad_norm": 10.601950645446777, "learning_rate": 7.130303030303031e-06, "num_tokens": 1683210.0, "completions/mean_length": 103.25, "completions/min_length": 90.0, "completions/max_length": 125.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 103.25, "completions/min_terminated_length": 90.0, "completions/max_terminated_length": 125.0, "rewards/meter/mean": 0.730411171913147, "rewards/meter/std": 0.15826690196990967, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.06681530922651291, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.020044606178998947, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.5941283702850342, "rewards/repeat_penalty/std": 0.14179567992687225, "rewards/repeat_floor/mean": 0.9539738297462463, "rewards/repeat_floor/std": 0.01815166510641575, "rewards/near_duplicate_penalty/mean": 0.8893653154373169, "rewards/near_duplicate_penalty/std": 0.05428140237927437, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.6781972646713257, "rewards/distinct_2/std": 0.1103530302643776, "rewards/total_composite/mean": 0.22807839512825012, "rewards/total_composite/std": 0.11001968383789062, "reward": 0.22807839512825012, "reward_std": 0.11001968383789062, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14287881553173065, "sampling/sampling_logp_difference/max": 2.320979118347168, "sampling/importance_sampling_ratio/min": 0.09817741066217422, "sampling/importance_sampling_ratio/mean": 1.0042535066604614, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.743267148733139, "clip_ratio/low_mean": 0.06109267380088568, "clip_ratio/low_min": 0.06109267380088568, "clip_ratio/high_mean": 0.06792892795056105, "clip_ratio/high_max": 0.06792892795056105, "clip_ratio/region_mean": 0.12902160175144672, "reward_total_mean": 0.22807839512825012, "reward_meter_mean": 0.730411171913147, "reward_meter_std": 0.15826690196990967, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.06681530922651291, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.020044606178998947, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5941283702850342, "reward_repeat_penalty_std": 0.14179567992687225, "reward_repeat_floor_mean": 0.9539738297462463, "reward_repeat_floor_std": 0.01815166510641575, "reward_near_duplicate_penalty_mean": 0.8893653154373169, "reward_near_duplicate_penalty_std": 0.05428140237927437, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.6781972646713257, "reward_distinct_2_std": 0.1103530302643776, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.22807839512825012, "reward_total_composite_std": 0.11001968383789062} {"timestamp_utc": "2026-04-12T19:31:17Z", "mode": "train", "global_step": 949, "epoch": 0.049944739750539445, "loss": -0.0433, "grad_norm": 2.3729870319366455, "learning_rate": 7.127272727272728e-06, "num_tokens": 1684658.0, "completions/mean_length": 214.0, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 35.20000076293945, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.4223981499671936, "rewards/meter/std": 0.3667108416557312, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8473978042602539, "rewards/lexical_plausibility/std": 0.21464623510837555, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.21876277029514313, "rewards/repeat_penalty/mean": 0.7196487784385681, "rewards/repeat_penalty/std": 0.26018139719963074, "rewards/repeat_floor/mean": 0.9653791189193726, "rewards/repeat_floor/std": 0.035732757300138474, "rewards/near_duplicate_penalty/mean": 0.8930052518844604, "rewards/near_duplicate_penalty/std": 0.10914258658885956, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8561482429504395, "rewards/distinct_2/std": 0.16621184349060059, "rewards/total_composite/mean": 0.1590559184551239, "rewards/total_composite/std": 0.21661260724067688, "reward": 0.1590559184551239, "reward_std": 0.21661259233951569, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11724242568016052, "sampling/sampling_logp_difference/max": 1.46563720703125, "sampling/importance_sampling_ratio/min": 0.23093080520629883, "sampling/importance_sampling_ratio/mean": 1.0067551136016846, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.46586231887340546, "clip_ratio/low_mean": 0.02888655522838235, "clip_ratio/low_min": 0.02888655522838235, "clip_ratio/high_mean": 0.027413126546889544, "clip_ratio/high_max": 0.027413126546889544, "clip_ratio/region_mean": 0.05629968177527189, "reward_total_mean": 0.1590559184551239, "reward_meter_mean": 0.4223981499671936, "reward_meter_std": 0.3667108416557312, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8473978042602539, "reward_lexical_plausibility_std": 0.21464623510837555, "reward_repeat_penalty_mean": 0.7196487784385681, "reward_repeat_penalty_std": 0.26018139719963074, "reward_repeat_floor_mean": 0.9653791189193726, "reward_repeat_floor_std": 0.035732757300138474, "reward_near_duplicate_penalty_mean": 0.8930052518844604, "reward_near_duplicate_penalty_std": 0.10914258658885956, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8561482429504395, "reward_distinct_2_std": 0.16621184349060059, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.21876277029514313, "reward_total_composite_mean": 0.1590559184551239, "reward_total_composite_std": 0.21661260724067688} {"timestamp_utc": "2026-04-12T19:31:25Z", "mode": "train", "global_step": 950, "epoch": 0.0499973685595495, "loss": 0.0298, "grad_norm": 14.033048629760742, "learning_rate": 7.124242424242424e-06, "num_tokens": 1686225.0, "completions/mean_length": 39.875, "completions/min_length": 36.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.875, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.5826082825660706, "rewards/meter/std": 0.3956049382686615, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5549999475479126, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.755547285079956, "rewards/repeat_penalty/std": 0.20465554296970367, "rewards/repeat_floor/mean": 0.9698851108551025, "rewards/repeat_floor/std": 0.027316758409142494, "rewards/near_duplicate_penalty/mean": 0.8884701132774353, "rewards/near_duplicate_penalty/std": 0.1049058735370636, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8929404020309448, "rewards/distinct_2/std": 0.1175127923488617, "rewards/total_composite/mean": 0.34095045924186707, "rewards/total_composite/std": 0.30790162086486816, "reward": 0.34095045924186707, "reward_std": 0.30790165066719055, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12967446446418762, "sampling/sampling_logp_difference/max": 1.8172540664672852, "sampling/importance_sampling_ratio/min": 0.16247127950191498, "sampling/importance_sampling_ratio/mean": 1.0189299583435059, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8970945179462433, "clip_ratio/low_mean": 0.072966150008142, "clip_ratio/low_min": 0.072966150008142, "clip_ratio/high_mean": 0.05367823038250208, "clip_ratio/high_max": 0.05367823038250208, "clip_ratio/region_mean": 0.12664438039064407, "reward_total_mean": 0.34095045924186707, "reward_meter_mean": 0.5826082825660706, "reward_meter_std": 0.3956049382686615, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.755547285079956, "reward_repeat_penalty_std": 0.20465554296970367, "reward_repeat_floor_mean": 0.9698851108551025, "reward_repeat_floor_std": 0.027316758409142494, "reward_near_duplicate_penalty_mean": 0.8884701132774353, "reward_near_duplicate_penalty_std": 0.1049058735370636, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8929404020309448, "reward_distinct_2_std": 0.1175127923488617, "reward_judge_quality_mean": 0.5549999475479126, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.34095045924186707, "reward_total_composite_std": 0.30790162086486816} {"timestamp_utc": "2026-04-12T19:33:45Z", "mode": "eval", "global_step": 950, "epoch": 0.0499973685595495, "eval_loss": NaN, "eval_runtime": 140.2932, "eval_samples_per_second": 0.741, "eval_steps_per_second": 0.093, "eval_num_tokens": 1686225.0, "eval_completions/mean_length": 142.03846153846155, "eval_completions/min_length": 28.307692307692307, "eval_completions/max_length": 409.84615384615387, "eval_completions/clipped_ratio": 0.09615384615384616, "eval_completions/mean_terminated_length": 102.19551555926984, "eval_completions/min_terminated_length": 28.307692307692307, "eval_completions/max_terminated_length": 221.69230769230768, "eval_rewards/meter/mean": 0.5910043991529025, "eval_rewards/meter/std": 0.38212204667238087, "eval_rewards/count_adherence/mean": 0.7742666693834158, "eval_rewards/count_adherence/std": 0.22555504796596673, "eval_rewards/arabic_clean/mean": 0.8846153846153846, "eval_rewards/arabic_clean/std": 0.2657948434352875, "eval_rewards/hard_gate/mean": 0.9903846153846154, "eval_rewards/hard_gate/std": 0.027196414195574246, "eval_rewards/arabic_floor/mean": 0.9985576913906977, "eval_rewards/arabic_floor/std": 0.004079461670838869, "eval_rewards/count_floor/mean": 0.9322800040245056, "eval_rewards/count_floor/std": 0.0676665109797166, "eval_rewards/lexical_plausibility/mean": 0.9623410380803622, "eval_rewards/lexical_plausibility/std": 0.08675260125444485, "eval_rewards/judge_quality/mean": 0.27961538388178897, "eval_rewards/judge_quality/std": 0.16308964559665093, "eval_rewards/repeat_penalty/mean": 0.5226171566889837, "eval_rewards/repeat_penalty/std": 0.320600233398951, "eval_rewards/repeat_floor/mean": 0.9376098742851844, "eval_rewards/repeat_floor/std": 0.05426772254017683, "eval_rewards/near_duplicate_penalty/mean": 0.8426430317071768, "eval_rewards/near_duplicate_penalty/std": 0.15295882179186895, "eval_rewards/opening_diversity/mean": 0.9035141651447003, "eval_rewards/opening_diversity/std": 0.1447479403935946, "eval_rewards/distinct_2/mean": 0.6333618897658128, "eval_rewards/distinct_2/std": 0.340181895173513, "eval_rewards/total_composite/mean": 0.14772453502966806, "eval_rewards/total_composite/std": 0.1381625120456402, "eval_reward": 0.14772453502966806, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.06588262348220898, "eval_sampling/sampling_logp_difference/max": 1.0992378821739783, "eval_sampling/importance_sampling_ratio/min": 0.340822676053414, "eval_sampling/importance_sampling_ratio/mean": 1.015147511775677, "eval_sampling/importance_sampling_ratio/max": 1.544888395529527, "eval_entropy": 0.6938141309298002, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.14772453502966806, "eval_reward_meter_mean": 0.5910043991529025, "eval_reward_meter_std": 0.38212204667238087, "eval_reward_count_adherence_mean": 0.7742666693834158, "eval_reward_count_adherence_std": 0.22555504796596673, "eval_reward_arabic_clean_mean": 0.8846153846153846, "eval_reward_arabic_clean_std": 0.2657948434352875, "eval_reward_hard_gate_mean": 0.9903846153846154, "eval_reward_hard_gate_std": 0.027196414195574246, "eval_reward_arabic_floor_mean": 0.9985576913906977, "eval_reward_arabic_floor_std": 0.004079461670838869, "eval_reward_count_floor_mean": 0.9322800040245056, "eval_reward_count_floor_std": 0.0676665109797166, "eval_reward_lexical_plausibility_mean": 0.9623410380803622, "eval_reward_lexical_plausibility_std": 0.08675260125444485, "eval_reward_repeat_penalty_mean": 0.5226171566889837, "eval_reward_repeat_penalty_std": 0.320600233398951, "eval_reward_repeat_floor_mean": 0.9376098742851844, "eval_reward_repeat_floor_std": 0.05426772254017683, "eval_reward_near_duplicate_penalty_mean": 0.8426430317071768, "eval_reward_near_duplicate_penalty_std": 0.15295882179186895, "eval_reward_opening_diversity_mean": 0.9035141651447003, "eval_reward_opening_diversity_std": 0.1447479403935946, "eval_reward_distinct_2_mean": 0.6333618897658128, "eval_reward_distinct_2_std": 0.340181895173513, "eval_reward_judge_quality_mean": 0.27961538388178897, "eval_reward_judge_quality_std": 0.16308964559665093, "eval_reward_total_composite_mean": 0.14772453502966806, "eval_reward_total_composite_std": 0.1381625120456402} {"timestamp_utc": "2026-04-12T19:34:01Z", "mode": "train", "global_step": 951, "epoch": 0.05004999736855955, "loss": 0.0189, "grad_norm": 10.40640640258789, "learning_rate": 7.121212121212122e-06, "num_tokens": 1688968.0, "completions/mean_length": 127.875, "completions/min_length": 110.0, "completions/max_length": 142.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 127.875, "completions/min_terminated_length": 110.0, "completions/max_terminated_length": 142.0, "rewards/meter/mean": 0.6116044521331787, "rewards/meter/std": 0.21812674403190613, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.06681530922651291, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.020044606178998947, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.6276565194129944, "rewards/repeat_penalty/std": 0.1394803524017334, "rewards/repeat_floor/mean": 0.9618325233459473, "rewards/repeat_floor/std": 0.012549640610814095, "rewards/near_duplicate_penalty/mean": 0.9100544452667236, "rewards/near_duplicate_penalty/std": 0.03262824937701225, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7258261442184448, "rewards/distinct_2/std": 0.11192677170038223, "rewards/total_composite/mean": 0.19275856018066406, "rewards/total_composite/std": 0.08759541064500809, "reward": 0.19275856018066406, "reward_std": 0.08759541064500809, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16588589549064636, "sampling/sampling_logp_difference/max": 3.5576331615448, "sampling/importance_sampling_ratio/min": 0.028506215661764145, "sampling/importance_sampling_ratio/mean": 1.0032833814620972, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7086888179183006, "clip_ratio/low_mean": 0.06634479109197855, "clip_ratio/low_min": 0.06634479109197855, "clip_ratio/high_mean": 0.06301605701446533, "clip_ratio/high_max": 0.06301605701446533, "clip_ratio/region_mean": 0.12936084810644388, "reward_total_mean": 0.19275856018066406, "reward_meter_mean": 0.6116044521331787, "reward_meter_std": 0.21812674403190613, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.06681530922651291, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.020044606178998947, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6276565194129944, "reward_repeat_penalty_std": 0.1394803524017334, "reward_repeat_floor_mean": 0.9618325233459473, "reward_repeat_floor_std": 0.012549640610814095, "reward_near_duplicate_penalty_mean": 0.9100544452667236, "reward_near_duplicate_penalty_std": 0.03262824937701225, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7258261442184448, "reward_distinct_2_std": 0.11192677170038223, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.19275856018066406, "reward_total_composite_std": 0.08759541064500809} {"timestamp_utc": "2026-04-12T19:34:11Z", "mode": "train", "global_step": 952, "epoch": 0.0501026261775696, "loss": 0.083, "grad_norm": 11.282236099243164, "learning_rate": 7.118181818181819e-06, "num_tokens": 1691552.0, "completions/mean_length": 98.0, "completions/min_length": 21.0, "completions/max_length": 144.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 98.0, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 144.0, "rewards/meter/mean": 0.8767145872116089, "rewards/meter/std": 0.20181696116924286, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.3234066069126129, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.887499988079071, "rewards/count_floor/std": 0.09702197462320328, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.5589762926101685, "rewards/repeat_penalty/std": 0.21816739439964294, "rewards/repeat_floor/mean": 0.9461507797241211, "rewards/repeat_floor/std": 0.033819179981946945, "rewards/near_duplicate_penalty/mean": 0.8495292067527771, "rewards/near_duplicate_penalty/std": 0.10360148549079895, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.6941260099411011, "rewards/distinct_2/std": 0.21561336517333984, "rewards/total_composite/mean": 0.22477945685386658, "rewards/total_composite/std": 0.07185804843902588, "reward": 0.22477945685386658, "reward_std": 0.07185804843902588, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1414160281419754, "sampling/sampling_logp_difference/max": 1.7998636960983276, "sampling/importance_sampling_ratio/min": 0.16532142460346222, "sampling/importance_sampling_ratio/mean": 1.0004907846450806, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8585029914975166, "clip_ratio/low_mean": 0.06142281927168369, "clip_ratio/low_min": 0.06142281927168369, "clip_ratio/high_mean": 0.07327659148722887, "clip_ratio/high_max": 0.07327659148722887, "clip_ratio/region_mean": 0.13469941075891256, "reward_total_mean": 0.22477945685386658, "reward_meter_mean": 0.8767145872116089, "reward_meter_std": 0.20181696116924286, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.3234066069126129, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.887499988079071, "reward_count_floor_std": 0.09702197462320328, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5589762926101685, "reward_repeat_penalty_std": 0.21816739439964294, "reward_repeat_floor_mean": 0.9461507797241211, "reward_repeat_floor_std": 0.033819179981946945, "reward_near_duplicate_penalty_mean": 0.8495292067527771, "reward_near_duplicate_penalty_std": 0.10360148549079895, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.6941260099411011, "reward_distinct_2_std": 0.21561336517333984, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.22477945685386658, "reward_total_composite_std": 0.07185804843902588} {"timestamp_utc": "2026-04-12T19:34:19Z", "mode": "train", "global_step": 953, "epoch": 0.050155254986579655, "loss": 0.0997, "grad_norm": 18.836973190307617, "learning_rate": 7.115151515151516e-06, "num_tokens": 1692917.0, "completions/mean_length": 20.625, "completions/min_length": 20.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.625, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.5763106346130371, "rewards/meter/std": 0.42897507548332214, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5137500166893005, "rewards/judge_quality/std": 0.3586059808731079, "rewards/repeat_penalty/mean": 0.6704980134963989, "rewards/repeat_penalty/std": 0.14287002384662628, "rewards/repeat_floor/mean": 0.9698734283447266, "rewards/repeat_floor/std": 0.027681956067681313, "rewards/near_duplicate_penalty/mean": 0.9247974157333374, "rewards/near_duplicate_penalty/std": 0.14086396992206573, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9572649598121643, "rewards/distinct_2/std": 0.07912991940975189, "rewards/total_composite/mean": 0.35372188687324524, "rewards/total_composite/std": 0.3583594858646393, "reward": 0.35372188687324524, "reward_std": 0.3583594560623169, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16290335357189178, "sampling/sampling_logp_difference/max": 3.2261862754821777, "sampling/importance_sampling_ratio/min": 0.03970864787697792, "sampling/importance_sampling_ratio/mean": 0.9987561702728271, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8055507615208626, "clip_ratio/low_mean": 0.03497670870274305, "clip_ratio/low_min": 0.03497670870274305, "clip_ratio/high_mean": 0.07500000204890966, "clip_ratio/high_max": 0.07500000204890966, "clip_ratio/region_mean": 0.10997671075165272, "reward_total_mean": 0.35372188687324524, "reward_meter_mean": 0.5763106346130371, "reward_meter_std": 0.42897507548332214, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6704980134963989, "reward_repeat_penalty_std": 0.14287002384662628, "reward_repeat_floor_mean": 0.9698734283447266, "reward_repeat_floor_std": 0.027681956067681313, "reward_near_duplicate_penalty_mean": 0.9247974157333374, "reward_near_duplicate_penalty_std": 0.14086396992206573, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9572649598121643, "reward_distinct_2_std": 0.07912991940975189, "reward_judge_quality_mean": 0.5137500166893005, "reward_judge_quality_std": 0.3586059808731079, "reward_total_composite_mean": 0.35372188687324524, "reward_total_composite_std": 0.3583594858646393} {"timestamp_utc": "2026-04-12T19:34:28Z", "mode": "train", "global_step": 954, "epoch": 0.05020788379558971, "loss": 0.0262, "grad_norm": 14.238551139831543, "learning_rate": 7.1121212121212125e-06, "num_tokens": 1694827.0, "completions/mean_length": 63.75, "completions/min_length": 39.0, "completions/max_length": 82.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.75, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.44905251264572144, "rewards/meter/std": 0.30701690912246704, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.6292611956596375, "rewards/repeat_penalty/std": 0.2200477570295334, "rewards/repeat_floor/mean": 0.9567912817001343, "rewards/repeat_floor/std": 0.027628019452095032, "rewards/near_duplicate_penalty/mean": 0.8850417137145996, "rewards/near_duplicate_penalty/std": 0.09129218757152557, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.7531673908233643, "rewards/distinct_2/std": 0.1234266459941864, "rewards/total_composite/mean": 0.140194833278656, "rewards/total_composite/std": 0.09795386344194412, "reward": 0.140194833278656, "reward_std": 0.09795386344194412, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13733336329460144, "sampling/sampling_logp_difference/max": 1.8037546873092651, "sampling/importance_sampling_ratio/min": 0.1646794080734253, "sampling/importance_sampling_ratio/mean": 1.0126349925994873, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8165108859539032, "clip_ratio/low_mean": 0.047445680014789104, "clip_ratio/low_min": 0.047445680014789104, "clip_ratio/high_mean": 0.06441685557365417, "clip_ratio/high_max": 0.06441685557365417, "clip_ratio/region_mean": 0.11186253558844328, "reward_total_mean": 0.140194833278656, "reward_meter_mean": 0.44905251264572144, "reward_meter_std": 0.30701690912246704, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.6292611956596375, "reward_repeat_penalty_std": 0.2200477570295334, "reward_repeat_floor_mean": 0.9567912817001343, "reward_repeat_floor_std": 0.027628019452095032, "reward_near_duplicate_penalty_mean": 0.8850417137145996, "reward_near_duplicate_penalty_std": 0.09129218757152557, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.7531673908233643, "reward_distinct_2_std": 0.1234266459941864, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.140194833278656, "reward_total_composite_std": 0.09795386344194412} {"timestamp_utc": "2026-04-12T19:34:39Z", "mode": "train", "global_step": 955, "epoch": 0.05026051260459976, "loss": 0.1342, "grad_norm": 9.032503128051758, "learning_rate": 7.10909090909091e-06, "num_tokens": 1697331.0, "completions/mean_length": 112.0, "completions/min_length": 19.0, "completions/max_length": 144.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 112.0, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 144.0, "rewards/meter/mean": 0.8889793753623962, "rewards/meter/std": 0.27543914318084717, "rewards/count_adherence/mean": 0.6964285373687744, "rewards/count_adherence/std": 0.23458294570446014, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9089285135269165, "rewards/count_floor/std": 0.07037486881017685, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.4074024558067322, "rewards/repeat_penalty/std": 0.2968716323375702, "rewards/repeat_floor/mean": 0.9225919246673584, "rewards/repeat_floor/std": 0.05010543391108513, "rewards/near_duplicate_penalty/mean": 0.8128306269645691, "rewards/near_duplicate_penalty/std": 0.1494600623846054, "rewards/opening_diversity/mean": 0.8491476774215698, "rewards/opening_diversity/std": 0.1471789926290512, "rewards/distinct_2/mean": 0.5524275302886963, "rewards/distinct_2/std": 0.2812095880508423, "rewards/total_composite/mean": 0.2147814929485321, "rewards/total_composite/std": 0.09185987710952759, "reward": 0.2147814929485321, "reward_std": 0.09185986965894699, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12279205024242401, "sampling/sampling_logp_difference/max": 3.0420215129852295, "sampling/importance_sampling_ratio/min": 0.04773828759789467, "sampling/importance_sampling_ratio/mean": 1.0091530084609985, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7275544628500938, "clip_ratio/low_mean": 0.04513888945803046, "clip_ratio/low_min": 0.04513888945803046, "clip_ratio/high_mean": 0.0845271460711956, "clip_ratio/high_max": 0.0845271460711956, "clip_ratio/region_mean": 0.12966603552922606, "reward_total_mean": 0.2147814929485321, "reward_meter_mean": 0.8889793753623962, "reward_meter_std": 0.27543914318084717, "reward_count_adherence_mean": 0.6964285373687744, "reward_count_adherence_std": 0.23458294570446014, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9089285135269165, "reward_count_floor_std": 0.07037486881017685, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.4074024558067322, "reward_repeat_penalty_std": 0.2968716323375702, "reward_repeat_floor_mean": 0.9225919246673584, "reward_repeat_floor_std": 0.05010543391108513, "reward_near_duplicate_penalty_mean": 0.8128306269645691, "reward_near_duplicate_penalty_std": 0.1494600623846054, "reward_opening_diversity_mean": 0.8491476774215698, "reward_opening_diversity_std": 0.1471789926290512, "reward_distinct_2_mean": 0.5524275302886963, "reward_distinct_2_std": 0.2812095880508423, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.2147814929485321, "reward_total_composite_std": 0.09185987710952759} {"timestamp_utc": "2026-04-12T19:34:53Z", "mode": "train", "global_step": 956, "epoch": 0.05031314141360981, "loss": -0.192, "grad_norm": 5.031750202178955, "learning_rate": 7.106060606060606e-06, "num_tokens": 1699358.0, "completions/mean_length": 101.375, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 42.71428680419922, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 134.0, "rewards/meter/mean": 0.9130992293357849, "rewards/meter/std": 0.14417938888072968, "rewards/count_adherence/mean": 0.3392857313156128, "rewards/count_adherence/std": 0.3234066069126129, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8017857074737549, "rewards/count_floor/std": 0.09702196717262268, "rewards/lexical_plausibility/mean": 0.9637529850006104, "rewards/lexical_plausibility/std": 0.10252200067043304, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.7165063619613647, "rewards/repeat_penalty/std": 0.07188376039266586, "rewards/repeat_floor/mean": 0.9738814234733582, "rewards/repeat_floor/std": 0.011144919320940971, "rewards/near_duplicate_penalty/mean": 0.9363481998443604, "rewards/near_duplicate_penalty/std": 0.06483633071184158, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9200469255447388, "rewards/distinct_2/std": 0.10844539850950241, "rewards/total_composite/mean": 0.1309385895729065, "rewards/total_composite/std": 0.07075480371713638, "reward": 0.1309385895729065, "reward_std": 0.07075481116771698, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14706915616989136, "sampling/sampling_logp_difference/max": 1.3654050827026367, "sampling/importance_sampling_ratio/min": 0.25527724623680115, "sampling/importance_sampling_ratio/mean": 1.0193216800689697, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9359106048941612, "clip_ratio/low_mean": 0.11711270874366164, "clip_ratio/low_min": 0.11711270874366164, "clip_ratio/high_mean": 0.02961753774434328, "clip_ratio/high_max": 0.02961753774434328, "clip_ratio/region_mean": 0.14673024648800492, "reward_total_mean": 0.1309385895729065, "reward_meter_mean": 0.9130992293357849, "reward_meter_std": 0.14417938888072968, "reward_count_adherence_mean": 0.3392857313156128, "reward_count_adherence_std": 0.3234066069126129, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8017857074737549, "reward_count_floor_std": 0.09702196717262268, "reward_lexical_plausibility_mean": 0.9637529850006104, "reward_lexical_plausibility_std": 0.10252200067043304, "reward_repeat_penalty_mean": 0.7165063619613647, "reward_repeat_penalty_std": 0.07188376039266586, "reward_repeat_floor_mean": 0.9738814234733582, "reward_repeat_floor_std": 0.011144919320940971, "reward_near_duplicate_penalty_mean": 0.9363481998443604, "reward_near_duplicate_penalty_std": 0.06483633071184158, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9200469255447388, "reward_distinct_2_std": 0.10844539850950241, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.1309385895729065, "reward_total_composite_std": 0.07075480371713638} {"timestamp_utc": "2026-04-12T19:35:03Z", "mode": "train", "global_step": 957, "epoch": 0.050365770222619864, "loss": 0.1632, "grad_norm": 11.119133949279785, "learning_rate": 7.103030303030304e-06, "num_tokens": 1701265.0, "completions/mean_length": 54.375, "completions/min_length": 34.0, "completions/max_length": 80.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.375, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.3305176794528961, "rewards/meter/std": 0.3714480698108673, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 0.9886363744735718, "rewards/lexical_plausibility/std": 0.03214120864868164, "rewards/judge_quality/mean": 0.42500001192092896, "rewards/judge_quality/std": 0.13887302577495575, "rewards/repeat_penalty/mean": 0.8939952850341797, "rewards/repeat_penalty/std": 0.1726941168308258, "rewards/repeat_floor/mean": 0.9871750473976135, "rewards/repeat_floor/std": 0.02102658897638321, "rewards/near_duplicate_penalty/mean": 0.959881067276001, "rewards/near_duplicate_penalty/std": 0.05803714320063591, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9243653416633606, "rewards/distinct_2/std": 0.1401679813861847, "rewards/total_composite/mean": 0.1598445475101471, "rewards/total_composite/std": 0.22067265212535858, "reward": 0.1598445475101471, "reward_std": 0.2206726223230362, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1448253095149994, "sampling/sampling_logp_difference/max": 1.810577392578125, "sampling/importance_sampling_ratio/min": 0.1635596752166748, "sampling/importance_sampling_ratio/mean": 1.0112669467926025, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7519679144024849, "clip_ratio/low_mean": 0.06484001688659191, "clip_ratio/low_min": 0.06484001688659191, "clip_ratio/high_mean": 0.05810453463345766, "clip_ratio/high_max": 0.05810453463345766, "clip_ratio/region_mean": 0.12294455152004957, "reward_total_mean": 0.1598445475101471, "reward_meter_mean": 0.3305176794528961, "reward_meter_std": 0.3714480698108673, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 0.9886363744735718, "reward_lexical_plausibility_std": 0.03214120864868164, "reward_repeat_penalty_mean": 0.8939952850341797, "reward_repeat_penalty_std": 0.1726941168308258, "reward_repeat_floor_mean": 0.9871750473976135, "reward_repeat_floor_std": 0.02102658897638321, "reward_near_duplicate_penalty_mean": 0.959881067276001, "reward_near_duplicate_penalty_std": 0.05803714320063591, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9243653416633606, "reward_distinct_2_std": 0.1401679813861847, "reward_judge_quality_mean": 0.42500001192092896, "reward_judge_quality_std": 0.13887302577495575, "reward_total_composite_mean": 0.1598445475101471, "reward_total_composite_std": 0.22067265212535858} {"timestamp_utc": "2026-04-12T19:35:17Z", "mode": "train", "global_step": 958, "epoch": 0.05041839903162992, "loss": 0.1987, "grad_norm": 3.029975175857544, "learning_rate": 7.100000000000001e-06, "num_tokens": 1703211.0, "completions/mean_length": 143.25, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 90.5714340209961, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 406.0, "rewards/meter/mean": 0.7041539549827576, "rewards/meter/std": 0.31757858395576477, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9418036937713623, "rewards/lexical_plausibility/std": 0.16460399329662323, "rewards/judge_quality/mean": 0.3212500214576721, "rewards/judge_quality/std": 0.2773052752017975, "rewards/repeat_penalty/mean": 0.656030535697937, "rewards/repeat_penalty/std": 0.3646494150161743, "rewards/repeat_floor/mean": 0.9413734674453735, "rewards/repeat_floor/std": 0.0894436240196228, "rewards/near_duplicate_penalty/mean": 0.8343397378921509, "rewards/near_duplicate_penalty/std": 0.2797500789165497, "rewards/opening_diversity/mean": 0.7979166507720947, "rewards/opening_diversity/std": 0.29566141963005066, "rewards/distinct_2/mean": 0.7594171762466431, "rewards/distinct_2/std": 0.33755066990852356, "rewards/total_composite/mean": 0.25579366087913513, "rewards/total_composite/std": 0.27933651208877563, "reward": 0.25579366087913513, "reward_std": 0.27933651208877563, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.056202176958322525, "sampling/sampling_logp_difference/max": 1.220952033996582, "sampling/importance_sampling_ratio/min": 0.2949492335319519, "sampling/importance_sampling_ratio/mean": 1.0123591423034668, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6898953504860401, "clip_ratio/low_mean": 0.04925617319531739, "clip_ratio/low_min": 0.04925617319531739, "clip_ratio/high_mean": 0.04855974344536662, "clip_ratio/high_max": 0.04855974344536662, "clip_ratio/region_mean": 0.09781591664068401, "reward_total_mean": 0.25579366087913513, "reward_meter_mean": 0.7041539549827576, "reward_meter_std": 0.31757858395576477, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9418036937713623, "reward_lexical_plausibility_std": 0.16460399329662323, "reward_repeat_penalty_mean": 0.656030535697937, "reward_repeat_penalty_std": 0.3646494150161743, "reward_repeat_floor_mean": 0.9413734674453735, "reward_repeat_floor_std": 0.0894436240196228, "reward_near_duplicate_penalty_mean": 0.8343397378921509, "reward_near_duplicate_penalty_std": 0.2797500789165497, "reward_opening_diversity_mean": 0.7979166507720947, "reward_opening_diversity_std": 0.29566141963005066, "reward_distinct_2_mean": 0.7594171762466431, "reward_distinct_2_std": 0.33755066990852356, "reward_judge_quality_mean": 0.3212500214576721, "reward_judge_quality_std": 0.2773052752017975, "reward_total_composite_mean": 0.25579366087913513, "reward_total_composite_std": 0.27933651208877563} {"timestamp_utc": "2026-04-12T19:35:30Z", "mode": "train", "global_step": 959, "epoch": 0.05047102784063997, "loss": -0.031, "grad_norm": 3.7746758460998535, "learning_rate": 7.096969696969698e-06, "num_tokens": 1704660.0, "completions/mean_length": 91.125, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 31.000001907348633, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.8713250756263733, "rewards/meter/std": 0.3392218351364136, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9499614238739014, "rewards/lexical_plausibility/std": 0.14153039455413818, "rewards/judge_quality/mean": 0.4362500011920929, "rewards/judge_quality/std": 0.3301055133342743, "rewards/repeat_penalty/mean": 0.7269412279129028, "rewards/repeat_penalty/std": 0.14046072959899902, "rewards/repeat_floor/mean": 0.9756722450256348, "rewards/repeat_floor/std": 0.020906880497932434, "rewards/near_duplicate_penalty/mean": 0.941906750202179, "rewards/near_duplicate_penalty/std": 0.10029266774654388, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9515135288238525, "rewards/distinct_2/std": 0.0954609140753746, "rewards/total_composite/mean": 0.371695339679718, "rewards/total_composite/std": 0.27089422941207886, "reward": 0.371695339679718, "reward_std": 0.27089422941207886, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12153531610965729, "sampling/sampling_logp_difference/max": 1.0987062454223633, "sampling/importance_sampling_ratio/min": 0.4633790850639343, "sampling/importance_sampling_ratio/mean": 1.0648107528686523, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9690554961562157, "clip_ratio/low_mean": 0.06534963380545378, "clip_ratio/low_min": 0.06534963380545378, "clip_ratio/high_mean": 0.04171892395243049, "clip_ratio/high_max": 0.04171892395243049, "clip_ratio/region_mean": 0.10706855775788426, "reward_total_mean": 0.371695339679718, "reward_meter_mean": 0.8713250756263733, "reward_meter_std": 0.3392218351364136, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9499614238739014, "reward_lexical_plausibility_std": 0.14153039455413818, "reward_repeat_penalty_mean": 0.7269412279129028, "reward_repeat_penalty_std": 0.14046072959899902, "reward_repeat_floor_mean": 0.9756722450256348, "reward_repeat_floor_std": 0.020906880497932434, "reward_near_duplicate_penalty_mean": 0.941906750202179, "reward_near_duplicate_penalty_std": 0.10029266774654388, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9515135288238525, "reward_distinct_2_std": 0.0954609140753746, "reward_judge_quality_mean": 0.4362500011920929, "reward_judge_quality_std": 0.3301055133342743, "reward_total_composite_mean": 0.371695339679718, "reward_total_composite_std": 0.27089422941207886} {"timestamp_utc": "2026-04-12T19:35:44Z", "mode": "train", "global_step": 960, "epoch": 0.05052365664965002, "loss": -0.0403, "grad_norm": 2.2011475563049316, "learning_rate": 7.093939393939394e-06, "num_tokens": 1706178.0, "completions/mean_length": 215.75, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 38.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.4090723395347595, "rewards/meter/std": 0.3334019184112549, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8459243774414062, "rewards/lexical_plausibility/std": 0.2214832901954651, "rewards/judge_quality/mean": 0.2900000214576721, "rewards/judge_quality/std": 0.304396390914917, "rewards/repeat_penalty/mean": 0.9365726709365845, "rewards/repeat_penalty/std": 0.08800051361322403, "rewards/repeat_floor/mean": 0.99422287940979, "rewards/repeat_floor/std": 0.006382799707353115, "rewards/near_duplicate_penalty/mean": 0.9842880368232727, "rewards/near_duplicate_penalty/std": 0.01846707984805107, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9828296899795532, "rewards/distinct_2/std": 0.03188734129071236, "rewards/total_composite/mean": 0.12301649153232574, "rewards/total_composite/std": 0.1511751115322113, "reward": 0.12301649153232574, "reward_std": 0.1511751264333725, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1577311009168625, "sampling/sampling_logp_difference/max": 1.4751026630401611, "sampling/importance_sampling_ratio/min": 0.2548242211341858, "sampling/importance_sampling_ratio/mean": 1.0386005640029907, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7927848324179649, "clip_ratio/low_mean": 0.01666666753590107, "clip_ratio/low_min": 0.01666666753590107, "clip_ratio/high_mean": 0.06475761369802058, "clip_ratio/high_max": 0.06475761369802058, "clip_ratio/region_mean": 0.08142428123392165, "reward_total_mean": 0.12301649153232574, "reward_meter_mean": 0.4090723395347595, "reward_meter_std": 0.3334019184112549, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8459243774414062, "reward_lexical_plausibility_std": 0.2214832901954651, "reward_repeat_penalty_mean": 0.9365726709365845, "reward_repeat_penalty_std": 0.08800051361322403, "reward_repeat_floor_mean": 0.99422287940979, "reward_repeat_floor_std": 0.006382799707353115, "reward_near_duplicate_penalty_mean": 0.9842880368232727, "reward_near_duplicate_penalty_std": 0.01846707984805107, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9828296899795532, "reward_distinct_2_std": 0.03188734129071236, "reward_judge_quality_mean": 0.2900000214576721, "reward_judge_quality_std": 0.304396390914917, "reward_total_composite_mean": 0.12301649153232574, "reward_total_composite_std": 0.1511751115322113} {"timestamp_utc": "2026-04-12T19:35:53Z", "mode": "train", "global_step": 961, "epoch": 0.050576285458660074, "loss": 0.0526, "grad_norm": 18.03604507446289, "learning_rate": 7.0909090909090916e-06, "num_tokens": 1707653.0, "completions/mean_length": 27.375, "completions/min_length": 18.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.375, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.9818100929260254, "rewards/meter/std": 0.011301834136247635, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6675000190734863, "rewards/judge_quality/std": 0.26162952184677124, "rewards/repeat_penalty/mean": 0.7778453826904297, "rewards/repeat_penalty/std": 0.09889805316925049, "rewards/repeat_floor/mean": 0.9818924069404602, "rewards/repeat_floor/std": 0.010265972465276718, "rewards/near_duplicate_penalty/mean": 0.9638105630874634, "rewards/near_duplicate_penalty/std": 0.052360448986291885, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9632866978645325, "rewards/distinct_2/std": 0.06808248907327652, "rewards/total_composite/mean": 0.5793253779411316, "rewards/total_composite/std": 0.22016698122024536, "reward": 0.5793253779411316, "reward_std": 0.22016699612140656, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14183680713176727, "sampling/sampling_logp_difference/max": 6.309340476989746, "sampling/importance_sampling_ratio/min": 0.0018192327115684748, "sampling/importance_sampling_ratio/mean": 1.0047463178634644, "sampling/importance_sampling_ratio/max": 1.5898181200027466, "entropy": 0.7553734555840492, "clip_ratio/low_mean": 0.06564555549994111, "clip_ratio/low_min": 0.06564555549994111, "clip_ratio/high_mean": 0.06134962756186724, "clip_ratio/high_max": 0.06134962756186724, "clip_ratio/region_mean": 0.12699518306180835, "reward_total_mean": 0.5793253779411316, "reward_meter_mean": 0.9818100929260254, "reward_meter_std": 0.011301834136247635, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7778453826904297, "reward_repeat_penalty_std": 0.09889805316925049, "reward_repeat_floor_mean": 0.9818924069404602, "reward_repeat_floor_std": 0.010265972465276718, "reward_near_duplicate_penalty_mean": 0.9638105630874634, "reward_near_duplicate_penalty_std": 0.052360448986291885, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9632866978645325, "reward_distinct_2_std": 0.06808248907327652, "reward_judge_quality_mean": 0.6675000190734863, "reward_judge_quality_std": 0.26162952184677124, "reward_total_composite_mean": 0.5793253779411316, "reward_total_composite_std": 0.22016698122024536} {"timestamp_utc": "2026-04-12T19:36:01Z", "mode": "train", "global_step": 962, "epoch": 0.05062891426767012, "loss": 0.0372, "grad_norm": 20.44489097595215, "learning_rate": 7.087878787878788e-06, "num_tokens": 1709195.0, "completions/mean_length": 20.75, "completions/min_length": 18.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.75, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.8680230975151062, "rewards/meter/std": 0.33155015110969543, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.7146035432815552, "rewards/repeat_penalty/std": 0.05397561192512512, "rewards/repeat_floor/mean": 0.9801807403564453, "rewards/repeat_floor/std": 0.006781466770917177, "rewards/near_duplicate_penalty/mean": 0.9909484386444092, "rewards/near_duplicate_penalty/std": 0.01611136458814144, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9615384340286255, "rewards/distinct_2/std": 0.07121692597866058, "rewards/total_composite/mean": 0.4299643039703369, "rewards/total_composite/std": 0.2295384556055069, "reward": 0.4299643039703369, "reward_std": 0.2295384407043457, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11307244747877121, "sampling/sampling_logp_difference/max": 1.1255760192871094, "sampling/importance_sampling_ratio/min": 0.3244655132293701, "sampling/importance_sampling_ratio/mean": 1.0188649892807007, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6549806296825409, "clip_ratio/low_mean": 0.03147546947002411, "clip_ratio/low_min": 0.03147546947002411, "clip_ratio/high_mean": 0.047945951111614704, "clip_ratio/high_max": 0.047945951111614704, "clip_ratio/region_mean": 0.07942142058163881, "reward_total_mean": 0.4299643039703369, "reward_meter_mean": 0.8680230975151062, "reward_meter_std": 0.33155015110969543, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7146035432815552, "reward_repeat_penalty_std": 0.05397561192512512, "reward_repeat_floor_mean": 0.9801807403564453, "reward_repeat_floor_std": 0.006781466770917177, "reward_near_duplicate_penalty_mean": 0.9909484386444092, "reward_near_duplicate_penalty_std": 0.01611136458814144, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9615384340286255, "reward_distinct_2_std": 0.07121692597866058, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.4299643039703369, "reward_total_composite_std": 0.2295384556055069} {"timestamp_utc": "2026-04-12T19:36:13Z", "mode": "train", "global_step": 963, "epoch": 0.05068154307668017, "loss": 0.0286, "grad_norm": 13.568646430969238, "learning_rate": 7.084848484848485e-06, "num_tokens": 1710796.0, "completions/mean_length": 46.125, "completions/min_length": 38.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.125, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.39017507433891296, "rewards/meter/std": 0.36206796765327454, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9397321343421936, "rewards/lexical_plausibility/std": 0.13258253037929535, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9037748575210571, "rewards/repeat_penalty/std": 0.06213401257991791, "rewards/repeat_floor/mean": 0.9888076782226562, "rewards/repeat_floor/std": 0.007460832595825195, "rewards/near_duplicate_penalty/mean": 0.9621427059173584, "rewards/near_duplicate_penalty/std": 0.032039932906627655, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9387362599372864, "rewards/distinct_2/std": 0.04270491376519203, "rewards/total_composite/mean": 0.16202372312545776, "rewards/total_composite/std": 0.14978615939617157, "reward": 0.16202372312545776, "reward_std": 0.14978615939617157, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1728232353925705, "sampling/sampling_logp_difference/max": 3.8115999698638916, "sampling/importance_sampling_ratio/min": 0.02211277186870575, "sampling/importance_sampling_ratio/mean": 1.0311328172683716, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7943053096532822, "clip_ratio/low_mean": 0.09817915316671133, "clip_ratio/low_min": 0.09817915316671133, "clip_ratio/high_mean": 0.06024638283997774, "clip_ratio/high_max": 0.06024638283997774, "clip_ratio/region_mean": 0.15842553600668907, "reward_total_mean": 0.16202372312545776, "reward_meter_mean": 0.39017507433891296, "reward_meter_std": 0.36206796765327454, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9397321343421936, "reward_lexical_plausibility_std": 0.13258253037929535, "reward_repeat_penalty_mean": 0.9037748575210571, "reward_repeat_penalty_std": 0.06213401257991791, "reward_repeat_floor_mean": 0.9888076782226562, "reward_repeat_floor_std": 0.007460832595825195, "reward_near_duplicate_penalty_mean": 0.9621427059173584, "reward_near_duplicate_penalty_std": 0.032039932906627655, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9387362599372864, "reward_distinct_2_std": 0.04270491376519203, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.16202372312545776, "reward_total_composite_std": 0.14978615939617157} {"timestamp_utc": "2026-04-12T19:36:21Z", "mode": "train", "global_step": 964, "epoch": 0.050734171885690224, "loss": -0.036, "grad_norm": 22.8244686126709, "learning_rate": 7.081818181818182e-06, "num_tokens": 1712131.0, "completions/mean_length": 19.875, "completions/min_length": 18.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.875, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.5185908675193787, "rewards/meter/std": 0.3965068757534027, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.3634728491306305, "rewards/repeat_penalty/mean": 0.7266660928726196, "rewards/repeat_penalty/std": 0.03757713735103607, "rewards/repeat_floor/mean": 0.9803332090377808, "rewards/repeat_floor/std": 0.007515429984778166, "rewards/near_duplicate_penalty/mean": 0.9688881635665894, "rewards/near_duplicate_penalty/std": 0.05010281875729561, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.17059214413166046, "rewards/total_composite/std": 0.22592337429523468, "reward": 0.17059214413166046, "reward_std": 0.2259233593940735, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10648006945848465, "sampling/sampling_logp_difference/max": 1.299217700958252, "sampling/importance_sampling_ratio/min": 0.2727450728416443, "sampling/importance_sampling_ratio/mean": 1.0147902965545654, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5916283205151558, "clip_ratio/low_mean": 0.05069444561377168, "clip_ratio/low_min": 0.05069444561377168, "clip_ratio/high_mean": 0.04408212564885616, "clip_ratio/high_max": 0.04408212564885616, "clip_ratio/region_mean": 0.09477657126262784, "reward_total_mean": 0.17059214413166046, "reward_meter_mean": 0.5185908675193787, "reward_meter_std": 0.3965068757534027, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7266660928726196, "reward_repeat_penalty_std": 0.03757713735103607, "reward_repeat_floor_mean": 0.9803332090377808, "reward_repeat_floor_std": 0.007515429984778166, "reward_near_duplicate_penalty_mean": 0.9688881635665894, "reward_near_duplicate_penalty_std": 0.05010281875729561, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.3634728491306305, "reward_total_composite_mean": 0.17059214413166046, "reward_total_composite_std": 0.22592337429523468} {"timestamp_utc": "2026-04-12T19:36:36Z", "mode": "train", "global_step": 965, "epoch": 0.050786800694700276, "loss": -0.0327, "grad_norm": 5.6483283042907715, "learning_rate": 7.07878787878788e-06, "num_tokens": 1713802.0, "completions/mean_length": 97.875, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.71428680419922, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.4031611680984497, "rewards/meter/std": 0.3963141143321991, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9448670148849487, "rewards/lexical_plausibility/std": 0.15593969821929932, "rewards/judge_quality/mean": 0.35874998569488525, "rewards/judge_quality/std": 0.27105283737182617, "rewards/repeat_penalty/mean": 0.8642938137054443, "rewards/repeat_penalty/std": 0.24190878868103027, "rewards/repeat_floor/mean": 0.983004093170166, "rewards/repeat_floor/std": 0.03545467182993889, "rewards/near_duplicate_penalty/mean": 0.9417939186096191, "rewards/near_duplicate_penalty/std": 0.13483747839927673, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9498327970504761, "rewards/distinct_2/std": 0.11722736805677414, "rewards/total_composite/mean": 0.12933379411697388, "rewards/total_composite/std": 0.14334839582443237, "reward": 0.12933379411697388, "reward_std": 0.14334839582443237, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19400382041931152, "sampling/sampling_logp_difference/max": 1.928518295288086, "sampling/importance_sampling_ratio/min": 0.14536342024803162, "sampling/importance_sampling_ratio/mean": 1.01447594165802, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3471220135688782, "clip_ratio/low_mean": 0.09430984780192375, "clip_ratio/low_min": 0.09430984780192375, "clip_ratio/high_mean": 0.04414682649075985, "clip_ratio/high_max": 0.04414682649075985, "clip_ratio/region_mean": 0.1384566742926836, "reward_total_mean": 0.12933379411697388, "reward_meter_mean": 0.4031611680984497, "reward_meter_std": 0.3963141143321991, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9448670148849487, "reward_lexical_plausibility_std": 0.15593969821929932, "reward_repeat_penalty_mean": 0.8642938137054443, "reward_repeat_penalty_std": 0.24190878868103027, "reward_repeat_floor_mean": 0.983004093170166, "reward_repeat_floor_std": 0.03545467182993889, "reward_near_duplicate_penalty_mean": 0.9417939186096191, "reward_near_duplicate_penalty_std": 0.13483747839927673, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9498327970504761, "reward_distinct_2_std": 0.11722736805677414, "reward_judge_quality_mean": 0.35874998569488525, "reward_judge_quality_std": 0.27105283737182617, "reward_total_composite_mean": 0.12933379411697388, "reward_total_composite_std": 0.14334839582443237} {"timestamp_utc": "2026-04-12T19:36:50Z", "mode": "train", "global_step": 966, "epoch": 0.05083942950371033, "loss": -0.131, "grad_norm": 5.304625988006592, "learning_rate": 7.075757575757576e-06, "num_tokens": 1715623.0, "completions/mean_length": 125.625, "completions/min_length": 60.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 70.42857360839844, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.717265248298645, "rewards/meter/std": 0.2712932229042053, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.10690449178218842, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9700000286102295, "rewards/count_floor/std": 0.03207135200500488, "rewards/lexical_plausibility/mean": 0.9640973210334778, "rewards/lexical_plausibility/std": 0.10154811292886734, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.8364830017089844, "rewards/repeat_penalty/std": 0.12496007978916168, "rewards/repeat_floor/mean": 0.984601616859436, "rewards/repeat_floor/std": 0.007827362976968288, "rewards/near_duplicate_penalty/mean": 0.9498469829559326, "rewards/near_duplicate_penalty/std": 0.03668202832341194, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9177031517028809, "rewards/distinct_2/std": 0.05820242688059807, "rewards/total_composite/mean": 0.22700145840644836, "rewards/total_composite/std": 0.11999580264091492, "reward": 0.22700145840644836, "reward_std": 0.11999580264091492, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17169775068759918, "sampling/sampling_logp_difference/max": 1.4786462783813477, "sampling/importance_sampling_ratio/min": 0.22794605791568756, "sampling/importance_sampling_ratio/mean": 0.9984003305435181, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7991107404232025, "clip_ratio/low_mean": 0.03892543911933899, "clip_ratio/low_min": 0.03892543911933899, "clip_ratio/high_mean": 0.1201695678755641, "clip_ratio/high_max": 0.1201695678755641, "clip_ratio/region_mean": 0.1590950069949031, "reward_total_mean": 0.22700145840644836, "reward_meter_mean": 0.717265248298645, "reward_meter_std": 0.2712932229042053, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.10690449178218842, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9700000286102295, "reward_count_floor_std": 0.03207135200500488, "reward_lexical_plausibility_mean": 0.9640973210334778, "reward_lexical_plausibility_std": 0.10154811292886734, "reward_repeat_penalty_mean": 0.8364830017089844, "reward_repeat_penalty_std": 0.12496007978916168, "reward_repeat_floor_mean": 0.984601616859436, "reward_repeat_floor_std": 0.007827362976968288, "reward_near_duplicate_penalty_mean": 0.9498469829559326, "reward_near_duplicate_penalty_std": 0.03668202832341194, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9177031517028809, "reward_distinct_2_std": 0.05820242688059807, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.22700145840644836, "reward_total_composite_std": 0.11999580264091492} {"timestamp_utc": "2026-04-12T19:37:04Z", "mode": "train", "global_step": 967, "epoch": 0.05089205831272038, "loss": -0.2086, "grad_norm": 5.202090263366699, "learning_rate": 7.072727272727273e-06, "num_tokens": 1717764.0, "completions/mean_length": 107.625, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 49.85714340209961, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 165.0, "rewards/meter/mean": 0.9686695337295532, "rewards/meter/std": 0.04694174602627754, "rewards/count_adherence/mean": 0.3125, "rewards/count_adherence/std": 0.2834733724594116, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.793749988079071, "rewards/count_floor/std": 0.08504199981689453, "rewards/lexical_plausibility/mean": 0.9523479342460632, "rewards/lexical_plausibility/std": 0.11168882250785828, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.6907267570495605, "rewards/repeat_penalty/std": 0.11627142876386642, "rewards/repeat_floor/mean": 0.9688509702682495, "rewards/repeat_floor/std": 0.014714229851961136, "rewards/near_duplicate_penalty/mean": 0.9194468259811401, "rewards/near_duplicate_penalty/std": 0.058872126042842865, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8923208713531494, "rewards/distinct_2/std": 0.08279687166213989, "rewards/total_composite/mean": 0.20435890555381775, "rewards/total_composite/std": 0.10451614111661911, "reward": 0.20435890555381775, "reward_std": 0.10451613366603851, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15677496790885925, "sampling/sampling_logp_difference/max": 1.6174089908599854, "sampling/importance_sampling_ratio/min": 0.19841212034225464, "sampling/importance_sampling_ratio/mean": 1.0298054218292236, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2037087976932526, "clip_ratio/low_mean": 0.0291422288864851, "clip_ratio/low_min": 0.0291422288864851, "clip_ratio/high_mean": 0.07766798511147499, "clip_ratio/high_max": 0.07766798511147499, "clip_ratio/region_mean": 0.10681021399796009, "reward_total_mean": 0.20435890555381775, "reward_meter_mean": 0.9686695337295532, "reward_meter_std": 0.04694174602627754, "reward_count_adherence_mean": 0.3125, "reward_count_adherence_std": 0.2834733724594116, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.793749988079071, "reward_count_floor_std": 0.08504199981689453, "reward_lexical_plausibility_mean": 0.9523479342460632, "reward_lexical_plausibility_std": 0.11168882250785828, "reward_repeat_penalty_mean": 0.6907267570495605, "reward_repeat_penalty_std": 0.11627142876386642, "reward_repeat_floor_mean": 0.9688509702682495, "reward_repeat_floor_std": 0.014714229851961136, "reward_near_duplicate_penalty_mean": 0.9194468259811401, "reward_near_duplicate_penalty_std": 0.058872126042842865, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8923208713531494, "reward_distinct_2_std": 0.08279687166213989, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.20435890555381775, "reward_total_composite_std": 0.10451614111661911} {"timestamp_utc": "2026-04-12T19:37:18Z", "mode": "train", "global_step": 968, "epoch": 0.050944687121730434, "loss": -0.0438, "grad_norm": 5.238527774810791, "learning_rate": 7.06969696969697e-06, "num_tokens": 1719289.0, "completions/mean_length": 92.625, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 32.71428680419922, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.7131102085113525, "rewards/meter/std": 0.3417653441429138, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9248441457748413, "rewards/lexical_plausibility/std": 0.12555167078971863, "rewards/judge_quality/mean": 0.4675000011920929, "rewards/judge_quality/std": 0.3160809278488159, "rewards/repeat_penalty/mean": 0.8501054048538208, "rewards/repeat_penalty/std": 0.1546521633863449, "rewards/repeat_floor/mean": 0.9813551306724548, "rewards/repeat_floor/std": 0.018153000622987747, "rewards/near_duplicate_penalty/mean": 0.9203752279281616, "rewards/near_duplicate_penalty/std": 0.07198642194271088, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9463757276535034, "rewards/distinct_2/std": 0.07744858413934708, "rewards/total_composite/mean": 0.31176048517227173, "rewards/total_composite/std": 0.220302551984787, "reward": 0.31176048517227173, "reward_std": 0.220302551984787, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19009913504123688, "sampling/sampling_logp_difference/max": 2.8461923599243164, "sampling/importance_sampling_ratio/min": 0.05806499347090721, "sampling/importance_sampling_ratio/mean": 0.9877751469612122, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6971128806471825, "clip_ratio/low_mean": 0.018067227210849524, "clip_ratio/low_min": 0.018067227210849524, "clip_ratio/high_mean": 0.12980854138731956, "clip_ratio/high_max": 0.12980854138731956, "clip_ratio/region_mean": 0.1478757685981691, "reward_total_mean": 0.31176048517227173, "reward_meter_mean": 0.7131102085113525, "reward_meter_std": 0.3417653441429138, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9248441457748413, "reward_lexical_plausibility_std": 0.12555167078971863, "reward_repeat_penalty_mean": 0.8501054048538208, "reward_repeat_penalty_std": 0.1546521633863449, "reward_repeat_floor_mean": 0.9813551306724548, "reward_repeat_floor_std": 0.018153000622987747, "reward_near_duplicate_penalty_mean": 0.9203752279281616, "reward_near_duplicate_penalty_std": 0.07198642194271088, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9463757276535034, "reward_distinct_2_std": 0.07744858413934708, "reward_judge_quality_mean": 0.4675000011920929, "reward_judge_quality_std": 0.3160809278488159, "reward_total_composite_mean": 0.31176048517227173, "reward_total_composite_std": 0.220302551984787} {"timestamp_utc": "2026-04-12T19:37:27Z", "mode": "train", "global_step": 969, "epoch": 0.050997315930740486, "loss": -0.0781, "grad_norm": 18.737300872802734, "learning_rate": 7.066666666666667e-06, "num_tokens": 1720934.0, "completions/mean_length": 27.625, "completions/min_length": 20.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.625, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.954509973526001, "rewards/meter/std": 0.09417146444320679, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.26250001788139343, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.7761447429656982, "rewards/repeat_penalty/std": 0.1170436441898346, "rewards/repeat_floor/mean": 0.9829691052436829, "rewards/repeat_floor/std": 0.01006452925503254, "rewards/near_duplicate_penalty/mean": 0.9710761904716492, "rewards/near_duplicate_penalty/std": 0.04073138162493706, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.045327357947826385, "rewards/total_composite/mean": 0.21585124731063843, "rewards/total_composite/std": 0.13087515532970428, "reward": 0.21585124731063843, "reward_std": 0.13087515532970428, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16987186670303345, "sampling/sampling_logp_difference/max": 1.384159803390503, "sampling/importance_sampling_ratio/min": 0.25053420662879944, "sampling/importance_sampling_ratio/mean": 1.0210856199264526, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.413540206849575, "clip_ratio/low_mean": 0.09910714440047741, "clip_ratio/low_min": 0.09910714440047741, "clip_ratio/high_mean": 0.06668862700462341, "clip_ratio/high_max": 0.06668862700462341, "clip_ratio/region_mean": 0.16579577140510082, "reward_total_mean": 0.21585124731063843, "reward_meter_mean": 0.954509973526001, "reward_meter_std": 0.09417146444320679, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7761447429656982, "reward_repeat_penalty_std": 0.1170436441898346, "reward_repeat_floor_mean": 0.9829691052436829, "reward_repeat_floor_std": 0.01006452925503254, "reward_near_duplicate_penalty_mean": 0.9710761904716492, "reward_near_duplicate_penalty_std": 0.04073138162493706, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.045327357947826385, "reward_judge_quality_mean": 0.26250001788139343, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.21585124731063843, "reward_total_composite_std": 0.13087515532970428} {"timestamp_utc": "2026-04-12T19:37:40Z", "mode": "train", "global_step": 970, "epoch": 0.05104994473975054, "loss": -0.037, "grad_norm": 3.005152940750122, "learning_rate": 7.063636363636365e-06, "num_tokens": 1722556.0, "completions/mean_length": 157.75, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 39.66666793823242, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.423380970954895, "rewards/meter/std": 0.3594983220100403, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8948670625686646, "rewards/lexical_plausibility/std": 0.17127196490764618, "rewards/judge_quality/mean": 0.2587500214576721, "rewards/judge_quality/std": 0.2947850525379181, "rewards/repeat_penalty/mean": 0.5997943878173828, "rewards/repeat_penalty/std": 0.22570596635341644, "rewards/repeat_floor/mean": 0.9517270922660828, "rewards/repeat_floor/std": 0.037120044231414795, "rewards/near_duplicate_penalty/mean": 0.8516302704811096, "rewards/near_duplicate_penalty/std": 0.1349460482597351, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8359174728393555, "rewards/distinct_2/std": 0.17480257153511047, "rewards/total_composite/mean": 0.17451606690883636, "rewards/total_composite/std": 0.29133304953575134, "reward": 0.17451606690883636, "reward_std": 0.29133301973342896, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15425877273082733, "sampling/sampling_logp_difference/max": 1.5117311477661133, "sampling/importance_sampling_ratio/min": 0.22052788734436035, "sampling/importance_sampling_ratio/mean": 1.0376791954040527, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9024818316102028, "clip_ratio/low_mean": 0.0920450184494257, "clip_ratio/low_min": 0.0920450184494257, "clip_ratio/high_mean": 0.018597560934722424, "clip_ratio/high_max": 0.018597560934722424, "clip_ratio/region_mean": 0.11064257938414812, "reward_total_mean": 0.17451606690883636, "reward_meter_mean": 0.423380970954895, "reward_meter_std": 0.3594983220100403, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8948670625686646, "reward_lexical_plausibility_std": 0.17127196490764618, "reward_repeat_penalty_mean": 0.5997943878173828, "reward_repeat_penalty_std": 0.22570596635341644, "reward_repeat_floor_mean": 0.9517270922660828, "reward_repeat_floor_std": 0.037120044231414795, "reward_near_duplicate_penalty_mean": 0.8516302704811096, "reward_near_duplicate_penalty_std": 0.1349460482597351, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8359174728393555, "reward_distinct_2_std": 0.17480257153511047, "reward_judge_quality_mean": 0.2587500214576721, "reward_judge_quality_std": 0.2947850525379181, "reward_total_composite_mean": 0.17451606690883636, "reward_total_composite_std": 0.29133304953575134} {"timestamp_utc": "2026-04-12T19:37:50Z", "mode": "train", "global_step": 971, "epoch": 0.05110257354876059, "loss": -0.0028, "grad_norm": 14.2072172164917, "learning_rate": 7.060606060606061e-06, "num_tokens": 1724298.0, "completions/mean_length": 51.75, "completions/min_length": 38.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.75, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.7715051174163818, "rewards/meter/std": 0.30648893117904663, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175492912530899, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.8485367298126221, "rewards/repeat_penalty/std": 0.10371339321136475, "rewards/repeat_floor/mean": 0.9831637144088745, "rewards/repeat_floor/std": 0.009831927716732025, "rewards/near_duplicate_penalty/mean": 0.9448339343070984, "rewards/near_duplicate_penalty/std": 0.0315127931535244, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9257071614265442, "rewards/distinct_2/std": 0.042042117565870285, "rewards/total_composite/mean": 0.2650087773799896, "rewards/total_composite/std": 0.12917882204055786, "reward": 0.2650087773799896, "reward_std": 0.12917882204055786, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16324123740196228, "sampling/sampling_logp_difference/max": 1.9861998558044434, "sampling/importance_sampling_ratio/min": 0.13721586763858795, "sampling/importance_sampling_ratio/mean": 1.0014806985855103, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9240273982286453, "clip_ratio/low_mean": 0.02583712339401245, "clip_ratio/low_min": 0.02583712339401245, "clip_ratio/high_mean": 0.11590507440268993, "clip_ratio/high_max": 0.11590507440268993, "clip_ratio/region_mean": 0.14174219779670238, "reward_total_mean": 0.2650087773799896, "reward_meter_mean": 0.7715051174163818, "reward_meter_std": 0.30648893117904663, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175492912530899, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8485367298126221, "reward_repeat_penalty_std": 0.10371339321136475, "reward_repeat_floor_mean": 0.9831637144088745, "reward_repeat_floor_std": 0.009831927716732025, "reward_near_duplicate_penalty_mean": 0.9448339343070984, "reward_near_duplicate_penalty_std": 0.0315127931535244, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9257071614265442, "reward_distinct_2_std": 0.042042117565870285, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.2650087773799896, "reward_total_composite_std": 0.12917882204055786} {"timestamp_utc": "2026-04-12T19:38:04Z", "mode": "train", "global_step": 972, "epoch": 0.05115520235777064, "loss": -0.0731, "grad_norm": 4.164340972900391, "learning_rate": 7.057575757575759e-06, "num_tokens": 1725689.0, "completions/mean_length": 93.875, "completions/min_length": 30.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 34.142860412597656, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.6997895240783691, "rewards/meter/std": 0.433590292930603, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9476128816604614, "rewards/lexical_plausibility/std": 0.1481732279062271, "rewards/judge_quality/mean": 0.34999996423721313, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.8653319478034973, "rewards/repeat_penalty/std": 0.16824647784233093, "rewards/repeat_floor/mean": 0.9855325222015381, "rewards/repeat_floor/std": 0.018374187871813774, "rewards/near_duplicate_penalty/mean": 0.9500287175178528, "rewards/near_duplicate_penalty/std": 0.06329852342605591, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9642024636268616, "rewards/distinct_2/std": 0.06630805134773254, "rewards/total_composite/mean": 0.2770465314388275, "rewards/total_composite/std": 0.18259696662425995, "reward": 0.2770465314388275, "reward_std": 0.18259696662425995, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16110078990459442, "sampling/sampling_logp_difference/max": 3.9171507358551025, "sampling/importance_sampling_ratio/min": 0.0198977068066597, "sampling/importance_sampling_ratio/mean": 1.0118138790130615, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8980119079351425, "clip_ratio/low_mean": 0.033928572200238705, "clip_ratio/low_min": 0.033928572200238705, "clip_ratio/high_mean": 0.11240511201322079, "clip_ratio/high_max": 0.11240511201322079, "clip_ratio/region_mean": 0.1463336842134595, "reward_total_mean": 0.2770465314388275, "reward_meter_mean": 0.6997895240783691, "reward_meter_std": 0.433590292930603, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9476128816604614, "reward_lexical_plausibility_std": 0.1481732279062271, "reward_repeat_penalty_mean": 0.8653319478034973, "reward_repeat_penalty_std": 0.16824647784233093, "reward_repeat_floor_mean": 0.9855325222015381, "reward_repeat_floor_std": 0.018374187871813774, "reward_near_duplicate_penalty_mean": 0.9500287175178528, "reward_near_duplicate_penalty_std": 0.06329852342605591, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9642024636268616, "reward_distinct_2_std": 0.06630805134773254, "reward_judge_quality_mean": 0.34999996423721313, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.2770465314388275, "reward_total_composite_std": 0.18259696662425995} {"timestamp_utc": "2026-04-12T19:38:18Z", "mode": "train", "global_step": 973, "epoch": 0.051207831166780696, "loss": -0.0693, "grad_norm": 3.999750852584839, "learning_rate": 7.054545454545455e-06, "num_tokens": 1727155.0, "completions/mean_length": 96.25, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 36.85714340209961, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.8346974849700928, "rewards/meter/std": 0.27647799253463745, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9555260539054871, "rewards/lexical_plausibility/std": 0.12579134106636047, "rewards/judge_quality/mean": 0.5300000309944153, "rewards/judge_quality/std": 0.2929163873195648, "rewards/repeat_penalty/mean": 0.96783846616745, "rewards/repeat_penalty/std": 0.061910782009363174, "rewards/repeat_floor/mean": 0.9961574077606201, "rewards/repeat_floor/std": 0.006572483107447624, "rewards/near_duplicate_penalty/mean": 0.985371470451355, "rewards/near_duplicate_penalty/std": 0.015771590173244476, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9816849827766418, "rewards/distinct_2/std": 0.05180269479751587, "rewards/total_composite/mean": 0.4928828477859497, "rewards/total_composite/std": 0.3025922477245331, "reward": 0.4928828477859497, "reward_std": 0.3025922477245331, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14396162331104279, "sampling/sampling_logp_difference/max": 1.389665126800537, "sampling/importance_sampling_ratio/min": 0.24915872514247894, "sampling/importance_sampling_ratio/mean": 1.0058937072753906, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7554473727941513, "clip_ratio/low_mean": 0.07631270308047533, "clip_ratio/low_min": 0.07631270308047533, "clip_ratio/high_mean": 0.05304666329175234, "clip_ratio/high_max": 0.05304666329175234, "clip_ratio/region_mean": 0.12935936637222767, "reward_total_mean": 0.4928828477859497, "reward_meter_mean": 0.8346974849700928, "reward_meter_std": 0.27647799253463745, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9555260539054871, "reward_lexical_plausibility_std": 0.12579134106636047, "reward_repeat_penalty_mean": 0.96783846616745, "reward_repeat_penalty_std": 0.061910782009363174, "reward_repeat_floor_mean": 0.9961574077606201, "reward_repeat_floor_std": 0.006572483107447624, "reward_near_duplicate_penalty_mean": 0.985371470451355, "reward_near_duplicate_penalty_std": 0.015771590173244476, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9816849827766418, "reward_distinct_2_std": 0.05180269479751587, "reward_judge_quality_mean": 0.5300000309944153, "reward_judge_quality_std": 0.2929163873195648, "reward_total_composite_mean": 0.4928828477859497, "reward_total_composite_std": 0.3025922477245331} {"timestamp_utc": "2026-04-12T19:38:28Z", "mode": "train", "global_step": 974, "epoch": 0.05126045997579075, "loss": -0.0492, "grad_norm": 8.404296875, "learning_rate": 7.0515151515151525e-06, "num_tokens": 1729572.0, "completions/mean_length": 114.125, "completions/min_length": 29.0, "completions/max_length": 136.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 114.125, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 136.0, "rewards/meter/mean": 0.9692351222038269, "rewards/meter/std": 0.04848598688840866, "rewards/count_adherence/mean": 0.6785714626312256, "rewards/count_adherence/std": 0.22587698698043823, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9035714268684387, "rewards/count_floor/std": 0.0677630826830864, "rewards/lexical_plausibility/mean": 0.9994343519210815, "rewards/lexical_plausibility/std": 0.0015997890150174499, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.32866936922073364, "rewards/repeat_penalty/std": 0.28666263818740845, "rewards/repeat_floor/mean": 0.9035038352012634, "rewards/repeat_floor/std": 0.06129074469208717, "rewards/near_duplicate_penalty/mean": 0.7400773167610168, "rewards/near_duplicate_penalty/std": 0.1981327086687088, "rewards/opening_diversity/mean": 0.8542613983154297, "rewards/opening_diversity/std": 0.2397436797618866, "rewards/distinct_2/mean": 0.4581839442253113, "rewards/distinct_2/std": 0.3071747422218323, "rewards/total_composite/mean": 0.14026211202144623, "rewards/total_composite/std": 0.06768891960382462, "reward": 0.14026211202144623, "reward_std": 0.06768891960382462, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11227668821811676, "sampling/sampling_logp_difference/max": 1.5684280395507812, "sampling/importance_sampling_ratio/min": 0.20837247371673584, "sampling/importance_sampling_ratio/mean": 0.9983904361724854, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8551279902458191, "clip_ratio/low_mean": 0.08559842547401786, "clip_ratio/low_min": 0.08559842547401786, "clip_ratio/high_mean": 0.02178030274808407, "clip_ratio/high_max": 0.02178030274808407, "clip_ratio/region_mean": 0.10737872822210193, "reward_total_mean": 0.14026211202144623, "reward_meter_mean": 0.9692351222038269, "reward_meter_std": 0.04848598688840866, "reward_count_adherence_mean": 0.6785714626312256, "reward_count_adherence_std": 0.22587698698043823, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9035714268684387, "reward_count_floor_std": 0.0677630826830864, "reward_lexical_plausibility_mean": 0.9994343519210815, "reward_lexical_plausibility_std": 0.0015997890150174499, "reward_repeat_penalty_mean": 0.32866936922073364, "reward_repeat_penalty_std": 0.28666263818740845, "reward_repeat_floor_mean": 0.9035038352012634, "reward_repeat_floor_std": 0.06129074469208717, "reward_near_duplicate_penalty_mean": 0.7400773167610168, "reward_near_duplicate_penalty_std": 0.1981327086687088, "reward_opening_diversity_mean": 0.8542613983154297, "reward_opening_diversity_std": 0.2397436797618866, "reward_distinct_2_mean": 0.4581839442253113, "reward_distinct_2_std": 0.3071747422218323, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.14026211202144623, "reward_total_composite_std": 0.06768891960382462} {"timestamp_utc": "2026-04-12T19:38:43Z", "mode": "train", "global_step": 975, "epoch": 0.0513130887848008, "loss": -0.0623, "grad_norm": 6.282349586486816, "learning_rate": 7.048484848484849e-06, "num_tokens": 1731370.0, "completions/mean_length": 93.75, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 34.0, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.8668069243431091, "rewards/meter/std": 0.22566258907318115, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9519826769828796, "rewards/lexical_plausibility/std": 0.11270204931497574, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.7283657193183899, "rewards/repeat_penalty/std": 0.15732789039611816, "rewards/repeat_floor/mean": 0.9734642505645752, "rewards/repeat_floor/std": 0.020226595923304558, "rewards/near_duplicate_penalty/mean": 0.9339142441749573, "rewards/near_duplicate_penalty/std": 0.06464814394712448, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9194676876068115, "rewards/distinct_2/std": 0.11235395073890686, "rewards/total_composite/mean": 0.238030344247818, "rewards/total_composite/std": 0.12912023067474365, "reward": 0.238030344247818, "reward_std": 0.12912021577358246, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16155895590782166, "sampling/sampling_logp_difference/max": 1.6713132858276367, "sampling/importance_sampling_ratio/min": 0.18800000846385956, "sampling/importance_sampling_ratio/mean": 1.0223023891448975, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1112970113754272, "clip_ratio/low_mean": 0.042171718552708626, "clip_ratio/low_min": 0.042171718552708626, "clip_ratio/high_mean": 0.10932516120374203, "clip_ratio/high_max": 0.10932516120374203, "clip_ratio/region_mean": 0.15149687975645065, "reward_total_mean": 0.238030344247818, "reward_meter_mean": 0.8668069243431091, "reward_meter_std": 0.22566258907318115, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9519826769828796, "reward_lexical_plausibility_std": 0.11270204931497574, "reward_repeat_penalty_mean": 0.7283657193183899, "reward_repeat_penalty_std": 0.15732789039611816, "reward_repeat_floor_mean": 0.9734642505645752, "reward_repeat_floor_std": 0.020226595923304558, "reward_near_duplicate_penalty_mean": 0.9339142441749573, "reward_near_duplicate_penalty_std": 0.06464814394712448, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9194676876068115, "reward_distinct_2_std": 0.11235395073890686, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.238030344247818, "reward_total_composite_std": 0.12912023067474365} {"timestamp_utc": "2026-04-12T19:38:57Z", "mode": "train", "global_step": 976, "epoch": 0.05136571759381085, "loss": -0.1167, "grad_norm": 4.999024868011475, "learning_rate": 7.045454545454546e-06, "num_tokens": 1733106.0, "completions/mean_length": 107.0, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 49.142860412597656, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.7845979928970337, "rewards/meter/std": 0.3847057521343231, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175492912530899, "rewards/lexical_plausibility/mean": 0.9493359327316284, "rewards/lexical_plausibility/std": 0.14329960942268372, "rewards/judge_quality/mean": 0.16249999403953552, "rewards/judge_quality/std": 0.08345229923725128, "rewards/repeat_penalty/mean": 0.5883820056915283, "rewards/repeat_penalty/std": 0.2849542796611786, "rewards/repeat_floor/mean": 0.9443279504776001, "rewards/repeat_floor/std": 0.0443461611866951, "rewards/near_duplicate_penalty/mean": 0.8288168907165527, "rewards/near_duplicate_penalty/std": 0.13788726925849915, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.18600596487522125, "rewards/distinct_2/mean": 0.7292263507843018, "rewards/distinct_2/std": 0.18950118124485016, "rewards/total_composite/mean": 0.13117390871047974, "rewards/total_composite/std": 0.09778672456741333, "reward": 0.13117390871047974, "reward_std": 0.09778672456741333, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13256482779979706, "sampling/sampling_logp_difference/max": 1.0620343685150146, "sampling/importance_sampling_ratio/min": 0.34575170278549194, "sampling/importance_sampling_ratio/mean": 1.019872784614563, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9142376482486725, "clip_ratio/low_mean": 0.053039186634123325, "clip_ratio/low_min": 0.053039186634123325, "clip_ratio/high_mean": 0.07695492263883352, "clip_ratio/high_max": 0.07695492263883352, "clip_ratio/region_mean": 0.12999410927295685, "reward_total_mean": 0.13117390871047974, "reward_meter_mean": 0.7845979928970337, "reward_meter_std": 0.3847057521343231, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175492912530899, "reward_lexical_plausibility_mean": 0.9493359327316284, "reward_lexical_plausibility_std": 0.14329960942268372, "reward_repeat_penalty_mean": 0.5883820056915283, "reward_repeat_penalty_std": 0.2849542796611786, "reward_repeat_floor_mean": 0.9443279504776001, "reward_repeat_floor_std": 0.0443461611866951, "reward_near_duplicate_penalty_mean": 0.8288168907165527, "reward_near_duplicate_penalty_std": 0.13788726925849915, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.18600596487522125, "reward_distinct_2_mean": 0.7292263507843018, "reward_distinct_2_std": 0.18950118124485016, "reward_judge_quality_mean": 0.16249999403953552, "reward_judge_quality_std": 0.08345229923725128, "reward_total_composite_mean": 0.13117390871047974, "reward_total_composite_std": 0.09778672456741333} {"timestamp_utc": "2026-04-12T19:39:07Z", "mode": "train", "global_step": 977, "epoch": 0.051418346402820905, "loss": -0.0165, "grad_norm": 9.522601127624512, "learning_rate": 7.0424242424242426e-06, "num_tokens": 1735170.0, "completions/mean_length": 79.0, "completions/min_length": 66.0, "completions/max_length": 95.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.0, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 95.0, "rewards/meter/mean": 0.7234905958175659, "rewards/meter/std": 0.22925277054309845, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9625000357627869, "rewards/count_floor/std": 0.031052952632308006, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.7888998985290527, "rewards/repeat_penalty/std": 0.16465048491954803, "rewards/repeat_floor/mean": 0.9782580733299255, "rewards/repeat_floor/std": 0.017079001292586327, "rewards/near_duplicate_penalty/mean": 0.9523767232894897, "rewards/near_duplicate_penalty/std": 0.03251688554883003, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.8461284637451172, "rewards/distinct_2/std": 0.1207500472664833, "rewards/total_composite/mean": 0.16878071427345276, "rewards/total_composite/std": 0.0734722912311554, "reward": 0.16878071427345276, "reward_std": 0.0734722912311554, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15607404708862305, "sampling/sampling_logp_difference/max": 1.5497758388519287, "sampling/importance_sampling_ratio/min": 0.2122955471277237, "sampling/importance_sampling_ratio/mean": 1.0087289810180664, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0343920290470123, "clip_ratio/low_mean": 0.04488448053598404, "clip_ratio/low_min": 0.04488448053598404, "clip_ratio/high_mean": 0.08986167516559362, "clip_ratio/high_max": 0.08986167516559362, "clip_ratio/region_mean": 0.13474615570157766, "reward_total_mean": 0.16878071427345276, "reward_meter_mean": 0.7234905958175659, "reward_meter_std": 0.22925277054309845, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9625000357627869, "reward_count_floor_std": 0.031052952632308006, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7888998985290527, "reward_repeat_penalty_std": 0.16465048491954803, "reward_repeat_floor_mean": 0.9782580733299255, "reward_repeat_floor_std": 0.017079001292586327, "reward_near_duplicate_penalty_mean": 0.9523767232894897, "reward_near_duplicate_penalty_std": 0.03251688554883003, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.8461284637451172, "reward_distinct_2_std": 0.1207500472664833, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.16878071427345276, "reward_total_composite_std": 0.0734722912311554} {"timestamp_utc": "2026-04-12T19:39:22Z", "mode": "train", "global_step": 978, "epoch": 0.05147097521183096, "loss": -0.0334, "grad_norm": 2.9417386054992676, "learning_rate": 7.039393939393941e-06, "num_tokens": 1737045.0, "completions/mean_length": 174.375, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 61.833335876464844, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.6534391641616821, "rewards/meter/std": 0.4237983524799347, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.053032997995615005, "rewards/lexical_plausibility/mean": 0.8672837615013123, "rewards/lexical_plausibility/std": 0.22072960436344147, "rewards/judge_quality/mean": 0.23125000298023224, "rewards/judge_quality/std": 0.2103356271982193, "rewards/repeat_penalty/mean": 0.7841565012931824, "rewards/repeat_penalty/std": 0.13806259632110596, "rewards/repeat_floor/mean": 0.9757506847381592, "rewards/repeat_floor/std": 0.01494610495865345, "rewards/near_duplicate_penalty/mean": 0.9242197275161743, "rewards/near_duplicate_penalty/std": 0.0468585379421711, "rewards/opening_diversity/mean": 0.9508928656578064, "rewards/opening_diversity/std": 0.09533105045557022, "rewards/distinct_2/mean": 0.88960200548172, "rewards/distinct_2/std": 0.08879511058330536, "rewards/total_composite/mean": 0.16443876922130585, "rewards/total_composite/std": 0.18450936675071716, "reward": 0.16443876922130585, "reward_std": 0.18450935184955597, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.162736177444458, "sampling/sampling_logp_difference/max": 1.5083184242248535, "sampling/importance_sampling_ratio/min": 0.2212817668914795, "sampling/importance_sampling_ratio/mean": 1.0156605243682861, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.789588488638401, "clip_ratio/low_mean": 0.06831929553300142, "clip_ratio/low_min": 0.06831929553300142, "clip_ratio/high_mean": 0.04146765172481537, "clip_ratio/high_max": 0.04146765172481537, "clip_ratio/region_mean": 0.10978694725781679, "reward_total_mean": 0.16443876922130585, "reward_meter_mean": 0.6534391641616821, "reward_meter_std": 0.4237983524799347, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.053032997995615005, "reward_lexical_plausibility_mean": 0.8672837615013123, "reward_lexical_plausibility_std": 0.22072960436344147, "reward_repeat_penalty_mean": 0.7841565012931824, "reward_repeat_penalty_std": 0.13806259632110596, "reward_repeat_floor_mean": 0.9757506847381592, "reward_repeat_floor_std": 0.01494610495865345, "reward_near_duplicate_penalty_mean": 0.9242197275161743, "reward_near_duplicate_penalty_std": 0.0468585379421711, "reward_opening_diversity_mean": 0.9508928656578064, "reward_opening_diversity_std": 0.09533105045557022, "reward_distinct_2_mean": 0.88960200548172, "reward_distinct_2_std": 0.08879511058330536, "reward_judge_quality_mean": 0.23125000298023224, "reward_judge_quality_std": 0.2103356271982193, "reward_total_composite_mean": 0.16443876922130585, "reward_total_composite_std": 0.18450936675071716} {"timestamp_utc": "2026-04-12T19:39:36Z", "mode": "train", "global_step": 979, "epoch": 0.05152360402084101, "loss": -0.0126, "grad_norm": 4.711750030517578, "learning_rate": 7.036363636363637e-06, "num_tokens": 1738775.0, "completions/mean_length": 113.25, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 56.28571701049805, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.9221183657646179, "rewards/meter/std": 0.10711797326803207, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9554562568664551, "rewards/lexical_plausibility/std": 0.12598878145217896, "rewards/judge_quality/mean": 0.3087500035762787, "rewards/judge_quality/std": 0.2728912830352783, "rewards/repeat_penalty/mean": 0.7102515697479248, "rewards/repeat_penalty/std": 0.24917364120483398, "rewards/repeat_floor/mean": 0.966413140296936, "rewards/repeat_floor/std": 0.025598620995879173, "rewards/near_duplicate_penalty/mean": 0.8830002546310425, "rewards/near_duplicate_penalty/std": 0.06831125169992447, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8218122720718384, "rewards/distinct_2/std": 0.20058032870292664, "rewards/total_composite/mean": 0.2271711528301239, "rewards/total_composite/std": 0.1514083296060562, "reward": 0.2271711528301239, "reward_std": 0.15140831470489502, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15027040243148804, "sampling/sampling_logp_difference/max": 2.3592848777770996, "sampling/importance_sampling_ratio/min": 0.09448777139186859, "sampling/importance_sampling_ratio/mean": 1.0147895812988281, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7766230329871178, "clip_ratio/low_mean": 0.04790704511106014, "clip_ratio/low_min": 0.04790704511106014, "clip_ratio/high_mean": 0.08284418471157551, "clip_ratio/high_max": 0.08284418471157551, "clip_ratio/region_mean": 0.13075122982263565, "reward_total_mean": 0.2271711528301239, "reward_meter_mean": 0.9221183657646179, "reward_meter_std": 0.10711797326803207, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9554562568664551, "reward_lexical_plausibility_std": 0.12598878145217896, "reward_repeat_penalty_mean": 0.7102515697479248, "reward_repeat_penalty_std": 0.24917364120483398, "reward_repeat_floor_mean": 0.966413140296936, "reward_repeat_floor_std": 0.025598620995879173, "reward_near_duplicate_penalty_mean": 0.8830002546310425, "reward_near_duplicate_penalty_std": 0.06831125169992447, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8218122720718384, "reward_distinct_2_std": 0.20058032870292664, "reward_judge_quality_mean": 0.3087500035762787, "reward_judge_quality_std": 0.2728912830352783, "reward_total_composite_mean": 0.2271711528301239, "reward_total_composite_std": 0.1514083296060562} {"timestamp_utc": "2026-04-12T19:39:51Z", "mode": "train", "global_step": 980, "epoch": 0.05157623282985106, "loss": -0.0726, "grad_norm": 7.281307220458984, "learning_rate": 7.033333333333334e-06, "num_tokens": 1740339.0, "completions/mean_length": 99.5, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 40.57143020629883, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.5013697743415833, "rewards/meter/std": 0.42095452547073364, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9430537819862366, "rewards/lexical_plausibility/std": 0.16106823086738586, "rewards/judge_quality/mean": 0.5512499809265137, "rewards/judge_quality/std": 0.3296508193016052, "rewards/repeat_penalty/mean": 0.9501906633377075, "rewards/repeat_penalty/std": 0.08315180242061615, "rewards/repeat_floor/mean": 0.9953410625457764, "rewards/repeat_floor/std": 0.005080376751720905, "rewards/near_duplicate_penalty/mean": 0.9814406633377075, "rewards/near_duplicate_penalty/std": 0.02067345753312111, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.30800536274909973, "rewards/total_composite/std": 0.29107582569122314, "reward": 0.30800536274909973, "reward_std": 0.29107579588890076, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.142264723777771, "sampling/sampling_logp_difference/max": 1.2008533477783203, "sampling/importance_sampling_ratio/min": 0.300937294960022, "sampling/importance_sampling_ratio/mean": 1.0181927680969238, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8764906153082848, "clip_ratio/low_mean": 0.050627183401957154, "clip_ratio/low_min": 0.050627183401957154, "clip_ratio/high_mean": 0.06795885041356087, "clip_ratio/high_max": 0.06795885041356087, "clip_ratio/region_mean": 0.11858603381551802, "reward_total_mean": 0.30800536274909973, "reward_meter_mean": 0.5013697743415833, "reward_meter_std": 0.42095452547073364, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9430537819862366, "reward_lexical_plausibility_std": 0.16106823086738586, "reward_repeat_penalty_mean": 0.9501906633377075, "reward_repeat_penalty_std": 0.08315180242061615, "reward_repeat_floor_mean": 0.9953410625457764, "reward_repeat_floor_std": 0.005080376751720905, "reward_near_duplicate_penalty_mean": 0.9814406633377075, "reward_near_duplicate_penalty_std": 0.02067345753312111, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5512499809265137, "reward_judge_quality_std": 0.3296508193016052, "reward_total_composite_mean": 0.30800536274909973, "reward_total_composite_std": 0.29107582569122314} {"timestamp_utc": "2026-04-12T19:40:07Z", "mode": "train", "global_step": 981, "epoch": 0.051628861638861115, "loss": -0.1136, "grad_norm": 5.602263927459717, "learning_rate": 7.030303030303031e-06, "num_tokens": 1742416.0, "completions/mean_length": 143.625, "completions/min_length": 73.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 91.00000762939453, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 107.0, "rewards/meter/mean": 0.6096323132514954, "rewards/meter/std": 0.21670779585838318, "rewards/count_adherence/mean": 0.8541666269302368, "rewards/count_adherence/std": 0.0589255727827549, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9562499523162842, "rewards/count_floor/std": 0.01767767407000065, "rewards/lexical_plausibility/mean": 0.9634765386581421, "rewards/lexical_plausibility/std": 0.10330399125814438, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.523923397064209, "rewards/repeat_penalty/std": 0.3207071125507355, "rewards/repeat_floor/mean": 0.9451455473899841, "rewards/repeat_floor/std": 0.04579712823033333, "rewards/near_duplicate_penalty/mean": 0.8665324449539185, "rewards/near_duplicate_penalty/std": 0.12881141901016235, "rewards/opening_diversity/mean": 0.8772727251052856, "rewards/opening_diversity/std": 0.18227215111255646, "rewards/distinct_2/mean": 0.6947696805000305, "rewards/distinct_2/std": 0.24594655632972717, "rewards/total_composite/mean": 0.15561579167842865, "rewards/total_composite/std": 0.061649389564991, "reward": 0.15561579167842865, "reward_std": 0.061649389564991, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16433143615722656, "sampling/sampling_logp_difference/max": 1.791287899017334, "sampling/importance_sampling_ratio/min": 0.16674529016017914, "sampling/importance_sampling_ratio/mean": 1.0020898580551147, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8947829157114029, "clip_ratio/low_mean": 0.04905950138345361, "clip_ratio/low_min": 0.04905950138345361, "clip_ratio/high_mean": 0.09206949733197689, "clip_ratio/high_max": 0.09206949733197689, "clip_ratio/region_mean": 0.1411289987154305, "reward_total_mean": 0.15561579167842865, "reward_meter_mean": 0.6096323132514954, "reward_meter_std": 0.21670779585838318, "reward_count_adherence_mean": 0.8541666269302368, "reward_count_adherence_std": 0.0589255727827549, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9562499523162842, "reward_count_floor_std": 0.01767767407000065, "reward_lexical_plausibility_mean": 0.9634765386581421, "reward_lexical_plausibility_std": 0.10330399125814438, "reward_repeat_penalty_mean": 0.523923397064209, "reward_repeat_penalty_std": 0.3207071125507355, "reward_repeat_floor_mean": 0.9451455473899841, "reward_repeat_floor_std": 0.04579712823033333, "reward_near_duplicate_penalty_mean": 0.8665324449539185, "reward_near_duplicate_penalty_std": 0.12881141901016235, "reward_opening_diversity_mean": 0.8772727251052856, "reward_opening_diversity_std": 0.18227215111255646, "reward_distinct_2_mean": 0.6947696805000305, "reward_distinct_2_std": 0.24594655632972717, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.15561579167842865, "reward_total_composite_std": 0.061649389564991} {"timestamp_utc": "2026-04-12T19:40:21Z", "mode": "train", "global_step": 982, "epoch": 0.05168149044787117, "loss": -0.0648, "grad_norm": 2.4111146926879883, "learning_rate": 7.027272727272728e-06, "num_tokens": 1744056.0, "completions/mean_length": 221.0, "completions/min_length": 23.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 46.400001525878906, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.5399047136306763, "rewards/meter/std": 0.3687581419944763, "rewards/count_adherence/mean": 0.53125, "rewards/count_adherence/std": 0.2086307406425476, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.859375, "rewards/count_floor/std": 0.06258923560380936, "rewards/lexical_plausibility/mean": 0.8683696985244751, "rewards/lexical_plausibility/std": 0.18313650786876678, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.91753089427948, "rewards/repeat_penalty/std": 0.08553789556026459, "rewards/repeat_floor/mean": 0.9917012453079224, "rewards/repeat_floor/std": 0.006855242885649204, "rewards/near_duplicate_penalty/mean": 0.9715892672538757, "rewards/near_duplicate_penalty/std": 0.029122455045580864, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9759762287139893, "rewards/distinct_2/std": 0.03664376586675644, "rewards/total_composite/mean": 0.10129118710756302, "rewards/total_composite/std": 0.09476771205663681, "reward": 0.10129118710756302, "reward_std": 0.09476771205663681, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19497662782669067, "sampling/sampling_logp_difference/max": 1.427119255065918, "sampling/importance_sampling_ratio/min": 0.23999930918216705, "sampling/importance_sampling_ratio/mean": 0.9906262159347534, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0351803004741669, "clip_ratio/low_mean": 0.013461538590490818, "clip_ratio/low_min": 0.013461538590490818, "clip_ratio/high_mean": 0.13716032542288303, "clip_ratio/high_max": 0.13716032542288303, "clip_ratio/region_mean": 0.15062186401337385, "reward_total_mean": 0.10129118710756302, "reward_meter_mean": 0.5399047136306763, "reward_meter_std": 0.3687581419944763, "reward_count_adherence_mean": 0.53125, "reward_count_adherence_std": 0.2086307406425476, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.859375, "reward_count_floor_std": 0.06258923560380936, "reward_lexical_plausibility_mean": 0.8683696985244751, "reward_lexical_plausibility_std": 0.18313650786876678, "reward_repeat_penalty_mean": 0.91753089427948, "reward_repeat_penalty_std": 0.08553789556026459, "reward_repeat_floor_mean": 0.9917012453079224, "reward_repeat_floor_std": 0.006855242885649204, "reward_near_duplicate_penalty_mean": 0.9715892672538757, "reward_near_duplicate_penalty_std": 0.029122455045580864, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9759762287139893, "reward_distinct_2_std": 0.03664376586675644, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.10129118710756302, "reward_total_composite_std": 0.09476771205663681} {"timestamp_utc": "2026-04-12T19:40:36Z", "mode": "train", "global_step": 983, "epoch": 0.05173411925688122, "loss": -0.1172, "grad_norm": 3.152083158493042, "learning_rate": 7.024242424242424e-06, "num_tokens": 1745985.0, "completions/mean_length": 257.125, "completions/min_length": 93.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 104.20000457763672, "completions/min_terminated_length": 93.0, "completions/max_terminated_length": 121.0, "rewards/meter/mean": 0.4858367443084717, "rewards/meter/std": 0.3778248429298401, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.19416078925132751, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.058248236775398254, "rewards/lexical_plausibility/mean": 0.8242735862731934, "rewards/lexical_plausibility/std": 0.2443189173936844, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.709581732749939, "rewards/repeat_penalty/std": 0.33633026480674744, "rewards/repeat_floor/mean": 0.9660537838935852, "rewards/repeat_floor/std": 0.04854338616132736, "rewards/near_duplicate_penalty/mean": 0.9026554226875305, "rewards/near_duplicate_penalty/std": 0.10118906944990158, "rewards/opening_diversity/mean": 0.984375, "rewards/opening_diversity/std": 0.04419417306780815, "rewards/distinct_2/mean": 0.7954776287078857, "rewards/distinct_2/std": 0.3431466221809387, "rewards/total_composite/mean": 0.15342482924461365, "rewards/total_composite/std": 0.15523755550384521, "reward": 0.15342482924461365, "reward_std": 0.15523755550384521, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1514987349510193, "sampling/sampling_logp_difference/max": 1.7979998588562012, "sampling/importance_sampling_ratio/min": 0.1758684664964676, "sampling/importance_sampling_ratio/mean": 1.0104864835739136, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5023180171847343, "clip_ratio/low_mean": 0.00826446246355772, "clip_ratio/low_min": 0.00826446246355772, "clip_ratio/high_mean": 0.0801688376814127, "clip_ratio/high_max": 0.0801688376814127, "clip_ratio/region_mean": 0.08843330014497042, "reward_total_mean": 0.15342482924461365, "reward_meter_mean": 0.4858367443084717, "reward_meter_std": 0.3778248429298401, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.19416078925132751, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.058248236775398254, "reward_lexical_plausibility_mean": 0.8242735862731934, "reward_lexical_plausibility_std": 0.2443189173936844, "reward_repeat_penalty_mean": 0.709581732749939, "reward_repeat_penalty_std": 0.33633026480674744, "reward_repeat_floor_mean": 0.9660537838935852, "reward_repeat_floor_std": 0.04854338616132736, "reward_near_duplicate_penalty_mean": 0.9026554226875305, "reward_near_duplicate_penalty_std": 0.10118906944990158, "reward_opening_diversity_mean": 0.984375, "reward_opening_diversity_std": 0.04419417306780815, "reward_distinct_2_mean": 0.7954776287078857, "reward_distinct_2_std": 0.3431466221809387, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.15342482924461365, "reward_total_composite_std": 0.15523755550384521} {"timestamp_utc": "2026-04-12T19:40:46Z", "mode": "train", "global_step": 984, "epoch": 0.05178674806589127, "loss": -0.1284, "grad_norm": 12.46694564819336, "learning_rate": 7.021212121212122e-06, "num_tokens": 1747856.0, "completions/mean_length": 57.875, "completions/min_length": 40.0, "completions/max_length": 76.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.875, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.9671827554702759, "rewards/meter/std": 0.03809695690870285, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.7879979014396667, "rewards/repeat_penalty/std": 0.16411684453487396, "rewards/repeat_floor/mean": 0.9735134243965149, "rewards/repeat_floor/std": 0.02506200224161148, "rewards/near_duplicate_penalty/mean": 0.9086606502532959, "rewards/near_duplicate_penalty/std": 0.11212155967950821, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8579369783401489, "rewards/distinct_2/std": 0.1026187464594841, "rewards/total_composite/mean": 0.3434147238731384, "rewards/total_composite/std": 0.19259168207645416, "reward": 0.3434147238731384, "reward_std": 0.19259168207645416, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16055570542812347, "sampling/sampling_logp_difference/max": 2.009434700012207, "sampling/importance_sampling_ratio/min": 0.1340644508600235, "sampling/importance_sampling_ratio/mean": 1.0233654975891113, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9670621529221535, "clip_ratio/low_mean": 0.09576516877859831, "clip_ratio/low_min": 0.09576516877859831, "clip_ratio/high_mean": 0.06828634068369865, "clip_ratio/high_max": 0.06828634068369865, "clip_ratio/region_mean": 0.16405150946229696, "reward_total_mean": 0.3434147238731384, "reward_meter_mean": 0.9671827554702759, "reward_meter_std": 0.03809695690870285, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7879979014396667, "reward_repeat_penalty_std": 0.16411684453487396, "reward_repeat_floor_mean": 0.9735134243965149, "reward_repeat_floor_std": 0.02506200224161148, "reward_near_duplicate_penalty_mean": 0.9086606502532959, "reward_near_duplicate_penalty_std": 0.11212155967950821, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8579369783401489, "reward_distinct_2_std": 0.1026187464594841, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.3434147238731384, "reward_total_composite_std": 0.19259168207645416} {"timestamp_utc": "2026-04-12T19:41:00Z", "mode": "train", "global_step": 985, "epoch": 0.05183937687490132, "loss": -0.0363, "grad_norm": 5.490208625793457, "learning_rate": 7.018181818181818e-06, "num_tokens": 1749594.0, "completions/mean_length": 117.25, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 60.857147216796875, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.8051995038986206, "rewards/meter/std": 0.27309978008270264, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9718749523162842, "rewards/count_floor/std": 0.05580177903175354, "rewards/lexical_plausibility/mean": 0.972457766532898, "rewards/lexical_plausibility/std": 0.07790117710828781, "rewards/judge_quality/mean": 0.33375000953674316, "rewards/judge_quality/std": 0.2653266191482544, "rewards/repeat_penalty/mean": 0.9663611650466919, "rewards/repeat_penalty/std": 0.02206224761903286, "rewards/repeat_floor/mean": 0.9958232641220093, "rewards/repeat_floor/std": 0.0021291167940944433, "rewards/near_duplicate_penalty/mean": 0.9812142848968506, "rewards/near_duplicate_penalty/std": 0.008108322508633137, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9849016666412354, "rewards/distinct_2/std": 0.022879112511873245, "rewards/total_composite/mean": 0.28808528184890747, "rewards/total_composite/std": 0.2510199248790741, "reward": 0.28808528184890747, "reward_std": 0.2510199248790741, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1580878496170044, "sampling/sampling_logp_difference/max": 1.9391846656799316, "sampling/importance_sampling_ratio/min": 0.14382116496562958, "sampling/importance_sampling_ratio/mean": 1.0177786350250244, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6177263595163822, "clip_ratio/low_mean": 0.045895135030150414, "clip_ratio/low_min": 0.045895135030150414, "clip_ratio/high_mean": 0.08070050645619631, "clip_ratio/high_max": 0.08070050645619631, "clip_ratio/region_mean": 0.12659564148634672, "reward_total_mean": 0.28808528184890747, "reward_meter_mean": 0.8051995038986206, "reward_meter_std": 0.27309978008270264, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9718749523162842, "reward_count_floor_std": 0.05580177903175354, "reward_lexical_plausibility_mean": 0.972457766532898, "reward_lexical_plausibility_std": 0.07790117710828781, "reward_repeat_penalty_mean": 0.9663611650466919, "reward_repeat_penalty_std": 0.02206224761903286, "reward_repeat_floor_mean": 0.9958232641220093, "reward_repeat_floor_std": 0.0021291167940944433, "reward_near_duplicate_penalty_mean": 0.9812142848968506, "reward_near_duplicate_penalty_std": 0.008108322508633137, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9849016666412354, "reward_distinct_2_std": 0.022879112511873245, "reward_judge_quality_mean": 0.33375000953674316, "reward_judge_quality_std": 0.2653266191482544, "reward_total_composite_mean": 0.28808528184890747, "reward_total_composite_std": 0.2510199248790741} {"timestamp_utc": "2026-04-12T19:41:14Z", "mode": "train", "global_step": 986, "epoch": 0.05189200568391137, "loss": -0.1813, "grad_norm": 3.5879359245300293, "learning_rate": 7.015151515151516e-06, "num_tokens": 1752183.0, "completions/mean_length": 184.625, "completions/min_length": 116.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 137.85714721679688, "completions/min_terminated_length": 116.0, "completions/max_terminated_length": 184.0, "rewards/meter/mean": 0.7311665415763855, "rewards/meter/std": 0.33589377999305725, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.0578637570142746, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.953125, "rewards/count_floor/std": 0.017359109595417976, "rewards/lexical_plausibility/mean": 0.946574866771698, "rewards/lexical_plausibility/std": 0.15110905468463898, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.0353553406894207, "rewards/repeat_penalty/mean": 0.3428924083709717, "rewards/repeat_penalty/std": 0.27344465255737305, "rewards/repeat_floor/mean": 0.9182778000831604, "rewards/repeat_floor/std": 0.04620883986353874, "rewards/near_duplicate_penalty/mean": 0.8172633051872253, "rewards/near_duplicate_penalty/std": 0.10879214107990265, "rewards/opening_diversity/mean": 0.9143544435501099, "rewards/opening_diversity/std": 0.12935413420200348, "rewards/distinct_2/mean": 0.4536336660385132, "rewards/distinct_2/std": 0.2980527877807617, "rewards/total_composite/mean": 0.09469848871231079, "rewards/total_composite/std": 0.044970057904720306, "reward": 0.09469848871231079, "reward_std": 0.044970057904720306, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13201110064983368, "sampling/sampling_logp_difference/max": 2.124917507171631, "sampling/importance_sampling_ratio/min": 0.11944282054901123, "sampling/importance_sampling_ratio/mean": 1.0128896236419678, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7170674204826355, "clip_ratio/low_mean": 0.024541988968849182, "clip_ratio/low_min": 0.024541988968849182, "clip_ratio/high_mean": 0.07692741509526968, "clip_ratio/high_max": 0.07692741509526968, "clip_ratio/region_mean": 0.10146940406411886, "reward_total_mean": 0.09469848871231079, "reward_meter_mean": 0.7311665415763855, "reward_meter_std": 0.33589377999305725, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.0578637570142746, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.953125, "reward_count_floor_std": 0.017359109595417976, "reward_lexical_plausibility_mean": 0.946574866771698, "reward_lexical_plausibility_std": 0.15110905468463898, "reward_repeat_penalty_mean": 0.3428924083709717, "reward_repeat_penalty_std": 0.27344465255737305, "reward_repeat_floor_mean": 0.9182778000831604, "reward_repeat_floor_std": 0.04620883986353874, "reward_near_duplicate_penalty_mean": 0.8172633051872253, "reward_near_duplicate_penalty_std": 0.10879214107990265, "reward_opening_diversity_mean": 0.9143544435501099, "reward_opening_diversity_std": 0.12935413420200348, "reward_distinct_2_mean": 0.4536336660385132, "reward_distinct_2_std": 0.2980527877807617, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.0353553406894207, "reward_total_composite_mean": 0.09469848871231079, "reward_total_composite_std": 0.044970057904720306} {"timestamp_utc": "2026-04-12T19:41:23Z", "mode": "train", "global_step": 987, "epoch": 0.05194463449292142, "loss": 0.1011, "grad_norm": 14.259634971618652, "learning_rate": 7.0121212121212126e-06, "num_tokens": 1753798.0, "completions/mean_length": 43.875, "completions/min_length": 38.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.875, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.8553590178489685, "rewards/meter/std": 0.21360167860984802, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4287499785423279, "rewards/judge_quality/std": 0.20746342837810516, "rewards/repeat_penalty/mean": 0.8162665367126465, "rewards/repeat_penalty/std": 0.14816901087760925, "rewards/repeat_floor/mean": 0.9770795106887817, "rewards/repeat_floor/std": 0.017852913588285446, "rewards/near_duplicate_penalty/mean": 0.9080779552459717, "rewards/near_duplicate_penalty/std": 0.06150315701961517, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9193644523620605, "rewards/distinct_2/std": 0.05791359022259712, "rewards/total_composite/mean": 0.3761236071586609, "rewards/total_composite/std": 0.2318309098482132, "reward": 0.3761236071586609, "reward_std": 0.2318309098482132, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16257882118225098, "sampling/sampling_logp_difference/max": 1.484790325164795, "sampling/importance_sampling_ratio/min": 0.22654984891414642, "sampling/importance_sampling_ratio/mean": 1.0188466310501099, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0776085332036018, "clip_ratio/low_mean": 0.0735879885032773, "clip_ratio/low_min": 0.0735879885032773, "clip_ratio/high_mean": 0.07214896846562624, "clip_ratio/high_max": 0.07214896846562624, "clip_ratio/region_mean": 0.14573695696890354, "reward_total_mean": 0.3761236071586609, "reward_meter_mean": 0.8553590178489685, "reward_meter_std": 0.21360167860984802, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8162665367126465, "reward_repeat_penalty_std": 0.14816901087760925, "reward_repeat_floor_mean": 0.9770795106887817, "reward_repeat_floor_std": 0.017852913588285446, "reward_near_duplicate_penalty_mean": 0.9080779552459717, "reward_near_duplicate_penalty_std": 0.06150315701961517, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9193644523620605, "reward_distinct_2_std": 0.05791359022259712, "reward_judge_quality_mean": 0.4287499785423279, "reward_judge_quality_std": 0.20746342837810516, "reward_total_composite_mean": 0.3761236071586609, "reward_total_composite_std": 0.2318309098482132} {"timestamp_utc": "2026-04-12T19:41:37Z", "mode": "train", "global_step": 988, "epoch": 0.051997263301931475, "loss": -0.0333, "grad_norm": 5.760228157043457, "learning_rate": 7.00909090909091e-06, "num_tokens": 1755222.0, "completions/mean_length": 99.0, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 40.0, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.7354631423950195, "rewards/meter/std": 0.4045969843864441, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9584840536117554, "rewards/lexical_plausibility/std": 0.1174248680472374, "rewards/judge_quality/mean": 0.38374999165534973, "rewards/judge_quality/std": 0.2579555809497833, "rewards/repeat_penalty/mean": 0.8071895241737366, "rewards/repeat_penalty/std": 0.1083652675151825, "rewards/repeat_floor/mean": 0.9800229072570801, "rewards/repeat_floor/std": 0.014075199142098427, "rewards/near_duplicate_penalty/mean": 0.9385877251625061, "rewards/near_duplicate_penalty/std": 0.0692981407046318, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9220526218414307, "rewards/distinct_2/std": 0.07810666412115097, "rewards/total_composite/mean": 0.3047555088996887, "rewards/total_composite/std": 0.26785439252853394, "reward": 0.3047555088996887, "reward_std": 0.26785439252853394, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1661999672651291, "sampling/sampling_logp_difference/max": 1.9121756553649902, "sampling/importance_sampling_ratio/min": 0.14775855839252472, "sampling/importance_sampling_ratio/mean": 0.9966478943824768, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7666777074337006, "clip_ratio/low_mean": 0.06960220634937286, "clip_ratio/low_min": 0.06960220634937286, "clip_ratio/high_mean": 0.09643602184951305, "clip_ratio/high_max": 0.09643602184951305, "clip_ratio/region_mean": 0.16603822819888592, "reward_total_mean": 0.3047555088996887, "reward_meter_mean": 0.7354631423950195, "reward_meter_std": 0.4045969843864441, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9584840536117554, "reward_lexical_plausibility_std": 0.1174248680472374, "reward_repeat_penalty_mean": 0.8071895241737366, "reward_repeat_penalty_std": 0.1083652675151825, "reward_repeat_floor_mean": 0.9800229072570801, "reward_repeat_floor_std": 0.014075199142098427, "reward_near_duplicate_penalty_mean": 0.9385877251625061, "reward_near_duplicate_penalty_std": 0.0692981407046318, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9220526218414307, "reward_distinct_2_std": 0.07810666412115097, "reward_judge_quality_mean": 0.38374999165534973, "reward_judge_quality_std": 0.2579555809497833, "reward_total_composite_mean": 0.3047555088996887, "reward_total_composite_std": 0.26785439252853394} {"timestamp_utc": "2026-04-12T19:41:46Z", "mode": "train", "global_step": 989, "epoch": 0.05204989211094153, "loss": 0.0084, "grad_norm": 14.503719329833984, "learning_rate": 7.006060606060606e-06, "num_tokens": 1757201.0, "completions/mean_length": 59.375, "completions/min_length": 52.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 59.375, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.753119945526123, "rewards/meter/std": 0.35611605644226074, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.24032345414161682, "rewards/repeat_penalty/mean": 0.7723912000656128, "rewards/repeat_penalty/std": 0.23510518670082092, "rewards/repeat_floor/mean": 0.9704902172088623, "rewards/repeat_floor/std": 0.03147847205400467, "rewards/near_duplicate_penalty/mean": 0.8949650526046753, "rewards/near_duplicate_penalty/std": 0.09759186208248138, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.847171425819397, "rewards/distinct_2/std": 0.20438216626644135, "rewards/total_composite/mean": 0.2648583650588989, "rewards/total_composite/std": 0.17425023019313812, "reward": 0.2648583650588989, "reward_std": 0.17425024509429932, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14865384995937347, "sampling/sampling_logp_difference/max": 2.655883312225342, "sampling/importance_sampling_ratio/min": 0.07023677229881287, "sampling/importance_sampling_ratio/mean": 0.9875383973121643, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8590160459280014, "clip_ratio/low_mean": 0.04135649371892214, "clip_ratio/low_min": 0.04135649371892214, "clip_ratio/high_mean": 0.10494442097842693, "clip_ratio/high_max": 0.10494442097842693, "clip_ratio/region_mean": 0.14630091469734907, "reward_total_mean": 0.2648583650588989, "reward_meter_mean": 0.753119945526123, "reward_meter_std": 0.35611605644226074, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.7723912000656128, "reward_repeat_penalty_std": 0.23510518670082092, "reward_repeat_floor_mean": 0.9704902172088623, "reward_repeat_floor_std": 0.03147847205400467, "reward_near_duplicate_penalty_mean": 0.8949650526046753, "reward_near_duplicate_penalty_std": 0.09759186208248138, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.847171425819397, "reward_distinct_2_std": 0.20438216626644135, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.24032345414161682, "reward_total_composite_mean": 0.2648583650588989, "reward_total_composite_std": 0.17425023019313812} {"timestamp_utc": "2026-04-12T19:41:55Z", "mode": "train", "global_step": 990, "epoch": 0.05210252091995158, "loss": 0.0212, "grad_norm": 10.293787956237793, "learning_rate": 7.0030303030303035e-06, "num_tokens": 1759252.0, "completions/mean_length": 76.375, "completions/min_length": 52.0, "completions/max_length": 91.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 76.375, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.3753584921360016, "rewards/meter/std": 0.3555986285209656, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.6902063488960266, "rewards/repeat_penalty/std": 0.09471764415502548, "rewards/repeat_floor/mean": 0.9640001058578491, "rewards/repeat_floor/std": 0.011091821826994419, "rewards/near_duplicate_penalty/mean": 0.9010778665542603, "rewards/near_duplicate_penalty/std": 0.03414170444011688, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7648714780807495, "rewards/distinct_2/std": 0.09027978032827377, "rewards/total_composite/mean": 0.1398789882659912, "rewards/total_composite/std": 0.14445915818214417, "reward": 0.1398789882659912, "reward_std": 0.14445915818214417, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14950519800186157, "sampling/sampling_logp_difference/max": 4.399341583251953, "sampling/importance_sampling_ratio/min": 0.012285426259040833, "sampling/importance_sampling_ratio/mean": 1.0108695030212402, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.802264578640461, "clip_ratio/low_mean": 0.08543698769062757, "clip_ratio/low_min": 0.08543698769062757, "clip_ratio/high_mean": 0.05243348143994808, "clip_ratio/high_max": 0.05243348143994808, "clip_ratio/region_mean": 0.13787046913057566, "reward_total_mean": 0.1398789882659912, "reward_meter_mean": 0.3753584921360016, "reward_meter_std": 0.3555986285209656, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6902063488960266, "reward_repeat_penalty_std": 0.09471764415502548, "reward_repeat_floor_mean": 0.9640001058578491, "reward_repeat_floor_std": 0.011091821826994419, "reward_near_duplicate_penalty_mean": 0.9010778665542603, "reward_near_duplicate_penalty_std": 0.03414170444011688, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7648714780807495, "reward_distinct_2_std": 0.09027978032827377, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.1398789882659912, "reward_total_composite_std": 0.14445915818214417} {"timestamp_utc": "2026-04-12T19:42:09Z", "mode": "train", "global_step": 991, "epoch": 0.05215514972896163, "loss": -0.0592, "grad_norm": 6.651369094848633, "learning_rate": 7e-06, "num_tokens": 1761192.0, "completions/mean_length": 117.5, "completions/min_length": 27.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 61.142860412597656, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.7795392870903015, "rewards/meter/std": 0.21611040830612183, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.07763238251209259, "rewards/lexical_plausibility/mean": 0.9535982608795166, "rewards/lexical_plausibility/std": 0.11648311465978622, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.6481847167015076, "rewards/repeat_penalty/std": 0.31310275197029114, "rewards/repeat_floor/mean": 0.9519377946853638, "rewards/repeat_floor/std": 0.05035944655537605, "rewards/near_duplicate_penalty/mean": 0.8536094427108765, "rewards/near_duplicate_penalty/std": 0.13116014003753662, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.18600596487522125, "rewards/distinct_2/mean": 0.7724599838256836, "rewards/distinct_2/std": 0.25449228286743164, "rewards/total_composite/mean": 0.18278560042381287, "rewards/total_composite/std": 0.1323985755443573, "reward": 0.18278560042381287, "reward_std": 0.1323985755443573, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16739000380039215, "sampling/sampling_logp_difference/max": 1.6728935241699219, "sampling/importance_sampling_ratio/min": 0.18770314753055573, "sampling/importance_sampling_ratio/mean": 0.9968866109848022, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.926862820982933, "clip_ratio/low_mean": 0.033057416789233685, "clip_ratio/low_min": 0.033057416789233685, "clip_ratio/high_mean": 0.07861966080963612, "clip_ratio/high_max": 0.07861966080963612, "clip_ratio/region_mean": 0.1116770775988698, "reward_total_mean": 0.18278560042381287, "reward_meter_mean": 0.7795392870903015, "reward_meter_std": 0.21611040830612183, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.07763238251209259, "reward_lexical_plausibility_mean": 0.9535982608795166, "reward_lexical_plausibility_std": 0.11648311465978622, "reward_repeat_penalty_mean": 0.6481847167015076, "reward_repeat_penalty_std": 0.31310275197029114, "reward_repeat_floor_mean": 0.9519377946853638, "reward_repeat_floor_std": 0.05035944655537605, "reward_near_duplicate_penalty_mean": 0.8536094427108765, "reward_near_duplicate_penalty_std": 0.13116014003753662, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.18600596487522125, "reward_distinct_2_mean": 0.7724599838256836, "reward_distinct_2_std": 0.25449228286743164, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.18278560042381287, "reward_total_composite_std": 0.1323985755443573} {"timestamp_utc": "2026-04-12T19:42:17Z", "mode": "train", "global_step": 992, "epoch": 0.052207778537971684, "loss": 0.3272, "grad_norm": 16.29084014892578, "learning_rate": 6.996969696969698e-06, "num_tokens": 1762630.0, "completions/mean_length": 26.75, "completions/min_length": 15.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.75, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.9486788511276245, "rewards/meter/std": 0.07560297101736069, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.5175492167472839, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.15526476502418518, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5712500214576721, "rewards/judge_quality/std": 0.4023657739162445, "rewards/repeat_penalty/mean": 0.6705222129821777, "rewards/repeat_penalty/std": 0.19232770800590515, "rewards/repeat_floor/mean": 0.9719693064689636, "rewards/repeat_floor/std": 0.02538437396287918, "rewards/near_duplicate_penalty/mean": 0.9534604549407959, "rewards/near_duplicate_penalty/std": 0.076200470328331, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9119470119476318, "rewards/distinct_2/std": 0.17741413414478302, "rewards/total_composite/mean": 0.5146055817604065, "rewards/total_composite/std": 0.4119769334793091, "reward": 0.5146055817604065, "reward_std": 0.4119769036769867, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12871712446212769, "sampling/sampling_logp_difference/max": 1.6771574020385742, "sampling/importance_sampling_ratio/min": 0.18690451979637146, "sampling/importance_sampling_ratio/mean": 1.0465173721313477, "sampling/importance_sampling_ratio/max": 1.9479018449783325, "entropy": 0.7988493666052818, "clip_ratio/low_mean": 0.08833384374156594, "clip_ratio/low_min": 0.08833384374156594, "clip_ratio/high_mean": 0.047437612898647785, "clip_ratio/high_max": 0.047437612898647785, "clip_ratio/region_mean": 0.13577145664021373, "reward_total_mean": 0.5146055817604065, "reward_meter_mean": 0.9486788511276245, "reward_meter_std": 0.07560297101736069, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.5175492167472839, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.15526476502418518, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6705222129821777, "reward_repeat_penalty_std": 0.19232770800590515, "reward_repeat_floor_mean": 0.9719693064689636, "reward_repeat_floor_std": 0.02538437396287918, "reward_near_duplicate_penalty_mean": 0.9534604549407959, "reward_near_duplicate_penalty_std": 0.076200470328331, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9119470119476318, "reward_distinct_2_std": 0.17741413414478302, "reward_judge_quality_mean": 0.5712500214576721, "reward_judge_quality_std": 0.4023657739162445, "reward_total_composite_mean": 0.5146055817604065, "reward_total_composite_std": 0.4119769334793091} {"timestamp_utc": "2026-04-12T19:42:25Z", "mode": "train", "global_step": 993, "epoch": 0.05226040734698174, "loss": 0.0287, "grad_norm": 15.378118515014648, "learning_rate": 6.993939393939394e-06, "num_tokens": 1764121.0, "completions/mean_length": 40.375, "completions/min_length": 36.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.47582417726516724, "rewards/meter/std": 0.46113091707229614, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.2666056752204895, "rewards/repeat_penalty/mean": 0.9162414073944092, "rewards/repeat_penalty/std": 0.08564253151416779, "rewards/repeat_floor/mean": 0.9898476600646973, "rewards/repeat_floor/std": 0.011220183223485947, "rewards/near_duplicate_penalty/mean": 0.9616491794586182, "rewards/near_duplicate_penalty/std": 0.051408372819423676, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9511142373085022, "rewards/distinct_2/std": 0.045760173350572586, "rewards/total_composite/mean": 0.370554655790329, "rewards/total_composite/std": 0.3914250433444977, "reward": 0.370554655790329, "reward_std": 0.39142507314682007, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19196295738220215, "sampling/sampling_logp_difference/max": 1.846895694732666, "sampling/importance_sampling_ratio/min": 0.15772603452205658, "sampling/importance_sampling_ratio/mean": 0.9863186478614807, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9971630051732063, "clip_ratio/low_mean": 0.08436782564967871, "clip_ratio/low_min": 0.08436782564967871, "clip_ratio/high_mean": 0.08469890104606748, "clip_ratio/high_max": 0.08469890104606748, "clip_ratio/region_mean": 0.16906672669574618, "reward_total_mean": 0.370554655790329, "reward_meter_mean": 0.47582417726516724, "reward_meter_std": 0.46113091707229614, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9162414073944092, "reward_repeat_penalty_std": 0.08564253151416779, "reward_repeat_floor_mean": 0.9898476600646973, "reward_repeat_floor_std": 0.011220183223485947, "reward_near_duplicate_penalty_mean": 0.9616491794586182, "reward_near_duplicate_penalty_std": 0.051408372819423676, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9511142373085022, "reward_distinct_2_std": 0.045760173350572586, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.2666056752204895, "reward_total_composite_mean": 0.370554655790329, "reward_total_composite_std": 0.3914250433444977} {"timestamp_utc": "2026-04-12T19:42:39Z", "mode": "train", "global_step": 994, "epoch": 0.05231303615599179, "loss": -0.1588, "grad_norm": 3.641510009765625, "learning_rate": 6.990909090909092e-06, "num_tokens": 1766208.0, "completions/mean_length": 215.875, "completions/min_length": 103.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 117.16667175292969, "completions/min_terminated_length": 103.0, "completions/max_terminated_length": 126.0, "rewards/meter/mean": 0.7931424379348755, "rewards/meter/std": 0.23350565135478973, "rewards/count_adherence/mean": 0.8541666269302368, "rewards/count_adherence/std": 0.10681165754795074, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9562499523162842, "rewards/count_floor/std": 0.03204350546002388, "rewards/lexical_plausibility/mean": 0.9017550945281982, "rewards/lexical_plausibility/std": 0.18226182460784912, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.11952286213636398, "rewards/repeat_penalty/mean": 0.7025879621505737, "rewards/repeat_penalty/std": 0.12204108387231827, "rewards/repeat_floor/mean": 0.9696890115737915, "rewards/repeat_floor/std": 0.01690717414021492, "rewards/near_duplicate_penalty/mean": 0.919126033782959, "rewards/near_duplicate_penalty/std": 0.04020199924707413, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7980012893676758, "rewards/distinct_2/std": 0.13514964282512665, "rewards/total_composite/mean": 0.19511479139328003, "rewards/total_composite/std": 0.1260329633951187, "reward": 0.19511479139328003, "reward_std": 0.12603294849395752, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14866895973682404, "sampling/sampling_logp_difference/max": 2.5168070793151855, "sampling/importance_sampling_ratio/min": 0.08071692287921906, "sampling/importance_sampling_ratio/mean": 1.002547025680542, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6413288563489914, "clip_ratio/low_mean": 0.03732842393219471, "clip_ratio/low_min": 0.03732842393219471, "clip_ratio/high_mean": 0.07037896942347288, "clip_ratio/high_max": 0.07037896942347288, "clip_ratio/region_mean": 0.10770739335566759, "reward_total_mean": 0.19511479139328003, "reward_meter_mean": 0.7931424379348755, "reward_meter_std": 0.23350565135478973, "reward_count_adherence_mean": 0.8541666269302368, "reward_count_adherence_std": 0.10681165754795074, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9562499523162842, "reward_count_floor_std": 0.03204350546002388, "reward_lexical_plausibility_mean": 0.9017550945281982, "reward_lexical_plausibility_std": 0.18226182460784912, "reward_repeat_penalty_mean": 0.7025879621505737, "reward_repeat_penalty_std": 0.12204108387231827, "reward_repeat_floor_mean": 0.9696890115737915, "reward_repeat_floor_std": 0.01690717414021492, "reward_near_duplicate_penalty_mean": 0.919126033782959, "reward_near_duplicate_penalty_std": 0.04020199924707413, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7980012893676758, "reward_distinct_2_std": 0.13514964282512665, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.11952286213636398, "reward_total_composite_mean": 0.19511479139328003, "reward_total_composite_std": 0.1260329633951187} {"timestamp_utc": "2026-04-12T19:42:54Z", "mode": "train", "global_step": 995, "epoch": 0.05236566496500184, "loss": -0.0701, "grad_norm": 6.266446113586426, "learning_rate": 6.987878787878788e-06, "num_tokens": 1768113.0, "completions/mean_length": 129.125, "completions/min_length": 59.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 74.42857360839844, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 90.0, "rewards/meter/mean": 0.534123420715332, "rewards/meter/std": 0.4553905427455902, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.06943651288747787, "rewards/lexical_plausibility/mean": 0.9521560668945312, "rewards/lexical_plausibility/std": 0.1353231817483902, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.18516400456428528, "rewards/repeat_penalty/mean": 0.7730696797370911, "rewards/repeat_penalty/std": 0.16656331717967987, "rewards/repeat_floor/mean": 0.9777371883392334, "rewards/repeat_floor/std": 0.015646226704120636, "rewards/near_duplicate_penalty/mean": 0.9473599195480347, "rewards/near_duplicate_penalty/std": 0.04339979588985443, "rewards/opening_diversity/mean": 0.9609375, "rewards/opening_diversity/std": 0.08799287676811218, "rewards/distinct_2/mean": 0.8664110898971558, "rewards/distinct_2/std": 0.1253872960805893, "rewards/total_composite/mean": 0.21720297634601593, "rewards/total_composite/std": 0.20966914296150208, "reward": 0.21720297634601593, "reward_std": 0.20966912806034088, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1831740140914917, "sampling/sampling_logp_difference/max": 2.044797420501709, "sampling/importance_sampling_ratio/min": 0.16297850012779236, "sampling/importance_sampling_ratio/mean": 0.9990149736404419, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.831375740468502, "clip_ratio/low_mean": 0.04941620957106352, "clip_ratio/low_min": 0.04941620957106352, "clip_ratio/high_mean": 0.08083320036530495, "clip_ratio/high_max": 0.08083320036530495, "clip_ratio/region_mean": 0.13024940993636847, "reward_total_mean": 0.21720297634601593, "reward_meter_mean": 0.534123420715332, "reward_meter_std": 0.4553905427455902, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.06943651288747787, "reward_lexical_plausibility_mean": 0.9521560668945312, "reward_lexical_plausibility_std": 0.1353231817483902, "reward_repeat_penalty_mean": 0.7730696797370911, "reward_repeat_penalty_std": 0.16656331717967987, "reward_repeat_floor_mean": 0.9777371883392334, "reward_repeat_floor_std": 0.015646226704120636, "reward_near_duplicate_penalty_mean": 0.9473599195480347, "reward_near_duplicate_penalty_std": 0.04339979588985443, "reward_opening_diversity_mean": 0.9609375, "reward_opening_diversity_std": 0.08799287676811218, "reward_distinct_2_mean": 0.8664110898971558, "reward_distinct_2_std": 0.1253872960805893, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.18516400456428528, "reward_total_composite_mean": 0.21720297634601593, "reward_total_composite_std": 0.20966914296150208} {"timestamp_utc": "2026-04-12T19:43:08Z", "mode": "train", "global_step": 996, "epoch": 0.052418293774011894, "loss": -0.1379, "grad_norm": 4.341999053955078, "learning_rate": 6.984848484848485e-06, "num_tokens": 1770580.0, "completions/mean_length": 185.375, "completions/min_length": 119.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 138.71429443359375, "completions/min_terminated_length": 119.0, "completions/max_terminated_length": 160.0, "rewards/meter/mean": 0.8178333044052124, "rewards/meter/std": 0.33430203795433044, "rewards/count_adherence/mean": 0.7857142686843872, "rewards/count_adherence/std": 0.2645200192928314, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9357142448425293, "rewards/count_floor/std": 0.07935599982738495, "rewards/lexical_plausibility/mean": 0.9604979753494263, "rewards/lexical_plausibility/std": 0.11172851920127869, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.5520014762878418, "rewards/repeat_penalty/std": 0.21984051167964935, "rewards/repeat_floor/mean": 0.9548934102058411, "rewards/repeat_floor/std": 0.023419057950377464, "rewards/near_duplicate_penalty/mean": 0.9242173433303833, "rewards/near_duplicate_penalty/std": 0.03988896310329437, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.6459535360336304, "rewards/distinct_2/std": 0.23264984786510468, "rewards/total_composite/mean": 0.25405704975128174, "rewards/total_composite/std": 0.13310401141643524, "reward": 0.25405704975128174, "reward_std": 0.13310401141643524, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16121190786361694, "sampling/sampling_logp_difference/max": 2.8203842639923096, "sampling/importance_sampling_ratio/min": 0.059583041816949844, "sampling/importance_sampling_ratio/mean": 1.0124974250793457, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8249397203326225, "clip_ratio/low_mean": 0.028817596845328808, "clip_ratio/low_min": 0.028817596845328808, "clip_ratio/high_mean": 0.08488169685006142, "clip_ratio/high_max": 0.08488169685006142, "clip_ratio/region_mean": 0.11369929369539022, "reward_total_mean": 0.25405704975128174, "reward_meter_mean": 0.8178333044052124, "reward_meter_std": 0.33430203795433044, "reward_count_adherence_mean": 0.7857142686843872, "reward_count_adherence_std": 0.2645200192928314, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9357142448425293, "reward_count_floor_std": 0.07935599982738495, "reward_lexical_plausibility_mean": 0.9604979753494263, "reward_lexical_plausibility_std": 0.11172851920127869, "reward_repeat_penalty_mean": 0.5520014762878418, "reward_repeat_penalty_std": 0.21984051167964935, "reward_repeat_floor_mean": 0.9548934102058411, "reward_repeat_floor_std": 0.023419057950377464, "reward_near_duplicate_penalty_mean": 0.9242173433303833, "reward_near_duplicate_penalty_std": 0.03988896310329437, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.6459535360336304, "reward_distinct_2_std": 0.23264984786510468, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.25405704975128174, "reward_total_composite_std": 0.13310401141643524} {"timestamp_utc": "2026-04-12T19:43:18Z", "mode": "train", "global_step": 997, "epoch": 0.052470922583021946, "loss": 0.0076, "grad_norm": 23.889097213745117, "learning_rate": 6.981818181818183e-06, "num_tokens": 1772183.0, "completions/mean_length": 40.375, "completions/min_length": 36.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.9363147020339966, "rewards/meter/std": 0.07850109040737152, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.7469356060028076, "rewards/repeat_penalty/std": 0.22237913310527802, "rewards/repeat_floor/mean": 0.9729578495025635, "rewards/repeat_floor/std": 0.021939516067504883, "rewards/near_duplicate_penalty/mean": 0.9223943948745728, "rewards/near_duplicate_penalty/std": 0.059935662895441055, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8705416321754456, "rewards/distinct_2/std": 0.10770028084516525, "rewards/total_composite/mean": 0.30584216117858887, "rewards/total_composite/std": 0.07497670501470566, "reward": 0.30584216117858887, "reward_std": 0.07497670501470566, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1816522479057312, "sampling/sampling_logp_difference/max": 1.8009929656982422, "sampling/importance_sampling_ratio/min": 0.16513483226299286, "sampling/importance_sampling_ratio/mean": 1.0063318014144897, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1741241961717606, "clip_ratio/low_mean": 0.04714912362396717, "clip_ratio/low_min": 0.04714912362396717, "clip_ratio/high_mean": 0.14426992181688547, "clip_ratio/high_max": 0.14426992181688547, "clip_ratio/region_mean": 0.19141904544085264, "reward_total_mean": 0.30584216117858887, "reward_meter_mean": 0.9363147020339966, "reward_meter_std": 0.07850109040737152, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7469356060028076, "reward_repeat_penalty_std": 0.22237913310527802, "reward_repeat_floor_mean": 0.9729578495025635, "reward_repeat_floor_std": 0.021939516067504883, "reward_near_duplicate_penalty_mean": 0.9223943948745728, "reward_near_duplicate_penalty_std": 0.059935662895441055, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8705416321754456, "reward_distinct_2_std": 0.10770028084516525, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.30584216117858887, "reward_total_composite_std": 0.07497670501470566} {"timestamp_utc": "2026-04-12T19:43:32Z", "mode": "train", "global_step": 998, "epoch": 0.052523551392032, "loss": -0.0395, "grad_norm": 5.007837772369385, "learning_rate": 6.978787878787879e-06, "num_tokens": 1773550.0, "completions/mean_length": 84.875, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 23.85714340209961, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.6104247570037842, "rewards/meter/std": 0.40084177255630493, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9202219843864441, "rewards/lexical_plausibility/std": 0.20158244669437408, "rewards/judge_quality/mean": 0.643750011920929, "rewards/judge_quality/std": 0.3899061381816864, "rewards/repeat_penalty/mean": 0.6620035171508789, "rewards/repeat_penalty/std": 0.267974317073822, "rewards/repeat_floor/mean": 0.9725660085678101, "rewards/repeat_floor/std": 0.031774453818798065, "rewards/near_duplicate_penalty/mean": 0.9630855321884155, "rewards/near_duplicate_penalty/std": 0.0787380039691925, "rewards/opening_diversity/mean": 0.6875, "rewards/opening_diversity/std": 0.29124119877815247, "rewards/distinct_2/mean": 0.9650349617004395, "rewards/distinct_2/std": 0.06474266946315765, "rewards/total_composite/mean": 0.3806096911430359, "rewards/total_composite/std": 0.328918993473053, "reward": 0.3806096911430359, "reward_std": 0.328918993473053, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18157890439033508, "sampling/sampling_logp_difference/max": 1.5199534893035889, "sampling/importance_sampling_ratio/min": 0.21872207522392273, "sampling/importance_sampling_ratio/mean": 1.0177454948425293, "sampling/importance_sampling_ratio/max": 1.9309744834899902, "entropy": 1.1548809856176376, "clip_ratio/low_mean": 0.05364583386108279, "clip_ratio/low_min": 0.05364583386108279, "clip_ratio/high_mean": 0.08059417875483632, "clip_ratio/high_max": 0.08059417875483632, "clip_ratio/region_mean": 0.1342400126159191, "reward_total_mean": 0.3806096911430359, "reward_meter_mean": 0.6104247570037842, "reward_meter_std": 0.40084177255630493, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9202219843864441, "reward_lexical_plausibility_std": 0.20158244669437408, "reward_repeat_penalty_mean": 0.6620035171508789, "reward_repeat_penalty_std": 0.267974317073822, "reward_repeat_floor_mean": 0.9725660085678101, "reward_repeat_floor_std": 0.031774453818798065, "reward_near_duplicate_penalty_mean": 0.9630855321884155, "reward_near_duplicate_penalty_std": 0.0787380039691925, "reward_opening_diversity_mean": 0.6875, "reward_opening_diversity_std": 0.29124119877815247, "reward_distinct_2_mean": 0.9650349617004395, "reward_distinct_2_std": 0.06474266946315765, "reward_judge_quality_mean": 0.643750011920929, "reward_judge_quality_std": 0.3899061381816864, "reward_total_composite_mean": 0.3806096911430359, "reward_total_composite_std": 0.328918993473053} {"timestamp_utc": "2026-04-12T19:43:40Z", "mode": "train", "global_step": 999, "epoch": 0.05257618020104205, "loss": 0.0568, "grad_norm": 27.54399299621582, "learning_rate": 6.975757575757577e-06, "num_tokens": 1774933.0, "completions/mean_length": 14.875, "completions/min_length": 12.0, "completions/max_length": 18.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 14.875, "completions/min_terminated_length": 12.0, "completions/max_terminated_length": 18.0, "rewards/meter/mean": 0.7081332206726074, "rewards/meter/std": 0.3522411286830902, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9898897409439087, "rewards/lexical_plausibility/std": 0.028596237301826477, "rewards/judge_quality/mean": 0.33375000953674316, "rewards/judge_quality/std": 0.2653266191482544, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19429558515548706, "rewards/total_composite/std": 0.13851676881313324, "reward": 0.19429558515548706, "reward_std": 0.13851676881313324, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1672811508178711, "sampling/sampling_logp_difference/max": 1.6584110260009766, "sampling/importance_sampling_ratio/min": 0.1904413402080536, "sampling/importance_sampling_ratio/mean": 1.0127928256988525, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7742867171764374, "clip_ratio/low_mean": 0.06736111221835017, "clip_ratio/low_min": 0.06736111221835017, "clip_ratio/high_mean": 0.0651785722002387, "clip_ratio/high_max": 0.0651785722002387, "clip_ratio/region_mean": 0.13253968441858888, "reward_total_mean": 0.19429558515548706, "reward_meter_mean": 0.7081332206726074, "reward_meter_std": 0.3522411286830902, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9898897409439087, "reward_lexical_plausibility_std": 0.028596237301826477, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.33375000953674316, "reward_judge_quality_std": 0.2653266191482544, "reward_total_composite_mean": 0.19429558515548706, "reward_total_composite_std": 0.13851676881313324} {"timestamp_utc": "2026-04-12T19:43:50Z", "mode": "train", "global_step": 1000, "epoch": 0.052628809010052104, "loss": 0.1831, "grad_norm": 17.784151077270508, "learning_rate": 6.9727272727272735e-06, "num_tokens": 1776651.0, "completions/mean_length": 50.75, "completions/min_length": 39.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.75, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.847233235836029, "rewards/meter/std": 0.2537863850593567, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.96875, "rewards/lexical_plausibility/std": 0.0883883461356163, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.8717567324638367, "rewards/repeat_penalty/std": 0.22724825143814087, "rewards/repeat_floor/mean": 0.9831814169883728, "rewards/repeat_floor/std": 0.03041817992925644, "rewards/near_duplicate_penalty/mean": 0.9444844722747803, "rewards/near_duplicate_penalty/std": 0.0802675411105156, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9264860153198242, "rewards/distinct_2/std": 0.1488673985004425, "rewards/total_composite/mean": 0.3012877404689789, "rewards/total_composite/std": 0.10948627442121506, "reward": 0.3012877404689789, "reward_std": 0.10948627442121506, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18483132123947144, "sampling/sampling_logp_difference/max": 2.2926578521728516, "sampling/importance_sampling_ratio/min": 0.1009976714849472, "sampling/importance_sampling_ratio/mean": 1.024142861366272, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1258426532149315, "clip_ratio/low_mean": 0.05139520764350891, "clip_ratio/low_min": 0.05139520764350891, "clip_ratio/high_mean": 0.10453180596232414, "clip_ratio/high_max": 0.10453180596232414, "clip_ratio/region_mean": 0.15592701360583305, "reward_total_mean": 0.3012877404689789, "reward_meter_mean": 0.847233235836029, "reward_meter_std": 0.2537863850593567, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.96875, "reward_lexical_plausibility_std": 0.0883883461356163, "reward_repeat_penalty_mean": 0.8717567324638367, "reward_repeat_penalty_std": 0.22724825143814087, "reward_repeat_floor_mean": 0.9831814169883728, "reward_repeat_floor_std": 0.03041817992925644, "reward_near_duplicate_penalty_mean": 0.9444844722747803, "reward_near_duplicate_penalty_std": 0.0802675411105156, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9264860153198242, "reward_distinct_2_std": 0.1488673985004425, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.3012877404689789, "reward_total_composite_std": 0.10948627442121506} {"timestamp_utc": "2026-04-12T19:45:47Z", "mode": "eval", "global_step": 1000, "epoch": 0.052628809010052104, "eval_loss": NaN, "eval_runtime": 117.2097, "eval_samples_per_second": 0.887, "eval_steps_per_second": 0.111, "eval_num_tokens": 1776651.0, "eval_completions/mean_length": 133.19230769230768, "eval_completions/min_length": 38.38461538461539, "eval_completions/max_length": 305.7692307692308, "eval_completions/clipped_ratio": 0.038461538461538464, "eval_completions/mean_terminated_length": 118.62362670898438, "eval_completions/min_terminated_length": 38.38461538461539, "eval_completions/max_terminated_length": 253.53846153846155, "eval_rewards/meter/mean": 0.5928477942943573, "eval_rewards/meter/std": 0.3524536627989549, "eval_rewards/count_adherence/mean": 0.8475735462628878, "eval_rewards/count_adherence/std": 0.1999759771502935, "eval_rewards/arabic_clean/mean": 0.9038461538461539, "eval_rewards/arabic_clean/std": 0.19682669181090134, "eval_rewards/hard_gate/mean": 0.9903846153846154, "eval_rewards/hard_gate/std": 0.027196414195574246, "eval_rewards/arabic_floor/mean": 0.9985576913906977, "eval_rewards/arabic_floor/std": 0.004079461670838869, "eval_rewards/count_floor/mean": 0.9542720638788663, "eval_rewards/count_floor/std": 0.05999279351761708, "eval_rewards/lexical_plausibility/mean": 0.9799962318860568, "eval_rewards/lexical_plausibility/std": 0.042006535025743336, "eval_rewards/judge_quality/mean": 0.3322115380030412, "eval_rewards/judge_quality/std": 0.17376625767120948, "eval_rewards/repeat_penalty/mean": 0.6011631328326005, "eval_rewards/repeat_penalty/std": 0.3092478123994974, "eval_rewards/repeat_floor/mean": 0.950995922088623, "eval_rewards/repeat_floor/std": 0.04671543435408519, "eval_rewards/near_duplicate_penalty/mean": 0.8854492398408743, "eval_rewards/near_duplicate_penalty/std": 0.11667734155288109, "eval_rewards/opening_diversity/mean": 0.9396305221777695, "eval_rewards/opening_diversity/std": 0.12207835955688587, "eval_rewards/distinct_2/mean": 0.686674544444451, "eval_rewards/distinct_2/std": 0.29635819162313753, "eval_rewards/total_composite/mean": 0.18042223499371454, "eval_rewards/total_composite/std": 0.14621163216921, "eval_reward": 0.18042223499371454, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.06332223375256245, "eval_sampling/sampling_logp_difference/max": 1.0790344018202562, "eval_sampling/importance_sampling_ratio/min": 0.34716252753367793, "eval_sampling/importance_sampling_ratio/mean": 1.0149937226222112, "eval_sampling/importance_sampling_ratio/max": 1.5712984158442571, "eval_entropy": 0.6994791076733515, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.18042223499371454, "eval_reward_meter_mean": 0.5928477942943573, "eval_reward_meter_std": 0.3524536627989549, "eval_reward_count_adherence_mean": 0.8475735462628878, "eval_reward_count_adherence_std": 0.1999759771502935, "eval_reward_arabic_clean_mean": 0.9038461538461539, "eval_reward_arabic_clean_std": 0.19682669181090134, "eval_reward_hard_gate_mean": 0.9903846153846154, "eval_reward_hard_gate_std": 0.027196414195574246, "eval_reward_arabic_floor_mean": 0.9985576913906977, "eval_reward_arabic_floor_std": 0.004079461670838869, "eval_reward_count_floor_mean": 0.9542720638788663, "eval_reward_count_floor_std": 0.05999279351761708, "eval_reward_lexical_plausibility_mean": 0.9799962318860568, "eval_reward_lexical_plausibility_std": 0.042006535025743336, "eval_reward_repeat_penalty_mean": 0.6011631328326005, "eval_reward_repeat_penalty_std": 0.3092478123994974, "eval_reward_repeat_floor_mean": 0.950995922088623, "eval_reward_repeat_floor_std": 0.04671543435408519, "eval_reward_near_duplicate_penalty_mean": 0.8854492398408743, "eval_reward_near_duplicate_penalty_std": 0.11667734155288109, "eval_reward_opening_diversity_mean": 0.9396305221777695, "eval_reward_opening_diversity_std": 0.12207835955688587, "eval_reward_distinct_2_mean": 0.686674544444451, "eval_reward_distinct_2_std": 0.29635819162313753, "eval_reward_judge_quality_mean": 0.3322115380030412, "eval_reward_judge_quality_std": 0.17376625767120948, "eval_reward_total_composite_mean": 0.18042223499371454, "eval_reward_total_composite_std": 0.14621163216921} {"timestamp_utc": "2026-04-12T19:45:59Z", "mode": "train", "global_step": 1001, "epoch": 0.052681437819062156, "loss": 0.0049, "grad_norm": 22.124954223632812, "learning_rate": 6.969696969696971e-06, "num_tokens": 1778329.0, "completions/mean_length": 39.75, "completions/min_length": 32.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.75, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.6398776769638062, "rewards/meter/std": 0.3831755816936493, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.953125, "rewards/lexical_plausibility/std": 0.0867956355214119, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.9656601548194885, "rewards/repeat_penalty/std": 0.05841750651597977, "rewards/repeat_floor/mean": 0.9959844350814819, "rewards/repeat_floor/std": 0.006667524576187134, "rewards/near_duplicate_penalty/mean": 0.9860895872116089, "rewards/near_duplicate_penalty/std": 0.0209298525005579, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9785662889480591, "rewards/distinct_2/std": 0.03976903110742569, "rewards/total_composite/mean": 0.2616726756095886, "rewards/total_composite/std": 0.15978965163230896, "reward": 0.2616726756095886, "reward_std": 0.15978963673114777, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18585973978042603, "sampling/sampling_logp_difference/max": 1.7011492252349854, "sampling/importance_sampling_ratio/min": 0.18247368931770325, "sampling/importance_sampling_ratio/mean": 1.0141067504882812, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9986731186509132, "clip_ratio/low_mean": 0.06751769222319126, "clip_ratio/low_min": 0.06751769222319126, "clip_ratio/high_mean": 0.0593555336818099, "clip_ratio/high_max": 0.0593555336818099, "clip_ratio/region_mean": 0.12687322590500116, "reward_total_mean": 0.2616726756095886, "reward_meter_mean": 0.6398776769638062, "reward_meter_std": 0.3831755816936493, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.953125, "reward_lexical_plausibility_std": 0.0867956355214119, "reward_repeat_penalty_mean": 0.9656601548194885, "reward_repeat_penalty_std": 0.05841750651597977, "reward_repeat_floor_mean": 0.9959844350814819, "reward_repeat_floor_std": 0.006667524576187134, "reward_near_duplicate_penalty_mean": 0.9860895872116089, "reward_near_duplicate_penalty_std": 0.0209298525005579, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9785662889480591, "reward_distinct_2_std": 0.03976903110742569, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.2616726756095886, "reward_total_composite_std": 0.15978965163230896} {"timestamp_utc": "2026-04-12T19:46:08Z", "mode": "train", "global_step": 1002, "epoch": 0.05273406662807221, "loss": -0.0115, "grad_norm": 33.8516731262207, "learning_rate": 6.966666666666667e-06, "num_tokens": 1780059.0, "completions/mean_length": 42.25, "completions/min_length": 36.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.25, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7623470425605774, "rewards/meter/std": 0.33664560317993164, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.6936088800430298, "rewards/repeat_penalty/std": 0.19767102599143982, "rewards/repeat_floor/mean": 0.9604244828224182, "rewards/repeat_floor/std": 0.026541326195001602, "rewards/near_duplicate_penalty/mean": 0.8602346181869507, "rewards/near_duplicate_penalty/std": 0.09306368231773376, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7932140231132507, "rewards/distinct_2/std": 0.1414918303489685, "rewards/total_composite/mean": 0.22167715430259705, "rewards/total_composite/std": 0.13051337003707886, "reward": 0.22167715430259705, "reward_std": 0.13051335513591766, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15382272005081177, "sampling/sampling_logp_difference/max": 1.674424171447754, "sampling/importance_sampling_ratio/min": 0.18741606175899506, "sampling/importance_sampling_ratio/mean": 0.9914189577102661, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7480546422302723, "clip_ratio/low_mean": 0.04925073031336069, "clip_ratio/low_min": 0.04925073031336069, "clip_ratio/high_mean": 0.07198562938719988, "clip_ratio/high_max": 0.07198562938719988, "clip_ratio/region_mean": 0.12123635970056057, "reward_total_mean": 0.22167715430259705, "reward_meter_mean": 0.7623470425605774, "reward_meter_std": 0.33664560317993164, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6936088800430298, "reward_repeat_penalty_std": 0.19767102599143982, "reward_repeat_floor_mean": 0.9604244828224182, "reward_repeat_floor_std": 0.026541326195001602, "reward_near_duplicate_penalty_mean": 0.8602346181869507, "reward_near_duplicate_penalty_std": 0.09306368231773376, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7932140231132507, "reward_distinct_2_std": 0.1414918303489685, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.22167715430259705, "reward_total_composite_std": 0.13051337003707886} {"timestamp_utc": "2026-04-12T19:46:21Z", "mode": "train", "global_step": 1003, "epoch": 0.05278669543708226, "loss": -0.0466, "grad_norm": 5.782053470611572, "learning_rate": 6.963636363636364e-06, "num_tokens": 1781500.0, "completions/mean_length": 101.125, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 42.42857360839844, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.6858435869216919, "rewards/meter/std": 0.2864830791950226, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9452910423278809, "rewards/lexical_plausibility/std": 0.15474040806293488, "rewards/judge_quality/mean": 0.29374998807907104, "rewards/judge_quality/std": 0.17204131186008453, "rewards/repeat_penalty/mean": 0.8735029697418213, "rewards/repeat_penalty/std": 0.15507210791110992, "rewards/repeat_floor/mean": 0.9849951267242432, "rewards/repeat_floor/std": 0.01891426369547844, "rewards/near_duplicate_penalty/mean": 0.9539567232131958, "rewards/near_duplicate_penalty/std": 0.06166788935661316, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9100174903869629, "rewards/distinct_2/std": 0.11439591646194458, "rewards/total_composite/mean": 0.2047213762998581, "rewards/total_composite/std": 0.1663588434457779, "reward": 0.2047213762998581, "reward_std": 0.1663588583469391, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.179252028465271, "sampling/sampling_logp_difference/max": 1.431613564491272, "sampling/importance_sampling_ratio/min": 0.2389231026172638, "sampling/importance_sampling_ratio/mean": 0.9973267316818237, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9459731131792068, "clip_ratio/low_mean": 0.06421158276498318, "clip_ratio/low_min": 0.06421158276498318, "clip_ratio/high_mean": 0.06737321056425571, "clip_ratio/high_max": 0.06737321056425571, "clip_ratio/region_mean": 0.1315847933292389, "reward_total_mean": 0.2047213762998581, "reward_meter_mean": 0.6858435869216919, "reward_meter_std": 0.2864830791950226, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9452910423278809, "reward_lexical_plausibility_std": 0.15474040806293488, "reward_repeat_penalty_mean": 0.8735029697418213, "reward_repeat_penalty_std": 0.15507210791110992, "reward_repeat_floor_mean": 0.9849951267242432, "reward_repeat_floor_std": 0.01891426369547844, "reward_near_duplicate_penalty_mean": 0.9539567232131958, "reward_near_duplicate_penalty_std": 0.06166788935661316, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9100174903869629, "reward_distinct_2_std": 0.11439591646194458, "reward_judge_quality_mean": 0.29374998807907104, "reward_judge_quality_std": 0.17204131186008453, "reward_total_composite_mean": 0.2047213762998581, "reward_total_composite_std": 0.1663588434457779} {"timestamp_utc": "2026-04-12T19:46:32Z", "mode": "train", "global_step": 1004, "epoch": 0.05283932424609231, "loss": 0.0387, "grad_norm": 8.3599214553833, "learning_rate": 6.960606060606061e-06, "num_tokens": 1784176.0, "completions/mean_length": 128.5, "completions/min_length": 117.0, "completions/max_length": 144.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 128.5, "completions/min_terminated_length": 117.0, "completions/max_terminated_length": 144.0, "rewards/meter/mean": 0.9748039245605469, "rewards/meter/std": 0.04602670669555664, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.06613000482320786, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.019838986918330193, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.3358052968978882, "rewards/repeat_penalty/std": 0.2542286515235901, "rewards/repeat_floor/mean": 0.9120162725448608, "rewards/repeat_floor/std": 0.043963972479104996, "rewards/near_duplicate_penalty/mean": 0.7990399599075317, "rewards/near_duplicate_penalty/std": 0.11572938412427902, "rewards/opening_diversity/mean": 0.9090908765792847, "rewards/opening_diversity/std": 0.15932264924049377, "rewards/distinct_2/mean": 0.4179425835609436, "rewards/distinct_2/std": 0.22397363185882568, "rewards/total_composite/mean": 0.21779005229473114, "rewards/total_composite/std": 0.11563143879175186, "reward": 0.21779005229473114, "reward_std": 0.11563143879175186, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14209409058094025, "sampling/sampling_logp_difference/max": 2.6210408210754395, "sampling/importance_sampling_ratio/min": 0.07272712141275406, "sampling/importance_sampling_ratio/mean": 1.011225700378418, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6245669387280941, "clip_ratio/low_mean": 0.05218059569597244, "clip_ratio/low_min": 0.05218059569597244, "clip_ratio/high_mean": 0.061950214207172394, "clip_ratio/high_max": 0.061950214207172394, "clip_ratio/region_mean": 0.11413080990314484, "reward_total_mean": 0.21779005229473114, "reward_meter_mean": 0.9748039245605469, "reward_meter_std": 0.04602670669555664, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.06613000482320786, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.019838986918330193, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.3358052968978882, "reward_repeat_penalty_std": 0.2542286515235901, "reward_repeat_floor_mean": 0.9120162725448608, "reward_repeat_floor_std": 0.043963972479104996, "reward_near_duplicate_penalty_mean": 0.7990399599075317, "reward_near_duplicate_penalty_std": 0.11572938412427902, "reward_opening_diversity_mean": 0.9090908765792847, "reward_opening_diversity_std": 0.15932264924049377, "reward_distinct_2_mean": 0.4179425835609436, "reward_distinct_2_std": 0.22397363185882568, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.21779005229473114, "reward_total_composite_std": 0.11563143879175186} {"timestamp_utc": "2026-04-12T19:46:41Z", "mode": "train", "global_step": 1005, "epoch": 0.052891953055102366, "loss": 0.0222, "grad_norm": 16.885114669799805, "learning_rate": 6.957575757575759e-06, "num_tokens": 1785922.0, "completions/mean_length": 37.25, "completions/min_length": 33.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.25, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.7541271448135376, "rewards/meter/std": 0.3757603168487549, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.8378614783287048, "rewards/repeat_penalty/std": 0.18811632692813873, "rewards/repeat_floor/mean": 0.9812521934509277, "rewards/repeat_floor/std": 0.01981162466108799, "rewards/near_duplicate_penalty/mean": 0.9331832528114319, "rewards/near_duplicate_penalty/std": 0.05320000275969505, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.944719672203064, "rewards/distinct_2/std": 0.07666565477848053, "rewards/total_composite/mean": 0.37645769119262695, "rewards/total_composite/std": 0.25472790002822876, "reward": 0.37645769119262695, "reward_std": 0.25472790002822876, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1486559808254242, "sampling/sampling_logp_difference/max": 1.6582918167114258, "sampling/importance_sampling_ratio/min": 0.190464049577713, "sampling/importance_sampling_ratio/mean": 1.0120564699172974, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8786394447088242, "clip_ratio/low_mean": 0.04948117770254612, "clip_ratio/low_min": 0.04948117770254612, "clip_ratio/high_mean": 0.06206894665956497, "clip_ratio/high_max": 0.06206894665956497, "clip_ratio/region_mean": 0.11155012436211109, "reward_total_mean": 0.37645769119262695, "reward_meter_mean": 0.7541271448135376, "reward_meter_std": 0.3757603168487549, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8378614783287048, "reward_repeat_penalty_std": 0.18811632692813873, "reward_repeat_floor_mean": 0.9812521934509277, "reward_repeat_floor_std": 0.01981162466108799, "reward_near_duplicate_penalty_mean": 0.9331832528114319, "reward_near_duplicate_penalty_std": 0.05320000275969505, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.944719672203064, "reward_distinct_2_std": 0.07666565477848053, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.37645769119262695, "reward_total_composite_std": 0.25472790002822876} {"timestamp_utc": "2026-04-12T19:46:52Z", "mode": "train", "global_step": 1006, "epoch": 0.05294458186411242, "loss": 0.1351, "grad_norm": 11.750435829162598, "learning_rate": 6.954545454545455e-06, "num_tokens": 1788394.0, "completions/mean_length": 96.0, "completions/min_length": 86.0, "completions/max_length": 123.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 96.0, "completions/min_terminated_length": 86.0, "completions/max_terminated_length": 123.0, "rewards/meter/mean": 0.8809903860092163, "rewards/meter/std": 0.20758835971355438, "rewards/count_adherence/mean": 0.8500000238418579, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9550000429153442, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 0.9977678656578064, "rewards/lexical_plausibility/std": 0.006313450634479523, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.6056420207023621, "rewards/repeat_penalty/std": 0.11947911977767944, "rewards/repeat_floor/mean": 0.953300416469574, "rewards/repeat_floor/std": 0.01842612773180008, "rewards/near_duplicate_penalty/mean": 0.8755171298980713, "rewards/near_duplicate_penalty/std": 0.06730354577302933, "rewards/opening_diversity/mean": 0.956250011920929, "rewards/opening_diversity/std": 0.038382481783628464, "rewards/distinct_2/mean": 0.717753529548645, "rewards/distinct_2/std": 0.09489758312702179, "rewards/total_composite/mean": 0.26976504921913147, "rewards/total_composite/std": 0.0885532796382904, "reward": 0.26976504921913147, "reward_std": 0.0885532796382904, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1504390984773636, "sampling/sampling_logp_difference/max": 2.123899221420288, "sampling/importance_sampling_ratio/min": 0.11956451088190079, "sampling/importance_sampling_ratio/mean": 1.0095388889312744, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8073622062802315, "clip_ratio/low_mean": 0.03410334698855877, "clip_ratio/low_min": 0.03410334698855877, "clip_ratio/high_mean": 0.09946299437433481, "clip_ratio/high_max": 0.09946299437433481, "clip_ratio/region_mean": 0.13356634136289358, "reward_total_mean": 0.26976504921913147, "reward_meter_mean": 0.8809903860092163, "reward_meter_std": 0.20758835971355438, "reward_count_adherence_mean": 0.8500000238418579, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9550000429153442, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 0.9977678656578064, "reward_lexical_plausibility_std": 0.006313450634479523, "reward_repeat_penalty_mean": 0.6056420207023621, "reward_repeat_penalty_std": 0.11947911977767944, "reward_repeat_floor_mean": 0.953300416469574, "reward_repeat_floor_std": 0.01842612773180008, "reward_near_duplicate_penalty_mean": 0.8755171298980713, "reward_near_duplicate_penalty_std": 0.06730354577302933, "reward_opening_diversity_mean": 0.956250011920929, "reward_opening_diversity_std": 0.038382481783628464, "reward_distinct_2_mean": 0.717753529548645, "reward_distinct_2_std": 0.09489758312702179, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.26976504921913147, "reward_total_composite_std": 0.0885532796382904} {"timestamp_utc": "2026-04-12T19:47:05Z", "mode": "train", "global_step": 1007, "epoch": 0.05299721067312247, "loss": -0.0408, "grad_norm": 2.1118760108947754, "learning_rate": 6.951515151515153e-06, "num_tokens": 1789791.0, "completions/mean_length": 143.625, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 20.83333396911621, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.9310407042503357, "rewards/meter/std": 0.14807407557964325, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8842537999153137, "rewards/lexical_plausibility/std": 0.19642283022403717, "rewards/judge_quality/mean": 0.41750001907348633, "rewards/judge_quality/std": 0.3491520583629608, "rewards/repeat_penalty/mean": 0.7398061752319336, "rewards/repeat_penalty/std": 0.028832554817199707, "rewards/repeat_floor/mean": 0.9829612374305725, "rewards/repeat_floor/std": 0.005766510963439941, "rewards/near_duplicate_penalty/mean": 0.9864082336425781, "rewards/near_duplicate_penalty/std": 0.0384434312582016, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4026138186454773, "rewards/total_composite/std": 0.34245648980140686, "reward": 0.4026138186454773, "reward_std": 0.34245648980140686, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14732153713703156, "sampling/sampling_logp_difference/max": 1.240102767944336, "sampling/importance_sampling_ratio/min": 0.28935450315475464, "sampling/importance_sampling_ratio/mean": 1.0136672258377075, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7386007532477379, "clip_ratio/low_mean": 0.032894738018512726, "clip_ratio/low_min": 0.032894738018512726, "clip_ratio/high_mean": 0.07768433075398207, "clip_ratio/high_max": 0.07768433075398207, "clip_ratio/region_mean": 0.11057906877249479, "reward_total_mean": 0.4026138186454773, "reward_meter_mean": 0.9310407042503357, "reward_meter_std": 0.14807407557964325, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8842537999153137, "reward_lexical_plausibility_std": 0.19642283022403717, "reward_repeat_penalty_mean": 0.7398061752319336, "reward_repeat_penalty_std": 0.028832554817199707, "reward_repeat_floor_mean": 0.9829612374305725, "reward_repeat_floor_std": 0.005766510963439941, "reward_near_duplicate_penalty_mean": 0.9864082336425781, "reward_near_duplicate_penalty_std": 0.0384434312582016, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41750001907348633, "reward_judge_quality_std": 0.3491520583629608, "reward_total_composite_mean": 0.4026138186454773, "reward_total_composite_std": 0.34245648980140686} {"timestamp_utc": "2026-04-12T19:47:14Z", "mode": "train", "global_step": 1008, "epoch": 0.053049839482132516, "loss": 0.0978, "grad_norm": 18.99734878540039, "learning_rate": 6.948484848484849e-06, "num_tokens": 1791109.0, "completions/mean_length": 41.75, "completions/min_length": 35.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.75, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.7719502449035645, "rewards/meter/std": 0.3665204644203186, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.22177450358867645, "rewards/repeat_penalty/mean": 0.7883635759353638, "rewards/repeat_penalty/std": 0.2875305116176605, "rewards/repeat_floor/mean": 0.9761488437652588, "rewards/repeat_floor/std": 0.03173362836241722, "rewards/near_duplicate_penalty/mean": 0.9299284219741821, "rewards/near_duplicate_penalty/std": 0.09230577945709229, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8934398889541626, "rewards/distinct_2/std": 0.13211345672607422, "rewards/total_composite/mean": 0.26631075143814087, "rewards/total_composite/std": 0.1468190997838974, "reward": 0.26631075143814087, "reward_std": 0.1468190997838974, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16248413920402527, "sampling/sampling_logp_difference/max": 2.112684488296509, "sampling/importance_sampling_ratio/min": 0.12091293931007385, "sampling/importance_sampling_ratio/mean": 1.0183058977127075, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0836613178253174, "clip_ratio/low_mean": 0.036015139892697334, "clip_ratio/low_min": 0.036015139892697334, "clip_ratio/high_mean": 0.097270124591887, "clip_ratio/high_max": 0.097270124591887, "clip_ratio/region_mean": 0.13328526448458433, "reward_total_mean": 0.26631075143814087, "reward_meter_mean": 0.7719502449035645, "reward_meter_std": 0.3665204644203186, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7883635759353638, "reward_repeat_penalty_std": 0.2875305116176605, "reward_repeat_floor_mean": 0.9761488437652588, "reward_repeat_floor_std": 0.03173362836241722, "reward_near_duplicate_penalty_mean": 0.9299284219741821, "reward_near_duplicate_penalty_std": 0.09230577945709229, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8934398889541626, "reward_distinct_2_std": 0.13211345672607422, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.22177450358867645, "reward_total_composite_mean": 0.26631075143814087, "reward_total_composite_std": 0.1468190997838974} {"timestamp_utc": "2026-04-12T19:47:21Z", "mode": "train", "global_step": 1009, "epoch": 0.05310246829114257, "loss": 0.0024, "grad_norm": 19.639877319335938, "learning_rate": 6.945454545454546e-06, "num_tokens": 1792713.0, "completions/mean_length": 38.5, "completions/min_length": 34.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.5, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.20156092941761017, "rewards/meter/std": 0.3161162734031677, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8487499952316284, "rewards/judge_quality/std": 0.20152544975280762, "rewards/repeat_penalty/mean": 0.8401227593421936, "rewards/repeat_penalty/std": 0.24954256415367126, "rewards/repeat_floor/mean": 0.9801956415176392, "rewards/repeat_floor/std": 0.03257455304265022, "rewards/near_duplicate_penalty/mean": 0.9383005499839783, "rewards/near_duplicate_penalty/std": 0.11043066531419754, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9244505167007446, "rewards/distinct_2/std": 0.10807745158672333, "rewards/total_composite/mean": 0.1712694615125656, "rewards/total_composite/std": 0.29461145401000977, "reward": 0.1712694615125656, "reward_std": 0.29461145401000977, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15079528093338013, "sampling/sampling_logp_difference/max": 2.5437378883361816, "sampling/importance_sampling_ratio/min": 0.07857215404510498, "sampling/importance_sampling_ratio/mean": 1.0141090154647827, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7228083424270153, "clip_ratio/low_mean": 0.11751789692789316, "clip_ratio/low_min": 0.11751789692789316, "clip_ratio/high_mean": 0.011627906933426857, "clip_ratio/high_max": 0.011627906933426857, "clip_ratio/region_mean": 0.12914580386132002, "reward_total_mean": 0.1712694615125656, "reward_meter_mean": 0.20156092941761017, "reward_meter_std": 0.3161162734031677, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8401227593421936, "reward_repeat_penalty_std": 0.24954256415367126, "reward_repeat_floor_mean": 0.9801956415176392, "reward_repeat_floor_std": 0.03257455304265022, "reward_near_duplicate_penalty_mean": 0.9383005499839783, "reward_near_duplicate_penalty_std": 0.11043066531419754, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9244505167007446, "reward_distinct_2_std": 0.10807745158672333, "reward_judge_quality_mean": 0.8487499952316284, "reward_judge_quality_std": 0.20152544975280762, "reward_total_composite_mean": 0.1712694615125656, "reward_total_composite_std": 0.29461145401000977} {"timestamp_utc": "2026-04-12T19:47:34Z", "mode": "train", "global_step": 1010, "epoch": 0.05315509710015262, "loss": -0.0514, "grad_norm": 6.53665018081665, "learning_rate": 6.942424242424243e-06, "num_tokens": 1794308.0, "completions/mean_length": 100.375, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 41.57143020629883, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.6300738453865051, "rewards/meter/std": 0.4180264174938202, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9348697662353516, "rewards/lexical_plausibility/std": 0.18421603739261627, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.7733302116394043, "rewards/repeat_penalty/std": 0.17437773942947388, "rewards/repeat_floor/mean": 0.9716709852218628, "rewards/repeat_floor/std": 0.021430013701319695, "rewards/near_duplicate_penalty/mean": 0.8944940567016602, "rewards/near_duplicate_penalty/std": 0.07561302930116653, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8819093704223633, "rewards/distinct_2/std": 0.09303763508796692, "rewards/total_composite/mean": 0.25638124346733093, "rewards/total_composite/std": 0.17983435094356537, "reward": 0.25638124346733093, "reward_std": 0.17983435094356537, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1843303143978119, "sampling/sampling_logp_difference/max": 2.005678653717041, "sampling/importance_sampling_ratio/min": 0.27497678995132446, "sampling/importance_sampling_ratio/mean": 1.0134769678115845, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9222210869193077, "clip_ratio/low_mean": 0.04940476268529892, "clip_ratio/low_min": 0.04940476268529892, "clip_ratio/high_mean": 0.08858220186084509, "clip_ratio/high_max": 0.08858220186084509, "clip_ratio/region_mean": 0.137986964546144, "reward_total_mean": 0.25638124346733093, "reward_meter_mean": 0.6300738453865051, "reward_meter_std": 0.4180264174938202, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9348697662353516, "reward_lexical_plausibility_std": 0.18421603739261627, "reward_repeat_penalty_mean": 0.7733302116394043, "reward_repeat_penalty_std": 0.17437773942947388, "reward_repeat_floor_mean": 0.9716709852218628, "reward_repeat_floor_std": 0.021430013701319695, "reward_near_duplicate_penalty_mean": 0.8944940567016602, "reward_near_duplicate_penalty_std": 0.07561302930116653, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8819093704223633, "reward_distinct_2_std": 0.09303763508796692, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.25638124346733093, "reward_total_composite_std": 0.17983435094356537} {"timestamp_utc": "2026-04-12T19:47:49Z", "mode": "train", "global_step": 1011, "epoch": 0.05320772590916267, "loss": -0.0497, "grad_norm": 2.913093328475952, "learning_rate": 6.93939393939394e-06, "num_tokens": 1795827.0, "completions/mean_length": 158.875, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 41.16666793823242, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.8286142349243164, "rewards/meter/std": 0.26238933205604553, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9084140062332153, "rewards/lexical_plausibility/std": 0.184202179312706, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.8880747556686401, "rewards/repeat_penalty/std": 0.12806706130504608, "rewards/repeat_floor/mean": 0.9884530901908875, "rewards/repeat_floor/std": 0.011946422047913074, "rewards/near_duplicate_penalty/mean": 0.9700514674186707, "rewards/near_duplicate_penalty/std": 0.026091916486620903, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9424481391906738, "rewards/distinct_2/std": 0.07517612725496292, "rewards/total_composite/mean": 0.19156673550605774, "rewards/total_composite/std": 0.1724543571472168, "reward": 0.19156673550605774, "reward_std": 0.1724543422460556, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16360272467136383, "sampling/sampling_logp_difference/max": 1.8231163024902344, "sampling/importance_sampling_ratio/min": 0.16152162849903107, "sampling/importance_sampling_ratio/mean": 0.9966424703598022, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7443043738603592, "clip_ratio/low_mean": 0.04181357566267252, "clip_ratio/low_min": 0.04181357566267252, "clip_ratio/high_mean": 0.0680640246719122, "clip_ratio/high_max": 0.0680640246719122, "clip_ratio/region_mean": 0.10987760033458471, "reward_total_mean": 0.19156673550605774, "reward_meter_mean": 0.8286142349243164, "reward_meter_std": 0.26238933205604553, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9084140062332153, "reward_lexical_plausibility_std": 0.184202179312706, "reward_repeat_penalty_mean": 0.8880747556686401, "reward_repeat_penalty_std": 0.12806706130504608, "reward_repeat_floor_mean": 0.9884530901908875, "reward_repeat_floor_std": 0.011946422047913074, "reward_near_duplicate_penalty_mean": 0.9700514674186707, "reward_near_duplicate_penalty_std": 0.026091916486620903, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9424481391906738, "reward_distinct_2_std": 0.07517612725496292, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.19156673550605774, "reward_total_composite_std": 0.1724543571472168} {"timestamp_utc": "2026-04-12T19:47:58Z", "mode": "train", "global_step": 1012, "epoch": 0.053260354718172725, "loss": -0.0235, "grad_norm": 16.611148834228516, "learning_rate": 6.936363636363636e-06, "num_tokens": 1797920.0, "completions/mean_length": 79.625, "completions/min_length": 56.0, "completions/max_length": 92.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 79.625, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.5717673301696777, "rewards/meter/std": 0.20936554670333862, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.08625821024179459, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.025877466425299644, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.6044003367424011, "rewards/repeat_penalty/std": 0.30608245730400085, "rewards/repeat_floor/mean": 0.9524610638618469, "rewards/repeat_floor/std": 0.04029426351189613, "rewards/near_duplicate_penalty/mean": 0.8641104102134705, "rewards/near_duplicate_penalty/std": 0.1204640343785286, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.7066054940223694, "rewards/distinct_2/std": 0.2334507554769516, "rewards/total_composite/mean": 0.17899343371391296, "rewards/total_composite/std": 0.09015974402427673, "reward": 0.17899343371391296, "reward_std": 0.09015974402427673, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17611022293567657, "sampling/sampling_logp_difference/max": 3.5170092582702637, "sampling/importance_sampling_ratio/min": 0.029688091948628426, "sampling/importance_sampling_ratio/mean": 0.9967480301856995, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6358252018690109, "clip_ratio/low_mean": 0.07266506366431713, "clip_ratio/low_min": 0.07266506366431713, "clip_ratio/high_mean": 0.06133164744824171, "clip_ratio/high_max": 0.06133164744824171, "clip_ratio/region_mean": 0.13399671111255884, "reward_total_mean": 0.17899343371391296, "reward_meter_mean": 0.5717673301696777, "reward_meter_std": 0.20936554670333862, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.08625821024179459, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.025877466425299644, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6044003367424011, "reward_repeat_penalty_std": 0.30608245730400085, "reward_repeat_floor_mean": 0.9524610638618469, "reward_repeat_floor_std": 0.04029426351189613, "reward_near_duplicate_penalty_mean": 0.8641104102134705, "reward_near_duplicate_penalty_std": 0.1204640343785286, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.7066054940223694, "reward_distinct_2_std": 0.2334507554769516, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.17899343371391296, "reward_total_composite_std": 0.09015974402427673} {"timestamp_utc": "2026-04-12T19:48:12Z", "mode": "train", "global_step": 1013, "epoch": 0.05331298352718278, "loss": -0.0772, "grad_norm": 4.246950626373291, "learning_rate": 6.9333333333333344e-06, "num_tokens": 1800689.0, "completions/mean_length": 194.125, "completions/min_length": 140.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 148.71429443359375, "completions/min_terminated_length": 140.0, "completions/max_terminated_length": 162.0, "rewards/meter/mean": 0.8107649683952332, "rewards/meter/std": 0.2995389997959137, "rewards/count_adherence/mean": 0.6944444179534912, "rewards/count_adherence/std": 0.19472770392894745, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9083333015441895, "rewards/count_floor/std": 0.05841831862926483, "rewards/lexical_plausibility/mean": 0.9449319839477539, "rewards/lexical_plausibility/std": 0.15575581789016724, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.37832921743392944, "rewards/repeat_penalty/std": 0.2577608823776245, "rewards/repeat_floor/mean": 0.9157594442367554, "rewards/repeat_floor/std": 0.055635854601860046, "rewards/near_duplicate_penalty/mean": 0.8125444650650024, "rewards/near_duplicate_penalty/std": 0.1331138014793396, "rewards/opening_diversity/mean": 0.8142857551574707, "rewards/opening_diversity/std": 0.2313605397939682, "rewards/distinct_2/mean": 0.5002288818359375, "rewards/distinct_2/std": 0.27545952796936035, "rewards/total_composite/mean": 0.13160385191440582, "rewards/total_composite/std": 0.1019962877035141, "reward": 0.13160385191440582, "reward_std": 0.1019962951540947, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11599625647068024, "sampling/sampling_logp_difference/max": 2.0500707626342773, "sampling/importance_sampling_ratio/min": 0.1287257969379425, "sampling/importance_sampling_ratio/mean": 1.0036892890930176, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6240360960364342, "clip_ratio/low_mean": 0.0621154080145061, "clip_ratio/low_min": 0.0621154080145061, "clip_ratio/high_mean": 0.03458994813263416, "clip_ratio/high_max": 0.03458994813263416, "clip_ratio/region_mean": 0.09670535614714026, "reward_total_mean": 0.13160385191440582, "reward_meter_mean": 0.8107649683952332, "reward_meter_std": 0.2995389997959137, "reward_count_adherence_mean": 0.6944444179534912, "reward_count_adherence_std": 0.19472770392894745, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9083333015441895, "reward_count_floor_std": 0.05841831862926483, "reward_lexical_plausibility_mean": 0.9449319839477539, "reward_lexical_plausibility_std": 0.15575581789016724, "reward_repeat_penalty_mean": 0.37832921743392944, "reward_repeat_penalty_std": 0.2577608823776245, "reward_repeat_floor_mean": 0.9157594442367554, "reward_repeat_floor_std": 0.055635854601860046, "reward_near_duplicate_penalty_mean": 0.8125444650650024, "reward_near_duplicate_penalty_std": 0.1331138014793396, "reward_opening_diversity_mean": 0.8142857551574707, "reward_opening_diversity_std": 0.2313605397939682, "reward_distinct_2_mean": 0.5002288818359375, "reward_distinct_2_std": 0.27545952796936035, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.13160385191440582, "reward_total_composite_std": 0.1019962877035141} {"timestamp_utc": "2026-04-12T19:48:21Z", "mode": "train", "global_step": 1014, "epoch": 0.05336561233619283, "loss": -0.0059, "grad_norm": 16.719514846801758, "learning_rate": 6.930303030303031e-06, "num_tokens": 1802249.0, "completions/mean_length": 39.0, "completions/min_length": 34.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.0, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.6012445092201233, "rewards/meter/std": 0.3797958791255951, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.9591650366783142, "rewards/repeat_penalty/std": 0.05876043438911438, "rewards/repeat_floor/mean": 0.994678258895874, "rewards/repeat_floor/std": 0.007383603136986494, "rewards/near_duplicate_penalty/mean": 0.9743462800979614, "rewards/near_duplicate_penalty/std": 0.03212657570838928, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9836259484291077, "rewards/distinct_2/std": 0.03032796084880829, "rewards/total_composite/mean": 0.2808791697025299, "rewards/total_composite/std": 0.21103060245513916, "reward": 0.2808791697025299, "reward_std": 0.21103060245513916, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14438484609127045, "sampling/sampling_logp_difference/max": 1.0845024585723877, "sampling/importance_sampling_ratio/min": 0.33806994557380676, "sampling/importance_sampling_ratio/mean": 1.0362433195114136, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8803220018744469, "clip_ratio/low_mean": 0.07116326969116926, "clip_ratio/low_min": 0.07116326969116926, "clip_ratio/high_mean": 0.06175364926457405, "clip_ratio/high_max": 0.06175364926457405, "clip_ratio/region_mean": 0.1329169189557433, "reward_total_mean": 0.2808791697025299, "reward_meter_mean": 0.6012445092201233, "reward_meter_std": 0.3797958791255951, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9591650366783142, "reward_repeat_penalty_std": 0.05876043438911438, "reward_repeat_floor_mean": 0.994678258895874, "reward_repeat_floor_std": 0.007383603136986494, "reward_near_duplicate_penalty_mean": 0.9743462800979614, "reward_near_duplicate_penalty_std": 0.03212657570838928, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9836259484291077, "reward_distinct_2_std": 0.03032796084880829, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.2808791697025299, "reward_total_composite_std": 0.21103060245513916} {"timestamp_utc": "2026-04-12T19:48:30Z", "mode": "train", "global_step": 1015, "epoch": 0.05341824114520288, "loss": 0.0455, "grad_norm": 15.736807823181152, "learning_rate": 6.927272727272728e-06, "num_tokens": 1804083.0, "completions/mean_length": 62.25, "completions/min_length": 50.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 62.25, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.5187026262283325, "rewards/meter/std": 0.3501666188240051, "rewards/count_adherence/mean": 0.9249999523162842, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9775000214576721, "rewards/count_floor/std": 0.031052952632308006, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9289546608924866, "rewards/repeat_penalty/std": 0.05026537925004959, "rewards/repeat_floor/mean": 0.9915232062339783, "rewards/repeat_floor/std": 0.005576802417635918, "rewards/near_duplicate_penalty/mean": 0.9679281711578369, "rewards/near_duplicate_penalty/std": 0.01552621554583311, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9592667818069458, "rewards/distinct_2/std": 0.037985555827617645, "rewards/total_composite/mean": 0.20378226041793823, "rewards/total_composite/std": 0.13046510517597198, "reward": 0.20378226041793823, "reward_std": 0.13046510517597198, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.191785991191864, "sampling/sampling_logp_difference/max": 3.3755979537963867, "sampling/importance_sampling_ratio/min": 0.03419766202569008, "sampling/importance_sampling_ratio/mean": 0.9981364011764526, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8586732968688011, "clip_ratio/low_mean": 0.075193808414042, "clip_ratio/low_min": 0.075193808414042, "clip_ratio/high_mean": 0.09183205105364323, "clip_ratio/high_max": 0.09183205105364323, "clip_ratio/region_mean": 0.16702585946768522, "reward_total_mean": 0.20378226041793823, "reward_meter_mean": 0.5187026262283325, "reward_meter_std": 0.3501666188240051, "reward_count_adherence_mean": 0.9249999523162842, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9775000214576721, "reward_count_floor_std": 0.031052952632308006, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9289546608924866, "reward_repeat_penalty_std": 0.05026537925004959, "reward_repeat_floor_mean": 0.9915232062339783, "reward_repeat_floor_std": 0.005576802417635918, "reward_near_duplicate_penalty_mean": 0.9679281711578369, "reward_near_duplicate_penalty_std": 0.01552621554583311, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9592667818069458, "reward_distinct_2_std": 0.037985555827617645, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.20378226041793823, "reward_total_composite_std": 0.13046510517597198} {"timestamp_utc": "2026-04-12T19:48:44Z", "mode": "train", "global_step": 1016, "epoch": 0.053470869954212935, "loss": -0.0999, "grad_norm": 2.734677314758301, "learning_rate": 6.9242424242424245e-06, "num_tokens": 1805953.0, "completions/mean_length": 185.75, "completions/min_length": 61.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 77.0, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 95.0, "rewards/meter/mean": 0.8243870139122009, "rewards/meter/std": 0.3384326696395874, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9718749523162842, "rewards/count_floor/std": 0.0388161838054657, "rewards/lexical_plausibility/mean": 0.9324014186859131, "rewards/lexical_plausibility/std": 0.1251707375049591, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.7513312101364136, "rewards/repeat_penalty/std": 0.24689440429210663, "rewards/repeat_floor/mean": 0.9705663919448853, "rewards/repeat_floor/std": 0.02873048186302185, "rewards/near_duplicate_penalty/mean": 0.9130241274833679, "rewards/near_duplicate_penalty/std": 0.07745034992694855, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8179193735122681, "rewards/distinct_2/std": 0.19593806564807892, "rewards/total_composite/mean": 0.16487714648246765, "rewards/total_composite/std": 0.1369059830904007, "reward": 0.16487714648246765, "reward_std": 0.1369059830904007, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15814648568630219, "sampling/sampling_logp_difference/max": 1.503152847290039, "sampling/importance_sampling_ratio/min": 0.22242778539657593, "sampling/importance_sampling_ratio/mean": 1.0122147798538208, "sampling/importance_sampling_ratio/max": 1.9908485412597656, "entropy": 0.7580432891845703, "clip_ratio/low_mean": 0.06812815926969051, "clip_ratio/low_min": 0.06812815926969051, "clip_ratio/high_mean": 0.04769197665154934, "clip_ratio/high_max": 0.04769197665154934, "clip_ratio/region_mean": 0.11582013592123985, "reward_total_mean": 0.16487714648246765, "reward_meter_mean": 0.8243870139122009, "reward_meter_std": 0.3384326696395874, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9718749523162842, "reward_count_floor_std": 0.0388161838054657, "reward_lexical_plausibility_mean": 0.9324014186859131, "reward_lexical_plausibility_std": 0.1251707375049591, "reward_repeat_penalty_mean": 0.7513312101364136, "reward_repeat_penalty_std": 0.24689440429210663, "reward_repeat_floor_mean": 0.9705663919448853, "reward_repeat_floor_std": 0.02873048186302185, "reward_near_duplicate_penalty_mean": 0.9130241274833679, "reward_near_duplicate_penalty_std": 0.07745034992694855, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8179193735122681, "reward_distinct_2_std": 0.19593806564807892, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.16487714648246765, "reward_total_composite_std": 0.1369059830904007} {"timestamp_utc": "2026-04-12T19:48:53Z", "mode": "train", "global_step": 1017, "epoch": 0.05352349876322299, "loss": 0.0294, "grad_norm": 15.249451637268066, "learning_rate": 6.921212121212122e-06, "num_tokens": 1807476.0, "completions/mean_length": 42.375, "completions/min_length": 36.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.9520642757415771, "rewards/meter/std": 0.039989177137613297, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.7672468423843384, "rewards/repeat_penalty/std": 0.21213914453983307, "rewards/repeat_floor/mean": 0.9698014259338379, "rewards/repeat_floor/std": 0.026916010305285454, "rewards/near_duplicate_penalty/mean": 0.8764516115188599, "rewards/near_duplicate_penalty/std": 0.0908878818154335, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.912040114402771, "rewards/distinct_2/std": 0.08792216330766678, "rewards/total_composite/mean": 0.4185837209224701, "rewards/total_composite/std": 0.19330984354019165, "reward": 0.4185837209224701, "reward_std": 0.19330984354019165, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14242349565029144, "sampling/sampling_logp_difference/max": 2.2091095447540283, "sampling/importance_sampling_ratio/min": 0.1097983792424202, "sampling/importance_sampling_ratio/mean": 1.016740083694458, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9091897383332253, "clip_ratio/low_mean": 0.08053475618362427, "clip_ratio/low_min": 0.08053475618362427, "clip_ratio/high_mean": 0.02852564211934805, "clip_ratio/high_max": 0.02852564211934805, "clip_ratio/region_mean": 0.10906039830297232, "reward_total_mean": 0.4185837209224701, "reward_meter_mean": 0.9520642757415771, "reward_meter_std": 0.039989177137613297, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7672468423843384, "reward_repeat_penalty_std": 0.21213914453983307, "reward_repeat_floor_mean": 0.9698014259338379, "reward_repeat_floor_std": 0.026916010305285454, "reward_near_duplicate_penalty_mean": 0.8764516115188599, "reward_near_duplicate_penalty_std": 0.0908878818154335, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.912040114402771, "reward_distinct_2_std": 0.08792216330766678, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.4185837209224701, "reward_total_composite_std": 0.19330984354019165} {"timestamp_utc": "2026-04-12T19:49:02Z", "mode": "train", "global_step": 1018, "epoch": 0.05357612757223304, "loss": 0.0507, "grad_norm": 19.598302841186523, "learning_rate": 6.918181818181818e-06, "num_tokens": 1808956.0, "completions/mean_length": 35.0, "completions/min_length": 33.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.0, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.5354318618774414, "rewards/meter/std": 0.43367528915405273, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.9152252078056335, "rewards/repeat_penalty/std": 0.16887253522872925, "rewards/repeat_floor/mean": 0.9895817637443542, "rewards/repeat_floor/std": 0.019032226875424385, "rewards/near_duplicate_penalty/mean": 0.9587793350219727, "rewards/near_duplicate_penalty/std": 0.05521485581994057, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9737762212753296, "rewards/distinct_2/std": 0.07417204976081848, "rewards/total_composite/mean": 0.24740704894065857, "rewards/total_composite/std": 0.2626734972000122, "reward": 0.24740704894065857, "reward_std": 0.2626734972000122, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1655251681804657, "sampling/sampling_logp_difference/max": 1.6508779525756836, "sampling/importance_sampling_ratio/min": 0.19188137352466583, "sampling/importance_sampling_ratio/mean": 1.0032281875610352, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0728318616747856, "clip_ratio/low_mean": 0.07185245538130403, "clip_ratio/low_min": 0.07185245538130403, "clip_ratio/high_mean": 0.09028219431638718, "clip_ratio/high_max": 0.09028219431638718, "clip_ratio/region_mean": 0.1621346496976912, "reward_total_mean": 0.24740704894065857, "reward_meter_mean": 0.5354318618774414, "reward_meter_std": 0.43367528915405273, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9152252078056335, "reward_repeat_penalty_std": 0.16887253522872925, "reward_repeat_floor_mean": 0.9895817637443542, "reward_repeat_floor_std": 0.019032226875424385, "reward_near_duplicate_penalty_mean": 0.9587793350219727, "reward_near_duplicate_penalty_std": 0.05521485581994057, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9737762212753296, "reward_distinct_2_std": 0.07417204976081848, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.24740704894065857, "reward_total_composite_std": 0.2626734972000122} {"timestamp_utc": "2026-04-12T19:49:10Z", "mode": "train", "global_step": 1019, "epoch": 0.05362875638124309, "loss": 0.0669, "grad_norm": 23.339536666870117, "learning_rate": 6.915151515151515e-06, "num_tokens": 1810416.0, "completions/mean_length": 18.5, "completions/min_length": 17.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.5, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.9146131873130798, "rewards/meter/std": 0.16223149001598358, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2790483236312866, "rewards/total_composite/std": 0.1188952848315239, "reward": 0.2790483236312866, "reward_std": 0.11889529228210449, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1691134124994278, "sampling/sampling_logp_difference/max": 1.1980762481689453, "sampling/importance_sampling_ratio/min": 0.30177417397499084, "sampling/importance_sampling_ratio/mean": 1.0461504459381104, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.437881775200367, "clip_ratio/low_mean": 0.09756929334253073, "clip_ratio/low_min": 0.09756929334253073, "clip_ratio/high_mean": 0.04771671863272786, "clip_ratio/high_max": 0.04771671863272786, "clip_ratio/region_mean": 0.1452860119752586, "reward_total_mean": 0.2790483236312866, "reward_meter_mean": 0.9146131873130798, "reward_meter_std": 0.16223149001598358, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.2790483236312866, "reward_total_composite_std": 0.1188952848315239} {"timestamp_utc": "2026-04-12T19:49:24Z", "mode": "train", "global_step": 1020, "epoch": 0.053681385190253145, "loss": -0.0313, "grad_norm": 4.8817291259765625, "learning_rate": 6.912121212121212e-06, "num_tokens": 1811742.0, "completions/mean_length": 83.75, "completions/min_length": 21.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 22.571430206298828, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.7196645736694336, "rewards/meter/std": 0.3615145683288574, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9158893823623657, "rewards/lexical_plausibility/std": 0.18216611444950104, "rewards/judge_quality/mean": 0.28125, "rewards/judge_quality/std": 0.1869635283946991, "rewards/repeat_penalty/mean": 0.729889988899231, "rewards/repeat_penalty/std": 0.056879594922065735, "rewards/repeat_floor/mean": 0.9823212623596191, "rewards/repeat_floor/std": 0.007576760370284319, "rewards/near_duplicate_penalty/mean": 0.996564507484436, "rewards/near_duplicate_penalty/std": 0.009717104025185108, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9759615659713745, "rewards/distinct_2/std": 0.06799104809761047, "rewards/total_composite/mean": 0.2241857647895813, "rewards/total_composite/std": 0.17084917426109314, "reward": 0.2241857647895813, "reward_std": 0.17084917426109314, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16490037739276886, "sampling/sampling_logp_difference/max": 1.0908076763153076, "sampling/importance_sampling_ratio/min": 0.3359450399875641, "sampling/importance_sampling_ratio/mean": 1.0472825765609741, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.959427073597908, "clip_ratio/low_mean": 0.0788014093413949, "clip_ratio/low_min": 0.0788014093413949, "clip_ratio/high_mean": 0.06151185929775238, "clip_ratio/high_max": 0.06151185929775238, "clip_ratio/region_mean": 0.14031326863914728, "reward_total_mean": 0.2241857647895813, "reward_meter_mean": 0.7196645736694336, "reward_meter_std": 0.3615145683288574, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9158893823623657, "reward_lexical_plausibility_std": 0.18216611444950104, "reward_repeat_penalty_mean": 0.729889988899231, "reward_repeat_penalty_std": 0.056879594922065735, "reward_repeat_floor_mean": 0.9823212623596191, "reward_repeat_floor_std": 0.007576760370284319, "reward_near_duplicate_penalty_mean": 0.996564507484436, "reward_near_duplicate_penalty_std": 0.009717104025185108, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9759615659713745, "reward_distinct_2_std": 0.06799104809761047, "reward_judge_quality_mean": 0.28125, "reward_judge_quality_std": 0.1869635283946991, "reward_total_composite_mean": 0.2241857647895813, "reward_total_composite_std": 0.17084917426109314} {"timestamp_utc": "2026-04-12T19:49:33Z", "mode": "train", "global_step": 1021, "epoch": 0.0537340139992632, "loss": 0.0312, "grad_norm": 11.923295974731445, "learning_rate": 6.90909090909091e-06, "num_tokens": 1813520.0, "completions/mean_length": 59.25, "completions/min_length": 55.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 59.25, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.5017757415771484, "rewards/meter/std": 0.3954038619995117, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390502154827118, "rewards/repeat_penalty/mean": 0.7688629627227783, "rewards/repeat_penalty/std": 0.2558096945285797, "rewards/repeat_floor/mean": 0.9724924564361572, "rewards/repeat_floor/std": 0.03248051553964615, "rewards/near_duplicate_penalty/mean": 0.9232298731803894, "rewards/near_duplicate_penalty/std": 0.09298214316368103, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.822311282157898, "rewards/distinct_2/std": 0.2100122720003128, "rewards/total_composite/mean": 0.17784088850021362, "rewards/total_composite/std": 0.12724155187606812, "reward": 0.17784088850021362, "reward_std": 0.12724153697490692, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1490003764629364, "sampling/sampling_logp_difference/max": 3.624004364013672, "sampling/importance_sampling_ratio/min": 0.026675643399357796, "sampling/importance_sampling_ratio/mean": 1.003395676612854, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7765489220619202, "clip_ratio/low_mean": 0.05926316091790795, "clip_ratio/low_min": 0.05926316091790795, "clip_ratio/high_mean": 0.0503940312191844, "clip_ratio/high_max": 0.0503940312191844, "clip_ratio/region_mean": 0.10965719213709235, "reward_total_mean": 0.17784088850021362, "reward_meter_mean": 0.5017757415771484, "reward_meter_std": 0.3954038619995117, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7688629627227783, "reward_repeat_penalty_std": 0.2558096945285797, "reward_repeat_floor_mean": 0.9724924564361572, "reward_repeat_floor_std": 0.03248051553964615, "reward_near_duplicate_penalty_mean": 0.9232298731803894, "reward_near_duplicate_penalty_std": 0.09298214316368103, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.822311282157898, "reward_distinct_2_std": 0.2100122720003128, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390502154827118, "reward_total_composite_mean": 0.17784088850021362, "reward_total_composite_std": 0.12724155187606812} {"timestamp_utc": "2026-04-12T19:49:48Z", "mode": "train", "global_step": 1022, "epoch": 0.05378664280827325, "loss": -0.0738, "grad_norm": 5.380892276763916, "learning_rate": 6.906060606060606e-06, "num_tokens": 1815317.0, "completions/mean_length": 123.625, "completions/min_length": 63.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 68.14286041259766, "completions/min_terminated_length": 63.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.6609570980072021, "rewards/meter/std": 0.3926407992839813, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9517898559570312, "rewards/lexical_plausibility/std": 0.13635894656181335, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.8896200656890869, "rewards/repeat_penalty/std": 0.1802321821451187, "rewards/repeat_floor/mean": 0.9887716174125671, "rewards/repeat_floor/std": 0.016658827662467957, "rewards/near_duplicate_penalty/mean": 0.9653176665306091, "rewards/near_duplicate_penalty/std": 0.04678317531943321, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9330440759658813, "rewards/distinct_2/std": 0.11006199568510056, "rewards/total_composite/mean": 0.16526050865650177, "rewards/total_composite/std": 0.12858688831329346, "reward": 0.16526050865650177, "reward_std": 0.12858688831329346, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13404597342014313, "sampling/sampling_logp_difference/max": 2.2708511352539062, "sampling/importance_sampling_ratio/min": 0.10322428494691849, "sampling/importance_sampling_ratio/mean": 1.0057851076126099, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.734650507569313, "clip_ratio/low_mean": 0.049931887770071626, "clip_ratio/low_min": 0.049931887770071626, "clip_ratio/high_mean": 0.05768774729222059, "clip_ratio/high_max": 0.05768774729222059, "clip_ratio/region_mean": 0.10761963506229222, "reward_total_mean": 0.16526050865650177, "reward_meter_mean": 0.6609570980072021, "reward_meter_std": 0.3926407992839813, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9517898559570312, "reward_lexical_plausibility_std": 0.13635894656181335, "reward_repeat_penalty_mean": 0.8896200656890869, "reward_repeat_penalty_std": 0.1802321821451187, "reward_repeat_floor_mean": 0.9887716174125671, "reward_repeat_floor_std": 0.016658827662467957, "reward_near_duplicate_penalty_mean": 0.9653176665306091, "reward_near_duplicate_penalty_std": 0.04678317531943321, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9330440759658813, "reward_distinct_2_std": 0.11006199568510056, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.16526050865650177, "reward_total_composite_std": 0.12858688831329346} {"timestamp_utc": "2026-04-12T19:49:57Z", "mode": "train", "global_step": 1023, "epoch": 0.0538392716172833, "loss": -0.0068, "grad_norm": 10.58643913269043, "learning_rate": 6.903030303030304e-06, "num_tokens": 1817268.0, "completions/mean_length": 66.875, "completions/min_length": 61.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 66.875, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.9753686785697937, "rewards/meter/std": 0.034470826387405396, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4662499725818634, "rewards/judge_quality/std": 0.17435084283351898, "rewards/repeat_penalty/mean": 0.8345916271209717, "rewards/repeat_penalty/std": 0.09254156798124313, "rewards/repeat_floor/mean": 0.9815016984939575, "rewards/repeat_floor/std": 0.01192476786673069, "rewards/near_duplicate_penalty/mean": 0.9519960880279541, "rewards/near_duplicate_penalty/std": 0.04704742506146431, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8744693398475647, "rewards/distinct_2/std": 0.058364640921354294, "rewards/total_composite/mean": 0.4374304413795471, "rewards/total_composite/std": 0.1469321846961975, "reward": 0.4374304413795471, "reward_std": 0.1469321846961975, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14517521858215332, "sampling/sampling_logp_difference/max": 2.105573892593384, "sampling/importance_sampling_ratio/min": 0.12177576869726181, "sampling/importance_sampling_ratio/mean": 1.0097715854644775, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9674729481339455, "clip_ratio/low_mean": 0.08652904396876693, "clip_ratio/low_min": 0.08652904396876693, "clip_ratio/high_mean": 0.034713342785835266, "clip_ratio/high_max": 0.034713342785835266, "clip_ratio/region_mean": 0.1212423867546022, "reward_total_mean": 0.4374304413795471, "reward_meter_mean": 0.9753686785697937, "reward_meter_std": 0.034470826387405396, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8345916271209717, "reward_repeat_penalty_std": 0.09254156798124313, "reward_repeat_floor_mean": 0.9815016984939575, "reward_repeat_floor_std": 0.01192476786673069, "reward_near_duplicate_penalty_mean": 0.9519960880279541, "reward_near_duplicate_penalty_std": 0.04704742506146431, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8744693398475647, "reward_distinct_2_std": 0.058364640921354294, "reward_judge_quality_mean": 0.4662499725818634, "reward_judge_quality_std": 0.17435084283351898, "reward_total_composite_mean": 0.4374304413795471, "reward_total_composite_std": 0.1469321846961975} {"timestamp_utc": "2026-04-12T19:50:11Z", "mode": "train", "global_step": 1024, "epoch": 0.053891900426293354, "loss": -0.0344, "grad_norm": 5.592095851898193, "learning_rate": 6.9e-06, "num_tokens": 1819001.0, "completions/mean_length": 108.625, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.000003814697266, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.5329739451408386, "rewards/meter/std": 0.40733638405799866, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9345566630363464, "rewards/lexical_plausibility/std": 0.18510174751281738, "rewards/judge_quality/mean": 0.5199999809265137, "rewards/judge_quality/std": 0.36371105909347534, "rewards/repeat_penalty/mean": 0.8286395072937012, "rewards/repeat_penalty/std": 0.17090271413326263, "rewards/repeat_floor/mean": 0.9779955148696899, "rewards/repeat_floor/std": 0.023956574499607086, "rewards/near_duplicate_penalty/mean": 0.9162154197692871, "rewards/near_duplicate_penalty/std": 0.10002227127552032, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8951464891433716, "rewards/distinct_2/std": 0.10349778831005096, "rewards/total_composite/mean": 0.27428188920021057, "rewards/total_composite/std": 0.2637614607810974, "reward": 0.27428188920021057, "reward_std": 0.263761430978775, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14042514562606812, "sampling/sampling_logp_difference/max": 3.151454448699951, "sampling/importance_sampling_ratio/min": 0.042789846658706665, "sampling/importance_sampling_ratio/mean": 1.0247440338134766, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6956662759184837, "clip_ratio/low_mean": 0.03759612329304218, "clip_ratio/low_min": 0.03759612329304218, "clip_ratio/high_mean": 0.050842379219830036, "clip_ratio/high_max": 0.050842379219830036, "clip_ratio/region_mean": 0.08843850251287222, "reward_total_mean": 0.27428188920021057, "reward_meter_mean": 0.5329739451408386, "reward_meter_std": 0.40733638405799866, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9345566630363464, "reward_lexical_plausibility_std": 0.18510174751281738, "reward_repeat_penalty_mean": 0.8286395072937012, "reward_repeat_penalty_std": 0.17090271413326263, "reward_repeat_floor_mean": 0.9779955148696899, "reward_repeat_floor_std": 0.023956574499607086, "reward_near_duplicate_penalty_mean": 0.9162154197692871, "reward_near_duplicate_penalty_std": 0.10002227127552032, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8951464891433716, "reward_distinct_2_std": 0.10349778831005096, "reward_judge_quality_mean": 0.5199999809265137, "reward_judge_quality_std": 0.36371105909347534, "reward_total_composite_mean": 0.27428188920021057, "reward_total_composite_std": 0.2637614607810974} {"timestamp_utc": "2026-04-12T19:50:20Z", "mode": "train", "global_step": 1025, "epoch": 0.05394452923530341, "loss": -0.001, "grad_norm": 13.66706371307373, "learning_rate": 6.896969696969697e-06, "num_tokens": 1820532.0, "completions/mean_length": 38.375, "completions/min_length": 34.0, "completions/max_length": 49.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.375, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.7257226705551147, "rewards/meter/std": 0.40899670124053955, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6212500333786011, "rewards/judge_quality/std": 0.2704724967479706, "rewards/repeat_penalty/mean": 0.9570635557174683, "rewards/repeat_penalty/std": 0.07852336764335632, "rewards/repeat_floor/mean": 0.9944359660148621, "rewards/repeat_floor/std": 0.009332636371254921, "rewards/near_duplicate_penalty/mean": 0.9744448661804199, "rewards/near_duplicate_penalty/std": 0.03071560338139534, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.37927505373954773, "rewards/total_composite/std": 0.28317341208457947, "reward": 0.37927505373954773, "reward_std": 0.28317341208457947, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15160652995109558, "sampling/sampling_logp_difference/max": 1.9479103088378906, "sampling/importance_sampling_ratio/min": 0.14257168769836426, "sampling/importance_sampling_ratio/mean": 0.9949976801872253, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8863668218255043, "clip_ratio/low_mean": 0.08853199845179915, "clip_ratio/low_min": 0.08853199845179915, "clip_ratio/high_mean": 0.025894062593579292, "clip_ratio/high_max": 0.025894062593579292, "clip_ratio/region_mean": 0.11442606104537845, "reward_total_mean": 0.37927505373954773, "reward_meter_mean": 0.7257226705551147, "reward_meter_std": 0.40899670124053955, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9570635557174683, "reward_repeat_penalty_std": 0.07852336764335632, "reward_repeat_floor_mean": 0.9944359660148621, "reward_repeat_floor_std": 0.009332636371254921, "reward_near_duplicate_penalty_mean": 0.9744448661804199, "reward_near_duplicate_penalty_std": 0.03071560338139534, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.6212500333786011, "reward_judge_quality_std": 0.2704724967479706, "reward_total_composite_mean": 0.37927505373954773, "reward_total_composite_std": 0.28317341208457947} {"timestamp_utc": "2026-04-12T19:50:30Z", "mode": "train", "global_step": 1026, "epoch": 0.05399715804431346, "loss": 0.1032, "grad_norm": 12.394335746765137, "learning_rate": 6.893939393939395e-06, "num_tokens": 1822868.0, "completions/mean_length": 103.0, "completions/min_length": 85.0, "completions/max_length": 115.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 103.0, "completions/min_terminated_length": 85.0, "completions/max_terminated_length": 115.0, "rewards/meter/mean": 0.749626874923706, "rewards/meter/std": 0.22611446678638458, "rewards/count_adherence/mean": 0.9642857313156128, "rewards/count_adherence/std": 0.06613000482320786, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9892857074737549, "rewards/count_floor/std": 0.01983901485800743, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.7000752091407776, "rewards/repeat_penalty/std": 0.2564781904220581, "rewards/repeat_floor/mean": 0.9643749594688416, "rewards/repeat_floor/std": 0.04147970303893089, "rewards/near_duplicate_penalty/mean": 0.911603569984436, "rewards/near_duplicate_penalty/std": 0.10075400769710541, "rewards/opening_diversity/mean": 0.9553571343421936, "rewards/opening_diversity/std": 0.12626907229423523, "rewards/distinct_2/mean": 0.7812555432319641, "rewards/distinct_2/std": 0.2117156982421875, "rewards/total_composite/mean": 0.27177268266677856, "rewards/total_composite/std": 0.09701024740934372, "reward": 0.27177268266677856, "reward_std": 0.09701025485992432, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16282899677753448, "sampling/sampling_logp_difference/max": 1.6345796585083008, "sampling/importance_sampling_ratio/min": 0.19503432512283325, "sampling/importance_sampling_ratio/mean": 1.0140913724899292, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9033370688557625, "clip_ratio/low_mean": 0.058566014282405376, "clip_ratio/low_min": 0.058566014282405376, "clip_ratio/high_mean": 0.0894228583201766, "clip_ratio/high_max": 0.0894228583201766, "clip_ratio/region_mean": 0.14798887260258198, "reward_total_mean": 0.27177268266677856, "reward_meter_mean": 0.749626874923706, "reward_meter_std": 0.22611446678638458, "reward_count_adherence_mean": 0.9642857313156128, "reward_count_adherence_std": 0.06613000482320786, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9892857074737549, "reward_count_floor_std": 0.01983901485800743, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7000752091407776, "reward_repeat_penalty_std": 0.2564781904220581, "reward_repeat_floor_mean": 0.9643749594688416, "reward_repeat_floor_std": 0.04147970303893089, "reward_near_duplicate_penalty_mean": 0.911603569984436, "reward_near_duplicate_penalty_std": 0.10075400769710541, "reward_opening_diversity_mean": 0.9553571343421936, "reward_opening_diversity_std": 0.12626907229423523, "reward_distinct_2_mean": 0.7812555432319641, "reward_distinct_2_std": 0.2117156982421875, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.27177268266677856, "reward_total_composite_std": 0.09701024740934372} {"timestamp_utc": "2026-04-12T19:50:44Z", "mode": "train", "global_step": 1027, "epoch": 0.05404978685332351, "loss": -0.0351, "grad_norm": 6.426838397979736, "learning_rate": 6.890909090909092e-06, "num_tokens": 1826362.0, "completions/mean_length": 292.75, "completions/min_length": 242.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 261.4285888671875, "completions/min_terminated_length": 242.0, "completions/max_terminated_length": 279.0, "rewards/meter/mean": 0.7850620746612549, "rewards/meter/std": 0.3157118260860443, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.08868516236543655, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9625000357627869, "rewards/count_floor/std": 0.026605553925037384, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.1679842621088028, "rewards/repeat_penalty/std": 0.1664513796567917, "rewards/repeat_floor/mean": 0.9083834886550903, "rewards/repeat_floor/std": 0.025251084938645363, "rewards/near_duplicate_penalty/mean": 0.8698483109474182, "rewards/near_duplicate_penalty/std": 0.06974322348833084, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.2041664719581604, "rewards/distinct_2/std": 0.19479382038116455, "rewards/total_composite/mean": 0.19514016807079315, "rewards/total_composite/std": 0.10494624823331833, "reward": 0.19514016807079315, "reward_std": 0.10494624078273773, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10818116366863251, "sampling/sampling_logp_difference/max": 2.5145912170410156, "sampling/importance_sampling_ratio/min": 0.08089597523212433, "sampling/importance_sampling_ratio/mean": 1.0067905187606812, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4590645357966423, "clip_ratio/low_mean": 0.027754032518714666, "clip_ratio/low_min": 0.027754032518714666, "clip_ratio/high_mean": 0.05993103887885809, "clip_ratio/high_max": 0.05993103887885809, "clip_ratio/region_mean": 0.08768507139757276, "reward_total_mean": 0.19514016807079315, "reward_meter_mean": 0.7850620746612549, "reward_meter_std": 0.3157118260860443, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.08868516236543655, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9625000357627869, "reward_count_floor_std": 0.026605553925037384, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.1679842621088028, "reward_repeat_penalty_std": 0.1664513796567917, "reward_repeat_floor_mean": 0.9083834886550903, "reward_repeat_floor_std": 0.025251084938645363, "reward_near_duplicate_penalty_mean": 0.8698483109474182, "reward_near_duplicate_penalty_std": 0.06974322348833084, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.2041664719581604, "reward_distinct_2_std": 0.19479382038116455, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.19514016807079315, "reward_total_composite_std": 0.10494624823331833} {"timestamp_utc": "2026-04-12T19:50:58Z", "mode": "train", "global_step": 1028, "epoch": 0.054102415662333564, "loss": -0.0606, "grad_norm": 4.061544895172119, "learning_rate": 6.887878787878789e-06, "num_tokens": 1827992.0, "completions/mean_length": 96.75, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.42857360839844, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.7716999053955078, "rewards/meter/std": 0.3507132828235626, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.932048499584198, "rewards/lexical_plausibility/std": 0.192195862531662, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.24032345414161682, "rewards/repeat_penalty/mean": 0.7073366641998291, "rewards/repeat_penalty/std": 0.15373623371124268, "rewards/repeat_floor/mean": 0.9699632525444031, "rewards/repeat_floor/std": 0.016544846817851067, "rewards/near_duplicate_penalty/mean": 0.91960608959198, "rewards/near_duplicate_penalty/std": 0.04806467518210411, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9044150114059448, "rewards/distinct_2/std": 0.05708000436425209, "rewards/total_composite/mean": 0.35969823598861694, "rewards/total_composite/std": 0.25277888774871826, "reward": 0.35969823598861694, "reward_std": 0.25277888774871826, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14263054728507996, "sampling/sampling_logp_difference/max": 1.3940820693969727, "sampling/importance_sampling_ratio/min": 0.24806064367294312, "sampling/importance_sampling_ratio/mean": 1.0255366563796997, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8742780163884163, "clip_ratio/low_mean": 0.06313793826848269, "clip_ratio/low_min": 0.06313793826848269, "clip_ratio/high_mean": 0.0343750009778887, "clip_ratio/high_max": 0.0343750009778887, "clip_ratio/region_mean": 0.09751293924637139, "reward_total_mean": 0.35969823598861694, "reward_meter_mean": 0.7716999053955078, "reward_meter_std": 0.3507132828235626, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.932048499584198, "reward_lexical_plausibility_std": 0.192195862531662, "reward_repeat_penalty_mean": 0.7073366641998291, "reward_repeat_penalty_std": 0.15373623371124268, "reward_repeat_floor_mean": 0.9699632525444031, "reward_repeat_floor_std": 0.016544846817851067, "reward_near_duplicate_penalty_mean": 0.91960608959198, "reward_near_duplicate_penalty_std": 0.04806467518210411, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9044150114059448, "reward_distinct_2_std": 0.05708000436425209, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.24032345414161682, "reward_total_composite_mean": 0.35969823598861694, "reward_total_composite_std": 0.25277888774871826} {"timestamp_utc": "2026-04-12T19:51:11Z", "mode": "train", "global_step": 1029, "epoch": 0.054155044471343616, "loss": -0.0624, "grad_norm": 3.5032265186309814, "learning_rate": 6.8848484848484854e-06, "num_tokens": 1829799.0, "completions/mean_length": 180.875, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 70.5, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 99.0, "rewards/meter/mean": 0.668749213218689, "rewards/meter/std": 0.4241233170032501, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.33905068039894104, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.934374988079071, "rewards/count_floor/std": 0.10171520709991455, "rewards/lexical_plausibility/mean": 0.9060420393943787, "rewards/lexical_plausibility/std": 0.17521625757217407, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.8074693083763123, "rewards/repeat_penalty/std": 0.18075814843177795, "rewards/repeat_floor/mean": 0.978519082069397, "rewards/repeat_floor/std": 0.019033988937735558, "rewards/near_duplicate_penalty/mean": 0.9393673539161682, "rewards/near_duplicate_penalty/std": 0.04634714126586914, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.8675855398178101, "rewards/distinct_2/std": 0.13593615591526031, "rewards/total_composite/mean": 0.14603254199028015, "rewards/total_composite/std": 0.1473514884710312, "reward": 0.14603254199028015, "reward_std": 0.1473514884710312, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17409799993038177, "sampling/sampling_logp_difference/max": 5.867944717407227, "sampling/importance_sampling_ratio/min": 0.002828681143000722, "sampling/importance_sampling_ratio/mean": 1.0262959003448486, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7266783341765404, "clip_ratio/low_mean": 0.08197050169110298, "clip_ratio/low_min": 0.08197050169110298, "clip_ratio/high_mean": 0.04159544222056866, "clip_ratio/high_max": 0.04159544222056866, "clip_ratio/region_mean": 0.12356594391167164, "reward_total_mean": 0.14603254199028015, "reward_meter_mean": 0.668749213218689, "reward_meter_std": 0.4241233170032501, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.33905068039894104, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.934374988079071, "reward_count_floor_std": 0.10171520709991455, "reward_lexical_plausibility_mean": 0.9060420393943787, "reward_lexical_plausibility_std": 0.17521625757217407, "reward_repeat_penalty_mean": 0.8074693083763123, "reward_repeat_penalty_std": 0.18075814843177795, "reward_repeat_floor_mean": 0.978519082069397, "reward_repeat_floor_std": 0.019033988937735558, "reward_near_duplicate_penalty_mean": 0.9393673539161682, "reward_near_duplicate_penalty_std": 0.04634714126586914, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.8675855398178101, "reward_distinct_2_std": 0.13593615591526031, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.14603254199028015, "reward_total_composite_std": 0.1473514884710312} {"timestamp_utc": "2026-04-12T19:51:21Z", "mode": "train", "global_step": 1030, "epoch": 0.05420767328035367, "loss": 0.0701, "grad_norm": 10.174373626708984, "learning_rate": 6.881818181818183e-06, "num_tokens": 1832335.0, "completions/mean_length": 129.0, "completions/min_length": 114.0, "completions/max_length": 150.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 129.0, "completions/min_terminated_length": 114.0, "completions/max_terminated_length": 150.0, "rewards/meter/mean": 0.7598661184310913, "rewards/meter/std": 0.10195587575435638, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.03928370773792267, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.01178510207682848, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.8587624430656433, "rewards/repeat_penalty/std": 0.1601112335920334, "rewards/repeat_floor/mean": 0.9859421253204346, "rewards/repeat_floor/std": 0.012671094387769699, "rewards/near_duplicate_penalty/mean": 0.9625072479248047, "rewards/near_duplicate_penalty/std": 0.020657068118453026, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9062890410423279, "rewards/distinct_2/std": 0.11188486963510513, "rewards/total_composite/mean": 0.361072301864624, "rewards/total_composite/std": 0.19525328278541565, "reward": 0.361072301864624, "reward_std": 0.19525328278541565, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16824322938919067, "sampling/sampling_logp_difference/max": 3.170562744140625, "sampling/importance_sampling_ratio/min": 0.041979968547821045, "sampling/importance_sampling_ratio/mean": 0.9918917417526245, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6613135971128941, "clip_ratio/low_mean": 0.11224114056676626, "clip_ratio/low_min": 0.11224114056676626, "clip_ratio/high_mean": 0.02254098281264305, "clip_ratio/high_max": 0.02254098281264305, "clip_ratio/region_mean": 0.1347821233794093, "reward_total_mean": 0.361072301864624, "reward_meter_mean": 0.7598661184310913, "reward_meter_std": 0.10195587575435638, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.03928370773792267, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.01178510207682848, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8587624430656433, "reward_repeat_penalty_std": 0.1601112335920334, "reward_repeat_floor_mean": 0.9859421253204346, "reward_repeat_floor_std": 0.012671094387769699, "reward_near_duplicate_penalty_mean": 0.9625072479248047, "reward_near_duplicate_penalty_std": 0.020657068118453026, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9062890410423279, "reward_distinct_2_std": 0.11188486963510513, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.361072301864624, "reward_total_composite_std": 0.19525328278541565} {"timestamp_utc": "2026-04-12T19:51:30Z", "mode": "train", "global_step": 1031, "epoch": 0.05426030208936372, "loss": 0.0247, "grad_norm": 12.100837707519531, "learning_rate": 6.878787878787879e-06, "num_tokens": 1834082.0, "completions/mean_length": 68.375, "completions/min_length": 18.0, "completions/max_length": 99.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 68.375, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 99.0, "rewards/meter/mean": 0.99265056848526, "rewards/meter/std": 0.003089885925874114, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.31160587072372437, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156250357627869, "rewards/count_floor/std": 0.09348177164793015, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.724898099899292, "rewards/repeat_penalty/std": 0.1089765653014183, "rewards/repeat_floor/mean": 0.9708527326583862, "rewards/repeat_floor/std": 0.016079066321253777, "rewards/near_duplicate_penalty/mean": 0.9235653877258301, "rewards/near_duplicate_penalty/std": 0.0582248792052269, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.845199704170227, "rewards/distinct_2/std": 0.1347823441028595, "rewards/total_composite/mean": 0.28273075819015503, "rewards/total_composite/std": 0.13824431598186493, "reward": 0.28273075819015503, "reward_std": 0.13824431598186493, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15212556719779968, "sampling/sampling_logp_difference/max": 1.730299472808838, "sampling/importance_sampling_ratio/min": 0.1772313266992569, "sampling/importance_sampling_ratio/mean": 1.0234389305114746, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9372230246663094, "clip_ratio/low_mean": 0.056656996719539165, "clip_ratio/low_min": 0.056656996719539165, "clip_ratio/high_mean": 0.07306154072284698, "clip_ratio/high_max": 0.07306154072284698, "clip_ratio/region_mean": 0.12971853744238615, "reward_total_mean": 0.28273075819015503, "reward_meter_mean": 0.99265056848526, "reward_meter_std": 0.003089885925874114, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.31160587072372437, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156250357627869, "reward_count_floor_std": 0.09348177164793015, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.724898099899292, "reward_repeat_penalty_std": 0.1089765653014183, "reward_repeat_floor_mean": 0.9708527326583862, "reward_repeat_floor_std": 0.016079066321253777, "reward_near_duplicate_penalty_mean": 0.9235653877258301, "reward_near_duplicate_penalty_std": 0.0582248792052269, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.845199704170227, "reward_distinct_2_std": 0.1347823441028595, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.28273075819015503, "reward_total_composite_std": 0.13824431598186493} {"timestamp_utc": "2026-04-12T19:51:44Z", "mode": "train", "global_step": 1032, "epoch": 0.05431293089837377, "loss": -0.1468, "grad_norm": 3.566657543182373, "learning_rate": 6.875757575757576e-06, "num_tokens": 1836175.0, "completions/mean_length": 128.625, "completions/min_length": 68.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 73.85714721679688, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.9461867213249207, "rewards/meter/std": 0.06024564430117607, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 0.9610633850097656, "rewards/lexical_plausibility/std": 0.11012942343950272, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.7090461850166321, "rewards/repeat_penalty/std": 0.15860313177108765, "rewards/repeat_floor/mean": 0.9681207537651062, "rewards/repeat_floor/std": 0.01909528486430645, "rewards/near_duplicate_penalty/mean": 0.918491542339325, "rewards/near_duplicate_penalty/std": 0.04221451282501221, "rewards/opening_diversity/mean": 0.984375, "rewards/opening_diversity/std": 0.0289318785071373, "rewards/distinct_2/mean": 0.7920502424240112, "rewards/distinct_2/std": 0.13314341008663177, "rewards/total_composite/mean": 0.31375664472579956, "rewards/total_composite/std": 0.12196913361549377, "reward": 0.31375664472579956, "reward_std": 0.12196913361549377, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16305559873580933, "sampling/sampling_logp_difference/max": 1.5273551940917969, "sampling/importance_sampling_ratio/min": 0.21710912883281708, "sampling/importance_sampling_ratio/mean": 1.0084128379821777, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0001589730381966, "clip_ratio/low_mean": 0.013513513840734959, "clip_ratio/low_min": 0.013513513840734959, "clip_ratio/high_mean": 0.10479060281068087, "clip_ratio/high_max": 0.10479060281068087, "clip_ratio/region_mean": 0.11830411665141582, "reward_total_mean": 0.31375664472579956, "reward_meter_mean": 0.9461867213249207, "reward_meter_std": 0.06024564430117607, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 0.9610633850097656, "reward_lexical_plausibility_std": 0.11012942343950272, "reward_repeat_penalty_mean": 0.7090461850166321, "reward_repeat_penalty_std": 0.15860313177108765, "reward_repeat_floor_mean": 0.9681207537651062, "reward_repeat_floor_std": 0.01909528486430645, "reward_near_duplicate_penalty_mean": 0.918491542339325, "reward_near_duplicate_penalty_std": 0.04221451282501221, "reward_opening_diversity_mean": 0.984375, "reward_opening_diversity_std": 0.0289318785071373, "reward_distinct_2_mean": 0.7920502424240112, "reward_distinct_2_std": 0.13314341008663177, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.31375664472579956, "reward_total_composite_std": 0.12196913361549377} {"timestamp_utc": "2026-04-12T19:51:58Z", "mode": "train", "global_step": 1033, "epoch": 0.05436555970738382, "loss": -0.0589, "grad_norm": 1.3373076915740967, "learning_rate": 6.872727272727273e-06, "num_tokens": 1837713.0, "completions/mean_length": 338.25, "completions/min_length": 22.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 48.66666793823242, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.5539199113845825, "rewards/meter/std": 0.3940742611885071, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.33034375309944153, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.887499988079071, "rewards/count_floor/std": 0.09910311549901962, "rewards/lexical_plausibility/mean": 0.7599345445632935, "rewards/lexical_plausibility/std": 0.2054721713066101, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.8813475370407104, "rewards/repeat_penalty/std": 0.11809955537319183, "rewards/repeat_floor/mean": 0.9911878108978271, "rewards/repeat_floor/std": 0.007555747404694557, "rewards/near_duplicate_penalty/mean": 0.9853224158287048, "rewards/near_duplicate_penalty/std": 0.024444254115223885, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9890491962432861, "rewards/distinct_2/std": 0.029218412935733795, "rewards/total_composite/mean": 0.12289460003376007, "rewards/total_composite/std": 0.1493535190820694, "reward": 0.12289460003376007, "reward_std": 0.1493535190820694, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1713695079088211, "sampling/sampling_logp_difference/max": 1.3529753684997559, "sampling/importance_sampling_ratio/min": 0.2584700584411621, "sampling/importance_sampling_ratio/mean": 1.0064082145690918, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.44355134665966034, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.07733955420553684, "clip_ratio/high_max": 0.07733955420553684, "clip_ratio/region_mean": 0.07733955420553684, "reward_total_mean": 0.12289460003376007, "reward_meter_mean": 0.5539199113845825, "reward_meter_std": 0.3940742611885071, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.33034375309944153, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.887499988079071, "reward_count_floor_std": 0.09910311549901962, "reward_lexical_plausibility_mean": 0.7599345445632935, "reward_lexical_plausibility_std": 0.2054721713066101, "reward_repeat_penalty_mean": 0.8813475370407104, "reward_repeat_penalty_std": 0.11809955537319183, "reward_repeat_floor_mean": 0.9911878108978271, "reward_repeat_floor_std": 0.007555747404694557, "reward_near_duplicate_penalty_mean": 0.9853224158287048, "reward_near_duplicate_penalty_std": 0.024444254115223885, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9890491962432861, "reward_distinct_2_std": 0.029218412935733795, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.12289460003376007, "reward_total_composite_std": 0.1493535190820694} {"timestamp_utc": "2026-04-12T19:52:11Z", "mode": "train", "global_step": 1034, "epoch": 0.05441818851639387, "loss": -0.1268, "grad_norm": 3.4945671558380127, "learning_rate": 6.869696969696971e-06, "num_tokens": 1840223.0, "completions/mean_length": 231.75, "completions/min_length": 117.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 138.33334350585938, "completions/min_terminated_length": 117.0, "completions/max_terminated_length": 171.0, "rewards/meter/mean": 0.8629274368286133, "rewards/meter/std": 0.17817242443561554, "rewards/count_adherence/mean": 0.8214285373687744, "rewards/count_adherence/std": 0.06613000482320786, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9464285373687744, "rewards/count_floor/std": 0.019838986918330193, "rewards/lexical_plausibility/mean": 0.9097108244895935, "rewards/lexical_plausibility/std": 0.1690024882555008, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.5891968607902527, "rewards/repeat_penalty/std": 0.21916449069976807, "rewards/repeat_floor/mean": 0.951640248298645, "rewards/repeat_floor/std": 0.02437850832939148, "rewards/near_duplicate_penalty/mean": 0.8651718497276306, "rewards/near_duplicate_penalty/std": 0.04946175217628479, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.6873830556869507, "rewards/distinct_2/std": 0.21976767480373383, "rewards/total_composite/mean": 0.1882256269454956, "rewards/total_composite/std": 0.1159299686551094, "reward": 0.1882256269454956, "reward_std": 0.1159299686551094, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12832891941070557, "sampling/sampling_logp_difference/max": 4.318770408630371, "sampling/importance_sampling_ratio/min": 0.013316246680915356, "sampling/importance_sampling_ratio/mean": 1.0024572610855103, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6344615891575813, "clip_ratio/low_mean": 0.028120783157646656, "clip_ratio/low_min": 0.028120783157646656, "clip_ratio/high_mean": 0.07120212726294994, "clip_ratio/high_max": 0.07120212726294994, "clip_ratio/region_mean": 0.0993229104205966, "reward_total_mean": 0.1882256269454956, "reward_meter_mean": 0.8629274368286133, "reward_meter_std": 0.17817242443561554, "reward_count_adherence_mean": 0.8214285373687744, "reward_count_adherence_std": 0.06613000482320786, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9464285373687744, "reward_count_floor_std": 0.019838986918330193, "reward_lexical_plausibility_mean": 0.9097108244895935, "reward_lexical_plausibility_std": 0.1690024882555008, "reward_repeat_penalty_mean": 0.5891968607902527, "reward_repeat_penalty_std": 0.21916449069976807, "reward_repeat_floor_mean": 0.951640248298645, "reward_repeat_floor_std": 0.02437850832939148, "reward_near_duplicate_penalty_mean": 0.8651718497276306, "reward_near_duplicate_penalty_std": 0.04946175217628479, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.6873830556869507, "reward_distinct_2_std": 0.21976767480373383, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.1882256269454956, "reward_total_composite_std": 0.1159299686551094} {"timestamp_utc": "2026-04-12T19:52:26Z", "mode": "train", "global_step": 1035, "epoch": 0.054470817325403924, "loss": -0.106, "grad_norm": 4.426401138305664, "learning_rate": 6.866666666666667e-06, "num_tokens": 1842176.0, "completions/mean_length": 134.125, "completions/min_length": 73.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 80.14286041259766, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 85.0, "rewards/meter/mean": 0.6368252038955688, "rewards/meter/std": 0.3716123402118683, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9403793215751648, "rewards/lexical_plausibility/std": 0.16863277554512024, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9268494844436646, "rewards/repeat_penalty/std": 0.04847259446978569, "rewards/repeat_floor/mean": 0.9913119673728943, "rewards/repeat_floor/std": 0.005451911594718695, "rewards/near_duplicate_penalty/mean": 0.9675188660621643, "rewards/near_duplicate_penalty/std": 0.018193546682596207, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9576012492179871, "rewards/distinct_2/std": 0.037529367953538895, "rewards/total_composite/mean": 0.23162199556827545, "rewards/total_composite/std": 0.14037111401557922, "reward": 0.23162199556827545, "reward_std": 0.14037111401557922, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1483355313539505, "sampling/sampling_logp_difference/max": 1.8519296646118164, "sampling/importance_sampling_ratio/min": 0.19051046669483185, "sampling/importance_sampling_ratio/mean": 1.0096585750579834, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8855811953544617, "clip_ratio/low_mean": 0.04130448121577501, "clip_ratio/low_min": 0.04130448121577501, "clip_ratio/high_mean": 0.073572619818151, "clip_ratio/high_max": 0.073572619818151, "clip_ratio/region_mean": 0.11487710103392601, "reward_total_mean": 0.23162199556827545, "reward_meter_mean": 0.6368252038955688, "reward_meter_std": 0.3716123402118683, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9403793215751648, "reward_lexical_plausibility_std": 0.16863277554512024, "reward_repeat_penalty_mean": 0.9268494844436646, "reward_repeat_penalty_std": 0.04847259446978569, "reward_repeat_floor_mean": 0.9913119673728943, "reward_repeat_floor_std": 0.005451911594718695, "reward_near_duplicate_penalty_mean": 0.9675188660621643, "reward_near_duplicate_penalty_std": 0.018193546682596207, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9576012492179871, "reward_distinct_2_std": 0.037529367953538895, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.23162199556827545, "reward_total_composite_std": 0.14037111401557922} {"timestamp_utc": "2026-04-12T19:52:40Z", "mode": "train", "global_step": 1036, "epoch": 0.054523446134413976, "loss": -0.0467, "grad_norm": 5.379473686218262, "learning_rate": 6.8636363636363645e-06, "num_tokens": 1843858.0, "completions/mean_length": 110.25, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 52.85714340209961, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 83.0, "rewards/meter/mean": 0.559983491897583, "rewards/meter/std": 0.35088860988616943, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9512271881103516, "rewards/lexical_plausibility/std": 0.13795040547847748, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.858528733253479, "rewards/repeat_penalty/std": 0.19305704534053802, "rewards/repeat_floor/mean": 0.983191728591919, "rewards/repeat_floor/std": 0.022784627974033356, "rewards/near_duplicate_penalty/mean": 0.9497088193893433, "rewards/near_duplicate_penalty/std": 0.05611324682831764, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9178939461708069, "rewards/distinct_2/std": 0.11625760793685913, "rewards/total_composite/mean": 0.12528550624847412, "rewards/total_composite/std": 0.1045026183128357, "reward": 0.12528550624847412, "reward_std": 0.1045026183128357, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16183240711688995, "sampling/sampling_logp_difference/max": 1.2830981016159058, "sampling/importance_sampling_ratio/min": 0.27717724442481995, "sampling/importance_sampling_ratio/mean": 1.0346561670303345, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3770179897546768, "clip_ratio/low_mean": 0.04216533713042736, "clip_ratio/low_min": 0.04216533713042736, "clip_ratio/high_mean": 0.11152931675314903, "clip_ratio/high_max": 0.11152931675314903, "clip_ratio/region_mean": 0.1536946538835764, "reward_total_mean": 0.12528550624847412, "reward_meter_mean": 0.559983491897583, "reward_meter_std": 0.35088860988616943, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9512271881103516, "reward_lexical_plausibility_std": 0.13795040547847748, "reward_repeat_penalty_mean": 0.858528733253479, "reward_repeat_penalty_std": 0.19305704534053802, "reward_repeat_floor_mean": 0.983191728591919, "reward_repeat_floor_std": 0.022784627974033356, "reward_near_duplicate_penalty_mean": 0.9497088193893433, "reward_near_duplicate_penalty_std": 0.05611324682831764, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9178939461708069, "reward_distinct_2_std": 0.11625760793685913, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.12528550624847412, "reward_total_composite_std": 0.1045026183128357} {"timestamp_utc": "2026-04-12T19:52:54Z", "mode": "train", "global_step": 1037, "epoch": 0.05457607494342403, "loss": -0.0856, "grad_norm": 2.698458433151245, "learning_rate": 6.860606060606061e-06, "num_tokens": 1845916.0, "completions/mean_length": 322.25, "completions/min_length": 119.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 132.5, "completions/min_terminated_length": 119.0, "completions/max_terminated_length": 151.0, "rewards/meter/mean": 0.3715631365776062, "rewards/meter/std": 0.35139113664627075, "rewards/count_adherence/mean": 0.7083333730697632, "rewards/count_adherence/std": 0.2781743109226227, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9124999642372131, "rewards/count_floor/std": 0.08345229178667068, "rewards/lexical_plausibility/mean": 0.7954964637756348, "rewards/lexical_plausibility/std": 0.22257614135742188, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.8200597763061523, "rewards/repeat_penalty/std": 0.19439402222633362, "rewards/repeat_floor/mean": 0.9812372326850891, "rewards/repeat_floor/std": 0.01872258074581623, "rewards/near_duplicate_penalty/mean": 0.955824077129364, "rewards/near_duplicate_penalty/std": 0.03457092121243477, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8651514053344727, "rewards/distinct_2/std": 0.16505487263202667, "rewards/total_composite/mean": 0.03896675631403923, "rewards/total_composite/std": 0.025124112144112587, "reward": 0.03896675631403923, "reward_std": 0.025124112144112587, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1449243426322937, "sampling/sampling_logp_difference/max": 2.939000129699707, "sampling/importance_sampling_ratio/min": 0.05291861295700073, "sampling/importance_sampling_ratio/mean": 0.9852445721626282, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4010564833879471, "clip_ratio/low_mean": 0.031799906864762306, "clip_ratio/low_min": 0.031799906864762306, "clip_ratio/high_mean": 0.044992998242378235, "clip_ratio/high_max": 0.044992998242378235, "clip_ratio/region_mean": 0.07679290510714054, "reward_total_mean": 0.03896675631403923, "reward_meter_mean": 0.3715631365776062, "reward_meter_std": 0.35139113664627075, "reward_count_adherence_mean": 0.7083333730697632, "reward_count_adherence_std": 0.2781743109226227, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9124999642372131, "reward_count_floor_std": 0.08345229178667068, "reward_lexical_plausibility_mean": 0.7954964637756348, "reward_lexical_plausibility_std": 0.22257614135742188, "reward_repeat_penalty_mean": 0.8200597763061523, "reward_repeat_penalty_std": 0.19439402222633362, "reward_repeat_floor_mean": 0.9812372326850891, "reward_repeat_floor_std": 0.01872258074581623, "reward_near_duplicate_penalty_mean": 0.955824077129364, "reward_near_duplicate_penalty_std": 0.03457092121243477, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8651514053344727, "reward_distinct_2_std": 0.16505487263202667, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.03896675631403923, "reward_total_composite_std": 0.025124112144112587} {"timestamp_utc": "2026-04-12T19:53:03Z", "mode": "train", "global_step": 1038, "epoch": 0.05462870375243408, "loss": 0.1119, "grad_norm": 11.717079162597656, "learning_rate": 6.857575757575758e-06, "num_tokens": 1848327.0, "completions/mean_length": 101.375, "completions/min_length": 87.0, "completions/max_length": 119.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 101.375, "completions/min_terminated_length": 87.0, "completions/max_terminated_length": 119.0, "rewards/meter/mean": 0.9379615783691406, "rewards/meter/std": 0.14111998677253723, "rewards/count_adherence/mean": 0.8999999761581421, "rewards/count_adherence/std": 0.10690449178218842, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9700000286102295, "rewards/count_floor/std": 0.03207135200500488, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.6559946537017822, "rewards/repeat_penalty/std": 0.2319997400045395, "rewards/repeat_floor/mean": 0.9619393348693848, "rewards/repeat_floor/std": 0.024726862087845802, "rewards/near_duplicate_penalty/mean": 0.9073032140731812, "rewards/near_duplicate_penalty/std": 0.046702027320861816, "rewards/opening_diversity/mean": 0.9119791388511658, "rewards/opening_diversity/std": 0.15455128252506256, "rewards/distinct_2/mean": 0.7902786731719971, "rewards/distinct_2/std": 0.1557294875383377, "rewards/total_composite/mean": 0.2675013840198517, "rewards/total_composite/std": 0.09637827426195145, "reward": 0.2675013840198517, "reward_std": 0.09637827426195145, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13963530957698822, "sampling/sampling_logp_difference/max": 1.5723917484283447, "sampling/importance_sampling_ratio/min": 0.20754818618297577, "sampling/importance_sampling_ratio/mean": 1.0107676982879639, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8562929853796959, "clip_ratio/low_mean": 0.037640057504177094, "clip_ratio/low_min": 0.037640057504177094, "clip_ratio/high_mean": 0.09844038728624582, "clip_ratio/high_max": 0.09844038728624582, "clip_ratio/region_mean": 0.13608044479042292, "reward_total_mean": 0.2675013840198517, "reward_meter_mean": 0.9379615783691406, "reward_meter_std": 0.14111998677253723, "reward_count_adherence_mean": 0.8999999761581421, "reward_count_adherence_std": 0.10690449178218842, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9700000286102295, "reward_count_floor_std": 0.03207135200500488, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6559946537017822, "reward_repeat_penalty_std": 0.2319997400045395, "reward_repeat_floor_mean": 0.9619393348693848, "reward_repeat_floor_std": 0.024726862087845802, "reward_near_duplicate_penalty_mean": 0.9073032140731812, "reward_near_duplicate_penalty_std": 0.046702027320861816, "reward_opening_diversity_mean": 0.9119791388511658, "reward_opening_diversity_std": 0.15455128252506256, "reward_distinct_2_mean": 0.7902786731719971, "reward_distinct_2_std": 0.1557294875383377, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.2675013840198517, "reward_total_composite_std": 0.09637827426195145} {"timestamp_utc": "2026-04-12T19:53:13Z", "mode": "train", "global_step": 1039, "epoch": 0.05468133256144413, "loss": 0.0451, "grad_norm": 7.77894926071167, "learning_rate": 6.854545454545455e-06, "num_tokens": 1850965.0, "completions/mean_length": 132.75, "completions/min_length": 123.0, "completions/max_length": 144.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 132.75, "completions/min_terminated_length": 123.0, "completions/max_terminated_length": 144.0, "rewards/meter/mean": 0.7572954893112183, "rewards/meter/std": 0.2965412735939026, "rewards/count_adherence/mean": 0.890625, "rewards/count_adherence/std": 0.04419417306780815, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9671874642372131, "rewards/count_floor/std": 0.013258260674774647, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.37820857763290405, "rewards/repeat_penalty/std": 0.2359757274389267, "rewards/repeat_floor/mean": 0.9255591034889221, "rewards/repeat_floor/std": 0.03798024356365204, "rewards/near_duplicate_penalty/mean": 0.8441143035888672, "rewards/near_duplicate_penalty/std": 0.08639401942491531, "rewards/opening_diversity/mean": 0.9079241156578064, "rewards/opening_diversity/std": 0.13796918094158173, "rewards/distinct_2/mean": 0.4940720498561859, "rewards/distinct_2/std": 0.2183462381362915, "rewards/total_composite/mean": 0.1361137479543686, "rewards/total_composite/std": 0.08358364552259445, "reward": 0.1361137479543686, "reward_std": 0.08358364552259445, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1351195126771927, "sampling/sampling_logp_difference/max": 2.775458335876465, "sampling/importance_sampling_ratio/min": 0.062320906668901443, "sampling/importance_sampling_ratio/mean": 1.0014041662216187, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6944403424859047, "clip_ratio/low_mean": 0.05950515950098634, "clip_ratio/low_min": 0.05950515950098634, "clip_ratio/high_mean": 0.05474177189171314, "clip_ratio/high_max": 0.05474177189171314, "clip_ratio/region_mean": 0.11424693139269948, "reward_total_mean": 0.1361137479543686, "reward_meter_mean": 0.7572954893112183, "reward_meter_std": 0.2965412735939026, "reward_count_adherence_mean": 0.890625, "reward_count_adherence_std": 0.04419417306780815, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9671874642372131, "reward_count_floor_std": 0.013258260674774647, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.37820857763290405, "reward_repeat_penalty_std": 0.2359757274389267, "reward_repeat_floor_mean": 0.9255591034889221, "reward_repeat_floor_std": 0.03798024356365204, "reward_near_duplicate_penalty_mean": 0.8441143035888672, "reward_near_duplicate_penalty_std": 0.08639401942491531, "reward_opening_diversity_mean": 0.9079241156578064, "reward_opening_diversity_std": 0.13796918094158173, "reward_distinct_2_mean": 0.4940720498561859, "reward_distinct_2_std": 0.2183462381362915, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.1361137479543686, "reward_total_composite_std": 0.08358364552259445} {"timestamp_utc": "2026-04-12T19:53:24Z", "mode": "train", "global_step": 1040, "epoch": 0.054733961370454186, "loss": 0.0123, "grad_norm": 9.252738952636719, "learning_rate": 6.851515151515153e-06, "num_tokens": 1853566.0, "completions/mean_length": 129.125, "completions/min_length": 107.0, "completions/max_length": 150.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 129.125, "completions/min_terminated_length": 107.0, "completions/max_terminated_length": 150.0, "rewards/meter/mean": 0.9835991263389587, "rewards/meter/std": 0.02488532103598118, "rewards/count_adherence/mean": 0.8035714030265808, "rewards/count_adherence/std": 0.07393559068441391, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9410713911056519, "rewards/count_floor/std": 0.02218066342175007, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.4110645055770874, "rewards/repeat_penalty/std": 0.22772547602653503, "rewards/repeat_floor/mean": 0.9282637238502502, "rewards/repeat_floor/std": 0.03510439395904541, "rewards/near_duplicate_penalty/mean": 0.8382090330123901, "rewards/near_duplicate_penalty/std": 0.08379925787448883, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1767766922712326, "rewards/distinct_2/mean": 0.514248788356781, "rewards/distinct_2/std": 0.1942049264907837, "rewards/total_composite/mean": 0.18888162076473236, "rewards/total_composite/std": 0.08576741814613342, "reward": 0.18888162076473236, "reward_std": 0.08576741814613342, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13730427622795105, "sampling/sampling_logp_difference/max": 2.3340024948120117, "sampling/importance_sampling_ratio/min": 0.09690709412097931, "sampling/importance_sampling_ratio/mean": 1.0222182273864746, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7903077602386475, "clip_ratio/low_mean": 0.06582424882799387, "clip_ratio/low_min": 0.06582424882799387, "clip_ratio/high_mean": 0.041744185611605644, "clip_ratio/high_max": 0.041744185611605644, "clip_ratio/region_mean": 0.10756843443959951, "reward_total_mean": 0.18888162076473236, "reward_meter_mean": 0.9835991263389587, "reward_meter_std": 0.02488532103598118, "reward_count_adherence_mean": 0.8035714030265808, "reward_count_adherence_std": 0.07393559068441391, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9410713911056519, "reward_count_floor_std": 0.02218066342175007, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.4110645055770874, "reward_repeat_penalty_std": 0.22772547602653503, "reward_repeat_floor_mean": 0.9282637238502502, "reward_repeat_floor_std": 0.03510439395904541, "reward_near_duplicate_penalty_mean": 0.8382090330123901, "reward_near_duplicate_penalty_std": 0.08379925787448883, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1767766922712326, "reward_distinct_2_mean": 0.514248788356781, "reward_distinct_2_std": 0.1942049264907837, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.18888162076473236, "reward_total_composite_std": 0.08576741814613342} {"timestamp_utc": "2026-04-12T19:53:37Z", "mode": "train", "global_step": 1041, "epoch": 0.05478659017946424, "loss": -0.0459, "grad_norm": 2.820596694946289, "learning_rate": 6.848484848484849e-06, "num_tokens": 1855036.0, "completions/mean_length": 156.75, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 38.333335876464844, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.39307206869125366, "rewards/meter/std": 0.37239328026771545, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8818939924240112, "rewards/lexical_plausibility/std": 0.22319026291370392, "rewards/judge_quality/mean": 0.35874998569488525, "rewards/judge_quality/std": 0.2864281237125397, "rewards/repeat_penalty/mean": 0.8335074782371521, "rewards/repeat_penalty/std": 0.14929601550102234, "rewards/repeat_floor/mean": 0.980891764163971, "rewards/repeat_floor/std": 0.017063746228814125, "rewards/near_duplicate_penalty/mean": 0.9217875003814697, "rewards/near_duplicate_penalty/std": 0.079309843480587, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9597069025039673, "rewards/distinct_2/std": 0.0338943749666214, "rewards/total_composite/mean": 0.10745798796415329, "rewards/total_composite/std": 0.12441365420818329, "reward": 0.10745798796415329, "reward_std": 0.12441365420818329, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15830090641975403, "sampling/sampling_logp_difference/max": 1.7270796298980713, "sampling/importance_sampling_ratio/min": 0.1778029054403305, "sampling/importance_sampling_ratio/mean": 1.024382472038269, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9981816112995148, "clip_ratio/low_mean": 0.05997073370963335, "clip_ratio/low_min": 0.05997073370963335, "clip_ratio/high_mean": 0.07817834243178368, "clip_ratio/high_max": 0.07817834243178368, "clip_ratio/region_mean": 0.13814907614141703, "reward_total_mean": 0.10745798796415329, "reward_meter_mean": 0.39307206869125366, "reward_meter_std": 0.37239328026771545, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8818939924240112, "reward_lexical_plausibility_std": 0.22319026291370392, "reward_repeat_penalty_mean": 0.8335074782371521, "reward_repeat_penalty_std": 0.14929601550102234, "reward_repeat_floor_mean": 0.980891764163971, "reward_repeat_floor_std": 0.017063746228814125, "reward_near_duplicate_penalty_mean": 0.9217875003814697, "reward_near_duplicate_penalty_std": 0.079309843480587, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9597069025039673, "reward_distinct_2_std": 0.0338943749666214, "reward_judge_quality_mean": 0.35874998569488525, "reward_judge_quality_std": 0.2864281237125397, "reward_total_composite_mean": 0.10745798796415329, "reward_total_composite_std": 0.12441365420818329} {"timestamp_utc": "2026-04-12T19:53:53Z", "mode": "train", "global_step": 1042, "epoch": 0.05483921898847429, "loss": -0.0754, "grad_norm": 4.727536201477051, "learning_rate": 6.845454545454546e-06, "num_tokens": 1856688.0, "completions/mean_length": 103.5, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 45.142860412597656, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.5524774789810181, "rewards/meter/std": 0.31214046478271484, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9506340026855469, "rewards/lexical_plausibility/std": 0.1396281123161316, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.1552647352218628, "rewards/repeat_penalty/mean": 0.9423285126686096, "rewards/repeat_penalty/std": 0.09359228610992432, "rewards/repeat_floor/mean": 0.9948512315750122, "rewards/repeat_floor/std": 0.007179405074566603, "rewards/near_duplicate_penalty/mean": 0.9861325621604919, "rewards/near_duplicate_penalty/std": 0.020935945212841034, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9867373704910278, "rewards/distinct_2/std": 0.03751229867339134, "rewards/total_composite/mean": 0.1782945692539215, "rewards/total_composite/std": 0.14102791249752045, "reward": 0.1782945692539215, "reward_std": 0.14102791249752045, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16874884068965912, "sampling/sampling_logp_difference/max": 2.3880558013916016, "sampling/importance_sampling_ratio/min": 0.0918080061674118, "sampling/importance_sampling_ratio/mean": 1.0198297500610352, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1007827296853065, "clip_ratio/low_mean": 0.0689714988693595, "clip_ratio/low_min": 0.0689714988693595, "clip_ratio/high_mean": 0.05714285932481289, "clip_ratio/high_max": 0.05714285932481289, "clip_ratio/region_mean": 0.12611435819417238, "reward_total_mean": 0.1782945692539215, "reward_meter_mean": 0.5524774789810181, "reward_meter_std": 0.31214046478271484, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9506340026855469, "reward_lexical_plausibility_std": 0.1396281123161316, "reward_repeat_penalty_mean": 0.9423285126686096, "reward_repeat_penalty_std": 0.09359228610992432, "reward_repeat_floor_mean": 0.9948512315750122, "reward_repeat_floor_std": 0.007179405074566603, "reward_near_duplicate_penalty_mean": 0.9861325621604919, "reward_near_duplicate_penalty_std": 0.020935945212841034, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9867373704910278, "reward_distinct_2_std": 0.03751229867339134, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.1552647352218628, "reward_total_composite_mean": 0.1782945692539215, "reward_total_composite_std": 0.14102791249752045} {"timestamp_utc": "2026-04-12T19:54:07Z", "mode": "train", "global_step": 1043, "epoch": 0.05489184779748434, "loss": -0.1677, "grad_norm": 4.966696262359619, "learning_rate": 6.842424242424243e-06, "num_tokens": 1859480.0, "completions/mean_length": 194.0, "completions/min_length": 132.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 148.57144165039062, "completions/min_terminated_length": 132.0, "completions/max_terminated_length": 180.0, "rewards/meter/mean": 0.7360803484916687, "rewards/meter/std": 0.38025182485580444, "rewards/count_adherence/mean": 0.671875, "rewards/count_adherence/std": 0.23085150122642517, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9015624523162842, "rewards/count_floor/std": 0.06925544887781143, "rewards/lexical_plausibility/mean": 0.9519443511962891, "rewards/lexical_plausibility/std": 0.1359219253063202, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.5964800119400024, "rewards/repeat_penalty/std": 0.24976219236850739, "rewards/repeat_floor/mean": 0.9522773027420044, "rewards/repeat_floor/std": 0.039006780833005905, "rewards/near_duplicate_penalty/mean": 0.8929007053375244, "rewards/near_duplicate_penalty/std": 0.08897947520017624, "rewards/opening_diversity/mean": 0.827556848526001, "rewards/opening_diversity/std": 0.16875314712524414, "rewards/distinct_2/mean": 0.7632088661193848, "rewards/distinct_2/std": 0.20450684428215027, "rewards/total_composite/mean": 0.2121185064315796, "rewards/total_composite/std": 0.12680518627166748, "reward": 0.2121185064315796, "reward_std": 0.12680518627166748, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1323598176240921, "sampling/sampling_logp_difference/max": 1.90132737159729, "sampling/importance_sampling_ratio/min": 0.1493702232837677, "sampling/importance_sampling_ratio/mean": 1.0072625875473022, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7059270441532135, "clip_ratio/low_mean": 0.028657877817749977, "clip_ratio/low_min": 0.028657877817749977, "clip_ratio/high_mean": 0.07214623875916004, "clip_ratio/high_max": 0.07214623875916004, "clip_ratio/region_mean": 0.10080411657691002, "reward_total_mean": 0.2121185064315796, "reward_meter_mean": 0.7360803484916687, "reward_meter_std": 0.38025182485580444, "reward_count_adherence_mean": 0.671875, "reward_count_adherence_std": 0.23085150122642517, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9015624523162842, "reward_count_floor_std": 0.06925544887781143, "reward_lexical_plausibility_mean": 0.9519443511962891, "reward_lexical_plausibility_std": 0.1359219253063202, "reward_repeat_penalty_mean": 0.5964800119400024, "reward_repeat_penalty_std": 0.24976219236850739, "reward_repeat_floor_mean": 0.9522773027420044, "reward_repeat_floor_std": 0.039006780833005905, "reward_near_duplicate_penalty_mean": 0.8929007053375244, "reward_near_duplicate_penalty_std": 0.08897947520017624, "reward_opening_diversity_mean": 0.827556848526001, "reward_opening_diversity_std": 0.16875314712524414, "reward_distinct_2_mean": 0.7632088661193848, "reward_distinct_2_std": 0.20450684428215027, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.2121185064315796, "reward_total_composite_std": 0.12680518627166748} {"timestamp_utc": "2026-04-12T19:54:24Z", "mode": "train", "global_step": 1044, "epoch": 0.054944476606494395, "loss": -0.012, "grad_norm": 6.336915016174316, "learning_rate": 6.83939393939394e-06, "num_tokens": 1860958.0, "completions/mean_length": 98.75, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 39.71428680419922, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.4518135190010071, "rewards/meter/std": 0.39509329199790955, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9591144323348999, "rewards/lexical_plausibility/std": 0.1156417652964592, "rewards/judge_quality/mean": 0.4462500214576721, "rewards/judge_quality/std": 0.23627693951129913, "rewards/repeat_penalty/mean": 0.8956582546234131, "rewards/repeat_penalty/std": 0.1424568146467209, "rewards/repeat_floor/mean": 0.9878213405609131, "rewards/repeat_floor/std": 0.015821415930986404, "rewards/near_duplicate_penalty/mean": 0.9531832933425903, "rewards/near_duplicate_penalty/std": 0.05720429867506027, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9427089691162109, "rewards/distinct_2/std": 0.08827294409275055, "rewards/total_composite/mean": 0.22185459733009338, "rewards/total_composite/std": 0.28892993927001953, "reward": 0.22185459733009338, "reward_std": 0.2889299690723419, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.198969766497612, "sampling/sampling_logp_difference/max": 1.3652875423431396, "sampling/importance_sampling_ratio/min": 0.25530725717544556, "sampling/importance_sampling_ratio/mean": 1.0301458835601807, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9624626711010933, "clip_ratio/low_mean": 0.09740735590457916, "clip_ratio/low_min": 0.09740735590457916, "clip_ratio/high_mean": 0.06637935806065798, "clip_ratio/high_max": 0.06637935806065798, "clip_ratio/region_mean": 0.16378671396523714, "reward_total_mean": 0.22185459733009338, "reward_meter_mean": 0.4518135190010071, "reward_meter_std": 0.39509329199790955, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9591144323348999, "reward_lexical_plausibility_std": 0.1156417652964592, "reward_repeat_penalty_mean": 0.8956582546234131, "reward_repeat_penalty_std": 0.1424568146467209, "reward_repeat_floor_mean": 0.9878213405609131, "reward_repeat_floor_std": 0.015821415930986404, "reward_near_duplicate_penalty_mean": 0.9531832933425903, "reward_near_duplicate_penalty_std": 0.05720429867506027, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9427089691162109, "reward_distinct_2_std": 0.08827294409275055, "reward_judge_quality_mean": 0.4462500214576721, "reward_judge_quality_std": 0.23627693951129913, "reward_total_composite_mean": 0.22185459733009338, "reward_total_composite_std": 0.28892993927001953} {"timestamp_utc": "2026-04-12T19:54:38Z", "mode": "train", "global_step": 1045, "epoch": 0.05499710541550445, "loss": -0.0847, "grad_norm": 4.317941188812256, "learning_rate": 6.8363636363636364e-06, "num_tokens": 1863046.0, "completions/mean_length": 131.0, "completions/min_length": 67.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 76.5714340209961, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 93.0, "rewards/meter/mean": 0.8516666889190674, "rewards/meter/std": 0.30668655037879944, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.18516401946544647, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.940000057220459, "rewards/count_floor/std": 0.05554921180009842, "rewards/lexical_plausibility/mean": 0.9649927616119385, "rewards/lexical_plausibility/std": 0.09901534020900726, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.7306001782417297, "rewards/repeat_penalty/std": 0.09317930042743683, "rewards/repeat_floor/mean": 0.970472514629364, "rewards/repeat_floor/std": 0.009617557749152184, "rewards/near_duplicate_penalty/mean": 0.9298416376113892, "rewards/near_duplicate_penalty/std": 0.03050163947045803, "rewards/opening_diversity/mean": 0.984375, "rewards/opening_diversity/std": 0.0289318785071373, "rewards/distinct_2/mean": 0.7992637753486633, "rewards/distinct_2/std": 0.10670207440853119, "rewards/total_composite/mean": 0.17786066234111786, "rewards/total_composite/std": 0.10766448080539703, "reward": 0.17786066234111786, "reward_std": 0.10766447335481644, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13103488087654114, "sampling/sampling_logp_difference/max": 1.6882412433624268, "sampling/importance_sampling_ratio/min": 0.18484432995319366, "sampling/importance_sampling_ratio/mean": 1.0278335809707642, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7445037737488747, "clip_ratio/low_mean": 0.06442466378211975, "clip_ratio/low_min": 0.06442466378211975, "clip_ratio/high_mean": 0.05242701154202223, "clip_ratio/high_max": 0.05242701154202223, "clip_ratio/region_mean": 0.11685167532414198, "reward_total_mean": 0.17786066234111786, "reward_meter_mean": 0.8516666889190674, "reward_meter_std": 0.30668655037879944, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.18516401946544647, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.940000057220459, "reward_count_floor_std": 0.05554921180009842, "reward_lexical_plausibility_mean": 0.9649927616119385, "reward_lexical_plausibility_std": 0.09901534020900726, "reward_repeat_penalty_mean": 0.7306001782417297, "reward_repeat_penalty_std": 0.09317930042743683, "reward_repeat_floor_mean": 0.970472514629364, "reward_repeat_floor_std": 0.009617557749152184, "reward_near_duplicate_penalty_mean": 0.9298416376113892, "reward_near_duplicate_penalty_std": 0.03050163947045803, "reward_opening_diversity_mean": 0.984375, "reward_opening_diversity_std": 0.0289318785071373, "reward_distinct_2_mean": 0.7992637753486633, "reward_distinct_2_std": 0.10670207440853119, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.17786066234111786, "reward_total_composite_std": 0.10766448080539703} {"timestamp_utc": "2026-04-12T19:54:53Z", "mode": "train", "global_step": 1046, "epoch": 0.0550497342245145, "loss": -0.0602, "grad_norm": 5.8024163246154785, "learning_rate": 6.833333333333334e-06, "num_tokens": 1864710.0, "completions/mean_length": 103.0, "completions/min_length": 39.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 44.57143020629883, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.6534960269927979, "rewards/meter/std": 0.43770304322242737, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9470566511154175, "rewards/lexical_plausibility/std": 0.1497463583946228, "rewards/judge_quality/mean": 0.3062500059604645, "rewards/judge_quality/std": 0.15454426407814026, "rewards/repeat_penalty/mean": 0.9568419456481934, "rewards/repeat_penalty/std": 0.06302206218242645, "rewards/repeat_floor/mean": 0.9943863153457642, "rewards/repeat_floor/std": 0.008068595081567764, "rewards/near_duplicate_penalty/mean": 0.9730864763259888, "rewards/near_duplicate_penalty/std": 0.037587083876132965, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9824813008308411, "rewards/distinct_2/std": 0.03248300403356552, "rewards/total_composite/mean": 0.242730051279068, "rewards/total_composite/std": 0.18923543393611908, "reward": 0.242730051279068, "reward_std": 0.18923543393611908, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18914373219013214, "sampling/sampling_logp_difference/max": 1.8349785804748535, "sampling/importance_sampling_ratio/min": 0.15961691737174988, "sampling/importance_sampling_ratio/mean": 1.0350492000579834, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2791118025779724, "clip_ratio/low_mean": 0.04326923191547394, "clip_ratio/low_min": 0.04326923191547394, "clip_ratio/high_mean": 0.11115088500082493, "clip_ratio/high_max": 0.11115088500082493, "clip_ratio/region_mean": 0.15442011691629887, "reward_total_mean": 0.242730051279068, "reward_meter_mean": 0.6534960269927979, "reward_meter_std": 0.43770304322242737, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9470566511154175, "reward_lexical_plausibility_std": 0.1497463583946228, "reward_repeat_penalty_mean": 0.9568419456481934, "reward_repeat_penalty_std": 0.06302206218242645, "reward_repeat_floor_mean": 0.9943863153457642, "reward_repeat_floor_std": 0.008068595081567764, "reward_near_duplicate_penalty_mean": 0.9730864763259888, "reward_near_duplicate_penalty_std": 0.037587083876132965, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9824813008308411, "reward_distinct_2_std": 0.03248300403356552, "reward_judge_quality_mean": 0.3062500059604645, "reward_judge_quality_std": 0.15454426407814026, "reward_total_composite_mean": 0.242730051279068, "reward_total_composite_std": 0.18923543393611908} {"timestamp_utc": "2026-04-12T19:55:06Z", "mode": "train", "global_step": 1047, "epoch": 0.05510236303352455, "loss": -0.0319, "grad_norm": 6.724843978881836, "learning_rate": 6.83030303030303e-06, "num_tokens": 1866284.0, "completions/mean_length": 107.75, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 50.000003814697266, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.6977684497833252, "rewards/meter/std": 0.3932817280292511, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9323267936706543, "rewards/lexical_plausibility/std": 0.13708946108818054, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.3127185106277466, "rewards/repeat_penalty/mean": 0.8352065086364746, "rewards/repeat_penalty/std": 0.20242764055728912, "rewards/repeat_floor/mean": 0.9793391227722168, "rewards/repeat_floor/std": 0.025525081902742386, "rewards/near_duplicate_penalty/mean": 0.9230776429176331, "rewards/near_duplicate_penalty/std": 0.0763208419084549, "rewards/opening_diversity/mean": 0.956250011920929, "rewards/opening_diversity/std": 0.09038607776165009, "rewards/distinct_2/mean": 0.9278052449226379, "rewards/distinct_2/std": 0.1118457093834877, "rewards/total_composite/mean": 0.3243905305862427, "rewards/total_composite/std": 0.36138296127319336, "reward": 0.3243905305862427, "reward_std": 0.36138296127319336, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13323017954826355, "sampling/sampling_logp_difference/max": 1.5657258033752441, "sampling/importance_sampling_ratio/min": 0.20893631875514984, "sampling/importance_sampling_ratio/mean": 1.0500448942184448, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7880965247750282, "clip_ratio/low_mean": 0.06800894532352686, "clip_ratio/low_min": 0.06800894532352686, "clip_ratio/high_mean": 0.038596960715949535, "clip_ratio/high_max": 0.038596960715949535, "clip_ratio/region_mean": 0.1066059060394764, "reward_total_mean": 0.3243905305862427, "reward_meter_mean": 0.6977684497833252, "reward_meter_std": 0.3932817280292511, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9323267936706543, "reward_lexical_plausibility_std": 0.13708946108818054, "reward_repeat_penalty_mean": 0.8352065086364746, "reward_repeat_penalty_std": 0.20242764055728912, "reward_repeat_floor_mean": 0.9793391227722168, "reward_repeat_floor_std": 0.025525081902742386, "reward_near_duplicate_penalty_mean": 0.9230776429176331, "reward_near_duplicate_penalty_std": 0.0763208419084549, "reward_opening_diversity_mean": 0.956250011920929, "reward_opening_diversity_std": 0.09038607776165009, "reward_distinct_2_mean": 0.9278052449226379, "reward_distinct_2_std": 0.1118457093834877, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.3127185106277466, "reward_total_composite_mean": 0.3243905305862427, "reward_total_composite_std": 0.36138296127319336} {"timestamp_utc": "2026-04-12T19:55:22Z", "mode": "train", "global_step": 1048, "epoch": 0.055154991842534605, "loss": -0.0619, "grad_norm": 2.6656150817871094, "learning_rate": 6.827272727272728e-06, "num_tokens": 1867766.0, "completions/mean_length": 164.25, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 48.333335876464844, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.945351243019104, "rewards/meter/std": 0.07080448418855667, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.37796446681022644, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.11338934302330017, "rewards/lexical_plausibility/mean": 0.8734819889068604, "rewards/lexical_plausibility/std": 0.23427492380142212, "rewards/judge_quality/mean": 0.45249998569488525, "rewards/judge_quality/std": 0.3345252573490143, "rewards/repeat_penalty/mean": 0.9593273997306824, "rewards/repeat_penalty/std": 0.02835819311439991, "rewards/repeat_floor/mean": 0.9940921664237976, "rewards/repeat_floor/std": 0.00415258202701807, "rewards/near_duplicate_penalty/mean": 0.9627646207809448, "rewards/near_duplicate_penalty/std": 0.0270233191549778, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9964163303375244, "rewards/distinct_2/std": 0.007133082952350378, "rewards/total_composite/mean": 0.4152056872844696, "rewards/total_composite/std": 0.3385762870311737, "reward": 0.4152056872844696, "reward_std": 0.3385762870311737, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14341652393341064, "sampling/sampling_logp_difference/max": 1.234467625617981, "sampling/importance_sampling_ratio/min": 0.2909896671772003, "sampling/importance_sampling_ratio/mean": 1.0214452743530273, "sampling/importance_sampling_ratio/max": 1.8521702289581299, "entropy": 0.7694663479924202, "clip_ratio/low_mean": 0.06064156163483858, "clip_ratio/low_min": 0.06064156163483858, "clip_ratio/high_mean": 0.06093749962747097, "clip_ratio/high_max": 0.06093749962747097, "clip_ratio/region_mean": 0.12157906126230955, "reward_total_mean": 0.4152056872844696, "reward_meter_mean": 0.945351243019104, "reward_meter_std": 0.07080448418855667, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.37796446681022644, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.11338934302330017, "reward_lexical_plausibility_mean": 0.8734819889068604, "reward_lexical_plausibility_std": 0.23427492380142212, "reward_repeat_penalty_mean": 0.9593273997306824, "reward_repeat_penalty_std": 0.02835819311439991, "reward_repeat_floor_mean": 0.9940921664237976, "reward_repeat_floor_std": 0.00415258202701807, "reward_near_duplicate_penalty_mean": 0.9627646207809448, "reward_near_duplicate_penalty_std": 0.0270233191549778, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9964163303375244, "reward_distinct_2_std": 0.007133082952350378, "reward_judge_quality_mean": 0.45249998569488525, "reward_judge_quality_std": 0.3345252573490143, "reward_total_composite_mean": 0.4152056872844696, "reward_total_composite_std": 0.3385762870311737} {"timestamp_utc": "2026-04-12T19:55:37Z", "mode": "train", "global_step": 1049, "epoch": 0.05520762065154466, "loss": -0.0538, "grad_norm": 4.804747581481934, "learning_rate": 6.824242424242425e-06, "num_tokens": 1869306.0, "completions/mean_length": 85.5, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 24.571430206298828, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 28.0, "rewards/meter/mean": 0.7500928640365601, "rewards/meter/std": 0.3757437765598297, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.7450137138366699, "rewards/lexical_plausibility/std": 0.2284269630908966, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.16903084516525269, "rewards/repeat_penalty/mean": 0.7430853247642517, "rewards/repeat_penalty/std": 0.019557634368538857, "rewards/repeat_floor/mean": 0.9836170673370361, "rewards/repeat_floor/std": 0.0039115226827561855, "rewards/near_duplicate_penalty/mean": 0.9907804727554321, "rewards/near_duplicate_penalty/std": 0.026076845824718475, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19522154331207275, "rewards/total_composite/std": 0.1586945652961731, "reward": 0.19522154331207275, "reward_std": 0.1586945503950119, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17666389048099518, "sampling/sampling_logp_difference/max": 1.0350725650787354, "sampling/importance_sampling_ratio/min": 0.3552005887031555, "sampling/importance_sampling_ratio/mean": 1.041739821434021, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2145957052707672, "clip_ratio/low_mean": 0.11156832380220294, "clip_ratio/low_min": 0.11156832380220294, "clip_ratio/high_mean": 0.06845238246023655, "clip_ratio/high_max": 0.06845238246023655, "clip_ratio/region_mean": 0.1800207062624395, "reward_total_mean": 0.19522154331207275, "reward_meter_mean": 0.7500928640365601, "reward_meter_std": 0.3757437765598297, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.7450137138366699, "reward_lexical_plausibility_std": 0.2284269630908966, "reward_repeat_penalty_mean": 0.7430853247642517, "reward_repeat_penalty_std": 0.019557634368538857, "reward_repeat_floor_mean": 0.9836170673370361, "reward_repeat_floor_std": 0.0039115226827561855, "reward_near_duplicate_penalty_mean": 0.9907804727554321, "reward_near_duplicate_penalty_std": 0.026076845824718475, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.16903084516525269, "reward_total_composite_mean": 0.19522154331207275, "reward_total_composite_std": 0.1586945652961731} {"timestamp_utc": "2026-04-12T19:55:48Z", "mode": "train", "global_step": 1050, "epoch": 0.05526024946055471, "loss": -0.011, "grad_norm": 9.942171096801758, "learning_rate": 6.821212121212122e-06, "num_tokens": 1871497.0, "completions/mean_length": 94.875, "completions/min_length": 82.0, "completions/max_length": 113.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 94.875, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 113.0, "rewards/meter/mean": 0.9846819639205933, "rewards/meter/std": 0.005867636762559414, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9474999904632568, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.8275918960571289, "rewards/repeat_penalty/std": 0.0879611074924469, "rewards/repeat_floor/mean": 0.9796619415283203, "rewards/repeat_floor/std": 0.010421667248010635, "rewards/near_duplicate_penalty/mean": 0.933120846748352, "rewards/near_duplicate_penalty/std": 0.034280579537153244, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8854864835739136, "rewards/distinct_2/std": 0.07136402279138565, "rewards/total_composite/mean": 0.35399487614631653, "rewards/total_composite/std": 0.06711232662200928, "reward": 0.35399487614631653, "reward_std": 0.06711231917142868, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1373150497674942, "sampling/sampling_logp_difference/max": 1.6900954246520996, "sampling/importance_sampling_ratio/min": 0.18450191617012024, "sampling/importance_sampling_ratio/mean": 1.02568519115448, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.009215459227562, "clip_ratio/low_mean": 0.05434692371636629, "clip_ratio/low_min": 0.05434692371636629, "clip_ratio/high_mean": 0.06637095753103495, "clip_ratio/high_max": 0.06637095753103495, "clip_ratio/region_mean": 0.12071788124740124, "reward_total_mean": 0.35399487614631653, "reward_meter_mean": 0.9846819639205933, "reward_meter_std": 0.005867636762559414, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9474999904632568, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8275918960571289, "reward_repeat_penalty_std": 0.0879611074924469, "reward_repeat_floor_mean": 0.9796619415283203, "reward_repeat_floor_std": 0.010421667248010635, "reward_near_duplicate_penalty_mean": 0.933120846748352, "reward_near_duplicate_penalty_std": 0.034280579537153244, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8854864835739136, "reward_distinct_2_std": 0.07136402279138565, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.35399487614631653, "reward_total_composite_std": 0.06711232662200928} {"timestamp_utc": "2026-04-12T19:58:34Z", "mode": "eval", "global_step": 1050, "epoch": 0.05526024946055471, "eval_loss": NaN, "eval_runtime": 165.8218, "eval_samples_per_second": 0.627, "eval_steps_per_second": 0.078, "eval_num_tokens": 1871497.0, "eval_completions/mean_length": 181.07692307692307, "eval_completions/min_length": 48.69230769230769, "eval_completions/max_length": 463.7692307692308, "eval_completions/clipped_ratio": 0.1346153846153846, "eval_completions/mean_terminated_length": 130.24368462195764, "eval_completions/min_terminated_length": 48.69230769230769, "eval_completions/max_terminated_length": 260.0, "eval_rewards/meter/mean": 0.6325419086676377, "eval_rewards/meter/std": 0.34741294040129733, "eval_rewards/count_adherence/mean": 0.8383747935295105, "eval_rewards/count_adherence/std": 0.1801246553659439, "eval_rewards/arabic_clean/mean": 0.8173076923076923, "eval_rewards/arabic_clean/std": 0.3538298515173105, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9985576913906977, "eval_rewards/arabic_floor/std": 0.004079461670838869, "eval_rewards/count_floor/mean": 0.9515124376003559, "eval_rewards/count_floor/std": 0.05403739500504274, "eval_rewards/lexical_plausibility/mean": 0.9488471654745249, "eval_rewards/lexical_plausibility/std": 0.1151565955235408, "eval_rewards/judge_quality/mean": 0.29365384349456203, "eval_rewards/judge_quality/std": 0.15624268696858332, "eval_rewards/repeat_penalty/mean": 0.6301313638687134, "eval_rewards/repeat_penalty/std": 0.30668880618535554, "eval_rewards/repeat_floor/mean": 0.9571049717756418, "eval_rewards/repeat_floor/std": 0.03760866577235552, "eval_rewards/near_duplicate_penalty/mean": 0.9016651786290683, "eval_rewards/near_duplicate_penalty/std": 0.08141242311551021, "eval_rewards/opening_diversity/mean": 0.9554844727882972, "eval_rewards/opening_diversity/std": 0.09711383541042988, "eval_rewards/distinct_2/mean": 0.7169570968701289, "eval_rewards/distinct_2/std": 0.277169399536573, "eval_rewards/total_composite/mean": 0.1787545084953308, "eval_rewards/total_composite/std": 0.14113237192997566, "eval_reward": 0.1787545084953308, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.06447494402527809, "eval_sampling/sampling_logp_difference/max": 1.1991608509650598, "eval_sampling/importance_sampling_ratio/min": 0.31045468953939587, "eval_sampling/importance_sampling_ratio/mean": 1.0170835990172167, "eval_sampling/importance_sampling_ratio/max": 1.5534480259968684, "eval_entropy": 0.7405934104552636, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.1787545084953308, "eval_reward_meter_mean": 0.6325419086676377, "eval_reward_meter_std": 0.34741294040129733, "eval_reward_count_adherence_mean": 0.8383747935295105, "eval_reward_count_adherence_std": 0.1801246553659439, "eval_reward_arabic_clean_mean": 0.8173076923076923, "eval_reward_arabic_clean_std": 0.3538298515173105, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9985576913906977, "eval_reward_arabic_floor_std": 0.004079461670838869, "eval_reward_count_floor_mean": 0.9515124376003559, "eval_reward_count_floor_std": 0.05403739500504274, "eval_reward_lexical_plausibility_mean": 0.9488471654745249, "eval_reward_lexical_plausibility_std": 0.1151565955235408, "eval_reward_repeat_penalty_mean": 0.6301313638687134, "eval_reward_repeat_penalty_std": 0.30668880618535554, "eval_reward_repeat_floor_mean": 0.9571049717756418, "eval_reward_repeat_floor_std": 0.03760866577235552, "eval_reward_near_duplicate_penalty_mean": 0.9016651786290683, "eval_reward_near_duplicate_penalty_std": 0.08141242311551021, "eval_reward_opening_diversity_mean": 0.9554844727882972, "eval_reward_opening_diversity_std": 0.09711383541042988, "eval_reward_distinct_2_mean": 0.7169570968701289, "eval_reward_distinct_2_std": 0.277169399536573, "eval_reward_judge_quality_mean": 0.29365384349456203, "eval_reward_judge_quality_std": 0.15624268696858332, "eval_reward_total_composite_mean": 0.1787545084953308, "eval_reward_total_composite_std": 0.14113237192997566} {"timestamp_utc": "2026-04-12T19:58:56Z", "mode": "train", "global_step": 1051, "epoch": 0.05531287826956476, "loss": 0.0689, "grad_norm": 6.433602809906006, "learning_rate": 6.818181818181818e-06, "num_tokens": 1874586.0, "completions/mean_length": 178.125, "completions/min_length": 152.0, "completions/max_length": 208.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 178.125, "completions/min_terminated_length": 152.0, "completions/max_terminated_length": 208.0, "rewards/meter/mean": 0.892245888710022, "rewards/meter/std": 0.11291775852441788, "rewards/count_adherence/mean": 0.8181818127632141, "rewards/count_adherence/std": 0.06872081756591797, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9454545974731445, "rewards/count_floor/std": 0.02061624825000763, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.010859579779207706, "rewards/repeat_penalty/std": 0.02485370635986328, "rewards/repeat_floor/mean": 0.7860385775566101, "rewards/repeat_floor/std": 0.03931530937552452, "rewards/near_duplicate_penalty/mean": 0.44362872838974, "rewards/near_duplicate_penalty/std": 0.18571671843528748, "rewards/opening_diversity/mean": 0.25591516494750977, "rewards/opening_diversity/std": 0.11222255229949951, "rewards/distinct_2/mean": 0.04599259793758392, "rewards/distinct_2/std": 0.0893903449177742, "rewards/total_composite/mean": 0.09890294820070267, "rewards/total_composite/std": 0.008755313232541084, "reward": 0.09890294820070267, "reward_std": 0.008755314163863659, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.058146748691797256, "sampling/sampling_logp_difference/max": 2.436023712158203, "sampling/importance_sampling_ratio/min": 0.08750811964273453, "sampling/importance_sampling_ratio/mean": 1.0135841369628906, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3538610301911831, "clip_ratio/low_mean": 0.03504520142450929, "clip_ratio/low_min": 0.03504520142450929, "clip_ratio/high_mean": 0.02121712057851255, "clip_ratio/high_max": 0.02121712057851255, "clip_ratio/region_mean": 0.056262322003021836, "reward_total_mean": 0.09890294820070267, "reward_meter_mean": 0.892245888710022, "reward_meter_std": 0.11291775852441788, "reward_count_adherence_mean": 0.8181818127632141, "reward_count_adherence_std": 0.06872081756591797, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9454545974731445, "reward_count_floor_std": 0.02061624825000763, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.010859579779207706, "reward_repeat_penalty_std": 0.02485370635986328, "reward_repeat_floor_mean": 0.7860385775566101, "reward_repeat_floor_std": 0.03931530937552452, "reward_near_duplicate_penalty_mean": 0.44362872838974, "reward_near_duplicate_penalty_std": 0.18571671843528748, "reward_opening_diversity_mean": 0.25591516494750977, "reward_opening_diversity_std": 0.11222255229949951, "reward_distinct_2_mean": 0.04599259793758392, "reward_distinct_2_std": 0.0893903449177742, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.09890294820070267, "reward_total_composite_std": 0.008755313232541084} {"timestamp_utc": "2026-04-12T19:59:15Z", "mode": "train", "global_step": 1052, "epoch": 0.055365507078574815, "loss": -0.0504, "grad_norm": 5.15717887878418, "learning_rate": 6.8151515151515155e-06, "num_tokens": 1876170.0, "completions/mean_length": 108.0, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 50.28571701049805, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.9441964626312256, "rewards/meter/std": 0.13102741539478302, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.942996621131897, "rewards/lexical_plausibility/std": 0.16123001277446747, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1505940556526184, "rewards/repeat_penalty/mean": 0.9034607410430908, "rewards/repeat_penalty/std": 0.07770588248968124, "rewards/repeat_floor/mean": 0.989519476890564, "rewards/repeat_floor/std": 0.006607821211218834, "rewards/near_duplicate_penalty/mean": 0.956121027469635, "rewards/near_duplicate_penalty/std": 0.04314931482076645, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9775147438049316, "rewards/distinct_2/std": 0.031041136011481285, "rewards/total_composite/mean": 0.2695521116256714, "rewards/total_composite/std": 0.15337784588336945, "reward": 0.2695521116256714, "reward_std": 0.15337783098220825, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1628119796514511, "sampling/sampling_logp_difference/max": 1.3122692108154297, "sampling/importance_sampling_ratio/min": 0.26920846104621887, "sampling/importance_sampling_ratio/mean": 1.034109115600586, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1611990332603455, "clip_ratio/low_mean": 0.03667763154953718, "clip_ratio/low_min": 0.03667763154953718, "clip_ratio/high_mean": 0.09007105976343155, "clip_ratio/high_max": 0.09007105976343155, "clip_ratio/region_mean": 0.12674869131296873, "reward_total_mean": 0.2695521116256714, "reward_meter_mean": 0.9441964626312256, "reward_meter_std": 0.13102741539478302, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.942996621131897, "reward_lexical_plausibility_std": 0.16123001277446747, "reward_repeat_penalty_mean": 0.9034607410430908, "reward_repeat_penalty_std": 0.07770588248968124, "reward_repeat_floor_mean": 0.989519476890564, "reward_repeat_floor_std": 0.006607821211218834, "reward_near_duplicate_penalty_mean": 0.956121027469635, "reward_near_duplicate_penalty_std": 0.04314931482076645, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9775147438049316, "reward_distinct_2_std": 0.031041136011481285, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1505940556526184, "reward_total_composite_mean": 0.2695521116256714, "reward_total_composite_std": 0.15337784588336945} {"timestamp_utc": "2026-04-12T19:59:33Z", "mode": "train", "global_step": 1053, "epoch": 0.05541813588758487, "loss": -0.0273, "grad_norm": 5.930370807647705, "learning_rate": 6.812121212121212e-06, "num_tokens": 1877840.0, "completions/mean_length": 111.75, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 54.57143020629883, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 108.0, "rewards/meter/mean": 0.7181860208511353, "rewards/meter/std": 0.3997362554073334, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9589493870735168, "rewards/lexical_plausibility/std": 0.11610868573188782, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.8715294599533081, "rewards/repeat_penalty/std": 0.17832595109939575, "rewards/repeat_floor/mean": 0.986426591873169, "rewards/repeat_floor/std": 0.019042083993554115, "rewards/near_duplicate_penalty/mean": 0.9549828767776489, "rewards/near_duplicate_penalty/std": 0.05734385922551155, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9450459480285645, "rewards/distinct_2/std": 0.07699161767959595, "rewards/total_composite/mean": 0.2721409201622009, "rewards/total_composite/std": 0.17866960167884827, "reward": 0.2721409201622009, "reward_std": 0.17866961658000946, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15803660452365875, "sampling/sampling_logp_difference/max": 1.1634140014648438, "sampling/importance_sampling_ratio/min": 0.31848540902137756, "sampling/importance_sampling_ratio/mean": 1.0133339166641235, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9356729984283447, "clip_ratio/low_mean": 0.03724747523665428, "clip_ratio/low_min": 0.03724747523665428, "clip_ratio/high_mean": 0.10755943227559328, "clip_ratio/high_max": 0.10755943227559328, "clip_ratio/region_mean": 0.14480690751224756, "reward_total_mean": 0.2721409201622009, "reward_meter_mean": 0.7181860208511353, "reward_meter_std": 0.3997362554073334, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9589493870735168, "reward_lexical_plausibility_std": 0.11610868573188782, "reward_repeat_penalty_mean": 0.8715294599533081, "reward_repeat_penalty_std": 0.17832595109939575, "reward_repeat_floor_mean": 0.986426591873169, "reward_repeat_floor_std": 0.019042083993554115, "reward_near_duplicate_penalty_mean": 0.9549828767776489, "reward_near_duplicate_penalty_std": 0.05734385922551155, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9450459480285645, "reward_distinct_2_std": 0.07699161767959595, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.2721409201622009, "reward_total_composite_std": 0.17866960167884827} {"timestamp_utc": "2026-04-12T19:59:44Z", "mode": "train", "global_step": 1054, "epoch": 0.05547076469659492, "loss": 0.3981, "grad_norm": 18.729524612426758, "learning_rate": 6.80909090909091e-06, "num_tokens": 1879511.0, "completions/mean_length": 57.875, "completions/min_length": 36.0, "completions/max_length": 129.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 57.875, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 129.0, "rewards/meter/mean": 0.740469753742218, "rewards/meter/std": 0.3820609748363495, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.37796446681022644, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.11338934302330017, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.82399582862854, "rewards/repeat_penalty/std": 0.27185317873954773, "rewards/repeat_floor/mean": 0.9810456037521362, "rewards/repeat_floor/std": 0.02700800821185112, "rewards/near_duplicate_penalty/mean": 0.9464839696884155, "rewards/near_duplicate_penalty/std": 0.048685867339372635, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8785883188247681, "rewards/distinct_2/std": 0.22482581436634064, "rewards/total_composite/mean": 0.27263057231903076, "rewards/total_composite/std": 0.1562337726354599, "reward": 0.27263057231903076, "reward_std": 0.1562337726354599, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1589154154062271, "sampling/sampling_logp_difference/max": 3.067474842071533, "sampling/importance_sampling_ratio/min": 0.04653852432966232, "sampling/importance_sampling_ratio/mean": 1.0194118022918701, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9854426980018616, "clip_ratio/low_mean": 0.03309714142233133, "clip_ratio/low_min": 0.03309714142233133, "clip_ratio/high_mean": 0.10806720703840256, "clip_ratio/high_max": 0.10806720703840256, "clip_ratio/region_mean": 0.1411643484607339, "reward_total_mean": 0.27263057231903076, "reward_meter_mean": 0.740469753742218, "reward_meter_std": 0.3820609748363495, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.37796446681022644, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.11338934302330017, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.82399582862854, "reward_repeat_penalty_std": 0.27185317873954773, "reward_repeat_floor_mean": 0.9810456037521362, "reward_repeat_floor_std": 0.02700800821185112, "reward_near_duplicate_penalty_mean": 0.9464839696884155, "reward_near_duplicate_penalty_std": 0.048685867339372635, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8785883188247681, "reward_distinct_2_std": 0.22482581436634064, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.27263057231903076, "reward_total_composite_std": 0.1562337726354599} {"timestamp_utc": "2026-04-12T20:00:02Z", "mode": "train", "global_step": 1055, "epoch": 0.055523393505604965, "loss": -0.1124, "grad_norm": 1.7240773439407349, "learning_rate": 6.806060606060607e-06, "num_tokens": 1881232.0, "completions/mean_length": 231.125, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 62.60000228881836, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 78.0, "rewards/meter/mean": 0.7945102453231812, "rewards/meter/std": 0.3211391866207123, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8764052391052246, "rewards/lexical_plausibility/std": 0.1765848696231842, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.6604894995689392, "rewards/repeat_penalty/std": 0.29806774854660034, "rewards/repeat_floor/mean": 0.9599384069442749, "rewards/repeat_floor/std": 0.03850284218788147, "rewards/near_duplicate_penalty/mean": 0.8947899341583252, "rewards/near_duplicate_penalty/std": 0.10041578114032745, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.7718883156776428, "rewards/distinct_2/std": 0.20208999514579773, "rewards/total_composite/mean": 0.23197248578071594, "rewards/total_composite/std": 0.15391208231449127, "reward": 0.23197248578071594, "reward_std": 0.15391208231449127, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14595472812652588, "sampling/sampling_logp_difference/max": 3.4403138160705566, "sampling/importance_sampling_ratio/min": 0.03205462545156479, "sampling/importance_sampling_ratio/mean": 1.025005578994751, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6018383800983429, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0645558824762702, "clip_ratio/high_max": 0.0645558824762702, "clip_ratio/region_mean": 0.0645558824762702, "reward_total_mean": 0.23197248578071594, "reward_meter_mean": 0.7945102453231812, "reward_meter_std": 0.3211391866207123, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8764052391052246, "reward_lexical_plausibility_std": 0.1765848696231842, "reward_repeat_penalty_mean": 0.6604894995689392, "reward_repeat_penalty_std": 0.29806774854660034, "reward_repeat_floor_mean": 0.9599384069442749, "reward_repeat_floor_std": 0.03850284218788147, "reward_near_duplicate_penalty_mean": 0.8947899341583252, "reward_near_duplicate_penalty_std": 0.10041578114032745, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.7718883156776428, "reward_distinct_2_std": 0.20208999514579773, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.23197248578071594, "reward_total_composite_std": 0.15391208231449127} {"timestamp_utc": "2026-04-12T20:00:13Z", "mode": "train", "global_step": 1056, "epoch": 0.05557602231461502, "loss": 0.1138, "grad_norm": 13.494691848754883, "learning_rate": 6.803030303030304e-06, "num_tokens": 1882856.0, "completions/mean_length": 44.0, "completions/min_length": 36.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.0, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.6584372520446777, "rewards/meter/std": 0.32397934794425964, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.97265625, "rewards/lexical_plausibility/std": 0.07733980566263199, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.2522329092025757, "rewards/repeat_penalty/mean": 0.8241800665855408, "rewards/repeat_penalty/std": 0.14683881402015686, "rewards/repeat_floor/mean": 0.9783002734184265, "rewards/repeat_floor/std": 0.018380578607320786, "rewards/near_duplicate_penalty/mean": 0.908063530921936, "rewards/near_duplicate_penalty/std": 0.09522882848978043, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9329525232315063, "rewards/distinct_2/std": 0.05054157227277756, "rewards/total_composite/mean": 0.3619273900985718, "rewards/total_composite/std": 0.3119892477989197, "reward": 0.3619273900985718, "reward_std": 0.3119892477989197, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1304035186767578, "sampling/sampling_logp_difference/max": 1.7612848281860352, "sampling/importance_sampling_ratio/min": 0.17182396352291107, "sampling/importance_sampling_ratio/mean": 1.0198287963867188, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.059627190232277, "clip_ratio/low_mean": 0.11065081227570772, "clip_ratio/low_min": 0.11065081227570772, "clip_ratio/high_mean": 0.03814102616161108, "clip_ratio/high_max": 0.03814102616161108, "clip_ratio/region_mean": 0.1487918384373188, "reward_total_mean": 0.3619273900985718, "reward_meter_mean": 0.6584372520446777, "reward_meter_std": 0.32397934794425964, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.97265625, "reward_lexical_plausibility_std": 0.07733980566263199, "reward_repeat_penalty_mean": 0.8241800665855408, "reward_repeat_penalty_std": 0.14683881402015686, "reward_repeat_floor_mean": 0.9783002734184265, "reward_repeat_floor_std": 0.018380578607320786, "reward_near_duplicate_penalty_mean": 0.908063530921936, "reward_near_duplicate_penalty_std": 0.09522882848978043, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9329525232315063, "reward_distinct_2_std": 0.05054157227277756, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.2522329092025757, "reward_total_composite_mean": 0.3619273900985718, "reward_total_composite_std": 0.3119892477989197} {"timestamp_utc": "2026-04-12T20:00:30Z", "mode": "train", "global_step": 1057, "epoch": 0.05562865112362507, "loss": -0.0935, "grad_norm": 2.5543081760406494, "learning_rate": 6.800000000000001e-06, "num_tokens": 1884421.0, "completions/mean_length": 163.625, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 47.5, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.6037691831588745, "rewards/meter/std": 0.46449241042137146, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.11160357296466827, "rewards/lexical_plausibility/mean": 0.8839333057403564, "rewards/lexical_plausibility/std": 0.21582959592342377, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.16850179433822632, "rewards/repeat_penalty/mean": 0.9102270603179932, "rewards/repeat_penalty/std": 0.061639171093702316, "rewards/repeat_floor/mean": 0.9885294437408447, "rewards/repeat_floor/std": 0.008984849788248539, "rewards/near_duplicate_penalty/mean": 0.9452494978904724, "rewards/near_duplicate_penalty/std": 0.0642799362540245, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9637999534606934, "rewards/distinct_2/std": 0.039412181824445724, "rewards/total_composite/mean": 0.22545307874679565, "rewards/total_composite/std": 0.174667090177536, "reward": 0.22545307874679565, "reward_std": 0.174667090177536, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11902369558811188, "sampling/sampling_logp_difference/max": 1.1344772577285767, "sampling/importance_sampling_ratio/min": 0.3215901851654053, "sampling/importance_sampling_ratio/mean": 1.0294219255447388, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5526062697172165, "clip_ratio/low_mean": 0.011627906933426857, "clip_ratio/low_min": 0.011627906933426857, "clip_ratio/high_mean": 0.08634344255551696, "clip_ratio/high_max": 0.08634344255551696, "clip_ratio/region_mean": 0.09797134948894382, "reward_total_mean": 0.22545307874679565, "reward_meter_mean": 0.6037691831588745, "reward_meter_std": 0.46449241042137146, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.11160357296466827, "reward_lexical_plausibility_mean": 0.8839333057403564, "reward_lexical_plausibility_std": 0.21582959592342377, "reward_repeat_penalty_mean": 0.9102270603179932, "reward_repeat_penalty_std": 0.061639171093702316, "reward_repeat_floor_mean": 0.9885294437408447, "reward_repeat_floor_std": 0.008984849788248539, "reward_near_duplicate_penalty_mean": 0.9452494978904724, "reward_near_duplicate_penalty_std": 0.0642799362540245, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9637999534606934, "reward_distinct_2_std": 0.039412181824445724, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.16850179433822632, "reward_total_composite_mean": 0.22545307874679565, "reward_total_composite_std": 0.174667090177536} {"timestamp_utc": "2026-04-12T20:00:44Z", "mode": "train", "global_step": 1058, "epoch": 0.05568127993263512, "loss": -0.0657, "grad_norm": 2.4039409160614014, "learning_rate": 6.796969696969697e-06, "num_tokens": 1886124.0, "completions/mean_length": 162.875, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 46.5, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.629806399345398, "rewards/meter/std": 0.41197389364242554, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.8900993466377258, "rewards/lexical_plausibility/std": 0.20356714725494385, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.8640317916870117, "rewards/repeat_penalty/std": 0.12923002243041992, "rewards/repeat_floor/mean": 0.9841066002845764, "rewards/repeat_floor/std": 0.014904729090631008, "rewards/near_duplicate_penalty/mean": 0.9508353471755981, "rewards/near_duplicate_penalty/std": 0.04037024453282356, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9053477048873901, "rewards/distinct_2/std": 0.10357029736042023, "rewards/total_composite/mean": 0.21735641360282898, "rewards/total_composite/std": 0.17386916279792786, "reward": 0.21735641360282898, "reward_std": 0.17386916279792786, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1386731117963791, "sampling/sampling_logp_difference/max": 1.817184567451477, "sampling/importance_sampling_ratio/min": 0.16248255968093872, "sampling/importance_sampling_ratio/mean": 1.005149006843567, "sampling/importance_sampling_ratio/max": 1.8159948587417603, "entropy": 0.7190160900354385, "clip_ratio/low_mean": 0.01785714365541935, "clip_ratio/low_min": 0.01785714365541935, "clip_ratio/high_mean": 0.08336841035634279, "clip_ratio/high_max": 0.08336841035634279, "clip_ratio/region_mean": 0.10122555401176214, "reward_total_mean": 0.21735641360282898, "reward_meter_mean": 0.629806399345398, "reward_meter_std": 0.41197389364242554, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.8900993466377258, "reward_lexical_plausibility_std": 0.20356714725494385, "reward_repeat_penalty_mean": 0.8640317916870117, "reward_repeat_penalty_std": 0.12923002243041992, "reward_repeat_floor_mean": 0.9841066002845764, "reward_repeat_floor_std": 0.014904729090631008, "reward_near_duplicate_penalty_mean": 0.9508353471755981, "reward_near_duplicate_penalty_std": 0.04037024453282356, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9053477048873901, "reward_distinct_2_std": 0.10357029736042023, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.21735641360282898, "reward_total_composite_std": 0.17386916279792786} {"timestamp_utc": "2026-04-12T20:00:58Z", "mode": "train", "global_step": 1059, "epoch": 0.055733908741645175, "loss": -0.06, "grad_norm": 1.3979827165603638, "learning_rate": 6.793939393939395e-06, "num_tokens": 1887704.0, "completions/mean_length": 400.5, "completions/min_length": 65.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 66.0, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.4304245710372925, "rewards/meter/std": 0.42752981185913086, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.35634833574295044, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.10690450668334961, "rewards/lexical_plausibility/mean": 0.7138697504997253, "rewards/lexical_plausibility/std": 0.18141908943653107, "rewards/judge_quality/mean": 0.08124999701976776, "rewards/judge_quality/std": 0.05938675254583359, "rewards/repeat_penalty/mean": 0.8546221256256104, "rewards/repeat_penalty/std": 0.18983952701091766, "rewards/repeat_floor/mean": 0.9849105477333069, "rewards/repeat_floor/std": 0.01979179121553898, "rewards/near_duplicate_penalty/mean": 0.9394791126251221, "rewards/near_duplicate_penalty/std": 0.06317517161369324, "rewards/opening_diversity/mean": 0.9821428656578064, "rewards/opening_diversity/std": 0.05050762742757797, "rewards/distinct_2/mean": 0.9451121091842651, "rewards/distinct_2/std": 0.09245479851961136, "rewards/total_composite/mean": 0.04833013191819191, "rewards/total_composite/std": 0.05893223360180855, "reward": 0.04833013191819191, "reward_std": 0.05893222987651825, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1608784794807434, "sampling/sampling_logp_difference/max": 1.230952262878418, "sampling/importance_sampling_ratio/min": 0.29201436042785645, "sampling/importance_sampling_ratio/mean": 1.0251495838165283, "sampling/importance_sampling_ratio/max": 1.996578335762024, "entropy": 0.2717258781194687, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.03030998818576336, "clip_ratio/high_max": 0.03030998818576336, "clip_ratio/region_mean": 0.03030998818576336, "reward_total_mean": 0.04833013191819191, "reward_meter_mean": 0.4304245710372925, "reward_meter_std": 0.42752981185913086, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.35634833574295044, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.10690450668334961, "reward_lexical_plausibility_mean": 0.7138697504997253, "reward_lexical_plausibility_std": 0.18141908943653107, "reward_repeat_penalty_mean": 0.8546221256256104, "reward_repeat_penalty_std": 0.18983952701091766, "reward_repeat_floor_mean": 0.9849105477333069, "reward_repeat_floor_std": 0.01979179121553898, "reward_near_duplicate_penalty_mean": 0.9394791126251221, "reward_near_duplicate_penalty_std": 0.06317517161369324, "reward_opening_diversity_mean": 0.9821428656578064, "reward_opening_diversity_std": 0.05050762742757797, "reward_distinct_2_mean": 0.9451121091842651, "reward_distinct_2_std": 0.09245479851961136, "reward_judge_quality_mean": 0.08124999701976776, "reward_judge_quality_std": 0.05938675254583359, "reward_total_composite_mean": 0.04833013191819191, "reward_total_composite_std": 0.05893223360180855} {"timestamp_utc": "2026-04-12T20:01:17Z", "mode": "train", "global_step": 1060, "epoch": 0.05578653755065523, "loss": -0.0819, "grad_norm": 1.4049897193908691, "learning_rate": 6.790909090909091e-06, "num_tokens": 1889125.0, "completions/mean_length": 344.625, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 65.66667175292969, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.8862758874893188, "rewards/meter/std": 0.12985679507255554, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.1060660183429718, "rewards/lexical_plausibility/mean": 0.7624388337135315, "rewards/lexical_plausibility/std": 0.20639127492904663, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.16850179433822632, "rewards/repeat_penalty/mean": 0.9160146713256836, "rewards/repeat_penalty/std": 0.08384377509355545, "rewards/repeat_floor/mean": 0.9922943711280823, "rewards/repeat_floor/std": 0.005956006236374378, "rewards/near_duplicate_penalty/mean": 0.9839053750038147, "rewards/near_duplicate_penalty/std": 0.013218950480222702, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9620392322540283, "rewards/distinct_2/std": 0.038459762930870056, "rewards/total_composite/mean": 0.15728075802326202, "rewards/total_composite/std": 0.14909547567367554, "reward": 0.15728075802326202, "reward_std": 0.14909547567367554, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14358174800872803, "sampling/sampling_logp_difference/max": 1.3824973106384277, "sampling/importance_sampling_ratio/min": 0.2509510815143585, "sampling/importance_sampling_ratio/mean": 1.0164670944213867, "sampling/importance_sampling_ratio/max": 1.7339977025985718, "entropy": 0.5054924339056015, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0542998481541872, "clip_ratio/high_max": 0.0542998481541872, "clip_ratio/region_mean": 0.0542998481541872, "reward_total_mean": 0.15728075802326202, "reward_meter_mean": 0.8862758874893188, "reward_meter_std": 0.12985679507255554, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.1060660183429718, "reward_lexical_plausibility_mean": 0.7624388337135315, "reward_lexical_plausibility_std": 0.20639127492904663, "reward_repeat_penalty_mean": 0.9160146713256836, "reward_repeat_penalty_std": 0.08384377509355545, "reward_repeat_floor_mean": 0.9922943711280823, "reward_repeat_floor_std": 0.005956006236374378, "reward_near_duplicate_penalty_mean": 0.9839053750038147, "reward_near_duplicate_penalty_std": 0.013218950480222702, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9620392322540283, "reward_distinct_2_std": 0.038459762930870056, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.16850179433822632, "reward_total_composite_mean": 0.15728075802326202, "reward_total_composite_std": 0.14909547567367554} {"timestamp_utc": "2026-04-12T20:01:32Z", "mode": "train", "global_step": 1061, "epoch": 0.05583916635966528, "loss": -0.1515, "grad_norm": 4.107607364654541, "learning_rate": 6.787878787878789e-06, "num_tokens": 1891867.0, "completions/mean_length": 199.75, "completions/min_length": 136.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 155.1428680419922, "completions/min_terminated_length": 136.0, "completions/max_terminated_length": 167.0, "rewards/meter/mean": 0.9535471200942993, "rewards/meter/std": 0.06693251430988312, "rewards/count_adherence/mean": 0.7321428656578064, "rewards/count_adherence/std": 0.141575887799263, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9196428060531616, "rewards/count_floor/std": 0.042472753673791885, "rewards/lexical_plausibility/mean": 0.9342121481895447, "rewards/lexical_plausibility/std": 0.12252917885780334, "rewards/judge_quality/mean": 0.21875, "rewards/judge_quality/std": 0.12799972295761108, "rewards/repeat_penalty/mean": 0.5980527400970459, "rewards/repeat_penalty/std": 0.1840987354516983, "rewards/repeat_floor/mean": 0.9544660449028015, "rewards/repeat_floor/std": 0.024737274274230003, "rewards/near_duplicate_penalty/mean": 0.9016295671463013, "rewards/near_duplicate_penalty/std": 0.04615097492933273, "rewards/opening_diversity/mean": 0.8622158765792847, "rewards/opening_diversity/std": 0.15586212277412415, "rewards/distinct_2/mean": 0.7498734593391418, "rewards/distinct_2/std": 0.12536492943763733, "rewards/total_composite/mean": 0.18040475249290466, "rewards/total_composite/std": 0.10451984405517578, "reward": 0.18040475249290466, "reward_std": 0.10451985150575638, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14744122326374054, "sampling/sampling_logp_difference/max": 2.5274710655212402, "sampling/importance_sampling_ratio/min": 0.07986072450876236, "sampling/importance_sampling_ratio/mean": 1.0065003633499146, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2474434822797775, "clip_ratio/low_mean": 0.03400100348517299, "clip_ratio/low_min": 0.03400100348517299, "clip_ratio/high_mean": 0.06318632420152426, "clip_ratio/high_max": 0.06318632420152426, "clip_ratio/region_mean": 0.09718732768669724, "reward_total_mean": 0.18040475249290466, "reward_meter_mean": 0.9535471200942993, "reward_meter_std": 0.06693251430988312, "reward_count_adherence_mean": 0.7321428656578064, "reward_count_adherence_std": 0.141575887799263, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9196428060531616, "reward_count_floor_std": 0.042472753673791885, "reward_lexical_plausibility_mean": 0.9342121481895447, "reward_lexical_plausibility_std": 0.12252917885780334, "reward_repeat_penalty_mean": 0.5980527400970459, "reward_repeat_penalty_std": 0.1840987354516983, "reward_repeat_floor_mean": 0.9544660449028015, "reward_repeat_floor_std": 0.024737274274230003, "reward_near_duplicate_penalty_mean": 0.9016295671463013, "reward_near_duplicate_penalty_std": 0.04615097492933273, "reward_opening_diversity_mean": 0.8622158765792847, "reward_opening_diversity_std": 0.15586212277412415, "reward_distinct_2_mean": 0.7498734593391418, "reward_distinct_2_std": 0.12536492943763733, "reward_judge_quality_mean": 0.21875, "reward_judge_quality_std": 0.12799972295761108, "reward_total_composite_mean": 0.18040475249290466, "reward_total_composite_std": 0.10451984405517578} {"timestamp_utc": "2026-04-12T20:01:41Z", "mode": "train", "global_step": 1062, "epoch": 0.05589179516867533, "loss": 0.2148, "grad_norm": 14.848766326904297, "learning_rate": 6.7848484848484855e-06, "num_tokens": 1893426.0, "completions/mean_length": 44.875, "completions/min_length": 37.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.875, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.8891546726226807, "rewards/meter/std": 0.2533186078071594, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7374999523162842, "rewards/judge_quality/std": 0.29489707946777344, "rewards/repeat_penalty/mean": 0.9520331621170044, "rewards/repeat_penalty/std": 0.05258069187402725, "rewards/repeat_floor/mean": 0.9941830635070801, "rewards/repeat_floor/std": 0.006022192072123289, "rewards/near_duplicate_penalty/mean": 0.9767163991928101, "rewards/near_duplicate_penalty/std": 0.019991640001535416, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9741734266281128, "rewards/distinct_2/std": 0.03608804941177368, "rewards/total_composite/mean": 0.6819944977760315, "rewards/total_composite/std": 0.356192022562027, "reward": 0.6819944977760315, "reward_std": 0.356192022562027, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10999785363674164, "sampling/sampling_logp_difference/max": 1.8745062351226807, "sampling/importance_sampling_ratio/min": 0.2727104127407074, "sampling/importance_sampling_ratio/mean": 1.0146538019180298, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5823167040944099, "clip_ratio/low_mean": 0.04365589935332537, "clip_ratio/low_min": 0.04365589935332537, "clip_ratio/high_mean": 0.027027026982977986, "clip_ratio/high_max": 0.027027026982977986, "clip_ratio/region_mean": 0.07068292633630335, "reward_total_mean": 0.6819944977760315, "reward_meter_mean": 0.8891546726226807, "reward_meter_std": 0.2533186078071594, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9520331621170044, "reward_repeat_penalty_std": 0.05258069187402725, "reward_repeat_floor_mean": 0.9941830635070801, "reward_repeat_floor_std": 0.006022192072123289, "reward_near_duplicate_penalty_mean": 0.9767163991928101, "reward_near_duplicate_penalty_std": 0.019991640001535416, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9741734266281128, "reward_distinct_2_std": 0.03608804941177368, "reward_judge_quality_mean": 0.7374999523162842, "reward_judge_quality_std": 0.29489707946777344, "reward_total_composite_mean": 0.6819944977760315, "reward_total_composite_std": 0.356192022562027} {"timestamp_utc": "2026-04-12T20:01:56Z", "mode": "train", "global_step": 1063, "epoch": 0.055944423977685384, "loss": -0.0645, "grad_norm": 1.2782859802246094, "learning_rate": 6.781818181818183e-06, "num_tokens": 1895374.0, "completions/mean_length": 468.5, "completions/min_length": 164.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.875, "completions/mean_terminated_length": 164.0, "completions/min_terminated_length": 164.0, "completions/max_terminated_length": 164.0, "rewards/meter/mean": 0.7416023015975952, "rewards/meter/std": 0.23459242284297943, "rewards/count_adherence/mean": 0.6111111640930176, "rewards/count_adherence/std": 0.2300218641757965, "rewards/arabic_clean/mean": 0.125, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8833333253860474, "rewards/count_floor/std": 0.06900654733181, "rewards/lexical_plausibility/mean": 0.7000858187675476, "rewards/lexical_plausibility/std": 0.16103827953338623, "rewards/judge_quality/mean": 0.10000000149011612, "rewards/judge_quality/std": 0.053452253341674805, "rewards/repeat_penalty/mean": 0.8089038133621216, "rewards/repeat_penalty/std": 0.2780887484550476, "rewards/repeat_floor/mean": 0.9789993166923523, "rewards/repeat_floor/std": 0.029382452368736267, "rewards/near_duplicate_penalty/mean": 0.9428079128265381, "rewards/near_duplicate_penalty/std": 0.05258138105273247, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8828124403953552, "rewards/distinct_2/std": 0.26019859313964844, "rewards/total_composite/mean": 0.06213457137346268, "rewards/total_composite/std": 0.04056248441338539, "reward": 0.06213457137346268, "reward_std": 0.04056248441338539, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09518899023532867, "sampling/sampling_logp_difference/max": 2.308614492416382, "sampling/importance_sampling_ratio/min": 0.09939887374639511, "sampling/importance_sampling_ratio/mean": 1.024430513381958, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.0841052234172821, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.009146341122686863, "clip_ratio/high_max": 0.009146341122686863, "clip_ratio/region_mean": 0.009146341122686863, "reward_total_mean": 0.06213457137346268, "reward_meter_mean": 0.7416023015975952, "reward_meter_std": 0.23459242284297943, "reward_count_adherence_mean": 0.6111111640930176, "reward_count_adherence_std": 0.2300218641757965, "reward_arabic_clean_mean": 0.125, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8833333253860474, "reward_count_floor_std": 0.06900654733181, "reward_lexical_plausibility_mean": 0.7000858187675476, "reward_lexical_plausibility_std": 0.16103827953338623, "reward_repeat_penalty_mean": 0.8089038133621216, "reward_repeat_penalty_std": 0.2780887484550476, "reward_repeat_floor_mean": 0.9789993166923523, "reward_repeat_floor_std": 0.029382452368736267, "reward_near_duplicate_penalty_mean": 0.9428079128265381, "reward_near_duplicate_penalty_std": 0.05258138105273247, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8828124403953552, "reward_distinct_2_std": 0.26019859313964844, "reward_judge_quality_mean": 0.10000000149011612, "reward_judge_quality_std": 0.053452253341674805, "reward_total_composite_mean": 0.06213457137346268, "reward_total_composite_std": 0.04056248441338539} {"timestamp_utc": "2026-04-12T20:02:12Z", "mode": "train", "global_step": 1064, "epoch": 0.055997052786695437, "loss": -0.0474, "grad_norm": 1.296054720878601, "learning_rate": 6.778787878787879e-06, "num_tokens": 1896773.0, "completions/mean_length": 395.875, "completions/min_length": 47.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 47.5, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.3521232604980469, "rewards/meter/std": 0.38961490988731384, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.7096376419067383, "rewards/lexical_plausibility/std": 0.18482549488544464, "rewards/judge_quality/mean": 0.11249999701976776, "rewards/judge_quality/std": 0.1482035368680954, "rewards/repeat_penalty/mean": 0.9406920075416565, "rewards/repeat_penalty/std": 0.08965983241796494, "rewards/repeat_floor/mean": 0.9944422245025635, "rewards/repeat_floor/std": 0.006898265331983566, "rewards/near_duplicate_penalty/mean": 0.9816901683807373, "rewards/near_duplicate_penalty/std": 0.026689769700169563, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9895961284637451, "rewards/distinct_2/std": 0.024498410522937775, "rewards/total_composite/mean": 0.08751553297042847, "rewards/total_composite/std": 0.15225645899772644, "reward": 0.08751553297042847, "reward_std": 0.15225645899772644, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17415796220302582, "sampling/sampling_logp_difference/max": 0.9947662353515625, "sampling/importance_sampling_ratio/min": 0.3698098957538605, "sampling/importance_sampling_ratio/mean": 1.0123945474624634, "sampling/importance_sampling_ratio/max": 1.951388955116272, "entropy": 0.2597910240292549, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.036846186965703964, "clip_ratio/high_max": 0.036846186965703964, "clip_ratio/region_mean": 0.036846186965703964, "reward_total_mean": 0.08751553297042847, "reward_meter_mean": 0.3521232604980469, "reward_meter_std": 0.38961490988731384, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.7096376419067383, "reward_lexical_plausibility_std": 0.18482549488544464, "reward_repeat_penalty_mean": 0.9406920075416565, "reward_repeat_penalty_std": 0.08965983241796494, "reward_repeat_floor_mean": 0.9944422245025635, "reward_repeat_floor_std": 0.006898265331983566, "reward_near_duplicate_penalty_mean": 0.9816901683807373, "reward_near_duplicate_penalty_std": 0.026689769700169563, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9895961284637451, "reward_distinct_2_std": 0.024498410522937775, "reward_judge_quality_mean": 0.11249999701976776, "reward_judge_quality_std": 0.1482035368680954, "reward_total_composite_mean": 0.08751553297042847, "reward_total_composite_std": 0.15225645899772644} {"timestamp_utc": "2026-04-12T20:02:27Z", "mode": "train", "global_step": 1065, "epoch": 0.05604968159570549, "loss": -0.1071, "grad_norm": 2.836012840270996, "learning_rate": 6.7757575757575765e-06, "num_tokens": 1898597.0, "completions/mean_length": 242.0, "completions/min_length": 68.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 80.0, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.7483861446380615, "rewards/meter/std": 0.3190765976905823, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.953125, "rewards/count_floor/std": 0.0388161838054657, "rewards/lexical_plausibility/mean": 0.873509407043457, "rewards/lexical_plausibility/std": 0.17771925032138824, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.4131460189819336, "rewards/repeat_penalty/std": 0.2663205862045288, "rewards/repeat_floor/mean": 0.9226658940315247, "rewards/repeat_floor/std": 0.04311244934797287, "rewards/near_duplicate_penalty/mean": 0.7836589813232422, "rewards/near_duplicate_penalty/std": 0.09089522063732147, "rewards/opening_diversity/mean": 0.7680398225784302, "rewards/opening_diversity/std": 0.18792153894901276, "rewards/distinct_2/mean": 0.6559408903121948, "rewards/distinct_2/std": 0.23752181231975555, "rewards/total_composite/mean": 0.1310032308101654, "rewards/total_composite/std": 0.1257311999797821, "reward": 0.1310032308101654, "reward_std": 0.1257311999797821, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1252867728471756, "sampling/sampling_logp_difference/max": 1.4811582565307617, "sampling/importance_sampling_ratio/min": 0.22737418115139008, "sampling/importance_sampling_ratio/mean": 1.019413948059082, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5311301052570343, "clip_ratio/low_mean": 0.028292838484048843, "clip_ratio/low_min": 0.028292838484048843, "clip_ratio/high_mean": 0.044053866527974606, "clip_ratio/high_max": 0.044053866527974606, "clip_ratio/region_mean": 0.07234670501202345, "reward_total_mean": 0.1310032308101654, "reward_meter_mean": 0.7483861446380615, "reward_meter_std": 0.3190765976905823, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.953125, "reward_count_floor_std": 0.0388161838054657, "reward_lexical_plausibility_mean": 0.873509407043457, "reward_lexical_plausibility_std": 0.17771925032138824, "reward_repeat_penalty_mean": 0.4131460189819336, "reward_repeat_penalty_std": 0.2663205862045288, "reward_repeat_floor_mean": 0.9226658940315247, "reward_repeat_floor_std": 0.04311244934797287, "reward_near_duplicate_penalty_mean": 0.7836589813232422, "reward_near_duplicate_penalty_std": 0.09089522063732147, "reward_opening_diversity_mean": 0.7680398225784302, "reward_opening_diversity_std": 0.18792153894901276, "reward_distinct_2_mean": 0.6559408903121948, "reward_distinct_2_std": 0.23752181231975555, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.1310032308101654, "reward_total_composite_std": 0.1257311999797821} {"timestamp_utc": "2026-04-12T20:02:42Z", "mode": "train", "global_step": 1066, "epoch": 0.05610231040471554, "loss": -0.0411, "grad_norm": 2.7471554279327393, "learning_rate": 6.772727272727273e-06, "num_tokens": 1899906.0, "completions/mean_length": 397.625, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 54.5, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.3778165578842163, "rewards/meter/std": 0.32139384746551514, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 0.7011655569076538, "rewards/lexical_plausibility/std": 0.19055898487567902, "rewards/judge_quality/mean": 0.10625000298023224, "rewards/judge_quality/std": 0.14500616490840912, "rewards/repeat_penalty/mean": 0.9135193824768066, "rewards/repeat_penalty/std": 0.1693478226661682, "rewards/repeat_floor/mean": 0.9898003339767456, "rewards/repeat_floor/std": 0.01800340972840786, "rewards/near_duplicate_penalty/mean": 0.9542979598045349, "rewards/near_duplicate_penalty/std": 0.062135085463523865, "rewards/opening_diversity/mean": 0.9553571343421936, "rewards/opening_diversity/std": 0.12626907229423523, "rewards/distinct_2/mean": 0.9926029443740845, "rewards/distinct_2/std": 0.014667045325040817, "rewards/total_composite/mean": 0.034173764288425446, "rewards/total_composite/std": 0.058432213962078094, "reward": 0.034173764288425446, "reward_std": 0.058432210236787796, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17999720573425293, "sampling/sampling_logp_difference/max": 0.9929285049438477, "sampling/importance_sampling_ratio/min": 0.37049010396003723, "sampling/importance_sampling_ratio/mean": 1.0718178749084473, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4738563895225525, "clip_ratio/low_mean": 0.013888888992369175, "clip_ratio/low_min": 0.013888888992369175, "clip_ratio/high_mean": 0.0234375, "clip_ratio/high_max": 0.0234375, "clip_ratio/region_mean": 0.037326388992369175, "reward_total_mean": 0.034173764288425446, "reward_meter_mean": 0.3778165578842163, "reward_meter_std": 0.32139384746551514, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 0.7011655569076538, "reward_lexical_plausibility_std": 0.19055898487567902, "reward_repeat_penalty_mean": 0.9135193824768066, "reward_repeat_penalty_std": 0.1693478226661682, "reward_repeat_floor_mean": 0.9898003339767456, "reward_repeat_floor_std": 0.01800340972840786, "reward_near_duplicate_penalty_mean": 0.9542979598045349, "reward_near_duplicate_penalty_std": 0.062135085463523865, "reward_opening_diversity_mean": 0.9553571343421936, "reward_opening_diversity_std": 0.12626907229423523, "reward_distinct_2_mean": 0.9926029443740845, "reward_distinct_2_std": 0.014667045325040817, "reward_judge_quality_mean": 0.10625000298023224, "reward_judge_quality_std": 0.14500616490840912, "reward_total_composite_mean": 0.034173764288425446, "reward_total_composite_std": 0.058432213962078094} {"timestamp_utc": "2026-04-12T20:02:58Z", "mode": "train", "global_step": 1067, "epoch": 0.056154939213725594, "loss": -0.0823, "grad_norm": 1.6724656820297241, "learning_rate": 6.76969696969697e-06, "num_tokens": 1901370.0, "completions/mean_length": 222.0, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 48.0, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.6790182590484619, "rewards/meter/std": 0.32086798548698425, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.1060660183429718, "rewards/lexical_plausibility/mean": 0.8339661359786987, "rewards/lexical_plausibility/std": 0.23012177646160126, "rewards/judge_quality/mean": 0.2562500238418579, "rewards/judge_quality/std": 0.1898072361946106, "rewards/repeat_penalty/mean": 0.9172540307044983, "rewards/repeat_penalty/std": 0.06828992068767548, "rewards/repeat_floor/mean": 0.9890499114990234, "rewards/repeat_floor/std": 0.008878531865775585, "rewards/near_duplicate_penalty/mean": 0.9455007314682007, "rewards/near_duplicate_penalty/std": 0.0421881340444088, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9691647291183472, "rewards/distinct_2/std": 0.03645267337560654, "rewards/total_composite/mean": 0.15745678544044495, "rewards/total_composite/std": 0.14194640517234802, "reward": 0.15745678544044495, "reward_std": 0.14194639027118683, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14348484575748444, "sampling/sampling_logp_difference/max": 1.2481822967529297, "sampling/importance_sampling_ratio/min": 0.2870260775089264, "sampling/importance_sampling_ratio/mean": 1.014376163482666, "sampling/importance_sampling_ratio/max": 1.798269271850586, "entropy": 0.680285319685936, "clip_ratio/low_mean": 0.02812499925494194, "clip_ratio/low_min": 0.02812499925494194, "clip_ratio/high_mean": 0.10010830871760845, "clip_ratio/high_max": 0.10010830871760845, "clip_ratio/region_mean": 0.1282333079725504, "reward_total_mean": 0.15745678544044495, "reward_meter_mean": 0.6790182590484619, "reward_meter_std": 0.32086798548698425, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.1060660183429718, "reward_lexical_plausibility_mean": 0.8339661359786987, "reward_lexical_plausibility_std": 0.23012177646160126, "reward_repeat_penalty_mean": 0.9172540307044983, "reward_repeat_penalty_std": 0.06828992068767548, "reward_repeat_floor_mean": 0.9890499114990234, "reward_repeat_floor_std": 0.008878531865775585, "reward_near_duplicate_penalty_mean": 0.9455007314682007, "reward_near_duplicate_penalty_std": 0.0421881340444088, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9691647291183472, "reward_distinct_2_std": 0.03645267337560654, "reward_judge_quality_mean": 0.2562500238418579, "reward_judge_quality_std": 0.1898072361946106, "reward_total_composite_mean": 0.15745678544044495, "reward_total_composite_std": 0.14194640517234802} {"timestamp_utc": "2026-04-12T20:03:07Z", "mode": "train", "global_step": 1068, "epoch": 0.056207568022735646, "loss": -0.0231, "grad_norm": 13.393712043762207, "learning_rate": 6.7666666666666665e-06, "num_tokens": 1902919.0, "completions/mean_length": 20.625, "completions/min_length": 16.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.625, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.9761309623718262, "rewards/meter/std": 0.036653872579336166, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6137499809265137, "rewards/judge_quality/std": 0.35419678688049316, "rewards/repeat_penalty/mean": 0.7455357313156128, "rewards/repeat_penalty/std": 0.012626901268959045, "rewards/repeat_floor/mean": 0.9841071367263794, "rewards/repeat_floor/std": 0.002525375923141837, "rewards/near_duplicate_penalty/mean": 0.9940476417541504, "rewards/near_duplicate_penalty/std": 0.016835875809192657, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5899828672409058, "rewards/total_composite/std": 0.3566151559352875, "reward": 0.5899828672409058, "reward_std": 0.3566151559352875, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1127404049038887, "sampling/sampling_logp_difference/max": 0.7840399742126465, "sampling/importance_sampling_ratio/min": 0.4565578103065491, "sampling/importance_sampling_ratio/mean": 1.0180014371871948, "sampling/importance_sampling_ratio/max": 1.9889965057373047, "entropy": 0.6647360324859619, "clip_ratio/low_mean": 0.0624323608353734, "clip_ratio/low_min": 0.0624323608353734, "clip_ratio/high_mean": 0.052759740967303514, "clip_ratio/high_max": 0.052759740967303514, "clip_ratio/region_mean": 0.11519210180267692, "reward_total_mean": 0.5899828672409058, "reward_meter_mean": 0.9761309623718262, "reward_meter_std": 0.036653872579336166, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7455357313156128, "reward_repeat_penalty_std": 0.012626901268959045, "reward_repeat_floor_mean": 0.9841071367263794, "reward_repeat_floor_std": 0.002525375923141837, "reward_near_duplicate_penalty_mean": 0.9940476417541504, "reward_near_duplicate_penalty_std": 0.016835875809192657, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6137499809265137, "reward_judge_quality_std": 0.35419678688049316, "reward_total_composite_mean": 0.5899828672409058, "reward_total_composite_std": 0.3566151559352875} {"timestamp_utc": "2026-04-12T20:03:23Z", "mode": "train", "global_step": 1069, "epoch": 0.0562601968317457, "loss": -0.123, "grad_norm": 1.8636703491210938, "learning_rate": 6.763636363636365e-06, "num_tokens": 1904484.0, "completions/mean_length": 100.625, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 41.85714340209961, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.8739906549453735, "rewards/meter/std": 0.30079954862594604, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9546717405319214, "rewards/lexical_plausibility/std": 0.12820763885974884, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.710982084274292, "rewards/repeat_penalty/std": 0.18087314069271088, "rewards/repeat_floor/mean": 0.9623284339904785, "rewards/repeat_floor/std": 0.022545693442225456, "rewards/near_duplicate_penalty/mean": 0.8514623641967773, "rewards/near_duplicate_penalty/std": 0.06669747829437256, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8498234748840332, "rewards/distinct_2/std": 0.12484649568796158, "rewards/total_composite/mean": 0.31140628457069397, "rewards/total_composite/std": 0.12951219081878662, "reward": 0.31140628457069397, "reward_std": 0.12951219081878662, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10668300092220306, "sampling/sampling_logp_difference/max": 1.5623292922973633, "sampling/importance_sampling_ratio/min": 0.20964716374874115, "sampling/importance_sampling_ratio/mean": 1.0178141593933105, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.48977963626384735, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.10859350766986609, "clip_ratio/high_max": 0.10859350766986609, "clip_ratio/region_mean": 0.10859350766986609, "reward_total_mean": 0.31140628457069397, "reward_meter_mean": 0.8739906549453735, "reward_meter_std": 0.30079954862594604, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9546717405319214, "reward_lexical_plausibility_std": 0.12820763885974884, "reward_repeat_penalty_mean": 0.710982084274292, "reward_repeat_penalty_std": 0.18087314069271088, "reward_repeat_floor_mean": 0.9623284339904785, "reward_repeat_floor_std": 0.022545693442225456, "reward_near_duplicate_penalty_mean": 0.8514623641967773, "reward_near_duplicate_penalty_std": 0.06669747829437256, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8498234748840332, "reward_distinct_2_std": 0.12484649568796158, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.31140628457069397, "reward_total_composite_std": 0.12951219081878662} {"timestamp_utc": "2026-04-12T20:03:42Z", "mode": "train", "global_step": 1070, "epoch": 0.05631282564075575, "loss": -0.0979, "grad_norm": 4.400808334350586, "learning_rate": 6.760606060606061e-06, "num_tokens": 1907799.0, "completions/mean_length": 263.375, "completions/min_length": 210.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 227.85714721679688, "completions/min_terminated_length": 210.0, "completions/max_terminated_length": 251.0, "rewards/meter/mean": 0.6059356927871704, "rewards/meter/std": 0.23981502652168274, "rewards/count_adherence/mean": 0.8229166269302368, "rewards/count_adherence/std": 0.13684004545211792, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9468749761581421, "rewards/count_floor/std": 0.04105200991034508, "rewards/lexical_plausibility/mean": 0.961497962474823, "rewards/lexical_plausibility/std": 0.10890025645494461, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.4514191150665283, "rewards/repeat_penalty/std": 0.23794931173324585, "rewards/repeat_floor/mean": 0.9416136741638184, "rewards/repeat_floor/std": 0.02634624019265175, "rewards/near_duplicate_penalty/mean": 0.9047547578811646, "rewards/near_duplicate_penalty/std": 0.03628513216972351, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.5100048184394836, "rewards/distinct_2/std": 0.2374163269996643, "rewards/total_composite/mean": 0.10428134351968765, "rewards/total_composite/std": 0.07745161652565002, "reward": 0.10428134351968765, "reward_std": 0.07745160907506943, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12649211287498474, "sampling/sampling_logp_difference/max": 1.844409465789795, "sampling/importance_sampling_ratio/min": 0.15811868011951447, "sampling/importance_sampling_ratio/mean": 0.9979678988456726, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6061956956982613, "clip_ratio/low_mean": 0.05695985537022352, "clip_ratio/low_min": 0.05695985537022352, "clip_ratio/high_mean": 0.05597740225493908, "clip_ratio/high_max": 0.05597740225493908, "clip_ratio/region_mean": 0.1129372576251626, "reward_total_mean": 0.10428134351968765, "reward_meter_mean": 0.6059356927871704, "reward_meter_std": 0.23981502652168274, "reward_count_adherence_mean": 0.8229166269302368, "reward_count_adherence_std": 0.13684004545211792, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9468749761581421, "reward_count_floor_std": 0.04105200991034508, "reward_lexical_plausibility_mean": 0.961497962474823, "reward_lexical_plausibility_std": 0.10890025645494461, "reward_repeat_penalty_mean": 0.4514191150665283, "reward_repeat_penalty_std": 0.23794931173324585, "reward_repeat_floor_mean": 0.9416136741638184, "reward_repeat_floor_std": 0.02634624019265175, "reward_near_duplicate_penalty_mean": 0.9047547578811646, "reward_near_duplicate_penalty_std": 0.03628513216972351, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.5100048184394836, "reward_distinct_2_std": 0.2374163269996643, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.10428134351968765, "reward_total_composite_std": 0.07745161652565002} {"timestamp_utc": "2026-04-12T20:03:52Z", "mode": "train", "global_step": 1071, "epoch": 0.0563654544497658, "loss": 0.0531, "grad_norm": 11.77622127532959, "learning_rate": 6.757575757575758e-06, "num_tokens": 1910020.0, "completions/mean_length": 99.625, "completions/min_length": 88.0, "completions/max_length": 109.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 99.625, "completions/min_terminated_length": 88.0, "completions/max_terminated_length": 109.0, "rewards/meter/mean": 0.567720890045166, "rewards/meter/std": 0.3172169625759125, "rewards/count_adherence/mean": 0.8571428656578064, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9571428298950195, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.16690458357334137, "rewards/repeat_penalty/mean": 0.9097242951393127, "rewards/repeat_penalty/std": 0.08820004761219025, "rewards/repeat_floor/mean": 0.9922217726707458, "rewards/repeat_floor/std": 0.006347257178276777, "rewards/near_duplicate_penalty/mean": 0.9796038269996643, "rewards/near_duplicate_penalty/std": 0.009924345649778843, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9475690126419067, "rewards/distinct_2/std": 0.05622003972530365, "rewards/total_composite/mean": 0.2502760589122772, "rewards/total_composite/std": 0.2120453417301178, "reward": 0.2502760589122772, "reward_std": 0.2120453417301178, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1844819337129593, "sampling/sampling_logp_difference/max": 3.5286781787872314, "sampling/importance_sampling_ratio/min": 0.029343679547309875, "sampling/importance_sampling_ratio/mean": 0.9935512542724609, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7695295810699463, "clip_ratio/low_mean": 0.09332773555070162, "clip_ratio/low_min": 0.09332773555070162, "clip_ratio/high_mean": 0.06373801082372665, "clip_ratio/high_max": 0.06373801082372665, "clip_ratio/region_mean": 0.15706574637442827, "reward_total_mean": 0.2502760589122772, "reward_meter_mean": 0.567720890045166, "reward_meter_std": 0.3172169625759125, "reward_count_adherence_mean": 0.8571428656578064, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9571428298950195, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9097242951393127, "reward_repeat_penalty_std": 0.08820004761219025, "reward_repeat_floor_mean": 0.9922217726707458, "reward_repeat_floor_std": 0.006347257178276777, "reward_near_duplicate_penalty_mean": 0.9796038269996643, "reward_near_duplicate_penalty_std": 0.009924345649778843, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9475690126419067, "reward_distinct_2_std": 0.05622003972530365, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.16690458357334137, "reward_total_composite_mean": 0.2502760589122772, "reward_total_composite_std": 0.2120453417301178} {"timestamp_utc": "2026-04-12T20:04:01Z", "mode": "train", "global_step": 1072, "epoch": 0.056418083258775856, "loss": 0.0181, "grad_norm": 20.931276321411133, "learning_rate": 6.754545454545455e-06, "num_tokens": 1911435.0, "completions/mean_length": 29.875, "completions/min_length": 25.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.875, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.5035991072654724, "rewards/meter/std": 0.4299202561378479, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7437499761581421, "rewards/judge_quality/std": 0.2432481348514557, "rewards/repeat_penalty/mean": 0.9292556047439575, "rewards/repeat_penalty/std": 0.16393889486789703, "rewards/repeat_floor/mean": 0.9918794631958008, "rewards/repeat_floor/std": 0.01759110577404499, "rewards/near_duplicate_penalty/mean": 0.9737478494644165, "rewards/near_duplicate_penalty/std": 0.04055837541818619, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9743589758872986, "rewards/distinct_2/std": 0.07252377271652222, "rewards/total_composite/mean": 0.34068629145622253, "rewards/total_composite/std": 0.3119940161705017, "reward": 0.34068629145622253, "reward_std": 0.3119940161705017, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15305404365062714, "sampling/sampling_logp_difference/max": 1.2168183326721191, "sampling/importance_sampling_ratio/min": 0.2961709797382355, "sampling/importance_sampling_ratio/mean": 1.0122547149658203, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.810894064605236, "clip_ratio/low_mean": 0.05046419193968177, "clip_ratio/low_min": 0.05046419193968177, "clip_ratio/high_mean": 0.06753788003697991, "clip_ratio/high_max": 0.06753788003697991, "clip_ratio/region_mean": 0.11800207197666168, "reward_total_mean": 0.34068629145622253, "reward_meter_mean": 0.5035991072654724, "reward_meter_std": 0.4299202561378479, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9292556047439575, "reward_repeat_penalty_std": 0.16393889486789703, "reward_repeat_floor_mean": 0.9918794631958008, "reward_repeat_floor_std": 0.01759110577404499, "reward_near_duplicate_penalty_mean": 0.9737478494644165, "reward_near_duplicate_penalty_std": 0.04055837541818619, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9743589758872986, "reward_distinct_2_std": 0.07252377271652222, "reward_judge_quality_mean": 0.7437499761581421, "reward_judge_quality_std": 0.2432481348514557, "reward_total_composite_mean": 0.34068629145622253, "reward_total_composite_std": 0.3119940161705017} {"timestamp_utc": "2026-04-12T20:04:18Z", "mode": "train", "global_step": 1073, "epoch": 0.05647071206778591, "loss": -0.0983, "grad_norm": 4.400396823883057, "learning_rate": 6.751515151515152e-06, "num_tokens": 1914004.0, "completions/mean_length": 182.125, "completions/min_length": 115.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 135.0, "completions/min_terminated_length": 115.0, "completions/max_terminated_length": 166.0, "rewards/meter/mean": 0.9867106676101685, "rewards/meter/std": 0.013244129717350006, "rewards/count_adherence/mean": 0.6428571343421936, "rewards/count_adherence/std": 0.2159797102212906, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8928571343421936, "rewards/count_floor/std": 0.0647939071059227, "rewards/lexical_plausibility/mean": 0.947879433631897, "rewards/lexical_plausibility/std": 0.14741921424865723, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.6394490599632263, "rewards/repeat_penalty/std": 0.16927896440029144, "rewards/repeat_floor/mean": 0.9610540270805359, "rewards/repeat_floor/std": 0.017209012061357498, "rewards/near_duplicate_penalty/mean": 0.9004266262054443, "rewards/near_duplicate_penalty/std": 0.036961011588573456, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.7415555715560913, "rewards/distinct_2/std": 0.13002930581569672, "rewards/total_composite/mean": 0.18242649734020233, "rewards/total_composite/std": 0.10402916371822357, "reward": 0.18242649734020233, "reward_std": 0.10402915626764297, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13504239916801453, "sampling/sampling_logp_difference/max": 2.2505435943603516, "sampling/importance_sampling_ratio/min": 0.10534194856882095, "sampling/importance_sampling_ratio/mean": 1.0122077465057373, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7037039622664452, "clip_ratio/low_mean": 0.07036673557013273, "clip_ratio/low_min": 0.07036673557013273, "clip_ratio/high_mean": 0.051998681388795376, "clip_ratio/high_max": 0.051998681388795376, "clip_ratio/region_mean": 0.12236541695892811, "reward_total_mean": 0.18242649734020233, "reward_meter_mean": 0.9867106676101685, "reward_meter_std": 0.013244129717350006, "reward_count_adherence_mean": 0.6428571343421936, "reward_count_adherence_std": 0.2159797102212906, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8928571343421936, "reward_count_floor_std": 0.0647939071059227, "reward_lexical_plausibility_mean": 0.947879433631897, "reward_lexical_plausibility_std": 0.14741921424865723, "reward_repeat_penalty_mean": 0.6394490599632263, "reward_repeat_penalty_std": 0.16927896440029144, "reward_repeat_floor_mean": 0.9610540270805359, "reward_repeat_floor_std": 0.017209012061357498, "reward_near_duplicate_penalty_mean": 0.9004266262054443, "reward_near_duplicate_penalty_std": 0.036961011588573456, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.7415555715560913, "reward_distinct_2_std": 0.13002930581569672, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.18242649734020233, "reward_total_composite_std": 0.10402916371822357} {"timestamp_utc": "2026-04-12T20:04:25Z", "mode": "train", "global_step": 1074, "epoch": 0.05652334087679596, "loss": 0.0822, "grad_norm": 19.359661102294922, "learning_rate": 6.748484848484848e-06, "num_tokens": 1915340.0, "completions/mean_length": 18.0, "completions/min_length": 16.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.0, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.7420926094055176, "rewards/meter/std": 0.4073685109615326, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6887499690055847, "rewards/judge_quality/std": 0.34156936407089233, "rewards/repeat_penalty/mean": 0.5175803899765015, "rewards/repeat_penalty/std": 0.18043386936187744, "rewards/repeat_floor/mean": 0.9380412697792053, "rewards/repeat_floor/std": 0.03679239749908447, "rewards/near_duplicate_penalty/mean": 0.7305313348770142, "rewards/near_duplicate_penalty/std": 0.19719846546649933, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9273504018783569, "rewards/distinct_2/std": 0.10447946935892105, "rewards/total_composite/mean": 0.4954415261745453, "rewards/total_composite/std": 0.3863968551158905, "reward": 0.4954415261745453, "reward_std": 0.3863968253135681, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.119955874979496, "sampling/sampling_logp_difference/max": 1.0646991729736328, "sampling/importance_sampling_ratio/min": 0.34483158588409424, "sampling/importance_sampling_ratio/mean": 0.9877858757972717, "sampling/importance_sampling_ratio/max": 1.8000118732452393, "entropy": 0.8861508518457413, "clip_ratio/low_mean": 0.012531328480690718, "clip_ratio/low_min": 0.012531328480690718, "clip_ratio/high_mean": 0.0705785620957613, "clip_ratio/high_max": 0.0705785620957613, "clip_ratio/region_mean": 0.08310989057645202, "reward_total_mean": 0.4954415261745453, "reward_meter_mean": 0.7420926094055176, "reward_meter_std": 0.4073685109615326, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5175803899765015, "reward_repeat_penalty_std": 0.18043386936187744, "reward_repeat_floor_mean": 0.9380412697792053, "reward_repeat_floor_std": 0.03679239749908447, "reward_near_duplicate_penalty_mean": 0.7305313348770142, "reward_near_duplicate_penalty_std": 0.19719846546649933, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9273504018783569, "reward_distinct_2_std": 0.10447946935892105, "reward_judge_quality_mean": 0.6887499690055847, "reward_judge_quality_std": 0.34156936407089233, "reward_total_composite_mean": 0.4954415261745453, "reward_total_composite_std": 0.3863968551158905} {"timestamp_utc": "2026-04-12T20:04:38Z", "mode": "train", "global_step": 1075, "epoch": 0.05657596968580601, "loss": -0.0389, "grad_norm": 4.987910747528076, "learning_rate": 6.7454545454545465e-06, "num_tokens": 1916754.0, "completions/mean_length": 87.75, "completions/min_length": 24.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 27.142858505249023, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.6227566003799438, "rewards/meter/std": 0.4933727979660034, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.933384120464325, "rewards/lexical_plausibility/std": 0.1884182095527649, "rewards/judge_quality/mean": 0.71875, "rewards/judge_quality/std": 0.3829747438430786, "rewards/repeat_penalty/mean": 0.742737889289856, "rewards/repeat_penalty/std": 0.12986721098423004, "rewards/repeat_floor/mean": 0.9807339906692505, "rewards/repeat_floor/std": 0.014583591371774673, "rewards/near_duplicate_penalty/mean": 0.9782905578613281, "rewards/near_duplicate_penalty/std": 0.037107914686203, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9679487347602844, "rewards/distinct_2/std": 0.09065470844507217, "rewards/total_composite/mean": 0.5589503049850464, "rewards/total_composite/std": 0.45456141233444214, "reward": 0.5589503049850464, "reward_std": 0.45456141233444214, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1434827744960785, "sampling/sampling_logp_difference/max": 1.3663749694824219, "sampling/importance_sampling_ratio/min": 0.2550297677516937, "sampling/importance_sampling_ratio/mean": 1.0104016065597534, "sampling/importance_sampling_ratio/max": 1.837349534034729, "entropy": 0.8188060000538826, "clip_ratio/low_mean": 0.0528273805975914, "clip_ratio/low_min": 0.0528273805975914, "clip_ratio/high_mean": 0.1226099543273449, "clip_ratio/high_max": 0.1226099543273449, "clip_ratio/region_mean": 0.1754373349249363, "reward_total_mean": 0.5589503049850464, "reward_meter_mean": 0.6227566003799438, "reward_meter_std": 0.4933727979660034, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.933384120464325, "reward_lexical_plausibility_std": 0.1884182095527649, "reward_repeat_penalty_mean": 0.742737889289856, "reward_repeat_penalty_std": 0.12986721098423004, "reward_repeat_floor_mean": 0.9807339906692505, "reward_repeat_floor_std": 0.014583591371774673, "reward_near_duplicate_penalty_mean": 0.9782905578613281, "reward_near_duplicate_penalty_std": 0.037107914686203, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9679487347602844, "reward_distinct_2_std": 0.09065470844507217, "reward_judge_quality_mean": 0.71875, "reward_judge_quality_std": 0.3829747438430786, "reward_total_composite_mean": 0.5589503049850464, "reward_total_composite_std": 0.45456141233444214} {"timestamp_utc": "2026-04-12T20:04:52Z", "mode": "train", "global_step": 1076, "epoch": 0.056628598494816065, "loss": -0.1246, "grad_norm": 4.763963222503662, "learning_rate": 6.742424242424243e-06, "num_tokens": 1918812.0, "completions/mean_length": 135.25, "completions/min_length": 68.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 81.42857360839844, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 103.0, "rewards/meter/mean": 0.970775842666626, "rewards/meter/std": 0.04196593537926674, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9694584608078003, "rewards/lexical_plausibility/std": 0.08638457953929901, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.8369671106338501, "rewards/repeat_penalty/std": 0.12449848651885986, "rewards/repeat_floor/mean": 0.9803304076194763, "rewards/repeat_floor/std": 0.01572480984032154, "rewards/near_duplicate_penalty/mean": 0.9328269958496094, "rewards/near_duplicate_penalty/std": 0.05469420179724693, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8934038877487183, "rewards/distinct_2/std": 0.09271004050970078, "rewards/total_composite/mean": 0.29090413451194763, "rewards/total_composite/std": 0.09215669333934784, "reward": 0.29090413451194763, "reward_std": 0.09215668588876724, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14479467272758484, "sampling/sampling_logp_difference/max": 1.4905118942260742, "sampling/importance_sampling_ratio/min": 0.22525732219219208, "sampling/importance_sampling_ratio/mean": 1.0108000040054321, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8082137405872345, "clip_ratio/low_mean": 0.020220588892698288, "clip_ratio/low_min": 0.020220588892698288, "clip_ratio/high_mean": 0.12136476766318083, "clip_ratio/high_max": 0.12136476766318083, "clip_ratio/region_mean": 0.14158535655587912, "reward_total_mean": 0.29090413451194763, "reward_meter_mean": 0.970775842666626, "reward_meter_std": 0.04196593537926674, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9694584608078003, "reward_lexical_plausibility_std": 0.08638457953929901, "reward_repeat_penalty_mean": 0.8369671106338501, "reward_repeat_penalty_std": 0.12449848651885986, "reward_repeat_floor_mean": 0.9803304076194763, "reward_repeat_floor_std": 0.01572480984032154, "reward_near_duplicate_penalty_mean": 0.9328269958496094, "reward_near_duplicate_penalty_std": 0.05469420179724693, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8934038877487183, "reward_distinct_2_std": 0.09271004050970078, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.29090413451194763, "reward_total_composite_std": 0.09215669333934784} {"timestamp_utc": "2026-04-12T20:05:03Z", "mode": "train", "global_step": 1077, "epoch": 0.05668122730382612, "loss": 0.0823, "grad_norm": 7.245699405670166, "learning_rate": 6.73939393939394e-06, "num_tokens": 1921592.0, "completions/mean_length": 146.5, "completions/min_length": 119.0, "completions/max_length": 181.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 146.5, "completions/min_terminated_length": 119.0, "completions/max_terminated_length": 181.0, "rewards/meter/mean": 0.6044440269470215, "rewards/meter/std": 0.23835039138793945, "rewards/count_adherence/mean": 0.7777777910232544, "rewards/count_adherence/std": 0.059391383081674576, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9333332777023315, "rewards/count_floor/std": 0.017817415297031403, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.3985518515110016, "rewards/repeat_penalty/std": 0.234026700258255, "rewards/repeat_floor/mean": 0.9324367046356201, "rewards/repeat_floor/std": 0.029193731024861336, "rewards/near_duplicate_penalty/mean": 0.8773298263549805, "rewards/near_duplicate_penalty/std": 0.057365674525499344, "rewards/opening_diversity/mean": 0.87109375, "rewards/opening_diversity/std": 0.2299424558877945, "rewards/distinct_2/mean": 0.5396846532821655, "rewards/distinct_2/std": 0.19586032629013062, "rewards/total_composite/mean": 0.17250597476959229, "rewards/total_composite/std": 0.08049008250236511, "reward": 0.17250597476959229, "reward_std": 0.08049008250236511, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11890258640050888, "sampling/sampling_logp_difference/max": 3.552889823913574, "sampling/importance_sampling_ratio/min": 0.028641749173402786, "sampling/importance_sampling_ratio/mean": 1.021666407585144, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6128877066075802, "clip_ratio/low_mean": 0.06310850847512484, "clip_ratio/low_min": 0.06310850847512484, "clip_ratio/high_mean": 0.05600618664175272, "clip_ratio/high_max": 0.05600618664175272, "clip_ratio/region_mean": 0.11911469511687756, "reward_total_mean": 0.17250597476959229, "reward_meter_mean": 0.6044440269470215, "reward_meter_std": 0.23835039138793945, "reward_count_adherence_mean": 0.7777777910232544, "reward_count_adherence_std": 0.059391383081674576, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9333332777023315, "reward_count_floor_std": 0.017817415297031403, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.3985518515110016, "reward_repeat_penalty_std": 0.234026700258255, "reward_repeat_floor_mean": 0.9324367046356201, "reward_repeat_floor_std": 0.029193731024861336, "reward_near_duplicate_penalty_mean": 0.8773298263549805, "reward_near_duplicate_penalty_std": 0.057365674525499344, "reward_opening_diversity_mean": 0.87109375, "reward_opening_diversity_std": 0.2299424558877945, "reward_distinct_2_mean": 0.5396846532821655, "reward_distinct_2_std": 0.19586032629013062, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.17250597476959229, "reward_total_composite_std": 0.08049008250236511} {"timestamp_utc": "2026-04-12T20:05:16Z", "mode": "train", "global_step": 1078, "epoch": 0.05673385611283616, "loss": -0.0222, "grad_norm": 3.444074869155884, "learning_rate": 6.7363636363636365e-06, "num_tokens": 1923161.0, "completions/mean_length": 173.125, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 60.16666793823242, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 120.0, "rewards/meter/mean": 0.5488107800483704, "rewards/meter/std": 0.3649800419807434, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.11160357296466827, "rewards/lexical_plausibility/mean": 0.9025658965110779, "rewards/lexical_plausibility/std": 0.18058884143829346, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.3561275005340576, "rewards/repeat_penalty/mean": 0.8407871723175049, "rewards/repeat_penalty/std": 0.27340683341026306, "rewards/repeat_floor/mean": 0.9819720387458801, "rewards/repeat_floor/std": 0.0298537015914917, "rewards/near_duplicate_penalty/mean": 0.9548909664154053, "rewards/near_duplicate_penalty/std": 0.05168209224939346, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.874870777130127, "rewards/distinct_2/std": 0.25533223152160645, "rewards/total_composite/mean": 0.2264440655708313, "rewards/total_composite/std": 0.29111823439598083, "reward": 0.2264440655708313, "reward_std": 0.29111823439598083, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15008863806724548, "sampling/sampling_logp_difference/max": 1.7263131141662598, "sampling/importance_sampling_ratio/min": 0.1779392510652542, "sampling/importance_sampling_ratio/mean": 1.0275452136993408, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7353262901306152, "clip_ratio/low_mean": 0.07197060901671648, "clip_ratio/low_min": 0.07197060901671648, "clip_ratio/high_mean": 0.029941861517727375, "clip_ratio/high_max": 0.029941861517727375, "clip_ratio/region_mean": 0.10191247053444386, "reward_total_mean": 0.2264440655708313, "reward_meter_mean": 0.5488107800483704, "reward_meter_std": 0.3649800419807434, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.11160357296466827, "reward_lexical_plausibility_mean": 0.9025658965110779, "reward_lexical_plausibility_std": 0.18058884143829346, "reward_repeat_penalty_mean": 0.8407871723175049, "reward_repeat_penalty_std": 0.27340683341026306, "reward_repeat_floor_mean": 0.9819720387458801, "reward_repeat_floor_std": 0.0298537015914917, "reward_near_duplicate_penalty_mean": 0.9548909664154053, "reward_near_duplicate_penalty_std": 0.05168209224939346, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.874870777130127, "reward_distinct_2_std": 0.25533223152160645, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.3561275005340576, "reward_total_composite_mean": 0.2264440655708313, "reward_total_composite_std": 0.29111823439598083} {"timestamp_utc": "2026-04-12T20:05:32Z", "mode": "train", "global_step": 1079, "epoch": 0.056786484921846216, "loss": -0.1521, "grad_norm": 2.4961585998535156, "learning_rate": 6.733333333333334e-06, "num_tokens": 1925263.0, "completions/mean_length": 259.75, "completions/min_length": 104.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 108.4000015258789, "completions/min_terminated_length": 104.0, "completions/max_terminated_length": 115.0, "rewards/meter/mean": 0.9006693363189697, "rewards/meter/std": 0.09917160868644714, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.08017838001251221, "rewards/lexical_plausibility/mean": 0.8560393452644348, "rewards/lexical_plausibility/std": 0.2027360051870346, "rewards/judge_quality/mean": 0.3212500214576721, "rewards/judge_quality/std": 0.2773052752017975, "rewards/repeat_penalty/mean": 0.9579098224639893, "rewards/repeat_penalty/std": 0.0416024886071682, "rewards/repeat_floor/mean": 0.9952350854873657, "rewards/repeat_floor/std": 0.003988961223512888, "rewards/near_duplicate_penalty/mean": 0.9844063520431519, "rewards/near_duplicate_penalty/std": 0.008151083253324032, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.973046600818634, "rewards/distinct_2/std": 0.04050234705209732, "rewards/total_composite/mean": 0.27432894706726074, "rewards/total_composite/std": 0.20733150839805603, "reward": 0.27432894706726074, "reward_std": 0.20733147859573364, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12474246323108673, "sampling/sampling_logp_difference/max": 1.5720982551574707, "sampling/importance_sampling_ratio/min": 0.20760910212993622, "sampling/importance_sampling_ratio/mean": 1.0134941339492798, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.44906847178936005, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.08068029396235943, "clip_ratio/high_max": 0.08068029396235943, "clip_ratio/region_mean": 0.08068029396235943, "reward_total_mean": 0.27432894706726074, "reward_meter_mean": 0.9006693363189697, "reward_meter_std": 0.09917160868644714, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.08017838001251221, "reward_lexical_plausibility_mean": 0.8560393452644348, "reward_lexical_plausibility_std": 0.2027360051870346, "reward_repeat_penalty_mean": 0.9579098224639893, "reward_repeat_penalty_std": 0.0416024886071682, "reward_repeat_floor_mean": 0.9952350854873657, "reward_repeat_floor_std": 0.003988961223512888, "reward_near_duplicate_penalty_mean": 0.9844063520431519, "reward_near_duplicate_penalty_std": 0.008151083253324032, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.973046600818634, "reward_distinct_2_std": 0.04050234705209732, "reward_judge_quality_mean": 0.3212500214576721, "reward_judge_quality_std": 0.2773052752017975, "reward_total_composite_mean": 0.27432894706726074, "reward_total_composite_std": 0.20733150839805603} {"timestamp_utc": "2026-04-12T20:05:40Z", "mode": "train", "global_step": 1080, "epoch": 0.05683911373085627, "loss": 0.0497, "grad_norm": 16.204898834228516, "learning_rate": 6.73030303030303e-06, "num_tokens": 1926756.0, "completions/mean_length": 27.625, "completions/min_length": 20.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.625, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.9221764206886292, "rewards/meter/std": 0.19007368385791779, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8350000381469727, "rewards/judge_quality/std": 0.27717968821525574, "rewards/repeat_penalty/mean": 0.6980905532836914, "rewards/repeat_penalty/std": 0.10256372392177582, "rewards/repeat_floor/mean": 0.9735473394393921, "rewards/repeat_floor/std": 0.019675888121128082, "rewards/near_duplicate_penalty/mean": 0.9372479319572449, "rewards/near_duplicate_penalty/std": 0.10603788495063782, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.956501841545105, "rewards/distinct_2/std": 0.08417937159538269, "rewards/total_composite/mean": 0.7104453444480896, "rewards/total_composite/std": 0.2962467670440674, "reward": 0.7104453444480896, "reward_std": 0.2962467670440674, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10239305347204208, "sampling/sampling_logp_difference/max": 1.2080011367797852, "sampling/importance_sampling_ratio/min": 0.2987939119338989, "sampling/importance_sampling_ratio/mean": 1.0033000707626343, "sampling/importance_sampling_ratio/max": 1.7388825416564941, "entropy": 0.8475519418716431, "clip_ratio/low_mean": 0.046653298661112785, "clip_ratio/low_min": 0.046653298661112785, "clip_ratio/high_mean": 0.08468259172514081, "clip_ratio/high_max": 0.08468259172514081, "clip_ratio/region_mean": 0.1313358903862536, "reward_total_mean": 0.7104453444480896, "reward_meter_mean": 0.9221764206886292, "reward_meter_std": 0.19007368385791779, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6980905532836914, "reward_repeat_penalty_std": 0.10256372392177582, "reward_repeat_floor_mean": 0.9735473394393921, "reward_repeat_floor_std": 0.019675888121128082, "reward_near_duplicate_penalty_mean": 0.9372479319572449, "reward_near_duplicate_penalty_std": 0.10603788495063782, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.956501841545105, "reward_distinct_2_std": 0.08417937159538269, "reward_judge_quality_mean": 0.8350000381469727, "reward_judge_quality_std": 0.27717968821525574, "reward_total_composite_mean": 0.7104453444480896, "reward_total_composite_std": 0.2962467670440674} {"timestamp_utc": "2026-04-12T20:05:54Z", "mode": "train", "global_step": 1081, "epoch": 0.05689174253986632, "loss": -0.0051, "grad_norm": 5.6562700271606445, "learning_rate": 6.7272727272727275e-06, "num_tokens": 1928367.0, "completions/mean_length": 100.375, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 41.57143020629883, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.41312259435653687, "rewards/meter/std": 0.42788901925086975, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9441838264465332, "rewards/lexical_plausibility/std": 0.15787187218666077, "rewards/judge_quality/mean": 0.4424999952316284, "rewards/judge_quality/std": 0.32101401686668396, "rewards/repeat_penalty/mean": 0.5048427581787109, "rewards/repeat_penalty/std": 0.20335707068443298, "rewards/repeat_floor/mean": 0.942783772945404, "rewards/repeat_floor/std": 0.02365000732243061, "rewards/near_duplicate_penalty/mean": 0.8348733186721802, "rewards/near_duplicate_penalty/std": 0.06673448532819748, "rewards/opening_diversity/mean": 0.737500011920929, "rewards/opening_diversity/std": 0.24712635576725006, "rewards/distinct_2/mean": 0.8144752979278564, "rewards/distinct_2/std": 0.09979349374771118, "rewards/total_composite/mean": 0.16769617795944214, "rewards/total_composite/std": 0.25463947653770447, "reward": 0.16769617795944214, "reward_std": 0.25463947653770447, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15469835698604584, "sampling/sampling_logp_difference/max": 1.55474853515625, "sampling/importance_sampling_ratio/min": 0.21124249696731567, "sampling/importance_sampling_ratio/mean": 1.0261539220809937, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6518596932291985, "clip_ratio/low_mean": 0.08085842244327068, "clip_ratio/low_min": 0.08085842244327068, "clip_ratio/high_mean": 0.033882785588502884, "clip_ratio/high_max": 0.033882785588502884, "clip_ratio/region_mean": 0.11474120803177357, "reward_total_mean": 0.16769617795944214, "reward_meter_mean": 0.41312259435653687, "reward_meter_std": 0.42788901925086975, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9441838264465332, "reward_lexical_plausibility_std": 0.15787187218666077, "reward_repeat_penalty_mean": 0.5048427581787109, "reward_repeat_penalty_std": 0.20335707068443298, "reward_repeat_floor_mean": 0.942783772945404, "reward_repeat_floor_std": 0.02365000732243061, "reward_near_duplicate_penalty_mean": 0.8348733186721802, "reward_near_duplicate_penalty_std": 0.06673448532819748, "reward_opening_diversity_mean": 0.737500011920929, "reward_opening_diversity_std": 0.24712635576725006, "reward_distinct_2_mean": 0.8144752979278564, "reward_distinct_2_std": 0.09979349374771118, "reward_judge_quality_mean": 0.4424999952316284, "reward_judge_quality_std": 0.32101401686668396, "reward_total_composite_mean": 0.16769617795944214, "reward_total_composite_std": 0.25463947653770447} {"timestamp_utc": "2026-04-12T20:06:06Z", "mode": "train", "global_step": 1082, "epoch": 0.05694437134887637, "loss": 0.232, "grad_norm": 16.52114486694336, "learning_rate": 6.724242424242424e-06, "num_tokens": 1929907.0, "completions/mean_length": 29.5, "completions/min_length": 17.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.5, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.6338993310928345, "rewards/meter/std": 0.26156964898109436, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.5345224738121033, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.16035674512386322, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.14880475401878357, "rewards/repeat_penalty/mean": 0.8179764747619629, "rewards/repeat_penalty/std": 0.09199567139148712, "rewards/repeat_floor/mean": 0.9851780533790588, "rewards/repeat_floor/std": 0.006651438307017088, "rewards/near_duplicate_penalty/mean": 0.966921329498291, "rewards/near_duplicate_penalty/std": 0.04215977340936661, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9737762212753296, "rewards/distinct_2/std": 0.05202964320778847, "rewards/total_composite/mean": 0.17168530821800232, "rewards/total_composite/std": 0.11954525113105774, "reward": 0.17168530821800232, "reward_std": 0.11954524368047714, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17270267009735107, "sampling/sampling_logp_difference/max": 1.880910873413086, "sampling/importance_sampling_ratio/min": 0.15245117247104645, "sampling/importance_sampling_ratio/mean": 0.9874579310417175, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8343949541449547, "clip_ratio/low_mean": 0.09078109497204423, "clip_ratio/low_min": 0.09078109497204423, "clip_ratio/high_mean": 0.06691176537424326, "clip_ratio/high_max": 0.06691176537424326, "clip_ratio/region_mean": 0.1576928603462875, "reward_total_mean": 0.17168530821800232, "reward_meter_mean": 0.6338993310928345, "reward_meter_std": 0.26156964898109436, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.5345224738121033, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.16035674512386322, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8179764747619629, "reward_repeat_penalty_std": 0.09199567139148712, "reward_repeat_floor_mean": 0.9851780533790588, "reward_repeat_floor_std": 0.006651438307017088, "reward_near_duplicate_penalty_mean": 0.966921329498291, "reward_near_duplicate_penalty_std": 0.04215977340936661, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9737762212753296, "reward_distinct_2_std": 0.05202964320778847, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.14880475401878357, "reward_total_composite_mean": 0.17168530821800232, "reward_total_composite_std": 0.11954525113105774} {"timestamp_utc": "2026-04-12T20:06:20Z", "mode": "train", "global_step": 1083, "epoch": 0.056997000157886425, "loss": -0.0892, "grad_norm": 3.384092092514038, "learning_rate": 6.721212121212122e-06, "num_tokens": 1931867.0, "completions/mean_length": 193.0, "completions/min_length": 71.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 86.66667175292969, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 97.0, "rewards/meter/mean": 0.6980332136154175, "rewards/meter/std": 0.3264663815498352, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.2651650309562683, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.953125, "rewards/count_floor/std": 0.07954952120780945, "rewards/lexical_plausibility/mean": 0.9041027426719666, "rewards/lexical_plausibility/std": 0.1783706098794937, "rewards/judge_quality/mean": 0.14375001192092896, "rewards/judge_quality/std": 0.10155048221349716, "rewards/repeat_penalty/mean": 0.6313503980636597, "rewards/repeat_penalty/std": 0.2825292646884918, "rewards/repeat_floor/mean": 0.9609284400939941, "rewards/repeat_floor/std": 0.0327136367559433, "rewards/near_duplicate_penalty/mean": 0.9083307385444641, "rewards/near_duplicate_penalty/std": 0.07224540412425995, "rewards/opening_diversity/mean": 0.8671875, "rewards/opening_diversity/std": 0.16173411905765533, "rewards/distinct_2/mean": 0.8071950078010559, "rewards/distinct_2/std": 0.215913325548172, "rewards/total_composite/mean": 0.11442960798740387, "rewards/total_composite/std": 0.09526680409908295, "reward": 0.11442960798740387, "reward_std": 0.09526679664850235, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13939079642295837, "sampling/sampling_logp_difference/max": 2.5638062953948975, "sampling/importance_sampling_ratio/min": 0.07701105624437332, "sampling/importance_sampling_ratio/mean": 1.029281497001648, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7014232128858566, "clip_ratio/low_mean": 0.034225694835186005, "clip_ratio/low_min": 0.034225694835186005, "clip_ratio/high_mean": 0.05332733877003193, "clip_ratio/high_max": 0.05332733877003193, "clip_ratio/region_mean": 0.08755303360521793, "reward_total_mean": 0.11442960798740387, "reward_meter_mean": 0.6980332136154175, "reward_meter_std": 0.3264663815498352, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.2651650309562683, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.953125, "reward_count_floor_std": 0.07954952120780945, "reward_lexical_plausibility_mean": 0.9041027426719666, "reward_lexical_plausibility_std": 0.1783706098794937, "reward_repeat_penalty_mean": 0.6313503980636597, "reward_repeat_penalty_std": 0.2825292646884918, "reward_repeat_floor_mean": 0.9609284400939941, "reward_repeat_floor_std": 0.0327136367559433, "reward_near_duplicate_penalty_mean": 0.9083307385444641, "reward_near_duplicate_penalty_std": 0.07224540412425995, "reward_opening_diversity_mean": 0.8671875, "reward_opening_diversity_std": 0.16173411905765533, "reward_distinct_2_mean": 0.8071950078010559, "reward_distinct_2_std": 0.215913325548172, "reward_judge_quality_mean": 0.14375001192092896, "reward_judge_quality_std": 0.10155048221349716, "reward_total_composite_mean": 0.11442960798740387, "reward_total_composite_std": 0.09526680409908295} {"timestamp_utc": "2026-04-12T20:06:36Z", "mode": "train", "global_step": 1084, "epoch": 0.05704962896689648, "loss": -0.0553, "grad_norm": 1.7104077339172363, "learning_rate": 6.718181818181819e-06, "num_tokens": 1933649.0, "completions/mean_length": 166.75, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 51.66666793823242, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 126.0, "rewards/meter/mean": 0.8004549145698547, "rewards/meter/std": 0.2955181896686554, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9153865575790405, "rewards/lexical_plausibility/std": 0.1567201316356659, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.18077214062213898, "rewards/repeat_penalty/mean": 0.444543719291687, "rewards/repeat_penalty/std": 0.3224257826805115, "rewards/repeat_floor/mean": 0.9293628334999084, "rewards/repeat_floor/std": 0.046146344393491745, "rewards/near_duplicate_penalty/mean": 0.8347088098526001, "rewards/near_duplicate_penalty/std": 0.10775653272867203, "rewards/opening_diversity/mean": 0.6526786088943481, "rewards/opening_diversity/std": 0.2602613568305969, "rewards/distinct_2/mean": 0.7221752405166626, "rewards/distinct_2/std": 0.2029658555984497, "rewards/total_composite/mean": 0.26727473735809326, "rewards/total_composite/std": 0.16430865228176117, "reward": 0.26727473735809326, "reward_std": 0.16430865228176117, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10477927327156067, "sampling/sampling_logp_difference/max": 1.3335072994232178, "sampling/importance_sampling_ratio/min": 0.2635512948036194, "sampling/importance_sampling_ratio/mean": 1.0224661827087402, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6080252602696419, "clip_ratio/low_mean": 0.014880952425301075, "clip_ratio/low_min": 0.014880952425301075, "clip_ratio/high_mean": 0.09854944609105587, "clip_ratio/high_max": 0.09854944609105587, "clip_ratio/region_mean": 0.11343039851635695, "reward_total_mean": 0.26727473735809326, "reward_meter_mean": 0.8004549145698547, "reward_meter_std": 0.2955181896686554, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9153865575790405, "reward_lexical_plausibility_std": 0.1567201316356659, "reward_repeat_penalty_mean": 0.444543719291687, "reward_repeat_penalty_std": 0.3224257826805115, "reward_repeat_floor_mean": 0.9293628334999084, "reward_repeat_floor_std": 0.046146344393491745, "reward_near_duplicate_penalty_mean": 0.8347088098526001, "reward_near_duplicate_penalty_std": 0.10775653272867203, "reward_opening_diversity_mean": 0.6526786088943481, "reward_opening_diversity_std": 0.2602613568305969, "reward_distinct_2_mean": 0.7221752405166626, "reward_distinct_2_std": 0.2029658555984497, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.18077214062213898, "reward_total_composite_mean": 0.26727473735809326, "reward_total_composite_std": 0.16430865228176117} {"timestamp_utc": "2026-04-12T20:06:51Z", "mode": "train", "global_step": 1085, "epoch": 0.05710225777590653, "loss": -0.034, "grad_norm": 5.871991157531738, "learning_rate": 6.715151515151516e-06, "num_tokens": 1935223.0, "completions/mean_length": 105.75, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.71428680419922, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.7791829109191895, "rewards/meter/std": 0.33099138736724854, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9680292010307312, "rewards/lexical_plausibility/std": 0.09042705595493317, "rewards/judge_quality/mean": 0.7512499690055847, "rewards/judge_quality/std": 0.349834144115448, "rewards/repeat_penalty/mean": 0.9364655017852783, "rewards/repeat_penalty/std": 0.1413634568452835, "rewards/repeat_floor/mean": 0.9951254725456238, "rewards/repeat_floor/std": 0.009855365380644798, "rewards/near_duplicate_penalty/mean": 0.988947868347168, "rewards/near_duplicate_penalty/std": 0.02277790755033493, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9642590284347534, "rewards/distinct_2/std": 0.07363905012607574, "rewards/total_composite/mean": 0.593836784362793, "rewards/total_composite/std": 0.40051841735839844, "reward": 0.593836784362793, "reward_std": 0.40051838755607605, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13935181498527527, "sampling/sampling_logp_difference/max": 1.3706169128417969, "sampling/importance_sampling_ratio/min": 0.25395023822784424, "sampling/importance_sampling_ratio/mean": 1.0205938816070557, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7359886914491653, "clip_ratio/low_mean": 0.036458333022892475, "clip_ratio/low_min": 0.036458333022892475, "clip_ratio/high_mean": 0.07284729508683085, "clip_ratio/high_max": 0.07284729508683085, "clip_ratio/region_mean": 0.10930562810972333, "reward_total_mean": 0.593836784362793, "reward_meter_mean": 0.7791829109191895, "reward_meter_std": 0.33099138736724854, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9680292010307312, "reward_lexical_plausibility_std": 0.09042705595493317, "reward_repeat_penalty_mean": 0.9364655017852783, "reward_repeat_penalty_std": 0.1413634568452835, "reward_repeat_floor_mean": 0.9951254725456238, "reward_repeat_floor_std": 0.009855365380644798, "reward_near_duplicate_penalty_mean": 0.988947868347168, "reward_near_duplicate_penalty_std": 0.02277790755033493, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9642590284347534, "reward_distinct_2_std": 0.07363905012607574, "reward_judge_quality_mean": 0.7512499690055847, "reward_judge_quality_std": 0.349834144115448, "reward_total_composite_mean": 0.593836784362793, "reward_total_composite_std": 0.40051841735839844} {"timestamp_utc": "2026-04-12T20:07:00Z", "mode": "train", "global_step": 1086, "epoch": 0.05715488658491658, "loss": 0.0465, "grad_norm": 10.681161880493164, "learning_rate": 6.712121212121213e-06, "num_tokens": 1936944.0, "completions/mean_length": 53.125, "completions/min_length": 44.0, "completions/max_length": 70.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.125, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.9139430522918701, "rewards/meter/std": 0.1263270080089569, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.24136148393154144, "rewards/repeat_penalty/mean": 0.8210009932518005, "rewards/repeat_penalty/std": 0.13047564029693604, "rewards/repeat_floor/mean": 0.9796181917190552, "rewards/repeat_floor/std": 0.012828967534005642, "rewards/near_duplicate_penalty/mean": 0.9301998615264893, "rewards/near_duplicate_penalty/std": 0.04048642888665199, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9107024669647217, "rewards/distinct_2/std": 0.10493715852499008, "rewards/total_composite/mean": 0.3343813121318817, "rewards/total_composite/std": 0.2343132346868515, "reward": 0.3343813121318817, "reward_std": 0.2343132346868515, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12319741398096085, "sampling/sampling_logp_difference/max": 1.5332574844360352, "sampling/importance_sampling_ratio/min": 0.215831458568573, "sampling/importance_sampling_ratio/mean": 1.0099456310272217, "sampling/importance_sampling_ratio/max": 1.9503875970840454, "entropy": 0.7286128997802734, "clip_ratio/low_mean": 0.07667247531935573, "clip_ratio/low_min": 0.07667247531935573, "clip_ratio/high_mean": 0.03490259870886803, "clip_ratio/high_max": 0.03490259870886803, "clip_ratio/region_mean": 0.11157507402822375, "reward_total_mean": 0.3343813121318817, "reward_meter_mean": 0.9139430522918701, "reward_meter_std": 0.1263270080089569, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8210009932518005, "reward_repeat_penalty_std": 0.13047564029693604, "reward_repeat_floor_mean": 0.9796181917190552, "reward_repeat_floor_std": 0.012828967534005642, "reward_near_duplicate_penalty_mean": 0.9301998615264893, "reward_near_duplicate_penalty_std": 0.04048642888665199, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9107024669647217, "reward_distinct_2_std": 0.10493715852499008, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.24136148393154144, "reward_total_composite_mean": 0.3343813121318817, "reward_total_composite_std": 0.2343132346868515} {"timestamp_utc": "2026-04-12T20:07:15Z", "mode": "train", "global_step": 1087, "epoch": 0.057207515393926635, "loss": -0.0599, "grad_norm": 1.916584849357605, "learning_rate": 6.709090909090909e-06, "num_tokens": 1938556.0, "completions/mean_length": 288.5, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 65.0, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 82.0, "rewards/meter/mean": 0.6596055030822754, "rewards/meter/std": 0.37892818450927734, "rewards/count_adherence/mean": 0.4583333730697632, "rewards/count_adherence/std": 0.43415674567222595, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8374999761581421, "rewards/count_floor/std": 0.13024702668190002, "rewards/lexical_plausibility/mean": 0.8312267065048218, "rewards/lexical_plausibility/std": 0.18548545241355896, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.7731016874313354, "rewards/repeat_penalty/std": 0.07494602352380753, "rewards/repeat_floor/mean": 0.9738824367523193, "rewards/repeat_floor/std": 0.00962059572339058, "rewards/near_duplicate_penalty/mean": 0.8970316648483276, "rewards/near_duplicate_penalty/std": 0.03821737319231033, "rewards/opening_diversity/mean": 0.9963235259056091, "rewards/opening_diversity/std": 0.010398639366030693, "rewards/distinct_2/mean": 0.8838698863983154, "rewards/distinct_2/std": 0.07145090401172638, "rewards/total_composite/mean": 0.16199465095996857, "rewards/total_composite/std": 0.16370822489261627, "reward": 0.16199465095996857, "reward_std": 0.16370822489261627, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1485721617937088, "sampling/sampling_logp_difference/max": 2.2193174362182617, "sampling/importance_sampling_ratio/min": 0.1086832657456398, "sampling/importance_sampling_ratio/mean": 1.0044283866882324, "sampling/importance_sampling_ratio/max": 1.9098730087280273, "entropy": 0.4442877247929573, "clip_ratio/low_mean": 0.013719512149691582, "clip_ratio/low_min": 0.013719512149691582, "clip_ratio/high_mean": 0.060597267001867294, "clip_ratio/high_max": 0.060597267001867294, "clip_ratio/region_mean": 0.07431677915155888, "reward_total_mean": 0.16199465095996857, "reward_meter_mean": 0.6596055030822754, "reward_meter_std": 0.37892818450927734, "reward_count_adherence_mean": 0.4583333730697632, "reward_count_adherence_std": 0.43415674567222595, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8374999761581421, "reward_count_floor_std": 0.13024702668190002, "reward_lexical_plausibility_mean": 0.8312267065048218, "reward_lexical_plausibility_std": 0.18548545241355896, "reward_repeat_penalty_mean": 0.7731016874313354, "reward_repeat_penalty_std": 0.07494602352380753, "reward_repeat_floor_mean": 0.9738824367523193, "reward_repeat_floor_std": 0.00962059572339058, "reward_near_duplicate_penalty_mean": 0.8970316648483276, "reward_near_duplicate_penalty_std": 0.03821737319231033, "reward_opening_diversity_mean": 0.9963235259056091, "reward_opening_diversity_std": 0.010398639366030693, "reward_distinct_2_mean": 0.8838698863983154, "reward_distinct_2_std": 0.07145090401172638, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.16199465095996857, "reward_total_composite_std": 0.16370822489261627} {"timestamp_utc": "2026-04-12T20:07:23Z", "mode": "train", "global_step": 1088, "epoch": 0.05726014420293669, "loss": 0.2228, "grad_norm": 8.618753433227539, "learning_rate": 6.706060606060607e-06, "num_tokens": 1940104.0, "completions/mean_length": 36.5, "completions/min_length": 21.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.5, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.4850292205810547, "rewards/meter/std": 0.3955121338367462, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.5345224738121033, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.16035674512386322, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.29871153831481934, "rewards/repeat_penalty/mean": 0.7875106930732727, "rewards/repeat_penalty/std": 0.16636258363723755, "rewards/repeat_floor/mean": 0.9793968796730042, "rewards/repeat_floor/std": 0.019574204459786415, "rewards/near_duplicate_penalty/mean": 0.9421905279159546, "rewards/near_duplicate_penalty/std": 0.09153043478727341, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9507588148117065, "rewards/distinct_2/std": 0.05842531472444534, "rewards/total_composite/mean": 0.2098846137523651, "rewards/total_composite/std": 0.27752968668937683, "reward": 0.2098846137523651, "reward_std": 0.27752965688705444, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1160566508769989, "sampling/sampling_logp_difference/max": 1.4186387062072754, "sampling/importance_sampling_ratio/min": 0.3461836874485016, "sampling/importance_sampling_ratio/mean": 1.0321719646453857, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8647604696452618, "clip_ratio/low_mean": 0.09415545128285885, "clip_ratio/low_min": 0.09415545128285885, "clip_ratio/high_mean": 0.03977272845804691, "clip_ratio/high_max": 0.03977272845804691, "clip_ratio/region_mean": 0.13392817974090576, "reward_total_mean": 0.2098846137523651, "reward_meter_mean": 0.4850292205810547, "reward_meter_std": 0.3955121338367462, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.5345224738121033, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.16035674512386322, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7875106930732727, "reward_repeat_penalty_std": 0.16636258363723755, "reward_repeat_floor_mean": 0.9793968796730042, "reward_repeat_floor_std": 0.019574204459786415, "reward_near_duplicate_penalty_mean": 0.9421905279159546, "reward_near_duplicate_penalty_std": 0.09153043478727341, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9507588148117065, "reward_distinct_2_std": 0.05842531472444534, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.29871153831481934, "reward_total_composite_mean": 0.2098846137523651, "reward_total_composite_std": 0.27752968668937683} {"timestamp_utc": "2026-04-12T20:07:37Z", "mode": "train", "global_step": 1089, "epoch": 0.05731277301194674, "loss": -0.0509, "grad_norm": 2.8513529300689697, "learning_rate": 6.703030303030304e-06, "num_tokens": 1941709.0, "completions/mean_length": 161.625, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 44.833335876464844, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.6778078079223633, "rewards/meter/std": 0.3915116786956787, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9214867353439331, "rewards/lexical_plausibility/std": 0.1500946283340454, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.27458736300468445, "rewards/repeat_penalty/mean": 0.8548451662063599, "rewards/repeat_penalty/std": 0.1594332903623581, "rewards/repeat_floor/mean": 0.9812458157539368, "rewards/repeat_floor/std": 0.01976749859750271, "rewards/near_duplicate_penalty/mean": 0.9221019148826599, "rewards/near_duplicate_penalty/std": 0.06468543410301208, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9214506149291992, "rewards/distinct_2/std": 0.1300339698791504, "rewards/total_composite/mean": 0.28842759132385254, "rewards/total_composite/std": 0.28460586071014404, "reward": 0.28842759132385254, "reward_std": 0.28460586071014404, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13578085601329803, "sampling/sampling_logp_difference/max": 1.5256547927856445, "sampling/importance_sampling_ratio/min": 0.21747861802577972, "sampling/importance_sampling_ratio/mean": 1.033605694770813, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7600734606385231, "clip_ratio/low_mean": 0.0461454764008522, "clip_ratio/low_min": 0.0461454764008522, "clip_ratio/high_mean": 0.06600877456367016, "clip_ratio/high_max": 0.06600877456367016, "clip_ratio/region_mean": 0.11215425096452236, "reward_total_mean": 0.28842759132385254, "reward_meter_mean": 0.6778078079223633, "reward_meter_std": 0.3915116786956787, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9214867353439331, "reward_lexical_plausibility_std": 0.1500946283340454, "reward_repeat_penalty_mean": 0.8548451662063599, "reward_repeat_penalty_std": 0.1594332903623581, "reward_repeat_floor_mean": 0.9812458157539368, "reward_repeat_floor_std": 0.01976749859750271, "reward_near_duplicate_penalty_mean": 0.9221019148826599, "reward_near_duplicate_penalty_std": 0.06468543410301208, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9214506149291992, "reward_distinct_2_std": 0.1300339698791504, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.27458736300468445, "reward_total_composite_mean": 0.28842759132385254, "reward_total_composite_std": 0.28460586071014404} {"timestamp_utc": "2026-04-12T20:07:45Z", "mode": "train", "global_step": 1090, "epoch": 0.05736540182095679, "loss": 0.2498, "grad_norm": 20.269132614135742, "learning_rate": 6.700000000000001e-06, "num_tokens": 1943162.0, "completions/mean_length": 22.625, "completions/min_length": 17.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.625, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.7608385682106018, "rewards/meter/std": 0.40729326009750366, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.14880475401878357, "rewards/repeat_penalty/mean": 0.7468118667602539, "rewards/repeat_penalty/std": 0.09663929045200348, "rewards/repeat_floor/mean": 0.9802461862564087, "rewards/repeat_floor/std": 0.010517552495002747, "rewards/near_duplicate_penalty/mean": 0.9558081030845642, "rewards/near_duplicate_penalty/std": 0.059891778975725174, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24426288902759552, "rewards/total_composite/std": 0.18034961819648743, "reward": 0.24426288902759552, "reward_std": 0.18034961819648743, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11935863643884659, "sampling/sampling_logp_difference/max": 1.0952835083007812, "sampling/importance_sampling_ratio/min": 0.3344447612762451, "sampling/importance_sampling_ratio/mean": 1.0266389846801758, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.780202716588974, "clip_ratio/low_mean": 0.07919938769191504, "clip_ratio/low_min": 0.07919938769191504, "clip_ratio/high_mean": 0.033010836225003004, "clip_ratio/high_max": 0.033010836225003004, "clip_ratio/region_mean": 0.11221022391691804, "reward_total_mean": 0.24426288902759552, "reward_meter_mean": 0.7608385682106018, "reward_meter_std": 0.40729326009750366, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7468118667602539, "reward_repeat_penalty_std": 0.09663929045200348, "reward_repeat_floor_mean": 0.9802461862564087, "reward_repeat_floor_std": 0.010517552495002747, "reward_near_duplicate_penalty_mean": 0.9558081030845642, "reward_near_duplicate_penalty_std": 0.059891778975725174, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.14880475401878357, "reward_total_composite_mean": 0.24426288902759552, "reward_total_composite_std": 0.18034961819648743} {"timestamp_utc": "2026-04-12T20:07:59Z", "mode": "train", "global_step": 1091, "epoch": 0.057418030629966844, "loss": -0.0313, "grad_norm": 3.0998330116271973, "learning_rate": 6.6969696969696975e-06, "num_tokens": 1944676.0, "completions/mean_length": 161.25, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 44.333335876464844, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.4616873562335968, "rewards/meter/std": 0.38850751519203186, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.919589102268219, "rewards/lexical_plausibility/std": 0.15135924518108368, "rewards/judge_quality/mean": 0.23750001192092896, "rewards/judge_quality/std": 0.2295181304216385, "rewards/repeat_penalty/mean": 0.7323417067527771, "rewards/repeat_penalty/std": 0.1445988267660141, "rewards/repeat_floor/mean": 0.9709863662719727, "rewards/repeat_floor/std": 0.014883177354931831, "rewards/near_duplicate_penalty/mean": 0.9120395183563232, "rewards/near_duplicate_penalty/std": 0.04725426435470581, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8867272138595581, "rewards/distinct_2/std": 0.10701995342969894, "rewards/total_composite/mean": 0.08975566923618317, "rewards/total_composite/std": 0.11220458894968033, "reward": 0.08975566923618317, "reward_std": 0.11220459640026093, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14262858033180237, "sampling/sampling_logp_difference/max": 1.5645205974578857, "sampling/importance_sampling_ratio/min": 0.20918826758861542, "sampling/importance_sampling_ratio/mean": 1.0364091396331787, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7283241897821426, "clip_ratio/low_mean": 0.054470415227115154, "clip_ratio/low_min": 0.054470415227115154, "clip_ratio/high_mean": 0.04826454073190689, "clip_ratio/high_max": 0.04826454073190689, "clip_ratio/region_mean": 0.10273495595902205, "reward_total_mean": 0.08975566923618317, "reward_meter_mean": 0.4616873562335968, "reward_meter_std": 0.38850751519203186, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.919589102268219, "reward_lexical_plausibility_std": 0.15135924518108368, "reward_repeat_penalty_mean": 0.7323417067527771, "reward_repeat_penalty_std": 0.1445988267660141, "reward_repeat_floor_mean": 0.9709863662719727, "reward_repeat_floor_std": 0.014883177354931831, "reward_near_duplicate_penalty_mean": 0.9120395183563232, "reward_near_duplicate_penalty_std": 0.04725426435470581, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8867272138595581, "reward_distinct_2_std": 0.10701995342969894, "reward_judge_quality_mean": 0.23750001192092896, "reward_judge_quality_std": 0.2295181304216385, "reward_total_composite_mean": 0.08975566923618317, "reward_total_composite_std": 0.11220458894968033} {"timestamp_utc": "2026-04-12T20:08:13Z", "mode": "train", "global_step": 1092, "epoch": 0.0574706594389769, "loss": -0.0939, "grad_norm": 1.647580623626709, "learning_rate": 6.693939393939395e-06, "num_tokens": 1946178.0, "completions/mean_length": 154.75, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 35.66666793823242, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.7439446449279785, "rewards/meter/std": 0.39357125759124756, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.11160357296466827, "rewards/lexical_plausibility/mean": 0.8957195281982422, "rewards/lexical_plausibility/std": 0.1949753612279892, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.1752549111843109, "rewards/repeat_penalty/mean": 0.8643711805343628, "rewards/repeat_penalty/std": 0.17102113366127014, "rewards/repeat_floor/mean": 0.9866104125976562, "rewards/repeat_floor/std": 0.017543351277709007, "rewards/near_duplicate_penalty/mean": 0.9631621837615967, "rewards/near_duplicate_penalty/std": 0.0577021948993206, "rewards/opening_diversity/mean": 0.925000011920929, "rewards/opening_diversity/std": 0.11338934302330017, "rewards/distinct_2/mean": 0.9626235961914062, "rewards/distinct_2/std": 0.06939946115016937, "rewards/total_composite/mean": 0.2858754098415375, "rewards/total_composite/std": 0.17618735134601593, "reward": 0.2858754098415375, "reward_std": 0.17618735134601593, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13028892874717712, "sampling/sampling_logp_difference/max": 0.8585249185562134, "sampling/importance_sampling_ratio/min": 0.49698859453201294, "sampling/importance_sampling_ratio/mean": 1.020411491394043, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6634023115038872, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.11563093308359385, "clip_ratio/high_max": 0.11563093308359385, "clip_ratio/region_mean": 0.11563093308359385, "reward_total_mean": 0.2858754098415375, "reward_meter_mean": 0.7439446449279785, "reward_meter_std": 0.39357125759124756, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.11160357296466827, "reward_lexical_plausibility_mean": 0.8957195281982422, "reward_lexical_plausibility_std": 0.1949753612279892, "reward_repeat_penalty_mean": 0.8643711805343628, "reward_repeat_penalty_std": 0.17102113366127014, "reward_repeat_floor_mean": 0.9866104125976562, "reward_repeat_floor_std": 0.017543351277709007, "reward_near_duplicate_penalty_mean": 0.9631621837615967, "reward_near_duplicate_penalty_std": 0.0577021948993206, "reward_opening_diversity_mean": 0.925000011920929, "reward_opening_diversity_std": 0.11338934302330017, "reward_distinct_2_mean": 0.9626235961914062, "reward_distinct_2_std": 0.06939946115016937, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.1752549111843109, "reward_total_composite_mean": 0.2858754098415375, "reward_total_composite_std": 0.17618735134601593} {"timestamp_utc": "2026-04-12T20:08:22Z", "mode": "train", "global_step": 1093, "epoch": 0.05752328824798695, "loss": 0.012, "grad_norm": 9.187946319580078, "learning_rate": 6.690909090909091e-06, "num_tokens": 1948294.0, "completions/mean_length": 70.5, "completions/min_length": 62.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 70.5, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.9771513938903809, "rewards/meter/std": 0.03255423158407211, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.6503579616546631, "rewards/repeat_penalty/std": 0.15134984254837036, "rewards/repeat_floor/mean": 0.9553418159484863, "rewards/repeat_floor/std": 0.02226443402469158, "rewards/near_duplicate_penalty/mean": 0.8459196090698242, "rewards/near_duplicate_penalty/std": 0.07903697341680527, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.7814317345619202, "rewards/distinct_2/std": 0.08685024827718735, "rewards/total_composite/mean": 0.19522690773010254, "rewards/total_composite/std": 0.09244982898235321, "reward": 0.19522690773010254, "reward_std": 0.09244982153177261, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1326293647289276, "sampling/sampling_logp_difference/max": 1.7948389053344727, "sampling/importance_sampling_ratio/min": 0.16615422070026398, "sampling/importance_sampling_ratio/mean": 1.0035054683685303, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7150585576891899, "clip_ratio/low_mean": 0.07776742801070213, "clip_ratio/low_min": 0.07776742801070213, "clip_ratio/high_mean": 0.05006090085953474, "clip_ratio/high_max": 0.05006090085953474, "clip_ratio/region_mean": 0.12782832887023687, "reward_total_mean": 0.19522690773010254, "reward_meter_mean": 0.9771513938903809, "reward_meter_std": 0.03255423158407211, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6503579616546631, "reward_repeat_penalty_std": 0.15134984254837036, "reward_repeat_floor_mean": 0.9553418159484863, "reward_repeat_floor_std": 0.02226443402469158, "reward_near_duplicate_penalty_mean": 0.8459196090698242, "reward_near_duplicate_penalty_std": 0.07903697341680527, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.7814317345619202, "reward_distinct_2_std": 0.08685024827718735, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.19522690773010254, "reward_total_composite_std": 0.09244982898235321} {"timestamp_utc": "2026-04-12T20:08:31Z", "mode": "train", "global_step": 1094, "epoch": 0.057575917056997, "loss": 0.0248, "grad_norm": 21.760711669921875, "learning_rate": 6.687878787878788e-06, "num_tokens": 1949525.0, "completions/mean_length": 22.875, "completions/min_length": 20.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.875, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.9305969476699829, "rewards/meter/std": 0.12035281956195831, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5762500166893005, "rewards/judge_quality/std": 0.30123260617256165, "rewards/repeat_penalty/mean": 0.5536414980888367, "rewards/repeat_penalty/std": 0.27665838599205017, "rewards/repeat_floor/mean": 0.9421765208244324, "rewards/repeat_floor/std": 0.0637635737657547, "rewards/near_duplicate_penalty/mean": 0.802559494972229, "rewards/near_duplicate_penalty/std": 0.2574443221092224, "rewards/opening_diversity/mean": 0.65625, "rewards/opening_diversity/std": 0.2651650309562683, "rewards/distinct_2/mean": 0.9157509207725525, "rewards/distinct_2/std": 0.14504754543304443, "rewards/total_composite/mean": 0.49066489934921265, "rewards/total_composite/std": 0.24006322026252747, "reward": 0.49066489934921265, "reward_std": 0.24006320536136627, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.194910928606987, "sampling/sampling_logp_difference/max": 1.578312873840332, "sampling/importance_sampling_ratio/min": 0.20632289350032806, "sampling/importance_sampling_ratio/mean": 1.0179365873336792, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0782008990645409, "clip_ratio/low_mean": 0.09517195029184222, "clip_ratio/low_min": 0.09517195029184222, "clip_ratio/high_mean": 0.07516678236424923, "clip_ratio/high_max": 0.07516678236424923, "clip_ratio/region_mean": 0.17033873265609145, "reward_total_mean": 0.49066489934921265, "reward_meter_mean": 0.9305969476699829, "reward_meter_std": 0.12035281956195831, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5536414980888367, "reward_repeat_penalty_std": 0.27665838599205017, "reward_repeat_floor_mean": 0.9421765208244324, "reward_repeat_floor_std": 0.0637635737657547, "reward_near_duplicate_penalty_mean": 0.802559494972229, "reward_near_duplicate_penalty_std": 0.2574443221092224, "reward_opening_diversity_mean": 0.65625, "reward_opening_diversity_std": 0.2651650309562683, "reward_distinct_2_mean": 0.9157509207725525, "reward_distinct_2_std": 0.14504754543304443, "reward_judge_quality_mean": 0.5762500166893005, "reward_judge_quality_std": 0.30123260617256165, "reward_total_composite_mean": 0.49066489934921265, "reward_total_composite_std": 0.24006322026252747} {"timestamp_utc": "2026-04-12T20:08:45Z", "mode": "train", "global_step": 1095, "epoch": 0.057628545866007054, "loss": -0.0376, "grad_norm": 1.7080044746398926, "learning_rate": 6.684848484848485e-06, "num_tokens": 1951137.0, "completions/mean_length": 277.5, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 43.0, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.5442564487457275, "rewards/meter/std": 0.46114057302474976, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.11160357296466827, "rewards/lexical_plausibility/mean": 0.8344399929046631, "rewards/lexical_plausibility/std": 0.17873318493366241, "rewards/judge_quality/mean": 0.2462500035762787, "rewards/judge_quality/std": 0.3020850121974945, "rewards/repeat_penalty/mean": 0.9330055713653564, "rewards/repeat_penalty/std": 0.07860389351844788, "rewards/repeat_floor/mean": 0.9916747212409973, "rewards/repeat_floor/std": 0.00870470143854618, "rewards/near_duplicate_penalty/mean": 0.964820146560669, "rewards/near_duplicate_penalty/std": 0.026550035923719406, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.966130256652832, "rewards/distinct_2/std": 0.06408049166202545, "rewards/total_composite/mean": 0.18429481983184814, "rewards/total_composite/std": 0.2996910810470581, "reward": 0.18429481983184814, "reward_std": 0.2996910512447357, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15668749809265137, "sampling/sampling_logp_difference/max": 0.9845449924468994, "sampling/importance_sampling_ratio/min": 0.41279104351997375, "sampling/importance_sampling_ratio/mean": 1.015380859375, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5497327595949173, "clip_ratio/low_mean": 0.037097953259944916, "clip_ratio/low_min": 0.037097953259944916, "clip_ratio/high_mean": 0.05080128461122513, "clip_ratio/high_max": 0.05080128461122513, "clip_ratio/region_mean": 0.08789923787117004, "reward_total_mean": 0.18429481983184814, "reward_meter_mean": 0.5442564487457275, "reward_meter_std": 0.46114057302474976, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.11160357296466827, "reward_lexical_plausibility_mean": 0.8344399929046631, "reward_lexical_plausibility_std": 0.17873318493366241, "reward_repeat_penalty_mean": 0.9330055713653564, "reward_repeat_penalty_std": 0.07860389351844788, "reward_repeat_floor_mean": 0.9916747212409973, "reward_repeat_floor_std": 0.00870470143854618, "reward_near_duplicate_penalty_mean": 0.964820146560669, "reward_near_duplicate_penalty_std": 0.026550035923719406, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.966130256652832, "reward_distinct_2_std": 0.06408049166202545, "reward_judge_quality_mean": 0.2462500035762787, "reward_judge_quality_std": 0.3020850121974945, "reward_total_composite_mean": 0.18429481983184814, "reward_total_composite_std": 0.2996910810470581} {"timestamp_utc": "2026-04-12T20:08:59Z", "mode": "train", "global_step": 1096, "epoch": 0.057681174675017106, "loss": -0.0479, "grad_norm": 4.381524562835693, "learning_rate": 6.681818181818183e-06, "num_tokens": 1952584.0, "completions/mean_length": 89.875, "completions/min_length": 25.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 29.571430206298828, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.6610127687454224, "rewards/meter/std": 0.40588122606277466, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.947071373462677, "rewards/lexical_plausibility/std": 0.1497047245502472, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.8847966194152832, "rewards/repeat_penalty/std": 0.1087074875831604, "rewards/repeat_floor/mean": 0.987322211265564, "rewards/repeat_floor/std": 0.010964552871882915, "rewards/near_duplicate_penalty/mean": 0.9510585069656372, "rewards/near_duplicate_penalty/std": 0.04364753141999245, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9615384340286255, "rewards/distinct_2/std": 0.07631013542413712, "rewards/total_composite/mean": 0.20927679538726807, "rewards/total_composite/std": 0.1652289777994156, "reward": 0.20927679538726807, "reward_std": 0.1652289777994156, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17333891987800598, "sampling/sampling_logp_difference/max": 1.238534927368164, "sampling/importance_sampling_ratio/min": 0.2898085117340088, "sampling/importance_sampling_ratio/mean": 1.0018415451049805, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9342399910092354, "clip_ratio/low_mean": 0.06966517865657806, "clip_ratio/low_min": 0.06966517865657806, "clip_ratio/high_mean": 0.08052733587101102, "clip_ratio/high_max": 0.08052733587101102, "clip_ratio/region_mean": 0.15019251452758908, "reward_total_mean": 0.20927679538726807, "reward_meter_mean": 0.6610127687454224, "reward_meter_std": 0.40588122606277466, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.947071373462677, "reward_lexical_plausibility_std": 0.1497047245502472, "reward_repeat_penalty_mean": 0.8847966194152832, "reward_repeat_penalty_std": 0.1087074875831604, "reward_repeat_floor_mean": 0.987322211265564, "reward_repeat_floor_std": 0.010964552871882915, "reward_near_duplicate_penalty_mean": 0.9510585069656372, "reward_near_duplicate_penalty_std": 0.04364753141999245, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9615384340286255, "reward_distinct_2_std": 0.07631013542413712, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.20927679538726807, "reward_total_composite_std": 0.1652289777994156} {"timestamp_utc": "2026-04-12T20:09:07Z", "mode": "train", "global_step": 1097, "epoch": 0.05773380348402716, "loss": 0.0129, "grad_norm": 12.897970199584961, "learning_rate": 6.678787878787879e-06, "num_tokens": 1954179.0, "completions/mean_length": 42.375, "completions/min_length": 36.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.8010610342025757, "rewards/meter/std": 0.337760865688324, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.1685018092393875, "rewards/repeat_penalty/mean": 0.6276440620422363, "rewards/repeat_penalty/std": 0.34671539068222046, "rewards/repeat_floor/mean": 0.9534791707992554, "rewards/repeat_floor/std": 0.044727250933647156, "rewards/near_duplicate_penalty/mean": 0.8738264441490173, "rewards/near_duplicate_penalty/std": 0.11950135231018066, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.2734534442424774, "rewards/distinct_2/mean": 0.8392242193222046, "rewards/distinct_2/std": 0.13986997306346893, "rewards/total_composite/mean": 0.3464347720146179, "rewards/total_composite/std": 0.22131280601024628, "reward": 0.3464347720146179, "reward_std": 0.22131283581256866, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1366889476776123, "sampling/sampling_logp_difference/max": 1.9211750030517578, "sampling/importance_sampling_ratio/min": 0.14643479883670807, "sampling/importance_sampling_ratio/mean": 0.99560546875, "sampling/importance_sampling_ratio/max": 1.992817759513855, "entropy": 0.7572882398962975, "clip_ratio/low_mean": 0.05509947193786502, "clip_ratio/low_min": 0.05509947193786502, "clip_ratio/high_mean": 0.06942121032625437, "clip_ratio/high_max": 0.06942121032625437, "clip_ratio/region_mean": 0.12452068226411939, "reward_total_mean": 0.3464347720146179, "reward_meter_mean": 0.8010610342025757, "reward_meter_std": 0.337760865688324, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6276440620422363, "reward_repeat_penalty_std": 0.34671539068222046, "reward_repeat_floor_mean": 0.9534791707992554, "reward_repeat_floor_std": 0.044727250933647156, "reward_near_duplicate_penalty_mean": 0.8738264441490173, "reward_near_duplicate_penalty_std": 0.11950135231018066, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.2734534442424774, "reward_distinct_2_mean": 0.8392242193222046, "reward_distinct_2_std": 0.13986997306346893, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.1685018092393875, "reward_total_composite_mean": 0.3464347720146179, "reward_total_composite_std": 0.22131280601024628} {"timestamp_utc": "2026-04-12T20:09:22Z", "mode": "train", "global_step": 1098, "epoch": 0.05778643229303721, "loss": -0.1113, "grad_norm": 4.186286926269531, "learning_rate": 6.6757575757575766e-06, "num_tokens": 1956353.0, "completions/mean_length": 139.75, "completions/min_length": 68.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 86.5714340209961, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 109.0, "rewards/meter/mean": 0.8713853359222412, "rewards/meter/std": 0.3166533410549164, "rewards/count_adherence/mean": 0.675000011920929, "rewards/count_adherence/std": 0.14880476891994476, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9024999737739563, "rewards/count_floor/std": 0.04464143142104149, "rewards/lexical_plausibility/mean": 0.9481337666511536, "rewards/lexical_plausibility/std": 0.14669986069202423, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.6134224534034729, "rewards/repeat_penalty/std": 0.21901676058769226, "rewards/repeat_floor/mean": 0.9548375606536865, "rewards/repeat_floor/std": 0.031802453100681305, "rewards/near_duplicate_penalty/mean": 0.8885675668716431, "rewards/near_duplicate_penalty/std": 0.08633626997470856, "rewards/opening_diversity/mean": 0.8567708730697632, "rewards/opening_diversity/std": 0.1726735681295395, "rewards/distinct_2/mean": 0.7794021964073181, "rewards/distinct_2/std": 0.15259352326393127, "rewards/total_composite/mean": 0.1775781661272049, "rewards/total_composite/std": 0.11254829168319702, "reward": 0.1775781661272049, "reward_std": 0.11254829168319702, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1395624428987503, "sampling/sampling_logp_difference/max": 3.1949408054351807, "sampling/importance_sampling_ratio/min": 0.04096895083785057, "sampling/importance_sampling_ratio/mean": 1.015233039855957, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8223958015441895, "clip_ratio/low_mean": 0.056410242803394794, "clip_ratio/low_min": 0.056410242803394794, "clip_ratio/high_mean": 0.06409796886146069, "clip_ratio/high_max": 0.06409796886146069, "clip_ratio/region_mean": 0.12050821166485548, "reward_total_mean": 0.1775781661272049, "reward_meter_mean": 0.8713853359222412, "reward_meter_std": 0.3166533410549164, "reward_count_adherence_mean": 0.675000011920929, "reward_count_adherence_std": 0.14880476891994476, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9024999737739563, "reward_count_floor_std": 0.04464143142104149, "reward_lexical_plausibility_mean": 0.9481337666511536, "reward_lexical_plausibility_std": 0.14669986069202423, "reward_repeat_penalty_mean": 0.6134224534034729, "reward_repeat_penalty_std": 0.21901676058769226, "reward_repeat_floor_mean": 0.9548375606536865, "reward_repeat_floor_std": 0.031802453100681305, "reward_near_duplicate_penalty_mean": 0.8885675668716431, "reward_near_duplicate_penalty_std": 0.08633626997470856, "reward_opening_diversity_mean": 0.8567708730697632, "reward_opening_diversity_std": 0.1726735681295395, "reward_distinct_2_mean": 0.7794021964073181, "reward_distinct_2_std": 0.15259352326393127, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.1775781661272049, "reward_total_composite_std": 0.11254829168319702} {"timestamp_utc": "2026-04-12T20:09:31Z", "mode": "train", "global_step": 1099, "epoch": 0.057839061102047264, "loss": 0.1291, "grad_norm": 12.249665260314941, "learning_rate": 6.672727272727273e-06, "num_tokens": 1958081.0, "completions/mean_length": 41.0, "completions/min_length": 32.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.0, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.5705949664115906, "rewards/meter/std": 0.36392638087272644, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.19776880741119385, "rewards/repeat_penalty/mean": 0.8820878267288208, "rewards/repeat_penalty/std": 0.10153698921203613, "rewards/repeat_floor/mean": 0.985323965549469, "rewards/repeat_floor/std": 0.01125027984380722, "rewards/near_duplicate_penalty/mean": 0.9399466514587402, "rewards/near_duplicate_penalty/std": 0.03149586170911789, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9370220303535461, "rewards/distinct_2/std": 0.08818355947732925, "rewards/total_composite/mean": 0.2716326117515564, "rewards/total_composite/std": 0.21279367804527283, "reward": 0.2716326117515564, "reward_std": 0.21279366314411163, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15643452107906342, "sampling/sampling_logp_difference/max": 4.454733848571777, "sampling/importance_sampling_ratio/min": 0.011623413302004337, "sampling/importance_sampling_ratio/mean": 1.0151728391647339, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8616652265191078, "clip_ratio/low_mean": 0.09151867032051086, "clip_ratio/low_min": 0.09151867032051086, "clip_ratio/high_mean": 0.0582217276096344, "clip_ratio/high_max": 0.0582217276096344, "clip_ratio/region_mean": 0.14974039793014526, "reward_total_mean": 0.2716326117515564, "reward_meter_mean": 0.5705949664115906, "reward_meter_std": 0.36392638087272644, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8820878267288208, "reward_repeat_penalty_std": 0.10153698921203613, "reward_repeat_floor_mean": 0.985323965549469, "reward_repeat_floor_std": 0.01125027984380722, "reward_near_duplicate_penalty_mean": 0.9399466514587402, "reward_near_duplicate_penalty_std": 0.03149586170911789, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9370220303535461, "reward_distinct_2_std": 0.08818355947732925, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.19776880741119385, "reward_total_composite_mean": 0.2716326117515564, "reward_total_composite_std": 0.21279367804527283} {"timestamp_utc": "2026-04-12T20:09:41Z", "mode": "train", "global_step": 1100, "epoch": 0.057891689911057316, "loss": 0.0608, "grad_norm": 14.894866943359375, "learning_rate": 6.66969696969697e-06, "num_tokens": 1960543.0, "completions/mean_length": 109.75, "completions/min_length": 94.0, "completions/max_length": 126.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 109.75, "completions/min_terminated_length": 94.0, "completions/max_terminated_length": 126.0, "rewards/meter/mean": 0.5068317651748657, "rewards/meter/std": 0.25957190990448, "rewards/count_adherence/mean": 0.7857142686843872, "rewards/count_adherence/std": 0.07636035233736038, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9357142448425293, "rewards/count_floor/std": 0.02290808968245983, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.6283880472183228, "rewards/repeat_penalty/std": 0.15834280848503113, "rewards/repeat_floor/mean": 0.9582613706588745, "rewards/repeat_floor/std": 0.01779051683843136, "rewards/near_duplicate_penalty/mean": 0.9038777351379395, "rewards/near_duplicate_penalty/std": 0.03803898021578789, "rewards/opening_diversity/mean": 0.9094842672348022, "rewards/opening_diversity/std": 0.10487770289182663, "rewards/distinct_2/mean": 0.7567849159240723, "rewards/distinct_2/std": 0.10809030383825302, "rewards/total_composite/mean": 0.17452022433280945, "rewards/total_composite/std": 0.08144509047269821, "reward": 0.17452022433280945, "reward_std": 0.08144509792327881, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1275382936000824, "sampling/sampling_logp_difference/max": 2.9277753829956055, "sampling/importance_sampling_ratio/min": 0.0535159558057785, "sampling/importance_sampling_ratio/mean": 0.9980449080467224, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5731510818004608, "clip_ratio/low_mean": 0.053869991563260555, "clip_ratio/low_min": 0.053869991563260555, "clip_ratio/high_mean": 0.05861018318682909, "clip_ratio/high_max": 0.05861018318682909, "clip_ratio/region_mean": 0.11248017475008965, "reward_total_mean": 0.17452022433280945, "reward_meter_mean": 0.5068317651748657, "reward_meter_std": 0.25957190990448, "reward_count_adherence_mean": 0.7857142686843872, "reward_count_adherence_std": 0.07636035233736038, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9357142448425293, "reward_count_floor_std": 0.02290808968245983, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6283880472183228, "reward_repeat_penalty_std": 0.15834280848503113, "reward_repeat_floor_mean": 0.9582613706588745, "reward_repeat_floor_std": 0.01779051683843136, "reward_near_duplicate_penalty_mean": 0.9038777351379395, "reward_near_duplicate_penalty_std": 0.03803898021578789, "reward_opening_diversity_mean": 0.9094842672348022, "reward_opening_diversity_std": 0.10487770289182663, "reward_distinct_2_mean": 0.7567849159240723, "reward_distinct_2_std": 0.10809030383825302, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.17452022433280945, "reward_total_composite_std": 0.08144509047269821} {"timestamp_utc": "2026-04-12T20:12:05Z", "mode": "eval", "global_step": 1100, "epoch": 0.057891689911057316, "eval_loss": NaN, "eval_runtime": 143.2477, "eval_samples_per_second": 0.726, "eval_steps_per_second": 0.091, "eval_num_tokens": 1960543.0, "eval_completions/mean_length": 161.42307692307693, "eval_completions/min_length": 38.15384615384615, "eval_completions/max_length": 459.15384615384613, "eval_completions/clipped_ratio": 0.11538461538461539, "eval_completions/mean_terminated_length": 114.97060805100661, "eval_completions/min_terminated_length": 38.15384615384615, "eval_completions/max_terminated_length": 229.76923076923077, "eval_rewards/meter/mean": 0.5215150645146003, "eval_rewards/meter/std": 0.38024141696783215, "eval_rewards/count_adherence/mean": 0.8148601055145264, "eval_rewards/count_adherence/std": 0.17769379340685332, "eval_rewards/arabic_clean/mean": 0.8173076923076923, "eval_rewards/arabic_clean/std": 0.3580388908202832, "eval_rewards/hard_gate/mean": 0.9903846153846154, "eval_rewards/hard_gate/std": 0.027196414195574246, "eval_rewards/arabic_floor/mean": 0.9942307655627911, "eval_rewards/arabic_floor/std": 0.016317846683355477, "eval_rewards/count_floor/mean": 0.9444580399073087, "eval_rewards/count_floor/std": 0.053308138193992466, "eval_rewards/lexical_plausibility/mean": 0.9602617254624, "eval_rewards/lexical_plausibility/std": 0.09390096194469012, "eval_rewards/judge_quality/mean": 0.2883653835608409, "eval_rewards/judge_quality/std": 0.1710561364889145, "eval_rewards/repeat_penalty/mean": 0.6766370351497943, "eval_rewards/repeat_penalty/std": 0.27264298727879155, "eval_rewards/repeat_floor/mean": 0.9617866002596341, "eval_rewards/repeat_floor/std": 0.03687848666539559, "eval_rewards/near_duplicate_penalty/mean": 0.9054372677436242, "eval_rewards/near_duplicate_penalty/std": 0.09143693057390359, "eval_rewards/opening_diversity/mean": 0.9644795335256137, "eval_rewards/opening_diversity/std": 0.08858410097085513, "eval_rewards/distinct_2/mean": 0.7566915704653814, "eval_rewards/distinct_2/std": 0.24649564176797867, "eval_rewards/total_composite/mean": 0.1296087603729505, "eval_rewards/total_composite/std": 0.127347124597201, "eval_reward": 0.1296087603729505, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.06633633776352955, "eval_sampling/sampling_logp_difference/max": 1.2731393667367787, "eval_sampling/importance_sampling_ratio/min": 0.30760770147809613, "eval_sampling/importance_sampling_ratio/mean": 1.0148192185621996, "eval_sampling/importance_sampling_ratio/max": 1.4713487441723163, "eval_entropy": 0.7175642481217017, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.1296087603729505, "eval_reward_meter_mean": 0.5215150645146003, "eval_reward_meter_std": 0.38024141696783215, "eval_reward_count_adherence_mean": 0.8148601055145264, "eval_reward_count_adherence_std": 0.17769379340685332, "eval_reward_arabic_clean_mean": 0.8173076923076923, "eval_reward_arabic_clean_std": 0.3580388908202832, "eval_reward_hard_gate_mean": 0.9903846153846154, "eval_reward_hard_gate_std": 0.027196414195574246, "eval_reward_arabic_floor_mean": 0.9942307655627911, "eval_reward_arabic_floor_std": 0.016317846683355477, "eval_reward_count_floor_mean": 0.9444580399073087, "eval_reward_count_floor_std": 0.053308138193992466, "eval_reward_lexical_plausibility_mean": 0.9602617254624, "eval_reward_lexical_plausibility_std": 0.09390096194469012, "eval_reward_repeat_penalty_mean": 0.6766370351497943, "eval_reward_repeat_penalty_std": 0.27264298727879155, "eval_reward_repeat_floor_mean": 0.9617866002596341, "eval_reward_repeat_floor_std": 0.03687848666539559, "eval_reward_near_duplicate_penalty_mean": 0.9054372677436242, "eval_reward_near_duplicate_penalty_std": 0.09143693057390359, "eval_reward_opening_diversity_mean": 0.9644795335256137, "eval_reward_opening_diversity_std": 0.08858410097085513, "eval_reward_distinct_2_mean": 0.7566915704653814, "eval_reward_distinct_2_std": 0.24649564176797867, "eval_reward_judge_quality_mean": 0.2883653835608409, "eval_reward_judge_quality_std": 0.1710561364889145, "eval_reward_total_composite_mean": 0.1296087603729505, "eval_reward_total_composite_std": 0.127347124597201} {"timestamp_utc": "2026-04-12T20:12:21Z", "mode": "train", "global_step": 1101, "epoch": 0.05794431872006736, "loss": 0.081, "grad_norm": 13.073052406311035, "learning_rate": 6.666666666666667e-06, "num_tokens": 1962881.0, "completions/mean_length": 85.25, "completions/min_length": 69.0, "completions/max_length": 97.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 85.25, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 97.0, "rewards/meter/mean": 0.3148347735404968, "rewards/meter/std": 0.33956053853034973, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.08625820279121399, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9812500476837158, "rewards/count_floor/std": 0.025877466425299644, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.25670650601387024, "rewards/repeat_penalty/mean": 0.854625940322876, "rewards/repeat_penalty/std": 0.11572480201721191, "rewards/repeat_floor/mean": 0.9845839738845825, "rewards/repeat_floor/std": 0.01062406413257122, "rewards/near_duplicate_penalty/mean": 0.9577128291130066, "rewards/near_duplicate_penalty/std": 0.02396639995276928, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8991890549659729, "rewards/distinct_2/std": 0.08846036344766617, "rewards/total_composite/mean": 0.0951695591211319, "rewards/total_composite/std": 0.12376604974269867, "reward": 0.0951695591211319, "reward_std": 0.12376604229211807, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18066447973251343, "sampling/sampling_logp_difference/max": 2.199256181716919, "sampling/importance_sampling_ratio/min": 0.11088559776544571, "sampling/importance_sampling_ratio/mean": 1.004384994506836, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7968593612313271, "clip_ratio/low_mean": 0.08449057955294847, "clip_ratio/low_min": 0.08449057955294847, "clip_ratio/high_mean": 0.05091132130473852, "clip_ratio/high_max": 0.05091132130473852, "clip_ratio/region_mean": 0.135401900857687, "reward_total_mean": 0.0951695591211319, "reward_meter_mean": 0.3148347735404968, "reward_meter_std": 0.33956053853034973, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.08625820279121399, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9812500476837158, "reward_count_floor_std": 0.025877466425299644, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.854625940322876, "reward_repeat_penalty_std": 0.11572480201721191, "reward_repeat_floor_mean": 0.9845839738845825, "reward_repeat_floor_std": 0.01062406413257122, "reward_near_duplicate_penalty_mean": 0.9577128291130066, "reward_near_duplicate_penalty_std": 0.02396639995276928, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8991890549659729, "reward_distinct_2_std": 0.08846036344766617, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.25670650601387024, "reward_total_composite_mean": 0.0951695591211319, "reward_total_composite_std": 0.12376604974269867} {"timestamp_utc": "2026-04-12T20:12:30Z", "mode": "train", "global_step": 1102, "epoch": 0.057996947529077414, "loss": 0.0697, "grad_norm": 16.103296279907227, "learning_rate": 6.663636363636365e-06, "num_tokens": 1964546.0, "completions/mean_length": 37.125, "completions/min_length": 34.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.125, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.6071222424507141, "rewards/meter/std": 0.37576961517333984, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5, "rewards/judge_quality/std": 0.22677868604660034, "rewards/repeat_penalty/mean": 0.8731639981269836, "rewards/repeat_penalty/std": 0.10080478340387344, "rewards/repeat_floor/mean": 0.9834874868392944, "rewards/repeat_floor/std": 0.012064182199537754, "rewards/near_duplicate_penalty/mean": 0.9238909482955933, "rewards/near_duplicate_penalty/std": 0.04522726312279701, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9433760643005371, "rewards/distinct_2/std": 0.0789896696805954, "rewards/total_composite/mean": 0.346088171005249, "rewards/total_composite/std": 0.27740663290023804, "reward": 0.346088171005249, "reward_std": 0.27740663290023804, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12328404933214188, "sampling/sampling_logp_difference/max": 2.982288122177124, "sampling/importance_sampling_ratio/min": 0.050676748156547546, "sampling/importance_sampling_ratio/mean": 0.9920760989189148, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6848688311874866, "clip_ratio/low_mean": 0.028126374119892716, "clip_ratio/low_min": 0.028126374119892716, "clip_ratio/high_mean": 0.035058798966929317, "clip_ratio/high_max": 0.035058798966929317, "clip_ratio/region_mean": 0.06318517308682203, "reward_total_mean": 0.346088171005249, "reward_meter_mean": 0.6071222424507141, "reward_meter_std": 0.37576961517333984, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8731639981269836, "reward_repeat_penalty_std": 0.10080478340387344, "reward_repeat_floor_mean": 0.9834874868392944, "reward_repeat_floor_std": 0.012064182199537754, "reward_near_duplicate_penalty_mean": 0.9238909482955933, "reward_near_duplicate_penalty_std": 0.04522726312279701, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9433760643005371, "reward_distinct_2_std": 0.0789896696805954, "reward_judge_quality_mean": 0.5, "reward_judge_quality_std": 0.22677868604660034, "reward_total_composite_mean": 0.346088171005249, "reward_total_composite_std": 0.27740663290023804} {"timestamp_utc": "2026-04-12T20:12:43Z", "mode": "train", "global_step": 1103, "epoch": 0.058049576338087466, "loss": -0.045, "grad_norm": 7.793649196624756, "learning_rate": 6.660606060606061e-06, "num_tokens": 1966979.0, "completions/mean_length": 117.125, "completions/min_length": 103.0, "completions/max_length": 143.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 117.125, "completions/min_terminated_length": 103.0, "completions/max_terminated_length": 143.0, "rewards/meter/mean": 0.9205447435379028, "rewards/meter/std": 0.10239286720752716, "rewards/count_adherence/mean": 0.734375, "rewards/count_adherence/std": 0.04419417306780815, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9203125238418579, "rewards/count_floor/std": 0.013258260674774647, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.2935946583747864, "rewards/repeat_penalty/std": 0.20078925788402557, "rewards/repeat_floor/mean": 0.9082276821136475, "rewards/repeat_floor/std": 0.03151927888393402, "rewards/near_duplicate_penalty/mean": 0.7923674583435059, "rewards/near_duplicate_penalty/std": 0.07853700965642929, "rewards/opening_diversity/mean": 0.853365421295166, "rewards/opening_diversity/std": 0.1527043879032135, "rewards/distinct_2/mean": 0.42411795258522034, "rewards/distinct_2/std": 0.15901106595993042, "rewards/total_composite/mean": 0.16899530589580536, "rewards/total_composite/std": 0.07099603861570358, "reward": 0.16899530589580536, "reward_std": 0.07099603861570358, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11038536578416824, "sampling/sampling_logp_difference/max": 3.053380250930786, "sampling/importance_sampling_ratio/min": 0.04719911143183708, "sampling/importance_sampling_ratio/mean": 1.017039179801941, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4790477119386196, "clip_ratio/low_mean": 0.04311941610649228, "clip_ratio/low_min": 0.04311941610649228, "clip_ratio/high_mean": 0.03171086683869362, "clip_ratio/high_max": 0.03171086683869362, "clip_ratio/region_mean": 0.0748302829451859, "reward_total_mean": 0.16899530589580536, "reward_meter_mean": 0.9205447435379028, "reward_meter_std": 0.10239286720752716, "reward_count_adherence_mean": 0.734375, "reward_count_adherence_std": 0.04419417306780815, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9203125238418579, "reward_count_floor_std": 0.013258260674774647, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.2935946583747864, "reward_repeat_penalty_std": 0.20078925788402557, "reward_repeat_floor_mean": 0.9082276821136475, "reward_repeat_floor_std": 0.03151927888393402, "reward_near_duplicate_penalty_mean": 0.7923674583435059, "reward_near_duplicate_penalty_std": 0.07853700965642929, "reward_opening_diversity_mean": 0.853365421295166, "reward_opening_diversity_std": 0.1527043879032135, "reward_distinct_2_mean": 0.42411795258522034, "reward_distinct_2_std": 0.15901106595993042, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.16899530589580536, "reward_total_composite_std": 0.07099603861570358} {"timestamp_utc": "2026-04-12T20:12:57Z", "mode": "train", "global_step": 1104, "epoch": 0.05810220514709752, "loss": -0.0347, "grad_norm": 1.6550719738006592, "learning_rate": 6.657575757575758e-06, "num_tokens": 1968518.0, "completions/mean_length": 282.375, "completions/min_length": 39.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 52.75, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.529358983039856, "rewards/meter/std": 0.44651857018470764, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.8022055625915527, "rewards/lexical_plausibility/std": 0.21344909071922302, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.16850179433822632, "rewards/repeat_penalty/mean": 0.9030297994613647, "rewards/repeat_penalty/std": 0.21560585498809814, "rewards/repeat_floor/mean": 0.9895449280738831, "rewards/repeat_floor/std": 0.02082372084259987, "rewards/near_duplicate_penalty/mean": 0.9677215218544006, "rewards/near_duplicate_penalty/std": 0.03597903996706009, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9376299381256104, "rewards/distinct_2/std": 0.17640918493270874, "rewards/total_composite/mean": 0.0933130607008934, "rewards/total_composite/std": 0.13378001749515533, "reward": 0.0933130607008934, "reward_std": 0.13378001749515533, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1530848741531372, "sampling/sampling_logp_difference/max": 1.1004223823547363, "sampling/importance_sampling_ratio/min": 0.3327305018901825, "sampling/importance_sampling_ratio/mean": 1.011047601699829, "sampling/importance_sampling_ratio/max": 1.9163264036178589, "entropy": 0.6772729009389877, "clip_ratio/low_mean": 0.033603766933083534, "clip_ratio/low_min": 0.033603766933083534, "clip_ratio/high_mean": 0.043729523196816444, "clip_ratio/high_max": 0.043729523196816444, "clip_ratio/region_mean": 0.07733329012989998, "reward_total_mean": 0.0933130607008934, "reward_meter_mean": 0.529358983039856, "reward_meter_std": 0.44651857018470764, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.8022055625915527, "reward_lexical_plausibility_std": 0.21344909071922302, "reward_repeat_penalty_mean": 0.9030297994613647, "reward_repeat_penalty_std": 0.21560585498809814, "reward_repeat_floor_mean": 0.9895449280738831, "reward_repeat_floor_std": 0.02082372084259987, "reward_near_duplicate_penalty_mean": 0.9677215218544006, "reward_near_duplicate_penalty_std": 0.03597903996706009, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9376299381256104, "reward_distinct_2_std": 0.17640918493270874, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.16850179433822632, "reward_total_composite_mean": 0.0933130607008934, "reward_total_composite_std": 0.13378001749515533} {"timestamp_utc": "2026-04-12T20:13:06Z", "mode": "train", "global_step": 1105, "epoch": 0.05815483395610757, "loss": 0.0401, "grad_norm": 13.847715377807617, "learning_rate": 6.654545454545455e-06, "num_tokens": 1970547.0, "completions/mean_length": 74.625, "completions/min_length": 61.0, "completions/max_length": 92.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 74.625, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.4378034770488739, "rewards/meter/std": 0.34693700075149536, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.953125, "rewards/count_floor/std": 0.0388161838054657, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.6074966192245483, "rewards/repeat_penalty/std": 0.21280565857887268, "rewards/repeat_floor/mean": 0.9571378827095032, "rewards/repeat_floor/std": 0.02454056590795517, "rewards/near_duplicate_penalty/mean": 0.9023202061653137, "rewards/near_duplicate_penalty/std": 0.04660462960600853, "rewards/opening_diversity/mean": 0.8095238208770752, "rewards/opening_diversity/std": 0.16274075210094452, "rewards/distinct_2/mean": 0.8135380744934082, "rewards/distinct_2/std": 0.13743402063846588, "rewards/total_composite/mean": 0.14529544115066528, "rewards/total_composite/std": 0.13355346024036407, "reward": 0.14529544115066528, "reward_std": 0.13355346024036407, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13097421824932098, "sampling/sampling_logp_difference/max": 1.811705470085144, "sampling/importance_sampling_ratio/min": 0.16337527334690094, "sampling/importance_sampling_ratio/mean": 1.002448558807373, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6577684804797173, "clip_ratio/low_mean": 0.11290837451815605, "clip_ratio/low_min": 0.11290837451815605, "clip_ratio/high_mean": 0.03404602035880089, "clip_ratio/high_max": 0.03404602035880089, "clip_ratio/region_mean": 0.14695439487695694, "reward_total_mean": 0.14529544115066528, "reward_meter_mean": 0.4378034770488739, "reward_meter_std": 0.34693700075149536, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.953125, "reward_count_floor_std": 0.0388161838054657, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6074966192245483, "reward_repeat_penalty_std": 0.21280565857887268, "reward_repeat_floor_mean": 0.9571378827095032, "reward_repeat_floor_std": 0.02454056590795517, "reward_near_duplicate_penalty_mean": 0.9023202061653137, "reward_near_duplicate_penalty_std": 0.04660462960600853, "reward_opening_diversity_mean": 0.8095238208770752, "reward_opening_diversity_std": 0.16274075210094452, "reward_distinct_2_mean": 0.8135380744934082, "reward_distinct_2_std": 0.13743402063846588, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.14529544115066528, "reward_total_composite_std": 0.13355346024036407} {"timestamp_utc": "2026-04-12T20:13:20Z", "mode": "train", "global_step": 1106, "epoch": 0.058207462765117624, "loss": -0.0468, "grad_norm": 2.429562568664551, "learning_rate": 6.651515151515152e-06, "num_tokens": 1972096.0, "completions/mean_length": 154.625, "completions/min_length": 30.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 35.5, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.5942372679710388, "rewards/meter/std": 0.3154802918434143, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8606337308883667, "rewards/lexical_plausibility/std": 0.17988498508930206, "rewards/judge_quality/mean": 0.13750000298023224, "rewards/judge_quality/std": 0.06408699601888657, "rewards/repeat_penalty/mean": 0.5485076308250427, "rewards/repeat_penalty/std": 0.28671008348464966, "rewards/repeat_floor/mean": 0.9438349008560181, "rewards/repeat_floor/std": 0.04892116039991379, "rewards/near_duplicate_penalty/mean": 0.8530266880989075, "rewards/near_duplicate_penalty/std": 0.14666646718978882, "rewards/opening_diversity/mean": 0.71875, "rewards/opening_diversity/std": 0.23857837915420532, "rewards/distinct_2/mean": 0.8083994388580322, "rewards/distinct_2/std": 0.17643962800502777, "rewards/total_composite/mean": 0.08410358428955078, "rewards/total_composite/std": 0.0748651921749115, "reward": 0.08410358428955078, "reward_std": 0.0748651847243309, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15047846734523773, "sampling/sampling_logp_difference/max": 1.846886157989502, "sampling/importance_sampling_ratio/min": 0.27108946442604065, "sampling/importance_sampling_ratio/mean": 1.0167381763458252, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.640695109963417, "clip_ratio/low_mean": 0.03189586754888296, "clip_ratio/low_min": 0.03189586754888296, "clip_ratio/high_mean": 0.06710030417889357, "clip_ratio/high_max": 0.06710030417889357, "clip_ratio/region_mean": 0.09899617172777653, "reward_total_mean": 0.08410358428955078, "reward_meter_mean": 0.5942372679710388, "reward_meter_std": 0.3154802918434143, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8606337308883667, "reward_lexical_plausibility_std": 0.17988498508930206, "reward_repeat_penalty_mean": 0.5485076308250427, "reward_repeat_penalty_std": 0.28671008348464966, "reward_repeat_floor_mean": 0.9438349008560181, "reward_repeat_floor_std": 0.04892116039991379, "reward_near_duplicate_penalty_mean": 0.8530266880989075, "reward_near_duplicate_penalty_std": 0.14666646718978882, "reward_opening_diversity_mean": 0.71875, "reward_opening_diversity_std": 0.23857837915420532, "reward_distinct_2_mean": 0.8083994388580322, "reward_distinct_2_std": 0.17643962800502777, "reward_judge_quality_mean": 0.13750000298023224, "reward_judge_quality_std": 0.06408699601888657, "reward_total_composite_mean": 0.08410358428955078, "reward_total_composite_std": 0.0748651921749115} {"timestamp_utc": "2026-04-12T20:13:34Z", "mode": "train", "global_step": 1107, "epoch": 0.058260091574127676, "loss": -0.1244, "grad_norm": 2.0914509296417236, "learning_rate": 6.6484848484848485e-06, "num_tokens": 1973872.0, "completions/mean_length": 297.0, "completions/min_length": 69.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 82.0, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.42121458053588867, "rewards/meter/std": 0.33367618918418884, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.10690449178218842, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9399999976158142, "rewards/count_floor/std": 0.03207135200500488, "rewards/lexical_plausibility/mean": 0.8283407092094421, "rewards/lexical_plausibility/std": 0.18677712976932526, "rewards/judge_quality/mean": 0.16249999403953552, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.828485369682312, "rewards/repeat_penalty/std": 0.15440241992473602, "rewards/repeat_floor/mean": 0.9807182550430298, "rewards/repeat_floor/std": 0.0176449753344059, "rewards/near_duplicate_penalty/mean": 0.9299378395080566, "rewards/near_duplicate_penalty/std": 0.049431342631578445, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9077373743057251, "rewards/distinct_2/std": 0.11320017278194427, "rewards/total_composite/mean": 0.06908316910266876, "rewards/total_composite/std": 0.06482606381177902, "reward": 0.06908316910266876, "reward_std": 0.06482606381177902, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14990414679050446, "sampling/sampling_logp_difference/max": 1.4901032447814941, "sampling/importance_sampling_ratio/min": 0.22534939646720886, "sampling/importance_sampling_ratio/mean": 1.0324369668960571, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4034942016005516, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.05423634499311447, "clip_ratio/high_max": 0.05423634499311447, "clip_ratio/region_mean": 0.05423634499311447, "reward_total_mean": 0.06908316910266876, "reward_meter_mean": 0.42121458053588867, "reward_meter_std": 0.33367618918418884, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.10690449178218842, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9399999976158142, "reward_count_floor_std": 0.03207135200500488, "reward_lexical_plausibility_mean": 0.8283407092094421, "reward_lexical_plausibility_std": 0.18677712976932526, "reward_repeat_penalty_mean": 0.828485369682312, "reward_repeat_penalty_std": 0.15440241992473602, "reward_repeat_floor_mean": 0.9807182550430298, "reward_repeat_floor_std": 0.0176449753344059, "reward_near_duplicate_penalty_mean": 0.9299378395080566, "reward_near_duplicate_penalty_std": 0.049431342631578445, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9077373743057251, "reward_distinct_2_std": 0.11320017278194427, "reward_judge_quality_mean": 0.16249999403953552, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.06908316910266876, "reward_total_composite_std": 0.06482606381177902} {"timestamp_utc": "2026-04-12T20:13:45Z", "mode": "train", "global_step": 1108, "epoch": 0.05831272038313773, "loss": -0.0446, "grad_norm": 16.983863830566406, "learning_rate": 6.645454545454546e-06, "num_tokens": 1975255.0, "completions/mean_length": 18.875, "completions/min_length": 16.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.875, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.9133576154708862, "rewards/meter/std": 0.15169987082481384, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.2620250880718231, "rewards/repeat_penalty/mean": 0.6188226342201233, "rewards/repeat_penalty/std": 0.2549654245376587, "rewards/repeat_floor/mean": 0.9648507833480835, "rewards/repeat_floor/std": 0.03714272007346153, "rewards/near_duplicate_penalty/mean": 0.9275311231613159, "rewards/near_duplicate_penalty/std": 0.1134401336312294, "rewards/opening_diversity/mean": 0.65625, "rewards/opening_diversity/std": 0.2651650309562683, "rewards/distinct_2/mean": 0.9594017267227173, "rewards/distinct_2/std": 0.07531212270259857, "rewards/total_composite/mean": 0.47816914319992065, "rewards/total_composite/std": 0.2793678641319275, "reward": 0.47816914319992065, "reward_std": 0.2793678343296051, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10533981770277023, "sampling/sampling_logp_difference/max": 1.3286073207855225, "sampling/importance_sampling_ratio/min": 0.2648458480834961, "sampling/importance_sampling_ratio/mean": 1.033332109451294, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6206137649714947, "clip_ratio/low_mean": 0.0996563108637929, "clip_ratio/low_min": 0.0996563108637929, "clip_ratio/high_mean": 0.017613636795431376, "clip_ratio/high_max": 0.017613636795431376, "clip_ratio/region_mean": 0.11726994765922427, "reward_total_mean": 0.47816914319992065, "reward_meter_mean": 0.9133576154708862, "reward_meter_std": 0.15169987082481384, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6188226342201233, "reward_repeat_penalty_std": 0.2549654245376587, "reward_repeat_floor_mean": 0.9648507833480835, "reward_repeat_floor_std": 0.03714272007346153, "reward_near_duplicate_penalty_mean": 0.9275311231613159, "reward_near_duplicate_penalty_std": 0.1134401336312294, "reward_opening_diversity_mean": 0.65625, "reward_opening_diversity_std": 0.2651650309562683, "reward_distinct_2_mean": 0.9594017267227173, "reward_distinct_2_std": 0.07531212270259857, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.2620250880718231, "reward_total_composite_mean": 0.47816914319992065, "reward_total_composite_std": 0.2793678641319275} {"timestamp_utc": "2026-04-12T20:13:58Z", "mode": "train", "global_step": 1109, "epoch": 0.05836534919214778, "loss": -0.0999, "grad_norm": 2.0615975856781006, "learning_rate": 6.642424242424242e-06, "num_tokens": 1976866.0, "completions/mean_length": 162.375, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 45.833335876464844, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.8475849032402039, "rewards/meter/std": 0.21688300371170044, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9197299480438232, "rewards/lexical_plausibility/std": 0.15040437877178192, "rewards/judge_quality/mean": 0.3687499761581421, "rewards/judge_quality/std": 0.24192309379577637, "rewards/repeat_penalty/mean": 0.9483822584152222, "rewards/repeat_penalty/std": 0.07223664969205856, "rewards/repeat_floor/mean": 0.9929223656654358, "rewards/repeat_floor/std": 0.009071624837815762, "rewards/near_duplicate_penalty/mean": 0.9620465040206909, "rewards/near_duplicate_penalty/std": 0.03764668107032776, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9846153855323792, "rewards/distinct_2/std": 0.04351425915956497, "rewards/total_composite/mean": 0.28844931721687317, "rewards/total_composite/std": 0.18522420525550842, "reward": 0.28844931721687317, "reward_std": 0.18522420525550842, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12053454667329788, "sampling/sampling_logp_difference/max": 1.2679967880249023, "sampling/importance_sampling_ratio/min": 0.28139474987983704, "sampling/importance_sampling_ratio/mean": 1.0279974937438965, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7419822961091995, "clip_ratio/low_mean": 0.02445652149617672, "clip_ratio/low_min": 0.02445652149617672, "clip_ratio/high_mean": 0.09371843561530113, "clip_ratio/high_max": 0.09371843561530113, "clip_ratio/region_mean": 0.11817495711147785, "reward_total_mean": 0.28844931721687317, "reward_meter_mean": 0.8475849032402039, "reward_meter_std": 0.21688300371170044, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9197299480438232, "reward_lexical_plausibility_std": 0.15040437877178192, "reward_repeat_penalty_mean": 0.9483822584152222, "reward_repeat_penalty_std": 0.07223664969205856, "reward_repeat_floor_mean": 0.9929223656654358, "reward_repeat_floor_std": 0.009071624837815762, "reward_near_duplicate_penalty_mean": 0.9620465040206909, "reward_near_duplicate_penalty_std": 0.03764668107032776, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9846153855323792, "reward_distinct_2_std": 0.04351425915956497, "reward_judge_quality_mean": 0.3687499761581421, "reward_judge_quality_std": 0.24192309379577637, "reward_total_composite_mean": 0.28844931721687317, "reward_total_composite_std": 0.18522420525550842} {"timestamp_utc": "2026-04-12T20:14:13Z", "mode": "train", "global_step": 1110, "epoch": 0.05841797800115783, "loss": -0.0794, "grad_norm": 2.9179773330688477, "learning_rate": 6.63939393939394e-06, "num_tokens": 1979022.0, "completions/mean_length": 183.5, "completions/min_length": 62.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 74.0, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 93.0, "rewards/meter/mean": 0.8318451642990112, "rewards/meter/std": 0.20805364847183228, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.04008918255567551, "rewards/lexical_plausibility/mean": 0.9160492420196533, "rewards/lexical_plausibility/std": 0.15560375154018402, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.8809946179389954, "rewards/repeat_penalty/std": 0.13774196803569794, "rewards/repeat_floor/mean": 0.985791802406311, "rewards/repeat_floor/std": 0.01610884815454483, "rewards/near_duplicate_penalty/mean": 0.9527111053466797, "rewards/near_duplicate_penalty/std": 0.04578179493546486, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9209458231925964, "rewards/distinct_2/std": 0.11181499809026718, "rewards/total_composite/mean": 0.19155310094356537, "rewards/total_composite/std": 0.11219286173582077, "reward": 0.19155310094356537, "reward_std": 0.11219285428524017, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13830317556858063, "sampling/sampling_logp_difference/max": 3.227928638458252, "sampling/importance_sampling_ratio/min": 0.03963952139019966, "sampling/importance_sampling_ratio/mean": 1.014770746231079, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.59681037068367, "clip_ratio/low_mean": 0.03618951514363289, "clip_ratio/low_min": 0.03618951514363289, "clip_ratio/high_mean": 0.06465556658804417, "clip_ratio/high_max": 0.06465556658804417, "clip_ratio/region_mean": 0.10084508173167706, "reward_total_mean": 0.19155310094356537, "reward_meter_mean": 0.8318451642990112, "reward_meter_std": 0.20805364847183228, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.04008918255567551, "reward_lexical_plausibility_mean": 0.9160492420196533, "reward_lexical_plausibility_std": 0.15560375154018402, "reward_repeat_penalty_mean": 0.8809946179389954, "reward_repeat_penalty_std": 0.13774196803569794, "reward_repeat_floor_mean": 0.985791802406311, "reward_repeat_floor_std": 0.01610884815454483, "reward_near_duplicate_penalty_mean": 0.9527111053466797, "reward_near_duplicate_penalty_std": 0.04578179493546486, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9209458231925964, "reward_distinct_2_std": 0.11181499809026718, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.19155310094356537, "reward_total_composite_std": 0.11219286173582077} {"timestamp_utc": "2026-04-12T20:14:27Z", "mode": "train", "global_step": 1111, "epoch": 0.058470606810167886, "loss": -0.0628, "grad_norm": 5.7866668701171875, "learning_rate": 6.6363636363636375e-06, "num_tokens": 1981067.0, "completions/mean_length": 119.625, "completions/min_length": 52.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 63.57143020629883, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.3348644971847534, "rewards/meter/std": 0.2584976553916931, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9496723413467407, "rewards/lexical_plausibility/std": 0.14234818518161774, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.7817235589027405, "rewards/repeat_penalty/std": 0.1948297768831253, "rewards/repeat_floor/mean": 0.9792885184288025, "rewards/repeat_floor/std": 0.01848774217069149, "rewards/near_duplicate_penalty/mean": 0.9541678428649902, "rewards/near_duplicate_penalty/std": 0.036467552185058594, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.8514680862426758, "rewards/distinct_2/std": 0.13727322220802307, "rewards/total_composite/mean": 0.06865432113409042, "rewards/total_composite/std": 0.05735473707318306, "reward": 0.06865432113409042, "reward_std": 0.05735473707318306, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15230675041675568, "sampling/sampling_logp_difference/max": 1.7144007682800293, "sampling/importance_sampling_ratio/min": 0.18007159233093262, "sampling/importance_sampling_ratio/mean": 1.015440583229065, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7344888225197792, "clip_ratio/low_mean": 0.036706872284412384, "clip_ratio/low_min": 0.036706872284412384, "clip_ratio/high_mean": 0.06962484121322632, "clip_ratio/high_max": 0.06962484121322632, "clip_ratio/region_mean": 0.1063317134976387, "reward_total_mean": 0.06865432113409042, "reward_meter_mean": 0.3348644971847534, "reward_meter_std": 0.2584976553916931, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9496723413467407, "reward_lexical_plausibility_std": 0.14234818518161774, "reward_repeat_penalty_mean": 0.7817235589027405, "reward_repeat_penalty_std": 0.1948297768831253, "reward_repeat_floor_mean": 0.9792885184288025, "reward_repeat_floor_std": 0.01848774217069149, "reward_near_duplicate_penalty_mean": 0.9541678428649902, "reward_near_duplicate_penalty_std": 0.036467552185058594, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.8514680862426758, "reward_distinct_2_std": 0.13727322220802307, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.06865432113409042, "reward_total_composite_std": 0.05735473707318306} {"timestamp_utc": "2026-04-12T20:14:41Z", "mode": "train", "global_step": 1112, "epoch": 0.05852323561917794, "loss": -0.0805, "grad_norm": 4.035440444946289, "learning_rate": 6.633333333333334e-06, "num_tokens": 1982990.0, "completions/mean_length": 128.375, "completions/min_length": 62.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 73.5714340209961, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.8845691680908203, "rewards/meter/std": 0.22545692324638367, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.9690029621124268, "rewards/lexical_plausibility/std": 0.08767286688089371, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.9531344175338745, "rewards/repeat_penalty/std": 0.06168410927057266, "rewards/repeat_floor/mean": 0.9945938587188721, "rewards/repeat_floor/std": 0.00690901093184948, "rewards/near_duplicate_penalty/mean": 0.982026219367981, "rewards/near_duplicate_penalty/std": 0.020426368340849876, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9698881506919861, "rewards/distinct_2/std": 0.0463474802672863, "rewards/total_composite/mean": 0.15288014709949493, "rewards/total_composite/std": 0.08371905237436295, "reward": 0.15288014709949493, "reward_std": 0.08371905237436295, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14734318852424622, "sampling/sampling_logp_difference/max": 3.514888286590576, "sampling/importance_sampling_ratio/min": 0.0297511275857687, "sampling/importance_sampling_ratio/mean": 1.0045669078826904, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7673340141773224, "clip_ratio/low_mean": 0.07881138427183032, "clip_ratio/low_min": 0.07881138427183032, "clip_ratio/high_mean": 0.01809210516512394, "clip_ratio/high_max": 0.01809210516512394, "clip_ratio/region_mean": 0.09690348943695426, "reward_total_mean": 0.15288014709949493, "reward_meter_mean": 0.8845691680908203, "reward_meter_std": 0.22545692324638367, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.9690029621124268, "reward_lexical_plausibility_std": 0.08767286688089371, "reward_repeat_penalty_mean": 0.9531344175338745, "reward_repeat_penalty_std": 0.06168410927057266, "reward_repeat_floor_mean": 0.9945938587188721, "reward_repeat_floor_std": 0.00690901093184948, "reward_near_duplicate_penalty_mean": 0.982026219367981, "reward_near_duplicate_penalty_std": 0.020426368340849876, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9698881506919861, "reward_distinct_2_std": 0.0463474802672863, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.15288014709949493, "reward_total_composite_std": 0.08371905237436295} {"timestamp_utc": "2026-04-12T20:14:55Z", "mode": "train", "global_step": 1113, "epoch": 0.05857586442818799, "loss": -0.0504, "grad_norm": 2.941549301147461, "learning_rate": 6.630303030303031e-06, "num_tokens": 1984514.0, "completions/mean_length": 160.5, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 43.333335876464844, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.4371984004974365, "rewards/meter/std": 0.45407575368881226, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9062854647636414, "rewards/lexical_plausibility/std": 0.17460642755031586, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.16850179433822632, "rewards/repeat_penalty/mean": 0.9275883436203003, "rewards/repeat_penalty/std": 0.04702247679233551, "rewards/repeat_floor/mean": 0.9904555082321167, "rewards/repeat_floor/std": 0.006308635696768761, "rewards/near_duplicate_penalty/mean": 0.9515511989593506, "rewards/near_duplicate_penalty/std": 0.03600221872329712, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9746977686882019, "rewards/distinct_2/std": 0.029676247388124466, "rewards/total_composite/mean": 0.16044147312641144, "rewards/total_composite/std": 0.18030868470668793, "reward": 0.16044147312641144, "reward_std": 0.18030866980552673, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1451808214187622, "sampling/sampling_logp_difference/max": 1.1717987060546875, "sampling/importance_sampling_ratio/min": 0.325014591217041, "sampling/importance_sampling_ratio/mean": 1.0261509418487549, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7441493943333626, "clip_ratio/low_mean": 0.06391768157482147, "clip_ratio/low_min": 0.06391768157482147, "clip_ratio/high_mean": 0.0580859649926424, "clip_ratio/high_max": 0.0580859649926424, "clip_ratio/region_mean": 0.12200364656746387, "reward_total_mean": 0.16044147312641144, "reward_meter_mean": 0.4371984004974365, "reward_meter_std": 0.45407575368881226, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9062854647636414, "reward_lexical_plausibility_std": 0.17460642755031586, "reward_repeat_penalty_mean": 0.9275883436203003, "reward_repeat_penalty_std": 0.04702247679233551, "reward_repeat_floor_mean": 0.9904555082321167, "reward_repeat_floor_std": 0.006308635696768761, "reward_near_duplicate_penalty_mean": 0.9515511989593506, "reward_near_duplicate_penalty_std": 0.03600221872329712, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9746977686882019, "reward_distinct_2_std": 0.029676247388124466, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.16850179433822632, "reward_total_composite_mean": 0.16044147312641144, "reward_total_composite_std": 0.18030868470668793} {"timestamp_utc": "2026-04-12T20:15:05Z", "mode": "train", "global_step": 1114, "epoch": 0.05862849323719804, "loss": 0.0633, "grad_norm": 14.003056526184082, "learning_rate": 6.627272727272728e-06, "num_tokens": 1986178.0, "completions/mean_length": 48.0, "completions/min_length": 43.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 48.0, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.4023730754852295, "rewards/meter/std": 0.42862024903297424, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.8969141840934753, "rewards/repeat_penalty/std": 0.14449533820152283, "rewards/repeat_floor/mean": 0.9900321960449219, "rewards/repeat_floor/std": 0.011697766371071339, "rewards/near_duplicate_penalty/mean": 0.9690596461296082, "rewards/near_duplicate_penalty/std": 0.02286618761718273, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9824812412261963, "rewards/distinct_2/std": 0.03248300403356552, "rewards/total_composite/mean": 0.17937220633029938, "rewards/total_composite/std": 0.17441724240779877, "reward": 0.17937220633029938, "reward_std": 0.17441724240779877, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1410696804523468, "sampling/sampling_logp_difference/max": 1.538599967956543, "sampling/importance_sampling_ratio/min": 0.2773173451423645, "sampling/importance_sampling_ratio/mean": 1.0401309728622437, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1267013922333717, "clip_ratio/low_mean": 0.0674998564645648, "clip_ratio/low_min": 0.0674998564645648, "clip_ratio/high_mean": 0.07219608779996634, "clip_ratio/high_max": 0.07219608779996634, "clip_ratio/region_mean": 0.13969594426453114, "reward_total_mean": 0.17937220633029938, "reward_meter_mean": 0.4023730754852295, "reward_meter_std": 0.42862024903297424, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8969141840934753, "reward_repeat_penalty_std": 0.14449533820152283, "reward_repeat_floor_mean": 0.9900321960449219, "reward_repeat_floor_std": 0.011697766371071339, "reward_near_duplicate_penalty_mean": 0.9690596461296082, "reward_near_duplicate_penalty_std": 0.02286618761718273, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9824812412261963, "reward_distinct_2_std": 0.03248300403356552, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.17937220633029938, "reward_total_composite_std": 0.17441724240779877} {"timestamp_utc": "2026-04-12T20:15:13Z", "mode": "train", "global_step": 1115, "epoch": 0.058681122046208095, "loss": 0.0144, "grad_norm": 17.99871826171875, "learning_rate": 6.624242424242425e-06, "num_tokens": 1987665.0, "completions/mean_length": 20.875, "completions/min_length": 19.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.875, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.6114475727081299, "rewards/meter/std": 0.33778610825538635, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.7137500047683716, "rewards/judge_quality/std": 0.31536543369293213, "rewards/repeat_penalty/mean": 0.6896699666976929, "rewards/repeat_penalty/std": 0.08575751632452011, "rewards/repeat_floor/mean": 0.973910927772522, "rewards/repeat_floor/std": 0.016552619636058807, "rewards/near_duplicate_penalty/mean": 0.9365619421005249, "rewards/near_duplicate_penalty/std": 0.11026822775602341, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.46602147817611694, "rewards/total_composite/std": 0.32216310501098633, "reward": 0.46602147817611694, "reward_std": 0.32216310501098633, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08904021233320236, "sampling/sampling_logp_difference/max": 1.1270697116851807, "sampling/importance_sampling_ratio/min": 0.32398122549057007, "sampling/importance_sampling_ratio/mean": 1.0219746828079224, "sampling/importance_sampling_ratio/max": 1.7735116481781006, "entropy": 0.6939110308885574, "clip_ratio/low_mean": 0.06235047848895192, "clip_ratio/low_min": 0.06235047848895192, "clip_ratio/high_mean": 0.02949134260416031, "clip_ratio/high_max": 0.02949134260416031, "clip_ratio/region_mean": 0.09184182109311223, "reward_total_mean": 0.46602147817611694, "reward_meter_mean": 0.6114475727081299, "reward_meter_std": 0.33778610825538635, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.6896699666976929, "reward_repeat_penalty_std": 0.08575751632452011, "reward_repeat_floor_mean": 0.973910927772522, "reward_repeat_floor_std": 0.016552619636058807, "reward_near_duplicate_penalty_mean": 0.9365619421005249, "reward_near_duplicate_penalty_std": 0.11026822775602341, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.7137500047683716, "reward_judge_quality_std": 0.31536543369293213, "reward_total_composite_mean": 0.46602147817611694, "reward_total_composite_std": 0.32216310501098633} {"timestamp_utc": "2026-04-12T20:15:22Z", "mode": "train", "global_step": 1116, "epoch": 0.05873375085521815, "loss": 0.0012, "grad_norm": 9.764896392822266, "learning_rate": 6.621212121212121e-06, "num_tokens": 1990171.0, "completions/mean_length": 106.25, "completions/min_length": 95.0, "completions/max_length": 125.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 106.25, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 125.0, "rewards/meter/mean": 0.5923319458961487, "rewards/meter/std": 0.1939777135848999, "rewards/count_adherence/mean": 0.7777777910232544, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9333333373069763, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.22500000894069672, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.7661954760551453, "rewards/repeat_penalty/std": 0.12541718780994415, "rewards/repeat_floor/mean": 0.9736922979354858, "rewards/repeat_floor/std": 0.014339100569486618, "rewards/near_duplicate_penalty/mean": 0.9339008331298828, "rewards/near_duplicate_penalty/std": 0.03763081878423691, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8178571462631226, "rewards/distinct_2/std": 0.11097404360771179, "rewards/total_composite/mean": 0.11490198969841003, "rewards/total_composite/std": 0.04570137336850166, "reward": 0.11490198969841003, "reward_std": 0.04570137336850166, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13520045578479767, "sampling/sampling_logp_difference/max": 4.625446319580078, "sampling/importance_sampling_ratio/min": 0.009799281135201454, "sampling/importance_sampling_ratio/mean": 1.0275001525878906, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5670370310544968, "clip_ratio/low_mean": 0.07349181175231934, "clip_ratio/low_min": 0.07349181175231934, "clip_ratio/high_mean": 0.059430984780192375, "clip_ratio/high_max": 0.059430984780192375, "clip_ratio/region_mean": 0.1329227965325117, "reward_total_mean": 0.11490198969841003, "reward_meter_mean": 0.5923319458961487, "reward_meter_std": 0.1939777135848999, "reward_count_adherence_mean": 0.7777777910232544, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9333333373069763, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7661954760551453, "reward_repeat_penalty_std": 0.12541718780994415, "reward_repeat_floor_mean": 0.9736922979354858, "reward_repeat_floor_std": 0.014339100569486618, "reward_near_duplicate_penalty_mean": 0.9339008331298828, "reward_near_duplicate_penalty_std": 0.03763081878423691, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8178571462631226, "reward_distinct_2_std": 0.11097404360771179, "reward_judge_quality_mean": 0.22500000894069672, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.11490198969841003, "reward_total_composite_std": 0.04570137336850166} {"timestamp_utc": "2026-04-12T20:15:31Z", "mode": "train", "global_step": 1117, "epoch": 0.0587863796642282, "loss": 0.0345, "grad_norm": 14.916417121887207, "learning_rate": 6.618181818181819e-06, "num_tokens": 1991890.0, "completions/mean_length": 37.875, "completions/min_length": 32.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.875, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.3961948752403259, "rewards/meter/std": 0.3561877906322479, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.923470139503479, "rewards/repeat_penalty/std": 0.07474140077829361, "rewards/repeat_floor/mean": 0.9925272464752197, "rewards/repeat_floor/std": 0.0037442089524120092, "rewards/near_duplicate_penalty/mean": 0.9748612642288208, "rewards/near_duplicate_penalty/std": 0.020294705405831337, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9797008037567139, "rewards/distinct_2/std": 0.037656061351299286, "rewards/total_composite/mean": 0.09380505234003067, "rewards/total_composite/std": 0.07677542418241501, "reward": 0.09380505234003067, "reward_std": 0.07677542418241501, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14778997004032135, "sampling/sampling_logp_difference/max": 0.9533829689025879, "sampling/importance_sampling_ratio/min": 0.38543492555618286, "sampling/importance_sampling_ratio/mean": 1.0124022960662842, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1333774775266647, "clip_ratio/low_mean": 0.0597513634711504, "clip_ratio/low_min": 0.0597513634711504, "clip_ratio/high_mean": 0.09166131168603897, "clip_ratio/high_max": 0.09166131168603897, "clip_ratio/region_mean": 0.15141267515718937, "reward_total_mean": 0.09380505234003067, "reward_meter_mean": 0.3961948752403259, "reward_meter_std": 0.3561877906322479, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.923470139503479, "reward_repeat_penalty_std": 0.07474140077829361, "reward_repeat_floor_mean": 0.9925272464752197, "reward_repeat_floor_std": 0.0037442089524120092, "reward_near_duplicate_penalty_mean": 0.9748612642288208, "reward_near_duplicate_penalty_std": 0.020294705405831337, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9797008037567139, "reward_distinct_2_std": 0.037656061351299286, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.09380505234003067, "reward_total_composite_std": 0.07677542418241501} {"timestamp_utc": "2026-04-12T20:15:45Z", "mode": "train", "global_step": 1118, "epoch": 0.05883900847323825, "loss": -0.0989, "grad_norm": 5.206904888153076, "learning_rate": 6.615151515151516e-06, "num_tokens": 1993986.0, "completions/mean_length": 143.0, "completions/min_length": 74.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 90.28572082519531, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.8414691090583801, "rewards/meter/std": 0.21675491333007812, "rewards/count_adherence/mean": 0.84375, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.953125, "rewards/count_floor/std": 0.0388161838054657, "rewards/lexical_plausibility/mean": 0.9532358646392822, "rewards/lexical_plausibility/std": 0.13226905465126038, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234977960587, "rewards/repeat_penalty/mean": 0.8449242115020752, "rewards/repeat_penalty/std": 0.14225640892982483, "rewards/repeat_floor/mean": 0.9826798439025879, "rewards/repeat_floor/std": 0.015020211227238178, "rewards/near_duplicate_penalty/mean": 0.9494950175285339, "rewards/near_duplicate_penalty/std": 0.030266793444752693, "rewards/opening_diversity/mean": 0.9642857313156128, "rewards/opening_diversity/std": 0.06613000482320786, "rewards/distinct_2/mean": 0.9155377149581909, "rewards/distinct_2/std": 0.07967370748519897, "rewards/total_composite/mean": 0.19605238735675812, "rewards/total_composite/std": 0.1010000929236412, "reward": 0.19605238735675812, "reward_std": 0.10100008547306061, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1536867618560791, "sampling/sampling_logp_difference/max": 3.0424208641052246, "sampling/importance_sampling_ratio/min": 0.04771922528743744, "sampling/importance_sampling_ratio/mean": 1.0013548135757446, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6599209234118462, "clip_ratio/low_mean": 0.04460963048040867, "clip_ratio/low_min": 0.04460963048040867, "clip_ratio/high_mean": 0.07997776567935944, "clip_ratio/high_max": 0.07997776567935944, "clip_ratio/region_mean": 0.1245873961597681, "reward_total_mean": 0.19605238735675812, "reward_meter_mean": 0.8414691090583801, "reward_meter_std": 0.21675491333007812, "reward_count_adherence_mean": 0.84375, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.953125, "reward_count_floor_std": 0.0388161838054657, "reward_lexical_plausibility_mean": 0.9532358646392822, "reward_lexical_plausibility_std": 0.13226905465126038, "reward_repeat_penalty_mean": 0.8449242115020752, "reward_repeat_penalty_std": 0.14225640892982483, "reward_repeat_floor_mean": 0.9826798439025879, "reward_repeat_floor_std": 0.015020211227238178, "reward_near_duplicate_penalty_mean": 0.9494950175285339, "reward_near_duplicate_penalty_std": 0.030266793444752693, "reward_opening_diversity_mean": 0.9642857313156128, "reward_opening_diversity_std": 0.06613000482320786, "reward_distinct_2_mean": 0.9155377149581909, "reward_distinct_2_std": 0.07967370748519897, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234977960587, "reward_total_composite_mean": 0.19605238735675812, "reward_total_composite_std": 0.1010000929236412} {"timestamp_utc": "2026-04-12T20:15:54Z", "mode": "train", "global_step": 1119, "epoch": 0.058891637282248305, "loss": 0.0072, "grad_norm": 15.530054092407227, "learning_rate": 6.612121212121213e-06, "num_tokens": 1995622.0, "completions/mean_length": 40.5, "completions/min_length": 38.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.5, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.6489101052284241, "rewards/meter/std": 0.32416361570358276, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5549999475479126, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.9871190190315247, "rewards/repeat_penalty/std": 0.0182426068931818, "rewards/repeat_floor/mean": 0.9980678558349609, "rewards/repeat_floor/std": 0.0027363866101950407, "rewards/near_duplicate_penalty/mean": 0.9871190190315247, "rewards/near_duplicate_penalty/std": 0.0182426068931818, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.32625383138656616, "rewards/total_composite/std": 0.19823554158210754, "reward": 0.32625383138656616, "reward_std": 0.19823555648326874, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10378772020339966, "sampling/sampling_logp_difference/max": 1.5988271236419678, "sampling/importance_sampling_ratio/min": 0.20213346183300018, "sampling/importance_sampling_ratio/mean": 1.0093050003051758, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.44540177285671234, "clip_ratio/low_mean": 0.029111534357070923, "clip_ratio/low_min": 0.029111534357070923, "clip_ratio/high_mean": 0.045524826273322105, "clip_ratio/high_max": 0.045524826273322105, "clip_ratio/region_mean": 0.07463636063039303, "reward_total_mean": 0.32625383138656616, "reward_meter_mean": 0.6489101052284241, "reward_meter_std": 0.32416361570358276, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9871190190315247, "reward_repeat_penalty_std": 0.0182426068931818, "reward_repeat_floor_mean": 0.9980678558349609, "reward_repeat_floor_std": 0.0027363866101950407, "reward_near_duplicate_penalty_mean": 0.9871190190315247, "reward_near_duplicate_penalty_std": 0.0182426068931818, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5549999475479126, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.32625383138656616, "reward_total_composite_std": 0.19823554158210754} {"timestamp_utc": "2026-04-12T20:16:08Z", "mode": "train", "global_step": 1120, "epoch": 0.05894426609125836, "loss": -0.0719, "grad_norm": 3.9804394245147705, "learning_rate": 6.609090909090909e-06, "num_tokens": 1997655.0, "completions/mean_length": 204.125, "completions/min_length": 87.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 101.5, "completions/min_terminated_length": 87.0, "completions/max_terminated_length": 110.0, "rewards/meter/mean": 0.25961464643478394, "rewards/meter/std": 0.34651073813438416, "rewards/count_adherence/mean": 0.7916666269302368, "rewards/count_adherence/std": 0.07715165615081787, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.023145509883761406, "rewards/lexical_plausibility/mean": 0.9188123941421509, "rewards/lexical_plausibility/std": 0.15209685266017914, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.8381876945495605, "rewards/repeat_penalty/std": 0.09057272970676422, "rewards/repeat_floor/mean": 0.9822417497634888, "rewards/repeat_floor/std": 0.009547477588057518, "rewards/near_duplicate_penalty/mean": 0.9560760259628296, "rewards/near_duplicate_penalty/std": 0.02068331465125084, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8758928775787354, "rewards/distinct_2/std": 0.08450737595558167, "rewards/total_composite/mean": 0.05883817374706268, "rewards/total_composite/std": 0.08443966507911682, "reward": 0.05883817374706268, "reward_std": 0.08443966507911682, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15302841365337372, "sampling/sampling_logp_difference/max": 2.613825798034668, "sampling/importance_sampling_ratio/min": 0.07325375080108643, "sampling/importance_sampling_ratio/mean": 0.9979686141014099, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7585892826318741, "clip_ratio/low_mean": 0.06769068352878094, "clip_ratio/low_min": 0.06769068352878094, "clip_ratio/high_mean": 0.05295042507350445, "clip_ratio/high_max": 0.05295042507350445, "clip_ratio/region_mean": 0.12064110860228539, "reward_total_mean": 0.05883817374706268, "reward_meter_mean": 0.25961464643478394, "reward_meter_std": 0.34651073813438416, "reward_count_adherence_mean": 0.7916666269302368, "reward_count_adherence_std": 0.07715165615081787, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.023145509883761406, "reward_lexical_plausibility_mean": 0.9188123941421509, "reward_lexical_plausibility_std": 0.15209685266017914, "reward_repeat_penalty_mean": 0.8381876945495605, "reward_repeat_penalty_std": 0.09057272970676422, "reward_repeat_floor_mean": 0.9822417497634888, "reward_repeat_floor_std": 0.009547477588057518, "reward_near_duplicate_penalty_mean": 0.9560760259628296, "reward_near_duplicate_penalty_std": 0.02068331465125084, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8758928775787354, "reward_distinct_2_std": 0.08450737595558167, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.05883817374706268, "reward_total_composite_std": 0.08443966507911682} {"timestamp_utc": "2026-04-12T20:16:24Z", "mode": "train", "global_step": 1121, "epoch": 0.05899689490026841, "loss": -0.1522, "grad_norm": 4.552389621734619, "learning_rate": 6.606060606060607e-06, "num_tokens": 2000529.0, "completions/mean_length": 184.25, "completions/min_length": 129.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 137.42857360839844, "completions/min_terminated_length": 129.0, "completions/max_terminated_length": 145.0, "rewards/meter/mean": 0.7251021862030029, "rewards/meter/std": 0.30393242835998535, "rewards/count_adherence/mean": 0.671875, "rewards/count_adherence/std": 0.13258251547813416, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9015624523162842, "rewards/count_floor/std": 0.03977476432919502, "rewards/lexical_plausibility/mean": 0.9584192037582397, "rewards/lexical_plausibility/std": 0.11760833859443665, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.8525344133377075, "rewards/repeat_penalty/std": 0.09830207377672195, "rewards/repeat_floor/mean": 0.9834234714508057, "rewards/repeat_floor/std": 0.010602456517517567, "rewards/near_duplicate_penalty/mean": 0.9542155861854553, "rewards/near_duplicate_penalty/std": 0.024001164361834526, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.892123818397522, "rewards/distinct_2/std": 0.08656427264213562, "rewards/total_composite/mean": 0.21732273697853088, "rewards/total_composite/std": 0.1142578274011612, "reward": 0.21732273697853088, "reward_std": 0.1142578199505806, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16900703310966492, "sampling/sampling_logp_difference/max": 2.089836597442627, "sampling/importance_sampling_ratio/min": 0.1237073540687561, "sampling/importance_sampling_ratio/mean": 1.0127708911895752, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7689536064863205, "clip_ratio/low_mean": 0.03640069626271725, "clip_ratio/low_min": 0.03640069626271725, "clip_ratio/high_mean": 0.09764457121491432, "clip_ratio/high_max": 0.09764457121491432, "clip_ratio/region_mean": 0.13404526747763157, "reward_total_mean": 0.21732273697853088, "reward_meter_mean": 0.7251021862030029, "reward_meter_std": 0.30393242835998535, "reward_count_adherence_mean": 0.671875, "reward_count_adherence_std": 0.13258251547813416, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9015624523162842, "reward_count_floor_std": 0.03977476432919502, "reward_lexical_plausibility_mean": 0.9584192037582397, "reward_lexical_plausibility_std": 0.11760833859443665, "reward_repeat_penalty_mean": 0.8525344133377075, "reward_repeat_penalty_std": 0.09830207377672195, "reward_repeat_floor_mean": 0.9834234714508057, "reward_repeat_floor_std": 0.010602456517517567, "reward_near_duplicate_penalty_mean": 0.9542155861854553, "reward_near_duplicate_penalty_std": 0.024001164361834526, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.892123818397522, "reward_distinct_2_std": 0.08656427264213562, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.21732273697853088, "reward_total_composite_std": 0.1142578274011612} {"timestamp_utc": "2026-04-12T20:16:37Z", "mode": "train", "global_step": 1122, "epoch": 0.05904952370927846, "loss": -0.0596, "grad_norm": 3.564344882965088, "learning_rate": 6.603030303030303e-06, "num_tokens": 2002157.0, "completions/mean_length": 166.5, "completions/min_length": 45.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 51.333335876464844, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.41081592440605164, "rewards/meter/std": 0.3736828565597534, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.2086307406425476, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9156250357627869, "rewards/count_floor/std": 0.06258922815322876, "rewards/lexical_plausibility/mean": 0.886710524559021, "rewards/lexical_plausibility/std": 0.15059080719947815, "rewards/judge_quality/mean": 0.3462499976158142, "rewards/judge_quality/std": 0.2840491831302643, "rewards/repeat_penalty/mean": 0.9600927233695984, "rewards/repeat_penalty/std": 0.05911032482981682, "rewards/repeat_floor/mean": 0.995184063911438, "rewards/repeat_floor/std": 0.006072294898331165, "rewards/near_duplicate_penalty/mean": 0.9801214933395386, "rewards/near_duplicate_penalty/std": 0.024099119007587433, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9796204566955566, "rewards/distinct_2/std": 0.05608870089054108, "rewards/total_composite/mean": 0.12884840369224548, "rewards/total_composite/std": 0.14484259486198425, "reward": 0.12884840369224548, "reward_std": 0.14484257996082306, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14707811176776886, "sampling/sampling_logp_difference/max": 2.2851123809814453, "sampling/importance_sampling_ratio/min": 0.10176262259483337, "sampling/importance_sampling_ratio/mean": 1.0025691986083984, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4895203188061714, "clip_ratio/low_mean": 0.06439827848225832, "clip_ratio/low_min": 0.06439827848225832, "clip_ratio/high_mean": 0.03513986058533192, "clip_ratio/high_max": 0.03513986058533192, "clip_ratio/region_mean": 0.09953813906759024, "reward_total_mean": 0.12884840369224548, "reward_meter_mean": 0.41081592440605164, "reward_meter_std": 0.3736828565597534, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.2086307406425476, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9156250357627869, "reward_count_floor_std": 0.06258922815322876, "reward_lexical_plausibility_mean": 0.886710524559021, "reward_lexical_plausibility_std": 0.15059080719947815, "reward_repeat_penalty_mean": 0.9600927233695984, "reward_repeat_penalty_std": 0.05911032482981682, "reward_repeat_floor_mean": 0.995184063911438, "reward_repeat_floor_std": 0.006072294898331165, "reward_near_duplicate_penalty_mean": 0.9801214933395386, "reward_near_duplicate_penalty_std": 0.024099119007587433, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9796204566955566, "reward_distinct_2_std": 0.05608870089054108, "reward_judge_quality_mean": 0.3462499976158142, "reward_judge_quality_std": 0.2840491831302643, "reward_total_composite_mean": 0.12884840369224548, "reward_total_composite_std": 0.14484259486198425} {"timestamp_utc": "2026-04-12T20:16:46Z", "mode": "train", "global_step": 1123, "epoch": 0.059102152518288514, "loss": 0.0776, "grad_norm": 13.980622291564941, "learning_rate": 6.600000000000001e-06, "num_tokens": 2003871.0, "completions/mean_length": 38.25, "completions/min_length": 31.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.25, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.8525334000587463, "rewards/meter/std": 0.3157230615615845, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.21999594569206238, "rewards/repeat_penalty/mean": 0.8316961526870728, "rewards/repeat_penalty/std": 0.23539437353610992, "rewards/repeat_floor/mean": 0.9764221906661987, "rewards/repeat_floor/std": 0.034281615167856216, "rewards/near_duplicate_penalty/mean": 0.9059597253799438, "rewards/near_duplicate_penalty/std": 0.10149959474802017, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9155916571617126, "rewards/distinct_2/std": 0.1588144749403, "rewards/total_composite/mean": 0.31011462211608887, "rewards/total_composite/std": 0.14059360325336456, "reward": 0.31011462211608887, "reward_std": 0.14059360325336456, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11450143158435822, "sampling/sampling_logp_difference/max": 2.1690657138824463, "sampling/importance_sampling_ratio/min": 0.11428434401750565, "sampling/importance_sampling_ratio/mean": 1.0173248052597046, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6251378655433655, "clip_ratio/low_mean": 0.012392900884151459, "clip_ratio/low_min": 0.012392900884151459, "clip_ratio/high_mean": 0.07436944916844368, "clip_ratio/high_max": 0.07436944916844368, "clip_ratio/region_mean": 0.08676235005259514, "reward_total_mean": 0.31011462211608887, "reward_meter_mean": 0.8525334000587463, "reward_meter_std": 0.3157230615615845, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8316961526870728, "reward_repeat_penalty_std": 0.23539437353610992, "reward_repeat_floor_mean": 0.9764221906661987, "reward_repeat_floor_std": 0.034281615167856216, "reward_near_duplicate_penalty_mean": 0.9059597253799438, "reward_near_duplicate_penalty_std": 0.10149959474802017, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9155916571617126, "reward_distinct_2_std": 0.1588144749403, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.21999594569206238, "reward_total_composite_mean": 0.31011462211608887, "reward_total_composite_std": 0.14059360325336456} {"timestamp_utc": "2026-04-12T20:16:56Z", "mode": "train", "global_step": 1124, "epoch": 0.05915478132729856, "loss": 0.0846, "grad_norm": 10.750117301940918, "learning_rate": 6.596969696969698e-06, "num_tokens": 2005713.0, "completions/mean_length": 59.25, "completions/min_length": 50.0, "completions/max_length": 70.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 59.25, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 70.0, "rewards/meter/mean": 0.7873080968856812, "rewards/meter/std": 0.27957883477211, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.34999996423721313, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.6102972030639648, "rewards/repeat_penalty/std": 0.1749582439661026, "rewards/repeat_floor/mean": 0.9612038731575012, "rewards/repeat_floor/std": 0.015765490010380745, "rewards/near_duplicate_penalty/mean": 0.9189068078994751, "rewards/near_duplicate_penalty/std": 0.023575618863105774, "rewards/opening_diversity/mean": 0.7633928656578064, "rewards/opening_diversity/std": 0.19274136424064636, "rewards/distinct_2/mean": 0.8618254661560059, "rewards/distinct_2/std": 0.044812317937612534, "rewards/total_composite/mean": 0.2615632116794586, "rewards/total_composite/std": 0.14510861039161682, "reward": 0.2615632116794586, "reward_std": 0.14510861039161682, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13254885375499725, "sampling/sampling_logp_difference/max": 2.096240520477295, "sampling/importance_sampling_ratio/min": 0.12291766703128815, "sampling/importance_sampling_ratio/mean": 0.9984291195869446, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6550969481468201, "clip_ratio/low_mean": 0.0359583692625165, "clip_ratio/low_min": 0.0359583692625165, "clip_ratio/high_mean": 0.09929751511663198, "clip_ratio/high_max": 0.09929751511663198, "clip_ratio/region_mean": 0.13525588437914848, "reward_total_mean": 0.2615632116794586, "reward_meter_mean": 0.7873080968856812, "reward_meter_std": 0.27957883477211, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6102972030639648, "reward_repeat_penalty_std": 0.1749582439661026, "reward_repeat_floor_mean": 0.9612038731575012, "reward_repeat_floor_std": 0.015765490010380745, "reward_near_duplicate_penalty_mean": 0.9189068078994751, "reward_near_duplicate_penalty_std": 0.023575618863105774, "reward_opening_diversity_mean": 0.7633928656578064, "reward_opening_diversity_std": 0.19274136424064636, "reward_distinct_2_mean": 0.8618254661560059, "reward_distinct_2_std": 0.044812317937612534, "reward_judge_quality_mean": 0.34999996423721313, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.2615632116794586, "reward_total_composite_std": 0.14510861039161682} {"timestamp_utc": "2026-04-12T20:17:05Z", "mode": "train", "global_step": 1125, "epoch": 0.05920741013630861, "loss": 0.0717, "grad_norm": 13.392807960510254, "learning_rate": 6.593939393939395e-06, "num_tokens": 2007246.0, "completions/mean_length": 31.625, "completions/min_length": 27.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.625, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.44038692116737366, "rewards/meter/std": 0.3768443167209625, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.1505940556526184, "rewards/repeat_penalty/mean": 0.8650407195091248, "rewards/repeat_penalty/std": 0.18009093403816223, "rewards/repeat_floor/mean": 0.9842195510864258, "rewards/repeat_floor/std": 0.020091760903596878, "rewards/near_duplicate_penalty/mean": 0.9507880210876465, "rewards/near_duplicate_penalty/std": 0.049686118960380554, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9275147914886475, "rewards/distinct_2/std": 0.10676814615726471, "rewards/total_composite/mean": 0.13445010781288147, "rewards/total_composite/std": 0.14371103048324585, "reward": 0.13445010781288147, "reward_std": 0.14371101558208466, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15485844016075134, "sampling/sampling_logp_difference/max": 1.4093377590179443, "sampling/importance_sampling_ratio/min": 0.24430501461029053, "sampling/importance_sampling_ratio/mean": 0.9953176975250244, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7089732997119427, "clip_ratio/low_mean": 0.055113638285547495, "clip_ratio/low_min": 0.055113638285547495, "clip_ratio/high_mean": 0.07573551312088966, "clip_ratio/high_max": 0.07573551312088966, "clip_ratio/region_mean": 0.13084915140643716, "reward_total_mean": 0.13445010781288147, "reward_meter_mean": 0.44038692116737366, "reward_meter_std": 0.3768443167209625, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8650407195091248, "reward_repeat_penalty_std": 0.18009093403816223, "reward_repeat_floor_mean": 0.9842195510864258, "reward_repeat_floor_std": 0.020091760903596878, "reward_near_duplicate_penalty_mean": 0.9507880210876465, "reward_near_duplicate_penalty_std": 0.049686118960380554, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9275147914886475, "reward_distinct_2_std": 0.10676814615726471, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.1505940556526184, "reward_total_composite_mean": 0.13445010781288147, "reward_total_composite_std": 0.14371103048324585} {"timestamp_utc": "2026-04-12T20:17:18Z", "mode": "train", "global_step": 1126, "epoch": 0.059260038945318665, "loss": -0.0392, "grad_norm": 4.587419033050537, "learning_rate": 6.590909090909091e-06, "num_tokens": 2008715.0, "completions/mean_length": 93.625, "completions/min_length": 22.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 33.85714340209961, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.7132863998413086, "rewards/meter/std": 0.3601767122745514, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9137206077575684, "rewards/lexical_plausibility/std": 0.18606792390346527, "rewards/judge_quality/mean": 0.6875, "rewards/judge_quality/std": 0.34964269399642944, "rewards/repeat_penalty/mean": 0.775210440158844, "rewards/repeat_penalty/std": 0.13890086114406586, "rewards/repeat_floor/mean": 0.9822299480438232, "rewards/repeat_floor/std": 0.015960371121764183, "rewards/near_duplicate_penalty/mean": 0.9657285809516907, "rewards/near_duplicate_penalty/std": 0.0695989653468132, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9846743941307068, "rewards/distinct_2/std": 0.04165209084749222, "rewards/total_composite/mean": 0.5038150548934937, "rewards/total_composite/std": 0.3079272210597992, "reward": 0.5038150548934937, "reward_std": 0.3079272210597992, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15248696506023407, "sampling/sampling_logp_difference/max": 1.5049519538879395, "sampling/importance_sampling_ratio/min": 0.2220279723405838, "sampling/importance_sampling_ratio/mean": 1.0120183229446411, "sampling/importance_sampling_ratio/max": 1.8857957124710083, "entropy": 0.8756452202796936, "clip_ratio/low_mean": 0.027657005470246077, "clip_ratio/low_min": 0.027657005470246077, "clip_ratio/high_mean": 0.05153837986290455, "clip_ratio/high_max": 0.05153837986290455, "clip_ratio/region_mean": 0.07919538533315063, "reward_total_mean": 0.5038150548934937, "reward_meter_mean": 0.7132863998413086, "reward_meter_std": 0.3601767122745514, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9137206077575684, "reward_lexical_plausibility_std": 0.18606792390346527, "reward_repeat_penalty_mean": 0.775210440158844, "reward_repeat_penalty_std": 0.13890086114406586, "reward_repeat_floor_mean": 0.9822299480438232, "reward_repeat_floor_std": 0.015960371121764183, "reward_near_duplicate_penalty_mean": 0.9657285809516907, "reward_near_duplicate_penalty_std": 0.0695989653468132, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9846743941307068, "reward_distinct_2_std": 0.04165209084749222, "reward_judge_quality_mean": 0.6875, "reward_judge_quality_std": 0.34964269399642944, "reward_total_composite_mean": 0.5038150548934937, "reward_total_composite_std": 0.3079272210597992} {"timestamp_utc": "2026-04-12T20:17:27Z", "mode": "train", "global_step": 1127, "epoch": 0.05931266775432872, "loss": 0.0048, "grad_norm": 30.975505828857422, "learning_rate": 6.5878787878787885e-06, "num_tokens": 2010415.0, "completions/mean_length": 45.5, "completions/min_length": 31.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 45.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.517594575881958, "rewards/meter/std": 0.351583868265152, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175492912530899, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9349482655525208, "rewards/repeat_penalty/std": 0.06766357272863388, "rewards/repeat_floor/mean": 0.9918985366821289, "rewards/repeat_floor/std": 0.007502663880586624, "rewards/near_duplicate_penalty/mean": 0.9652293920516968, "rewards/near_duplicate_penalty/std": 0.022758612409234047, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9679344296455383, "rewards/distinct_2/std": 0.05440628528594971, "rewards/total_composite/mean": 0.19004203379154205, "rewards/total_composite/std": 0.1314927637577057, "reward": 0.19004203379154205, "reward_std": 0.1314927637577057, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1117461547255516, "sampling/sampling_logp_difference/max": 1.3882112503051758, "sampling/importance_sampling_ratio/min": 0.3044358789920807, "sampling/importance_sampling_ratio/mean": 1.021960735321045, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7055645324289799, "clip_ratio/low_mean": 0.04885927261784673, "clip_ratio/low_min": 0.04885927261784673, "clip_ratio/high_mean": 0.03511530440300703, "clip_ratio/high_max": 0.03511530440300703, "clip_ratio/region_mean": 0.08397457702085376, "reward_total_mean": 0.19004203379154205, "reward_meter_mean": 0.517594575881958, "reward_meter_std": 0.351583868265152, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175492912530899, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9349482655525208, "reward_repeat_penalty_std": 0.06766357272863388, "reward_repeat_floor_mean": 0.9918985366821289, "reward_repeat_floor_std": 0.007502663880586624, "reward_near_duplicate_penalty_mean": 0.9652293920516968, "reward_near_duplicate_penalty_std": 0.022758612409234047, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9679344296455383, "reward_distinct_2_std": 0.05440628528594971, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.19004203379154205, "reward_total_composite_std": 0.1314927637577057} {"timestamp_utc": "2026-04-12T20:17:36Z", "mode": "train", "global_step": 1128, "epoch": 0.05936529656333877, "loss": -0.0051, "grad_norm": 15.235906600952148, "learning_rate": 6.584848484848485e-06, "num_tokens": 2011804.0, "completions/mean_length": 32.625, "completions/min_length": 29.0, "completions/max_length": 35.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.625, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 35.0, "rewards/meter/mean": 0.3482735753059387, "rewards/meter/std": 0.3614812195301056, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9653024673461914, "rewards/lexical_plausibility/std": 0.06643702834844589, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.3384418189525604, "rewards/repeat_penalty/mean": 0.9854830503463745, "rewards/repeat_penalty/std": 0.017718393355607986, "rewards/repeat_floor/mean": 0.9978224635124207, "rewards/repeat_floor/std": 0.002657755510881543, "rewards/near_duplicate_penalty/mean": 0.9854830503463745, "rewards/near_duplicate_penalty/std": 0.017718393355607986, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.29860031604766846, "rewards/total_composite/std": 0.35767844319343567, "reward": 0.29860031604766846, "reward_std": 0.35767844319343567, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14200299978256226, "sampling/sampling_logp_difference/max": 1.2735671997070312, "sampling/importance_sampling_ratio/min": 0.2798316180706024, "sampling/importance_sampling_ratio/mean": 1.0043753385543823, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9176896587014198, "clip_ratio/low_mean": 0.08291233633644879, "clip_ratio/low_min": 0.08291233633644879, "clip_ratio/high_mean": 0.025649351067841053, "clip_ratio/high_max": 0.025649351067841053, "clip_ratio/region_mean": 0.10856168740428984, "reward_total_mean": 0.29860031604766846, "reward_meter_mean": 0.3482735753059387, "reward_meter_std": 0.3614812195301056, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9653024673461914, "reward_lexical_plausibility_std": 0.06643702834844589, "reward_repeat_penalty_mean": 0.9854830503463745, "reward_repeat_penalty_std": 0.017718393355607986, "reward_repeat_floor_mean": 0.9978224635124207, "reward_repeat_floor_std": 0.002657755510881543, "reward_near_duplicate_penalty_mean": 0.9854830503463745, "reward_near_duplicate_penalty_std": 0.017718393355607986, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.3384418189525604, "reward_total_composite_mean": 0.29860031604766846, "reward_total_composite_std": 0.35767844319343567} {"timestamp_utc": "2026-04-12T20:17:45Z", "mode": "train", "global_step": 1129, "epoch": 0.05941792537234882, "loss": -0.0055, "grad_norm": 12.833215713500977, "learning_rate": 6.581818181818182e-06, "num_tokens": 2013296.0, "completions/mean_length": 26.5, "completions/min_length": 25.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.5, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.16604852676391602, "rewards/meter/std": 0.3022329807281494, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8813630938529968, "rewards/lexical_plausibility/std": 0.22464321553707123, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9446057081222534, "rewards/repeat_penalty/std": 0.060503557324409485, "rewards/repeat_floor/mean": 0.9923745393753052, "rewards/repeat_floor/std": 0.007236011326313019, "rewards/near_duplicate_penalty/mean": 0.958039402961731, "rewards/near_duplicate_penalty/std": 0.0261548962444067, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.07083623111248016, "rewards/total_composite/std": 0.1334410011768341, "reward": 0.07083623111248016, "reward_std": 0.1334410011768341, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09989334642887115, "sampling/sampling_logp_difference/max": 3.296788215637207, "sampling/importance_sampling_ratio/min": 0.03700181841850281, "sampling/importance_sampling_ratio/mean": 1.0052670240402222, "sampling/importance_sampling_ratio/max": 1.6640193462371826, "entropy": 0.45605812780559063, "clip_ratio/low_mean": 0.07714387588202953, "clip_ratio/low_min": 0.07714387588202953, "clip_ratio/high_mean": 0.008620689623057842, "clip_ratio/high_max": 0.008620689623057842, "clip_ratio/region_mean": 0.08576456550508738, "reward_total_mean": 0.07083623111248016, "reward_meter_mean": 0.16604852676391602, "reward_meter_std": 0.3022329807281494, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8813630938529968, "reward_lexical_plausibility_std": 0.22464321553707123, "reward_repeat_penalty_mean": 0.9446057081222534, "reward_repeat_penalty_std": 0.060503557324409485, "reward_repeat_floor_mean": 0.9923745393753052, "reward_repeat_floor_std": 0.007236011326313019, "reward_near_duplicate_penalty_mean": 0.958039402961731, "reward_near_duplicate_penalty_std": 0.0261548962444067, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.07083623111248016, "reward_total_composite_std": 0.1334410011768341} {"timestamp_utc": "2026-04-12T20:17:56Z", "mode": "train", "global_step": 1130, "epoch": 0.059470554181358874, "loss": 0.0621, "grad_norm": 36.1773681640625, "learning_rate": 6.578787878787879e-06, "num_tokens": 2015752.0, "completions/mean_length": 100.0, "completions/min_length": 89.0, "completions/max_length": 112.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 100.0, "completions/min_terminated_length": 89.0, "completions/max_terminated_length": 112.0, "rewards/meter/mean": 0.9864547252655029, "rewards/meter/std": 0.009229982271790504, "rewards/count_adherence/mean": 0.5714285969734192, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8714285492897034, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.09161253273487091, "rewards/repeat_penalty/mean": 0.6942178010940552, "rewards/repeat_penalty/std": 0.16141824424266815, "rewards/repeat_floor/mean": 0.9650284051895142, "rewards/repeat_floor/std": 0.018470648676156998, "rewards/near_duplicate_penalty/mean": 0.9118733406066895, "rewards/near_duplicate_penalty/std": 0.04245678335428238, "rewards/opening_diversity/mean": 0.953125, "rewards/opening_diversity/std": 0.0867956355214119, "rewards/distinct_2/mean": 0.789554238319397, "rewards/distinct_2/std": 0.10843206197023392, "rewards/total_composite/mean": 0.17613454163074493, "rewards/total_composite/std": 0.07548650354146957, "reward": 0.17613454163074493, "reward_std": 0.07548649609088898, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13595923781394958, "sampling/sampling_logp_difference/max": 1.6110103130340576, "sampling/importance_sampling_ratio/min": 0.19968575239181519, "sampling/importance_sampling_ratio/mean": 1.0114250183105469, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0017299130558968, "clip_ratio/low_mean": 0.07044956088066101, "clip_ratio/low_min": 0.07044956088066101, "clip_ratio/high_mean": 0.05550385545939207, "clip_ratio/high_max": 0.05550385545939207, "clip_ratio/region_mean": 0.12595341634005308, "reward_total_mean": 0.17613454163074493, "reward_meter_mean": 0.9864547252655029, "reward_meter_std": 0.009229982271790504, "reward_count_adherence_mean": 0.5714285969734192, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8714285492897034, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6942178010940552, "reward_repeat_penalty_std": 0.16141824424266815, "reward_repeat_floor_mean": 0.9650284051895142, "reward_repeat_floor_std": 0.018470648676156998, "reward_near_duplicate_penalty_mean": 0.9118733406066895, "reward_near_duplicate_penalty_std": 0.04245678335428238, "reward_opening_diversity_mean": 0.953125, "reward_opening_diversity_std": 0.0867956355214119, "reward_distinct_2_mean": 0.789554238319397, "reward_distinct_2_std": 0.10843206197023392, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.09161253273487091, "reward_total_composite_mean": 0.17613454163074493, "reward_total_composite_std": 0.07548650354146957} {"timestamp_utc": "2026-04-12T20:18:06Z", "mode": "train", "global_step": 1131, "epoch": 0.05952318299036893, "loss": 0.0113, "grad_norm": 13.86112117767334, "learning_rate": 6.575757575757577e-06, "num_tokens": 2017289.0, "completions/mean_length": 39.125, "completions/min_length": 37.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.125, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.48837825655937195, "rewards/meter/std": 0.3425035774707794, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.8703740239143372, "rewards/repeat_penalty/std": 0.139456644654274, "rewards/repeat_floor/mean": 0.9848619103431702, "rewards/repeat_floor/std": 0.015189900994300842, "rewards/near_duplicate_penalty/mean": 0.9423151016235352, "rewards/near_duplicate_penalty/std": 0.05494488775730133, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9487741589546204, "rewards/distinct_2/std": 0.06066346541047096, "rewards/total_composite/mean": 0.17353501915931702, "rewards/total_composite/std": 0.12023576349020004, "reward": 0.17353501915931702, "reward_std": 0.12023576349020004, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11927077174186707, "sampling/sampling_logp_difference/max": 1.4823565483093262, "sampling/importance_sampling_ratio/min": 0.2271018922328949, "sampling/importance_sampling_ratio/mean": 1.0048420429229736, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7911979854106903, "clip_ratio/low_mean": 0.04927143733948469, "clip_ratio/low_min": 0.04927143733948469, "clip_ratio/high_mean": 0.0989175345748663, "clip_ratio/high_max": 0.0989175345748663, "clip_ratio/region_mean": 0.148188971914351, "reward_total_mean": 0.17353501915931702, "reward_meter_mean": 0.48837825655937195, "reward_meter_std": 0.3425035774707794, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8703740239143372, "reward_repeat_penalty_std": 0.139456644654274, "reward_repeat_floor_mean": 0.9848619103431702, "reward_repeat_floor_std": 0.015189900994300842, "reward_near_duplicate_penalty_mean": 0.9423151016235352, "reward_near_duplicate_penalty_std": 0.05494488775730133, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9487741589546204, "reward_distinct_2_std": 0.06066346541047096, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.17353501915931702, "reward_total_composite_std": 0.12023576349020004} {"timestamp_utc": "2026-04-12T20:18:21Z", "mode": "train", "global_step": 1132, "epoch": 0.05957581179937898, "loss": -0.1145, "grad_norm": 3.182318687438965, "learning_rate": 6.572727272727273e-06, "num_tokens": 2019220.0, "completions/mean_length": 183.375, "completions/min_length": 67.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 73.83333587646484, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.8254173994064331, "rewards/meter/std": 0.11091367900371552, "rewards/count_adherence/mean": 0.7749999761581421, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9325000047683716, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.9096426367759705, "rewards/lexical_plausibility/std": 0.1676514446735382, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.7916404008865356, "rewards/repeat_penalty/std": 0.17198587954044342, "rewards/repeat_floor/mean": 0.97715163230896, "rewards/repeat_floor/std": 0.016961004585027695, "rewards/near_duplicate_penalty/mean": 0.9342776536941528, "rewards/near_duplicate_penalty/std": 0.03185384348034859, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8556665778160095, "rewards/distinct_2/std": 0.14103658497333527, "rewards/total_composite/mean": 0.17727932333946228, "rewards/total_composite/std": 0.12055294960737228, "reward": 0.17727932333946228, "reward_std": 0.12055294215679169, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13627950847148895, "sampling/sampling_logp_difference/max": 1.14845871925354, "sampling/importance_sampling_ratio/min": 0.3628806173801422, "sampling/importance_sampling_ratio/mean": 1.007847547531128, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7004885524511337, "clip_ratio/low_mean": 0.03209459409117699, "clip_ratio/low_min": 0.03209459409117699, "clip_ratio/high_mean": 0.07658103574067354, "clip_ratio/high_max": 0.07658103574067354, "clip_ratio/region_mean": 0.10867562983185053, "reward_total_mean": 0.17727932333946228, "reward_meter_mean": 0.8254173994064331, "reward_meter_std": 0.11091367900371552, "reward_count_adherence_mean": 0.7749999761581421, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9325000047683716, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.9096426367759705, "reward_lexical_plausibility_std": 0.1676514446735382, "reward_repeat_penalty_mean": 0.7916404008865356, "reward_repeat_penalty_std": 0.17198587954044342, "reward_repeat_floor_mean": 0.97715163230896, "reward_repeat_floor_std": 0.016961004585027695, "reward_near_duplicate_penalty_mean": 0.9342776536941528, "reward_near_duplicate_penalty_std": 0.03185384348034859, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8556665778160095, "reward_distinct_2_std": 0.14103658497333527, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.17727932333946228, "reward_total_composite_std": 0.12055294960737228} {"timestamp_utc": "2026-04-12T20:18:35Z", "mode": "train", "global_step": 1133, "epoch": 0.05962844060838903, "loss": 0.0085, "grad_norm": 15.432718276977539, "learning_rate": 6.56969696969697e-06, "num_tokens": 2020825.0, "completions/mean_length": 37.625, "completions/min_length": 35.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.625, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.6276660561561584, "rewards/meter/std": 0.3171907067298889, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5637500286102295, "rewards/judge_quality/std": 0.3137759864330292, "rewards/repeat_penalty/mean": 0.8649664521217346, "rewards/repeat_penalty/std": 0.19094587862491608, "rewards/repeat_floor/mean": 0.983667254447937, "rewards/repeat_floor/std": 0.023933250457048416, "rewards/near_duplicate_penalty/mean": 0.9502384662628174, "rewards/near_duplicate_penalty/std": 0.06433877348899841, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9222947955131531, "rewards/distinct_2/std": 0.10613454133272171, "rewards/total_composite/mean": 0.3853622078895569, "rewards/total_composite/std": 0.31717705726623535, "reward": 0.3853622078895569, "reward_std": 0.31717702746391296, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13214007019996643, "sampling/sampling_logp_difference/max": 1.607330083847046, "sampling/importance_sampling_ratio/min": 0.200422003865242, "sampling/importance_sampling_ratio/mean": 1.0287736654281616, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.889851488173008, "clip_ratio/low_mean": 0.08795452699996531, "clip_ratio/low_min": 0.08795452699996531, "clip_ratio/high_mean": 0.01883012824691832, "clip_ratio/high_max": 0.01883012824691832, "clip_ratio/region_mean": 0.10678465524688363, "reward_total_mean": 0.3853622078895569, "reward_meter_mean": 0.6276660561561584, "reward_meter_std": 0.3171907067298889, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8649664521217346, "reward_repeat_penalty_std": 0.19094587862491608, "reward_repeat_floor_mean": 0.983667254447937, "reward_repeat_floor_std": 0.023933250457048416, "reward_near_duplicate_penalty_mean": 0.9502384662628174, "reward_near_duplicate_penalty_std": 0.06433877348899841, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9222947955131531, "reward_distinct_2_std": 0.10613454133272171, "reward_judge_quality_mean": 0.5637500286102295, "reward_judge_quality_std": 0.3137759864330292, "reward_total_composite_mean": 0.3853622078895569, "reward_total_composite_std": 0.31717705726623535} {"timestamp_utc": "2026-04-12T20:18:50Z", "mode": "train", "global_step": 1134, "epoch": 0.059681069417399084, "loss": -0.12, "grad_norm": 1.8836357593536377, "learning_rate": 6.566666666666667e-06, "num_tokens": 2022563.0, "completions/mean_length": 172.25, "completions/min_length": 55.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 59.0, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.818039059638977, "rewards/meter/std": 0.32381972670555115, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 0.8922749757766724, "rewards/lexical_plausibility/std": 0.22093923389911652, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213627576828, "rewards/repeat_penalty/mean": 0.865650475025177, "rewards/repeat_penalty/std": 0.08957969397306442, "rewards/repeat_floor/mean": 0.9841786623001099, "rewards/repeat_floor/std": 0.009905756451189518, "rewards/near_duplicate_penalty/mean": 0.9467566609382629, "rewards/near_duplicate_penalty/std": 0.024681156501173973, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9129465818405151, "rewards/distinct_2/std": 0.07364129275083542, "rewards/total_composite/mean": 0.2068629264831543, "rewards/total_composite/std": 0.13120529055595398, "reward": 0.2068629264831543, "reward_std": 0.13120529055595398, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10028151422739029, "sampling/sampling_logp_difference/max": 2.1131720542907715, "sampling/importance_sampling_ratio/min": 0.12085399776697159, "sampling/importance_sampling_ratio/mean": 0.998281717300415, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.44601161032915115, "clip_ratio/low_mean": 0.014830508269369602, "clip_ratio/low_min": 0.014830508269369602, "clip_ratio/high_mean": 0.0753679284825921, "clip_ratio/high_max": 0.0753679284825921, "clip_ratio/region_mean": 0.09019843675196171, "reward_total_mean": 0.2068629264831543, "reward_meter_mean": 0.818039059638977, "reward_meter_std": 0.32381972670555115, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 0.8922749757766724, "reward_lexical_plausibility_std": 0.22093923389911652, "reward_repeat_penalty_mean": 0.865650475025177, "reward_repeat_penalty_std": 0.08957969397306442, "reward_repeat_floor_mean": 0.9841786623001099, "reward_repeat_floor_std": 0.009905756451189518, "reward_near_duplicate_penalty_mean": 0.9467566609382629, "reward_near_duplicate_penalty_std": 0.024681156501173973, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9129465818405151, "reward_distinct_2_std": 0.07364129275083542, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213627576828, "reward_total_composite_mean": 0.2068629264831543, "reward_total_composite_std": 0.13120529055595398} {"timestamp_utc": "2026-04-12T20:19:04Z", "mode": "train", "global_step": 1135, "epoch": 0.059733698226409136, "loss": -0.0602, "grad_norm": 4.82960319519043, "learning_rate": 6.563636363636364e-06, "num_tokens": 2024119.0, "completions/mean_length": 101.5, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 42.85714340209961, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.28957587480545044, "rewards/meter/std": 0.23467731475830078, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9404920339584351, "rewards/lexical_plausibility/std": 0.16831403970718384, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.8318454027175903, "rewards/repeat_penalty/std": 0.33134788274765015, "rewards/repeat_floor/mean": 0.9736530184745789, "rewards/repeat_floor/std": 0.06063687801361084, "rewards/near_duplicate_penalty/mean": 0.9209880232810974, "rewards/near_duplicate_penalty/std": 0.17099036276340485, "rewards/opening_diversity/mean": 0.890625, "rewards/opening_diversity/std": 0.2259652018547058, "rewards/distinct_2/mean": 0.9118589758872986, "rewards/distinct_2/std": 0.24930046498775482, "rewards/total_composite/mean": 0.0776042640209198, "rewards/total_composite/std": 0.05956317111849785, "reward": 0.0776042640209198, "reward_std": 0.05956317111849785, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16488967835903168, "sampling/sampling_logp_difference/max": 1.4712190628051758, "sampling/importance_sampling_ratio/min": 0.22964537143707275, "sampling/importance_sampling_ratio/mean": 1.0245412588119507, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.941789448261261, "clip_ratio/low_mean": 0.041631230153143406, "clip_ratio/low_min": 0.041631230153143406, "clip_ratio/high_mean": 0.083386754617095, "clip_ratio/high_max": 0.083386754617095, "clip_ratio/region_mean": 0.1250179847702384, "reward_total_mean": 0.0776042640209198, "reward_meter_mean": 0.28957587480545044, "reward_meter_std": 0.23467731475830078, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9404920339584351, "reward_lexical_plausibility_std": 0.16831403970718384, "reward_repeat_penalty_mean": 0.8318454027175903, "reward_repeat_penalty_std": 0.33134788274765015, "reward_repeat_floor_mean": 0.9736530184745789, "reward_repeat_floor_std": 0.06063687801361084, "reward_near_duplicate_penalty_mean": 0.9209880232810974, "reward_near_duplicate_penalty_std": 0.17099036276340485, "reward_opening_diversity_mean": 0.890625, "reward_opening_diversity_std": 0.2259652018547058, "reward_distinct_2_mean": 0.9118589758872986, "reward_distinct_2_std": 0.24930046498775482, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.0776042640209198, "reward_total_composite_std": 0.05956317111849785} {"timestamp_utc": "2026-04-12T20:19:12Z", "mode": "train", "global_step": 1136, "epoch": 0.05978632703541919, "loss": -0.002, "grad_norm": 11.741394996643066, "learning_rate": 6.56060606060606e-06, "num_tokens": 2025782.0, "completions/mean_length": 42.875, "completions/min_length": 40.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.875, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.8009480237960815, "rewards/meter/std": 0.22720018029212952, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32875001430511475, "rewards/judge_quality/std": 0.24121344089508057, "rewards/repeat_penalty/mean": 0.9277142286300659, "rewards/repeat_penalty/std": 0.10197477787733078, "rewards/repeat_floor/mean": 0.9906651973724365, "rewards/repeat_floor/std": 0.012397919781506062, "rewards/near_duplicate_penalty/mean": 0.9579403400421143, "rewards/near_duplicate_penalty/std": 0.04623378440737724, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9663797616958618, "rewards/distinct_2/std": 0.0741337239742279, "rewards/total_composite/mean": 0.2769007682800293, "rewards/total_composite/std": 0.2531771659851074, "reward": 0.2769007682800293, "reward_std": 0.25317713618278503, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1619262546300888, "sampling/sampling_logp_difference/max": 1.4930922985076904, "sampling/importance_sampling_ratio/min": 0.22467681765556335, "sampling/importance_sampling_ratio/mean": 1.004959225654602, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1832910180091858, "clip_ratio/low_mean": 0.07099359226413071, "clip_ratio/low_min": 0.07099359226413071, "clip_ratio/high_mean": 0.029980657622218132, "clip_ratio/high_max": 0.029980657622218132, "clip_ratio/region_mean": 0.10097424988634884, "reward_total_mean": 0.2769007682800293, "reward_meter_mean": 0.8009480237960815, "reward_meter_std": 0.22720018029212952, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9277142286300659, "reward_repeat_penalty_std": 0.10197477787733078, "reward_repeat_floor_mean": 0.9906651973724365, "reward_repeat_floor_std": 0.012397919781506062, "reward_near_duplicate_penalty_mean": 0.9579403400421143, "reward_near_duplicate_penalty_std": 0.04623378440737724, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9663797616958618, "reward_distinct_2_std": 0.0741337239742279, "reward_judge_quality_mean": 0.32875001430511475, "reward_judge_quality_std": 0.24121344089508057, "reward_total_composite_mean": 0.2769007682800293, "reward_total_composite_std": 0.2531771659851074} {"timestamp_utc": "2026-04-12T20:19:27Z", "mode": "train", "global_step": 1137, "epoch": 0.05983895584442924, "loss": -0.0953, "grad_norm": 5.342452526092529, "learning_rate": 6.5575757575757585e-06, "num_tokens": 2027628.0, "completions/mean_length": 111.75, "completions/min_length": 43.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 54.57143020629883, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 59.0, "rewards/meter/mean": 0.6841248869895935, "rewards/meter/std": 0.3728896677494049, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.9550659656524658, "rewards/lexical_plausibility/std": 0.12709257006645203, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.8799244165420532, "rewards/repeat_penalty/std": 0.0797056257724762, "rewards/repeat_floor/mean": 0.9848881363868713, "rewards/repeat_floor/std": 0.009496498852968216, "rewards/near_duplicate_penalty/mean": 0.9356658458709717, "rewards/near_duplicate_penalty/std": 0.03665041923522949, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.939314067363739, "rewards/distinct_2/std": 0.05864523723721504, "rewards/total_composite/mean": 0.23774784803390503, "rewards/total_composite/std": 0.14941243827342987, "reward": 0.23774784803390503, "reward_std": 0.14941245317459106, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12418399751186371, "sampling/sampling_logp_difference/max": 1.2790470123291016, "sampling/importance_sampling_ratio/min": 0.278302401304245, "sampling/importance_sampling_ratio/mean": 0.9947309494018555, "sampling/importance_sampling_ratio/max": 1.963147521018982, "entropy": 0.651507593691349, "clip_ratio/low_mean": 0.033350951969623566, "clip_ratio/low_min": 0.033350951969623566, "clip_ratio/high_mean": 0.08394730091094971, "clip_ratio/high_max": 0.08394730091094971, "clip_ratio/region_mean": 0.11729825288057327, "reward_total_mean": 0.23774784803390503, "reward_meter_mean": 0.6841248869895935, "reward_meter_std": 0.3728896677494049, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.9550659656524658, "reward_lexical_plausibility_std": 0.12709257006645203, "reward_repeat_penalty_mean": 0.8799244165420532, "reward_repeat_penalty_std": 0.0797056257724762, "reward_repeat_floor_mean": 0.9848881363868713, "reward_repeat_floor_std": 0.009496498852968216, "reward_near_duplicate_penalty_mean": 0.9356658458709717, "reward_near_duplicate_penalty_std": 0.03665041923522949, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.939314067363739, "reward_distinct_2_std": 0.05864523723721504, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.23774784803390503, "reward_total_composite_std": 0.14941243827342987} {"timestamp_utc": "2026-04-12T20:19:36Z", "mode": "train", "global_step": 1138, "epoch": 0.05989158465343929, "loss": 0.0479, "grad_norm": 18.135719299316406, "learning_rate": 6.554545454545455e-06, "num_tokens": 2029204.0, "completions/mean_length": 41.0, "completions/min_length": 39.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.0, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.2913917303085327, "rewards/meter/std": 0.36782386898994446, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5499999523162842, "rewards/judge_quality/std": 0.21902382373809814, "rewards/repeat_penalty/mean": 0.9766601324081421, "rewards/repeat_penalty/std": 0.025797616690397263, "rewards/repeat_floor/mean": 0.9969615936279297, "rewards/repeat_floor/std": 0.0028235320933163166, "rewards/near_duplicate_penalty/mean": 0.9845515489578247, "rewards/near_duplicate_penalty/std": 0.013140684925019741, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9919871687889099, "rewards/distinct_2/std": 0.02266368828713894, "rewards/total_composite/mean": 0.19136007130146027, "rewards/total_composite/std": 0.2899673581123352, "reward": 0.19136007130146027, "reward_std": 0.2899673581123352, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14844121038913727, "sampling/sampling_logp_difference/max": 1.8613018989562988, "sampling/importance_sampling_ratio/min": 0.1554700881242752, "sampling/importance_sampling_ratio/mean": 0.9931487441062927, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6197232231497765, "clip_ratio/low_mean": 0.10148030612617731, "clip_ratio/low_min": 0.10148030612617731, "clip_ratio/high_mean": 0.04374999925494194, "clip_ratio/high_max": 0.04374999925494194, "clip_ratio/region_mean": 0.14523030538111925, "reward_total_mean": 0.19136007130146027, "reward_meter_mean": 0.2913917303085327, "reward_meter_std": 0.36782386898994446, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9766601324081421, "reward_repeat_penalty_std": 0.025797616690397263, "reward_repeat_floor_mean": 0.9969615936279297, "reward_repeat_floor_std": 0.0028235320933163166, "reward_near_duplicate_penalty_mean": 0.9845515489578247, "reward_near_duplicate_penalty_std": 0.013140684925019741, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9919871687889099, "reward_distinct_2_std": 0.02266368828713894, "reward_judge_quality_mean": 0.5499999523162842, "reward_judge_quality_std": 0.21902382373809814, "reward_total_composite_mean": 0.19136007130146027, "reward_total_composite_std": 0.2899673581123352} {"timestamp_utc": "2026-04-12T20:19:51Z", "mode": "train", "global_step": 1139, "epoch": 0.059944213462449346, "loss": -0.0205, "grad_norm": 5.675747394561768, "learning_rate": 6.551515151515152e-06, "num_tokens": 2030825.0, "completions/mean_length": 113.625, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 56.71428680419922, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.46092361211776733, "rewards/meter/std": 0.38770899176597595, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9608503580093384, "rewards/lexical_plausibility/std": 0.11073198169469833, "rewards/judge_quality/mean": 0.20625001192092896, "rewards/judge_quality/std": 0.1590990275144577, "rewards/repeat_penalty/mean": 0.8663142323493958, "rewards/repeat_penalty/std": 0.17410963773727417, "rewards/repeat_floor/mean": 0.9843921065330505, "rewards/repeat_floor/std": 0.01966203935444355, "rewards/near_duplicate_penalty/mean": 0.9548225998878479, "rewards/near_duplicate_penalty/std": 0.04271745681762695, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9018747806549072, "rewards/distinct_2/std": 0.15136343240737915, "rewards/total_composite/mean": 0.10493719577789307, "rewards/total_composite/std": 0.12584581971168518, "reward": 0.10493719577789307, "reward_std": 0.12584581971168518, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17330564558506012, "sampling/sampling_logp_difference/max": 2.0196781158447266, "sampling/importance_sampling_ratio/min": 0.1326981782913208, "sampling/importance_sampling_ratio/mean": 1.0193663835525513, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0731084495782852, "clip_ratio/low_mean": 0.0699875932186842, "clip_ratio/low_min": 0.0699875932186842, "clip_ratio/high_mean": 0.06027951929718256, "clip_ratio/high_max": 0.06027951929718256, "clip_ratio/region_mean": 0.13026711251586676, "reward_total_mean": 0.10493719577789307, "reward_meter_mean": 0.46092361211776733, "reward_meter_std": 0.38770899176597595, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9608503580093384, "reward_lexical_plausibility_std": 0.11073198169469833, "reward_repeat_penalty_mean": 0.8663142323493958, "reward_repeat_penalty_std": 0.17410963773727417, "reward_repeat_floor_mean": 0.9843921065330505, "reward_repeat_floor_std": 0.01966203935444355, "reward_near_duplicate_penalty_mean": 0.9548225998878479, "reward_near_duplicate_penalty_std": 0.04271745681762695, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9018747806549072, "reward_distinct_2_std": 0.15136343240737915, "reward_judge_quality_mean": 0.20625001192092896, "reward_judge_quality_std": 0.1590990275144577, "reward_total_composite_mean": 0.10493719577789307, "reward_total_composite_std": 0.12584581971168518} {"timestamp_utc": "2026-04-12T20:20:04Z", "mode": "train", "global_step": 1140, "epoch": 0.0599968422714594, "loss": -0.0675, "grad_norm": 3.6204586029052734, "learning_rate": 6.5484848484848494e-06, "num_tokens": 2032225.0, "completions/mean_length": 98.0, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.85714340209961, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.6756739616394043, "rewards/meter/std": 0.35370534658432007, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9530335664749146, "rewards/lexical_plausibility/std": 0.1328410506248474, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.33161941170692444, "rewards/repeat_penalty/mean": 0.9558984041213989, "rewards/repeat_penalty/std": 0.04338403418660164, "rewards/repeat_floor/mean": 0.9937871694564819, "rewards/repeat_floor/std": 0.006231467239558697, "rewards/near_duplicate_penalty/mean": 0.9628546237945557, "rewards/near_duplicate_penalty/std": 0.04140779376029968, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9928774833679199, "rewards/distinct_2/std": 0.02014549821615219, "rewards/total_composite/mean": 0.4560588598251343, "rewards/total_composite/std": 0.2655254900455475, "reward": 0.4560588598251343, "reward_std": 0.2655254602432251, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1267271339893341, "sampling/sampling_logp_difference/max": 1.193772315979004, "sampling/importance_sampling_ratio/min": 0.30307579040527344, "sampling/importance_sampling_ratio/mean": 1.0059844255447388, "sampling/importance_sampling_ratio/max": 1.6562862396240234, "entropy": 0.7207122519612312, "clip_ratio/low_mean": 0.06068417150527239, "clip_ratio/low_min": 0.06068417150527239, "clip_ratio/high_mean": 0.040540540125221014, "clip_ratio/high_max": 0.040540540125221014, "clip_ratio/region_mean": 0.1012247116304934, "reward_total_mean": 0.4560588598251343, "reward_meter_mean": 0.6756739616394043, "reward_meter_std": 0.35370534658432007, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9530335664749146, "reward_lexical_plausibility_std": 0.1328410506248474, "reward_repeat_penalty_mean": 0.9558984041213989, "reward_repeat_penalty_std": 0.04338403418660164, "reward_repeat_floor_mean": 0.9937871694564819, "reward_repeat_floor_std": 0.006231467239558697, "reward_near_duplicate_penalty_mean": 0.9628546237945557, "reward_near_duplicate_penalty_std": 0.04140779376029968, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9928774833679199, "reward_distinct_2_std": 0.02014549821615219, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.33161941170692444, "reward_total_composite_mean": 0.4560588598251343, "reward_total_composite_std": 0.2655254900455475} {"timestamp_utc": "2026-04-12T20:20:12Z", "mode": "train", "global_step": 1141, "epoch": 0.06004947108046945, "loss": -0.0148, "grad_norm": 26.83353614807129, "learning_rate": 6.545454545454546e-06, "num_tokens": 2033633.0, "completions/mean_length": 19.0, "completions/min_length": 17.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.0, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.7602664828300476, "rewards/meter/std": 0.39526283740997314, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6687500476837158, "rewards/judge_quality/std": 0.3589046001434326, "rewards/repeat_penalty/mean": 0.7529481649398804, "rewards/repeat_penalty/std": 0.11471517384052277, "rewards/repeat_floor/mean": 0.9812146425247192, "rewards/repeat_floor/std": 0.013616316951811314, "rewards/near_duplicate_penalty/mean": 0.9622641801834106, "rewards/near_duplicate_penalty/std": 0.07688961178064346, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.44564753770828247, "rewards/total_composite/std": 0.37537670135498047, "reward": 0.44564753770828247, "reward_std": 0.37537670135498047, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1680663675069809, "sampling/sampling_logp_difference/max": 0.8450136184692383, "sampling/importance_sampling_ratio/min": 0.42955151200294495, "sampling/importance_sampling_ratio/mean": 1.0307961702346802, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.063039354979992, "clip_ratio/low_mean": 0.061185440979897976, "clip_ratio/low_min": 0.061185440979897976, "clip_ratio/high_mean": 0.04417293332517147, "clip_ratio/high_max": 0.04417293332517147, "clip_ratio/region_mean": 0.10535837430506945, "reward_total_mean": 0.44564753770828247, "reward_meter_mean": 0.7602664828300476, "reward_meter_std": 0.39526283740997314, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7529481649398804, "reward_repeat_penalty_std": 0.11471517384052277, "reward_repeat_floor_mean": 0.9812146425247192, "reward_repeat_floor_std": 0.013616316951811314, "reward_near_duplicate_penalty_mean": 0.9622641801834106, "reward_near_duplicate_penalty_std": 0.07688961178064346, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6687500476837158, "reward_judge_quality_std": 0.3589046001434326, "reward_total_composite_mean": 0.44564753770828247, "reward_total_composite_std": 0.37537670135498047} {"timestamp_utc": "2026-04-12T20:20:27Z", "mode": "train", "global_step": 1142, "epoch": 0.0601020998894795, "loss": -0.0235, "grad_norm": 5.856141090393066, "learning_rate": 6.542424242424243e-06, "num_tokens": 2035919.0, "completions/mean_length": 148.75, "completions/min_length": 90.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 96.85714721679688, "completions/min_terminated_length": 90.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.7262279987335205, "rewards/meter/std": 0.29544880986213684, "rewards/count_adherence/mean": 0.7142857313156128, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9142857193946838, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9561619758605957, "rewards/lexical_plausibility/std": 0.12399259954690933, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.8861979842185974, "rewards/repeat_penalty/std": 0.06992067396640778, "rewards/repeat_floor/mean": 0.9877134561538696, "rewards/repeat_floor/std": 0.007540726102888584, "rewards/near_duplicate_penalty/mean": 0.9708187580108643, "rewards/near_duplicate_penalty/std": 0.017901204526424408, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9121188521385193, "rewards/distinct_2/std": 0.05898182839155197, "rewards/total_composite/mean": 0.18572500348091125, "rewards/total_composite/std": 0.08685710281133652, "reward": 0.18572500348091125, "reward_std": 0.08685710281133652, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.136882483959198, "sampling/sampling_logp_difference/max": 2.890528678894043, "sampling/importance_sampling_ratio/min": 0.0555468387901783, "sampling/importance_sampling_ratio/mean": 1.0035995244979858, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6375368684530258, "clip_ratio/low_mean": 0.05462704598903656, "clip_ratio/low_min": 0.05462704598903656, "clip_ratio/high_mean": 0.054704878479242325, "clip_ratio/high_max": 0.054704878479242325, "clip_ratio/region_mean": 0.10933192446827888, "reward_total_mean": 0.18572500348091125, "reward_meter_mean": 0.7262279987335205, "reward_meter_std": 0.29544880986213684, "reward_count_adherence_mean": 0.7142857313156128, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9142857193946838, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9561619758605957, "reward_lexical_plausibility_std": 0.12399259954690933, "reward_repeat_penalty_mean": 0.8861979842185974, "reward_repeat_penalty_std": 0.06992067396640778, "reward_repeat_floor_mean": 0.9877134561538696, "reward_repeat_floor_std": 0.007540726102888584, "reward_near_duplicate_penalty_mean": 0.9708187580108643, "reward_near_duplicate_penalty_std": 0.017901204526424408, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9121188521385193, "reward_distinct_2_std": 0.05898182839155197, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.18572500348091125, "reward_total_composite_std": 0.08685710281133652} {"timestamp_utc": "2026-04-12T20:20:41Z", "mode": "train", "global_step": 1143, "epoch": 0.060154728698489555, "loss": -0.0278, "grad_norm": 6.398889064788818, "learning_rate": 6.5393939393939395e-06, "num_tokens": 2037622.0, "completions/mean_length": 110.875, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 53.57143020629883, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.4308423399925232, "rewards/meter/std": 0.33540067076683044, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.2086307406425476, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.06258922815322876, "rewards/lexical_plausibility/mean": 0.9597708582878113, "rewards/lexical_plausibility/std": 0.11378522217273712, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.33114519715309143, "rewards/repeat_penalty/mean": 0.9547795057296753, "rewards/repeat_penalty/std": 0.08326976746320724, "rewards/repeat_floor/mean": 0.9960293769836426, "rewards/repeat_floor/std": 0.004671937320381403, "rewards/near_duplicate_penalty/mean": 0.9860295057296753, "rewards/near_duplicate_penalty/std": 0.010920105502009392, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22858132421970367, "rewards/total_composite/std": 0.23406212031841278, "reward": 0.22858132421970367, "reward_std": 0.2340621054172516, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17115718126296997, "sampling/sampling_logp_difference/max": 1.98124361038208, "sampling/importance_sampling_ratio/min": 0.13789764046669006, "sampling/importance_sampling_ratio/mean": 1.0093872547149658, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6973089054226875, "clip_ratio/low_mean": 0.04788055643439293, "clip_ratio/low_min": 0.04788055643439293, "clip_ratio/high_mean": 0.0812247795984149, "clip_ratio/high_max": 0.0812247795984149, "clip_ratio/region_mean": 0.12910533603280783, "reward_total_mean": 0.22858132421970367, "reward_meter_mean": 0.4308423399925232, "reward_meter_std": 0.33540067076683044, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.2086307406425476, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.06258922815322876, "reward_lexical_plausibility_mean": 0.9597708582878113, "reward_lexical_plausibility_std": 0.11378522217273712, "reward_repeat_penalty_mean": 0.9547795057296753, "reward_repeat_penalty_std": 0.08326976746320724, "reward_repeat_floor_mean": 0.9960293769836426, "reward_repeat_floor_std": 0.004671937320381403, "reward_near_duplicate_penalty_mean": 0.9860295057296753, "reward_near_duplicate_penalty_std": 0.010920105502009392, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.33114519715309143, "reward_total_composite_mean": 0.22858132421970367, "reward_total_composite_std": 0.23406212031841278} {"timestamp_utc": "2026-04-12T20:20:57Z", "mode": "train", "global_step": 1144, "epoch": 0.06020735750749961, "loss": -0.0509, "grad_norm": 1.6195006370544434, "learning_rate": 6.536363636363638e-06, "num_tokens": 2038988.0, "completions/mean_length": 335.75, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 42.0, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.25796008110046387, "rewards/meter/std": 0.3918321430683136, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.3720119297504425, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.11160357296466827, "rewards/lexical_plausibility/mean": 0.7385250926017761, "rewards/lexical_plausibility/std": 0.21849527955055237, "rewards/judge_quality/mean": 0.15625, "rewards/judge_quality/std": 0.18600594997406006, "rewards/repeat_penalty/mean": 0.8957667350769043, "rewards/repeat_penalty/std": 0.10599631071090698, "rewards/repeat_floor/mean": 0.9909473657608032, "rewards/repeat_floor/std": 0.00767924590036273, "rewards/near_duplicate_penalty/mean": 0.976216197013855, "rewards/near_duplicate_penalty/std": 0.029041754081845284, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9807209968566895, "rewards/distinct_2/std": 0.0357571542263031, "rewards/total_composite/mean": 0.07311014831066132, "rewards/total_composite/std": 0.12083852291107178, "reward": 0.07311014831066132, "reward_std": 0.12083853036165237, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2061946988105774, "sampling/sampling_logp_difference/max": 1.6785106658935547, "sampling/importance_sampling_ratio/min": 0.18665175139904022, "sampling/importance_sampling_ratio/mean": 1.0507837533950806, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5393520146608353, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.04928728099912405, "clip_ratio/high_max": 0.04928728099912405, "clip_ratio/region_mean": 0.04928728099912405, "reward_total_mean": 0.07311014831066132, "reward_meter_mean": 0.25796008110046387, "reward_meter_std": 0.3918321430683136, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.3720119297504425, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.11160357296466827, "reward_lexical_plausibility_mean": 0.7385250926017761, "reward_lexical_plausibility_std": 0.21849527955055237, "reward_repeat_penalty_mean": 0.8957667350769043, "reward_repeat_penalty_std": 0.10599631071090698, "reward_repeat_floor_mean": 0.9909473657608032, "reward_repeat_floor_std": 0.00767924590036273, "reward_near_duplicate_penalty_mean": 0.976216197013855, "reward_near_duplicate_penalty_std": 0.029041754081845284, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9807209968566895, "reward_distinct_2_std": 0.0357571542263031, "reward_judge_quality_mean": 0.15625, "reward_judge_quality_std": 0.18600594997406006, "reward_total_composite_mean": 0.07311014831066132, "reward_total_composite_std": 0.12083852291107178} {"timestamp_utc": "2026-04-12T20:21:05Z", "mode": "train", "global_step": 1145, "epoch": 0.06025998631650966, "loss": 0.058, "grad_norm": 18.354543685913086, "learning_rate": 6.533333333333334e-06, "num_tokens": 2040303.0, "completions/mean_length": 23.375, "completions/min_length": 21.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.375, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.8853771686553955, "rewards/meter/std": 0.17064696550369263, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.7312500476837158, "rewards/judge_quality/std": 0.2623213827610016, "rewards/repeat_penalty/mean": 0.7260016798973083, "rewards/repeat_penalty/std": 0.06787750124931335, "rewards/repeat_floor/mean": 0.9808095693588257, "rewards/repeat_floor/std": 0.011852389201521873, "rewards/near_duplicate_penalty/mean": 0.9816790223121643, "rewards/near_duplicate_penalty/std": 0.05181950703263283, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.045327357947826385, "rewards/total_composite/mean": 0.6388901472091675, "rewards/total_composite/std": 0.27662715315818787, "reward": 0.6388901472091675, "reward_std": 0.27662715315818787, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14900989830493927, "sampling/sampling_logp_difference/max": 1.2409031391143799, "sampling/importance_sampling_ratio/min": 0.289122998714447, "sampling/importance_sampling_ratio/mean": 1.0068740844726562, "sampling/importance_sampling_ratio/max": 1.7706222534179688, "entropy": 0.8659064024686813, "clip_ratio/low_mean": 0.06323369592428207, "clip_ratio/low_min": 0.06323369592428207, "clip_ratio/high_mean": 0.06437229551374912, "clip_ratio/high_max": 0.06437229551374912, "clip_ratio/region_mean": 0.1276059914380312, "reward_total_mean": 0.6388901472091675, "reward_meter_mean": 0.8853771686553955, "reward_meter_std": 0.17064696550369263, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7260016798973083, "reward_repeat_penalty_std": 0.06787750124931335, "reward_repeat_floor_mean": 0.9808095693588257, "reward_repeat_floor_std": 0.011852389201521873, "reward_near_duplicate_penalty_mean": 0.9816790223121643, "reward_near_duplicate_penalty_std": 0.05181950703263283, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.045327357947826385, "reward_judge_quality_mean": 0.7312500476837158, "reward_judge_quality_std": 0.2623213827610016, "reward_total_composite_mean": 0.6388901472091675, "reward_total_composite_std": 0.27662715315818787} {"timestamp_utc": "2026-04-12T20:21:19Z", "mode": "train", "global_step": 1146, "epoch": 0.06031261512551971, "loss": -0.0486, "grad_norm": 3.964550495147705, "learning_rate": 6.530303030303031e-06, "num_tokens": 2041793.0, "completions/mean_length": 158.25, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 40.333335876464844, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.20266953110694885, "rewards/meter/std": 0.2659032344818115, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.921892523765564, "rewards/lexical_plausibility/std": 0.1446504145860672, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1767766773700714, "rewards/repeat_penalty/mean": 0.9146501421928406, "rewards/repeat_penalty/std": 0.11435196548700333, "rewards/repeat_floor/mean": 0.9908194541931152, "rewards/repeat_floor/std": 0.010582190938293934, "rewards/near_duplicate_penalty/mean": 0.9662138223648071, "rewards/near_duplicate_penalty/std": 0.04272926598787308, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9751373529434204, "rewards/distinct_2/std": 0.034471429884433746, "rewards/total_composite/mean": 0.07987114042043686, "rewards/total_composite/std": 0.12118276208639145, "reward": 0.07987114042043686, "reward_std": 0.12118275463581085, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15076430141925812, "sampling/sampling_logp_difference/max": 1.9134538173675537, "sampling/importance_sampling_ratio/min": 0.14756983518600464, "sampling/importance_sampling_ratio/mean": 1.0418813228607178, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8976794555783272, "clip_ratio/low_mean": 0.07418129313737154, "clip_ratio/low_min": 0.07418129313737154, "clip_ratio/high_mean": 0.02325581479817629, "clip_ratio/high_max": 0.02325581479817629, "clip_ratio/region_mean": 0.09743710793554783, "reward_total_mean": 0.07987114042043686, "reward_meter_mean": 0.20266953110694885, "reward_meter_std": 0.2659032344818115, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.921892523765564, "reward_lexical_plausibility_std": 0.1446504145860672, "reward_repeat_penalty_mean": 0.9146501421928406, "reward_repeat_penalty_std": 0.11435196548700333, "reward_repeat_floor_mean": 0.9908194541931152, "reward_repeat_floor_std": 0.010582190938293934, "reward_near_duplicate_penalty_mean": 0.9662138223648071, "reward_near_duplicate_penalty_std": 0.04272926598787308, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9751373529434204, "reward_distinct_2_std": 0.034471429884433746, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1767766773700714, "reward_total_composite_mean": 0.07987114042043686, "reward_total_composite_std": 0.12118276208639145} {"timestamp_utc": "2026-04-12T20:21:34Z", "mode": "train", "global_step": 1147, "epoch": 0.060365243934529765, "loss": -0.0959, "grad_norm": 4.084112167358398, "learning_rate": 6.527272727272728e-06, "num_tokens": 2043591.0, "completions/mean_length": 117.75, "completions/min_length": 58.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 61.42857360839844, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 67.0, "rewards/meter/mean": 0.7658863663673401, "rewards/meter/std": 0.31261318922042847, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.24800792336463928, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.07440238445997238, "rewards/lexical_plausibility/mean": 0.9434326887130737, "rewards/lexical_plausibility/std": 0.15999643504619598, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.8328726291656494, "rewards/repeat_penalty/std": 0.13319075107574463, "rewards/repeat_floor/mean": 0.9800093173980713, "rewards/repeat_floor/std": 0.015447062440216541, "rewards/near_duplicate_penalty/mean": 0.9336251020431519, "rewards/near_duplicate_penalty/std": 0.039976511150598526, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8885061144828796, "rewards/distinct_2/std": 0.11086546629667282, "rewards/total_composite/mean": 0.24992404878139496, "rewards/total_composite/std": 0.14261551201343536, "reward": 0.24992404878139496, "reward_std": 0.14261551201343536, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14335353672504425, "sampling/sampling_logp_difference/max": 1.9305111169815063, "sampling/importance_sampling_ratio/min": 0.1450740396976471, "sampling/importance_sampling_ratio/mean": 1.0164743661880493, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7771314010024071, "clip_ratio/low_mean": 0.033865710720419884, "clip_ratio/low_min": 0.033865710720419884, "clip_ratio/high_mean": 0.09077356196939945, "clip_ratio/high_max": 0.09077356196939945, "clip_ratio/region_mean": 0.12463927268981934, "reward_total_mean": 0.24992404878139496, "reward_meter_mean": 0.7658863663673401, "reward_meter_std": 0.31261318922042847, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.24800792336463928, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.07440238445997238, "reward_lexical_plausibility_mean": 0.9434326887130737, "reward_lexical_plausibility_std": 0.15999643504619598, "reward_repeat_penalty_mean": 0.8328726291656494, "reward_repeat_penalty_std": 0.13319075107574463, "reward_repeat_floor_mean": 0.9800093173980713, "reward_repeat_floor_std": 0.015447062440216541, "reward_near_duplicate_penalty_mean": 0.9336251020431519, "reward_near_duplicate_penalty_std": 0.039976511150598526, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8885061144828796, "reward_distinct_2_std": 0.11086546629667282, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.24992404878139496, "reward_total_composite_std": 0.14261551201343536} {"timestamp_utc": "2026-04-12T20:21:48Z", "mode": "train", "global_step": 1148, "epoch": 0.06041787274353981, "loss": 0.0164, "grad_norm": 6.501523971557617, "learning_rate": 6.524242424242425e-06, "num_tokens": 2045448.0, "completions/mean_length": 126.125, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 71.0, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 97.0, "rewards/meter/mean": 0.6120268702507019, "rewards/meter/std": 0.290813684463501, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 0.9514014720916748, "rewards/lexical_plausibility/std": 0.137457475066185, "rewards/judge_quality/mean": 0.29999998211860657, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.8905959129333496, "rewards/repeat_penalty/std": 0.0741792693734169, "rewards/repeat_floor/mean": 0.9868966937065125, "rewards/repeat_floor/std": 0.007907633669674397, "rewards/near_duplicate_penalty/mean": 0.9514176845550537, "rewards/near_duplicate_penalty/std": 0.017901966348290443, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9353775978088379, "rewards/distinct_2/std": 0.06565867364406586, "rewards/total_composite/mean": 0.16292856633663177, "rewards/total_composite/std": 0.12048143148422241, "reward": 0.16292856633663177, "reward_std": 0.12048143893480301, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17229385673999786, "sampling/sampling_logp_difference/max": 2.7195560932159424, "sampling/importance_sampling_ratio/min": 0.06590400636196136, "sampling/importance_sampling_ratio/mean": 1.000677466392517, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7999205216765404, "clip_ratio/low_mean": 0.07672486081719398, "clip_ratio/low_min": 0.07672486081719398, "clip_ratio/high_mean": 0.0744554940611124, "clip_ratio/high_max": 0.0744554940611124, "clip_ratio/region_mean": 0.1511803548783064, "reward_total_mean": 0.16292856633663177, "reward_meter_mean": 0.6120268702507019, "reward_meter_std": 0.290813684463501, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 0.9514014720916748, "reward_lexical_plausibility_std": 0.137457475066185, "reward_repeat_penalty_mean": 0.8905959129333496, "reward_repeat_penalty_std": 0.0741792693734169, "reward_repeat_floor_mean": 0.9868966937065125, "reward_repeat_floor_std": 0.007907633669674397, "reward_near_duplicate_penalty_mean": 0.9514176845550537, "reward_near_duplicate_penalty_std": 0.017901966348290443, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9353775978088379, "reward_distinct_2_std": 0.06565867364406586, "reward_judge_quality_mean": 0.29999998211860657, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.16292856633663177, "reward_total_composite_std": 0.12048143148422241} {"timestamp_utc": "2026-04-12T20:21:57Z", "mode": "train", "global_step": 1149, "epoch": 0.06047050155254986, "loss": 0.0612, "grad_norm": 14.13011646270752, "learning_rate": 6.521212121212121e-06, "num_tokens": 2047024.0, "completions/mean_length": 37.0, "completions/min_length": 31.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.37118369340896606, "rewards/meter/std": 0.35734549164772034, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.19668231904506683, "rewards/repeat_penalty/mean": 0.889718770980835, "rewards/repeat_penalty/std": 0.06981737911701202, "rewards/repeat_floor/mean": 0.9864054322242737, "rewards/repeat_floor/std": 0.007891464978456497, "rewards/near_duplicate_penalty/mean": 0.9447933435440063, "rewards/near_duplicate_penalty/std": 0.025792958214879036, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9409602880477905, "rewards/distinct_2/std": 0.056140556931495667, "rewards/total_composite/mean": 0.15181592106819153, "rewards/total_composite/std": 0.13855406641960144, "reward": 0.15181592106819153, "reward_std": 0.13855406641960144, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13481339812278748, "sampling/sampling_logp_difference/max": 1.7303745746612549, "sampling/importance_sampling_ratio/min": 0.1772180199623108, "sampling/importance_sampling_ratio/mean": 1.0263570547103882, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8146373778581619, "clip_ratio/low_mean": 0.05393212754279375, "clip_ratio/low_min": 0.05393212754279375, "clip_ratio/high_mean": 0.05444540362805128, "clip_ratio/high_max": 0.05444540362805128, "clip_ratio/region_mean": 0.10837753117084503, "reward_total_mean": 0.15181592106819153, "reward_meter_mean": 0.37118369340896606, "reward_meter_std": 0.35734549164772034, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.889718770980835, "reward_repeat_penalty_std": 0.06981737911701202, "reward_repeat_floor_mean": 0.9864054322242737, "reward_repeat_floor_std": 0.007891464978456497, "reward_near_duplicate_penalty_mean": 0.9447933435440063, "reward_near_duplicate_penalty_std": 0.025792958214879036, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9409602880477905, "reward_distinct_2_std": 0.056140556931495667, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.19668231904506683, "reward_total_composite_mean": 0.15181592106819153, "reward_total_composite_std": 0.13855406641960144} {"timestamp_utc": "2026-04-12T20:22:05Z", "mode": "train", "global_step": 1150, "epoch": 0.060523130361559915, "loss": 0.0474, "grad_norm": 21.6728458404541, "learning_rate": 6.5181818181818195e-06, "num_tokens": 2048574.0, "completions/mean_length": 25.75, "completions/min_length": 19.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 25.75, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.8422211408615112, "rewards/meter/std": 0.30025631189346313, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5924999713897705, "rewards/judge_quality/std": 0.23279361426830292, "rewards/repeat_penalty/mean": 0.8518966436386108, "rewards/repeat_penalty/std": 0.2523607313632965, "rewards/repeat_floor/mean": 0.9817835092544556, "rewards/repeat_floor/std": 0.026638295501470566, "rewards/near_duplicate_penalty/mean": 0.9225249886512756, "rewards/near_duplicate_penalty/std": 0.05797421932220459, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9475524425506592, "rewards/distinct_2/std": 0.14834408462047577, "rewards/total_composite/mean": 0.45890873670578003, "rewards/total_composite/std": 0.24174794554710388, "reward": 0.45890873670578003, "reward_std": 0.24174796044826508, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1397968828678131, "sampling/sampling_logp_difference/max": 1.3089745044708252, "sampling/importance_sampling_ratio/min": 0.27009689807891846, "sampling/importance_sampling_ratio/mean": 1.0170339345932007, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5876163616776466, "clip_ratio/low_mean": 0.10471547488123178, "clip_ratio/low_min": 0.10471547488123178, "clip_ratio/high_mean": 0.04418103490024805, "clip_ratio/high_max": 0.04418103490024805, "clip_ratio/region_mean": 0.14889650978147984, "reward_total_mean": 0.45890873670578003, "reward_meter_mean": 0.8422211408615112, "reward_meter_std": 0.30025631189346313, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8518966436386108, "reward_repeat_penalty_std": 0.2523607313632965, "reward_repeat_floor_mean": 0.9817835092544556, "reward_repeat_floor_std": 0.026638295501470566, "reward_near_duplicate_penalty_mean": 0.9225249886512756, "reward_near_duplicate_penalty_std": 0.05797421932220459, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9475524425506592, "reward_distinct_2_std": 0.14834408462047577, "reward_judge_quality_mean": 0.5924999713897705, "reward_judge_quality_std": 0.23279361426830292, "reward_total_composite_mean": 0.45890873670578003, "reward_total_composite_std": 0.24174794554710388} {"timestamp_utc": "2026-04-12T20:24:18Z", "mode": "eval", "global_step": 1150, "epoch": 0.060523130361559915, "eval_loss": NaN, "eval_runtime": 132.9701, "eval_samples_per_second": 0.782, "eval_steps_per_second": 0.098, "eval_num_tokens": 2048574.0, "eval_completions/mean_length": 152.90384615384616, "eval_completions/min_length": 33.46153846153846, "eval_completions/max_length": 407.9230769230769, "eval_completions/clipped_ratio": 0.14423076923076922, "eval_completions/mean_terminated_length": 93.38425093430739, "eval_completions/min_terminated_length": 33.46153846153846, "eval_completions/max_terminated_length": 184.3846153846154, "eval_rewards/meter/mean": 0.46407373593403745, "eval_rewards/meter/std": 0.3627307415008545, "eval_rewards/count_adherence/mean": 0.7267556465589083, "eval_rewards/count_adherence/std": 0.17637487959403259, "eval_rewards/arabic_clean/mean": 0.7596153846153846, "eval_rewards/arabic_clean/std": 0.38037164165423465, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9951923076923077, "eval_rewards/arabic_floor/std": 0.013598207670908708, "eval_rewards/count_floor/mean": 0.918026694884667, "eval_rewards/count_floor/std": 0.052912466801129855, "eval_rewards/lexical_plausibility/mean": 0.9519930344361526, "eval_rewards/lexical_plausibility/std": 0.09474431837980564, "eval_rewards/judge_quality/mean": 0.29019230948044705, "eval_rewards/judge_quality/std": 0.17068963727125755, "eval_rewards/repeat_penalty/mean": 0.7603715383089505, "eval_rewards/repeat_penalty/std": 0.2201156782416197, "eval_rewards/repeat_floor/mean": 0.9729670607126676, "eval_rewards/repeat_floor/std": 0.025789915440747373, "eval_rewards/near_duplicate_penalty/mean": 0.9284641788556025, "eval_rewards/near_duplicate_penalty/std": 0.06080597653411902, "eval_rewards/opening_diversity/mean": 0.9599762604786799, "eval_rewards/opening_diversity/std": 0.09110712345976096, "eval_rewards/distinct_2/mean": 0.8455428251853356, "eval_rewards/distinct_2/std": 0.18207372237856573, "eval_rewards/total_composite/mean": 0.1142805413557933, "eval_rewards/total_composite/std": 0.11712601465674546, "eval_reward": 0.1142805413557933, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.07252842159225391, "eval_sampling/sampling_logp_difference/max": 1.0427780884962816, "eval_sampling/importance_sampling_ratio/min": 0.3573741637743436, "eval_sampling/importance_sampling_ratio/mean": 1.0154054898482103, "eval_sampling/importance_sampling_ratio/max": 1.577569191272442, "eval_entropy": 0.797071649478032, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.1142805413557933, "eval_reward_meter_mean": 0.46407373593403745, "eval_reward_meter_std": 0.3627307415008545, "eval_reward_count_adherence_mean": 0.7267556465589083, "eval_reward_count_adherence_std": 0.17637487959403259, "eval_reward_arabic_clean_mean": 0.7596153846153846, "eval_reward_arabic_clean_std": 0.38037164165423465, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9951923076923077, "eval_reward_arabic_floor_std": 0.013598207670908708, "eval_reward_count_floor_mean": 0.918026694884667, "eval_reward_count_floor_std": 0.052912466801129855, "eval_reward_lexical_plausibility_mean": 0.9519930344361526, "eval_reward_lexical_plausibility_std": 0.09474431837980564, "eval_reward_repeat_penalty_mean": 0.7603715383089505, "eval_reward_repeat_penalty_std": 0.2201156782416197, "eval_reward_repeat_floor_mean": 0.9729670607126676, "eval_reward_repeat_floor_std": 0.025789915440747373, "eval_reward_near_duplicate_penalty_mean": 0.9284641788556025, "eval_reward_near_duplicate_penalty_std": 0.06080597653411902, "eval_reward_opening_diversity_mean": 0.9599762604786799, "eval_reward_opening_diversity_std": 0.09110712345976096, "eval_reward_distinct_2_mean": 0.8455428251853356, "eval_reward_distinct_2_std": 0.18207372237856573, "eval_reward_judge_quality_mean": 0.29019230948044705, "eval_reward_judge_quality_std": 0.17068963727125755, "eval_reward_total_composite_mean": 0.1142805413557933, "eval_reward_total_composite_std": 0.11712601465674546} {"timestamp_utc": "2026-04-12T20:24:35Z", "mode": "train", "global_step": 1151, "epoch": 0.06057575917056997, "loss": -0.0616, "grad_norm": 5.99368953704834, "learning_rate": 6.515151515151516e-06, "num_tokens": 2050940.0, "completions/mean_length": 207.75, "completions/min_length": 96.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 106.33333587646484, "completions/min_terminated_length": 96.0, "completions/max_terminated_length": 114.0, "rewards/meter/mean": 0.7844904661178589, "rewards/meter/std": 0.3082217872142792, "rewards/count_adherence/mean": 0.453125, "rewards/count_adherence/std": 0.09300298243761063, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8359375, "rewards/count_floor/std": 0.02790091000497341, "rewards/lexical_plausibility/mean": 0.9240038990974426, "rewards/lexical_plausibility/std": 0.14556916058063507, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.6493626236915588, "rewards/repeat_penalty/std": 0.14069417119026184, "rewards/repeat_floor/mean": 0.9627324938774109, "rewards/repeat_floor/std": 0.015762509778141975, "rewards/near_duplicate_penalty/mean": 0.901320219039917, "rewards/near_duplicate_penalty/std": 0.04448346421122551, "rewards/opening_diversity/mean": 0.8636904954910278, "rewards/opening_diversity/std": 0.18898972868919373, "rewards/distinct_2/mean": 0.8412556648254395, "rewards/distinct_2/std": 0.10836755484342575, "rewards/total_composite/mean": 0.09898905456066132, "rewards/total_composite/std": 0.08719787746667862, "reward": 0.09898905456066132, "reward_std": 0.08719787746667862, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15414954721927643, "sampling/sampling_logp_difference/max": 2.5807323455810547, "sampling/importance_sampling_ratio/min": 0.07571852952241898, "sampling/importance_sampling_ratio/mean": 1.0037548542022705, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5894298553466797, "clip_ratio/low_mean": 0.03150651790201664, "clip_ratio/low_min": 0.03150651790201664, "clip_ratio/high_mean": 0.0673754969611764, "clip_ratio/high_max": 0.0673754969611764, "clip_ratio/region_mean": 0.09888201486319304, "reward_total_mean": 0.09898905456066132, "reward_meter_mean": 0.7844904661178589, "reward_meter_std": 0.3082217872142792, "reward_count_adherence_mean": 0.453125, "reward_count_adherence_std": 0.09300298243761063, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8359375, "reward_count_floor_std": 0.02790091000497341, "reward_lexical_plausibility_mean": 0.9240038990974426, "reward_lexical_plausibility_std": 0.14556916058063507, "reward_repeat_penalty_mean": 0.6493626236915588, "reward_repeat_penalty_std": 0.14069417119026184, "reward_repeat_floor_mean": 0.9627324938774109, "reward_repeat_floor_std": 0.015762509778141975, "reward_near_duplicate_penalty_mean": 0.901320219039917, "reward_near_duplicate_penalty_std": 0.04448346421122551, "reward_opening_diversity_mean": 0.8636904954910278, "reward_opening_diversity_std": 0.18898972868919373, "reward_distinct_2_mean": 0.8412556648254395, "reward_distinct_2_std": 0.10836755484342575, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.09898905456066132, "reward_total_composite_std": 0.08719787746667862} {"timestamp_utc": "2026-04-12T20:24:50Z", "mode": "train", "global_step": 1152, "epoch": 0.06062838797958002, "loss": -0.1078, "grad_norm": 2.2056760787963867, "learning_rate": 6.512121212121213e-06, "num_tokens": 2053431.0, "completions/mean_length": 415.375, "completions/min_length": 121.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.75, "completions/mean_terminated_length": 125.5, "completions/min_terminated_length": 121.0, "completions/max_terminated_length": 130.0, "rewards/meter/mean": 0.630567729473114, "rewards/meter/std": 0.3366723656654358, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.0839921236038208, "rewards/arabic_clean/mean": 0.25, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.02519763633608818, "rewards/lexical_plausibility/mean": 0.7459694743156433, "rewards/lexical_plausibility/std": 0.16210918128490448, "rewards/judge_quality/mean": 0.15000000596046448, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.8843338489532471, "rewards/repeat_penalty/std": 0.08120060712099075, "rewards/repeat_floor/mean": 0.9852336645126343, "rewards/repeat_floor/std": 0.009063991717994213, "rewards/near_duplicate_penalty/mean": 0.9262511730194092, "rewards/near_duplicate_penalty/std": 0.033649466931819916, "rewards/opening_diversity/mean": 0.979687511920929, "rewards/opening_diversity/std": 0.03892387077212334, "rewards/distinct_2/mean": 0.9723861217498779, "rewards/distinct_2/std": 0.027408117428421974, "rewards/total_composite/mean": 0.08911535143852234, "rewards/total_composite/std": 0.09778188169002533, "reward": 0.08911535143852234, "reward_std": 0.09778188914060593, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13808836042881012, "sampling/sampling_logp_difference/max": 1.8025791645050049, "sampling/importance_sampling_ratio/min": 0.16487310826778412, "sampling/importance_sampling_ratio/mean": 1.0155705213546753, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.24934573471546173, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.03575969487428665, "clip_ratio/high_max": 0.03575969487428665, "clip_ratio/region_mean": 0.03575969487428665, "reward_total_mean": 0.08911535143852234, "reward_meter_mean": 0.630567729473114, "reward_meter_std": 0.3366723656654358, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.0839921236038208, "reward_arabic_clean_mean": 0.25, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.02519763633608818, "reward_lexical_plausibility_mean": 0.7459694743156433, "reward_lexical_plausibility_std": 0.16210918128490448, "reward_repeat_penalty_mean": 0.8843338489532471, "reward_repeat_penalty_std": 0.08120060712099075, "reward_repeat_floor_mean": 0.9852336645126343, "reward_repeat_floor_std": 0.009063991717994213, "reward_near_duplicate_penalty_mean": 0.9262511730194092, "reward_near_duplicate_penalty_std": 0.033649466931819916, "reward_opening_diversity_mean": 0.979687511920929, "reward_opening_diversity_std": 0.03892387077212334, "reward_distinct_2_mean": 0.9723861217498779, "reward_distinct_2_std": 0.027408117428421974, "reward_judge_quality_mean": 0.15000000596046448, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.08911535143852234, "reward_total_composite_std": 0.09778188169002533} {"timestamp_utc": "2026-04-12T20:24:59Z", "mode": "train", "global_step": 1153, "epoch": 0.06068101678859007, "loss": 0.0266, "grad_norm": 14.970558166503906, "learning_rate": 6.5090909090909095e-06, "num_tokens": 2054875.0, "completions/mean_length": 33.5, "completions/min_length": 29.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.5, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.3699997365474701, "rewards/meter/std": 0.3258172869682312, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.7188122272491455, "rewards/repeat_penalty/std": 0.19269207119941711, "rewards/repeat_floor/mean": 0.968213677406311, "rewards/repeat_floor/std": 0.020962757989764214, "rewards/near_duplicate_penalty/mean": 0.8991570472717285, "rewards/near_duplicate_penalty/std": 0.05692235380411148, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.8982231616973877, "rewards/distinct_2/std": 0.083673395216465, "rewards/total_composite/mean": 0.13423895835876465, "rewards/total_composite/std": 0.12630689144134521, "reward": 0.13423895835876465, "reward_std": 0.12630687654018402, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1432502269744873, "sampling/sampling_logp_difference/max": 1.766525387763977, "sampling/importance_sampling_ratio/min": 0.17092587053775787, "sampling/importance_sampling_ratio/mean": 1.0145972967147827, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.848037950694561, "clip_ratio/low_mean": 0.11832964140921831, "clip_ratio/low_min": 0.11832964140921831, "clip_ratio/high_mean": 0.022077922709286213, "clip_ratio/high_max": 0.022077922709286213, "clip_ratio/region_mean": 0.14040756411850452, "reward_total_mean": 0.13423895835876465, "reward_meter_mean": 0.3699997365474701, "reward_meter_std": 0.3258172869682312, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7188122272491455, "reward_repeat_penalty_std": 0.19269207119941711, "reward_repeat_floor_mean": 0.968213677406311, "reward_repeat_floor_std": 0.020962757989764214, "reward_near_duplicate_penalty_mean": 0.8991570472717285, "reward_near_duplicate_penalty_std": 0.05692235380411148, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.8982231616973877, "reward_distinct_2_std": 0.083673395216465, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.13423895835876465, "reward_total_composite_std": 0.12630689144134521} {"timestamp_utc": "2026-04-12T20:25:08Z", "mode": "train", "global_step": 1154, "epoch": 0.060733645597600125, "loss": -0.0044, "grad_norm": 17.46927833557129, "learning_rate": 6.506060606060607e-06, "num_tokens": 2056361.0, "completions/mean_length": 28.75, "completions/min_length": 25.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.75, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.635522186756134, "rewards/meter/std": 0.3521137237548828, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9786953330039978, "rewards/lexical_plausibility/std": 0.06025872007012367, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.19668231904506683, "rewards/repeat_penalty/mean": 0.9707440137863159, "rewards/repeat_penalty/std": 0.04813366010785103, "rewards/repeat_floor/mean": 0.9963599443435669, "rewards/repeat_floor/std": 0.005245621781796217, "rewards/near_duplicate_penalty/mean": 0.983974814414978, "rewards/near_duplicate_penalty/std": 0.016977880150079727, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9862637519836426, "rewards/distinct_2/std": 0.0388520210981369, "rewards/total_composite/mean": 0.2994198203086853, "rewards/total_composite/std": 0.2327273041009903, "reward": 0.2994198203086853, "reward_std": 0.2327273041009903, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16486014425754547, "sampling/sampling_logp_difference/max": 2.0230321884155273, "sampling/importance_sampling_ratio/min": 0.13225384056568146, "sampling/importance_sampling_ratio/mean": 0.9832513928413391, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8267838284373283, "clip_ratio/low_mean": 0.05542989354580641, "clip_ratio/low_min": 0.05542989354580641, "clip_ratio/high_mean": 0.08571589924395084, "clip_ratio/high_max": 0.08571589924395084, "clip_ratio/region_mean": 0.14114579278975725, "reward_total_mean": 0.2994198203086853, "reward_meter_mean": 0.635522186756134, "reward_meter_std": 0.3521137237548828, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9786953330039978, "reward_lexical_plausibility_std": 0.06025872007012367, "reward_repeat_penalty_mean": 0.9707440137863159, "reward_repeat_penalty_std": 0.04813366010785103, "reward_repeat_floor_mean": 0.9963599443435669, "reward_repeat_floor_std": 0.005245621781796217, "reward_near_duplicate_penalty_mean": 0.983974814414978, "reward_near_duplicate_penalty_std": 0.016977880150079727, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9862637519836426, "reward_distinct_2_std": 0.0388520210981369, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.19668231904506683, "reward_total_composite_mean": 0.2994198203086853, "reward_total_composite_std": 0.2327273041009903} {"timestamp_utc": "2026-04-12T20:25:18Z", "mode": "train", "global_step": 1155, "epoch": 0.06078627440661018, "loss": 0.005, "grad_norm": 9.964399337768555, "learning_rate": 6.503030303030303e-06, "num_tokens": 2058618.0, "completions/mean_length": 86.125, "completions/min_length": 75.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 86.125, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.8563166856765747, "rewards/meter/std": 0.2183181196451187, "rewards/count_adherence/mean": 0.569444477558136, "rewards/count_adherence/std": 0.03928370773792267, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8708333373069763, "rewards/count_floor/std": 0.01178510207682848, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.6219333410263062, "rewards/repeat_penalty/std": 0.20783403515815735, "rewards/repeat_floor/mean": 0.9534505605697632, "rewards/repeat_floor/std": 0.02509978972375393, "rewards/near_duplicate_penalty/mean": 0.8502159118652344, "rewards/near_duplicate_penalty/std": 0.07133748382329941, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.7532573938369751, "rewards/distinct_2/std": 0.14269323647022247, "rewards/total_composite/mean": 0.21906912326812744, "rewards/total_composite/std": 0.09565562754869461, "reward": 0.21906912326812744, "reward_std": 0.09565562754869461, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14156417548656464, "sampling/sampling_logp_difference/max": 3.4508442878723145, "sampling/importance_sampling_ratio/min": 0.031718842685222626, "sampling/importance_sampling_ratio/mean": 1.0200921297073364, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7914101481437683, "clip_ratio/low_mean": 0.05078322812914848, "clip_ratio/low_min": 0.05078322812914848, "clip_ratio/high_mean": 0.06147776357829571, "clip_ratio/high_max": 0.06147776357829571, "clip_ratio/region_mean": 0.11226099170744419, "reward_total_mean": 0.21906912326812744, "reward_meter_mean": 0.8563166856765747, "reward_meter_std": 0.2183181196451187, "reward_count_adherence_mean": 0.569444477558136, "reward_count_adherence_std": 0.03928370773792267, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8708333373069763, "reward_count_floor_std": 0.01178510207682848, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6219333410263062, "reward_repeat_penalty_std": 0.20783403515815735, "reward_repeat_floor_mean": 0.9534505605697632, "reward_repeat_floor_std": 0.02509978972375393, "reward_near_duplicate_penalty_mean": 0.8502159118652344, "reward_near_duplicate_penalty_std": 0.07133748382329941, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.7532573938369751, "reward_distinct_2_std": 0.14269323647022247, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.21906912326812744, "reward_total_composite_std": 0.09565562754869461} {"timestamp_utc": "2026-04-12T20:25:27Z", "mode": "train", "global_step": 1156, "epoch": 0.06083890321562023, "loss": 0.0643, "grad_norm": 14.037107467651367, "learning_rate": 6.5000000000000004e-06, "num_tokens": 2060144.0, "completions/mean_length": 32.75, "completions/min_length": 29.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.75, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.7854678630828857, "rewards/meter/std": 0.33875739574432373, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.8979510068893433, "rewards/repeat_penalty/std": 0.1679760366678238, "rewards/repeat_floor/mean": 0.9875774383544922, "rewards/repeat_floor/std": 0.018704188987612724, "rewards/near_duplicate_penalty/mean": 0.9534009695053101, "rewards/near_duplicate_penalty/std": 0.043604057282209396, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9604700803756714, "rewards/distinct_2/std": 0.08285844326019287, "rewards/total_composite/mean": 0.2822146415710449, "rewards/total_composite/std": 0.1538948267698288, "reward": 0.2822146415710449, "reward_std": 0.1538948267698288, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13271188735961914, "sampling/sampling_logp_difference/max": 1.9485602378845215, "sampling/importance_sampling_ratio/min": 0.1424790620803833, "sampling/importance_sampling_ratio/mean": 1.0143986940383911, "sampling/importance_sampling_ratio/max": 1.859466552734375, "entropy": 0.8529380187392235, "clip_ratio/low_mean": 0.03912673145532608, "clip_ratio/low_min": 0.03912673145532608, "clip_ratio/high_mean": 0.06894915783777833, "clip_ratio/high_max": 0.06894915783777833, "clip_ratio/region_mean": 0.10807588929310441, "reward_total_mean": 0.2822146415710449, "reward_meter_mean": 0.7854678630828857, "reward_meter_std": 0.33875739574432373, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.8979510068893433, "reward_repeat_penalty_std": 0.1679760366678238, "reward_repeat_floor_mean": 0.9875774383544922, "reward_repeat_floor_std": 0.018704188987612724, "reward_near_duplicate_penalty_mean": 0.9534009695053101, "reward_near_duplicate_penalty_std": 0.043604057282209396, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9604700803756714, "reward_distinct_2_std": 0.08285844326019287, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.2822146415710449, "reward_total_composite_std": 0.1538948267698288} {"timestamp_utc": "2026-04-12T20:25:42Z", "mode": "train", "global_step": 1157, "epoch": 0.06089153202463028, "loss": -0.0319, "grad_norm": 5.865137577056885, "learning_rate": 6.496969696969697e-06, "num_tokens": 2061950.0, "completions/mean_length": 118.75, "completions/min_length": 55.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 62.57143020629883, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.48764151334762573, "rewards/meter/std": 0.3870513439178467, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9434781074523926, "rewards/lexical_plausibility/std": 0.1598680317401886, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.7771471738815308, "rewards/repeat_penalty/std": 0.10980329662561417, "rewards/repeat_floor/mean": 0.971560001373291, "rewards/repeat_floor/std": 0.013160254806280136, "rewards/near_duplicate_penalty/mean": 0.8849307298660278, "rewards/near_duplicate_penalty/std": 0.0374838262796402, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8757820129394531, "rewards/distinct_2/std": 0.09655886888504028, "rewards/total_composite/mean": 0.13093577325344086, "rewards/total_composite/std": 0.1346941590309143, "reward": 0.13093577325344086, "reward_std": 0.1346941739320755, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15730227530002594, "sampling/sampling_logp_difference/max": 2.12467098236084, "sampling/importance_sampling_ratio/min": 0.11947227269411087, "sampling/importance_sampling_ratio/mean": 0.9975865483283997, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7934385240077972, "clip_ratio/low_mean": 0.07863768097013235, "clip_ratio/low_min": 0.07863768097013235, "clip_ratio/high_mean": 0.051933810114860535, "clip_ratio/high_max": 0.051933810114860535, "clip_ratio/region_mean": 0.13057149108499289, "reward_total_mean": 0.13093577325344086, "reward_meter_mean": 0.48764151334762573, "reward_meter_std": 0.3870513439178467, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9434781074523926, "reward_lexical_plausibility_std": 0.1598680317401886, "reward_repeat_penalty_mean": 0.7771471738815308, "reward_repeat_penalty_std": 0.10980329662561417, "reward_repeat_floor_mean": 0.971560001373291, "reward_repeat_floor_std": 0.013160254806280136, "reward_near_duplicate_penalty_mean": 0.8849307298660278, "reward_near_duplicate_penalty_std": 0.0374838262796402, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8757820129394531, "reward_distinct_2_std": 0.09655886888504028, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.13093577325344086, "reward_total_composite_std": 0.1346941590309143} {"timestamp_utc": "2026-04-12T20:25:51Z", "mode": "train", "global_step": 1158, "epoch": 0.060944160833640335, "loss": 0.0459, "grad_norm": 15.484068870544434, "learning_rate": 6.493939393939395e-06, "num_tokens": 2063529.0, "completions/mean_length": 38.375, "completions/min_length": 34.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.375, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.6438114643096924, "rewards/meter/std": 0.35187867283821106, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.8934659957885742, "rewards/repeat_penalty/std": 0.08277325332164764, "rewards/repeat_floor/mean": 0.9852427244186401, "rewards/repeat_floor/std": 0.010353182442486286, "rewards/near_duplicate_penalty/mean": 0.9192298650741577, "rewards/near_duplicate_penalty/std": 0.04352216050028801, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9706477522850037, "rewards/distinct_2/std": 0.05773414671421051, "rewards/total_composite/mean": 0.22211618721485138, "rewards/total_composite/std": 0.15434913337230682, "reward": 0.22211618721485138, "reward_std": 0.15434913337230682, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14374874532222748, "sampling/sampling_logp_difference/max": 2.1967883110046387, "sampling/importance_sampling_ratio/min": 0.11115959286689758, "sampling/importance_sampling_ratio/mean": 1.0207242965698242, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8655757308006287, "clip_ratio/low_mean": 0.08804118540138006, "clip_ratio/low_min": 0.08804118540138006, "clip_ratio/high_mean": 0.05212550796568394, "clip_ratio/high_max": 0.05212550796568394, "clip_ratio/region_mean": 0.140166693367064, "reward_total_mean": 0.22211618721485138, "reward_meter_mean": 0.6438114643096924, "reward_meter_std": 0.35187867283821106, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8934659957885742, "reward_repeat_penalty_std": 0.08277325332164764, "reward_repeat_floor_mean": 0.9852427244186401, "reward_repeat_floor_std": 0.010353182442486286, "reward_near_duplicate_penalty_mean": 0.9192298650741577, "reward_near_duplicate_penalty_std": 0.04352216050028801, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9706477522850037, "reward_distinct_2_std": 0.05773414671421051, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.22211618721485138, "reward_total_composite_std": 0.15434913337230682} {"timestamp_utc": "2026-04-12T20:26:05Z", "mode": "train", "global_step": 1159, "epoch": 0.06099678964265039, "loss": -0.0157, "grad_norm": 4.696249008178711, "learning_rate": 6.490909090909091e-06, "num_tokens": 2064964.0, "completions/mean_length": 82.375, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 21.0, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.27648496627807617, "rewards/meter/std": 0.32832154631614685, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9272909164428711, "rewards/lexical_plausibility/std": 0.14972831308841705, "rewards/judge_quality/mean": 0.3837500214576721, "rewards/judge_quality/std": 0.2579555809497833, "rewards/repeat_penalty/mean": 0.7200098037719727, "rewards/repeat_penalty/std": 0.056112002581357956, "rewards/repeat_floor/mean": 0.9800509214401245, "rewards/repeat_floor/std": 0.009941146709024906, "rewards/near_duplicate_penalty/mean": 0.977495551109314, "rewards/near_duplicate_penalty/std": 0.06365221738815308, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.14794588088989258, "rewards/total_composite/std": 0.2056187093257904, "reward": 0.14794588088989258, "reward_std": 0.2056187093257904, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1781710684299469, "sampling/sampling_logp_difference/max": 1.902235507965088, "sampling/importance_sampling_ratio/min": 0.1492346227169037, "sampling/importance_sampling_ratio/mean": 0.9933753609657288, "sampling/importance_sampling_ratio/max": 1.8410460948944092, "entropy": 0.8407760038971901, "clip_ratio/low_mean": 0.031250000931322575, "clip_ratio/low_min": 0.031250000931322575, "clip_ratio/high_mean": 0.034090910106897354, "clip_ratio/high_max": 0.034090910106897354, "clip_ratio/region_mean": 0.06534091103821993, "reward_total_mean": 0.14794588088989258, "reward_meter_mean": 0.27648496627807617, "reward_meter_std": 0.32832154631614685, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9272909164428711, "reward_lexical_plausibility_std": 0.14972831308841705, "reward_repeat_penalty_mean": 0.7200098037719727, "reward_repeat_penalty_std": 0.056112002581357956, "reward_repeat_floor_mean": 0.9800509214401245, "reward_repeat_floor_std": 0.009941146709024906, "reward_near_duplicate_penalty_mean": 0.977495551109314, "reward_near_duplicate_penalty_std": 0.06365221738815308, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.3837500214576721, "reward_judge_quality_std": 0.2579555809497833, "reward_total_composite_mean": 0.14794588088989258, "reward_total_composite_std": 0.2056187093257904} {"timestamp_utc": "2026-04-12T20:26:14Z", "mode": "train", "global_step": 1160, "epoch": 0.06104941845166044, "loss": 0.0581, "grad_norm": 15.720664978027344, "learning_rate": 6.487878787878789e-06, "num_tokens": 2066467.0, "completions/mean_length": 42.875, "completions/min_length": 34.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.875, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.4660980999469757, "rewards/meter/std": 0.3450045585632324, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.8497967720031738, "rewards/repeat_penalty/std": 0.10524605959653854, "rewards/repeat_floor/mean": 0.9820445775985718, "rewards/repeat_floor/std": 0.012370223179459572, "rewards/near_duplicate_penalty/mean": 0.9378513693809509, "rewards/near_duplicate_penalty/std": 0.04161651432514191, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9040762186050415, "rewards/distinct_2/std": 0.08254225552082062, "rewards/total_composite/mean": 0.09876013547182083, "rewards/total_composite/std": 0.08257844299077988, "reward": 0.09876013547182083, "reward_std": 0.08257844299077988, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13839685916900635, "sampling/sampling_logp_difference/max": 2.001260280609131, "sampling/importance_sampling_ratio/min": 0.13516482710838318, "sampling/importance_sampling_ratio/mean": 1.0199694633483887, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9884352087974548, "clip_ratio/low_mean": 0.06572796776890755, "clip_ratio/low_min": 0.06572796776890755, "clip_ratio/high_mean": 0.06660071201622486, "clip_ratio/high_max": 0.06660071201622486, "clip_ratio/region_mean": 0.1323286797851324, "reward_total_mean": 0.09876013547182083, "reward_meter_mean": 0.4660980999469757, "reward_meter_std": 0.3450045585632324, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8497967720031738, "reward_repeat_penalty_std": 0.10524605959653854, "reward_repeat_floor_mean": 0.9820445775985718, "reward_repeat_floor_std": 0.012370223179459572, "reward_near_duplicate_penalty_mean": 0.9378513693809509, "reward_near_duplicate_penalty_std": 0.04161651432514191, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9040762186050415, "reward_distinct_2_std": 0.08254225552082062, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.09876013547182083, "reward_total_composite_std": 0.08257844299077988} {"timestamp_utc": "2026-04-12T20:26:30Z", "mode": "train", "global_step": 1161, "epoch": 0.06110204726067049, "loss": -0.008, "grad_norm": 4.582535266876221, "learning_rate": 6.484848484848485e-06, "num_tokens": 2068065.0, "completions/mean_length": 95.75, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 36.28571701049805, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.17230460047721863, "rewards/meter/std": 0.16195982694625854, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9570178985595703, "rewards/lexical_plausibility/std": 0.12157180905342102, "rewards/judge_quality/mean": 0.4337499737739563, "rewards/judge_quality/std": 0.23868314921855927, "rewards/repeat_penalty/mean": 0.9817172288894653, "rewards/repeat_penalty/std": 0.02288021519780159, "rewards/repeat_floor/mean": 0.9972575902938843, "rewards/repeat_floor/std": 0.003432035446166992, "rewards/near_duplicate_penalty/mean": 0.9817172288894653, "rewards/near_duplicate_penalty/std": 0.02288021519780159, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08432656526565552, "rewards/total_composite/std": 0.10472684353590012, "reward": 0.08432656526565552, "reward_std": 0.10472684353590012, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1567433625459671, "sampling/sampling_logp_difference/max": 1.515317440032959, "sampling/importance_sampling_ratio/min": 0.2197384238243103, "sampling/importance_sampling_ratio/mean": 0.9965807199478149, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8705822378396988, "clip_ratio/low_mean": 0.07751431968063116, "clip_ratio/low_min": 0.07751431968063116, "clip_ratio/high_mean": 0.04292929358780384, "clip_ratio/high_max": 0.04292929358780384, "clip_ratio/region_mean": 0.120443613268435, "reward_total_mean": 0.08432656526565552, "reward_meter_mean": 0.17230460047721863, "reward_meter_std": 0.16195982694625854, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9570178985595703, "reward_lexical_plausibility_std": 0.12157180905342102, "reward_repeat_penalty_mean": 0.9817172288894653, "reward_repeat_penalty_std": 0.02288021519780159, "reward_repeat_floor_mean": 0.9972575902938843, "reward_repeat_floor_std": 0.003432035446166992, "reward_near_duplicate_penalty_mean": 0.9817172288894653, "reward_near_duplicate_penalty_std": 0.02288021519780159, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4337499737739563, "reward_judge_quality_std": 0.23868314921855927, "reward_total_composite_mean": 0.08432656526565552, "reward_total_composite_std": 0.10472684353590012} {"timestamp_utc": "2026-04-12T20:26:45Z", "mode": "train", "global_step": 1162, "epoch": 0.061154676069680544, "loss": -0.079, "grad_norm": 5.631038188934326, "learning_rate": 6.481818181818182e-06, "num_tokens": 2070181.0, "completions/mean_length": 137.5, "completions/min_length": 78.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 84.0, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.6919570565223694, "rewards/meter/std": 0.3975428640842438, "rewards/count_adherence/mean": 0.7749999761581421, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9325000047683716, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.9682310223579407, "rewards/lexical_plausibility/std": 0.08985619992017746, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.8089238405227661, "rewards/repeat_penalty/std": 0.12179581820964813, "rewards/repeat_floor/mean": 0.9776259660720825, "rewards/repeat_floor/std": 0.01334670651704073, "rewards/near_duplicate_penalty/mean": 0.9300089478492737, "rewards/near_duplicate_penalty/std": 0.027919495478272438, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.8732602000236511, "rewards/distinct_2/std": 0.09980998933315277, "rewards/total_composite/mean": 0.20294485986232758, "rewards/total_composite/std": 0.1514461785554886, "reward": 0.20294485986232758, "reward_std": 0.1514461785554886, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11978968977928162, "sampling/sampling_logp_difference/max": 1.9871903657913208, "sampling/importance_sampling_ratio/min": 0.13708002865314484, "sampling/importance_sampling_ratio/mean": 1.0126415491104126, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6159942448139191, "clip_ratio/low_mean": 0.030828980961814523, "clip_ratio/low_min": 0.030828980961814523, "clip_ratio/high_mean": 0.06853400450199842, "clip_ratio/high_max": 0.06853400450199842, "clip_ratio/region_mean": 0.09936298546381295, "reward_total_mean": 0.20294485986232758, "reward_meter_mean": 0.6919570565223694, "reward_meter_std": 0.3975428640842438, "reward_count_adherence_mean": 0.7749999761581421, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9325000047683716, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.9682310223579407, "reward_lexical_plausibility_std": 0.08985619992017746, "reward_repeat_penalty_mean": 0.8089238405227661, "reward_repeat_penalty_std": 0.12179581820964813, "reward_repeat_floor_mean": 0.9776259660720825, "reward_repeat_floor_std": 0.01334670651704073, "reward_near_duplicate_penalty_mean": 0.9300089478492737, "reward_near_duplicate_penalty_std": 0.027919495478272438, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.8732602000236511, "reward_distinct_2_std": 0.09980998933315277, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.20294485986232758, "reward_total_composite_std": 0.1514461785554886} {"timestamp_utc": "2026-04-12T20:26:54Z", "mode": "train", "global_step": 1163, "epoch": 0.0612073048786906, "loss": 0.0485, "grad_norm": 16.970054626464844, "learning_rate": 6.478787878787879e-06, "num_tokens": 2071664.0, "completions/mean_length": 37.375, "completions/min_length": 35.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.375, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.8161476254463196, "rewards/meter/std": 0.27444982528686523, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.8676532506942749, "rewards/repeat_penalty/std": 0.12680873274803162, "rewards/repeat_floor/mean": 0.9854923486709595, "rewards/repeat_floor/std": 0.012804005295038223, "rewards/near_duplicate_penalty/mean": 0.9528676271438599, "rewards/near_duplicate_penalty/std": 0.03966348245739937, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9381910562515259, "rewards/distinct_2/std": 0.07818726450204849, "rewards/total_composite/mean": 0.24345338344573975, "rewards/total_composite/std": 0.11819523572921753, "reward": 0.24345338344573975, "reward_std": 0.11819523572921753, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16171762347221375, "sampling/sampling_logp_difference/max": 2.447770595550537, "sampling/importance_sampling_ratio/min": 0.08648618310689926, "sampling/importance_sampling_ratio/mean": 1.0307674407958984, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7863077223300934, "clip_ratio/low_mean": 0.06299201771616936, "clip_ratio/low_min": 0.06299201771616936, "clip_ratio/high_mean": 0.06924000778235495, "clip_ratio/high_max": 0.06924000778235495, "clip_ratio/region_mean": 0.1322320254985243, "reward_total_mean": 0.24345338344573975, "reward_meter_mean": 0.8161476254463196, "reward_meter_std": 0.27444982528686523, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8676532506942749, "reward_repeat_penalty_std": 0.12680873274803162, "reward_repeat_floor_mean": 0.9854923486709595, "reward_repeat_floor_std": 0.012804005295038223, "reward_near_duplicate_penalty_mean": 0.9528676271438599, "reward_near_duplicate_penalty_std": 0.03966348245739937, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9381910562515259, "reward_distinct_2_std": 0.07818726450204849, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.24345338344573975, "reward_total_composite_std": 0.11819523572921753} {"timestamp_utc": "2026-04-12T20:27:03Z", "mode": "train", "global_step": 1164, "epoch": 0.06125993368770065, "loss": 0.0649, "grad_norm": 20.438199996948242, "learning_rate": 6.475757575757576e-06, "num_tokens": 2073318.0, "completions/mean_length": 32.75, "completions/min_length": 29.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.75, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.9538679122924805, "rewards/meter/std": 0.08358047157526016, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5587499737739563, "rewards/judge_quality/std": 0.1950412094593048, "rewards/repeat_penalty/mean": 0.9687126874923706, "rewards/repeat_penalty/std": 0.054679952561855316, "rewards/repeat_floor/mean": 0.9959474802017212, "rewards/repeat_floor/std": 0.006458973977714777, "rewards/near_duplicate_penalty/mean": 0.9806758165359497, "rewards/near_duplicate_penalty/std": 0.02333887480199337, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9871795177459717, "rewards/distinct_2/std": 0.03626188635826111, "rewards/total_composite/mean": 0.5294739007949829, "rewards/total_composite/std": 0.21466690301895142, "reward": 0.5294739007949829, "reward_std": 0.21466688811779022, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1903575360774994, "sampling/sampling_logp_difference/max": 2.798466682434082, "sampling/importance_sampling_ratio/min": 0.06090337410569191, "sampling/importance_sampling_ratio/mean": 1.0329440832138062, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7618510350584984, "clip_ratio/low_mean": 0.12161163985729218, "clip_ratio/low_min": 0.12161163985729218, "clip_ratio/high_mean": 0.047407833859324455, "clip_ratio/high_max": 0.047407833859324455, "clip_ratio/region_mean": 0.16901947371661663, "reward_total_mean": 0.5294739007949829, "reward_meter_mean": 0.9538679122924805, "reward_meter_std": 0.08358047157526016, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9687126874923706, "reward_repeat_penalty_std": 0.054679952561855316, "reward_repeat_floor_mean": 0.9959474802017212, "reward_repeat_floor_std": 0.006458973977714777, "reward_near_duplicate_penalty_mean": 0.9806758165359497, "reward_near_duplicate_penalty_std": 0.02333887480199337, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9871795177459717, "reward_distinct_2_std": 0.03626188635826111, "reward_judge_quality_mean": 0.5587499737739563, "reward_judge_quality_std": 0.1950412094593048, "reward_total_composite_mean": 0.5294739007949829, "reward_total_composite_std": 0.21466690301895142} {"timestamp_utc": "2026-04-12T20:27:12Z", "mode": "train", "global_step": 1165, "epoch": 0.0613125624967107, "loss": 0.0393, "grad_norm": 15.200995445251465, "learning_rate": 6.472727272727272e-06, "num_tokens": 2074913.0, "completions/mean_length": 35.375, "completions/min_length": 32.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.375, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.42000287771224976, "rewards/meter/std": 0.3212505877017975, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.21249999105930328, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.7220735549926758, "rewards/repeat_penalty/std": 0.2497500330209732, "rewards/repeat_floor/mean": 0.9631826281547546, "rewards/repeat_floor/std": 0.03353746607899666, "rewards/near_duplicate_penalty/mean": 0.8581938743591309, "rewards/near_duplicate_penalty/std": 0.11930513381958008, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8689281940460205, "rewards/distinct_2/std": 0.14304015040397644, "rewards/total_composite/mean": 0.100531205534935, "rewards/total_composite/std": 0.10330844670534134, "reward": 0.100531205534935, "reward_std": 0.10330844670534134, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11675301939249039, "sampling/sampling_logp_difference/max": 1.809838056564331, "sampling/importance_sampling_ratio/min": 0.16368064284324646, "sampling/importance_sampling_ratio/mean": 1.0187861919403076, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.89546187967062, "clip_ratio/low_mean": 0.03737593372352421, "clip_ratio/low_min": 0.03737593372352421, "clip_ratio/high_mean": 0.08466759137809277, "clip_ratio/high_max": 0.08466759137809277, "clip_ratio/region_mean": 0.12204352510161698, "reward_total_mean": 0.100531205534935, "reward_meter_mean": 0.42000287771224976, "reward_meter_std": 0.3212505877017975, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7220735549926758, "reward_repeat_penalty_std": 0.2497500330209732, "reward_repeat_floor_mean": 0.9631826281547546, "reward_repeat_floor_std": 0.03353746607899666, "reward_near_duplicate_penalty_mean": 0.8581938743591309, "reward_near_duplicate_penalty_std": 0.11930513381958008, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8689281940460205, "reward_distinct_2_std": 0.14304015040397644, "reward_judge_quality_mean": 0.21249999105930328, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.100531205534935, "reward_total_composite_std": 0.10330844670534134} {"timestamp_utc": "2026-04-12T20:27:21Z", "mode": "train", "global_step": 1166, "epoch": 0.061365191305720754, "loss": 0.0533, "grad_norm": 22.2900447845459, "learning_rate": 6.4696969696969705e-06, "num_tokens": 2076663.0, "completions/mean_length": 46.75, "completions/min_length": 41.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.75, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.8413935303688049, "rewards/meter/std": 0.26518484950065613, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4124999940395355, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9452246427536011, "rewards/repeat_penalty/std": 0.039447903633117676, "rewards/repeat_floor/mean": 0.9932481050491333, "rewards/repeat_floor/std": 0.004163719248026609, "rewards/near_duplicate_penalty/mean": 0.9708089232444763, "rewards/near_duplicate_penalty/std": 0.016380518674850464, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9736305475234985, "rewards/distinct_2/std": 0.03655470907688141, "rewards/total_composite/mean": 0.31506264209747314, "rewards/total_composite/std": 0.1310979276895523, "reward": 0.31506264209747314, "reward_std": 0.1310979276895523, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14283476769924164, "sampling/sampling_logp_difference/max": 1.736236572265625, "sampling/importance_sampling_ratio/min": 0.1938168853521347, "sampling/importance_sampling_ratio/mean": 1.003521203994751, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6892067454755306, "clip_ratio/low_mean": 0.047656466253101826, "clip_ratio/low_min": 0.047656466253101826, "clip_ratio/high_mean": 0.06528578093275428, "clip_ratio/high_max": 0.06528578093275428, "clip_ratio/region_mean": 0.1129422471858561, "reward_total_mean": 0.31506264209747314, "reward_meter_mean": 0.8413935303688049, "reward_meter_std": 0.26518484950065613, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9452246427536011, "reward_repeat_penalty_std": 0.039447903633117676, "reward_repeat_floor_mean": 0.9932481050491333, "reward_repeat_floor_std": 0.004163719248026609, "reward_near_duplicate_penalty_mean": 0.9708089232444763, "reward_near_duplicate_penalty_std": 0.016380518674850464, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9736305475234985, "reward_distinct_2_std": 0.03655470907688141, "reward_judge_quality_mean": 0.4124999940395355, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.31506264209747314, "reward_total_composite_std": 0.1310979276895523} {"timestamp_utc": "2026-04-12T20:27:31Z", "mode": "train", "global_step": 1167, "epoch": 0.061417820114730806, "loss": -0.0126, "grad_norm": 15.429891586303711, "learning_rate": 6.466666666666667e-06, "num_tokens": 2078270.0, "completions/mean_length": 37.875, "completions/min_length": 32.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.875, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.580768883228302, "rewards/meter/std": 0.35080647468566895, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5424999594688416, "rewards/judge_quality/std": 0.23705033957958221, "rewards/repeat_penalty/mean": 0.9361674785614014, "rewards/repeat_penalty/std": 0.11030331999063492, "rewards/repeat_floor/mean": 0.9932888150215149, "rewards/repeat_floor/std": 0.008743004873394966, "rewards/near_duplicate_penalty/mean": 0.9738315939903259, "rewards/near_duplicate_penalty/std": 0.021498937159776688, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.36090075969696045, "rewards/total_composite/std": 0.32910487055778503, "reward": 0.36090075969696045, "reward_std": 0.32910484075546265, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15758608281612396, "sampling/sampling_logp_difference/max": 1.8015403747558594, "sampling/importance_sampling_ratio/min": 0.16504447162151337, "sampling/importance_sampling_ratio/mean": 1.0100774765014648, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.893947422504425, "clip_ratio/low_mean": 0.0787806436419487, "clip_ratio/low_min": 0.0787806436419487, "clip_ratio/high_mean": 0.04233381152153015, "clip_ratio/high_max": 0.04233381152153015, "clip_ratio/region_mean": 0.12111445516347885, "reward_total_mean": 0.36090075969696045, "reward_meter_mean": 0.580768883228302, "reward_meter_std": 0.35080647468566895, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9361674785614014, "reward_repeat_penalty_std": 0.11030331999063492, "reward_repeat_floor_mean": 0.9932888150215149, "reward_repeat_floor_std": 0.008743004873394966, "reward_near_duplicate_penalty_mean": 0.9738315939903259, "reward_near_duplicate_penalty_std": 0.021498937159776688, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.5424999594688416, "reward_judge_quality_std": 0.23705033957958221, "reward_total_composite_mean": 0.36090075969696045, "reward_total_composite_std": 0.32910487055778503} {"timestamp_utc": "2026-04-12T20:27:45Z", "mode": "train", "global_step": 1168, "epoch": 0.06147044892374086, "loss": -0.0721, "grad_norm": 6.22426176071167, "learning_rate": 6.463636363636364e-06, "num_tokens": 2080252.0, "completions/mean_length": 125.75, "completions/min_length": 62.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 70.5714340209961, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 83.0, "rewards/meter/mean": 0.6669456958770752, "rewards/meter/std": 0.35373440384864807, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 0.9652393460273743, "rewards/lexical_plausibility/std": 0.0983179584145546, "rewards/judge_quality/mean": 0.29374998807907104, "rewards/judge_quality/std": 0.14500615000724792, "rewards/repeat_penalty/mean": 0.897933304309845, "rewards/repeat_penalty/std": 0.060476645827293396, "rewards/repeat_floor/mean": 0.9872768521308899, "rewards/repeat_floor/std": 0.00716354139149189, "rewards/near_duplicate_penalty/mean": 0.9456610679626465, "rewards/near_duplicate_penalty/std": 0.03142561390995979, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9491965174674988, "rewards/distinct_2/std": 0.04890682175755501, "rewards/total_composite/mean": 0.20631453394889832, "rewards/total_composite/std": 0.14997436106204987, "reward": 0.20631453394889832, "reward_std": 0.14997434616088867, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14736725389957428, "sampling/sampling_logp_difference/max": 1.6134846210479736, "sampling/importance_sampling_ratio/min": 0.19919230043888092, "sampling/importance_sampling_ratio/mean": 1.0059081315994263, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8500893861055374, "clip_ratio/low_mean": 0.027432807721197605, "clip_ratio/low_min": 0.027432807721197605, "clip_ratio/high_mean": 0.08002971019595861, "clip_ratio/high_max": 0.08002971019595861, "clip_ratio/region_mean": 0.10746251791715622, "reward_total_mean": 0.20631453394889832, "reward_meter_mean": 0.6669456958770752, "reward_meter_std": 0.35373440384864807, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 0.9652393460273743, "reward_lexical_plausibility_std": 0.0983179584145546, "reward_repeat_penalty_mean": 0.897933304309845, "reward_repeat_penalty_std": 0.060476645827293396, "reward_repeat_floor_mean": 0.9872768521308899, "reward_repeat_floor_std": 0.00716354139149189, "reward_near_duplicate_penalty_mean": 0.9456610679626465, "reward_near_duplicate_penalty_std": 0.03142561390995979, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9491965174674988, "reward_distinct_2_std": 0.04890682175755501, "reward_judge_quality_mean": 0.29374998807907104, "reward_judge_quality_std": 0.14500615000724792, "reward_total_composite_mean": 0.20631453394889832, "reward_total_composite_std": 0.14997436106204987} {"timestamp_utc": "2026-04-12T20:28:00Z", "mode": "train", "global_step": 1169, "epoch": 0.06152307773275091, "loss": -0.0233, "grad_norm": 1.5329583883285522, "learning_rate": 6.460606060606061e-06, "num_tokens": 2081900.0, "completions/mean_length": 287.0, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 62.0, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.16482141613960266, "rewards/meter/std": 0.20791269838809967, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.18898223340511322, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.05669468268752098, "rewards/lexical_plausibility/mean": 0.8037311434745789, "rewards/lexical_plausibility/std": 0.21235255897045135, "rewards/judge_quality/mean": 0.1875, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9125614762306213, "rewards/repeat_penalty/std": 0.0802270919084549, "rewards/repeat_floor/mean": 0.9909461736679077, "rewards/repeat_floor/std": 0.00573686184361577, "rewards/near_duplicate_penalty/mean": 0.9670474529266357, "rewards/near_duplicate_penalty/std": 0.0214032381772995, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9751566052436829, "rewards/distinct_2/std": 0.026700975373387337, "rewards/total_composite/mean": 0.03795194625854492, "rewards/total_composite/std": 0.06141568720340729, "reward": 0.03795194625854492, "reward_std": 0.06141568347811699, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1377536654472351, "sampling/sampling_logp_difference/max": 1.4968687295913696, "sampling/importance_sampling_ratio/min": 0.2238299548625946, "sampling/importance_sampling_ratio/mean": 1.0231471061706543, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.46314381062984467, "clip_ratio/low_mean": 0.03395562805235386, "clip_ratio/low_min": 0.03395562805235386, "clip_ratio/high_mean": 0.03532608784735203, "clip_ratio/high_max": 0.03532608784735203, "clip_ratio/region_mean": 0.06928171589970589, "reward_total_mean": 0.03795194625854492, "reward_meter_mean": 0.16482141613960266, "reward_meter_std": 0.20791269838809967, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.18898223340511322, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.05669468268752098, "reward_lexical_plausibility_mean": 0.8037311434745789, "reward_lexical_plausibility_std": 0.21235255897045135, "reward_repeat_penalty_mean": 0.9125614762306213, "reward_repeat_penalty_std": 0.0802270919084549, "reward_repeat_floor_mean": 0.9909461736679077, "reward_repeat_floor_std": 0.00573686184361577, "reward_near_duplicate_penalty_mean": 0.9670474529266357, "reward_near_duplicate_penalty_std": 0.0214032381772995, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9751566052436829, "reward_distinct_2_std": 0.026700975373387337, "reward_judge_quality_mean": 0.1875, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.03795194625854492, "reward_total_composite_std": 0.06141568720340729} {"timestamp_utc": "2026-04-12T20:28:10Z", "mode": "train", "global_step": 1170, "epoch": 0.06157570654176096, "loss": 0.0431, "grad_norm": 15.129555702209473, "learning_rate": 6.457575757575758e-06, "num_tokens": 2083562.0, "completions/mean_length": 36.75, "completions/min_length": 35.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.75, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.5394048690795898, "rewards/meter/std": 0.3251197338104248, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.7317183017730713, "rewards/repeat_penalty/std": 0.2782125771045685, "rewards/repeat_floor/mean": 0.965384840965271, "rewards/repeat_floor/std": 0.03441338613629341, "rewards/near_duplicate_penalty/mean": 0.8558469414710999, "rewards/near_duplicate_penalty/std": 0.09792716056108475, "rewards/opening_diversity/mean": 0.859375, "rewards/opening_diversity/std": 0.2259652018547058, "rewards/distinct_2/mean": 0.9493926763534546, "rewards/distinct_2/std": 0.08588341623544693, "rewards/total_composite/mean": 0.20513157546520233, "rewards/total_composite/std": 0.1099473237991333, "reward": 0.20513157546520233, "reward_std": 0.1099473237991333, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1395585685968399, "sampling/sampling_logp_difference/max": 1.2856788635253906, "sampling/importance_sampling_ratio/min": 0.3174495995044708, "sampling/importance_sampling_ratio/mean": 1.025923490524292, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2124241590499878, "clip_ratio/low_mean": 0.038241437170654535, "clip_ratio/low_min": 0.038241437170654535, "clip_ratio/high_mean": 0.08114373125135899, "clip_ratio/high_max": 0.08114373125135899, "clip_ratio/region_mean": 0.11938516842201352, "reward_total_mean": 0.20513157546520233, "reward_meter_mean": 0.5394048690795898, "reward_meter_std": 0.3251197338104248, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7317183017730713, "reward_repeat_penalty_std": 0.2782125771045685, "reward_repeat_floor_mean": 0.965384840965271, "reward_repeat_floor_std": 0.03441338613629341, "reward_near_duplicate_penalty_mean": 0.8558469414710999, "reward_near_duplicate_penalty_std": 0.09792716056108475, "reward_opening_diversity_mean": 0.859375, "reward_opening_diversity_std": 0.2259652018547058, "reward_distinct_2_mean": 0.9493926763534546, "reward_distinct_2_std": 0.08588341623544693, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.20513157546520233, "reward_total_composite_std": 0.1099473237991333} {"timestamp_utc": "2026-04-12T20:28:25Z", "mode": "train", "global_step": 1171, "epoch": 0.06162833535077101, "loss": -0.1211, "grad_norm": 2.693272829055786, "learning_rate": 6.454545454545456e-06, "num_tokens": 2085432.0, "completions/mean_length": 180.75, "completions/min_length": 61.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 70.33333587646484, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.6504790186882019, "rewards/meter/std": 0.3757871985435486, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 0.9116208553314209, "rewards/lexical_plausibility/std": 0.16364926099777222, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.8919795751571655, "rewards/repeat_penalty/std": 0.07459060847759247, "rewards/repeat_floor/mean": 0.9868773818016052, "rewards/repeat_floor/std": 0.008385890163481236, "rewards/near_duplicate_penalty/mean": 0.9481184482574463, "rewards/near_duplicate_penalty/std": 0.03529313579201698, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9406622648239136, "rewards/distinct_2/std": 0.06901639699935913, "rewards/total_composite/mean": 0.18823757767677307, "rewards/total_composite/std": 0.1282653957605362, "reward": 0.18823757767677307, "reward_std": 0.1282653957605362, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15525995194911957, "sampling/sampling_logp_difference/max": 1.603744626045227, "sampling/importance_sampling_ratio/min": 0.20114189386367798, "sampling/importance_sampling_ratio/mean": 1.0033159255981445, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6417087316513062, "clip_ratio/low_mean": 0.021604938432574272, "clip_ratio/low_min": 0.021604938432574272, "clip_ratio/high_mean": 0.09305895399302244, "clip_ratio/high_max": 0.09305895399302244, "clip_ratio/region_mean": 0.11466389242559671, "reward_total_mean": 0.18823757767677307, "reward_meter_mean": 0.6504790186882019, "reward_meter_std": 0.3757871985435486, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 0.9116208553314209, "reward_lexical_plausibility_std": 0.16364926099777222, "reward_repeat_penalty_mean": 0.8919795751571655, "reward_repeat_penalty_std": 0.07459060847759247, "reward_repeat_floor_mean": 0.9868773818016052, "reward_repeat_floor_std": 0.008385890163481236, "reward_near_duplicate_penalty_mean": 0.9481184482574463, "reward_near_duplicate_penalty_std": 0.03529313579201698, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9406622648239136, "reward_distinct_2_std": 0.06901639699935913, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.18823757767677307, "reward_total_composite_std": 0.1282653957605362} {"timestamp_utc": "2026-04-12T20:28:40Z", "mode": "train", "global_step": 1172, "epoch": 0.06168096415978106, "loss": -0.0842, "grad_norm": 4.343000888824463, "learning_rate": 6.451515151515152e-06, "num_tokens": 2087867.0, "completions/mean_length": 206.375, "completions/min_length": 89.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 104.5, "completions/min_terminated_length": 89.0, "completions/max_terminated_length": 125.0, "rewards/meter/mean": 0.25451478362083435, "rewards/meter/std": 0.3005032539367676, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.06681530922651291, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.020044591277837753, "rewards/lexical_plausibility/mean": 0.8755115270614624, "rewards/lexical_plausibility/std": 0.17141562700271606, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9441555738449097, "rewards/repeat_penalty/std": 0.08863238245248795, "rewards/repeat_floor/mean": 0.9929077625274658, "rewards/repeat_floor/std": 0.009711802005767822, "rewards/near_duplicate_penalty/mean": 0.9686335325241089, "rewards/near_duplicate_penalty/std": 0.022336483001708984, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9734748005867004, "rewards/distinct_2/std": 0.07502459734678268, "rewards/total_composite/mean": 0.08731585741043091, "rewards/total_composite/std": 0.11921091377735138, "reward": 0.08731585741043091, "reward_std": 0.11921091377735138, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15906591713428497, "sampling/sampling_logp_difference/max": 2.512744426727295, "sampling/importance_sampling_ratio/min": 0.08104550838470459, "sampling/importance_sampling_ratio/mean": 1.0241643190383911, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6895046234130859, "clip_ratio/low_mean": 0.08757777698338032, "clip_ratio/low_min": 0.08757777698338032, "clip_ratio/high_mean": 0.021990740671753883, "clip_ratio/high_max": 0.021990740671753883, "clip_ratio/region_mean": 0.1095685176551342, "reward_total_mean": 0.08731585741043091, "reward_meter_mean": 0.25451478362083435, "reward_meter_std": 0.3005032539367676, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.06681530922651291, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.020044591277837753, "reward_lexical_plausibility_mean": 0.8755115270614624, "reward_lexical_plausibility_std": 0.17141562700271606, "reward_repeat_penalty_mean": 0.9441555738449097, "reward_repeat_penalty_std": 0.08863238245248795, "reward_repeat_floor_mean": 0.9929077625274658, "reward_repeat_floor_std": 0.009711802005767822, "reward_near_duplicate_penalty_mean": 0.9686335325241089, "reward_near_duplicate_penalty_std": 0.022336483001708984, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9734748005867004, "reward_distinct_2_std": 0.07502459734678268, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.08731585741043091, "reward_total_composite_std": 0.11921091377735138} {"timestamp_utc": "2026-04-12T20:28:54Z", "mode": "train", "global_step": 1173, "epoch": 0.061733592968791114, "loss": -0.0676, "grad_norm": 3.6703689098358154, "learning_rate": 6.4484848484848496e-06, "num_tokens": 2089366.0, "completions/mean_length": 94.375, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 34.71428680419922, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.7640120983123779, "rewards/meter/std": 0.3361947238445282, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9438018798828125, "rewards/lexical_plausibility/std": 0.15895235538482666, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.14880476891994476, "rewards/repeat_penalty/mean": 0.8772763013839722, "rewards/repeat_penalty/std": 0.09475304186344147, "rewards/repeat_floor/mean": 0.9869712591171265, "rewards/repeat_floor/std": 0.009290582500398159, "rewards/near_duplicate_penalty/mean": 0.9571102261543274, "rewards/near_duplicate_penalty/std": 0.03337300941348076, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9475524425506592, "rewards/distinct_2/std": 0.06198638677597046, "rewards/total_composite/mean": 0.231920063495636, "rewards/total_composite/std": 0.14521637558937073, "reward": 0.231920063495636, "reward_std": 0.14521637558937073, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1311490833759308, "sampling/sampling_logp_difference/max": 1.021317958831787, "sampling/importance_sampling_ratio/min": 0.4232490062713623, "sampling/importance_sampling_ratio/mean": 1.0339765548706055, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7758961468935013, "clip_ratio/low_mean": 0.06531531736254692, "clip_ratio/low_min": 0.06531531736254692, "clip_ratio/high_mean": 0.07865659799426794, "clip_ratio/high_max": 0.07865659799426794, "clip_ratio/region_mean": 0.14397191535681486, "reward_total_mean": 0.231920063495636, "reward_meter_mean": 0.7640120983123779, "reward_meter_std": 0.3361947238445282, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9438018798828125, "reward_lexical_plausibility_std": 0.15895235538482666, "reward_repeat_penalty_mean": 0.8772763013839722, "reward_repeat_penalty_std": 0.09475304186344147, "reward_repeat_floor_mean": 0.9869712591171265, "reward_repeat_floor_std": 0.009290582500398159, "reward_near_duplicate_penalty_mean": 0.9571102261543274, "reward_near_duplicate_penalty_std": 0.03337300941348076, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9475524425506592, "reward_distinct_2_std": 0.06198638677597046, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.14880476891994476, "reward_total_composite_mean": 0.231920063495636, "reward_total_composite_std": 0.14521637558937073} {"timestamp_utc": "2026-04-12T20:29:02Z", "mode": "train", "global_step": 1174, "epoch": 0.061786221777801166, "loss": 0.0343, "grad_norm": 12.081247329711914, "learning_rate": 6.445454545454546e-06, "num_tokens": 2091383.0, "completions/mean_length": 73.125, "completions/min_length": 69.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 73.125, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.2684102952480316, "rewards/meter/std": 0.2224985808134079, "rewards/count_adherence/mean": 0.7142857313156128, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.9437500238418579, "rewards/arabic_floor/std": 0.0776323676109314, "rewards/count_floor/mean": 0.9142857193946838, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32124999165534973, "rewards/judge_quality/std": 0.2613939344882965, "rewards/repeat_penalty/mean": 0.9842795133590698, "rewards/repeat_penalty/std": 0.011036689393222332, "rewards/repeat_floor/mean": 0.997641921043396, "rewards/repeat_floor/std": 0.0016554942121729255, "rewards/near_duplicate_penalty/mean": 0.9842795133590698, "rewards/near_duplicate_penalty/std": 0.011036689393222332, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11585226655006409, "rewards/total_composite/std": 0.21081215143203735, "reward": 0.11585226655006409, "reward_std": 0.21081213653087616, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1400773823261261, "sampling/sampling_logp_difference/max": 3.6298511028289795, "sampling/importance_sampling_ratio/min": 0.026520133018493652, "sampling/importance_sampling_ratio/mean": 0.9967420101165771, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.4955849088728428, "clip_ratio/low_mean": 0.07609959505498409, "clip_ratio/low_min": 0.07609959505498409, "clip_ratio/high_mean": 0.014999999664723873, "clip_ratio/high_max": 0.014999999664723873, "clip_ratio/region_mean": 0.09109959471970797, "reward_total_mean": 0.11585226655006409, "reward_meter_mean": 0.2684102952480316, "reward_meter_std": 0.2224985808134079, "reward_count_adherence_mean": 0.7142857313156128, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.9437500238418579, "reward_arabic_floor_std": 0.0776323676109314, "reward_count_floor_mean": 0.9142857193946838, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9842795133590698, "reward_repeat_penalty_std": 0.011036689393222332, "reward_repeat_floor_mean": 0.997641921043396, "reward_repeat_floor_std": 0.0016554942121729255, "reward_near_duplicate_penalty_mean": 0.9842795133590698, "reward_near_duplicate_penalty_std": 0.011036689393222332, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32124999165534973, "reward_judge_quality_std": 0.2613939344882965, "reward_total_composite_mean": 0.11585226655006409, "reward_total_composite_std": 0.21081215143203735} {"timestamp_utc": "2026-04-12T20:29:17Z", "mode": "train", "global_step": 1175, "epoch": 0.06183885058681122, "loss": -0.1229, "grad_norm": 2.8570423126220703, "learning_rate": 6.442424242424243e-06, "num_tokens": 2093107.0, "completions/mean_length": 169.5, "completions/min_length": 39.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 55.333335876464844, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.6233956813812256, "rewards/meter/std": 0.34679114818573, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175493285059929, "rewards/lexical_plausibility/mean": 0.9061822891235352, "rewards/lexical_plausibility/std": 0.17565475404262543, "rewards/judge_quality/mean": 0.24374999105930328, "rewards/judge_quality/std": 0.17816023528575897, "rewards/repeat_penalty/mean": 0.8485980033874512, "rewards/repeat_penalty/std": 0.10092641413211823, "rewards/repeat_floor/mean": 0.9814270734786987, "rewards/repeat_floor/std": 0.013136054389178753, "rewards/near_duplicate_penalty/mean": 0.9245766401290894, "rewards/near_duplicate_penalty/std": 0.059332989156246185, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.9276729226112366, "rewards/distinct_2/std": 0.06419502943754196, "rewards/total_composite/mean": 0.13856390118598938, "rewards/total_composite/std": 0.10914583504199982, "reward": 0.13856390118598938, "reward_std": 0.10914584249258041, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14658518135547638, "sampling/sampling_logp_difference/max": 1.446281909942627, "sampling/importance_sampling_ratio/min": 0.2354440689086914, "sampling/importance_sampling_ratio/mean": 1.021836757659912, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7347785532474518, "clip_ratio/low_mean": 0.023690078407526016, "clip_ratio/low_min": 0.023690078407526016, "clip_ratio/high_mean": 0.06728896172717214, "clip_ratio/high_max": 0.06728896172717214, "clip_ratio/region_mean": 0.09097904013469815, "reward_total_mean": 0.13856390118598938, "reward_meter_mean": 0.6233956813812256, "reward_meter_std": 0.34679114818573, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175493285059929, "reward_lexical_plausibility_mean": 0.9061822891235352, "reward_lexical_plausibility_std": 0.17565475404262543, "reward_repeat_penalty_mean": 0.8485980033874512, "reward_repeat_penalty_std": 0.10092641413211823, "reward_repeat_floor_mean": 0.9814270734786987, "reward_repeat_floor_std": 0.013136054389178753, "reward_near_duplicate_penalty_mean": 0.9245766401290894, "reward_near_duplicate_penalty_std": 0.059332989156246185, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.9276729226112366, "reward_distinct_2_std": 0.06419502943754196, "reward_judge_quality_mean": 0.24374999105930328, "reward_judge_quality_std": 0.17816023528575897, "reward_total_composite_mean": 0.13856390118598938, "reward_total_composite_std": 0.10914583504199982} {"timestamp_utc": "2026-04-12T20:29:27Z", "mode": "train", "global_step": 1176, "epoch": 0.06189147939582127, "loss": 0.0915, "grad_norm": 10.135137557983398, "learning_rate": 6.43939393939394e-06, "num_tokens": 2095301.0, "completions/mean_length": 83.25, "completions/min_length": 73.0, "completions/max_length": 96.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 83.25, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 96.0, "rewards/meter/mean": 0.646192193031311, "rewards/meter/std": 0.37273940443992615, "rewards/count_adherence/mean": 0.5892857313156128, "rewards/count_adherence/std": 0.05050762742757797, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8767856955528259, "rewards/count_floor/std": 0.015152297914028168, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.7674247026443481, "rewards/repeat_penalty/std": 0.15474501252174377, "rewards/repeat_floor/mean": 0.9736853837966919, "rewards/repeat_floor/std": 0.01742369867861271, "rewards/near_duplicate_penalty/mean": 0.9230344891548157, "rewards/near_duplicate_penalty/std": 0.04531843215227127, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8358914852142334, "rewards/distinct_2/std": 0.1191958338022232, "rewards/total_composite/mean": 0.15712034702301025, "rewards/total_composite/std": 0.09755794703960419, "reward": 0.15712034702301025, "reward_std": 0.09755793958902359, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13611240684986115, "sampling/sampling_logp_difference/max": 2.0423898696899414, "sampling/importance_sampling_ratio/min": 0.12971831858158112, "sampling/importance_sampling_ratio/mean": 1.0118257999420166, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8137337416410446, "clip_ratio/low_mean": 0.06493366323411465, "clip_ratio/low_min": 0.06493366323411465, "clip_ratio/high_mean": 0.04521361459046602, "clip_ratio/high_max": 0.04521361459046602, "clip_ratio/region_mean": 0.11014727782458067, "reward_total_mean": 0.15712034702301025, "reward_meter_mean": 0.646192193031311, "reward_meter_std": 0.37273940443992615, "reward_count_adherence_mean": 0.5892857313156128, "reward_count_adherence_std": 0.05050762742757797, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8767856955528259, "reward_count_floor_std": 0.015152297914028168, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7674247026443481, "reward_repeat_penalty_std": 0.15474501252174377, "reward_repeat_floor_mean": 0.9736853837966919, "reward_repeat_floor_std": 0.01742369867861271, "reward_near_duplicate_penalty_mean": 0.9230344891548157, "reward_near_duplicate_penalty_std": 0.04531843215227127, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8358914852142334, "reward_distinct_2_std": 0.1191958338022232, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.15712034702301025, "reward_total_composite_std": 0.09755794703960419} {"timestamp_utc": "2026-04-12T20:29:36Z", "mode": "train", "global_step": 1177, "epoch": 0.06194410820483132, "loss": 0.0172, "grad_norm": 11.781129837036133, "learning_rate": 6.436363636363637e-06, "num_tokens": 2097376.0, "completions/mean_length": 75.375, "completions/min_length": 65.0, "completions/max_length": 85.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 75.375, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 85.0, "rewards/meter/mean": 0.4562099575996399, "rewards/meter/std": 0.30367332696914673, "rewards/count_adherence/mean": 0.7321428656578064, "rewards/count_adherence/std": 0.05050762742757797, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9196428060531616, "rewards/count_floor/std": 0.015152277424931526, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.8536198139190674, "rewards/repeat_penalty/std": 0.19675740599632263, "rewards/repeat_floor/mean": 0.9849412441253662, "rewards/repeat_floor/std": 0.017513787373900414, "rewards/near_duplicate_penalty/mean": 0.957760214805603, "rewards/near_duplicate_penalty/std": 0.032522544264793396, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9030799865722656, "rewards/distinct_2/std": 0.14267270267009735, "rewards/total_composite/mean": 0.14770402014255524, "rewards/total_composite/std": 0.09274586290121078, "reward": 0.14770402014255524, "reward_std": 0.09274585545063019, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14335109293460846, "sampling/sampling_logp_difference/max": 2.8070526123046875, "sampling/importance_sampling_ratio/min": 0.06038270518183708, "sampling/importance_sampling_ratio/mean": 1.0255144834518433, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7056219540536404, "clip_ratio/low_mean": 0.08524096012115479, "clip_ratio/low_min": 0.08524096012115479, "clip_ratio/high_mean": 0.04571624659001827, "clip_ratio/high_max": 0.04571624659001827, "clip_ratio/region_mean": 0.13095720671117306, "reward_total_mean": 0.14770402014255524, "reward_meter_mean": 0.4562099575996399, "reward_meter_std": 0.30367332696914673, "reward_count_adherence_mean": 0.7321428656578064, "reward_count_adherence_std": 0.05050762742757797, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9196428060531616, "reward_count_floor_std": 0.015152277424931526, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8536198139190674, "reward_repeat_penalty_std": 0.19675740599632263, "reward_repeat_floor_mean": 0.9849412441253662, "reward_repeat_floor_std": 0.017513787373900414, "reward_near_duplicate_penalty_mean": 0.957760214805603, "reward_near_duplicate_penalty_std": 0.032522544264793396, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9030799865722656, "reward_distinct_2_std": 0.14267270267009735, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.14770402014255524, "reward_total_composite_std": 0.09274586290121078} {"timestamp_utc": "2026-04-12T20:29:46Z", "mode": "train", "global_step": 1178, "epoch": 0.061996737013841376, "loss": 0.0706, "grad_norm": 16.067766189575195, "learning_rate": 6.433333333333333e-06, "num_tokens": 2098961.0, "completions/mean_length": 35.125, "completions/min_length": 28.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.125, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.3932083249092102, "rewards/meter/std": 0.31237199902534485, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.2620250880718231, "rewards/repeat_penalty/mean": 0.9277840852737427, "rewards/repeat_penalty/std": 0.12222915887832642, "rewards/repeat_floor/mean": 0.9925423860549927, "rewards/repeat_floor/std": 0.010928593575954437, "rewards/near_duplicate_penalty/mean": 0.9765478372573853, "rewards/near_duplicate_penalty/std": 0.022501083090901375, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9770580530166626, "rewards/distinct_2/std": 0.04287045821547508, "rewards/total_composite/mean": 0.25220540165901184, "rewards/total_composite/std": 0.29897743463516235, "reward": 0.25220540165901184, "reward_std": 0.29897740483283997, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.2015005648136139, "sampling/sampling_logp_difference/max": 4.263955116271973, "sampling/importance_sampling_ratio/min": 0.01406655739992857, "sampling/importance_sampling_ratio/mean": 1.0184476375579834, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0405635833740234, "clip_ratio/low_mean": 0.08031512796878815, "clip_ratio/low_min": 0.08031512796878815, "clip_ratio/high_mean": 0.0418560616672039, "clip_ratio/high_max": 0.0418560616672039, "clip_ratio/region_mean": 0.12217118963599205, "reward_total_mean": 0.25220540165901184, "reward_meter_mean": 0.3932083249092102, "reward_meter_std": 0.31237199902534485, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9277840852737427, "reward_repeat_penalty_std": 0.12222915887832642, "reward_repeat_floor_mean": 0.9925423860549927, "reward_repeat_floor_std": 0.010928593575954437, "reward_near_duplicate_penalty_mean": 0.9765478372573853, "reward_near_duplicate_penalty_std": 0.022501083090901375, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9770580530166626, "reward_distinct_2_std": 0.04287045821547508, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.2620250880718231, "reward_total_composite_mean": 0.25220540165901184, "reward_total_composite_std": 0.29897743463516235} {"timestamp_utc": "2026-04-12T20:30:01Z", "mode": "train", "global_step": 1179, "epoch": 0.06204936582285143, "loss": -0.1342, "grad_norm": 5.803771495819092, "learning_rate": 6.430303030303031e-06, "num_tokens": 2101726.0, "completions/mean_length": 196.625, "completions/min_length": 125.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 151.57144165039062, "completions/min_terminated_length": 125.0, "completions/max_terminated_length": 168.0, "rewards/meter/mean": 0.7816752791404724, "rewards/meter/std": 0.1955045461654663, "rewards/count_adherence/mean": 0.6416666507720947, "rewards/count_adherence/std": 0.1630561351776123, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8924999833106995, "rewards/count_floor/std": 0.04891684651374817, "rewards/lexical_plausibility/mean": 0.9546787142753601, "rewards/lexical_plausibility/std": 0.12818799912929535, "rewards/judge_quality/mean": 0.2875000238418579, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.7376455664634705, "rewards/repeat_penalty/std": 0.19538435339927673, "rewards/repeat_floor/mean": 0.9733842611312866, "rewards/repeat_floor/std": 0.01891866698861122, "rewards/near_duplicate_penalty/mean": 0.9357107281684875, "rewards/near_duplicate_penalty/std": 0.03585259988903999, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.811418354511261, "rewards/distinct_2/std": 0.15347079932689667, "rewards/total_composite/mean": 0.20624026656150818, "rewards/total_composite/std": 0.12254581600427628, "reward": 0.20624026656150818, "reward_std": 0.12254581600427628, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1515682488679886, "sampling/sampling_logp_difference/max": 2.480428695678711, "sampling/importance_sampling_ratio/min": 0.08370733261108398, "sampling/importance_sampling_ratio/mean": 1.0019123554229736, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6952157318592072, "clip_ratio/low_mean": 0.0440100422129035, "clip_ratio/low_min": 0.0440100422129035, "clip_ratio/high_mean": 0.07741628587245941, "clip_ratio/high_max": 0.07741628587245941, "clip_ratio/region_mean": 0.12142632808536291, "reward_total_mean": 0.20624026656150818, "reward_meter_mean": 0.7816752791404724, "reward_meter_std": 0.1955045461654663, "reward_count_adherence_mean": 0.6416666507720947, "reward_count_adherence_std": 0.1630561351776123, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8924999833106995, "reward_count_floor_std": 0.04891684651374817, "reward_lexical_plausibility_mean": 0.9546787142753601, "reward_lexical_plausibility_std": 0.12818799912929535, "reward_repeat_penalty_mean": 0.7376455664634705, "reward_repeat_penalty_std": 0.19538435339927673, "reward_repeat_floor_mean": 0.9733842611312866, "reward_repeat_floor_std": 0.01891866698861122, "reward_near_duplicate_penalty_mean": 0.9357107281684875, "reward_near_duplicate_penalty_std": 0.03585259988903999, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.811418354511261, "reward_distinct_2_std": 0.15347079932689667, "reward_judge_quality_mean": 0.2875000238418579, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.20624026656150818, "reward_total_composite_std": 0.12254581600427628} {"timestamp_utc": "2026-04-12T20:30:09Z", "mode": "train", "global_step": 1180, "epoch": 0.06210199463186148, "loss": 0.1742, "grad_norm": 23.012863159179688, "learning_rate": 6.427272727272728e-06, "num_tokens": 2103134.0, "completions/mean_length": 20.0, "completions/min_length": 14.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.0, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.4516674876213074, "rewards/meter/std": 0.4358198642730713, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5887500047683716, "rewards/judge_quality/std": 0.3700748085975647, "rewards/repeat_penalty/mean": 0.7786733508110046, "rewards/repeat_penalty/std": 0.08971989154815674, "rewards/repeat_floor/mean": 0.986359715461731, "rewards/repeat_floor/std": 0.005697190761566162, "rewards/near_duplicate_penalty/mean": 0.996564507484436, "rewards/near_duplicate_penalty/std": 0.009717104025185108, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.17987149953842163, "rewards/total_composite/std": 0.1643475443124771, "reward": 0.17987149953842163, "reward_std": 0.16434752941131592, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1801695078611374, "sampling/sampling_logp_difference/max": 1.1258525848388672, "sampling/importance_sampling_ratio/min": 0.32437577843666077, "sampling/importance_sampling_ratio/mean": 1.0048922300338745, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0632063671946526, "clip_ratio/low_mean": 0.06390555063262582, "clip_ratio/low_min": 0.06390555063262582, "clip_ratio/high_mean": 0.054793234914541245, "clip_ratio/high_max": 0.054793234914541245, "clip_ratio/region_mean": 0.11869878554716706, "reward_total_mean": 0.17987149953842163, "reward_meter_mean": 0.4516674876213074, "reward_meter_std": 0.4358198642730713, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7786733508110046, "reward_repeat_penalty_std": 0.08971989154815674, "reward_repeat_floor_mean": 0.986359715461731, "reward_repeat_floor_std": 0.005697190761566162, "reward_near_duplicate_penalty_mean": 0.996564507484436, "reward_near_duplicate_penalty_std": 0.009717104025185108, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5887500047683716, "reward_judge_quality_std": 0.3700748085975647, "reward_total_composite_mean": 0.17987149953842163, "reward_total_composite_std": 0.1643475443124771} {"timestamp_utc": "2026-04-12T20:30:17Z", "mode": "train", "global_step": 1181, "epoch": 0.06215462344087153, "loss": 0.0329, "grad_norm": 14.65428352355957, "learning_rate": 6.424242424242425e-06, "num_tokens": 2104503.0, "completions/mean_length": 19.125, "completions/min_length": 18.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.125, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.5089462995529175, "rewards/meter/std": 0.46019771695137024, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9322916269302368, "rewards/lexical_plausibility/std": 0.13717946410179138, "rewards/judge_quality/mean": 0.20000000298023224, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.73777174949646, "rewards/repeat_penalty/std": 0.03458673879504204, "rewards/repeat_floor/mean": 0.9825543761253357, "rewards/repeat_floor/std": 0.006917351391166449, "rewards/near_duplicate_penalty/mean": 0.9836956262588501, "rewards/near_duplicate_penalty/std": 0.04611567035317421, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.09618495404720306, "rewards/total_composite/std": 0.09962039440870285, "reward": 0.09618495404720306, "reward_std": 0.09962038695812225, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1431964784860611, "sampling/sampling_logp_difference/max": 1.3529396057128906, "sampling/importance_sampling_ratio/min": 0.2584793269634247, "sampling/importance_sampling_ratio/mean": 1.018261432647705, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8322898298501968, "clip_ratio/low_mean": 0.052010233979672194, "clip_ratio/low_min": 0.052010233979672194, "clip_ratio/high_mean": 0.07331349374726415, "clip_ratio/high_max": 0.07331349374726415, "clip_ratio/region_mean": 0.12532372772693634, "reward_total_mean": 0.09618495404720306, "reward_meter_mean": 0.5089462995529175, "reward_meter_std": 0.46019771695137024, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9322916269302368, "reward_lexical_plausibility_std": 0.13717946410179138, "reward_repeat_penalty_mean": 0.73777174949646, "reward_repeat_penalty_std": 0.03458673879504204, "reward_repeat_floor_mean": 0.9825543761253357, "reward_repeat_floor_std": 0.006917351391166449, "reward_near_duplicate_penalty_mean": 0.9836956262588501, "reward_near_duplicate_penalty_std": 0.04611567035317421, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.20000000298023224, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.09618495404720306, "reward_total_composite_std": 0.09962039440870285} {"timestamp_utc": "2026-04-12T20:30:27Z", "mode": "train", "global_step": 1182, "epoch": 0.062207252249881585, "loss": 0.0381, "grad_norm": 15.322174072265625, "learning_rate": 6.4212121212121215e-06, "num_tokens": 2106277.0, "completions/mean_length": 47.75, "completions/min_length": 36.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.75, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.6455488204956055, "rewards/meter/std": 0.34475696086883545, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.8652312755584717, "rewards/repeat_penalty/std": 0.10077371448278427, "rewards/repeat_floor/mean": 0.9828896522521973, "rewards/repeat_floor/std": 0.012291517108678818, "rewards/near_duplicate_penalty/mean": 0.9276446104049683, "rewards/near_duplicate_penalty/std": 0.04552360624074936, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9304767847061157, "rewards/distinct_2/std": 0.07052377611398697, "rewards/total_composite/mean": 0.21648946404457092, "rewards/total_composite/std": 0.11931361258029938, "reward": 0.21648946404457092, "reward_std": 0.11931361258029938, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14189143478870392, "sampling/sampling_logp_difference/max": 1.317641258239746, "sampling/importance_sampling_ratio/min": 0.26776614785194397, "sampling/importance_sampling_ratio/mean": 1.0085481405258179, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0084244906902313, "clip_ratio/low_mean": 0.03993618651293218, "clip_ratio/low_min": 0.03993618651293218, "clip_ratio/high_mean": 0.0881309974938631, "clip_ratio/high_max": 0.0881309974938631, "clip_ratio/region_mean": 0.1280671840067953, "reward_total_mean": 0.21648946404457092, "reward_meter_mean": 0.6455488204956055, "reward_meter_std": 0.34475696086883545, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8652312755584717, "reward_repeat_penalty_std": 0.10077371448278427, "reward_repeat_floor_mean": 0.9828896522521973, "reward_repeat_floor_std": 0.012291517108678818, "reward_near_duplicate_penalty_mean": 0.9276446104049683, "reward_near_duplicate_penalty_std": 0.04552360624074936, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9304767847061157, "reward_distinct_2_std": 0.07052377611398697, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.21648946404457092, "reward_total_composite_std": 0.11931361258029938} {"timestamp_utc": "2026-04-12T20:30:35Z", "mode": "train", "global_step": 1183, "epoch": 0.06225988105889164, "loss": 0.0112, "grad_norm": 15.95504093170166, "learning_rate": 6.418181818181819e-06, "num_tokens": 2107836.0, "completions/mean_length": 39.875, "completions/min_length": 36.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.875, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.7433016896247864, "rewards/meter/std": 0.18175439536571503, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.5954976081848145, "rewards/repeat_penalty/std": 0.21761220693588257, "rewards/repeat_floor/mean": 0.9552149772644043, "rewards/repeat_floor/std": 0.0264911986887455, "rewards/near_duplicate_penalty/mean": 0.8680577874183655, "rewards/near_duplicate_penalty/std": 0.08897467702627182, "rewards/opening_diversity/mean": 0.765625, "rewards/opening_diversity/std": 0.19408094882965088, "rewards/distinct_2/mean": 0.8785424828529358, "rewards/distinct_2/std": 0.09677964448928833, "rewards/total_composite/mean": 0.31861215829849243, "rewards/total_composite/std": 0.11181426048278809, "reward": 0.31861215829849243, "reward_std": 0.11181425303220749, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1395990252494812, "sampling/sampling_logp_difference/max": 3.518556594848633, "sampling/importance_sampling_ratio/min": 0.029642188921570778, "sampling/importance_sampling_ratio/mean": 1.0078552961349487, "sampling/importance_sampling_ratio/max": 1.81479811668396, "entropy": 0.8162758573889732, "clip_ratio/low_mean": 0.07800290104933083, "clip_ratio/low_min": 0.07800290104933083, "clip_ratio/high_mean": 0.02722902176901698, "clip_ratio/high_max": 0.02722902176901698, "clip_ratio/region_mean": 0.10523192281834781, "reward_total_mean": 0.31861215829849243, "reward_meter_mean": 0.7433016896247864, "reward_meter_std": 0.18175439536571503, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5954976081848145, "reward_repeat_penalty_std": 0.21761220693588257, "reward_repeat_floor_mean": 0.9552149772644043, "reward_repeat_floor_std": 0.0264911986887455, "reward_near_duplicate_penalty_mean": 0.8680577874183655, "reward_near_duplicate_penalty_std": 0.08897467702627182, "reward_opening_diversity_mean": 0.765625, "reward_opening_diversity_std": 0.19408094882965088, "reward_distinct_2_mean": 0.8785424828529358, "reward_distinct_2_std": 0.09677964448928833, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.31861215829849243, "reward_total_composite_std": 0.11181426048278809} {"timestamp_utc": "2026-04-12T20:30:45Z", "mode": "train", "global_step": 1184, "epoch": 0.06231250986790169, "loss": 0.0323, "grad_norm": 9.809541702270508, "learning_rate": 6.415151515151515e-06, "num_tokens": 2110150.0, "completions/mean_length": 94.25, "completions/min_length": 77.0, "completions/max_length": 112.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 94.25, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 112.0, "rewards/meter/mean": 0.9119459390640259, "rewards/meter/std": 0.15937098860740662, "rewards/count_adherence/mean": 0.484375, "rewards/count_adherence/std": 0.04419417306780815, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8453125357627869, "rewards/count_floor/std": 0.013258260674774647, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.26250001788139343, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.8172634840011597, "rewards/repeat_penalty/std": 0.11730685085058212, "rewards/repeat_floor/mean": 0.9783135652542114, "rewards/repeat_floor/std": 0.013516058214008808, "rewards/near_duplicate_penalty/mean": 0.9289640784263611, "rewards/near_duplicate_penalty/std": 0.03674700856208801, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8774330019950867, "rewards/distinct_2/std": 0.10283441841602325, "rewards/total_composite/mean": 0.20477306842803955, "rewards/total_composite/std": 0.1126212552189827, "reward": 0.20477306842803955, "reward_std": 0.1126212552189827, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16478417813777924, "sampling/sampling_logp_difference/max": 4.918659687042236, "sampling/importance_sampling_ratio/min": 0.007308920379728079, "sampling/importance_sampling_ratio/mean": 1.0037118196487427, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9794083014130592, "clip_ratio/low_mean": 0.05482036620378494, "clip_ratio/low_min": 0.05482036620378494, "clip_ratio/high_mean": 0.07793444767594337, "clip_ratio/high_max": 0.07793444767594337, "clip_ratio/region_mean": 0.13275481387972832, "reward_total_mean": 0.20477306842803955, "reward_meter_mean": 0.9119459390640259, "reward_meter_std": 0.15937098860740662, "reward_count_adherence_mean": 0.484375, "reward_count_adherence_std": 0.04419417306780815, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8453125357627869, "reward_count_floor_std": 0.013258260674774647, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8172634840011597, "reward_repeat_penalty_std": 0.11730685085058212, "reward_repeat_floor_mean": 0.9783135652542114, "reward_repeat_floor_std": 0.013516058214008808, "reward_near_duplicate_penalty_mean": 0.9289640784263611, "reward_near_duplicate_penalty_std": 0.03674700856208801, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8774330019950867, "reward_distinct_2_std": 0.10283441841602325, "reward_judge_quality_mean": 0.26250001788139343, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.20477306842803955, "reward_total_composite_std": 0.1126212552189827} {"timestamp_utc": "2026-04-12T20:30:54Z", "mode": "train", "global_step": 1185, "epoch": 0.06236513867691174, "loss": 0.0198, "grad_norm": 18.055950164794922, "learning_rate": 6.412121212121213e-06, "num_tokens": 2112116.0, "completions/mean_length": 73.75, "completions/min_length": 62.0, "completions/max_length": 84.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 73.75, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.7976605892181396, "rewards/meter/std": 0.30140194296836853, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.887499988079071, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9134676456451416, "rewards/repeat_penalty/std": 0.037574149668216705, "rewards/repeat_floor/mean": 0.9891688823699951, "rewards/repeat_floor/std": 0.0046572377905249596, "rewards/near_duplicate_penalty/mean": 0.9521973729133606, "rewards/near_duplicate_penalty/std": 0.025508565828204155, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.959325909614563, "rewards/distinct_2/std": 0.02949613146483898, "rewards/total_composite/mean": 0.26701101660728455, "rewards/total_composite/std": 0.11397452652454376, "reward": 0.26701101660728455, "reward_std": 0.11397451907396317, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14282502233982086, "sampling/sampling_logp_difference/max": 2.9267032146453857, "sampling/importance_sampling_ratio/min": 0.0535733699798584, "sampling/importance_sampling_ratio/mean": 1.0160162448883057, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.930775836110115, "clip_ratio/low_mean": 0.039340363815426826, "clip_ratio/low_min": 0.039340363815426826, "clip_ratio/high_mean": 0.09138065297156572, "clip_ratio/high_max": 0.09138065297156572, "clip_ratio/region_mean": 0.13072101678699255, "reward_total_mean": 0.26701101660728455, "reward_meter_mean": 0.7976605892181396, "reward_meter_std": 0.30140194296836853, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.887499988079071, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9134676456451416, "reward_repeat_penalty_std": 0.037574149668216705, "reward_repeat_floor_mean": 0.9891688823699951, "reward_repeat_floor_std": 0.0046572377905249596, "reward_near_duplicate_penalty_mean": 0.9521973729133606, "reward_near_duplicate_penalty_std": 0.025508565828204155, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.959325909614563, "reward_distinct_2_std": 0.02949613146483898, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.26701101660728455, "reward_total_composite_std": 0.11397452652454376} {"timestamp_utc": "2026-04-12T20:31:04Z", "mode": "train", "global_step": 1186, "epoch": 0.062417767485921795, "loss": -0.0545, "grad_norm": 11.506623268127441, "learning_rate": 6.40909090909091e-06, "num_tokens": 2113774.0, "completions/mean_length": 53.25, "completions/min_length": 43.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.25, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.8872829079627991, "rewards/meter/std": 0.16512970626354218, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5037499666213989, "rewards/judge_quality/std": 0.177999809384346, "rewards/repeat_penalty/mean": 0.9021210670471191, "rewards/repeat_penalty/std": 0.0825454369187355, "rewards/repeat_floor/mean": 0.9884834289550781, "rewards/repeat_floor/std": 0.009969102218747139, "rewards/near_duplicate_penalty/mean": 0.9608796834945679, "rewards/near_duplicate_penalty/std": 0.03545333445072174, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9372386932373047, "rewards/distinct_2/std": 0.05369313806295395, "rewards/total_composite/mean": 0.44249606132507324, "rewards/total_composite/std": 0.21247518062591553, "reward": 0.44249606132507324, "reward_std": 0.21247516572475433, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14859214425086975, "sampling/sampling_logp_difference/max": 1.6988357305526733, "sampling/importance_sampling_ratio/min": 0.18289633095264435, "sampling/importance_sampling_ratio/mean": 0.9840831160545349, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7777009159326553, "clip_ratio/low_mean": 0.07531295251101255, "clip_ratio/low_min": 0.07531295251101255, "clip_ratio/high_mean": 0.030569007620215416, "clip_ratio/high_max": 0.030569007620215416, "clip_ratio/region_mean": 0.10588196013122797, "reward_total_mean": 0.44249606132507324, "reward_meter_mean": 0.8872829079627991, "reward_meter_std": 0.16512970626354218, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9021210670471191, "reward_repeat_penalty_std": 0.0825454369187355, "reward_repeat_floor_mean": 0.9884834289550781, "reward_repeat_floor_std": 0.009969102218747139, "reward_near_duplicate_penalty_mean": 0.9608796834945679, "reward_near_duplicate_penalty_std": 0.03545333445072174, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9372386932373047, "reward_distinct_2_std": 0.05369313806295395, "reward_judge_quality_mean": 0.5037499666213989, "reward_judge_quality_std": 0.177999809384346, "reward_total_composite_mean": 0.44249606132507324, "reward_total_composite_std": 0.21247518062591553} {"timestamp_utc": "2026-04-12T20:31:12Z", "mode": "train", "global_step": 1187, "epoch": 0.06247039629493185, "loss": -0.0121, "grad_norm": 17.133201599121094, "learning_rate": 6.406060606060607e-06, "num_tokens": 2115060.0, "completions/mean_length": 16.75, "completions/min_length": 15.0, "completions/max_length": 18.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.75, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 18.0, "rewards/meter/mean": 0.8836097717285156, "rewards/meter/std": 0.1592770516872406, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8612500429153442, "rewards/judge_quality/std": 0.16617010533809662, "rewards/repeat_penalty/mean": 0.705302357673645, "rewards/repeat_penalty/std": 0.04968933388590813, "rewards/repeat_floor/mean": 0.9760604500770569, "rewards/repeat_floor/std": 0.009937874972820282, "rewards/near_duplicate_penalty/mean": 0.9404031038284302, "rewards/near_duplicate_penalty/std": 0.0662524476647377, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7368852496147156, "rewards/total_composite/std": 0.1850358545780182, "reward": 0.7368852496147156, "reward_std": 0.185035839676857, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.08635969460010529, "sampling/sampling_logp_difference/max": 0.9684031009674072, "sampling/importance_sampling_ratio/min": 0.4997761845588684, "sampling/importance_sampling_ratio/mean": 1.043078064918518, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.49771571159362793, "clip_ratio/low_mean": 0.014705882407724857, "clip_ratio/low_min": 0.014705882407724857, "clip_ratio/high_mean": 0.058986930176615715, "clip_ratio/high_max": 0.058986930176615715, "clip_ratio/region_mean": 0.07369281258434057, "reward_total_mean": 0.7368852496147156, "reward_meter_mean": 0.8836097717285156, "reward_meter_std": 0.1592770516872406, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.705302357673645, "reward_repeat_penalty_std": 0.04968933388590813, "reward_repeat_floor_mean": 0.9760604500770569, "reward_repeat_floor_std": 0.009937874972820282, "reward_near_duplicate_penalty_mean": 0.9404031038284302, "reward_near_duplicate_penalty_std": 0.0662524476647377, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8612500429153442, "reward_judge_quality_std": 0.16617010533809662, "reward_total_composite_mean": 0.7368852496147156, "reward_total_composite_std": 0.1850358545780182} {"timestamp_utc": "2026-04-12T20:31:19Z", "mode": "train", "global_step": 1188, "epoch": 0.06252302510394189, "loss": 0.0157, "grad_norm": 19.255817413330078, "learning_rate": 6.403030303030303e-06, "num_tokens": 2116357.0, "completions/mean_length": 17.125, "completions/min_length": 16.0, "completions/max_length": 20.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.125, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 20.0, "rewards/meter/mean": 0.6553815007209778, "rewards/meter/std": 0.4051918387413025, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7725000381469727, "rewards/judge_quality/std": 0.3027375340461731, "rewards/repeat_penalty/mean": 0.7455357313156128, "rewards/repeat_penalty/std": 0.012626901268959045, "rewards/repeat_floor/mean": 0.9841071367263794, "rewards/repeat_floor/std": 0.002525375923141837, "rewards/near_duplicate_penalty/mean": 0.9940476417541504, "rewards/near_duplicate_penalty/std": 0.016835875809192657, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5080605745315552, "rewards/total_composite/std": 0.42490366101264954, "reward": 0.5080605745315552, "reward_std": 0.4249036908149719, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1546800136566162, "sampling/sampling_logp_difference/max": 2.8401095867156982, "sampling/importance_sampling_ratio/min": 0.05841926112771034, "sampling/importance_sampling_ratio/mean": 0.9928350448608398, "sampling/importance_sampling_ratio/max": 1.7932406663894653, "entropy": 0.8976735547184944, "clip_ratio/low_mean": 0.058799341320991516, "clip_ratio/low_min": 0.058799341320991516, "clip_ratio/high_mean": 0.054871323984116316, "clip_ratio/high_max": 0.054871323984116316, "clip_ratio/region_mean": 0.11367066530510783, "reward_total_mean": 0.5080605745315552, "reward_meter_mean": 0.6553815007209778, "reward_meter_std": 0.4051918387413025, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7455357313156128, "reward_repeat_penalty_std": 0.012626901268959045, "reward_repeat_floor_mean": 0.9841071367263794, "reward_repeat_floor_std": 0.002525375923141837, "reward_near_duplicate_penalty_mean": 0.9940476417541504, "reward_near_duplicate_penalty_std": 0.016835875809192657, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7725000381469727, "reward_judge_quality_std": 0.3027375340461731, "reward_total_composite_mean": 0.5080605745315552, "reward_total_composite_std": 0.42490366101264954} {"timestamp_utc": "2026-04-12T20:31:28Z", "mode": "train", "global_step": 1189, "epoch": 0.06257565391295195, "loss": 0.1288, "grad_norm": 12.094244956970215, "learning_rate": 6.4000000000000006e-06, "num_tokens": 2117869.0, "completions/mean_length": 39.0, "completions/min_length": 28.0, "completions/max_length": 76.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.0, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.2448902726173401, "rewards/meter/std": 0.2321670800447464, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.1060660183429718, "rewards/repeat_penalty/mean": 0.7840290665626526, "rewards/repeat_penalty/std": 0.22433924674987793, "rewards/repeat_floor/mean": 0.9759631156921387, "rewards/repeat_floor/std": 0.0252972561866045, "rewards/near_duplicate_penalty/mean": 0.9217918515205383, "rewards/near_duplicate_penalty/std": 0.07592284679412842, "rewards/opening_diversity/mean": 0.925000011920929, "rewards/opening_diversity/std": 0.11338934302330017, "rewards/distinct_2/mean": 0.9132702350616455, "rewards/distinct_2/std": 0.10772211104631424, "rewards/total_composite/mean": 0.09393828362226486, "rewards/total_composite/std": 0.08279355615377426, "reward": 0.09393828362226486, "reward_std": 0.08279355615377426, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16901198029518127, "sampling/sampling_logp_difference/max": 4.9106645584106445, "sampling/importance_sampling_ratio/min": 0.007367590442299843, "sampling/importance_sampling_ratio/mean": 1.0038750171661377, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9866219609975815, "clip_ratio/low_mean": 0.09241046849638224, "clip_ratio/low_min": 0.09241046849638224, "clip_ratio/high_mean": 0.061492979526519775, "clip_ratio/high_max": 0.061492979526519775, "clip_ratio/region_mean": 0.153903448022902, "reward_total_mean": 0.09393828362226486, "reward_meter_mean": 0.2448902726173401, "reward_meter_std": 0.2321670800447464, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7840290665626526, "reward_repeat_penalty_std": 0.22433924674987793, "reward_repeat_floor_mean": 0.9759631156921387, "reward_repeat_floor_std": 0.0252972561866045, "reward_near_duplicate_penalty_mean": 0.9217918515205383, "reward_near_duplicate_penalty_std": 0.07592284679412842, "reward_opening_diversity_mean": 0.925000011920929, "reward_opening_diversity_std": 0.11338934302330017, "reward_distinct_2_mean": 0.9132702350616455, "reward_distinct_2_std": 0.10772211104631424, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.1060660183429718, "reward_total_composite_mean": 0.09393828362226486, "reward_total_composite_std": 0.08279355615377426} {"timestamp_utc": "2026-04-12T20:31:42Z", "mode": "train", "global_step": 1190, "epoch": 0.062628282721962, "loss": -0.1151, "grad_norm": 3.064037561416626, "learning_rate": 6.396969696969697e-06, "num_tokens": 2120149.0, "completions/mean_length": 251.0, "completions/min_length": 78.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 94.4000015258789, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 109.0, "rewards/meter/mean": 0.5597401857376099, "rewards/meter/std": 0.3874618411064148, "rewards/count_adherence/mean": 0.535714328289032, "rewards/count_adherence/std": 0.22587698698043823, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.860714316368103, "rewards/count_floor/std": 0.06776309758424759, "rewards/lexical_plausibility/mean": 0.8444586992263794, "rewards/lexical_plausibility/std": 0.22641272842884064, "rewards/judge_quality/mean": 0.21875, "rewards/judge_quality/std": 0.17512750625610352, "rewards/repeat_penalty/mean": 0.9328254461288452, "rewards/repeat_penalty/std": 0.07999370992183685, "rewards/repeat_floor/mean": 0.9921799898147583, "rewards/repeat_floor/std": 0.009029122069478035, "rewards/near_duplicate_penalty/mean": 0.9739542007446289, "rewards/near_duplicate_penalty/std": 0.025501254945993423, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9565209746360779, "rewards/distinct_2/std": 0.06015944480895996, "rewards/total_composite/mean": 0.09549776464700699, "rewards/total_composite/std": 0.10370214283466339, "reward": 0.09549776464700699, "reward_std": 0.1037021353840828, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1545894593000412, "sampling/sampling_logp_difference/max": 1.3918174505233765, "sampling/importance_sampling_ratio/min": 0.24862302839756012, "sampling/importance_sampling_ratio/mean": 1.0047316551208496, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.48921435326337814, "clip_ratio/low_mean": 0.03175813052803278, "clip_ratio/low_min": 0.03175813052803278, "clip_ratio/high_mean": 0.055323295295238495, "clip_ratio/high_max": 0.055323295295238495, "clip_ratio/region_mean": 0.08708142582327127, "reward_total_mean": 0.09549776464700699, "reward_meter_mean": 0.5597401857376099, "reward_meter_std": 0.3874618411064148, "reward_count_adherence_mean": 0.535714328289032, "reward_count_adherence_std": 0.22587698698043823, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.860714316368103, "reward_count_floor_std": 0.06776309758424759, "reward_lexical_plausibility_mean": 0.8444586992263794, "reward_lexical_plausibility_std": 0.22641272842884064, "reward_repeat_penalty_mean": 0.9328254461288452, "reward_repeat_penalty_std": 0.07999370992183685, "reward_repeat_floor_mean": 0.9921799898147583, "reward_repeat_floor_std": 0.009029122069478035, "reward_near_duplicate_penalty_mean": 0.9739542007446289, "reward_near_duplicate_penalty_std": 0.025501254945993423, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9565209746360779, "reward_distinct_2_std": 0.06015944480895996, "reward_judge_quality_mean": 0.21875, "reward_judge_quality_std": 0.17512750625610352, "reward_total_composite_mean": 0.09549776464700699, "reward_total_composite_std": 0.10370214283466339} {"timestamp_utc": "2026-04-12T20:31:51Z", "mode": "train", "global_step": 1191, "epoch": 0.06268091153097205, "loss": 0.0521, "grad_norm": 15.420903205871582, "learning_rate": 6.393939393939394e-06, "num_tokens": 2121809.0, "completions/mean_length": 39.5, "completions/min_length": 22.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.5, "completions/min_terminated_length": 22.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.33362430334091187, "rewards/meter/std": 0.34837689995765686, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.8976688385009766, "rewards/repeat_penalty/std": 0.12704874575138092, "rewards/repeat_floor/mean": 0.9910262823104858, "rewards/repeat_floor/std": 0.00865508895367384, "rewards/near_duplicate_penalty/mean": 0.9794062376022339, "rewards/near_duplicate_penalty/std": 0.016195926815271378, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9762820601463318, "rewards/distinct_2/std": 0.0473938025534153, "rewards/total_composite/mean": 0.08406940847635269, "rewards/total_composite/std": 0.08071156591176987, "reward": 0.08406940847635269, "reward_std": 0.08071156591176987, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15563789010047913, "sampling/sampling_logp_difference/max": 1.7960224151611328, "sampling/importance_sampling_ratio/min": 0.16595768928527832, "sampling/importance_sampling_ratio/mean": 1.0279182195663452, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.25249882042408, "clip_ratio/low_mean": 0.08641419466584921, "clip_ratio/low_min": 0.08641419466584921, "clip_ratio/high_mean": 0.052471186965703964, "clip_ratio/high_max": 0.052471186965703964, "clip_ratio/region_mean": 0.13888538163155317, "reward_total_mean": 0.08406940847635269, "reward_meter_mean": 0.33362430334091187, "reward_meter_std": 0.34837689995765686, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.8976688385009766, "reward_repeat_penalty_std": 0.12704874575138092, "reward_repeat_floor_mean": 0.9910262823104858, "reward_repeat_floor_std": 0.00865508895367384, "reward_near_duplicate_penalty_mean": 0.9794062376022339, "reward_near_duplicate_penalty_std": 0.016195926815271378, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9762820601463318, "reward_distinct_2_std": 0.0473938025534153, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.08406940847635269, "reward_total_composite_std": 0.08071156591176987} {"timestamp_utc": "2026-04-12T20:31:59Z", "mode": "train", "global_step": 1192, "epoch": 0.0627335403399821, "loss": 0.0462, "grad_norm": 13.260112762451172, "learning_rate": 6.390909090909091e-06, "num_tokens": 2123400.0, "completions/mean_length": 35.875, "completions/min_length": 21.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.875, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.7292162179946899, "rewards/meter/std": 0.33589762449264526, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.22273865342140198, "rewards/repeat_penalty/mean": 0.7868608236312866, "rewards/repeat_penalty/std": 0.12876349687576294, "rewards/repeat_floor/mean": 0.9787724614143372, "rewards/repeat_floor/std": 0.014359559863805771, "rewards/near_duplicate_penalty/mean": 0.9416112899780273, "rewards/near_duplicate_penalty/std": 0.05764366313815117, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9239528179168701, "rewards/distinct_2/std": 0.07524978369474411, "rewards/total_composite/mean": 0.30526676774024963, "rewards/total_composite/std": 0.25670892000198364, "reward": 0.30526676774024963, "reward_std": 0.25670892000198364, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1421644538640976, "sampling/sampling_logp_difference/max": 1.4621171951293945, "sampling/importance_sampling_ratio/min": 0.23174512386322021, "sampling/importance_sampling_ratio/mean": 1.0219980478286743, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0340564623475075, "clip_ratio/low_mean": 0.1301058055832982, "clip_ratio/low_min": 0.1301058055832982, "clip_ratio/high_mean": 0.03627622500061989, "clip_ratio/high_max": 0.03627622500061989, "clip_ratio/region_mean": 0.1663820305839181, "reward_total_mean": 0.30526676774024963, "reward_meter_mean": 0.7292162179946899, "reward_meter_std": 0.33589762449264526, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7868608236312866, "reward_repeat_penalty_std": 0.12876349687576294, "reward_repeat_floor_mean": 0.9787724614143372, "reward_repeat_floor_std": 0.014359559863805771, "reward_near_duplicate_penalty_mean": 0.9416112899780273, "reward_near_duplicate_penalty_std": 0.05764366313815117, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9239528179168701, "reward_distinct_2_std": 0.07524978369474411, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.22273865342140198, "reward_total_composite_mean": 0.30526676774024963, "reward_total_composite_std": 0.25670892000198364} {"timestamp_utc": "2026-04-12T20:32:09Z", "mode": "train", "global_step": 1193, "epoch": 0.06278616914899215, "loss": -0.0015, "grad_norm": 9.142109870910645, "learning_rate": 6.387878787878789e-06, "num_tokens": 2125750.0, "completions/mean_length": 94.75, "completions/min_length": 75.0, "completions/max_length": 114.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 94.75, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 114.0, "rewards/meter/mean": 0.9359992742538452, "rewards/meter/std": 0.05971302092075348, "rewards/count_adherence/mean": 0.46875, "rewards/count_adherence/std": 0.043129101395606995, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.840624988079071, "rewards/count_floor/std": 0.012938748113811016, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.5473600625991821, "rewards/repeat_penalty/std": 0.16508932411670685, "rewards/repeat_floor/mean": 0.9428822994232178, "rewards/repeat_floor/std": 0.024883070960640907, "rewards/near_duplicate_penalty/mean": 0.8338198661804199, "rewards/near_duplicate_penalty/std": 0.07837218791246414, "rewards/opening_diversity/mean": 0.9593750238418579, "rewards/opening_diversity/std": 0.056596167385578156, "rewards/distinct_2/mean": 0.6694088578224182, "rewards/distinct_2/std": 0.12782509624958038, "rewards/total_composite/mean": 0.2599286735057831, "rewards/total_composite/std": 0.022021885961294174, "reward": 0.2599286735057831, "reward_std": 0.022021880373358727, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13182973861694336, "sampling/sampling_logp_difference/max": 1.8844695091247559, "sampling/importance_sampling_ratio/min": 0.15190961956977844, "sampling/importance_sampling_ratio/mean": 1.0104258060455322, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6066080182790756, "clip_ratio/low_mean": 0.031279259361326694, "clip_ratio/low_min": 0.031279259361326694, "clip_ratio/high_mean": 0.0918187159113586, "clip_ratio/high_max": 0.0918187159113586, "clip_ratio/region_mean": 0.12309797527268529, "reward_total_mean": 0.2599286735057831, "reward_meter_mean": 0.9359992742538452, "reward_meter_std": 0.05971302092075348, "reward_count_adherence_mean": 0.46875, "reward_count_adherence_std": 0.043129101395606995, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.840624988079071, "reward_count_floor_std": 0.012938748113811016, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5473600625991821, "reward_repeat_penalty_std": 0.16508932411670685, "reward_repeat_floor_mean": 0.9428822994232178, "reward_repeat_floor_std": 0.024883070960640907, "reward_near_duplicate_penalty_mean": 0.8338198661804199, "reward_near_duplicate_penalty_std": 0.07837218791246414, "reward_opening_diversity_mean": 0.9593750238418579, "reward_opening_diversity_std": 0.056596167385578156, "reward_distinct_2_mean": 0.6694088578224182, "reward_distinct_2_std": 0.12782509624958038, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.2599286735057831, "reward_total_composite_std": 0.022021885961294174} {"timestamp_utc": "2026-04-12T20:32:19Z", "mode": "train", "global_step": 1194, "epoch": 0.06283879795800221, "loss": 0.0208, "grad_norm": 11.12405776977539, "learning_rate": 6.384848484848485e-06, "num_tokens": 2128102.0, "completions/mean_length": 103.0, "completions/min_length": 89.0, "completions/max_length": 110.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 103.0, "completions/min_terminated_length": 89.0, "completions/max_terminated_length": 110.0, "rewards/meter/mean": 0.740294337272644, "rewards/meter/std": 0.29995906352996826, "rewards/count_adherence/mean": 0.4861111044883728, "rewards/count_adherence/std": 0.057505473494529724, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8458333611488342, "rewards/count_floor/std": 0.017251653596758842, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.7783148288726807, "rewards/repeat_penalty/std": 0.10792271047830582, "rewards/repeat_floor/mean": 0.9739859104156494, "rewards/repeat_floor/std": 0.013446926139295101, "rewards/near_duplicate_penalty/mean": 0.9214696884155273, "rewards/near_duplicate_penalty/std": 0.04053705930709839, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8418387770652771, "rewards/distinct_2/std": 0.08892444521188736, "rewards/total_composite/mean": 0.22537961602210999, "rewards/total_composite/std": 0.0901152640581131, "reward": 0.22537961602210999, "reward_std": 0.0901152640581131, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14989331364631653, "sampling/sampling_logp_difference/max": 2.6498146057128906, "sampling/importance_sampling_ratio/min": 0.07066430896520615, "sampling/importance_sampling_ratio/mean": 1.0311756134033203, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0670210123062134, "clip_ratio/low_mean": 0.05114095564931631, "clip_ratio/low_min": 0.05114095564931631, "clip_ratio/high_mean": 0.08290205523371696, "clip_ratio/high_max": 0.08290205523371696, "clip_ratio/region_mean": 0.13404301088303328, "reward_total_mean": 0.22537961602210999, "reward_meter_mean": 0.740294337272644, "reward_meter_std": 0.29995906352996826, "reward_count_adherence_mean": 0.4861111044883728, "reward_count_adherence_std": 0.057505473494529724, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8458333611488342, "reward_count_floor_std": 0.017251653596758842, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7783148288726807, "reward_repeat_penalty_std": 0.10792271047830582, "reward_repeat_floor_mean": 0.9739859104156494, "reward_repeat_floor_std": 0.013446926139295101, "reward_near_duplicate_penalty_mean": 0.9214696884155273, "reward_near_duplicate_penalty_std": 0.04053705930709839, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8418387770652771, "reward_distinct_2_std": 0.08892444521188736, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.22537961602210999, "reward_total_composite_std": 0.0901152640581131} {"timestamp_utc": "2026-04-12T20:32:28Z", "mode": "train", "global_step": 1195, "epoch": 0.06289142676701226, "loss": -0.0036, "grad_norm": 12.172980308532715, "learning_rate": 6.381818181818182e-06, "num_tokens": 2129708.0, "completions/mean_length": 33.75, "completions/min_length": 31.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.75, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.9084851741790771, "rewards/meter/std": 0.1901261806488037, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9177228212356567, "rewards/repeat_penalty/std": 0.046730946749448776, "rewards/repeat_floor/mean": 0.989124059677124, "rewards/repeat_floor/std": 0.005586832296103239, "rewards/near_duplicate_penalty/mean": 0.9445270299911499, "rewards/near_duplicate_penalty/std": 0.028661437332630157, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.971611738204956, "rewards/distinct_2/std": 0.03919585049152374, "rewards/total_composite/mean": 0.3621888756752014, "rewards/total_composite/std": 0.09562387317419052, "reward": 0.3621888756752014, "reward_std": 0.09562388062477112, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14849862456321716, "sampling/sampling_logp_difference/max": 2.1155805587768555, "sampling/importance_sampling_ratio/min": 0.12056327611207962, "sampling/importance_sampling_ratio/mean": 1.0559884309768677, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.100086785852909, "clip_ratio/low_mean": 0.04571143467910588, "clip_ratio/low_min": 0.04571143467910588, "clip_ratio/high_mean": 0.059406036511063576, "clip_ratio/high_max": 0.059406036511063576, "clip_ratio/region_mean": 0.10511747119016945, "reward_total_mean": 0.3621888756752014, "reward_meter_mean": 0.9084851741790771, "reward_meter_std": 0.1901261806488037, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9177228212356567, "reward_repeat_penalty_std": 0.046730946749448776, "reward_repeat_floor_mean": 0.989124059677124, "reward_repeat_floor_std": 0.005586832296103239, "reward_near_duplicate_penalty_mean": 0.9445270299911499, "reward_near_duplicate_penalty_std": 0.028661437332630157, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.971611738204956, "reward_distinct_2_std": 0.03919585049152374, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.3621888756752014, "reward_total_composite_std": 0.09562387317419052} {"timestamp_utc": "2026-04-12T20:32:37Z", "mode": "train", "global_step": 1196, "epoch": 0.06294405557602231, "loss": 0.0354, "grad_norm": 19.802976608276367, "learning_rate": 6.37878787878788e-06, "num_tokens": 2131321.0, "completions/mean_length": 21.625, "completions/min_length": 19.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.625, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.3409562110900879, "rewards/meter/std": 0.4013894498348236, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9322916269302368, "rewards/lexical_plausibility/std": 0.13717946410179138, "rewards/judge_quality/mean": 0.4050000309944153, "rewards/judge_quality/std": 0.33713075518608093, "rewards/repeat_penalty/mean": 0.6805267333984375, "rewards/repeat_penalty/std": 0.1280427724123001, "rewards/repeat_floor/mean": 0.9711188077926636, "rewards/repeat_floor/std": 0.025574974715709686, "rewards/near_duplicate_penalty/mean": 0.9163343906402588, "rewards/near_duplicate_penalty/std": 0.14881302416324615, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.14375658333301544, "rewards/total_composite/std": 0.2785193622112274, "reward": 0.14375658333301544, "reward_std": 0.27851933240890503, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14784274995326996, "sampling/sampling_logp_difference/max": 1.161886215209961, "sampling/importance_sampling_ratio/min": 0.31289544701576233, "sampling/importance_sampling_ratio/mean": 0.9942523241043091, "sampling/importance_sampling_ratio/max": 1.9750866889953613, "entropy": 1.2131140232086182, "clip_ratio/low_mean": 0.07700497936457396, "clip_ratio/low_min": 0.07700497936457396, "clip_ratio/high_mean": 0.019078947603702545, "clip_ratio/high_max": 0.019078947603702545, "clip_ratio/region_mean": 0.0960839269682765, "reward_total_mean": 0.14375658333301544, "reward_meter_mean": 0.3409562110900879, "reward_meter_std": 0.4013894498348236, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9322916269302368, "reward_lexical_plausibility_std": 0.13717946410179138, "reward_repeat_penalty_mean": 0.6805267333984375, "reward_repeat_penalty_std": 0.1280427724123001, "reward_repeat_floor_mean": 0.9711188077926636, "reward_repeat_floor_std": 0.025574974715709686, "reward_near_duplicate_penalty_mean": 0.9163343906402588, "reward_near_duplicate_penalty_std": 0.14881302416324615, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.4050000309944153, "reward_judge_quality_std": 0.33713075518608093, "reward_total_composite_mean": 0.14375658333301544, "reward_total_composite_std": 0.2785193622112274} {"timestamp_utc": "2026-04-12T20:32:51Z", "mode": "train", "global_step": 1197, "epoch": 0.06299668438503236, "loss": -0.0318, "grad_norm": 4.761552810668945, "learning_rate": 6.375757575757576e-06, "num_tokens": 2132795.0, "completions/mean_length": 97.25, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.0, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.6433270573616028, "rewards/meter/std": 0.3524598479270935, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9619851112365723, "rewards/lexical_plausibility/std": 0.10752230137586594, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.25753986835479736, "rewards/repeat_penalty/mean": 0.8302223086357117, "rewards/repeat_penalty/std": 0.1848599910736084, "rewards/repeat_floor/mean": 0.9805862307548523, "rewards/repeat_floor/std": 0.019555971026420593, "rewards/near_duplicate_penalty/mean": 0.9340364933013916, "rewards/near_duplicate_penalty/std": 0.04922031611204147, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9358974695205688, "rewards/distinct_2/std": 0.0824902281165123, "rewards/total_composite/mean": 0.26143789291381836, "rewards/total_composite/std": 0.18207389116287231, "reward": 0.26143789291381836, "reward_std": 0.18207387626171112, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12284072488546371, "sampling/sampling_logp_difference/max": 1.630645751953125, "sampling/importance_sampling_ratio/min": 0.19580307602882385, "sampling/importance_sampling_ratio/mean": 1.01539945602417, "sampling/importance_sampling_ratio/max": 1.8028939962387085, "entropy": 0.7139197960495949, "clip_ratio/low_mean": 0.014003378339111805, "clip_ratio/low_min": 0.014003378339111805, "clip_ratio/high_mean": 0.06070714630186558, "clip_ratio/high_max": 0.06070714630186558, "clip_ratio/region_mean": 0.07471052464097738, "reward_total_mean": 0.26143789291381836, "reward_meter_mean": 0.6433270573616028, "reward_meter_std": 0.3524598479270935, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9619851112365723, "reward_lexical_plausibility_std": 0.10752230137586594, "reward_repeat_penalty_mean": 0.8302223086357117, "reward_repeat_penalty_std": 0.1848599910736084, "reward_repeat_floor_mean": 0.9805862307548523, "reward_repeat_floor_std": 0.019555971026420593, "reward_near_duplicate_penalty_mean": 0.9340364933013916, "reward_near_duplicate_penalty_std": 0.04922031611204147, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9358974695205688, "reward_distinct_2_std": 0.0824902281165123, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.25753986835479736, "reward_total_composite_mean": 0.26143789291381836, "reward_total_composite_std": 0.18207389116287231} {"timestamp_utc": "2026-04-12T20:33:00Z", "mode": "train", "global_step": 1198, "epoch": 0.06304931319404242, "loss": 0.0037, "grad_norm": 16.240053176879883, "learning_rate": 6.372727272727274e-06, "num_tokens": 2134598.0, "completions/mean_length": 47.375, "completions/min_length": 29.0, "completions/max_length": 57.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.375, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.19367700815200806, "rewards/meter/std": 0.1618591994047165, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.8449052572250366, "rewards/repeat_penalty/std": 0.10780539363622665, "rewards/repeat_floor/mean": 0.9817018508911133, "rewards/repeat_floor/std": 0.013330195099115372, "rewards/near_duplicate_penalty/mean": 0.9405525326728821, "rewards/near_duplicate_penalty/std": 0.05005362257361412, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.895766019821167, "rewards/distinct_2/std": 0.07663242518901825, "rewards/total_composite/mean": 0.05933813005685806, "rewards/total_composite/std": 0.052925460040569305, "reward": 0.05933813005685806, "reward_std": 0.052925460040569305, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1752455085515976, "sampling/sampling_logp_difference/max": 2.4137229919433594, "sampling/importance_sampling_ratio/min": 0.08948154002428055, "sampling/importance_sampling_ratio/mean": 1.030357003211975, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1912523359060287, "clip_ratio/low_mean": 0.07709004636853933, "clip_ratio/low_min": 0.07709004636853933, "clip_ratio/high_mean": 0.07225293572992086, "clip_ratio/high_max": 0.07225293572992086, "clip_ratio/region_mean": 0.1493429820984602, "reward_total_mean": 0.05933813005685806, "reward_meter_mean": 0.19367700815200806, "reward_meter_std": 0.1618591994047165, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8449052572250366, "reward_repeat_penalty_std": 0.10780539363622665, "reward_repeat_floor_mean": 0.9817018508911133, "reward_repeat_floor_std": 0.013330195099115372, "reward_near_duplicate_penalty_mean": 0.9405525326728821, "reward_near_duplicate_penalty_std": 0.05005362257361412, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.895766019821167, "reward_distinct_2_std": 0.07663242518901825, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.05933813005685806, "reward_total_composite_std": 0.052925460040569305} {"timestamp_utc": "2026-04-12T20:33:15Z", "mode": "train", "global_step": 1199, "epoch": 0.06310194200305247, "loss": -0.0192, "grad_norm": 4.026417255401611, "learning_rate": 6.3696969696969706e-06, "num_tokens": 2136143.0, "completions/mean_length": 85.125, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 24.142858505249023, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.6765033006668091, "rewards/meter/std": 0.45151782035827637, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.8960034847259521, "rewards/lexical_plausibility/std": 0.17476549744606018, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.7788149118423462, "rewards/repeat_penalty/std": 0.08963186293840408, "rewards/repeat_floor/mean": 0.9863879680633545, "rewards/repeat_floor/std": 0.005666534882038832, "rewards/near_duplicate_penalty/mean": 0.9967532157897949, "rewards/near_duplicate_penalty/std": 0.009183208458125591, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21465714275836945, "rewards/total_composite/std": 0.1751587986946106, "reward": 0.21465714275836945, "reward_std": 0.1751587986946106, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14708156883716583, "sampling/sampling_logp_difference/max": 1.144773006439209, "sampling/importance_sampling_ratio/min": 0.3182961642742157, "sampling/importance_sampling_ratio/mean": 1.0248851776123047, "sampling/importance_sampling_ratio/max": 1.794689416885376, "entropy": 1.215759925544262, "clip_ratio/low_mean": 0.045703339856117964, "clip_ratio/low_min": 0.045703339856117964, "clip_ratio/high_mean": 0.09492244198918343, "clip_ratio/high_max": 0.09492244198918343, "clip_ratio/region_mean": 0.1406257818453014, "reward_total_mean": 0.21465714275836945, "reward_meter_mean": 0.6765033006668091, "reward_meter_std": 0.45151782035827637, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.8960034847259521, "reward_lexical_plausibility_std": 0.17476549744606018, "reward_repeat_penalty_mean": 0.7788149118423462, "reward_repeat_penalty_std": 0.08963186293840408, "reward_repeat_floor_mean": 0.9863879680633545, "reward_repeat_floor_std": 0.005666534882038832, "reward_near_duplicate_penalty_mean": 0.9967532157897949, "reward_near_duplicate_penalty_std": 0.009183208458125591, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.21465714275836945, "reward_total_composite_std": 0.1751587986946106} {"timestamp_utc": "2026-04-12T20:33:26Z", "mode": "train", "global_step": 1200, "epoch": 0.06315457081206252, "loss": 0.0866, "grad_norm": 7.650173187255859, "learning_rate": 6.366666666666668e-06, "num_tokens": 2138897.0, "completions/mean_length": 148.25, "completions/min_length": 127.0, "completions/max_length": 200.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 148.25, "completions/min_terminated_length": 127.0, "completions/max_terminated_length": 200.0, "rewards/meter/mean": 0.8345358371734619, "rewards/meter/std": 0.16472771763801575, "rewards/count_adherence/mean": 0.598214328289032, "rewards/count_adherence/std": 0.06543752551078796, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8794642686843872, "rewards/count_floor/std": 0.01963125728070736, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.11456432938575745, "rewards/repeat_penalty/std": 0.07127604633569717, "rewards/repeat_floor/mean": 0.8602797389030457, "rewards/repeat_floor/std": 0.040996063500642776, "rewards/near_duplicate_penalty/mean": 0.6809592247009277, "rewards/near_duplicate_penalty/std": 0.1290561556816101, "rewards/opening_diversity/mean": 0.47280287742614746, "rewards/opening_diversity/std": 0.24958428740501404, "rewards/distinct_2/mean": 0.33075234293937683, "rewards/distinct_2/std": 0.15208888053894043, "rewards/total_composite/mean": 0.21884483098983765, "rewards/total_composite/std": 0.07116051018238068, "reward": 0.21884483098983765, "reward_std": 0.07116050273180008, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09359678626060486, "sampling/sampling_logp_difference/max": 2.6280698776245117, "sampling/importance_sampling_ratio/min": 0.07221771776676178, "sampling/importance_sampling_ratio/mean": 1.0027965307235718, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6755676865577698, "clip_ratio/low_mean": 0.019725318998098373, "clip_ratio/low_min": 0.019725318998098373, "clip_ratio/high_mean": 0.08952105836942792, "clip_ratio/high_max": 0.08952105836942792, "clip_ratio/region_mean": 0.10924637736752629, "reward_total_mean": 0.21884483098983765, "reward_meter_mean": 0.8345358371734619, "reward_meter_std": 0.16472771763801575, "reward_count_adherence_mean": 0.598214328289032, "reward_count_adherence_std": 0.06543752551078796, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8794642686843872, "reward_count_floor_std": 0.01963125728070736, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.11456432938575745, "reward_repeat_penalty_std": 0.07127604633569717, "reward_repeat_floor_mean": 0.8602797389030457, "reward_repeat_floor_std": 0.040996063500642776, "reward_near_duplicate_penalty_mean": 0.6809592247009277, "reward_near_duplicate_penalty_std": 0.1290561556816101, "reward_opening_diversity_mean": 0.47280287742614746, "reward_opening_diversity_std": 0.24958428740501404, "reward_distinct_2_mean": 0.33075234293937683, "reward_distinct_2_std": 0.15208888053894043, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.21884483098983765, "reward_total_composite_std": 0.07116051018238068} {"timestamp_utc": "2026-04-12T20:35:18Z", "mode": "eval", "global_step": 1200, "epoch": 0.06315457081206252, "eval_loss": NaN, "eval_runtime": 111.625, "eval_samples_per_second": 0.932, "eval_steps_per_second": 0.116, "eval_num_tokens": 2138897.0, "eval_completions/mean_length": 99.53846153846153, "eval_completions/min_length": 28.23076923076923, "eval_completions/max_length": 258.6923076923077, "eval_completions/clipped_ratio": 0.028846153846153848, "eval_completions/mean_terminated_length": 87.33379246638371, "eval_completions/min_terminated_length": 28.23076923076923, "eval_completions/max_terminated_length": 190.53846153846155, "eval_rewards/meter/mean": 0.5399709687783167, "eval_rewards/meter/std": 0.403679588666329, "eval_rewards/count_adherence/mean": 0.6893736857634324, "eval_rewards/count_adherence/std": 0.17183029307768896, "eval_rewards/arabic_clean/mean": 0.9423076923076923, "eval_rewards/arabic_clean/std": 0.12140072079805228, "eval_rewards/hard_gate/mean": 0.9903846153846154, "eval_rewards/hard_gate/std": 0.027196414195574246, "eval_rewards/arabic_floor/mean": 0.9985576913906977, "eval_rewards/arabic_floor/std": 0.004079461670838869, "eval_rewards/count_floor/mean": 0.906812099310068, "eval_rewards/count_floor/std": 0.05154908906954985, "eval_rewards/lexical_plausibility/mean": 0.9854171963838431, "eval_rewards/lexical_plausibility/std": 0.041246407880232885, "eval_rewards/judge_quality/mean": 0.35634615329595715, "eval_rewards/judge_quality/std": 0.17094641694655785, "eval_rewards/repeat_penalty/mean": 0.7649480929741492, "eval_rewards/repeat_penalty/std": 0.22522002802445337, "eval_rewards/repeat_floor/mean": 0.9734325546484727, "eval_rewards/repeat_floor/std": 0.026794853405310556, "eval_rewards/near_duplicate_penalty/mean": 0.9295695607478802, "eval_rewards/near_duplicate_penalty/std": 0.0630534474666302, "eval_rewards/opening_diversity/mean": 0.9619390826958877, "eval_rewards/opening_diversity/std": 0.0756664781902845, "eval_rewards/distinct_2/mean": 0.8475641654087946, "eval_rewards/distinct_2/std": 0.1847701961031327, "eval_rewards/total_composite/mean": 0.16604607437665647, "eval_rewards/total_composite/std": 0.15247203266391388, "eval_reward": 0.16604607437665647, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.07127173588826106, "eval_sampling/sampling_logp_difference/max": 1.1292851521418645, "eval_sampling/importance_sampling_ratio/min": 0.33061610276882464, "eval_sampling/importance_sampling_ratio/mean": 1.0207775556124175, "eval_sampling/importance_sampling_ratio/max": 1.5605387045786931, "eval_entropy": 0.8297604001485385, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.16604607437665647, "eval_reward_meter_mean": 0.5399709687783167, "eval_reward_meter_std": 0.403679588666329, "eval_reward_count_adherence_mean": 0.6893736857634324, "eval_reward_count_adherence_std": 0.17183029307768896, "eval_reward_arabic_clean_mean": 0.9423076923076923, "eval_reward_arabic_clean_std": 0.12140072079805228, "eval_reward_hard_gate_mean": 0.9903846153846154, "eval_reward_hard_gate_std": 0.027196414195574246, "eval_reward_arabic_floor_mean": 0.9985576913906977, "eval_reward_arabic_floor_std": 0.004079461670838869, "eval_reward_count_floor_mean": 0.906812099310068, "eval_reward_count_floor_std": 0.05154908906954985, "eval_reward_lexical_plausibility_mean": 0.9854171963838431, "eval_reward_lexical_plausibility_std": 0.041246407880232885, "eval_reward_repeat_penalty_mean": 0.7649480929741492, "eval_reward_repeat_penalty_std": 0.22522002802445337, "eval_reward_repeat_floor_mean": 0.9734325546484727, "eval_reward_repeat_floor_std": 0.026794853405310556, "eval_reward_near_duplicate_penalty_mean": 0.9295695607478802, "eval_reward_near_duplicate_penalty_std": 0.0630534474666302, "eval_reward_opening_diversity_mean": 0.9619390826958877, "eval_reward_opening_diversity_std": 0.0756664781902845, "eval_reward_distinct_2_mean": 0.8475641654087946, "eval_reward_distinct_2_std": 0.1847701961031327, "eval_reward_judge_quality_mean": 0.35634615329595715, "eval_reward_judge_quality_std": 0.17094641694655785, "eval_reward_total_composite_mean": 0.16604607437665647, "eval_reward_total_composite_std": 0.15247203266391388} {"timestamp_utc": "2026-04-12T20:35:36Z", "mode": "train", "global_step": 1201, "epoch": 0.06320719962107257, "loss": -0.072, "grad_norm": 7.008788108825684, "learning_rate": 6.363636363636364e-06, "num_tokens": 2140397.0, "completions/mean_length": 97.5, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.28571701049805, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.8029114603996277, "rewards/meter/std": 0.35101836919784546, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9611736536026001, "rewards/lexical_plausibility/std": 0.10981755703687668, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.3071993589401245, "rewards/repeat_penalty/mean": 0.9936205744743347, "rewards/repeat_penalty/std": 0.009501545690000057, "rewards/repeat_floor/mean": 0.9990431070327759, "rewards/repeat_floor/std": 0.0014252327382564545, "rewards/near_duplicate_penalty/mean": 0.9936205744743347, "rewards/near_duplicate_penalty/std": 0.009501545690000057, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.48663556575775146, "rewards/total_composite/std": 0.33136990666389465, "reward": 0.48663556575775146, "reward_std": 0.33136990666389465, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14729870855808258, "sampling/sampling_logp_difference/max": 1.2603862285614014, "sampling/importance_sampling_ratio/min": 0.28354448080062866, "sampling/importance_sampling_ratio/mean": 1.0013937950134277, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7681055665016174, "clip_ratio/low_mean": 0.08650779351592064, "clip_ratio/low_min": 0.08650779351592064, "clip_ratio/high_mean": 0.03159098140895367, "clip_ratio/high_max": 0.03159098140895367, "clip_ratio/region_mean": 0.1180987749248743, "reward_total_mean": 0.48663556575775146, "reward_meter_mean": 0.8029114603996277, "reward_meter_std": 0.35101836919784546, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9611736536026001, "reward_lexical_plausibility_std": 0.10981755703687668, "reward_repeat_penalty_mean": 0.9936205744743347, "reward_repeat_penalty_std": 0.009501545690000057, "reward_repeat_floor_mean": 0.9990431070327759, "reward_repeat_floor_std": 0.0014252327382564545, "reward_near_duplicate_penalty_mean": 0.9936205744743347, "reward_near_duplicate_penalty_std": 0.009501545690000057, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.3071993589401245, "reward_total_composite_mean": 0.48663556575775146, "reward_total_composite_std": 0.33136990666389465} {"timestamp_utc": "2026-04-12T20:35:45Z", "mode": "train", "global_step": 1202, "epoch": 0.06325982843008263, "loss": 0.0206, "grad_norm": 16.42057228088379, "learning_rate": 6.3606060606060615e-06, "num_tokens": 2141842.0, "completions/mean_length": 37.625, "completions/min_length": 34.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.625, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.9312632083892822, "rewards/meter/std": 0.06470198929309845, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.7945879697799683, "rewards/repeat_penalty/std": 0.169195756316185, "rewards/repeat_floor/mean": 0.9748214483261108, "rewards/repeat_floor/std": 0.019403159618377686, "rewards/near_duplicate_penalty/mean": 0.9054898619651794, "rewards/near_duplicate_penalty/std": 0.05964653939008713, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.898588240146637, "rewards/distinct_2/std": 0.10835838317871094, "rewards/total_composite/mean": 0.3089689016342163, "rewards/total_composite/std": 0.1473286747932434, "reward": 0.3089689016342163, "reward_std": 0.14732865989208221, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12740515172481537, "sampling/sampling_logp_difference/max": 1.2794170379638672, "sampling/importance_sampling_ratio/min": 0.2781994342803955, "sampling/importance_sampling_ratio/mean": 1.0375691652297974, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9828255251049995, "clip_ratio/low_mean": 0.04012907110154629, "clip_ratio/low_min": 0.04012907110154629, "clip_ratio/high_mean": 0.05993717163801193, "clip_ratio/high_max": 0.05993717163801193, "clip_ratio/region_mean": 0.10006624273955822, "reward_total_mean": 0.3089689016342163, "reward_meter_mean": 0.9312632083892822, "reward_meter_std": 0.06470198929309845, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7945879697799683, "reward_repeat_penalty_std": 0.169195756316185, "reward_repeat_floor_mean": 0.9748214483261108, "reward_repeat_floor_std": 0.019403159618377686, "reward_near_duplicate_penalty_mean": 0.9054898619651794, "reward_near_duplicate_penalty_std": 0.05964653939008713, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.898588240146637, "reward_distinct_2_std": 0.10835838317871094, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.3089689016342163, "reward_total_composite_std": 0.1473286747932434} {"timestamp_utc": "2026-04-12T20:35:53Z", "mode": "train", "global_step": 1203, "epoch": 0.06331245723909268, "loss": 0.0639, "grad_norm": 21.74378204345703, "learning_rate": 6.357575757575758e-06, "num_tokens": 2143520.0, "completions/mean_length": 34.75, "completions/min_length": 32.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.75, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.6564161777496338, "rewards/meter/std": 0.37329354882240295, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.2512255907058716, "rewards/repeat_penalty/mean": 0.9125479459762573, "rewards/repeat_penalty/std": 0.09410092979669571, "rewards/repeat_floor/mean": 0.9882010817527771, "rewards/repeat_floor/std": 0.01300717331469059, "rewards/near_duplicate_penalty/mean": 0.9395591020584106, "rewards/near_duplicate_penalty/std": 0.06932149082422256, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9696356058120728, "rewards/distinct_2/std": 0.04190681502223015, "rewards/total_composite/mean": 0.4698362946510315, "rewards/total_composite/std": 0.3359878361225128, "reward": 0.4698362946510315, "reward_std": 0.3359878361225128, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12448786944150925, "sampling/sampling_logp_difference/max": 1.6460838317871094, "sampling/importance_sampling_ratio/min": 0.1928034871816635, "sampling/importance_sampling_ratio/mean": 0.9984982013702393, "sampling/importance_sampling_ratio/max": 1.8500926494598389, "entropy": 0.6688754260540009, "clip_ratio/low_mean": 0.05910828988999128, "clip_ratio/low_min": 0.05910828988999128, "clip_ratio/high_mean": 0.03399342764168978, "clip_ratio/high_max": 0.03399342764168978, "clip_ratio/region_mean": 0.09310171753168106, "reward_total_mean": 0.4698362946510315, "reward_meter_mean": 0.6564161777496338, "reward_meter_std": 0.37329354882240295, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9125479459762573, "reward_repeat_penalty_std": 0.09410092979669571, "reward_repeat_floor_mean": 0.9882010817527771, "reward_repeat_floor_std": 0.01300717331469059, "reward_near_duplicate_penalty_mean": 0.9395591020584106, "reward_near_duplicate_penalty_std": 0.06932149082422256, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9696356058120728, "reward_distinct_2_std": 0.04190681502223015, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.2512255907058716, "reward_total_composite_mean": 0.4698362946510315, "reward_total_composite_std": 0.3359878361225128} {"timestamp_utc": "2026-04-12T20:36:03Z", "mode": "train", "global_step": 1204, "epoch": 0.06336508604810273, "loss": 0.1669, "grad_norm": 10.4877347946167, "learning_rate": 6.354545454545455e-06, "num_tokens": 2145527.0, "completions/mean_length": 63.875, "completions/min_length": 41.0, "completions/max_length": 83.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 63.875, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 83.0, "rewards/meter/mean": 0.733081042766571, "rewards/meter/std": 0.33875375986099243, "rewards/count_adherence/mean": 0.65625, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8968750238418579, "rewards/count_floor/std": 0.0388161838054657, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9397873878479004, "rewards/repeat_penalty/std": 0.05229237675666809, "rewards/repeat_floor/mean": 0.991862416267395, "rewards/repeat_floor/std": 0.00680643180385232, "rewards/near_duplicate_penalty/mean": 0.9566202163696289, "rewards/near_duplicate_penalty/std": 0.03369787707924843, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9818822145462036, "rewards/distinct_2/std": 0.025771545246243477, "rewards/total_composite/mean": 0.16590189933776855, "rewards/total_composite/std": 0.09892627596855164, "reward": 0.16590189933776855, "reward_std": 0.09892627596855164, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14697673916816711, "sampling/sampling_logp_difference/max": 1.9397528171539307, "sampling/importance_sampling_ratio/min": 0.1437394767999649, "sampling/importance_sampling_ratio/mean": 1.0007494688034058, "sampling/importance_sampling_ratio/max": 1.9181885719299316, "entropy": 0.9829893261194229, "clip_ratio/low_mean": 0.05677100457251072, "clip_ratio/low_min": 0.05677100457251072, "clip_ratio/high_mean": 0.06569111905992031, "clip_ratio/high_max": 0.06569111905992031, "clip_ratio/region_mean": 0.12246212363243103, "reward_total_mean": 0.16590189933776855, "reward_meter_mean": 0.733081042766571, "reward_meter_std": 0.33875375986099243, "reward_count_adherence_mean": 0.65625, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8968750238418579, "reward_count_floor_std": 0.0388161838054657, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9397873878479004, "reward_repeat_penalty_std": 0.05229237675666809, "reward_repeat_floor_mean": 0.991862416267395, "reward_repeat_floor_std": 0.00680643180385232, "reward_near_duplicate_penalty_mean": 0.9566202163696289, "reward_near_duplicate_penalty_std": 0.03369787707924843, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9818822145462036, "reward_distinct_2_std": 0.025771545246243477, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.16590189933776855, "reward_total_composite_std": 0.09892627596855164} {"timestamp_utc": "2026-04-12T20:36:11Z", "mode": "train", "global_step": 1205, "epoch": 0.06341771485711278, "loss": 0.0233, "grad_norm": 21.569499969482422, "learning_rate": 6.3515151515151516e-06, "num_tokens": 2146853.0, "completions/mean_length": 18.75, "completions/min_length": 17.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.75, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.7382795810699463, "rewards/meter/std": 0.4383016526699066, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5012500286102295, "rewards/judge_quality/std": 0.36286312341690063, "rewards/repeat_penalty/mean": 0.7296368479728699, "rewards/repeat_penalty/std": 0.14529210329055786, "rewards/repeat_floor/mean": 0.9770223498344421, "rewards/repeat_floor/std": 0.020359160378575325, "rewards/near_duplicate_penalty/mean": 0.9448052048683167, "rewards/near_duplicate_penalty/std": 0.1022009328007698, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.35865330696105957, "rewards/total_composite/std": 0.3571521043777466, "reward": 0.35865330696105957, "reward_std": 0.35715213418006897, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17650271952152252, "sampling/sampling_logp_difference/max": 1.5873017311096191, "sampling/importance_sampling_ratio/min": 0.20447658002376556, "sampling/importance_sampling_ratio/mean": 0.9966835975646973, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0803226828575134, "clip_ratio/low_mean": 0.09669086989015341, "clip_ratio/low_min": 0.09669086989015341, "clip_ratio/high_mean": 0.03947368264198303, "clip_ratio/high_max": 0.03947368264198303, "clip_ratio/region_mean": 0.13616455253213644, "reward_total_mean": 0.35865330696105957, "reward_meter_mean": 0.7382795810699463, "reward_meter_std": 0.4383016526699066, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7296368479728699, "reward_repeat_penalty_std": 0.14529210329055786, "reward_repeat_floor_mean": 0.9770223498344421, "reward_repeat_floor_std": 0.020359160378575325, "reward_near_duplicate_penalty_mean": 0.9448052048683167, "reward_near_duplicate_penalty_std": 0.1022009328007698, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.5012500286102295, "reward_judge_quality_std": 0.36286312341690063, "reward_total_composite_mean": 0.35865330696105957, "reward_total_composite_std": 0.3571521043777466} {"timestamp_utc": "2026-04-12T20:36:20Z", "mode": "train", "global_step": 1206, "epoch": 0.06347034366612284, "loss": -0.0109, "grad_norm": 15.907942771911621, "learning_rate": 6.34848484848485e-06, "num_tokens": 2148488.0, "completions/mean_length": 28.375, "completions/min_length": 24.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.375, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.5188062191009521, "rewards/meter/std": 0.39765051007270813, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.9719680547714233, "rewards/repeat_penalty/std": 0.03793061897158623, "rewards/repeat_floor/mean": 0.9957951903343201, "rewards/repeat_floor/std": 0.005689589306712151, "rewards/near_duplicate_penalty/mean": 0.9719680547714233, "rewards/near_duplicate_penalty/std": 0.03793061897158623, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.234795480966568, "rewards/total_composite/std": 0.17182940244674683, "reward": 0.234795480966568, "reward_std": 0.17182940244674683, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13703396916389465, "sampling/sampling_logp_difference/max": 1.294355869293213, "sampling/importance_sampling_ratio/min": 0.27407434582710266, "sampling/importance_sampling_ratio/mean": 0.9839217662811279, "sampling/importance_sampling_ratio/max": 1.9476102590560913, "entropy": 0.9434890896081924, "clip_ratio/low_mean": 0.0903625562787056, "clip_ratio/low_min": 0.0903625562787056, "clip_ratio/high_mean": 0.060693761333823204, "clip_ratio/high_max": 0.060693761333823204, "clip_ratio/region_mean": 0.1510563176125288, "reward_total_mean": 0.234795480966568, "reward_meter_mean": 0.5188062191009521, "reward_meter_std": 0.39765051007270813, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9719680547714233, "reward_repeat_penalty_std": 0.03793061897158623, "reward_repeat_floor_mean": 0.9957951903343201, "reward_repeat_floor_std": 0.005689589306712151, "reward_near_duplicate_penalty_mean": 0.9719680547714233, "reward_near_duplicate_penalty_std": 0.03793061897158623, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.234795480966568, "reward_total_composite_std": 0.17182940244674683} {"timestamp_utc": "2026-04-12T20:36:34Z", "mode": "train", "global_step": 1207, "epoch": 0.06352297247513289, "loss": -0.0949, "grad_norm": 3.60880708694458, "learning_rate": 6.345454545454546e-06, "num_tokens": 2150185.0, "completions/mean_length": 107.125, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 49.28571701049805, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.7138907313346863, "rewards/meter/std": 0.39355406165122986, "rewards/count_adherence/mean": 0.59375, "rewards/count_adherence/std": 0.18600596487522125, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.8781250715255737, "rewards/count_floor/std": 0.05580179765820503, "rewards/lexical_plausibility/mean": 0.9553365111351013, "rewards/lexical_plausibility/std": 0.12632741034030914, "rewards/judge_quality/mean": 0.34999996423721313, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.7574905157089233, "rewards/repeat_penalty/std": 0.1678810715675354, "rewards/repeat_floor/mean": 0.9705373048782349, "rewards/repeat_floor/std": 0.02032845839858055, "rewards/near_duplicate_penalty/mean": 0.8933776617050171, "rewards/near_duplicate_penalty/std": 0.08141732960939407, "rewards/opening_diversity/mean": 0.956250011920929, "rewards/opening_diversity/std": 0.09038607776165009, "rewards/distinct_2/mean": 0.8795071840286255, "rewards/distinct_2/std": 0.10103638470172882, "rewards/total_composite/mean": 0.2213066965341568, "rewards/total_composite/std": 0.13975903391838074, "reward": 0.2213066965341568, "reward_std": 0.13975903391838074, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18231259286403656, "sampling/sampling_logp_difference/max": 4.9658894538879395, "sampling/importance_sampling_ratio/min": 0.006971747148782015, "sampling/importance_sampling_ratio/mean": 0.9963338375091553, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8248138725757599, "clip_ratio/low_mean": 0.02142857201397419, "clip_ratio/low_min": 0.02142857201397419, "clip_ratio/high_mean": 0.12161261029541492, "clip_ratio/high_max": 0.12161261029541492, "clip_ratio/region_mean": 0.14304118230938911, "reward_total_mean": 0.2213066965341568, "reward_meter_mean": 0.7138907313346863, "reward_meter_std": 0.39355406165122986, "reward_count_adherence_mean": 0.59375, "reward_count_adherence_std": 0.18600596487522125, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.8781250715255737, "reward_count_floor_std": 0.05580179765820503, "reward_lexical_plausibility_mean": 0.9553365111351013, "reward_lexical_plausibility_std": 0.12632741034030914, "reward_repeat_penalty_mean": 0.7574905157089233, "reward_repeat_penalty_std": 0.1678810715675354, "reward_repeat_floor_mean": 0.9705373048782349, "reward_repeat_floor_std": 0.02032845839858055, "reward_near_duplicate_penalty_mean": 0.8933776617050171, "reward_near_duplicate_penalty_std": 0.08141732960939407, "reward_opening_diversity_mean": 0.956250011920929, "reward_opening_diversity_std": 0.09038607776165009, "reward_distinct_2_mean": 0.8795071840286255, "reward_distinct_2_std": 0.10103638470172882, "reward_judge_quality_mean": 0.34999996423721313, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.2213066965341568, "reward_total_composite_std": 0.13975903391838074} {"timestamp_utc": "2026-04-12T20:36:42Z", "mode": "train", "global_step": 1208, "epoch": 0.06357560128414294, "loss": 0.0455, "grad_norm": 23.564870834350586, "learning_rate": 6.342424242424243e-06, "num_tokens": 2151509.0, "completions/mean_length": 17.5, "completions/min_length": 14.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.5, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.7611930966377258, "rewards/meter/std": 0.3555090129375458, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.2173829823732376, "rewards/repeat_penalty/mean": 0.7329545617103577, "rewards/repeat_penalty/std": 0.04821182042360306, "rewards/repeat_floor/mean": 0.9815909266471863, "rewards/repeat_floor/std": 0.009642376564443111, "rewards/near_duplicate_penalty/mean": 0.9772727489471436, "rewards/near_duplicate_penalty/std": 0.06428243964910507, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2852109372615814, "rewards/total_composite/std": 0.13652414083480835, "reward": 0.2852109372615814, "reward_std": 0.13652415573596954, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1368054747581482, "sampling/sampling_logp_difference/max": 1.1629854440689087, "sampling/importance_sampling_ratio/min": 0.31255167722702026, "sampling/importance_sampling_ratio/mean": 1.0286072492599487, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.042983703315258, "clip_ratio/low_mean": 0.031746032647788525, "clip_ratio/low_min": 0.031746032647788525, "clip_ratio/high_mean": 0.07504438143223524, "clip_ratio/high_max": 0.07504438143223524, "clip_ratio/region_mean": 0.10679041408002377, "reward_total_mean": 0.2852109372615814, "reward_meter_mean": 0.7611930966377258, "reward_meter_std": 0.3555090129375458, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7329545617103577, "reward_repeat_penalty_std": 0.04821182042360306, "reward_repeat_floor_mean": 0.9815909266471863, "reward_repeat_floor_std": 0.009642376564443111, "reward_near_duplicate_penalty_mean": 0.9772727489471436, "reward_near_duplicate_penalty_std": 0.06428243964910507, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.2173829823732376, "reward_total_composite_mean": 0.2852109372615814, "reward_total_composite_std": 0.13652414083480835} {"timestamp_utc": "2026-04-12T20:36:56Z", "mode": "train", "global_step": 1209, "epoch": 0.063628230093153, "loss": -0.0248, "grad_norm": 5.25899600982666, "learning_rate": 6.33939393939394e-06, "num_tokens": 2153559.0, "completions/mean_length": 193.25, "completions/min_length": 83.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 87.0, "completions/min_terminated_length": 83.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.20541584491729736, "rewards/meter/std": 0.2512703239917755, "rewards/count_adherence/mean": 0.6458333730697632, "rewards/count_adherence/std": 0.0589255727827549, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8937499523162842, "rewards/count_floor/std": 0.017677653580904007, "rewards/lexical_plausibility/mean": 0.9278985261917114, "rewards/lexical_plausibility/std": 0.13665519654750824, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.1505940705537796, "rewards/repeat_penalty/mean": 0.9035552740097046, "rewards/repeat_penalty/std": 0.053205035626888275, "rewards/repeat_floor/mean": 0.9888391494750977, "rewards/repeat_floor/std": 0.005328211933374405, "rewards/near_duplicate_penalty/mean": 0.9597481489181519, "rewards/near_duplicate_penalty/std": 0.014031111262738705, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9482852220535278, "rewards/distinct_2/std": 0.035729460418224335, "rewards/total_composite/mean": 0.030430592596530914, "rewards/total_composite/std": 0.02682132087647915, "reward": 0.030430592596530914, "reward_std": 0.026821322739124298, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20513655245304108, "sampling/sampling_logp_difference/max": 6.901684761047363, "sampling/importance_sampling_ratio/min": 0.0010060889180749655, "sampling/importance_sampling_ratio/mean": 1.0060534477233887, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.75008674710989, "clip_ratio/low_mean": 0.020650184247642756, "clip_ratio/low_min": 0.020650184247642756, "clip_ratio/high_mean": 0.07043274398893118, "clip_ratio/high_max": 0.07043274398893118, "clip_ratio/region_mean": 0.09108292823657393, "reward_total_mean": 0.030430592596530914, "reward_meter_mean": 0.20541584491729736, "reward_meter_std": 0.2512703239917755, "reward_count_adherence_mean": 0.6458333730697632, "reward_count_adherence_std": 0.0589255727827549, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8937499523162842, "reward_count_floor_std": 0.017677653580904007, "reward_lexical_plausibility_mean": 0.9278985261917114, "reward_lexical_plausibility_std": 0.13665519654750824, "reward_repeat_penalty_mean": 0.9035552740097046, "reward_repeat_penalty_std": 0.053205035626888275, "reward_repeat_floor_mean": 0.9888391494750977, "reward_repeat_floor_std": 0.005328211933374405, "reward_near_duplicate_penalty_mean": 0.9597481489181519, "reward_near_duplicate_penalty_std": 0.014031111262738705, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9482852220535278, "reward_distinct_2_std": 0.035729460418224335, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.1505940705537796, "reward_total_composite_mean": 0.030430592596530914, "reward_total_composite_std": 0.02682132087647915} {"timestamp_utc": "2026-04-12T20:37:04Z", "mode": "train", "global_step": 1210, "epoch": 0.06368085890216305, "loss": 0.0911, "grad_norm": 21.43655776977539, "learning_rate": 6.336363636363637e-06, "num_tokens": 2155006.0, "completions/mean_length": 18.875, "completions/min_length": 17.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.875, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.752964437007904, "rewards/meter/std": 0.3473961055278778, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27183228731155396, "rewards/total_composite/std": 0.16105426847934723, "reward": 0.27183228731155396, "reward_std": 0.16105428338050842, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15867464244365692, "sampling/sampling_logp_difference/max": 2.0039024353027344, "sampling/importance_sampling_ratio/min": 0.13480816781520844, "sampling/importance_sampling_ratio/mean": 1.0121946334838867, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1300195679068565, "clip_ratio/low_mean": 0.05700188176706433, "clip_ratio/low_min": 0.05700188176706433, "clip_ratio/high_mean": 0.06751867523416877, "clip_ratio/high_max": 0.06751867523416877, "clip_ratio/region_mean": 0.1245205570012331, "reward_total_mean": 0.27183228731155396, "reward_meter_mean": 0.752964437007904, "reward_meter_std": 0.3473961055278778, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.27183228731155396, "reward_total_composite_std": 0.16105426847934723} {"timestamp_utc": "2026-04-12T20:37:18Z", "mode": "train", "global_step": 1211, "epoch": 0.0637334877111731, "loss": 0.0038, "grad_norm": 14.992835998535156, "learning_rate": 6.333333333333333e-06, "num_tokens": 2156592.0, "completions/mean_length": 92.25, "completions/min_length": 19.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 32.28571701049805, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.4348967969417572, "rewards/meter/std": 0.4210846424102783, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 0.9319894313812256, "rewards/lexical_plausibility/std": 0.1379537731409073, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.14880475401878357, "rewards/repeat_penalty/mean": 0.8651514053344727, "rewards/repeat_penalty/std": 0.0973212793469429, "rewards/repeat_floor/mean": 0.9892520904541016, "rewards/repeat_floor/std": 0.004238321911543608, "rewards/near_duplicate_penalty/mean": 0.976586639881134, "rewards/near_duplicate_penalty/std": 0.030550716444849968, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9821012020111084, "rewards/distinct_2/std": 0.03315402567386627, "rewards/total_composite/mean": 0.09467208385467529, "rewards/total_composite/std": 0.1028226688504219, "reward": 0.09467208385467529, "reward_std": 0.1028226688504219, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1479664295911789, "sampling/sampling_logp_difference/max": 1.4311161041259766, "sampling/importance_sampling_ratio/min": 0.2390419840812683, "sampling/importance_sampling_ratio/mean": 1.0245029926300049, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0029484778642654, "clip_ratio/low_mean": 0.0645554643124342, "clip_ratio/low_min": 0.0645554643124342, "clip_ratio/high_mean": 0.03510458953678608, "clip_ratio/high_max": 0.03510458953678608, "clip_ratio/region_mean": 0.09966005384922028, "reward_total_mean": 0.09467208385467529, "reward_meter_mean": 0.4348967969417572, "reward_meter_std": 0.4210846424102783, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 0.9319894313812256, "reward_lexical_plausibility_std": 0.1379537731409073, "reward_repeat_penalty_mean": 0.8651514053344727, "reward_repeat_penalty_std": 0.0973212793469429, "reward_repeat_floor_mean": 0.9892520904541016, "reward_repeat_floor_std": 0.004238321911543608, "reward_near_duplicate_penalty_mean": 0.976586639881134, "reward_near_duplicate_penalty_std": 0.030550716444849968, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9821012020111084, "reward_distinct_2_std": 0.03315402567386627, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.14880475401878357, "reward_total_composite_mean": 0.09467208385467529, "reward_total_composite_std": 0.1028226688504219} {"timestamp_utc": "2026-04-12T20:37:32Z", "mode": "train", "global_step": 1212, "epoch": 0.06378611652018315, "loss": -0.1068, "grad_norm": 4.133994102478027, "learning_rate": 6.330303030303031e-06, "num_tokens": 2158403.0, "completions/mean_length": 180.375, "completions/min_length": 58.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 69.83333587646484, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.7337206602096558, "rewards/meter/std": 0.3387097120285034, "rewards/count_adherence/mean": 0.6000000238418579, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8799999952316284, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.935899555683136, "rewards/lexical_plausibility/std": 0.12873761355876923, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.8237954378128052, "rewards/repeat_penalty/std": 0.13474205136299133, "rewards/repeat_floor/mean": 0.9798691272735596, "rewards/repeat_floor/std": 0.014733619056642056, "rewards/near_duplicate_penalty/mean": 0.9424534440040588, "rewards/near_duplicate_penalty/std": 0.030256416648626328, "rewards/opening_diversity/mean": 0.9821428656578064, "rewards/opening_diversity/std": 0.05050762742757797, "rewards/distinct_2/mean": 0.8841394186019897, "rewards/distinct_2/std": 0.09345018118619919, "rewards/total_composite/mean": 0.1660452038049698, "rewards/total_composite/std": 0.13699889183044434, "reward": 0.1660452038049698, "reward_std": 0.13699889183044434, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16011005640029907, "sampling/sampling_logp_difference/max": 1.9461746215820312, "sampling/importance_sampling_ratio/min": 0.1428193598985672, "sampling/importance_sampling_ratio/mean": 1.0197577476501465, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7529733255505562, "clip_ratio/low_mean": 0.05727875977754593, "clip_ratio/low_min": 0.05727875977754593, "clip_ratio/high_mean": 0.050101449713110924, "clip_ratio/high_max": 0.050101449713110924, "clip_ratio/region_mean": 0.10738020949065685, "reward_total_mean": 0.1660452038049698, "reward_meter_mean": 0.7337206602096558, "reward_meter_std": 0.3387097120285034, "reward_count_adherence_mean": 0.6000000238418579, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8799999952316284, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.935899555683136, "reward_lexical_plausibility_std": 0.12873761355876923, "reward_repeat_penalty_mean": 0.8237954378128052, "reward_repeat_penalty_std": 0.13474205136299133, "reward_repeat_floor_mean": 0.9798691272735596, "reward_repeat_floor_std": 0.014733619056642056, "reward_near_duplicate_penalty_mean": 0.9424534440040588, "reward_near_duplicate_penalty_std": 0.030256416648626328, "reward_opening_diversity_mean": 0.9821428656578064, "reward_opening_diversity_std": 0.05050762742757797, "reward_distinct_2_mean": 0.8841394186019897, "reward_distinct_2_std": 0.09345018118619919, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.1660452038049698, "reward_total_composite_std": 0.13699889183044434} {"timestamp_utc": "2026-04-12T20:37:41Z", "mode": "train", "global_step": 1213, "epoch": 0.0638387453291932, "loss": 0.1538, "grad_norm": 21.867694854736328, "learning_rate": 6.327272727272727e-06, "num_tokens": 2159802.0, "completions/mean_length": 20.875, "completions/min_length": 17.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.875, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.8007805943489075, "rewards/meter/std": 0.3548671007156372, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.25088417530059814, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4320274293422699, "rewards/total_composite/std": 0.31167376041412354, "reward": 0.4320274293422699, "reward_std": 0.31167376041412354, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15956537425518036, "sampling/sampling_logp_difference/max": 1.5569047927856445, "sampling/importance_sampling_ratio/min": 0.21078747510910034, "sampling/importance_sampling_ratio/mean": 1.0307022333145142, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9438512027263641, "clip_ratio/low_mean": 0.07086055586114526, "clip_ratio/low_min": 0.07086055586114526, "clip_ratio/high_mean": 0.040204678662121296, "clip_ratio/high_max": 0.040204678662121296, "clip_ratio/region_mean": 0.11106523452326655, "reward_total_mean": 0.4320274293422699, "reward_meter_mean": 0.8007805943489075, "reward_meter_std": 0.3548671007156372, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.25088417530059814, "reward_total_composite_mean": 0.4320274293422699, "reward_total_composite_std": 0.31167376041412354} {"timestamp_utc": "2026-04-12T20:37:49Z", "mode": "train", "global_step": 1214, "epoch": 0.06389137413820326, "loss": -0.001, "grad_norm": 21.382360458374023, "learning_rate": 6.324242424242425e-06, "num_tokens": 2161232.0, "completions/mean_length": 19.75, "completions/min_length": 17.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.75, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.020442329347133636, "rewards/meter/std": 0.017357273027300835, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.5137500166893005, "rewards/judge_quality/std": 0.35860592126846313, "rewards/repeat_penalty/mean": 0.6933351755142212, "rewards/repeat_penalty/std": 0.06524933129549026, "rewards/repeat_floor/mean": 0.9736670255661011, "rewards/repeat_floor/std": 0.013049869798123837, "rewards/near_duplicate_penalty/mean": 0.9244468212127686, "rewards/near_duplicate_penalty/std": 0.08699910342693329, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.01031399704515934, "rewards/total_composite/std": 0.014790808781981468, "reward": 0.01031399704515934, "reward_std": 0.014790808781981468, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12007023394107819, "sampling/sampling_logp_difference/max": 1.2201991081237793, "sampling/importance_sampling_ratio/min": 0.2951713800430298, "sampling/importance_sampling_ratio/mean": 0.9926290512084961, "sampling/importance_sampling_ratio/max": 1.4620743989944458, "entropy": 0.9448820129036903, "clip_ratio/low_mean": 0.054750101175159216, "clip_ratio/low_min": 0.054750101175159216, "clip_ratio/high_mean": 0.014705882407724857, "clip_ratio/high_max": 0.014705882407724857, "clip_ratio/region_mean": 0.06945598358288407, "reward_total_mean": 0.01031399704515934, "reward_meter_mean": 0.020442329347133636, "reward_meter_std": 0.017357273027300835, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.6933351755142212, "reward_repeat_penalty_std": 0.06524933129549026, "reward_repeat_floor_mean": 0.9736670255661011, "reward_repeat_floor_std": 0.013049869798123837, "reward_near_duplicate_penalty_mean": 0.9244468212127686, "reward_near_duplicate_penalty_std": 0.08699910342693329, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5137500166893005, "reward_judge_quality_std": 0.35860592126846313, "reward_total_composite_mean": 0.01031399704515934, "reward_total_composite_std": 0.014790808781981468} {"timestamp_utc": "2026-04-12T20:38:03Z", "mode": "train", "global_step": 1215, "epoch": 0.06394400294721331, "loss": -0.0453, "grad_norm": 3.159048557281494, "learning_rate": 6.3212121212121216e-06, "num_tokens": 2163032.0, "completions/mean_length": 290.0, "completions/min_length": 64.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 68.0, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.6043152213096619, "rewards/meter/std": 0.3914482891559601, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.18898223340511322, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.9624999761581421, "rewards/arabic_floor/std": 0.06943649053573608, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.05669468268752098, "rewards/lexical_plausibility/mean": 0.8393545150756836, "rewards/lexical_plausibility/std": 0.17289237678050995, "rewards/judge_quality/mean": 0.17499999701976776, "rewards/judge_quality/std": 0.14880476891994476, "rewards/repeat_penalty/mean": 0.9636474847793579, "rewards/repeat_penalty/std": 0.03607404604554176, "rewards/repeat_floor/mean": 0.9955552816390991, "rewards/repeat_floor/std": 0.00433861929923296, "rewards/near_duplicate_penalty/mean": 0.981377363204956, "rewards/near_duplicate_penalty/std": 0.01754741743206978, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9816523194313049, "rewards/distinct_2/std": 0.020408710464835167, "rewards/total_composite/mean": 0.07501804828643799, "rewards/total_composite/std": 0.09521345794200897, "reward": 0.07501804828643799, "reward_std": 0.09521345049142838, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17560173571109772, "sampling/sampling_logp_difference/max": 1.2245416641235352, "sampling/importance_sampling_ratio/min": 0.32175910472869873, "sampling/importance_sampling_ratio/mean": 1.0271246433258057, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.757672131061554, "clip_ratio/low_mean": 0.019275929778814316, "clip_ratio/low_min": 0.019275929778814316, "clip_ratio/high_mean": 0.056129809468984604, "clip_ratio/high_max": 0.056129809468984604, "clip_ratio/region_mean": 0.07540573924779892, "reward_total_mean": 0.07501804828643799, "reward_meter_mean": 0.6043152213096619, "reward_meter_std": 0.3914482891559601, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.18898223340511322, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.9624999761581421, "reward_arabic_floor_std": 0.06943649053573608, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.05669468268752098, "reward_lexical_plausibility_mean": 0.8393545150756836, "reward_lexical_plausibility_std": 0.17289237678050995, "reward_repeat_penalty_mean": 0.9636474847793579, "reward_repeat_penalty_std": 0.03607404604554176, "reward_repeat_floor_mean": 0.9955552816390991, "reward_repeat_floor_std": 0.00433861929923296, "reward_near_duplicate_penalty_mean": 0.981377363204956, "reward_near_duplicate_penalty_std": 0.01754741743206978, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9816523194313049, "reward_distinct_2_std": 0.020408710464835167, "reward_judge_quality_mean": 0.17499999701976776, "reward_judge_quality_std": 0.14880476891994476, "reward_total_composite_mean": 0.07501804828643799, "reward_total_composite_std": 0.09521345794200897} {"timestamp_utc": "2026-04-12T20:38:11Z", "mode": "train", "global_step": 1216, "epoch": 0.06399663175622336, "loss": 0.0119, "grad_norm": 13.02386474609375, "learning_rate": 6.318181818181819e-06, "num_tokens": 2164507.0, "completions/mean_length": 40.375, "completions/min_length": 36.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.5762792825698853, "rewards/meter/std": 0.39428186416625977, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.2507951855659485, "rewards/repeat_penalty/mean": 0.6602959036827087, "rewards/repeat_penalty/std": 0.26908808946609497, "rewards/repeat_floor/mean": 0.9588524103164673, "rewards/repeat_floor/std": 0.03361457958817482, "rewards/near_duplicate_penalty/mean": 0.8791007995605469, "rewards/near_duplicate_penalty/std": 0.08795655518770218, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.8068033456802368, "rewards/distinct_2/std": 0.15945789217948914, "rewards/total_composite/mean": 0.19602055847644806, "rewards/total_composite/std": 0.1265619546175003, "reward": 0.19602055847644806, "reward_std": 0.1265619397163391, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13155457377433777, "sampling/sampling_logp_difference/max": 1.6768778562545776, "sampling/importance_sampling_ratio/min": 0.1869567632675171, "sampling/importance_sampling_ratio/mean": 1.0167096853256226, "sampling/importance_sampling_ratio/max": 1.6693665981292725, "entropy": 0.9068821221590042, "clip_ratio/low_mean": 0.061954366974532604, "clip_ratio/low_min": 0.061954366974532604, "clip_ratio/high_mean": 0.07152792531996965, "clip_ratio/high_max": 0.07152792531996965, "clip_ratio/region_mean": 0.13348229229450226, "reward_total_mean": 0.19602055847644806, "reward_meter_mean": 0.5762792825698853, "reward_meter_std": 0.39428186416625977, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6602959036827087, "reward_repeat_penalty_std": 0.26908808946609497, "reward_repeat_floor_mean": 0.9588524103164673, "reward_repeat_floor_std": 0.03361457958817482, "reward_near_duplicate_penalty_mean": 0.8791007995605469, "reward_near_duplicate_penalty_std": 0.08795655518770218, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.8068033456802368, "reward_distinct_2_std": 0.15945789217948914, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.2507951855659485, "reward_total_composite_mean": 0.19602055847644806, "reward_total_composite_std": 0.1265619546175003} {"timestamp_utc": "2026-04-12T20:38:26Z", "mode": "train", "global_step": 1217, "epoch": 0.06404926056523341, "loss": -0.0791, "grad_norm": 5.531728267669678, "learning_rate": 6.315151515151515e-06, "num_tokens": 2166367.0, "completions/mean_length": 115.5, "completions/min_length": 52.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 58.857147216796875, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.5791007280349731, "rewards/meter/std": 0.35110318660736084, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9581830501556396, "rewards/lexical_plausibility/std": 0.11827609688043594, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.8939722776412964, "rewards/repeat_penalty/std": 0.06201153248548508, "rewards/repeat_floor/mean": 0.9865633249282837, "rewards/repeat_floor/std": 0.007288097403943539, "rewards/near_duplicate_penalty/mean": 0.9402076005935669, "rewards/near_duplicate_penalty/std": 0.030698206275701523, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9503576755523682, "rewards/distinct_2/std": 0.04762725532054901, "rewards/total_composite/mean": 0.20109564065933228, "rewards/total_composite/std": 0.13192442059516907, "reward": 0.20109564065933228, "reward_std": 0.13192442059516907, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14121000468730927, "sampling/sampling_logp_difference/max": 1.369049072265625, "sampling/importance_sampling_ratio/min": 0.26712557673454285, "sampling/importance_sampling_ratio/mean": 1.0121617317199707, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7656353935599327, "clip_ratio/low_mean": 0.04952818900346756, "clip_ratio/low_min": 0.04952818900346756, "clip_ratio/high_mean": 0.054745656438171864, "clip_ratio/high_max": 0.054745656438171864, "clip_ratio/region_mean": 0.10427384544163942, "reward_total_mean": 0.20109564065933228, "reward_meter_mean": 0.5791007280349731, "reward_meter_std": 0.35110318660736084, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9581830501556396, "reward_lexical_plausibility_std": 0.11827609688043594, "reward_repeat_penalty_mean": 0.8939722776412964, "reward_repeat_penalty_std": 0.06201153248548508, "reward_repeat_floor_mean": 0.9865633249282837, "reward_repeat_floor_std": 0.007288097403943539, "reward_near_duplicate_penalty_mean": 0.9402076005935669, "reward_near_duplicate_penalty_std": 0.030698206275701523, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9503576755523682, "reward_distinct_2_std": 0.04762725532054901, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.20109564065933228, "reward_total_composite_std": 0.13192442059516907} {"timestamp_utc": "2026-04-12T20:38:40Z", "mode": "train", "global_step": 1218, "epoch": 0.06410188937424346, "loss": -0.037, "grad_norm": 2.199390172958374, "learning_rate": 6.3121212121212125e-06, "num_tokens": 2168057.0, "completions/mean_length": 225.25, "completions/min_length": 48.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 53.20000076293945, "completions/min_terminated_length": 48.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.2198893427848816, "rewards/meter/std": 0.22230005264282227, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8457233905792236, "rewards/lexical_plausibility/std": 0.21446913480758667, "rewards/judge_quality/mean": 0.19374999403953552, "rewards/judge_quality/std": 0.16783814132213593, "rewards/repeat_penalty/mean": 0.9438612461090088, "rewards/repeat_penalty/std": 0.065047986805439, "rewards/repeat_floor/mean": 0.9930291175842285, "rewards/repeat_floor/std": 0.007196676451712847, "rewards/near_duplicate_penalty/mean": 0.9699330925941467, "rewards/near_duplicate_penalty/std": 0.025620054453611374, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9726577997207642, "rewards/distinct_2/std": 0.05350784212350845, "rewards/total_composite/mean": 0.05306670069694519, "rewards/total_composite/std": 0.08914055675268173, "reward": 0.05306670069694519, "reward_std": 0.08914055675268173, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16026510298252106, "sampling/sampling_logp_difference/max": 1.733330488204956, "sampling/importance_sampling_ratio/min": 0.22949977219104767, "sampling/importance_sampling_ratio/mean": 1.0221580266952515, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7499352991580963, "clip_ratio/low_mean": 0.05001780670136213, "clip_ratio/low_min": 0.05001780670136213, "clip_ratio/high_mean": 0.03986378200352192, "clip_ratio/high_max": 0.03986378200352192, "clip_ratio/region_mean": 0.08988158870488405, "reward_total_mean": 0.05306670069694519, "reward_meter_mean": 0.2198893427848816, "reward_meter_std": 0.22230005264282227, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8457233905792236, "reward_lexical_plausibility_std": 0.21446913480758667, "reward_repeat_penalty_mean": 0.9438612461090088, "reward_repeat_penalty_std": 0.065047986805439, "reward_repeat_floor_mean": 0.9930291175842285, "reward_repeat_floor_std": 0.007196676451712847, "reward_near_duplicate_penalty_mean": 0.9699330925941467, "reward_near_duplicate_penalty_std": 0.025620054453611374, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9726577997207642, "reward_distinct_2_std": 0.05350784212350845, "reward_judge_quality_mean": 0.19374999403953552, "reward_judge_quality_std": 0.16783814132213593, "reward_total_composite_mean": 0.05306670069694519, "reward_total_composite_std": 0.08914055675268173} {"timestamp_utc": "2026-04-12T20:38:50Z", "mode": "train", "global_step": 1219, "epoch": 0.06415451818325352, "loss": 0.0296, "grad_norm": 8.804862976074219, "learning_rate": 6.309090909090909e-06, "num_tokens": 2170582.0, "completions/mean_length": 113.625, "completions/min_length": 102.0, "completions/max_length": 123.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 113.625, "completions/min_terminated_length": 102.0, "completions/max_terminated_length": 123.0, "rewards/meter/mean": 0.44080227613449097, "rewards/meter/std": 0.24647030234336853, "rewards/count_adherence/mean": 0.6136363744735718, "rewards/count_adherence/std": 0.04208271950483322, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8840909004211426, "rewards/count_floor/std": 0.01262480765581131, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.6801637411117554, "rewards/repeat_penalty/std": 0.11364476382732391, "rewards/repeat_floor/mean": 0.9634428024291992, "rewards/repeat_floor/std": 0.012377992272377014, "rewards/near_duplicate_penalty/mean": 0.900574803352356, "rewards/near_duplicate_penalty/std": 0.02994886040687561, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.7595179677009583, "rewards/distinct_2/std": 0.09867044538259506, "rewards/total_composite/mean": 0.1381712555885315, "rewards/total_composite/std": 0.08209511637687683, "reward": 0.1381712555885315, "reward_std": 0.08209511637687683, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12140367925167084, "sampling/sampling_logp_difference/max": 3.9601335525512695, "sampling/importance_sampling_ratio/min": 0.019060568884015083, "sampling/importance_sampling_ratio/mean": 1.017128348350525, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.70613794028759, "clip_ratio/low_mean": 0.07515633245930076, "clip_ratio/low_min": 0.07515633245930076, "clip_ratio/high_mean": 0.027110234834253788, "clip_ratio/high_max": 0.027110234834253788, "clip_ratio/region_mean": 0.10226656729355454, "reward_total_mean": 0.1381712555885315, "reward_meter_mean": 0.44080227613449097, "reward_meter_std": 0.24647030234336853, "reward_count_adherence_mean": 0.6136363744735718, "reward_count_adherence_std": 0.04208271950483322, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8840909004211426, "reward_count_floor_std": 0.01262480765581131, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6801637411117554, "reward_repeat_penalty_std": 0.11364476382732391, "reward_repeat_floor_mean": 0.9634428024291992, "reward_repeat_floor_std": 0.012377992272377014, "reward_near_duplicate_penalty_mean": 0.900574803352356, "reward_near_duplicate_penalty_std": 0.02994886040687561, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.7595179677009583, "reward_distinct_2_std": 0.09867044538259506, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.1381712555885315, "reward_total_composite_std": 0.08209511637687683} {"timestamp_utc": "2026-04-12T20:38:59Z", "mode": "train", "global_step": 1220, "epoch": 0.06420714699226357, "loss": -0.0296, "grad_norm": 9.735910415649414, "learning_rate": 6.306060606060607e-06, "num_tokens": 2172902.0, "completions/mean_length": 95.0, "completions/min_length": 77.0, "completions/max_length": 111.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 95.0, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 111.0, "rewards/meter/mean": 0.7763108015060425, "rewards/meter/std": 0.20298224687576294, "rewards/count_adherence/mean": 0.5454545617103577, "rewards/count_adherence/std": 0.06872080266475677, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8636363744735718, "rewards/count_floor/std": 0.02061624825000763, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.4445405602455139, "rewards/repeat_penalty/std": 0.21346114575862885, "rewards/repeat_floor/mean": 0.9284533262252808, "rewards/repeat_floor/std": 0.038077108561992645, "rewards/near_duplicate_penalty/mean": 0.8144187331199646, "rewards/near_duplicate_penalty/std": 0.10507257282733917, "rewards/opening_diversity/mean": 0.7781655788421631, "rewards/opening_diversity/std": 0.18842655420303345, "rewards/distinct_2/mean": 0.6622289419174194, "rewards/distinct_2/std": 0.14104324579238892, "rewards/total_composite/mean": 0.22396959364414215, "rewards/total_composite/std": 0.053816284984350204, "reward": 0.22396959364414215, "reward_std": 0.053816284984350204, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13207414746284485, "sampling/sampling_logp_difference/max": 2.4983208179473877, "sampling/importance_sampling_ratio/min": 0.11782732605934143, "sampling/importance_sampling_ratio/mean": 1.0074642896652222, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5844785496592522, "clip_ratio/low_mean": 0.04841542150825262, "clip_ratio/low_min": 0.04841542150825262, "clip_ratio/high_mean": 0.07083963975310326, "clip_ratio/high_max": 0.07083963975310326, "clip_ratio/region_mean": 0.11925506126135588, "reward_total_mean": 0.22396959364414215, "reward_meter_mean": 0.7763108015060425, "reward_meter_std": 0.20298224687576294, "reward_count_adherence_mean": 0.5454545617103577, "reward_count_adherence_std": 0.06872080266475677, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8636363744735718, "reward_count_floor_std": 0.02061624825000763, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.4445405602455139, "reward_repeat_penalty_std": 0.21346114575862885, "reward_repeat_floor_mean": 0.9284533262252808, "reward_repeat_floor_std": 0.038077108561992645, "reward_near_duplicate_penalty_mean": 0.8144187331199646, "reward_near_duplicate_penalty_std": 0.10507257282733917, "reward_opening_diversity_mean": 0.7781655788421631, "reward_opening_diversity_std": 0.18842655420303345, "reward_distinct_2_mean": 0.6622289419174194, "reward_distinct_2_std": 0.14104324579238892, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.22396959364414215, "reward_total_composite_std": 0.053816284984350204} {"timestamp_utc": "2026-04-12T20:39:08Z", "mode": "train", "global_step": 1221, "epoch": 0.06425977580127362, "loss": 0.0349, "grad_norm": 14.995492935180664, "learning_rate": 6.303030303030303e-06, "num_tokens": 2174459.0, "completions/mean_length": 33.625, "completions/min_length": 30.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.625, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.37095850706100464, "rewards/meter/std": 0.29680106043815613, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9696150422096252, "rewards/lexical_plausibility/std": 0.0859416201710701, "rewards/judge_quality/mean": 0.45374998450279236, "rewards/judge_quality/std": 0.20170257985591888, "rewards/repeat_penalty/mean": 0.8760749101638794, "rewards/repeat_penalty/std": 0.17035168409347534, "rewards/repeat_floor/mean": 0.9844744205474854, "rewards/repeat_floor/std": 0.019319143146276474, "rewards/near_duplicate_penalty/mean": 0.9355652332305908, "rewards/near_duplicate_penalty/std": 0.05685482174158096, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9557186365127563, "rewards/distinct_2/std": 0.08239380270242691, "rewards/total_composite/mean": 0.1714765429496765, "rewards/total_composite/std": 0.1576114445924759, "reward": 0.1714765429496765, "reward_std": 0.1576114445924759, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14743992686271667, "sampling/sampling_logp_difference/max": 1.28440523147583, "sampling/importance_sampling_ratio/min": 0.27681517601013184, "sampling/importance_sampling_ratio/mean": 1.021804928779602, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0102483034133911, "clip_ratio/low_mean": 0.059101749677211046, "clip_ratio/low_min": 0.059101749677211046, "clip_ratio/high_mean": 0.06423611240461469, "clip_ratio/high_max": 0.06423611240461469, "clip_ratio/region_mean": 0.12333786208182573, "reward_total_mean": 0.1714765429496765, "reward_meter_mean": 0.37095850706100464, "reward_meter_std": 0.29680106043815613, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9696150422096252, "reward_lexical_plausibility_std": 0.0859416201710701, "reward_repeat_penalty_mean": 0.8760749101638794, "reward_repeat_penalty_std": 0.17035168409347534, "reward_repeat_floor_mean": 0.9844744205474854, "reward_repeat_floor_std": 0.019319143146276474, "reward_near_duplicate_penalty_mean": 0.9355652332305908, "reward_near_duplicate_penalty_std": 0.05685482174158096, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9557186365127563, "reward_distinct_2_std": 0.08239380270242691, "reward_judge_quality_mean": 0.45374998450279236, "reward_judge_quality_std": 0.20170257985591888, "reward_total_composite_mean": 0.1714765429496765, "reward_total_composite_std": 0.1576114445924759} {"timestamp_utc": "2026-04-12T20:39:22Z", "mode": "train", "global_step": 1222, "epoch": 0.06431240461028367, "loss": -0.1187, "grad_norm": 4.0689239501953125, "learning_rate": 6.300000000000001e-06, "num_tokens": 2176344.0, "completions/mean_length": 116.625, "completions/min_length": 55.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 60.142860412597656, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.7610733509063721, "rewards/meter/std": 0.3392793536186218, "rewards/count_adherence/mean": 0.6666666865348816, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8999999761581421, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9665437340736389, "rewards/lexical_plausibility/std": 0.09462856501340866, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.7470518350601196, "rewards/repeat_penalty/std": 0.15076427161693573, "rewards/repeat_floor/mean": 0.9713449478149414, "rewards/repeat_floor/std": 0.018709450960159302, "rewards/near_duplicate_penalty/mean": 0.912311851978302, "rewards/near_duplicate_penalty/std": 0.053679209202528, "rewards/opening_diversity/mean": 0.9791666269302368, "rewards/opening_diversity/std": 0.0589255727827549, "rewards/distinct_2/mean": 0.8416461944580078, "rewards/distinct_2/std": 0.09909360110759735, "rewards/total_composite/mean": 0.23799125850200653, "rewards/total_composite/std": 0.120130255818367, "reward": 0.23799125850200653, "reward_std": 0.1201302632689476, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13118958473205566, "sampling/sampling_logp_difference/max": 1.665986180305481, "sampling/importance_sampling_ratio/min": 0.18900416791439056, "sampling/importance_sampling_ratio/mean": 0.9999014735221863, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6908783726394176, "clip_ratio/low_mean": 0.012711863964796066, "clip_ratio/low_min": 0.012711863964796066, "clip_ratio/high_mean": 0.10025918297469616, "clip_ratio/high_max": 0.10025918297469616, "clip_ratio/region_mean": 0.11297104693949223, "reward_total_mean": 0.23799125850200653, "reward_meter_mean": 0.7610733509063721, "reward_meter_std": 0.3392793536186218, "reward_count_adherence_mean": 0.6666666865348816, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8999999761581421, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9665437340736389, "reward_lexical_plausibility_std": 0.09462856501340866, "reward_repeat_penalty_mean": 0.7470518350601196, "reward_repeat_penalty_std": 0.15076427161693573, "reward_repeat_floor_mean": 0.9713449478149414, "reward_repeat_floor_std": 0.018709450960159302, "reward_near_duplicate_penalty_mean": 0.912311851978302, "reward_near_duplicate_penalty_std": 0.053679209202528, "reward_opening_diversity_mean": 0.9791666269302368, "reward_opening_diversity_std": 0.0589255727827549, "reward_distinct_2_mean": 0.8416461944580078, "reward_distinct_2_std": 0.09909360110759735, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.23799125850200653, "reward_total_composite_std": 0.120130255818367} {"timestamp_utc": "2026-04-12T20:39:37Z", "mode": "train", "global_step": 1223, "epoch": 0.06436503341929373, "loss": -0.0311, "grad_norm": 4.6294050216674805, "learning_rate": 6.296969696969697e-06, "num_tokens": 2177848.0, "completions/mean_length": 92.0, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 32.0, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.6059252023696899, "rewards/meter/std": 0.3446142077445984, "rewards/count_adherence/mean": 0.6666666865348816, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8999999761581421, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9573439955711365, "rewards/lexical_plausibility/std": 0.12064942717552185, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.23627692461013794, "rewards/repeat_penalty/mean": 0.9202711582183838, "rewards/repeat_penalty/std": 0.13714632391929626, "rewards/repeat_floor/mean": 0.9909429550170898, "rewards/repeat_floor/std": 0.014037278480827808, "rewards/near_duplicate_penalty/mean": 0.9653171300888062, "rewards/near_duplicate_penalty/std": 0.04035671800374985, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.978003978729248, "rewards/distinct_2/std": 0.04075079411268234, "rewards/total_composite/mean": 0.28693416714668274, "rewards/total_composite/std": 0.24088135361671448, "reward": 0.28693416714668274, "reward_std": 0.24088133871555328, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1436370313167572, "sampling/sampling_logp_difference/max": 1.0054512023925781, "sampling/importance_sampling_ratio/min": 0.4024932086467743, "sampling/importance_sampling_ratio/mean": 1.0243269205093384, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8930256366729736, "clip_ratio/low_mean": 0.043560607358813286, "clip_ratio/low_min": 0.043560607358813286, "clip_ratio/high_mean": 0.055880406871438026, "clip_ratio/high_max": 0.055880406871438026, "clip_ratio/region_mean": 0.09944101423025131, "reward_total_mean": 0.28693416714668274, "reward_meter_mean": 0.6059252023696899, "reward_meter_std": 0.3446142077445984, "reward_count_adherence_mean": 0.6666666865348816, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8999999761581421, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9573439955711365, "reward_lexical_plausibility_std": 0.12064942717552185, "reward_repeat_penalty_mean": 0.9202711582183838, "reward_repeat_penalty_std": 0.13714632391929626, "reward_repeat_floor_mean": 0.9909429550170898, "reward_repeat_floor_std": 0.014037278480827808, "reward_near_duplicate_penalty_mean": 0.9653171300888062, "reward_near_duplicate_penalty_std": 0.04035671800374985, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.978003978729248, "reward_distinct_2_std": 0.04075079411268234, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.23627692461013794, "reward_total_composite_mean": 0.28693416714668274, "reward_total_composite_std": 0.24088135361671448} {"timestamp_utc": "2026-04-12T20:39:51Z", "mode": "train", "global_step": 1224, "epoch": 0.06441766222830378, "loss": -0.0283, "grad_norm": 5.391702651977539, "learning_rate": 6.293939393939394e-06, "num_tokens": 2179387.0, "completions/mean_length": 93.375, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 33.57143020629883, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.4266401529312134, "rewards/meter/std": 0.3757961392402649, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9573965668678284, "rewards/lexical_plausibility/std": 0.12050070613622665, "rewards/judge_quality/mean": 0.45000001788139343, "rewards/judge_quality/std": 0.2828426957130432, "rewards/repeat_penalty/mean": 0.9389135837554932, "rewards/repeat_penalty/std": 0.08198247849941254, "rewards/repeat_floor/mean": 0.9936495423316956, "rewards/repeat_floor/std": 0.005686817225068808, "rewards/near_duplicate_penalty/mean": 0.9701635837554932, "rewards/near_duplicate_penalty/std": 0.03224588558077812, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18385660648345947, "rewards/total_composite/std": 0.1858883798122406, "reward": 0.18385660648345947, "reward_std": 0.1858883798122406, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17873063683509827, "sampling/sampling_logp_difference/max": 1.8777542114257812, "sampling/importance_sampling_ratio/min": 0.15293318033218384, "sampling/importance_sampling_ratio/mean": 1.0017623901367188, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1278115212917328, "clip_ratio/low_mean": 0.07725170347839594, "clip_ratio/low_min": 0.07725170347839594, "clip_ratio/high_mean": 0.07338709570467472, "clip_ratio/high_max": 0.07338709570467472, "clip_ratio/region_mean": 0.15063879918307066, "reward_total_mean": 0.18385660648345947, "reward_meter_mean": 0.4266401529312134, "reward_meter_std": 0.3757961392402649, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9573965668678284, "reward_lexical_plausibility_std": 0.12050070613622665, "reward_repeat_penalty_mean": 0.9389135837554932, "reward_repeat_penalty_std": 0.08198247849941254, "reward_repeat_floor_mean": 0.9936495423316956, "reward_repeat_floor_std": 0.005686817225068808, "reward_near_duplicate_penalty_mean": 0.9701635837554932, "reward_near_duplicate_penalty_std": 0.03224588558077812, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45000001788139343, "reward_judge_quality_std": 0.2828426957130432, "reward_total_composite_mean": 0.18385660648345947, "reward_total_composite_std": 0.1858883798122406} {"timestamp_utc": "2026-04-12T20:40:00Z", "mode": "train", "global_step": 1225, "epoch": 0.06447029103731383, "loss": 0.0078, "grad_norm": 14.657776832580566, "learning_rate": 6.290909090909092e-06, "num_tokens": 2181043.0, "completions/mean_length": 44.0, "completions/min_length": 29.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.0, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.8110363483428955, "rewards/meter/std": 0.32047566771507263, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.9276831150054932, "rewards/repeat_penalty/std": 0.06526709347963333, "rewards/repeat_floor/mean": 0.9911633729934692, "rewards/repeat_floor/std": 0.00710683036595583, "rewards/near_duplicate_penalty/mean": 0.9638071060180664, "rewards/near_duplicate_penalty/std": 0.02484997548162937, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9621370434761047, "rewards/distinct_2/std": 0.05582091957330704, "rewards/total_composite/mean": 0.23005390167236328, "rewards/total_composite/std": 0.14171624183654785, "reward": 0.23005390167236328, "reward_std": 0.14171624183654785, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15819786489009857, "sampling/sampling_logp_difference/max": 1.872924566268921, "sampling/importance_sampling_ratio/min": 0.15367357432842255, "sampling/importance_sampling_ratio/mean": 0.9857171177864075, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8455542996525764, "clip_ratio/low_mean": 0.0755122834816575, "clip_ratio/low_min": 0.0755122834816575, "clip_ratio/high_mean": 0.06759650958701968, "clip_ratio/high_max": 0.06759650958701968, "clip_ratio/region_mean": 0.1431087930686772, "reward_total_mean": 0.23005390167236328, "reward_meter_mean": 0.8110363483428955, "reward_meter_std": 0.32047566771507263, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9276831150054932, "reward_repeat_penalty_std": 0.06526709347963333, "reward_repeat_floor_mean": 0.9911633729934692, "reward_repeat_floor_std": 0.00710683036595583, "reward_near_duplicate_penalty_mean": 0.9638071060180664, "reward_near_duplicate_penalty_std": 0.02484997548162937, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9621370434761047, "reward_distinct_2_std": 0.05582091957330704, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.23005390167236328, "reward_total_composite_std": 0.14171624183654785} {"timestamp_utc": "2026-04-12T20:40:08Z", "mode": "train", "global_step": 1226, "epoch": 0.06452291984632388, "loss": 0.0385, "grad_norm": 13.133723258972168, "learning_rate": 6.287878787878788e-06, "num_tokens": 2182718.0, "completions/mean_length": 29.375, "completions/min_length": 26.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.375, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.7395759224891663, "rewards/meter/std": 0.28121909499168396, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5049999952316284, "rewards/judge_quality/std": 0.2639264166355133, "rewards/repeat_penalty/mean": 0.9634692668914795, "rewards/repeat_penalty/std": 0.049862924963235855, "rewards/repeat_floor/mean": 0.994520366191864, "rewards/repeat_floor/std": 0.007479443214833736, "rewards/near_duplicate_penalty/mean": 0.9634692668914795, "rewards/near_duplicate_penalty/std": 0.049862924963235855, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3715677559375763, "rewards/total_composite/std": 0.24364785850048065, "reward": 0.3715677559375763, "reward_std": 0.24364784359931946, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1478663980960846, "sampling/sampling_logp_difference/max": 1.7367868423461914, "sampling/importance_sampling_ratio/min": 0.17608527839183807, "sampling/importance_sampling_ratio/mean": 0.9975112676620483, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8369600102305412, "clip_ratio/low_mean": 0.05892255902290344, "clip_ratio/low_min": 0.05892255902290344, "clip_ratio/high_mean": 0.09431419614702463, "clip_ratio/high_max": 0.09431419614702463, "clip_ratio/region_mean": 0.15323675516992807, "reward_total_mean": 0.3715677559375763, "reward_meter_mean": 0.7395759224891663, "reward_meter_std": 0.28121909499168396, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9634692668914795, "reward_repeat_penalty_std": 0.049862924963235855, "reward_repeat_floor_mean": 0.994520366191864, "reward_repeat_floor_std": 0.007479443214833736, "reward_near_duplicate_penalty_mean": 0.9634692668914795, "reward_near_duplicate_penalty_std": 0.049862924963235855, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5049999952316284, "reward_judge_quality_std": 0.2639264166355133, "reward_total_composite_mean": 0.3715677559375763, "reward_total_composite_std": 0.24364785850048065} {"timestamp_utc": "2026-04-12T20:40:16Z", "mode": "train", "global_step": 1227, "epoch": 0.06457554865533394, "loss": -0.024, "grad_norm": 19.35190773010254, "learning_rate": 6.284848484848486e-06, "num_tokens": 2184057.0, "completions/mean_length": 31.375, "completions/min_length": 28.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.375, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.5555839538574219, "rewards/meter/std": 0.3538241684436798, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.14880475401878357, "rewards/repeat_penalty/mean": 0.8659398555755615, "rewards/repeat_penalty/std": 0.14649713039398193, "rewards/repeat_floor/mean": 0.9835029244422913, "rewards/repeat_floor/std": 0.017463911324739456, "rewards/near_duplicate_penalty/mean": 0.9395708441734314, "rewards/near_duplicate_penalty/std": 0.048510950058698654, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9174147844314575, "rewards/distinct_2/std": 0.1265544444322586, "rewards/total_composite/mean": 0.1759277582168579, "rewards/total_composite/std": 0.1372385323047638, "reward": 0.1759277582168579, "reward_std": 0.1372385323047638, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15816184878349304, "sampling/sampling_logp_difference/max": 1.1287744045257568, "sampling/importance_sampling_ratio/min": 0.3234294056892395, "sampling/importance_sampling_ratio/mean": 1.018064022064209, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1887256801128387, "clip_ratio/low_mean": 0.08529490092769265, "clip_ratio/low_min": 0.08529490092769265, "clip_ratio/high_mean": 0.06788240931928158, "clip_ratio/high_max": 0.06788240931928158, "clip_ratio/region_mean": 0.15317731024697423, "reward_total_mean": 0.1759277582168579, "reward_meter_mean": 0.5555839538574219, "reward_meter_std": 0.3538241684436798, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8659398555755615, "reward_repeat_penalty_std": 0.14649713039398193, "reward_repeat_floor_mean": 0.9835029244422913, "reward_repeat_floor_std": 0.017463911324739456, "reward_near_duplicate_penalty_mean": 0.9395708441734314, "reward_near_duplicate_penalty_std": 0.048510950058698654, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9174147844314575, "reward_distinct_2_std": 0.1265544444322586, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.14880475401878357, "reward_total_composite_mean": 0.1759277582168579, "reward_total_composite_std": 0.1372385323047638} {"timestamp_utc": "2026-04-12T20:40:25Z", "mode": "train", "global_step": 1228, "epoch": 0.06462817746434399, "loss": 0.0674, "grad_norm": 14.310054779052734, "learning_rate": 6.2818181818181825e-06, "num_tokens": 2185508.0, "completions/mean_length": 31.375, "completions/min_length": 27.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.375, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.26273313164711, "rewards/meter/std": 0.3580339252948761, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5212500095367432, "rewards/judge_quality/std": 0.18137866258621216, "rewards/repeat_penalty/mean": 0.984682023525238, "rewards/repeat_penalty/std": 0.021919764578342438, "rewards/repeat_floor/mean": 0.9977023005485535, "rewards/repeat_floor/std": 0.003287959611043334, "rewards/near_duplicate_penalty/mean": 0.984682023525238, "rewards/near_duplicate_penalty/std": 0.021919764578342438, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13236719369888306, "rewards/total_composite/std": 0.17755210399627686, "reward": 0.13236719369888306, "reward_std": 0.17755210399627686, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14894165098667145, "sampling/sampling_logp_difference/max": 1.5280179977416992, "sampling/importance_sampling_ratio/min": 0.21696527302265167, "sampling/importance_sampling_ratio/mean": 1.0312650203704834, "sampling/importance_sampling_ratio/max": 1.9037361145019531, "entropy": 1.311284214258194, "clip_ratio/low_mean": 0.10541710071265697, "clip_ratio/low_min": 0.10541710071265697, "clip_ratio/high_mean": 0.057189542800188065, "clip_ratio/high_max": 0.057189542800188065, "clip_ratio/region_mean": 0.16260664351284504, "reward_total_mean": 0.13236719369888306, "reward_meter_mean": 0.26273313164711, "reward_meter_std": 0.3580339252948761, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.984682023525238, "reward_repeat_penalty_std": 0.021919764578342438, "reward_repeat_floor_mean": 0.9977023005485535, "reward_repeat_floor_std": 0.003287959611043334, "reward_near_duplicate_penalty_mean": 0.984682023525238, "reward_near_duplicate_penalty_std": 0.021919764578342438, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5212500095367432, "reward_judge_quality_std": 0.18137866258621216, "reward_total_composite_mean": 0.13236719369888306, "reward_total_composite_std": 0.17755210399627686} {"timestamp_utc": "2026-04-12T20:40:39Z", "mode": "train", "global_step": 1229, "epoch": 0.06468080627335403, "loss": -0.026, "grad_norm": 6.57251501083374, "learning_rate": 6.27878787878788e-06, "num_tokens": 2186797.0, "completions/mean_length": 80.125, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 18.428571701049805, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 20.0, "rewards/meter/mean": 0.35416775941848755, "rewards/meter/std": 0.44328710436820984, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9538531303405762, "rewards/lexical_plausibility/std": 0.13052314519882202, "rewards/judge_quality/mean": 0.476250022649765, "rewards/judge_quality/std": 0.38119879364967346, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24739056825637817, "rewards/total_composite/std": 0.3496955931186676, "reward": 0.24739056825637817, "reward_std": 0.3496955931186676, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12106632441282272, "sampling/sampling_logp_difference/max": 1.3868143558502197, "sampling/importance_sampling_ratio/min": 0.24987004697322845, "sampling/importance_sampling_ratio/mean": 1.0496184825897217, "sampling/importance_sampling_ratio/max": 1.8097660541534424, "entropy": 0.8599603101611137, "clip_ratio/low_mean": 0.04983660206198692, "clip_ratio/low_min": 0.04983660206198692, "clip_ratio/high_mean": 0.045138888992369175, "clip_ratio/high_max": 0.045138888992369175, "clip_ratio/region_mean": 0.0949754910543561, "reward_total_mean": 0.24739056825637817, "reward_meter_mean": 0.35416775941848755, "reward_meter_std": 0.44328710436820984, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9538531303405762, "reward_lexical_plausibility_std": 0.13052314519882202, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.476250022649765, "reward_judge_quality_std": 0.38119879364967346, "reward_total_composite_mean": 0.24739056825637817, "reward_total_composite_std": 0.3496955931186676} {"timestamp_utc": "2026-04-12T20:40:49Z", "mode": "train", "global_step": 1230, "epoch": 0.06473343508236408, "loss": 0.0823, "grad_norm": 16.972959518432617, "learning_rate": 6.275757575757576e-06, "num_tokens": 2188420.0, "completions/mean_length": 39.875, "completions/min_length": 35.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.875, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.8223479390144348, "rewards/meter/std": 0.15021897852420807, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.11877348273992538, "rewards/repeat_penalty/mean": 0.9021636843681335, "rewards/repeat_penalty/std": 0.12987715005874634, "rewards/repeat_floor/mean": 0.9905874133110046, "rewards/repeat_floor/std": 0.009797558188438416, "rewards/near_duplicate_penalty/mean": 0.965046763420105, "rewards/near_duplicate_penalty/std": 0.025503626093268394, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9536713361740112, "rewards/distinct_2/std": 0.06758687645196915, "rewards/total_composite/mean": 0.25501781702041626, "rewards/total_composite/std": 0.11399103701114655, "reward": 0.25501781702041626, "reward_std": 0.11399103701114655, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18526025116443634, "sampling/sampling_logp_difference/max": 1.9111475944519043, "sampling/importance_sampling_ratio/min": 0.14791055023670197, "sampling/importance_sampling_ratio/mean": 0.9953362345695496, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2463163137435913, "clip_ratio/low_mean": 0.05903615802526474, "clip_ratio/low_min": 0.05903615802526474, "clip_ratio/high_mean": 0.11196553893387318, "clip_ratio/high_max": 0.11196553893387318, "clip_ratio/region_mean": 0.17100169695913792, "reward_total_mean": 0.25501781702041626, "reward_meter_mean": 0.8223479390144348, "reward_meter_std": 0.15021897852420807, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9021636843681335, "reward_repeat_penalty_std": 0.12987715005874634, "reward_repeat_floor_mean": 0.9905874133110046, "reward_repeat_floor_std": 0.009797558188438416, "reward_near_duplicate_penalty_mean": 0.965046763420105, "reward_near_duplicate_penalty_std": 0.025503626093268394, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9536713361740112, "reward_distinct_2_std": 0.06758687645196915, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.11877348273992538, "reward_total_composite_mean": 0.25501781702041626, "reward_total_composite_std": 0.11399103701114655} {"timestamp_utc": "2026-04-12T20:40:58Z", "mode": "train", "global_step": 1231, "epoch": 0.06478606389137413, "loss": 0.095, "grad_norm": 15.801769256591797, "learning_rate": 6.2727272727272734e-06, "num_tokens": 2190329.0, "completions/mean_length": 41.625, "completions/min_length": 38.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.625, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.7712146043777466, "rewards/meter/std": 0.2963913083076477, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9583333134651184, "rewards/lexical_plausibility/std": 0.07715168595314026, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.9823122620582581, "rewards/repeat_penalty/std": 0.014481368474662304, "rewards/repeat_floor/mean": 0.9973468780517578, "rewards/repeat_floor/std": 0.002172210020944476, "rewards/near_duplicate_penalty/mean": 0.9823122620582581, "rewards/near_duplicate_penalty/std": 0.014481368474662304, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20297935605049133, "rewards/total_composite/std": 0.11905229836702347, "reward": 0.20297935605049133, "reward_std": 0.11905229091644287, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1693575382232666, "sampling/sampling_logp_difference/max": 1.5651897192001343, "sampling/importance_sampling_ratio/min": 0.2090483456850052, "sampling/importance_sampling_ratio/mean": 1.0169260501861572, "sampling/importance_sampling_ratio/max": 1.8917797803878784, "entropy": 1.4480042457580566, "clip_ratio/low_mean": 0.055440512485802174, "clip_ratio/low_min": 0.055440512485802174, "clip_ratio/high_mean": 0.06758436374366283, "clip_ratio/high_max": 0.06758436374366283, "clip_ratio/region_mean": 0.12302487622946501, "reward_total_mean": 0.20297935605049133, "reward_meter_mean": 0.7712146043777466, "reward_meter_std": 0.2963913083076477, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9583333134651184, "reward_lexical_plausibility_std": 0.07715168595314026, "reward_repeat_penalty_mean": 0.9823122620582581, "reward_repeat_penalty_std": 0.014481368474662304, "reward_repeat_floor_mean": 0.9973468780517578, "reward_repeat_floor_std": 0.002172210020944476, "reward_near_duplicate_penalty_mean": 0.9823122620582581, "reward_near_duplicate_penalty_std": 0.014481368474662304, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.20297935605049133, "reward_total_composite_std": 0.11905229836702347} {"timestamp_utc": "2026-04-12T20:41:12Z", "mode": "train", "global_step": 1232, "epoch": 0.06483869270038418, "loss": -0.0944, "grad_norm": 1.9240204095840454, "learning_rate": 6.26969696969697e-06, "num_tokens": 2192110.0, "completions/mean_length": 230.625, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 61.79999923706055, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.6351822018623352, "rewards/meter/std": 0.3960917890071869, "rewards/count_adherence/mean": 0.65625, "rewards/count_adherence/std": 0.22903135418891907, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8968750238418579, "rewards/count_floor/std": 0.06870941072702408, "rewards/lexical_plausibility/mean": 0.8640150427818298, "rewards/lexical_plausibility/std": 0.19077719748020172, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.16903084516525269, "rewards/repeat_penalty/mean": 0.8195990920066833, "rewards/repeat_penalty/std": 0.19482024013996124, "rewards/repeat_floor/mean": 0.9790264368057251, "rewards/repeat_floor/std": 0.023111246526241302, "rewards/near_duplicate_penalty/mean": 0.9283485412597656, "rewards/near_duplicate_penalty/std": 0.06932410597801208, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9280460476875305, "rewards/distinct_2/std": 0.10154540836811066, "rewards/total_composite/mean": 0.1878122240304947, "rewards/total_composite/std": 0.16088247299194336, "reward": 0.1878122240304947, "reward_std": 0.16088247299194336, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16117610037326813, "sampling/sampling_logp_difference/max": 2.038297653198242, "sampling/importance_sampling_ratio/min": 0.1302502602338791, "sampling/importance_sampling_ratio/mean": 1.0264315605163574, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6506724879145622, "clip_ratio/low_mean": 0.010416666977107525, "clip_ratio/low_min": 0.010416666977107525, "clip_ratio/high_mean": 0.05322717409580946, "clip_ratio/high_max": 0.05322717409580946, "clip_ratio/region_mean": 0.06364384107291698, "reward_total_mean": 0.1878122240304947, "reward_meter_mean": 0.6351822018623352, "reward_meter_std": 0.3960917890071869, "reward_count_adherence_mean": 0.65625, "reward_count_adherence_std": 0.22903135418891907, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8968750238418579, "reward_count_floor_std": 0.06870941072702408, "reward_lexical_plausibility_mean": 0.8640150427818298, "reward_lexical_plausibility_std": 0.19077719748020172, "reward_repeat_penalty_mean": 0.8195990920066833, "reward_repeat_penalty_std": 0.19482024013996124, "reward_repeat_floor_mean": 0.9790264368057251, "reward_repeat_floor_std": 0.023111246526241302, "reward_near_duplicate_penalty_mean": 0.9283485412597656, "reward_near_duplicate_penalty_std": 0.06932410597801208, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9280460476875305, "reward_distinct_2_std": 0.10154540836811066, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.16903084516525269, "reward_total_composite_mean": 0.1878122240304947, "reward_total_composite_std": 0.16088247299194336} {"timestamp_utc": "2026-04-12T20:41:27Z", "mode": "train", "global_step": 1233, "epoch": 0.06489132150939424, "loss": -0.0365, "grad_norm": 5.7209553718566895, "learning_rate": 6.266666666666668e-06, "num_tokens": 2193670.0, "completions/mean_length": 97.0, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.71428680419922, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.345956027507782, "rewards/meter/std": 0.392540842294693, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.964140772819519, "rewards/lexical_plausibility/std": 0.10142520815134048, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9224766492843628, "rewards/repeat_penalty/std": 0.13886435329914093, "rewards/repeat_floor/mean": 0.9912518262863159, "rewards/repeat_floor/std": 0.014125322923064232, "rewards/near_duplicate_penalty/mean": 0.9680249691009521, "rewards/near_duplicate_penalty/std": 0.036666907370090485, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9769231081008911, "rewards/distinct_2/std": 0.04578607901930809, "rewards/total_composite/mean": 0.11356526613235474, "rewards/total_composite/std": 0.14179803431034088, "reward": 0.11356526613235474, "reward_std": 0.14179803431034088, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16457846760749817, "sampling/sampling_logp_difference/max": 1.6693463325500488, "sampling/importance_sampling_ratio/min": 0.18837015330791473, "sampling/importance_sampling_ratio/mean": 1.0209168195724487, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3274514079093933, "clip_ratio/low_mean": 0.0551587319932878, "clip_ratio/low_min": 0.0551587319932878, "clip_ratio/high_mean": 0.06817394308745861, "clip_ratio/high_max": 0.06817394308745861, "clip_ratio/region_mean": 0.12333267508074641, "reward_total_mean": 0.11356526613235474, "reward_meter_mean": 0.345956027507782, "reward_meter_std": 0.392540842294693, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.964140772819519, "reward_lexical_plausibility_std": 0.10142520815134048, "reward_repeat_penalty_mean": 0.9224766492843628, "reward_repeat_penalty_std": 0.13886435329914093, "reward_repeat_floor_mean": 0.9912518262863159, "reward_repeat_floor_std": 0.014125322923064232, "reward_near_duplicate_penalty_mean": 0.9680249691009521, "reward_near_duplicate_penalty_std": 0.036666907370090485, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9769231081008911, "reward_distinct_2_std": 0.04578607901930809, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.11356526613235474, "reward_total_composite_std": 0.14179803431034088} {"timestamp_utc": "2026-04-12T20:41:41Z", "mode": "train", "global_step": 1234, "epoch": 0.06494395031840429, "loss": -0.0196, "grad_norm": 1.247450590133667, "learning_rate": 6.263636363636364e-06, "num_tokens": 2194934.0, "completions/mean_length": 265.0, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 18.0, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.39558348059654236, "rewards/meter/std": 0.38997212052345276, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.7501569390296936, "rewards/lexical_plausibility/std": 0.26882272958755493, "rewards/judge_quality/mean": 0.125, "rewards/judge_quality/std": 0.10350984334945679, "rewards/repeat_penalty/mean": 0.7495925426483154, "rewards/repeat_penalty/std": 0.0011524002766236663, "rewards/repeat_floor/mean": 0.9849511384963989, "rewards/repeat_floor/std": 0.0001382838236168027, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9994567632675171, "rewards/distinct_2/std": 0.001536526600830257, "rewards/total_composite/mean": 0.04846624284982681, "rewards/total_composite/std": 0.06216733530163765, "reward": 0.04846624284982681, "reward_std": 0.06216733530163765, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16079159080982208, "sampling/sampling_logp_difference/max": 0.8369097709655762, "sampling/importance_sampling_ratio/min": 0.43304669857025146, "sampling/importance_sampling_ratio/mean": 1.0477958917617798, "sampling/importance_sampling_ratio/max": 1.7438623905181885, "entropy": 0.8355869203805923, "clip_ratio/low_mean": 0.014705882407724857, "clip_ratio/low_min": 0.014705882407724857, "clip_ratio/high_mean": 0.06423611240461469, "clip_ratio/high_max": 0.06423611240461469, "clip_ratio/region_mean": 0.07894199481233954, "reward_total_mean": 0.04846624284982681, "reward_meter_mean": 0.39558348059654236, "reward_meter_std": 0.38997212052345276, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.7501569390296936, "reward_lexical_plausibility_std": 0.26882272958755493, "reward_repeat_penalty_mean": 0.7495925426483154, "reward_repeat_penalty_std": 0.0011524002766236663, "reward_repeat_floor_mean": 0.9849511384963989, "reward_repeat_floor_std": 0.0001382838236168027, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9994567632675171, "reward_distinct_2_std": 0.001536526600830257, "reward_judge_quality_mean": 0.125, "reward_judge_quality_std": 0.10350984334945679, "reward_total_composite_mean": 0.04846624284982681, "reward_total_composite_std": 0.06216733530163765} {"timestamp_utc": "2026-04-12T20:41:55Z", "mode": "train", "global_step": 1235, "epoch": 0.06499657912741434, "loss": -0.0914, "grad_norm": 1.8325289487838745, "learning_rate": 6.260606060606062e-06, "num_tokens": 2196427.0, "completions/mean_length": 154.625, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 35.5, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.7336145043373108, "rewards/meter/std": 0.4413461983203888, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8891605138778687, "rewards/lexical_plausibility/std": 0.20523492991924286, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.16850179433822632, "rewards/repeat_penalty/mean": 0.6898847222328186, "rewards/repeat_penalty/std": 0.32939156889915466, "rewards/repeat_floor/mean": 0.9750527143478394, "rewards/repeat_floor/std": 0.021731629967689514, "rewards/near_duplicate_penalty/mean": 0.957435131072998, "rewards/near_duplicate_penalty/std": 0.041575632989406586, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.32732683420181274, "rewards/distinct_2/mean": 0.9604164361953735, "rewards/distinct_2/std": 0.056162718683481216, "rewards/total_composite/mean": 0.2856692373752594, "rewards/total_composite/std": 0.18015047907829285, "reward": 0.2856692373752594, "reward_std": 0.18015047907829285, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1669953167438507, "sampling/sampling_logp_difference/max": 1.4733266830444336, "sampling/importance_sampling_ratio/min": 0.22916185855865479, "sampling/importance_sampling_ratio/mean": 1.0710846185684204, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0276648104190826, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.10665093921124935, "clip_ratio/high_max": 0.10665093921124935, "clip_ratio/region_mean": 0.10665093921124935, "reward_total_mean": 0.2856692373752594, "reward_meter_mean": 0.7336145043373108, "reward_meter_std": 0.4413461983203888, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8891605138778687, "reward_lexical_plausibility_std": 0.20523492991924286, "reward_repeat_penalty_mean": 0.6898847222328186, "reward_repeat_penalty_std": 0.32939156889915466, "reward_repeat_floor_mean": 0.9750527143478394, "reward_repeat_floor_std": 0.021731629967689514, "reward_near_duplicate_penalty_mean": 0.957435131072998, "reward_near_duplicate_penalty_std": 0.041575632989406586, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.32732683420181274, "reward_distinct_2_mean": 0.9604164361953735, "reward_distinct_2_std": 0.056162718683481216, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.16850179433822632, "reward_total_composite_mean": 0.2856692373752594, "reward_total_composite_std": 0.18015047907829285} {"timestamp_utc": "2026-04-12T20:42:09Z", "mode": "train", "global_step": 1236, "epoch": 0.0650492079364244, "loss": -0.1221, "grad_norm": 2.4707868099212646, "learning_rate": 6.257575757575758e-06, "num_tokens": 2198380.0, "completions/mean_length": 231.125, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 62.60000228881836, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.9382025003433228, "rewards/meter/std": 0.08106688410043716, "rewards/count_adherence/mean": 0.4166666865348816, "rewards/count_adherence/std": 0.1653386503458023, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8250000476837158, "rewards/count_floor/std": 0.04960159957408905, "rewards/lexical_plausibility/mean": 0.8655129671096802, "rewards/lexical_plausibility/std": 0.1479320228099823, "rewards/judge_quality/mean": 0.23125000298023224, "rewards/judge_quality/std": 0.13611313700675964, "rewards/repeat_penalty/mean": 0.901749849319458, "rewards/repeat_penalty/std": 0.0676775798201561, "rewards/repeat_floor/mean": 0.9873590469360352, "rewards/repeat_floor/std": 0.008352715522050858, "rewards/near_duplicate_penalty/mean": 0.9418801665306091, "rewards/near_duplicate_penalty/std": 0.03421046957373619, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9564115405082703, "rewards/distinct_2/std": 0.04288877546787262, "rewards/total_composite/mean": 0.1718834787607193, "rewards/total_composite/std": 0.10159119963645935, "reward": 0.1718834787607193, "reward_std": 0.10159119963645935, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17375414073467255, "sampling/sampling_logp_difference/max": 2.4321956634521484, "sampling/importance_sampling_ratio/min": 0.2225916087627411, "sampling/importance_sampling_ratio/mean": 1.0492405891418457, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9741256237030029, "clip_ratio/low_mean": 0.01744186133146286, "clip_ratio/low_min": 0.01744186133146286, "clip_ratio/high_mean": 0.08449536841362715, "clip_ratio/high_max": 0.08449536841362715, "clip_ratio/region_mean": 0.10193722974509001, "reward_total_mean": 0.1718834787607193, "reward_meter_mean": 0.9382025003433228, "reward_meter_std": 0.08106688410043716, "reward_count_adherence_mean": 0.4166666865348816, "reward_count_adherence_std": 0.1653386503458023, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8250000476837158, "reward_count_floor_std": 0.04960159957408905, "reward_lexical_plausibility_mean": 0.8655129671096802, "reward_lexical_plausibility_std": 0.1479320228099823, "reward_repeat_penalty_mean": 0.901749849319458, "reward_repeat_penalty_std": 0.0676775798201561, "reward_repeat_floor_mean": 0.9873590469360352, "reward_repeat_floor_std": 0.008352715522050858, "reward_near_duplicate_penalty_mean": 0.9418801665306091, "reward_near_duplicate_penalty_std": 0.03421046957373619, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9564115405082703, "reward_distinct_2_std": 0.04288877546787262, "reward_judge_quality_mean": 0.23125000298023224, "reward_judge_quality_std": 0.13611313700675964, "reward_total_composite_mean": 0.1718834787607193, "reward_total_composite_std": 0.10159119963645935} {"timestamp_utc": "2026-04-12T20:42:24Z", "mode": "train", "global_step": 1237, "epoch": 0.06510183674543445, "loss": -0.0557, "grad_norm": 5.74350118637085, "learning_rate": 6.254545454545455e-06, "num_tokens": 2200015.0, "completions/mean_length": 105.375, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.28571701049805, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.6636344194412231, "rewards/meter/std": 0.3934630751609802, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.9641571044921875, "rewards/lexical_plausibility/std": 0.10137906670570374, "rewards/judge_quality/mean": 0.34999996423721313, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9089483022689819, "rewards/repeat_penalty/std": 0.06338323652744293, "rewards/repeat_floor/mean": 0.9879863262176514, "rewards/repeat_floor/std": 0.008179265074431896, "rewards/near_duplicate_penalty/mean": 0.9401991367340088, "rewards/near_duplicate_penalty/std": 0.04138028994202614, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9661828279495239, "rewards/distinct_2/std": 0.03781760856509209, "rewards/total_composite/mean": 0.2201250195503235, "rewards/total_composite/std": 0.15626908838748932, "reward": 0.2201250195503235, "reward_std": 0.15626908838748932, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18314969539642334, "sampling/sampling_logp_difference/max": 1.3584260940551758, "sampling/importance_sampling_ratio/min": 0.2570650577545166, "sampling/importance_sampling_ratio/mean": 1.0382224321365356, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3279864937067032, "clip_ratio/low_mean": 0.023518981877714396, "clip_ratio/low_min": 0.023518981877714396, "clip_ratio/high_mean": 0.08756113331764936, "clip_ratio/high_max": 0.08756113331764936, "clip_ratio/region_mean": 0.11108011519536376, "reward_total_mean": 0.2201250195503235, "reward_meter_mean": 0.6636344194412231, "reward_meter_std": 0.3934630751609802, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.9641571044921875, "reward_lexical_plausibility_std": 0.10137906670570374, "reward_repeat_penalty_mean": 0.9089483022689819, "reward_repeat_penalty_std": 0.06338323652744293, "reward_repeat_floor_mean": 0.9879863262176514, "reward_repeat_floor_std": 0.008179265074431896, "reward_near_duplicate_penalty_mean": 0.9401991367340088, "reward_near_duplicate_penalty_std": 0.04138028994202614, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9661828279495239, "reward_distinct_2_std": 0.03781760856509209, "reward_judge_quality_mean": 0.34999996423721313, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.2201250195503235, "reward_total_composite_std": 0.15626908838748932} {"timestamp_utc": "2026-04-12T20:42:32Z", "mode": "train", "global_step": 1238, "epoch": 0.0651544655544445, "loss": -0.0297, "grad_norm": 14.210705757141113, "learning_rate": 6.251515151515152e-06, "num_tokens": 2201544.0, "completions/mean_length": 34.125, "completions/min_length": 31.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.125, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.5090712904930115, "rewards/meter/std": 0.3570987582206726, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9781991839408875, "rewards/lexical_plausibility/std": 0.06166204437613487, "rewards/judge_quality/mean": 0.4424999952316284, "rewards/judge_quality/std": 0.32101401686668396, "rewards/repeat_penalty/mean": 0.9412117600440979, "rewards/repeat_penalty/std": 0.058571357280015945, "rewards/repeat_floor/mean": 0.9920860528945923, "rewards/repeat_floor/std": 0.007197629660367966, "rewards/near_duplicate_penalty/mean": 0.9585583209991455, "rewards/near_duplicate_penalty/std": 0.02920488268136978, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9811372756958008, "rewards/distinct_2/std": 0.035051409155130386, "rewards/total_composite/mean": 0.304751992225647, "rewards/total_composite/std": 0.3495134115219116, "reward": 0.304751992225647, "reward_std": 0.3495134115219116, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1359197348356247, "sampling/sampling_logp_difference/max": 1.2594246864318848, "sampling/importance_sampling_ratio/min": 0.28381726145744324, "sampling/importance_sampling_ratio/mean": 1.0325759649276733, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2088068053126335, "clip_ratio/low_mean": 0.09459223784506321, "clip_ratio/low_min": 0.09459223784506321, "clip_ratio/high_mean": 0.05419511627405882, "clip_ratio/high_max": 0.05419511627405882, "clip_ratio/region_mean": 0.14878735411912203, "reward_total_mean": 0.304751992225647, "reward_meter_mean": 0.5090712904930115, "reward_meter_std": 0.3570987582206726, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9781991839408875, "reward_lexical_plausibility_std": 0.06166204437613487, "reward_repeat_penalty_mean": 0.9412117600440979, "reward_repeat_penalty_std": 0.058571357280015945, "reward_repeat_floor_mean": 0.9920860528945923, "reward_repeat_floor_std": 0.007197629660367966, "reward_near_duplicate_penalty_mean": 0.9585583209991455, "reward_near_duplicate_penalty_std": 0.02920488268136978, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9811372756958008, "reward_distinct_2_std": 0.035051409155130386, "reward_judge_quality_mean": 0.4424999952316284, "reward_judge_quality_std": 0.32101401686668396, "reward_total_composite_mean": 0.304751992225647, "reward_total_composite_std": 0.3495134115219116} {"timestamp_utc": "2026-04-12T20:42:40Z", "mode": "train", "global_step": 1239, "epoch": 0.06520709436345455, "loss": -0.0679, "grad_norm": 14.023561477661133, "learning_rate": 6.248484848484849e-06, "num_tokens": 2203072.0, "completions/mean_length": 30.0, "completions/min_length": 5.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.0, "completions/min_terminated_length": 5.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.5566118955612183, "rewards/meter/std": 0.4028037488460541, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.2781743109226227, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8874999284744263, "rewards/count_floor/std": 0.08345229923725128, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.768750011920929, "rewards/judge_quality/std": 0.3004015386104584, "rewards/repeat_penalty/mean": 0.9690935611724854, "rewards/repeat_penalty/std": 0.01671244017779827, "rewards/repeat_floor/mean": 0.9953640699386597, "rewards/repeat_floor/std": 0.0025068672839552164, "rewards/near_duplicate_penalty/mean": 0.9690935611724854, "rewards/near_duplicate_penalty/std": 0.01671244017779827, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.45701491832733154, "rewards/total_composite/std": 0.3411944806575775, "reward": 0.45701491832733154, "reward_std": 0.3411944508552551, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12629644572734833, "sampling/sampling_logp_difference/max": 1.4598636627197266, "sampling/importance_sampling_ratio/min": 0.23226793110370636, "sampling/importance_sampling_ratio/mean": 1.0134378671646118, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.45294495671987534, "clip_ratio/low_mean": 0.06294171139597893, "clip_ratio/low_min": 0.06294171139597893, "clip_ratio/high_mean": 0.04567307699471712, "clip_ratio/high_max": 0.04567307699471712, "clip_ratio/region_mean": 0.10861478839069605, "reward_total_mean": 0.45701491832733154, "reward_meter_mean": 0.5566118955612183, "reward_meter_std": 0.4028037488460541, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.2781743109226227, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8874999284744263, "reward_count_floor_std": 0.08345229923725128, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9690935611724854, "reward_repeat_penalty_std": 0.01671244017779827, "reward_repeat_floor_mean": 0.9953640699386597, "reward_repeat_floor_std": 0.0025068672839552164, "reward_near_duplicate_penalty_mean": 0.9690935611724854, "reward_near_duplicate_penalty_std": 0.01671244017779827, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.768750011920929, "reward_judge_quality_std": 0.3004015386104584, "reward_total_composite_mean": 0.45701491832733154, "reward_total_composite_std": 0.3411944806575775} {"timestamp_utc": "2026-04-12T20:42:47Z", "mode": "train", "global_step": 1240, "epoch": 0.0652597231724646, "loss": 0.0112, "grad_norm": 17.732521057128906, "learning_rate": 6.245454545454545e-06, "num_tokens": 2204286.0, "completions/mean_length": 14.75, "completions/min_length": 13.0, "completions/max_length": 17.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 14.75, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 17.0, "rewards/meter/mean": 0.9761737585067749, "rewards/meter/std": 0.01978938840329647, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.24032345414161682, "rewards/repeat_penalty/mean": 0.7171111106872559, "rewards/repeat_penalty/std": 0.052729666233062744, "rewards/repeat_floor/mean": 0.978422224521637, "rewards/repeat_floor/std": 0.010545928031206131, "rewards/near_duplicate_penalty/mean": 0.9561481475830078, "rewards/near_duplicate_penalty/std": 0.0703062191605568, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.40208137035369873, "rewards/total_composite/std": 0.227709099650383, "reward": 0.40208137035369873, "reward_std": 0.227709099650383, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.139068141579628, "sampling/sampling_logp_difference/max": 0.9917736053466797, "sampling/importance_sampling_ratio/min": 0.37091824412345886, "sampling/importance_sampling_ratio/mean": 1.010571837425232, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.176104299724102, "clip_ratio/low_mean": 0.03708791360259056, "clip_ratio/low_min": 0.03708791360259056, "clip_ratio/high_mean": 0.08474702574312687, "clip_ratio/high_max": 0.08474702574312687, "clip_ratio/region_mean": 0.12183493934571743, "reward_total_mean": 0.40208137035369873, "reward_meter_mean": 0.9761737585067749, "reward_meter_std": 0.01978938840329647, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7171111106872559, "reward_repeat_penalty_std": 0.052729666233062744, "reward_repeat_floor_mean": 0.978422224521637, "reward_repeat_floor_std": 0.010545928031206131, "reward_near_duplicate_penalty_mean": 0.9561481475830078, "reward_near_duplicate_penalty_std": 0.0703062191605568, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.24032345414161682, "reward_total_composite_mean": 0.40208137035369873, "reward_total_composite_std": 0.227709099650383} {"timestamp_utc": "2026-04-12T20:42:55Z", "mode": "train", "global_step": 1241, "epoch": 0.06531235198147466, "loss": 0.0515, "grad_norm": 28.220304489135742, "learning_rate": 6.2424242424242434e-06, "num_tokens": 2205802.0, "completions/mean_length": 17.5, "completions/min_length": 16.0, "completions/max_length": 20.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.5, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 20.0, "rewards/meter/mean": 0.7593625783920288, "rewards/meter/std": 0.25426849722862244, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7887499928474426, "rewards/judge_quality/std": 0.27115824818611145, "rewards/repeat_penalty/mean": 0.7366601228713989, "rewards/repeat_penalty/std": 0.025940246880054474, "rewards/repeat_floor/mean": 0.9823319911956787, "rewards/repeat_floor/std": 0.005188049282878637, "rewards/near_duplicate_penalty/mean": 0.9822134375572205, "rewards/near_duplicate_penalty/std": 0.034586984664201736, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5923237800598145, "rewards/total_composite/std": 0.2872130274772644, "reward": 0.5923237800598145, "reward_std": 0.2872130274772644, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14005941152572632, "sampling/sampling_logp_difference/max": 1.0842657089233398, "sampling/importance_sampling_ratio/min": 0.4309065043926239, "sampling/importance_sampling_ratio/mean": 0.9893203973770142, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9171800911426544, "clip_ratio/low_mean": 0.0390625, "clip_ratio/low_min": 0.0390625, "clip_ratio/high_mean": 0.10661764768883586, "clip_ratio/high_max": 0.10661764768883586, "clip_ratio/region_mean": 0.14568014768883586, "reward_total_mean": 0.5923237800598145, "reward_meter_mean": 0.7593625783920288, "reward_meter_std": 0.25426849722862244, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7366601228713989, "reward_repeat_penalty_std": 0.025940246880054474, "reward_repeat_floor_mean": 0.9823319911956787, "reward_repeat_floor_std": 0.005188049282878637, "reward_near_duplicate_penalty_mean": 0.9822134375572205, "reward_near_duplicate_penalty_std": 0.034586984664201736, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7887499928474426, "reward_judge_quality_std": 0.27115824818611145, "reward_total_composite_mean": 0.5923237800598145, "reward_total_composite_std": 0.2872130274772644} {"timestamp_utc": "2026-04-12T20:43:09Z", "mode": "train", "global_step": 1242, "epoch": 0.06536498079048471, "loss": -0.0633, "grad_norm": 4.929039001464844, "learning_rate": 6.23939393939394e-06, "num_tokens": 2207455.0, "completions/mean_length": 101.625, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 43.000003814697266, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.9189140796661377, "rewards/meter/std": 0.10611801594495773, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9609698057174683, "rewards/lexical_plausibility/std": 0.11039415001869202, "rewards/judge_quality/mean": 0.20625001192092896, "rewards/judge_quality/std": 0.1293872892856598, "rewards/repeat_penalty/mean": 0.9624922871589661, "rewards/repeat_penalty/std": 0.053655955940485, "rewards/repeat_floor/mean": 0.9946796298027039, "rewards/repeat_floor/std": 0.007227218244224787, "rewards/near_duplicate_penalty/mean": 0.9688042402267456, "rewards/near_duplicate_penalty/std": 0.03699269890785217, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9928774833679199, "rewards/distinct_2/std": 0.02014549821615219, "rewards/total_composite/mean": 0.1921328902244568, "rewards/total_composite/std": 0.12995624542236328, "reward": 0.1921328902244568, "reward_std": 0.1299562305212021, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1773170381784439, "sampling/sampling_logp_difference/max": 1.926767349243164, "sampling/importance_sampling_ratio/min": 0.14561817049980164, "sampling/importance_sampling_ratio/mean": 1.056402564048767, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3925556987524033, "clip_ratio/low_mean": 0.07583586126565933, "clip_ratio/low_min": 0.07583586126565933, "clip_ratio/high_mean": 0.04462869931012392, "clip_ratio/high_max": 0.04462869931012392, "clip_ratio/region_mean": 0.12046456057578325, "reward_total_mean": 0.1921328902244568, "reward_meter_mean": 0.9189140796661377, "reward_meter_std": 0.10611801594495773, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9609698057174683, "reward_lexical_plausibility_std": 0.11039415001869202, "reward_repeat_penalty_mean": 0.9624922871589661, "reward_repeat_penalty_std": 0.053655955940485, "reward_repeat_floor_mean": 0.9946796298027039, "reward_repeat_floor_std": 0.007227218244224787, "reward_near_duplicate_penalty_mean": 0.9688042402267456, "reward_near_duplicate_penalty_std": 0.03699269890785217, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9928774833679199, "reward_distinct_2_std": 0.02014549821615219, "reward_judge_quality_mean": 0.20625001192092896, "reward_judge_quality_std": 0.1293872892856598, "reward_total_composite_mean": 0.1921328902244568, "reward_total_composite_std": 0.12995624542236328} {"timestamp_utc": "2026-04-12T20:43:23Z", "mode": "train", "global_step": 1243, "epoch": 0.06541760959949476, "loss": -0.1326, "grad_norm": 1.853240728378296, "learning_rate": 6.236363636363637e-06, "num_tokens": 2209666.0, "completions/mean_length": 249.375, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 91.80000305175781, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 116.0, "rewards/meter/mean": 0.8503066897392273, "rewards/meter/std": 0.21898460388183594, "rewards/count_adherence/mean": 0.4107142984867096, "rewards/count_adherence/std": 0.1937432438135147, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8232142925262451, "rewards/count_floor/std": 0.05812295898795128, "rewards/lexical_plausibility/mean": 0.883672833442688, "rewards/lexical_plausibility/std": 0.17210981249809265, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.17728105187416077, "rewards/repeat_penalty/mean": 0.8924397826194763, "rewards/repeat_penalty/std": 0.12868241965770721, "rewards/repeat_floor/mean": 0.9905014634132385, "rewards/repeat_floor/std": 0.010197503492236137, "rewards/near_duplicate_penalty/mean": 0.9795410633087158, "rewards/near_duplicate_penalty/std": 0.02328227460384369, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9702256917953491, "rewards/distinct_2/std": 0.039875928312540054, "rewards/total_composite/mean": 0.18152840435504913, "rewards/total_composite/std": 0.1370563805103302, "reward": 0.18152840435504913, "reward_std": 0.1370563805103302, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14794373512268066, "sampling/sampling_logp_difference/max": 1.7479491233825684, "sampling/importance_sampling_ratio/min": 0.17413069307804108, "sampling/importance_sampling_ratio/mean": 1.0459083318710327, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8835892453789711, "clip_ratio/low_mean": 0.02604166604578495, "clip_ratio/low_min": 0.02604166604578495, "clip_ratio/high_mean": 0.05065748514607549, "clip_ratio/high_max": 0.05065748514607549, "clip_ratio/region_mean": 0.07669915119186044, "reward_total_mean": 0.18152840435504913, "reward_meter_mean": 0.8503066897392273, "reward_meter_std": 0.21898460388183594, "reward_count_adherence_mean": 0.4107142984867096, "reward_count_adherence_std": 0.1937432438135147, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8232142925262451, "reward_count_floor_std": 0.05812295898795128, "reward_lexical_plausibility_mean": 0.883672833442688, "reward_lexical_plausibility_std": 0.17210981249809265, "reward_repeat_penalty_mean": 0.8924397826194763, "reward_repeat_penalty_std": 0.12868241965770721, "reward_repeat_floor_mean": 0.9905014634132385, "reward_repeat_floor_std": 0.010197503492236137, "reward_near_duplicate_penalty_mean": 0.9795410633087158, "reward_near_duplicate_penalty_std": 0.02328227460384369, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9702256917953491, "reward_distinct_2_std": 0.039875928312540054, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.17728105187416077, "reward_total_composite_mean": 0.18152840435504913, "reward_total_composite_std": 0.1370563805103302} {"timestamp_utc": "2026-04-12T20:43:37Z", "mode": "train", "global_step": 1244, "epoch": 0.06547023840850481, "loss": -0.1541, "grad_norm": 1.9030165672302246, "learning_rate": 6.2333333333333335e-06, "num_tokens": 2211666.0, "completions/mean_length": 181.0, "completions/min_length": 64.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 70.66667175292969, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.9835989475250244, "rewards/meter/std": 0.013030430302023888, "rewards/count_adherence/mean": 0.7000000476837158, "rewards/count_adherence/std": 0.10690449178218842, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9099999666213989, "rewards/count_floor/std": 0.03207135200500488, "rewards/lexical_plausibility/mean": 0.8965067863464355, "rewards/lexical_plausibility/std": 0.193262979388237, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.28822651505470276, "rewards/repeat_penalty/std": 0.2483576536178589, "rewards/repeat_floor/mean": 0.9058868885040283, "rewards/repeat_floor/std": 0.0566122941672802, "rewards/near_duplicate_penalty/mean": 0.7477419376373291, "rewards/near_duplicate_penalty/std": 0.1612212359905243, "rewards/opening_diversity/mean": 0.4352678656578064, "rewards/opening_diversity/std": 0.2844659388065338, "rewards/distinct_2/mean": 0.7512165904045105, "rewards/distinct_2/std": 0.25841039419174194, "rewards/total_composite/mean": 0.22412312030792236, "rewards/total_composite/std": 0.11611055582761765, "reward": 0.22412312030792236, "reward_std": 0.11611056327819824, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13060210645198822, "sampling/sampling_logp_difference/max": 1.560983657836914, "sampling/importance_sampling_ratio/min": 0.2099294662475586, "sampling/importance_sampling_ratio/mean": 1.010269284248352, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5903434529900551, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.07258011866360903, "clip_ratio/high_max": 0.07258011866360903, "clip_ratio/region_mean": 0.07258011866360903, "reward_total_mean": 0.22412312030792236, "reward_meter_mean": 0.9835989475250244, "reward_meter_std": 0.013030430302023888, "reward_count_adherence_mean": 0.7000000476837158, "reward_count_adherence_std": 0.10690449178218842, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9099999666213989, "reward_count_floor_std": 0.03207135200500488, "reward_lexical_plausibility_mean": 0.8965067863464355, "reward_lexical_plausibility_std": 0.193262979388237, "reward_repeat_penalty_mean": 0.28822651505470276, "reward_repeat_penalty_std": 0.2483576536178589, "reward_repeat_floor_mean": 0.9058868885040283, "reward_repeat_floor_std": 0.0566122941672802, "reward_near_duplicate_penalty_mean": 0.7477419376373291, "reward_near_duplicate_penalty_std": 0.1612212359905243, "reward_opening_diversity_mean": 0.4352678656578064, "reward_opening_diversity_std": 0.2844659388065338, "reward_distinct_2_mean": 0.7512165904045105, "reward_distinct_2_std": 0.25841039419174194, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.22412312030792236, "reward_total_composite_std": 0.11611055582761765} {"timestamp_utc": "2026-04-12T20:43:46Z", "mode": "train", "global_step": 1245, "epoch": 0.06552286721751487, "loss": 0.0629, "grad_norm": 15.939921379089355, "learning_rate": 6.230303030303031e-06, "num_tokens": 2213499.0, "completions/mean_length": 46.125, "completions/min_length": 31.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.125, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.8733986616134644, "rewards/meter/std": 0.17946261167526245, "rewards/count_adherence/mean": 0.71875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.9624999761581421, "rewards/arabic_floor/std": 0.06943649053573608, "rewards/count_floor/mean": 0.9156249761581421, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9535636901855469, "rewards/repeat_penalty/std": 0.04536581039428711, "rewards/repeat_floor/mean": 0.9941201210021973, "rewards/repeat_floor/std": 0.004832054954022169, "rewards/near_duplicate_penalty/mean": 0.9727669954299927, "rewards/near_duplicate_penalty/std": 0.014959770254790783, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9800570011138916, "rewards/distinct_2/std": 0.038885053247213364, "rewards/total_composite/mean": 0.3151639699935913, "rewards/total_composite/std": 0.08295875042676926, "reward": 0.3151639699935913, "reward_std": 0.08295875042676926, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16736873984336853, "sampling/sampling_logp_difference/max": 2.2824487686157227, "sampling/importance_sampling_ratio/min": 0.10203403979539871, "sampling/importance_sampling_ratio/mean": 1.0098350048065186, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9740136489272118, "clip_ratio/low_mean": 0.06517662992700934, "clip_ratio/low_min": 0.06517662992700934, "clip_ratio/high_mean": 0.08775888569653034, "clip_ratio/high_max": 0.08775888569653034, "clip_ratio/region_mean": 0.1529355156235397, "reward_total_mean": 0.3151639699935913, "reward_meter_mean": 0.8733986616134644, "reward_meter_std": 0.17946261167526245, "reward_count_adherence_mean": 0.71875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.9624999761581421, "reward_arabic_floor_std": 0.06943649053573608, "reward_count_floor_mean": 0.9156249761581421, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9535636901855469, "reward_repeat_penalty_std": 0.04536581039428711, "reward_repeat_floor_mean": 0.9941201210021973, "reward_repeat_floor_std": 0.004832054954022169, "reward_near_duplicate_penalty_mean": 0.9727669954299927, "reward_near_duplicate_penalty_std": 0.014959770254790783, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9800570011138916, "reward_distinct_2_std": 0.038885053247213364, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.3151639699935913, "reward_total_composite_std": 0.08295875042676926} {"timestamp_utc": "2026-04-12T20:44:00Z", "mode": "train", "global_step": 1246, "epoch": 0.06557549602652492, "loss": -0.1205, "grad_norm": 2.6888742446899414, "learning_rate": 6.227272727272727e-06, "num_tokens": 2215517.0, "completions/mean_length": 176.25, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 64.33333587646484, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.513663113117218, "rewards/meter/std": 0.2534431219100952, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 0.9237847328186035, "rewards/lexical_plausibility/std": 0.14155985414981842, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.18077214062213898, "rewards/repeat_penalty/mean": 0.9332049489021301, "rewards/repeat_penalty/std": 0.04546697065234184, "rewards/repeat_floor/mean": 0.9919899702072144, "rewards/repeat_floor/std": 0.005299018695950508, "rewards/near_duplicate_penalty/mean": 0.9688516855239868, "rewards/near_duplicate_penalty/std": 0.021502871066331863, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.962913990020752, "rewards/distinct_2/std": 0.03316647931933403, "rewards/total_composite/mean": 0.17804402112960815, "rewards/total_composite/std": 0.11710407584905624, "reward": 0.17804402112960815, "reward_std": 0.11710407584905624, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1626768261194229, "sampling/sampling_logp_difference/max": 1.681884765625, "sampling/importance_sampling_ratio/min": 0.1860230267047882, "sampling/importance_sampling_ratio/mean": 1.0211745500564575, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7871479243040085, "clip_ratio/low_mean": 0.019480518996715546, "clip_ratio/low_min": 0.019480518996715546, "clip_ratio/high_mean": 0.07765456382185221, "clip_ratio/high_max": 0.07765456382185221, "clip_ratio/region_mean": 0.09713508281856775, "reward_total_mean": 0.17804402112960815, "reward_meter_mean": 0.513663113117218, "reward_meter_std": 0.2534431219100952, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 0.9237847328186035, "reward_lexical_plausibility_std": 0.14155985414981842, "reward_repeat_penalty_mean": 0.9332049489021301, "reward_repeat_penalty_std": 0.04546697065234184, "reward_repeat_floor_mean": 0.9919899702072144, "reward_repeat_floor_std": 0.005299018695950508, "reward_near_duplicate_penalty_mean": 0.9688516855239868, "reward_near_duplicate_penalty_std": 0.021502871066331863, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.962913990020752, "reward_distinct_2_std": 0.03316647931933403, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.18077214062213898, "reward_total_composite_mean": 0.17804402112960815, "reward_total_composite_std": 0.11710407584905624} {"timestamp_utc": "2026-04-12T20:44:09Z", "mode": "train", "global_step": 1247, "epoch": 0.06562812483553497, "loss": 0.023, "grad_norm": 20.79667091369629, "learning_rate": 6.224242424242425e-06, "num_tokens": 2217002.0, "completions/mean_length": 20.625, "completions/min_length": 18.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.625, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.7085248827934265, "rewards/meter/std": 0.38873299956321716, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.15059404075145721, "rewards/repeat_penalty/mean": 0.7411185503005981, "rewards/repeat_penalty/std": 0.019554078578948975, "rewards/repeat_floor/mean": 0.9832237362861633, "rewards/repeat_floor/std": 0.003910813480615616, "rewards/near_duplicate_penalty/mean": 0.9881580471992493, "rewards/near_duplicate_penalty/std": 0.026072107255458832, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19634845852851868, "rewards/total_composite/std": 0.14513981342315674, "reward": 0.19634845852851868, "reward_std": 0.14513979852199554, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17221178114414215, "sampling/sampling_logp_difference/max": 1.073185920715332, "sampling/importance_sampling_ratio/min": 0.341917484998703, "sampling/importance_sampling_ratio/mean": 1.0430773496627808, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5565488040447235, "clip_ratio/low_mean": 0.10535714589059353, "clip_ratio/low_min": 0.10535714589059353, "clip_ratio/high_mean": 0.05227272864431143, "clip_ratio/high_max": 0.05227272864431143, "clip_ratio/region_mean": 0.15762987453490496, "reward_total_mean": 0.19634845852851868, "reward_meter_mean": 0.7085248827934265, "reward_meter_std": 0.38873299956321716, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7411185503005981, "reward_repeat_penalty_std": 0.019554078578948975, "reward_repeat_floor_mean": 0.9832237362861633, "reward_repeat_floor_std": 0.003910813480615616, "reward_near_duplicate_penalty_mean": 0.9881580471992493, "reward_near_duplicate_penalty_std": 0.026072107255458832, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.15059404075145721, "reward_total_composite_mean": 0.19634845852851868, "reward_total_composite_std": 0.14513981342315674} {"timestamp_utc": "2026-04-12T20:44:18Z", "mode": "train", "global_step": 1248, "epoch": 0.06568075364454502, "loss": 0.0507, "grad_norm": 15.76718521118164, "learning_rate": 6.221212121212121e-06, "num_tokens": 2218935.0, "completions/mean_length": 59.625, "completions/min_length": 57.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 59.625, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.5233222246170044, "rewards/meter/std": 0.38666650652885437, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200973272324, "rewards/repeat_penalty/mean": 0.9243854284286499, "rewards/repeat_penalty/std": 0.0598582923412323, "rewards/repeat_floor/mean": 0.9905862212181091, "rewards/repeat_floor/std": 0.0066826920956373215, "rewards/near_duplicate_penalty/mean": 0.9595956802368164, "rewards/near_duplicate_penalty/std": 0.02047358825802803, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9627429246902466, "rewards/distinct_2/std": 0.04781792685389519, "rewards/total_composite/mean": 0.17514003813266754, "rewards/total_composite/std": 0.14418698847293854, "reward": 0.17514003813266754, "reward_std": 0.14418698847293854, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.152029350399971, "sampling/sampling_logp_difference/max": 2.5474061965942383, "sampling/importance_sampling_ratio/min": 0.07828445732593536, "sampling/importance_sampling_ratio/mean": 1.0235058069229126, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1948922351002693, "clip_ratio/low_mean": 0.09359662793576717, "clip_ratio/low_min": 0.09359662793576717, "clip_ratio/high_mean": 0.05369666777551174, "clip_ratio/high_max": 0.05369666777551174, "clip_ratio/region_mean": 0.14729329571127892, "reward_total_mean": 0.17514003813266754, "reward_meter_mean": 0.5233222246170044, "reward_meter_std": 0.38666650652885437, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9243854284286499, "reward_repeat_penalty_std": 0.0598582923412323, "reward_repeat_floor_mean": 0.9905862212181091, "reward_repeat_floor_std": 0.0066826920956373215, "reward_near_duplicate_penalty_mean": 0.9595956802368164, "reward_near_duplicate_penalty_std": 0.02047358825802803, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9627429246902466, "reward_distinct_2_std": 0.04781792685389519, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200973272324, "reward_total_composite_mean": 0.17514003813266754, "reward_total_composite_std": 0.14418698847293854} {"timestamp_utc": "2026-04-12T20:44:27Z", "mode": "train", "global_step": 1249, "epoch": 0.06573338245355508, "loss": 0.0949, "grad_norm": 11.137635231018066, "learning_rate": 6.218181818181819e-06, "num_tokens": 2220625.0, "completions/mean_length": 43.25, "completions/min_length": 34.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.25, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.6899032592773438, "rewards/meter/std": 0.39812588691711426, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4612500071525574, "rewards/judge_quality/std": 0.3258587718009949, "rewards/repeat_penalty/mean": 0.9699445962905884, "rewards/repeat_penalty/std": 0.02828710526227951, "rewards/repeat_floor/mean": 0.9959218502044678, "rewards/repeat_floor/std": 0.0036720731295645237, "rewards/near_duplicate_penalty/mean": 0.9772500991821289, "rewards/near_duplicate_penalty/std": 0.02340538427233696, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9926035404205322, "rewards/distinct_2/std": 0.020920326933264732, "rewards/total_composite/mean": 0.2737385630607605, "rewards/total_composite/std": 0.2619189918041229, "reward": 0.2737385630607605, "reward_std": 0.2619189918041229, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1389586329460144, "sampling/sampling_logp_difference/max": 1.3593130111694336, "sampling/importance_sampling_ratio/min": 0.2568371593952179, "sampling/importance_sampling_ratio/mean": 1.0159103870391846, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9785799756646156, "clip_ratio/low_mean": 0.07975180726498365, "clip_ratio/low_min": 0.07975180726498365, "clip_ratio/high_mean": 0.050666118040680885, "clip_ratio/high_max": 0.050666118040680885, "clip_ratio/region_mean": 0.13041792530566454, "reward_total_mean": 0.2737385630607605, "reward_meter_mean": 0.6899032592773438, "reward_meter_std": 0.39812588691711426, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9699445962905884, "reward_repeat_penalty_std": 0.02828710526227951, "reward_repeat_floor_mean": 0.9959218502044678, "reward_repeat_floor_std": 0.0036720731295645237, "reward_near_duplicate_penalty_mean": 0.9772500991821289, "reward_near_duplicate_penalty_std": 0.02340538427233696, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9926035404205322, "reward_distinct_2_std": 0.020920326933264732, "reward_judge_quality_mean": 0.4612500071525574, "reward_judge_quality_std": 0.3258587718009949, "reward_total_composite_mean": 0.2737385630607605, "reward_total_composite_std": 0.2619189918041229} {"timestamp_utc": "2026-04-12T20:44:36Z", "mode": "train", "global_step": 1250, "epoch": 0.06578601126256513, "loss": -0.0456, "grad_norm": 18.66234016418457, "learning_rate": 6.215151515151515e-06, "num_tokens": 2221926.0, "completions/mean_length": 20.625, "completions/min_length": 19.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.625, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.5020642280578613, "rewards/meter/std": 0.48159053921699524, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8541666269302368, "rewards/lexical_plausibility/std": 0.3500283658504486, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390503644943237, "rewards/repeat_penalty/mean": 0.7149804830551147, "rewards/repeat_penalty/std": 0.08950236439704895, "rewards/repeat_floor/mean": 0.9785131216049194, "rewards/repeat_floor/std": 0.016445640474557877, "rewards/near_duplicate_penalty/mean": 0.9682923555374146, "rewards/near_duplicate_penalty/std": 0.07725809514522552, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.26162445545196533, "rewards/total_composite/std": 0.3064093589782715, "reward": 0.26162445545196533, "reward_std": 0.3064093589782715, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15142585337162018, "sampling/sampling_logp_difference/max": 1.40028715133667, "sampling/importance_sampling_ratio/min": 0.24652616679668427, "sampling/importance_sampling_ratio/mean": 1.0279133319854736, "sampling/importance_sampling_ratio/max": 1.9877774715423584, "entropy": 1.3119773119688034, "clip_ratio/low_mean": 0.057565790601074696, "clip_ratio/low_min": 0.057565790601074696, "clip_ratio/high_mean": 0.08418062329292297, "clip_ratio/high_max": 0.08418062329292297, "clip_ratio/region_mean": 0.14174641389399767, "reward_total_mean": 0.26162445545196533, "reward_meter_mean": 0.5020642280578613, "reward_meter_std": 0.48159053921699524, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8541666269302368, "reward_lexical_plausibility_std": 0.3500283658504486, "reward_repeat_penalty_mean": 0.7149804830551147, "reward_repeat_penalty_std": 0.08950236439704895, "reward_repeat_floor_mean": 0.9785131216049194, "reward_repeat_floor_std": 0.016445640474557877, "reward_near_duplicate_penalty_mean": 0.9682923555374146, "reward_near_duplicate_penalty_std": 0.07725809514522552, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390503644943237, "reward_total_composite_mean": 0.26162445545196533, "reward_total_composite_std": 0.3064093589782715} {"timestamp_utc": "2026-04-12T20:46:30Z", "mode": "eval", "global_step": 1250, "epoch": 0.06578601126256513, "eval_loss": NaN, "eval_runtime": 113.8564, "eval_samples_per_second": 0.913, "eval_steps_per_second": 0.114, "eval_num_tokens": 2221926.0, "eval_completions/mean_length": 97.08653846153847, "eval_completions/min_length": 31.46153846153846, "eval_completions/max_length": 261.15384615384613, "eval_completions/clipped_ratio": 0.028846153846153848, "eval_completions/mean_terminated_length": 84.32829724825345, "eval_completions/min_terminated_length": 31.46153846153846, "eval_completions/max_terminated_length": 170.76923076923077, "eval_rewards/meter/mean": 0.5966296516931974, "eval_rewards/meter/std": 0.3781478554010391, "eval_rewards/count_adherence/mean": 0.6978326898354751, "eval_rewards/count_adherence/std": 0.17388536379887506, "eval_rewards/arabic_clean/mean": 0.9230769230769231, "eval_rewards/arabic_clean/std": 0.1800025884921734, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9985576913906977, "eval_rewards/arabic_floor/std": 0.004079461670838869, "eval_rewards/count_floor/mean": 0.909349799156189, "eval_rewards/count_floor/std": 0.052165612005270444, "eval_rewards/lexical_plausibility/mean": 0.9841088423362145, "eval_rewards/lexical_plausibility/std": 0.04021226242184639, "eval_rewards/judge_quality/mean": 0.4044230649104485, "eval_rewards/judge_quality/std": 0.14548370414055312, "eval_rewards/repeat_penalty/mean": 0.8389853605857263, "eval_rewards/repeat_penalty/std": 0.1801053428879151, "eval_rewards/repeat_floor/mean": 0.9808639471347516, "eval_rewards/repeat_floor/std": 0.02278821413906721, "eval_rewards/near_duplicate_penalty/mean": 0.9447789742396429, "eval_rewards/near_duplicate_penalty/std": 0.05819114068379769, "eval_rewards/opening_diversity/mean": 0.9653127101751474, "eval_rewards/opening_diversity/std": 0.093134797966251, "eval_rewards/distinct_2/mean": 0.9025370341080886, "eval_rewards/distinct_2/std": 0.12902091615475142, "eval_rewards/total_composite/mean": 0.20754941839438218, "eval_rewards/total_composite/std": 0.15265308664395258, "eval_reward": 0.20754941839438218, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.07792179229167792, "eval_sampling/sampling_logp_difference/max": 1.0831471223097582, "eval_sampling/importance_sampling_ratio/min": 0.3470337184575888, "eval_sampling/importance_sampling_ratio/mean": 1.0167787350141084, "eval_sampling/importance_sampling_ratio/max": 1.570376992225647, "eval_entropy": 0.8809040509737455, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.20754941839438218, "eval_reward_meter_mean": 0.5966296516931974, "eval_reward_meter_std": 0.3781478554010391, "eval_reward_count_adherence_mean": 0.6978326898354751, "eval_reward_count_adherence_std": 0.17388536379887506, "eval_reward_arabic_clean_mean": 0.9230769230769231, "eval_reward_arabic_clean_std": 0.1800025884921734, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9985576913906977, "eval_reward_arabic_floor_std": 0.004079461670838869, "eval_reward_count_floor_mean": 0.909349799156189, "eval_reward_count_floor_std": 0.052165612005270444, "eval_reward_lexical_plausibility_mean": 0.9841088423362145, "eval_reward_lexical_plausibility_std": 0.04021226242184639, "eval_reward_repeat_penalty_mean": 0.8389853605857263, "eval_reward_repeat_penalty_std": 0.1801053428879151, "eval_reward_repeat_floor_mean": 0.9808639471347516, "eval_reward_repeat_floor_std": 0.02278821413906721, "eval_reward_near_duplicate_penalty_mean": 0.9447789742396429, "eval_reward_near_duplicate_penalty_std": 0.05819114068379769, "eval_reward_opening_diversity_mean": 0.9653127101751474, "eval_reward_opening_diversity_std": 0.093134797966251, "eval_reward_distinct_2_mean": 0.9025370341080886, "eval_reward_distinct_2_std": 0.12902091615475142, "eval_reward_judge_quality_mean": 0.4044230649104485, "eval_reward_judge_quality_std": 0.14548370414055312, "eval_reward_total_composite_mean": 0.20754941839438218, "eval_reward_total_composite_std": 0.15265308664395258} {"timestamp_utc": "2026-04-12T20:46:44Z", "mode": "train", "global_step": 1251, "epoch": 0.06583864007157518, "loss": 0.034, "grad_norm": 13.278849601745605, "learning_rate": 6.212121212121213e-06, "num_tokens": 2223525.0, "completions/mean_length": 44.875, "completions/min_length": 39.0, "completions/max_length": 52.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.875, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.7909760475158691, "rewards/meter/std": 0.3239612877368927, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9940759539604187, "rewards/lexical_plausibility/std": 0.016755690798163414, "rewards/judge_quality/mean": 0.5212500095367432, "rewards/judge_quality/std": 0.20364098250865936, "rewards/repeat_penalty/mean": 0.99138343334198, "rewards/repeat_penalty/std": 0.019528528675436974, "rewards/repeat_floor/mean": 0.9987075328826904, "rewards/repeat_floor/std": 0.00292928796261549, "rewards/near_duplicate_penalty/mean": 0.99138343334198, "rewards/near_duplicate_penalty/std": 0.019528528675436974, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.42991146445274353, "rewards/total_composite/std": 0.26296699047088623, "reward": 0.42991146445274353, "reward_std": 0.26296699047088623, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19633692502975464, "sampling/sampling_logp_difference/max": 3.283474922180176, "sampling/importance_sampling_ratio/min": 0.03749772906303406, "sampling/importance_sampling_ratio/mean": 1.0168532133102417, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.360746517777443, "clip_ratio/low_mean": 0.0833424273878336, "clip_ratio/low_min": 0.0833424273878336, "clip_ratio/high_mean": 0.08187267184257507, "clip_ratio/high_max": 0.08187267184257507, "clip_ratio/region_mean": 0.16521509923040867, "reward_total_mean": 0.42991146445274353, "reward_meter_mean": 0.7909760475158691, "reward_meter_std": 0.3239612877368927, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9940759539604187, "reward_lexical_plausibility_std": 0.016755690798163414, "reward_repeat_penalty_mean": 0.99138343334198, "reward_repeat_penalty_std": 0.019528528675436974, "reward_repeat_floor_mean": 0.9987075328826904, "reward_repeat_floor_std": 0.00292928796261549, "reward_near_duplicate_penalty_mean": 0.99138343334198, "reward_near_duplicate_penalty_std": 0.019528528675436974, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5212500095367432, "reward_judge_quality_std": 0.20364098250865936, "reward_total_composite_mean": 0.42991146445274353, "reward_total_composite_std": 0.26296699047088623} {"timestamp_utc": "2026-04-12T20:47:02Z", "mode": "train", "global_step": 1252, "epoch": 0.06589126888058523, "loss": -0.0322, "grad_norm": 5.458512783050537, "learning_rate": 6.209090909090909e-06, "num_tokens": 2225286.0, "completions/mean_length": 106.125, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 48.142860412597656, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.6572843194007874, "rewards/meter/std": 0.39681798219680786, "rewards/count_adherence/mean": 0.6000000238418579, "rewards/count_adherence/std": 0.10690449923276901, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8799999952316284, "rewards/count_floor/std": 0.03207135200500488, "rewards/lexical_plausibility/mean": 0.9629882574081421, "rewards/lexical_plausibility/std": 0.10468495637178421, "rewards/judge_quality/mean": 0.2749999761581421, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.7683491110801697, "rewards/repeat_penalty/std": 0.22019585967063904, "rewards/repeat_floor/mean": 0.975979208946228, "rewards/repeat_floor/std": 0.024363616481423378, "rewards/near_duplicate_penalty/mean": 0.9293384552001953, "rewards/near_duplicate_penalty/std": 0.06565709412097931, "rewards/opening_diversity/mean": 0.9116071462631226, "rewards/opening_diversity/std": 0.1401757299900055, "rewards/distinct_2/mean": 0.9098001718521118, "rewards/distinct_2/std": 0.08037779480218887, "rewards/total_composite/mean": 0.13883529603481293, "rewards/total_composite/std": 0.11671510338783264, "reward": 0.13883529603481293, "reward_std": 0.11671510338783264, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16912361979484558, "sampling/sampling_logp_difference/max": 2.014023780822754, "sampling/importance_sampling_ratio/min": 0.13345061242580414, "sampling/importance_sampling_ratio/mean": 0.9999454617500305, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7984330877661705, "clip_ratio/low_mean": 0.061143194790929556, "clip_ratio/low_min": 0.061143194790929556, "clip_ratio/high_mean": 0.06245866417884827, "clip_ratio/high_max": 0.06245866417884827, "clip_ratio/region_mean": 0.12360185896977782, "reward_total_mean": 0.13883529603481293, "reward_meter_mean": 0.6572843194007874, "reward_meter_std": 0.39681798219680786, "reward_count_adherence_mean": 0.6000000238418579, "reward_count_adherence_std": 0.10690449923276901, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8799999952316284, "reward_count_floor_std": 0.03207135200500488, "reward_lexical_plausibility_mean": 0.9629882574081421, "reward_lexical_plausibility_std": 0.10468495637178421, "reward_repeat_penalty_mean": 0.7683491110801697, "reward_repeat_penalty_std": 0.22019585967063904, "reward_repeat_floor_mean": 0.975979208946228, "reward_repeat_floor_std": 0.024363616481423378, "reward_near_duplicate_penalty_mean": 0.9293384552001953, "reward_near_duplicate_penalty_std": 0.06565709412097931, "reward_opening_diversity_mean": 0.9116071462631226, "reward_opening_diversity_std": 0.1401757299900055, "reward_distinct_2_mean": 0.9098001718521118, "reward_distinct_2_std": 0.08037779480218887, "reward_judge_quality_mean": 0.2749999761581421, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.13883529603481293, "reward_total_composite_std": 0.11671510338783264} {"timestamp_utc": "2026-04-12T20:47:17Z", "mode": "train", "global_step": 1253, "epoch": 0.06594389768959528, "loss": -0.109, "grad_norm": 4.875716686248779, "learning_rate": 6.206060606060606e-06, "num_tokens": 2227751.0, "completions/mean_length": 160.125, "completions/min_length": 93.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 109.85714721679688, "completions/min_terminated_length": 93.0, "completions/max_terminated_length": 127.0, "rewards/meter/mean": 0.6825902462005615, "rewards/meter/std": 0.26857298612594604, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.046290989965200424, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.887499988079071, "rewards/count_floor/std": 0.01388731598854065, "rewards/lexical_plausibility/mean": 0.9683085083961487, "rewards/lexical_plausibility/std": 0.08963703364133835, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.7191486954689026, "rewards/repeat_penalty/std": 0.1966438591480255, "rewards/repeat_floor/mean": 0.968305230140686, "rewards/repeat_floor/std": 0.02208957076072693, "rewards/near_duplicate_penalty/mean": 0.9228141903877258, "rewards/near_duplicate_penalty/std": 0.04181179031729698, "rewards/opening_diversity/mean": 0.9714972972869873, "rewards/opening_diversity/std": 0.06735674291849136, "rewards/distinct_2/mean": 0.7954806089401245, "rewards/distinct_2/std": 0.15416808426380157, "rewards/total_composite/mean": 0.19127149879932404, "rewards/total_composite/std": 0.11537996679544449, "reward": 0.19127149879932404, "reward_std": 0.11537995934486389, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14006738364696503, "sampling/sampling_logp_difference/max": 2.62046480178833, "sampling/importance_sampling_ratio/min": 0.07276903092861176, "sampling/importance_sampling_ratio/mean": 1.012315273284912, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7036051526665688, "clip_ratio/low_mean": 0.026867925189435482, "clip_ratio/low_min": 0.026867925189435482, "clip_ratio/high_mean": 0.10295883566141129, "clip_ratio/high_max": 0.10295883566141129, "clip_ratio/region_mean": 0.12982676085084677, "reward_total_mean": 0.19127149879932404, "reward_meter_mean": 0.6825902462005615, "reward_meter_std": 0.26857298612594604, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.046290989965200424, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.887499988079071, "reward_count_floor_std": 0.01388731598854065, "reward_lexical_plausibility_mean": 0.9683085083961487, "reward_lexical_plausibility_std": 0.08963703364133835, "reward_repeat_penalty_mean": 0.7191486954689026, "reward_repeat_penalty_std": 0.1966438591480255, "reward_repeat_floor_mean": 0.968305230140686, "reward_repeat_floor_std": 0.02208957076072693, "reward_near_duplicate_penalty_mean": 0.9228141903877258, "reward_near_duplicate_penalty_std": 0.04181179031729698, "reward_opening_diversity_mean": 0.9714972972869873, "reward_opening_diversity_std": 0.06735674291849136, "reward_distinct_2_mean": 0.7954806089401245, "reward_distinct_2_std": 0.15416808426380157, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.19127149879932404, "reward_total_composite_std": 0.11537996679544449} {"timestamp_utc": "2026-04-12T20:47:26Z", "mode": "train", "global_step": 1254, "epoch": 0.06599652649860534, "loss": -0.0029, "grad_norm": 17.301715850830078, "learning_rate": 6.203030303030304e-06, "num_tokens": 2229346.0, "completions/mean_length": 34.375, "completions/min_length": 29.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.375, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.6378952860832214, "rewards/meter/std": 0.48884040117263794, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.20310096442699432, "rewards/repeat_penalty/mean": 0.9229481220245361, "rewards/repeat_penalty/std": 0.12945304811000824, "rewards/repeat_floor/mean": 0.98879075050354, "rewards/repeat_floor/std": 0.018455978482961655, "rewards/near_duplicate_penalty/mean": 0.9368101358413696, "rewards/near_duplicate_penalty/std": 0.09152856469154358, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.2965428829193115, "rewards/total_composite/std": 0.25965338945388794, "reward": 0.2965428829193115, "reward_std": 0.25965335965156555, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16391807794570923, "sampling/sampling_logp_difference/max": 1.4643560647964478, "sampling/importance_sampling_ratio/min": 0.2312268316745758, "sampling/importance_sampling_ratio/mean": 1.0039533376693726, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8995163664221764, "clip_ratio/low_mean": 0.04930837359279394, "clip_ratio/low_min": 0.04930837359279394, "clip_ratio/high_mean": 0.1144637931138277, "clip_ratio/high_max": 0.1144637931138277, "clip_ratio/region_mean": 0.16377216670662165, "reward_total_mean": 0.2965428829193115, "reward_meter_mean": 0.6378952860832214, "reward_meter_std": 0.48884040117263794, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9229481220245361, "reward_repeat_penalty_std": 0.12945304811000824, "reward_repeat_floor_mean": 0.98879075050354, "reward_repeat_floor_std": 0.018455978482961655, "reward_near_duplicate_penalty_mean": 0.9368101358413696, "reward_near_duplicate_penalty_std": 0.09152856469154358, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.20310096442699432, "reward_total_composite_mean": 0.2965428829193115, "reward_total_composite_std": 0.25965338945388794} {"timestamp_utc": "2026-04-12T20:47:39Z", "mode": "train", "global_step": 1255, "epoch": 0.06604915530761539, "loss": -0.0326, "grad_norm": 4.500360012054443, "learning_rate": 6.200000000000001e-06, "num_tokens": 2230788.0, "completions/mean_length": 81.25, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 19.71428680419922, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.7399331331253052, "rewards/meter/std": 0.35489702224731445, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8943848609924316, "rewards/lexical_plausibility/std": 0.17779874801635742, "rewards/judge_quality/mean": 0.4712500274181366, "rewards/judge_quality/std": 0.40484344959259033, "rewards/repeat_penalty/mean": 0.716228723526001, "rewards/repeat_penalty/std": 0.09551949054002762, "rewards/repeat_floor/mean": 0.9786228537559509, "rewards/repeat_floor/std": 0.01803729124367237, "rewards/near_duplicate_penalty/mean": 0.9679751992225647, "rewards/near_duplicate_penalty/std": 0.0905797928571701, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.41331934928894043, "rewards/total_composite/std": 0.38725849986076355, "reward": 0.41331934928894043, "reward_std": 0.38725847005844116, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17487557232379913, "sampling/sampling_logp_difference/max": 2.0627710819244385, "sampling/importance_sampling_ratio/min": 0.25391247868537903, "sampling/importance_sampling_ratio/mean": 1.0444165468215942, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1215150207281113, "clip_ratio/low_mean": 0.049753288738429546, "clip_ratio/low_min": 0.049753288738429546, "clip_ratio/high_mean": 0.09697420801967382, "clip_ratio/high_max": 0.09697420801967382, "clip_ratio/region_mean": 0.14672749675810337, "reward_total_mean": 0.41331934928894043, "reward_meter_mean": 0.7399331331253052, "reward_meter_std": 0.35489702224731445, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8943848609924316, "reward_lexical_plausibility_std": 0.17779874801635742, "reward_repeat_penalty_mean": 0.716228723526001, "reward_repeat_penalty_std": 0.09551949054002762, "reward_repeat_floor_mean": 0.9786228537559509, "reward_repeat_floor_std": 0.01803729124367237, "reward_near_duplicate_penalty_mean": 0.9679751992225647, "reward_near_duplicate_penalty_std": 0.0905797928571701, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.4712500274181366, "reward_judge_quality_std": 0.40484344959259033, "reward_total_composite_mean": 0.41331934928894043, "reward_total_composite_std": 0.38725849986076355} {"timestamp_utc": "2026-04-12T20:47:49Z", "mode": "train", "global_step": 1256, "epoch": 0.06610178411662544, "loss": 0.0226, "grad_norm": 16.340438842773438, "learning_rate": 6.196969696969698e-06, "num_tokens": 2232139.0, "completions/mean_length": 18.875, "completions/min_length": 18.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.875, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.9844534397125244, "rewards/meter/std": 0.009304544888436794, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9360517263412476, "rewards/lexical_plausibility/std": 0.12239138036966324, "rewards/judge_quality/mean": 0.706250011920929, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.7193916440010071, "rewards/repeat_penalty/std": 0.08657350391149521, "rewards/repeat_floor/mean": 0.979559063911438, "rewards/repeat_floor/std": 0.015389395877718925, "rewards/near_duplicate_penalty/mean": 0.976547360420227, "rewards/near_duplicate_penalty/std": 0.06633399426937103, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.6836011409759521, "rewards/total_composite/std": 0.3004305064678192, "reward": 0.6836011409759521, "reward_std": 0.3004305064678192, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1253630816936493, "sampling/sampling_logp_difference/max": 1.2026491165161133, "sampling/importance_sampling_ratio/min": 0.3003973662853241, "sampling/importance_sampling_ratio/mean": 0.9946272969245911, "sampling/importance_sampling_ratio/max": 1.794089913368225, "entropy": 0.7536482810974121, "clip_ratio/low_mean": 0.03289473615586758, "clip_ratio/low_min": 0.03289473615586758, "clip_ratio/high_mean": 0.09863199945539236, "clip_ratio/high_max": 0.09863199945539236, "clip_ratio/region_mean": 0.13152673561125994, "reward_total_mean": 0.6836011409759521, "reward_meter_mean": 0.9844534397125244, "reward_meter_std": 0.009304544888436794, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9360517263412476, "reward_lexical_plausibility_std": 0.12239138036966324, "reward_repeat_penalty_mean": 0.7193916440010071, "reward_repeat_penalty_std": 0.08657350391149521, "reward_repeat_floor_mean": 0.979559063911438, "reward_repeat_floor_std": 0.015389395877718925, "reward_near_duplicate_penalty_mean": 0.976547360420227, "reward_near_duplicate_penalty_std": 0.06633399426937103, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.706250011920929, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.6836011409759521, "reward_total_composite_std": 0.3004305064678192} {"timestamp_utc": "2026-04-12T20:48:03Z", "mode": "train", "global_step": 1257, "epoch": 0.0661544129256355, "loss": -0.0412, "grad_norm": 4.738894939422607, "learning_rate": 6.1939393939393944e-06, "num_tokens": 2233588.0, "completions/mean_length": 91.125, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 31.000001907348633, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.48015978932380676, "rewards/meter/std": 0.3897162675857544, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9451248645782471, "rewards/lexical_plausibility/std": 0.15521031618118286, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9197390079498291, "rewards/repeat_penalty/std": 0.10586664080619812, "rewards/repeat_floor/mean": 0.9886679649353027, "rewards/repeat_floor/std": 0.014973809011280537, "rewards/near_duplicate_penalty/mean": 0.9365989565849304, "rewards/near_duplicate_penalty/std": 0.08111708611249924, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9797570705413818, "rewards/distinct_2/std": 0.03748259320855141, "rewards/total_composite/mean": 0.15227575600147247, "rewards/total_composite/std": 0.12180215120315552, "reward": 0.15227575600147247, "reward_std": 0.12180214375257492, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15141573548316956, "sampling/sampling_logp_difference/max": 1.4547791481018066, "sampling/importance_sampling_ratio/min": 0.23345191776752472, "sampling/importance_sampling_ratio/mean": 1.0041520595550537, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.003646194934845, "clip_ratio/low_mean": 0.07050189469009638, "clip_ratio/low_min": 0.07050189469009638, "clip_ratio/high_mean": 0.024245689623057842, "clip_ratio/high_max": 0.024245689623057842, "clip_ratio/region_mean": 0.09474758431315422, "reward_total_mean": 0.15227575600147247, "reward_meter_mean": 0.48015978932380676, "reward_meter_std": 0.3897162675857544, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9451248645782471, "reward_lexical_plausibility_std": 0.15521031618118286, "reward_repeat_penalty_mean": 0.9197390079498291, "reward_repeat_penalty_std": 0.10586664080619812, "reward_repeat_floor_mean": 0.9886679649353027, "reward_repeat_floor_std": 0.014973809011280537, "reward_near_duplicate_penalty_mean": 0.9365989565849304, "reward_near_duplicate_penalty_std": 0.08111708611249924, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9797570705413818, "reward_distinct_2_std": 0.03748259320855141, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.15227575600147247, "reward_total_composite_std": 0.12180215120315552} {"timestamp_utc": "2026-04-12T20:48:13Z", "mode": "train", "global_step": 1258, "epoch": 0.06620704173464555, "loss": 0.0921, "grad_norm": 13.316137313842773, "learning_rate": 6.190909090909092e-06, "num_tokens": 2235700.0, "completions/mean_length": 81.0, "completions/min_length": 67.0, "completions/max_length": 102.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 81.0, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.685248613357544, "rewards/meter/std": 0.30939343571662903, "rewards/count_adherence/mean": 0.6750000715255737, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9024999737739563, "rewards/count_floor/std": 0.031052952632308006, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9204732775688171, "rewards/repeat_penalty/std": 0.037678152322769165, "rewards/repeat_floor/mean": 0.9904094934463501, "rewards/repeat_floor/std": 0.0037440124433487654, "rewards/near_duplicate_penalty/mean": 0.9617751836776733, "rewards/near_duplicate_penalty/std": 0.013675026595592499, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9571467638015747, "rewards/distinct_2/std": 0.03926120698451996, "rewards/total_composite/mean": 0.2565568685531616, "rewards/total_composite/std": 0.11464803665876389, "reward": 0.2565568685531616, "reward_std": 0.11464803665876389, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14566437900066376, "sampling/sampling_logp_difference/max": 2.5363893508911133, "sampling/importance_sampling_ratio/min": 0.07915167510509491, "sampling/importance_sampling_ratio/mean": 1.0065324306488037, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8205195590853691, "clip_ratio/low_mean": 0.049017183016985655, "clip_ratio/low_min": 0.049017183016985655, "clip_ratio/high_mean": 0.06952247768640518, "clip_ratio/high_max": 0.06952247768640518, "clip_ratio/region_mean": 0.11853966070339084, "reward_total_mean": 0.2565568685531616, "reward_meter_mean": 0.685248613357544, "reward_meter_std": 0.30939343571662903, "reward_count_adherence_mean": 0.6750000715255737, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9024999737739563, "reward_count_floor_std": 0.031052952632308006, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9204732775688171, "reward_repeat_penalty_std": 0.037678152322769165, "reward_repeat_floor_mean": 0.9904094934463501, "reward_repeat_floor_std": 0.0037440124433487654, "reward_near_duplicate_penalty_mean": 0.9617751836776733, "reward_near_duplicate_penalty_std": 0.013675026595592499, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9571467638015747, "reward_distinct_2_std": 0.03926120698451996, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.2565568685531616, "reward_total_composite_std": 0.11464803665876389} {"timestamp_utc": "2026-04-12T20:48:24Z", "mode": "train", "global_step": 1259, "epoch": 0.0662596705436556, "loss": 0.0388, "grad_norm": 16.644067764282227, "learning_rate": 6.187878787878788e-06, "num_tokens": 2237502.0, "completions/mean_length": 47.25, "completions/min_length": 41.0, "completions/max_length": 58.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.25, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.4338234066963196, "rewards/meter/std": 0.3957770764827728, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9787946343421936, "rewards/lexical_plausibility/std": 0.04103745147585869, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9020435810089111, "rewards/repeat_penalty/std": 0.18300504982471466, "rewards/repeat_floor/mean": 0.9880900979042053, "rewards/repeat_floor/std": 0.02130706235766411, "rewards/near_duplicate_penalty/mean": 0.9589366912841797, "rewards/near_duplicate_penalty/std": 0.0589282251894474, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9569398164749146, "rewards/distinct_2/std": 0.09462050348520279, "rewards/total_composite/mean": 0.19060809910297394, "rewards/total_composite/std": 0.18203598260879517, "reward": 0.19060809910297394, "reward_std": 0.18203599750995636, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1600101739168167, "sampling/sampling_logp_difference/max": 2.0403048992156982, "sampling/importance_sampling_ratio/min": 0.12998907268047333, "sampling/importance_sampling_ratio/mean": 1.0351078510284424, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4189226180315018, "clip_ratio/low_mean": 0.045179912354797125, "clip_ratio/low_min": 0.045179912354797125, "clip_ratio/high_mean": 0.0699779293499887, "clip_ratio/high_max": 0.0699779293499887, "clip_ratio/region_mean": 0.11515784170478582, "reward_total_mean": 0.19060809910297394, "reward_meter_mean": 0.4338234066963196, "reward_meter_std": 0.3957770764827728, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9787946343421936, "reward_lexical_plausibility_std": 0.04103745147585869, "reward_repeat_penalty_mean": 0.9020435810089111, "reward_repeat_penalty_std": 0.18300504982471466, "reward_repeat_floor_mean": 0.9880900979042053, "reward_repeat_floor_std": 0.02130706235766411, "reward_near_duplicate_penalty_mean": 0.9589366912841797, "reward_near_duplicate_penalty_std": 0.0589282251894474, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9569398164749146, "reward_distinct_2_std": 0.09462050348520279, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.19060809910297394, "reward_total_composite_std": 0.18203598260879517} {"timestamp_utc": "2026-04-12T20:48:36Z", "mode": "train", "global_step": 1260, "epoch": 0.06631229935266565, "loss": 0.0373, "grad_norm": 51.46892547607422, "learning_rate": 6.184848484848485e-06, "num_tokens": 2239677.0, "completions/mean_length": 71.875, "completions/min_length": 64.0, "completions/max_length": 81.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 71.875, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 81.0, "rewards/meter/mean": 0.683354914188385, "rewards/meter/std": 0.3178428113460541, "rewards/count_adherence/mean": 0.6428571939468384, "rewards/count_adherence/std": 0.07636035233736038, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8928571343421936, "rewards/count_floor/std": 0.022908121347427368, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.8680921792984009, "rewards/repeat_penalty/std": 0.1462443768978119, "rewards/repeat_floor/mean": 0.9849512577056885, "rewards/repeat_floor/std": 0.015877826139330864, "rewards/near_duplicate_penalty/mean": 0.9536528587341309, "rewards/near_duplicate_penalty/std": 0.03723161295056343, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9308700561523438, "rewards/distinct_2/std": 0.0646088495850563, "rewards/total_composite/mean": 0.2129134237766266, "rewards/total_composite/std": 0.1447014957666397, "reward": 0.2129134237766266, "reward_std": 0.1447015106678009, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1904776692390442, "sampling/sampling_logp_difference/max": 3.6638755798339844, "sampling/importance_sampling_ratio/min": 0.02563297748565674, "sampling/importance_sampling_ratio/mean": 1.0279250144958496, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2319042310118675, "clip_ratio/low_mean": 0.10676970705389977, "clip_ratio/low_min": 0.10676970705389977, "clip_ratio/high_mean": 0.06631868332624435, "clip_ratio/high_max": 0.06631868332624435, "clip_ratio/region_mean": 0.17308839038014412, "reward_total_mean": 0.2129134237766266, "reward_meter_mean": 0.683354914188385, "reward_meter_std": 0.3178428113460541, "reward_count_adherence_mean": 0.6428571939468384, "reward_count_adherence_std": 0.07636035233736038, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8928571343421936, "reward_count_floor_std": 0.022908121347427368, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8680921792984009, "reward_repeat_penalty_std": 0.1462443768978119, "reward_repeat_floor_mean": 0.9849512577056885, "reward_repeat_floor_std": 0.015877826139330864, "reward_near_duplicate_penalty_mean": 0.9536528587341309, "reward_near_duplicate_penalty_std": 0.03723161295056343, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9308700561523438, "reward_distinct_2_std": 0.0646088495850563, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.2129134237766266, "reward_total_composite_std": 0.1447014957666397} {"timestamp_utc": "2026-04-12T20:48:46Z", "mode": "train", "global_step": 1261, "epoch": 0.0663649281616757, "loss": 0.0451, "grad_norm": 23.265932083129883, "learning_rate": 6.181818181818182e-06, "num_tokens": 2241033.0, "completions/mean_length": 17.5, "completions/min_length": 15.0, "completions/max_length": 19.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.5, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 19.0, "rewards/meter/mean": 0.7343837022781372, "rewards/meter/std": 0.36674001812934875, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9420955777168274, "rewards/lexical_plausibility/std": 0.11673673987388611, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.7020621299743652, "rewards/repeat_penalty/std": 0.09208667278289795, "rewards/repeat_floor/mean": 0.9754124283790588, "rewards/repeat_floor/std": 0.018417349085211754, "rewards/near_duplicate_penalty/mean": 0.9360828399658203, "rewards/near_duplicate_penalty/std": 0.12278221547603607, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16880950331687927, "rewards/total_composite/std": 0.09944184869527817, "reward": 0.16880950331687927, "reward_std": 0.09944184869527817, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14555129408836365, "sampling/sampling_logp_difference/max": 1.1002131700515747, "sampling/importance_sampling_ratio/min": 0.33280012011528015, "sampling/importance_sampling_ratio/mean": 1.0176080465316772, "sampling/importance_sampling_ratio/max": 1.652567744255066, "entropy": 1.1419166252017021, "clip_ratio/low_mean": 0.054502063896507025, "clip_ratio/low_min": 0.054502063896507025, "clip_ratio/high_mean": 0.0564236119389534, "clip_ratio/high_max": 0.0564236119389534, "clip_ratio/region_mean": 0.11092567583546042, "reward_total_mean": 0.16880950331687927, "reward_meter_mean": 0.7343837022781372, "reward_meter_std": 0.36674001812934875, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9420955777168274, "reward_lexical_plausibility_std": 0.11673673987388611, "reward_repeat_penalty_mean": 0.7020621299743652, "reward_repeat_penalty_std": 0.09208667278289795, "reward_repeat_floor_mean": 0.9754124283790588, "reward_repeat_floor_std": 0.018417349085211754, "reward_near_duplicate_penalty_mean": 0.9360828399658203, "reward_near_duplicate_penalty_std": 0.12278221547603607, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.16880950331687927, "reward_total_composite_std": 0.09944184869527817} {"timestamp_utc": "2026-04-12T20:48:58Z", "mode": "train", "global_step": 1262, "epoch": 0.06641755697068576, "loss": 0.0699, "grad_norm": 24.21959114074707, "learning_rate": 6.17878787878788e-06, "num_tokens": 2242677.0, "completions/mean_length": 38.5, "completions/min_length": 35.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.5, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.5172942876815796, "rewards/meter/std": 0.35494574904441833, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9384489059448242, "rewards/repeat_penalty/std": 0.06010139361023903, "rewards/repeat_floor/mean": 0.9916393756866455, "rewards/repeat_floor/std": 0.0077572292648255825, "rewards/near_duplicate_penalty/mean": 0.9550015926361084, "rewards/near_duplicate_penalty/std": 0.03920619562268257, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9821012020111084, "rewards/distinct_2/std": 0.03315402567386627, "rewards/total_composite/mean": 0.1482156366109848, "rewards/total_composite/std": 0.09594321250915527, "reward": 0.1482156366109848, "reward_std": 0.09594321250915527, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17619386315345764, "sampling/sampling_logp_difference/max": 2.140575408935547, "sampling/importance_sampling_ratio/min": 0.11758716404438019, "sampling/importance_sampling_ratio/mean": 1.006761074066162, "sampling/importance_sampling_ratio/max": 1.964910864830017, "entropy": 1.307152271270752, "clip_ratio/low_mean": 0.10503984801471233, "clip_ratio/low_min": 0.10503984801471233, "clip_ratio/high_mean": 0.07996433600783348, "clip_ratio/high_max": 0.07996433600783348, "clip_ratio/region_mean": 0.18500418402254581, "reward_total_mean": 0.1482156366109848, "reward_meter_mean": 0.5172942876815796, "reward_meter_std": 0.35494574904441833, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9384489059448242, "reward_repeat_penalty_std": 0.06010139361023903, "reward_repeat_floor_mean": 0.9916393756866455, "reward_repeat_floor_std": 0.0077572292648255825, "reward_near_duplicate_penalty_mean": 0.9550015926361084, "reward_near_duplicate_penalty_std": 0.03920619562268257, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9821012020111084, "reward_distinct_2_std": 0.03315402567386627, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.1482156366109848, "reward_total_composite_std": 0.09594321250915527} {"timestamp_utc": "2026-04-12T20:49:08Z", "mode": "train", "global_step": 1263, "epoch": 0.06647018577969581, "loss": 0.057, "grad_norm": 16.291786193847656, "learning_rate": 6.175757575757576e-06, "num_tokens": 2244506.0, "completions/mean_length": 54.625, "completions/min_length": 38.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 54.625, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.9612852334976196, "rewards/meter/std": 0.06804504990577698, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175493285059929, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.8350206017494202, "rewards/repeat_penalty/std": 0.10663489997386932, "rewards/repeat_floor/mean": 0.9820359349250793, "rewards/repeat_floor/std": 0.010365995578467846, "rewards/near_duplicate_penalty/mean": 0.9458608627319336, "rewards/near_duplicate_penalty/std": 0.03843100741505623, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9114644527435303, "rewards/distinct_2/std": 0.06882385909557343, "rewards/total_composite/mean": 0.36352118849754333, "rewards/total_composite/std": 0.05873783677816391, "reward": 0.36352118849754333, "reward_std": 0.05873784050345421, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16212032735347748, "sampling/sampling_logp_difference/max": 1.8741812705993652, "sampling/importance_sampling_ratio/min": 0.15348057448863983, "sampling/importance_sampling_ratio/mean": 1.0290857553482056, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0166698470711708, "clip_ratio/low_mean": 0.08290879055857658, "clip_ratio/low_min": 0.08290879055857658, "clip_ratio/high_mean": 0.062196952290832996, "clip_ratio/high_max": 0.062196952290832996, "clip_ratio/region_mean": 0.14510574284940958, "reward_total_mean": 0.36352118849754333, "reward_meter_mean": 0.9612852334976196, "reward_meter_std": 0.06804504990577698, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175493285059929, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8350206017494202, "reward_repeat_penalty_std": 0.10663489997386932, "reward_repeat_floor_mean": 0.9820359349250793, "reward_repeat_floor_std": 0.010365995578467846, "reward_near_duplicate_penalty_mean": 0.9458608627319336, "reward_near_duplicate_penalty_std": 0.03843100741505623, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9114644527435303, "reward_distinct_2_std": 0.06882385909557343, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.36352118849754333, "reward_total_composite_std": 0.05873783677816391} {"timestamp_utc": "2026-04-12T20:49:19Z", "mode": "train", "global_step": 1264, "epoch": 0.06652281458870586, "loss": 0.0202, "grad_norm": 15.28254508972168, "learning_rate": 6.1727272727272735e-06, "num_tokens": 2245840.0, "completions/mean_length": 22.75, "completions/min_length": 21.0, "completions/max_length": 26.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.75, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 26.0, "rewards/meter/mean": 0.6410651206970215, "rewards/meter/std": 0.3981606364250183, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9505208134651184, "rewards/lexical_plausibility/std": 0.07547593116760254, "rewards/judge_quality/mean": 0.7900000214576721, "rewards/judge_quality/std": 0.24219238758087158, "rewards/repeat_penalty/mean": 0.7227855920791626, "rewards/repeat_penalty/std": 0.0522967204451561, "rewards/repeat_floor/mean": 0.9795571565628052, "rewards/repeat_floor/std": 0.01045935321599245, "rewards/near_duplicate_penalty/mean": 0.9637141227722168, "rewards/near_duplicate_penalty/std": 0.06972895562648773, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4546905755996704, "rewards/total_composite/std": 0.3120134472846985, "reward": 0.4546905755996704, "reward_std": 0.3120134174823761, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12129475921392441, "sampling/sampling_logp_difference/max": 1.448277473449707, "sampling/importance_sampling_ratio/min": 0.2349746972322464, "sampling/importance_sampling_ratio/mean": 1.0157819986343384, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8585151359438896, "clip_ratio/low_mean": 0.05714122951030731, "clip_ratio/low_min": 0.05714122951030731, "clip_ratio/high_mean": 0.061264822259545326, "clip_ratio/high_max": 0.061264822259545326, "clip_ratio/region_mean": 0.11840605176985264, "reward_total_mean": 0.4546905755996704, "reward_meter_mean": 0.6410651206970215, "reward_meter_std": 0.3981606364250183, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9505208134651184, "reward_lexical_plausibility_std": 0.07547593116760254, "reward_repeat_penalty_mean": 0.7227855920791626, "reward_repeat_penalty_std": 0.0522967204451561, "reward_repeat_floor_mean": 0.9795571565628052, "reward_repeat_floor_std": 0.01045935321599245, "reward_near_duplicate_penalty_mean": 0.9637141227722168, "reward_near_duplicate_penalty_std": 0.06972895562648773, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7900000214576721, "reward_judge_quality_std": 0.24219238758087158, "reward_total_composite_mean": 0.4546905755996704, "reward_total_composite_std": 0.3120134472846985} {"timestamp_utc": "2026-04-12T20:49:31Z", "mode": "train", "global_step": 1265, "epoch": 0.06657544339771591, "loss": 0.018, "grad_norm": 18.336753845214844, "learning_rate": 6.16969696969697e-06, "num_tokens": 2247450.0, "completions/mean_length": 37.25, "completions/min_length": 34.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.25, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.7474797964096069, "rewards/meter/std": 0.32458820939064026, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.7601014375686646, "rewards/repeat_penalty/std": 0.20466993749141693, "rewards/repeat_floor/mean": 0.9752048850059509, "rewards/repeat_floor/std": 0.0214733574539423, "rewards/near_duplicate_penalty/mean": 0.9393946528434753, "rewards/near_duplicate_penalty/std": 0.04691839963197708, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9088411331176758, "rewards/distinct_2/std": 0.09400047361850739, "rewards/total_composite/mean": 0.316353976726532, "rewards/total_composite/std": 0.13710325956344604, "reward": 0.316353976726532, "reward_std": 0.13710327446460724, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14864195883274078, "sampling/sampling_logp_difference/max": 2.556056499481201, "sampling/importance_sampling_ratio/min": 0.07761019468307495, "sampling/importance_sampling_ratio/mean": 1.0261150598526, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0611946359276772, "clip_ratio/low_mean": 0.03016718663275242, "clip_ratio/low_min": 0.03016718663275242, "clip_ratio/high_mean": 0.08687753137201071, "clip_ratio/high_max": 0.08687753137201071, "clip_ratio/region_mean": 0.11704471800476313, "reward_total_mean": 0.316353976726532, "reward_meter_mean": 0.7474797964096069, "reward_meter_std": 0.32458820939064026, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.7601014375686646, "reward_repeat_penalty_std": 0.20466993749141693, "reward_repeat_floor_mean": 0.9752048850059509, "reward_repeat_floor_std": 0.0214733574539423, "reward_near_duplicate_penalty_mean": 0.9393946528434753, "reward_near_duplicate_penalty_std": 0.04691839963197708, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9088411331176758, "reward_distinct_2_std": 0.09400047361850739, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.316353976726532, "reward_total_composite_std": 0.13710325956344604} {"timestamp_utc": "2026-04-12T20:49:46Z", "mode": "train", "global_step": 1266, "epoch": 0.06662807220672597, "loss": -0.0092, "grad_norm": 13.861244201660156, "learning_rate": 6.166666666666667e-06, "num_tokens": 2249670.0, "completions/mean_length": 62.5, "completions/min_length": 55.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 62.5, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.6740539073944092, "rewards/meter/std": 0.2800249755382538, "rewards/count_adherence/mean": 0.6666666865348816, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8999999761581421, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.9260563850402832, "rewards/repeat_penalty/std": 0.052895672619342804, "rewards/repeat_floor/mean": 0.9907950162887573, "rewards/repeat_floor/std": 0.005818056873977184, "rewards/near_duplicate_penalty/mean": 0.9600675106048584, "rewards/near_duplicate_penalty/std": 0.020493807271122932, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9642767310142517, "rewards/distinct_2/std": 0.043864890933036804, "rewards/total_composite/mean": 0.22967740893363953, "rewards/total_composite/std": 0.10760796070098877, "reward": 0.22967740893363953, "reward_std": 0.10760795325040817, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16858060657978058, "sampling/sampling_logp_difference/max": 2.4223482608795166, "sampling/importance_sampling_ratio/min": 0.08871304988861084, "sampling/importance_sampling_ratio/mean": 1.0314624309539795, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.123613402247429, "clip_ratio/low_mean": 0.08123089745640755, "clip_ratio/low_min": 0.08123089745640755, "clip_ratio/high_mean": 0.080549038015306, "clip_ratio/high_max": 0.080549038015306, "clip_ratio/region_mean": 0.16177993547171354, "reward_total_mean": 0.22967740893363953, "reward_meter_mean": 0.6740539073944092, "reward_meter_std": 0.2800249755382538, "reward_count_adherence_mean": 0.6666666865348816, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8999999761581421, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9260563850402832, "reward_repeat_penalty_std": 0.052895672619342804, "reward_repeat_floor_mean": 0.9907950162887573, "reward_repeat_floor_std": 0.005818056873977184, "reward_near_duplicate_penalty_mean": 0.9600675106048584, "reward_near_duplicate_penalty_std": 0.020493807271122932, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9642767310142517, "reward_distinct_2_std": 0.043864890933036804, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.22967740893363953, "reward_total_composite_std": 0.10760796070098877} {"timestamp_utc": "2026-04-12T20:49:58Z", "mode": "train", "global_step": 1267, "epoch": 0.06668070101573602, "loss": -0.023, "grad_norm": 20.50056266784668, "learning_rate": 6.163636363636364e-06, "num_tokens": 2250984.0, "completions/mean_length": 21.25, "completions/min_length": 19.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.25, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.9926935434341431, "rewards/meter/std": 0.012431460432708263, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7100000381469727, "rewards/judge_quality/std": 0.3123185336589813, "rewards/repeat_penalty/mean": 0.7480332255363464, "rewards/repeat_penalty/std": 0.005562899634242058, "rewards/repeat_floor/mean": 0.9846066236495972, "rewards/repeat_floor/std": 0.0011125925229862332, "rewards/near_duplicate_penalty/mean": 0.9973776340484619, "rewards/near_duplicate_penalty/std": 0.007417213171720505, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.6952759027481079, "rewards/total_composite/std": 0.30866101384162903, "reward": 0.6952759027481079, "reward_std": 0.30866101384162903, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1120215505361557, "sampling/sampling_logp_difference/max": 0.973543643951416, "sampling/importance_sampling_ratio/min": 0.37774208188056946, "sampling/importance_sampling_ratio/mean": 1.0003728866577148, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7908177301287651, "clip_ratio/low_mean": 0.044407895766198635, "clip_ratio/low_min": 0.044407895766198635, "clip_ratio/high_mean": 0.05077757500112057, "clip_ratio/high_max": 0.05077757500112057, "clip_ratio/region_mean": 0.0951854707673192, "reward_total_mean": 0.6952759027481079, "reward_meter_mean": 0.9926935434341431, "reward_meter_std": 0.012431460432708263, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7480332255363464, "reward_repeat_penalty_std": 0.005562899634242058, "reward_repeat_floor_mean": 0.9846066236495972, "reward_repeat_floor_std": 0.0011125925229862332, "reward_near_duplicate_penalty_mean": 0.9973776340484619, "reward_near_duplicate_penalty_std": 0.007417213171720505, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7100000381469727, "reward_judge_quality_std": 0.3123185336589813, "reward_total_composite_mean": 0.6952759027481079, "reward_total_composite_std": 0.30866101384162903} {"timestamp_utc": "2026-04-12T20:50:07Z", "mode": "train", "global_step": 1268, "epoch": 0.06673332982474607, "loss": 0.0299, "grad_norm": 12.037437438964844, "learning_rate": 6.160606060606062e-06, "num_tokens": 2252548.0, "completions/mean_length": 46.5, "completions/min_length": 42.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.5, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.9866486191749573, "rewards/meter/std": 0.005395363084971905, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.8592847585678101, "rewards/repeat_penalty/std": 0.14945675432682037, "rewards/repeat_floor/mean": 0.9841450452804565, "rewards/repeat_floor/std": 0.015937577933073044, "rewards/near_duplicate_penalty/mean": 0.9527406096458435, "rewards/near_duplicate_penalty/std": 0.041233573108911514, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9234330654144287, "rewards/distinct_2/std": 0.07231061160564423, "rewards/total_composite/mean": 0.40093937516212463, "rewards/total_composite/std": 0.05397419258952141, "reward": 0.40093937516212463, "reward_std": 0.05397419631481171, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1417992264032364, "sampling/sampling_logp_difference/max": 1.3404064178466797, "sampling/importance_sampling_ratio/min": 0.2617392838001251, "sampling/importance_sampling_ratio/mean": 1.014907956123352, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1005871817469597, "clip_ratio/low_mean": 0.045286303386092186, "clip_ratio/low_min": 0.045286303386092186, "clip_ratio/high_mean": 0.09812999051064253, "clip_ratio/high_max": 0.09812999051064253, "clip_ratio/region_mean": 0.14341629389673471, "reward_total_mean": 0.40093937516212463, "reward_meter_mean": 0.9866486191749573, "reward_meter_std": 0.005395363084971905, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8592847585678101, "reward_repeat_penalty_std": 0.14945675432682037, "reward_repeat_floor_mean": 0.9841450452804565, "reward_repeat_floor_std": 0.015937577933073044, "reward_near_duplicate_penalty_mean": 0.9527406096458435, "reward_near_duplicate_penalty_std": 0.041233573108911514, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9234330654144287, "reward_distinct_2_std": 0.07231061160564423, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.40093937516212463, "reward_total_composite_std": 0.05397419258952141} {"timestamp_utc": "2026-04-12T20:50:15Z", "mode": "train", "global_step": 1269, "epoch": 0.06678595863375612, "loss": 0.0632, "grad_norm": 15.516514778137207, "learning_rate": 6.157575757575758e-06, "num_tokens": 2254052.0, "completions/mean_length": 32.0, "completions/min_length": 28.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.0, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.890855073928833, "rewards/meter/std": 0.15631577372550964, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5799999833106995, "rewards/judge_quality/std": 0.2919393479824066, "rewards/repeat_penalty/mean": 0.9839155673980713, "rewards/repeat_penalty/std": 0.01513652689754963, "rewards/repeat_floor/mean": 0.9975873231887817, "rewards/repeat_floor/std": 0.0022704889997839928, "rewards/near_duplicate_penalty/mean": 0.9839155673980713, "rewards/near_duplicate_penalty/std": 0.01513652689754963, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5272724628448486, "rewards/total_composite/std": 0.29654330015182495, "reward": 0.5272724628448486, "reward_std": 0.29654330015182495, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.132646843791008, "sampling/sampling_logp_difference/max": 2.2651548385620117, "sampling/importance_sampling_ratio/min": 0.10381396114826202, "sampling/importance_sampling_ratio/mean": 0.9975581169128418, "sampling/importance_sampling_ratio/max": 1.9516104459762573, "entropy": 0.5118381641805172, "clip_ratio/low_mean": 0.06889673369005322, "clip_ratio/low_min": 0.06889673369005322, "clip_ratio/high_mean": 0.04442902561277151, "clip_ratio/high_max": 0.04442902561277151, "clip_ratio/region_mean": 0.11332575930282474, "reward_total_mean": 0.5272724628448486, "reward_meter_mean": 0.890855073928833, "reward_meter_std": 0.15631577372550964, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9839155673980713, "reward_repeat_penalty_std": 0.01513652689754963, "reward_repeat_floor_mean": 0.9975873231887817, "reward_repeat_floor_std": 0.0022704889997839928, "reward_near_duplicate_penalty_mean": 0.9839155673980713, "reward_near_duplicate_penalty_std": 0.01513652689754963, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5799999833106995, "reward_judge_quality_std": 0.2919393479824066, "reward_total_composite_mean": 0.5272724628448486, "reward_total_composite_std": 0.29654330015182495} {"timestamp_utc": "2026-04-12T20:50:27Z", "mode": "train", "global_step": 1270, "epoch": 0.06683858744276618, "loss": 0.0658, "grad_norm": 19.7850399017334, "learning_rate": 6.154545454545455e-06, "num_tokens": 2255664.0, "completions/mean_length": 21.5, "completions/min_length": 19.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.5, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.7712091207504272, "rewards/meter/std": 0.4052234888076782, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.984375, "rewards/lexical_plausibility/std": 0.0289318785071373, "rewards/judge_quality/mean": 0.7350000143051147, "rewards/judge_quality/std": 0.36130717396736145, "rewards/repeat_penalty/mean": 0.7275916337966919, "rewards/repeat_penalty/std": 0.045595794916152954, "rewards/repeat_floor/mean": 0.9805183410644531, "rewards/repeat_floor/std": 0.00911917444318533, "rewards/near_duplicate_penalty/mean": 0.9701220989227295, "rewards/near_duplicate_penalty/std": 0.0607944019138813, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5143482089042664, "rewards/total_composite/std": 0.4180837571620941, "reward": 0.5143482089042664, "reward_std": 0.41808369755744934, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15848523378372192, "sampling/sampling_logp_difference/max": 1.434493064880371, "sampling/importance_sampling_ratio/min": 0.23823609948158264, "sampling/importance_sampling_ratio/mean": 0.9839390516281128, "sampling/importance_sampling_ratio/max": 1.670961856842041, "entropy": 1.060697577893734, "clip_ratio/low_mean": 0.05887050414457917, "clip_ratio/low_min": 0.05887050414457917, "clip_ratio/high_mean": 0.07446741918101907, "clip_ratio/high_max": 0.07446741918101907, "clip_ratio/region_mean": 0.13333792332559824, "reward_total_mean": 0.5143482089042664, "reward_meter_mean": 0.7712091207504272, "reward_meter_std": 0.4052234888076782, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.984375, "reward_lexical_plausibility_std": 0.0289318785071373, "reward_repeat_penalty_mean": 0.7275916337966919, "reward_repeat_penalty_std": 0.045595794916152954, "reward_repeat_floor_mean": 0.9805183410644531, "reward_repeat_floor_std": 0.00911917444318533, "reward_near_duplicate_penalty_mean": 0.9701220989227295, "reward_near_duplicate_penalty_std": 0.0607944019138813, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7350000143051147, "reward_judge_quality_std": 0.36130717396736145, "reward_total_composite_mean": 0.5143482089042664, "reward_total_composite_std": 0.4180837571620941} {"timestamp_utc": "2026-04-12T20:50:41Z", "mode": "train", "global_step": 1271, "epoch": 0.06689121625177623, "loss": -0.0548, "grad_norm": 4.0297932624816895, "learning_rate": 6.151515151515152e-06, "num_tokens": 2257160.0, "completions/mean_length": 97.0, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 37.71428680419922, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.7833063006401062, "rewards/meter/std": 0.38132694363594055, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9453494548797607, "rewards/lexical_plausibility/std": 0.15457506477832794, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.14880475401878357, "rewards/repeat_penalty/mean": 0.7664239406585693, "rewards/repeat_penalty/std": 0.23794934153556824, "rewards/repeat_floor/mean": 0.974159300327301, "rewards/repeat_floor/std": 0.023759540170431137, "rewards/near_duplicate_penalty/mean": 0.9218281507492065, "rewards/near_duplicate_penalty/std": 0.04649970680475235, "rewards/opening_diversity/mean": 0.890625, "rewards/opening_diversity/std": 0.2259652018547058, "rewards/distinct_2/mean": 0.9160839319229126, "rewards/distinct_2/std": 0.08180836588144302, "rewards/total_composite/mean": 0.268919438123703, "rewards/total_composite/std": 0.18038040399551392, "reward": 0.268919438123703, "reward_std": 0.18038038909435272, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1051422506570816, "sampling/sampling_logp_difference/max": 1.1019303798675537, "sampling/importance_sampling_ratio/min": 0.3322291374206543, "sampling/importance_sampling_ratio/mean": 1.0184539556503296, "sampling/importance_sampling_ratio/max": 1.8097755908966064, "entropy": 0.7051658853888512, "clip_ratio/low_mean": 0.025760134682059288, "clip_ratio/low_min": 0.025760134682059288, "clip_ratio/high_mean": 0.05704365251585841, "clip_ratio/high_max": 0.05704365251585841, "clip_ratio/region_mean": 0.0828037871979177, "reward_total_mean": 0.268919438123703, "reward_meter_mean": 0.7833063006401062, "reward_meter_std": 0.38132694363594055, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9453494548797607, "reward_lexical_plausibility_std": 0.15457506477832794, "reward_repeat_penalty_mean": 0.7664239406585693, "reward_repeat_penalty_std": 0.23794934153556824, "reward_repeat_floor_mean": 0.974159300327301, "reward_repeat_floor_std": 0.023759540170431137, "reward_near_duplicate_penalty_mean": 0.9218281507492065, "reward_near_duplicate_penalty_std": 0.04649970680475235, "reward_opening_diversity_mean": 0.890625, "reward_opening_diversity_std": 0.2259652018547058, "reward_distinct_2_mean": 0.9160839319229126, "reward_distinct_2_std": 0.08180836588144302, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.14880475401878357, "reward_total_composite_mean": 0.268919438123703, "reward_total_composite_std": 0.18038040399551392} {"timestamp_utc": "2026-04-12T20:50:58Z", "mode": "train", "global_step": 1272, "epoch": 0.06694384506078628, "loss": -0.185, "grad_norm": 1.8744791746139526, "learning_rate": 6.148484848484849e-06, "num_tokens": 2259287.0, "completions/mean_length": 197.875, "completions/min_length": 82.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 93.16667175292969, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.8875970840454102, "rewards/meter/std": 0.2766491770744324, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.07715168595314026, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.887499988079071, "rewards/count_floor/std": 0.023145480081439018, "rewards/lexical_plausibility/mean": 0.8949588537216187, "rewards/lexical_plausibility/std": 0.195562481880188, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.8824868202209473, "rewards/repeat_penalty/std": 0.13397713005542755, "rewards/repeat_floor/mean": 0.9877086877822876, "rewards/repeat_floor/std": 0.012082344852387905, "rewards/near_duplicate_penalty/mean": 0.9649714827537537, "rewards/near_duplicate_penalty/std": 0.01671692356467247, "rewards/opening_diversity/mean": 0.9609375, "rewards/opening_diversity/std": 0.08799287676811218, "rewards/distinct_2/mean": 0.9478525519371033, "rewards/distinct_2/std": 0.074729323387146, "rewards/total_composite/mean": 0.23223958909511566, "rewards/total_composite/std": 0.12774422764778137, "reward": 0.23223958909511566, "reward_std": 0.12774422764778137, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15499474108219147, "sampling/sampling_logp_difference/max": 1.9885585308074951, "sampling/importance_sampling_ratio/min": 0.13689260184764862, "sampling/importance_sampling_ratio/mean": 1.0061284303665161, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8128736615180969, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.12715011462569237, "clip_ratio/high_max": 0.12715011462569237, "clip_ratio/region_mean": 0.12715011462569237, "reward_total_mean": 0.23223958909511566, "reward_meter_mean": 0.8875970840454102, "reward_meter_std": 0.2766491770744324, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.07715168595314026, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.887499988079071, "reward_count_floor_std": 0.023145480081439018, "reward_lexical_plausibility_mean": 0.8949588537216187, "reward_lexical_plausibility_std": 0.195562481880188, "reward_repeat_penalty_mean": 0.8824868202209473, "reward_repeat_penalty_std": 0.13397713005542755, "reward_repeat_floor_mean": 0.9877086877822876, "reward_repeat_floor_std": 0.012082344852387905, "reward_near_duplicate_penalty_mean": 0.9649714827537537, "reward_near_duplicate_penalty_std": 0.01671692356467247, "reward_opening_diversity_mean": 0.9609375, "reward_opening_diversity_std": 0.08799287676811218, "reward_distinct_2_mean": 0.9478525519371033, "reward_distinct_2_std": 0.074729323387146, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.23223958909511566, "reward_total_composite_std": 0.12774422764778137} {"timestamp_utc": "2026-04-12T20:51:09Z", "mode": "train", "global_step": 1273, "epoch": 0.06699647386979633, "loss": -0.0014, "grad_norm": 19.351198196411133, "learning_rate": 6.1454545454545454e-06, "num_tokens": 2260517.0, "completions/mean_length": 18.75, "completions/min_length": 16.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.75, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.889035701751709, "rewards/meter/std": 0.2521689236164093, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.11259915679693222, "rewards/repeat_penalty/mean": 0.7478047609329224, "rewards/repeat_penalty/std": 0.004292828496545553, "rewards/repeat_floor/mean": 0.9845609664916992, "rewards/repeat_floor/std": 0.0008585641044192016, "rewards/near_duplicate_penalty/mean": 0.9970729947090149, "rewards/near_duplicate_penalty/std": 0.005723773967474699, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3275934159755707, "rewards/total_composite/std": 0.14551202952861786, "reward": 0.3275934159755707, "reward_std": 0.14551201462745667, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16604115068912506, "sampling/sampling_logp_difference/max": 2.1093358993530273, "sampling/importance_sampling_ratio/min": 0.1213185042142868, "sampling/importance_sampling_ratio/mean": 1.019057273864746, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8111205697059631, "clip_ratio/low_mean": 0.04062500037252903, "clip_ratio/low_min": 0.04062500037252903, "clip_ratio/high_mean": 0.09177355095744133, "clip_ratio/high_max": 0.09177355095744133, "clip_ratio/region_mean": 0.13239855132997036, "reward_total_mean": 0.3275934159755707, "reward_meter_mean": 0.889035701751709, "reward_meter_std": 0.2521689236164093, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7478047609329224, "reward_repeat_penalty_std": 0.004292828496545553, "reward_repeat_floor_mean": 0.9845609664916992, "reward_repeat_floor_std": 0.0008585641044192016, "reward_near_duplicate_penalty_mean": 0.9970729947090149, "reward_near_duplicate_penalty_std": 0.005723773967474699, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.11259915679693222, "reward_total_composite_mean": 0.3275934159755707, "reward_total_composite_std": 0.14551202952861786} {"timestamp_utc": "2026-04-12T20:51:17Z", "mode": "train", "global_step": 1274, "epoch": 0.06704910267880639, "loss": 0.0317, "grad_norm": 20.619544982910156, "learning_rate": 6.142424242424243e-06, "num_tokens": 2262087.0, "completions/mean_length": 20.25, "completions/min_length": 19.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.25, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.5778706073760986, "rewards/meter/std": 0.4129282534122467, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6687500476837158, "rewards/judge_quality/std": 0.3589046001434326, "rewards/repeat_penalty/mean": 0.6929779052734375, "rewards/repeat_penalty/std": 0.0843266025185585, "rewards/repeat_floor/mean": 0.9735955595970154, "rewards/repeat_floor/std": 0.016865329816937447, "rewards/near_duplicate_penalty/mean": 0.9239704608917236, "rewards/near_duplicate_penalty/std": 0.1124354749917984, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.42597997188568115, "rewards/total_composite/std": 0.40709230303764343, "reward": 0.42597997188568115, "reward_std": 0.40709230303764343, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13488778471946716, "sampling/sampling_logp_difference/max": 1.7053031921386719, "sampling/importance_sampling_ratio/min": 0.18171727657318115, "sampling/importance_sampling_ratio/mean": 1.046378493309021, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9697450995445251, "clip_ratio/low_mean": 0.06265664286911488, "clip_ratio/low_min": 0.06265664286911488, "clip_ratio/high_mean": 0.04302876768633723, "clip_ratio/high_max": 0.04302876768633723, "clip_ratio/region_mean": 0.10568541055545211, "reward_total_mean": 0.42597997188568115, "reward_meter_mean": 0.5778706073760986, "reward_meter_std": 0.4129282534122467, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.6929779052734375, "reward_repeat_penalty_std": 0.0843266025185585, "reward_repeat_floor_mean": 0.9735955595970154, "reward_repeat_floor_std": 0.016865329816937447, "reward_near_duplicate_penalty_mean": 0.9239704608917236, "reward_near_duplicate_penalty_std": 0.1124354749917984, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6687500476837158, "reward_judge_quality_std": 0.3589046001434326, "reward_total_composite_mean": 0.42597997188568115, "reward_total_composite_std": 0.40709230303764343} {"timestamp_utc": "2026-04-12T20:51:26Z", "mode": "train", "global_step": 1275, "epoch": 0.06710173148781642, "loss": -0.0046, "grad_norm": 15.704371452331543, "learning_rate": 6.139393939393939e-06, "num_tokens": 2263567.0, "completions/mean_length": 23.0, "completions/min_length": 20.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.0, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.5792652368545532, "rewards/meter/std": 0.4077938199043274, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8049999475479126, "rewards/judge_quality/std": 0.2517368495464325, "rewards/repeat_penalty/mean": 0.7330512404441833, "rewards/repeat_penalty/std": 0.032561879605054855, "rewards/repeat_floor/mean": 0.9816102981567383, "rewards/repeat_floor/std": 0.006512374151498079, "rewards/near_duplicate_penalty/mean": 0.977401614189148, "rewards/near_duplicate_penalty/std": 0.043415818363428116, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.43998605012893677, "rewards/total_composite/std": 0.3601395785808563, "reward": 0.43998605012893677, "reward_std": 0.3601395785808563, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14472268521785736, "sampling/sampling_logp_difference/max": 1.3146476745605469, "sampling/importance_sampling_ratio/min": 0.2685689330101013, "sampling/importance_sampling_ratio/mean": 0.992941677570343, "sampling/importance_sampling_ratio/max": 1.663733720779419, "entropy": 1.2278536260128021, "clip_ratio/low_mean": 0.05238742334768176, "clip_ratio/low_min": 0.05238742334768176, "clip_ratio/high_mean": 0.09493485651910305, "clip_ratio/high_max": 0.09493485651910305, "clip_ratio/region_mean": 0.1473222798667848, "reward_total_mean": 0.43998605012893677, "reward_meter_mean": 0.5792652368545532, "reward_meter_std": 0.4077938199043274, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7330512404441833, "reward_repeat_penalty_std": 0.032561879605054855, "reward_repeat_floor_mean": 0.9816102981567383, "reward_repeat_floor_std": 0.006512374151498079, "reward_near_duplicate_penalty_mean": 0.977401614189148, "reward_near_duplicate_penalty_std": 0.043415818363428116, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8049999475479126, "reward_judge_quality_std": 0.2517368495464325, "reward_total_composite_mean": 0.43998605012893677, "reward_total_composite_std": 0.3601395785808563} {"timestamp_utc": "2026-04-12T20:51:36Z", "mode": "train", "global_step": 1276, "epoch": 0.06715436029682648, "loss": 0.0295, "grad_norm": 9.942580223083496, "learning_rate": 6.136363636363637e-06, "num_tokens": 2266485.0, "completions/mean_length": 125.75, "completions/min_length": 115.0, "completions/max_length": 149.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 125.75, "completions/min_terminated_length": 115.0, "completions/max_terminated_length": 149.0, "rewards/meter/mean": 0.9674736261367798, "rewards/meter/std": 0.07034432142972946, "rewards/count_adherence/mean": 0.5555555820465088, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8666666746139526, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.7272279858589172, "rewards/repeat_penalty/std": 0.16049474477767944, "rewards/repeat_floor/mean": 0.9704926013946533, "rewards/repeat_floor/std": 0.015507549047470093, "rewards/near_duplicate_penalty/mean": 0.9288506507873535, "rewards/near_duplicate_penalty/std": 0.023925166577100754, "rewards/opening_diversity/mean": 0.9147727489471436, "rewards/opening_diversity/std": 0.14389893412590027, "rewards/distinct_2/mean": 0.8475406169891357, "rewards/distinct_2/std": 0.060464322566986084, "rewards/total_composite/mean": 0.24789929389953613, "rewards/total_composite/std": 0.08466501533985138, "reward": 0.24789929389953613, "reward_std": 0.08466501533985138, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16390083730220795, "sampling/sampling_logp_difference/max": 2.1465890407562256, "sampling/importance_sampling_ratio/min": 0.11688216030597687, "sampling/importance_sampling_ratio/mean": 1.0131659507751465, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0201633274555206, "clip_ratio/low_mean": 0.031063650734722614, "clip_ratio/low_min": 0.031063650734722614, "clip_ratio/high_mean": 0.12579221092164516, "clip_ratio/high_max": 0.12579221092164516, "clip_ratio/region_mean": 0.15685586165636778, "reward_total_mean": 0.24789929389953613, "reward_meter_mean": 0.9674736261367798, "reward_meter_std": 0.07034432142972946, "reward_count_adherence_mean": 0.5555555820465088, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8666666746139526, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7272279858589172, "reward_repeat_penalty_std": 0.16049474477767944, "reward_repeat_floor_mean": 0.9704926013946533, "reward_repeat_floor_std": 0.015507549047470093, "reward_near_duplicate_penalty_mean": 0.9288506507873535, "reward_near_duplicate_penalty_std": 0.023925166577100754, "reward_opening_diversity_mean": 0.9147727489471436, "reward_opening_diversity_std": 0.14389893412590027, "reward_distinct_2_mean": 0.8475406169891357, "reward_distinct_2_std": 0.060464322566986084, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.24789929389953613, "reward_total_composite_std": 0.08466501533985138} {"timestamp_utc": "2026-04-12T20:51:45Z", "mode": "train", "global_step": 1277, "epoch": 0.06720698910583653, "loss": -0.0896, "grad_norm": 26.013608932495117, "learning_rate": 6.133333333333334e-06, "num_tokens": 2267761.0, "completions/mean_length": 17.5, "completions/min_length": 13.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.5, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.7073818445205688, "rewards/meter/std": 0.36538729071617126, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.6475000381469727, "rewards/judge_quality/std": 0.30742016434669495, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4580766558647156, "rewards/total_composite/std": 0.3642033636569977, "reward": 0.4580766558647156, "reward_std": 0.3642033040523529, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21130113303661346, "sampling/sampling_logp_difference/max": 1.5415663719177246, "sampling/importance_sampling_ratio/min": 0.21404556930065155, "sampling/importance_sampling_ratio/mean": 1.0190093517303467, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3722561374306679, "clip_ratio/low_mean": 0.12367457337677479, "clip_ratio/low_min": 0.12367457337677479, "clip_ratio/high_mean": 0.07932423241436481, "clip_ratio/high_max": 0.07932423241436481, "clip_ratio/region_mean": 0.2029988057911396, "reward_total_mean": 0.4580766558647156, "reward_meter_mean": 0.7073818445205688, "reward_meter_std": 0.36538729071617126, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6475000381469727, "reward_judge_quality_std": 0.30742016434669495, "reward_total_composite_mean": 0.4580766558647156, "reward_total_composite_std": 0.3642033636569977} {"timestamp_utc": "2026-04-12T20:51:57Z", "mode": "train", "global_step": 1278, "epoch": 0.06725961791484658, "loss": 0.0498, "grad_norm": 15.023978233337402, "learning_rate": 6.130303030303031e-06, "num_tokens": 2269458.0, "completions/mean_length": 44.125, "completions/min_length": 39.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.125, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.6327494382858276, "rewards/meter/std": 0.3527475595474243, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.988175630569458, "rewards/repeat_penalty/std": 0.025807036086916924, "rewards/repeat_floor/mean": 0.9986739754676819, "rewards/repeat_floor/std": 0.0026872691232711077, "rewards/near_duplicate_penalty/mean": 0.9957752227783203, "rewards/near_duplicate_penalty/std": 0.0082395039498806, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9923076629638672, "rewards/distinct_2/std": 0.021757129579782486, "rewards/total_composite/mean": 0.24861422181129456, "rewards/total_composite/std": 0.14773215353488922, "reward": 0.24861422181129456, "reward_std": 0.14773216843605042, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.19556066393852234, "sampling/sampling_logp_difference/max": 1.4899392127990723, "sampling/importance_sampling_ratio/min": 0.2705949544906616, "sampling/importance_sampling_ratio/mean": 1.0542553663253784, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.8790571242570877, "clip_ratio/low_mean": 0.06543927919119596, "clip_ratio/low_min": 0.06543927919119596, "clip_ratio/high_mean": 0.0822699274867773, "clip_ratio/high_max": 0.0822699274867773, "clip_ratio/region_mean": 0.14770920667797327, "reward_total_mean": 0.24861422181129456, "reward_meter_mean": 0.6327494382858276, "reward_meter_std": 0.3527475595474243, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.988175630569458, "reward_repeat_penalty_std": 0.025807036086916924, "reward_repeat_floor_mean": 0.9986739754676819, "reward_repeat_floor_std": 0.0026872691232711077, "reward_near_duplicate_penalty_mean": 0.9957752227783203, "reward_near_duplicate_penalty_std": 0.0082395039498806, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9923076629638672, "reward_distinct_2_std": 0.021757129579782486, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.24861422181129456, "reward_total_composite_std": 0.14773215353488922} {"timestamp_utc": "2026-04-12T20:52:10Z", "mode": "train", "global_step": 1279, "epoch": 0.06731224672385663, "loss": 0.0127, "grad_norm": 10.804234504699707, "learning_rate": 6.127272727272727e-06, "num_tokens": 2271055.0, "completions/mean_length": 51.625, "completions/min_length": 44.0, "completions/max_length": 64.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.625, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.9879533052444458, "rewards/meter/std": 0.005108564160764217, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.24121345579624176, "rewards/repeat_penalty/mean": 0.6141194105148315, "rewards/repeat_penalty/std": 0.06002319976687431, "rewards/repeat_floor/mean": 0.9644373655319214, "rewards/repeat_floor/std": 0.009719708934426308, "rewards/near_duplicate_penalty/mean": 0.9412378668785095, "rewards/near_duplicate_penalty/std": 0.04470231384038925, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8694632053375244, "rewards/distinct_2/std": 0.06619791686534882, "rewards/total_composite/mean": 0.3886520564556122, "rewards/total_composite/std": 0.22585095465183258, "reward": 0.3886520564556122, "reward_std": 0.2258509397506714, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13005231320858002, "sampling/sampling_logp_difference/max": 1.3732376098632812, "sampling/importance_sampling_ratio/min": 0.25328558683395386, "sampling/importance_sampling_ratio/mean": 1.0239617824554443, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9145958125591278, "clip_ratio/low_mean": 0.06817550025880337, "clip_ratio/low_min": 0.06817550025880337, "clip_ratio/high_mean": 0.0639254841953516, "clip_ratio/high_max": 0.0639254841953516, "clip_ratio/region_mean": 0.13210098445415497, "reward_total_mean": 0.3886520564556122, "reward_meter_mean": 0.9879533052444458, "reward_meter_std": 0.005108564160764217, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6141194105148315, "reward_repeat_penalty_std": 0.06002319976687431, "reward_repeat_floor_mean": 0.9644373655319214, "reward_repeat_floor_std": 0.009719708934426308, "reward_near_duplicate_penalty_mean": 0.9412378668785095, "reward_near_duplicate_penalty_std": 0.04470231384038925, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8694632053375244, "reward_distinct_2_std": 0.06619791686534882, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.24121345579624176, "reward_total_composite_mean": 0.3886520564556122, "reward_total_composite_std": 0.22585095465183258} {"timestamp_utc": "2026-04-12T20:52:19Z", "mode": "train", "global_step": 1280, "epoch": 0.06736487553286669, "loss": 0.0655, "grad_norm": 19.38922691345215, "learning_rate": 6.1242424242424245e-06, "num_tokens": 2272399.0, "completions/mean_length": 22.0, "completions/min_length": 19.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.0, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.9677039980888367, "rewards/meter/std": 0.04641558229923248, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8650000095367432, "rewards/judge_quality/std": 0.16801361739635468, "rewards/repeat_penalty/mean": 0.7378586530685425, "rewards/repeat_penalty/std": 0.031095918267965317, "rewards/repeat_floor/mean": 0.9834593534469604, "rewards/repeat_floor/std": 0.0037274223286658525, "rewards/near_duplicate_penalty/mean": 0.9986044764518738, "rewards/near_duplicate_penalty/std": 0.003947157878428698, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.8240794539451599, "rewards/total_composite/std": 0.1687736064195633, "reward": 0.8240794539451599, "reward_std": 0.1687736064195633, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.134673610329628, "sampling/sampling_logp_difference/max": 0.9066610336303711, "sampling/importance_sampling_ratio/min": 0.40387049317359924, "sampling/importance_sampling_ratio/mean": 1.0463017225265503, "sampling/importance_sampling_ratio/max": 1.8804807662963867, "entropy": 1.0864523872733116, "clip_ratio/low_mean": 0.04166666604578495, "clip_ratio/low_min": 0.04166666604578495, "clip_ratio/high_mean": 0.09955168422311544, "clip_ratio/high_max": 0.09955168422311544, "clip_ratio/region_mean": 0.1412183502689004, "reward_total_mean": 0.8240794539451599, "reward_meter_mean": 0.9677039980888367, "reward_meter_std": 0.04641558229923248, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7378586530685425, "reward_repeat_penalty_std": 0.031095918267965317, "reward_repeat_floor_mean": 0.9834593534469604, "reward_repeat_floor_std": 0.0037274223286658525, "reward_near_duplicate_penalty_mean": 0.9986044764518738, "reward_near_duplicate_penalty_std": 0.003947157878428698, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.8650000095367432, "reward_judge_quality_std": 0.16801361739635468, "reward_total_composite_mean": 0.8240794539451599, "reward_total_composite_std": 0.1687736064195633} {"timestamp_utc": "2026-04-12T20:52:34Z", "mode": "train", "global_step": 1281, "epoch": 0.06741750434187674, "loss": -0.1159, "grad_norm": 4.049616813659668, "learning_rate": 6.121212121212121e-06, "num_tokens": 2274800.0, "completions/mean_length": 158.125, "completions/min_length": 96.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 107.5714340209961, "completions/min_terminated_length": 96.0, "completions/max_terminated_length": 118.0, "rewards/meter/mean": 0.932712197303772, "rewards/meter/std": 0.153072789311409, "rewards/count_adherence/mean": 0.5714285969734192, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8714285492897034, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9623285531997681, "rewards/lexical_plausibility/std": 0.1065509244799614, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.6622878313064575, "rewards/repeat_penalty/std": 0.24458257853984833, "rewards/repeat_floor/mean": 0.9626510143280029, "rewards/repeat_floor/std": 0.030960487201809883, "rewards/near_duplicate_penalty/mean": 0.9089532494544983, "rewards/near_duplicate_penalty/std": 0.059056829661130905, "rewards/opening_diversity/mean": 0.8671875, "rewards/opening_diversity/std": 0.21505165100097656, "rewards/distinct_2/mean": 0.8252971768379211, "rewards/distinct_2/std": 0.14173123240470886, "rewards/total_composite/mean": 0.2526596188545227, "rewards/total_composite/std": 0.10356839001178741, "reward": 0.2526596188545227, "reward_std": 0.10356838256120682, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14163656532764435, "sampling/sampling_logp_difference/max": 1.6069011688232422, "sampling/importance_sampling_ratio/min": 0.2005079984664917, "sampling/importance_sampling_ratio/mean": 1.005495309829712, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9161988273262978, "clip_ratio/low_mean": 0.016447369009256363, "clip_ratio/low_min": 0.016447369009256363, "clip_ratio/high_mean": 0.10982071235775948, "clip_ratio/high_max": 0.10982071235775948, "clip_ratio/region_mean": 0.12626808136701584, "reward_total_mean": 0.2526596188545227, "reward_meter_mean": 0.932712197303772, "reward_meter_std": 0.153072789311409, "reward_count_adherence_mean": 0.5714285969734192, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8714285492897034, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9623285531997681, "reward_lexical_plausibility_std": 0.1065509244799614, "reward_repeat_penalty_mean": 0.6622878313064575, "reward_repeat_penalty_std": 0.24458257853984833, "reward_repeat_floor_mean": 0.9626510143280029, "reward_repeat_floor_std": 0.030960487201809883, "reward_near_duplicate_penalty_mean": 0.9089532494544983, "reward_near_duplicate_penalty_std": 0.059056829661130905, "reward_opening_diversity_mean": 0.8671875, "reward_opening_diversity_std": 0.21505165100097656, "reward_distinct_2_mean": 0.8252971768379211, "reward_distinct_2_std": 0.14173123240470886, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.2526596188545227, "reward_total_composite_std": 0.10356839001178741} {"timestamp_utc": "2026-04-12T20:52:48Z", "mode": "train", "global_step": 1282, "epoch": 0.06747013315088679, "loss": -0.0367, "grad_norm": 4.579404354095459, "learning_rate": 6.118181818181819e-06, "num_tokens": 2276398.0, "completions/mean_length": 99.75, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 40.85714340209961, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7003982067108154, "rewards/meter/std": 0.421455442905426, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9506106376647949, "rewards/lexical_plausibility/std": 0.13969433307647705, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.1552647352218628, "rewards/repeat_penalty/mean": 0.8909257650375366, "rewards/repeat_penalty/std": 0.146341472864151, "rewards/repeat_floor/mean": 0.9866161346435547, "rewards/repeat_floor/std": 0.01638607122004032, "rewards/near_duplicate_penalty/mean": 0.9431406259536743, "rewards/near_duplicate_penalty/std": 0.05240917205810547, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9668891429901123, "rewards/distinct_2/std": 0.04862732067704201, "rewards/total_composite/mean": 0.2612893879413605, "rewards/total_composite/std": 0.1929890662431717, "reward": 0.2612893879413605, "reward_std": 0.19298908114433289, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16385674476623535, "sampling/sampling_logp_difference/max": 2.9079105854034424, "sampling/importance_sampling_ratio/min": 0.05458967387676239, "sampling/importance_sampling_ratio/mean": 1.0130107402801514, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.126872956752777, "clip_ratio/low_mean": 0.034722222946584225, "clip_ratio/low_min": 0.034722222946584225, "clip_ratio/high_mean": 0.08194526610895991, "clip_ratio/high_max": 0.08194526610895991, "clip_ratio/region_mean": 0.11666748905554414, "reward_total_mean": 0.2612893879413605, "reward_meter_mean": 0.7003982067108154, "reward_meter_std": 0.421455442905426, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9506106376647949, "reward_lexical_plausibility_std": 0.13969433307647705, "reward_repeat_penalty_mean": 0.8909257650375366, "reward_repeat_penalty_std": 0.146341472864151, "reward_repeat_floor_mean": 0.9866161346435547, "reward_repeat_floor_std": 0.01638607122004032, "reward_near_duplicate_penalty_mean": 0.9431406259536743, "reward_near_duplicate_penalty_std": 0.05240917205810547, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9668891429901123, "reward_distinct_2_std": 0.04862732067704201, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.1552647352218628, "reward_total_composite_mean": 0.2612893879413605, "reward_total_composite_std": 0.1929890662431717} {"timestamp_utc": "2026-04-12T20:52:57Z", "mode": "train", "global_step": 1283, "epoch": 0.06752276195989684, "loss": 0.0156, "grad_norm": 18.195934295654297, "learning_rate": 6.115151515151516e-06, "num_tokens": 2277797.0, "completions/mean_length": 26.875, "completions/min_length": 23.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 26.875, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.3963731825351715, "rewards/meter/std": 0.4179953634738922, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6012499928474426, "rewards/judge_quality/std": 0.2671777307987213, "rewards/repeat_penalty/mean": 0.9705680012702942, "rewards/repeat_penalty/std": 0.02303503267467022, "rewards/repeat_floor/mean": 0.9955852031707764, "rewards/repeat_floor/std": 0.003455251455307007, "rewards/near_duplicate_penalty/mean": 0.9705680012702942, "rewards/near_duplicate_penalty/std": 0.02303503267467022, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24516846239566803, "rewards/total_composite/std": 0.2693071961402893, "reward": 0.24516846239566803, "reward_std": 0.2693071961402893, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16867254674434662, "sampling/sampling_logp_difference/max": 1.825056552886963, "sampling/importance_sampling_ratio/min": 0.16120852530002594, "sampling/importance_sampling_ratio/mean": 1.0346688032150269, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0673444122076035, "clip_ratio/low_mean": 0.09447878506034613, "clip_ratio/low_min": 0.09447878506034613, "clip_ratio/high_mean": 0.0480658458545804, "clip_ratio/high_max": 0.0480658458545804, "clip_ratio/region_mean": 0.14254463091492653, "reward_total_mean": 0.24516846239566803, "reward_meter_mean": 0.3963731825351715, "reward_meter_std": 0.4179953634738922, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9705680012702942, "reward_repeat_penalty_std": 0.02303503267467022, "reward_repeat_floor_mean": 0.9955852031707764, "reward_repeat_floor_std": 0.003455251455307007, "reward_near_duplicate_penalty_mean": 0.9705680012702942, "reward_near_duplicate_penalty_std": 0.02303503267467022, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6012499928474426, "reward_judge_quality_std": 0.2671777307987213, "reward_total_composite_mean": 0.24516846239566803, "reward_total_composite_std": 0.2693071961402893} {"timestamp_utc": "2026-04-12T20:53:07Z", "mode": "train", "global_step": 1284, "epoch": 0.0675753907689069, "loss": 0.0247, "grad_norm": 20.05014419555664, "learning_rate": 6.112121212121213e-06, "num_tokens": 2279296.0, "completions/mean_length": 34.375, "completions/min_length": 31.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.375, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.629314661026001, "rewards/meter/std": 0.44294917583465576, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9662244915962219, "rewards/repeat_penalty/std": 0.03941755369305611, "rewards/repeat_floor/mean": 0.9954374432563782, "rewards/repeat_floor/std": 0.0049843802116811275, "rewards/near_duplicate_penalty/mean": 0.9750772714614868, "rewards/near_duplicate_penalty/std": 0.027527790516614914, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.25952810049057007, "rewards/total_composite/std": 0.22622127830982208, "reward": 0.25952810049057007, "reward_std": 0.2262212634086609, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1595010608434677, "sampling/sampling_logp_difference/max": 1.266634464263916, "sampling/importance_sampling_ratio/min": 0.28177836537361145, "sampling/importance_sampling_ratio/mean": 1.003468632698059, "sampling/importance_sampling_ratio/max": 1.7857407331466675, "entropy": 1.1013183817267418, "clip_ratio/low_mean": 0.08061044104397297, "clip_ratio/low_min": 0.08061044104397297, "clip_ratio/high_mean": 0.09057654067873955, "clip_ratio/high_max": 0.09057654067873955, "clip_ratio/region_mean": 0.17118698172271252, "reward_total_mean": 0.25952810049057007, "reward_meter_mean": 0.629314661026001, "reward_meter_std": 0.44294917583465576, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9662244915962219, "reward_repeat_penalty_std": 0.03941755369305611, "reward_repeat_floor_mean": 0.9954374432563782, "reward_repeat_floor_std": 0.0049843802116811275, "reward_near_duplicate_penalty_mean": 0.9750772714614868, "reward_near_duplicate_penalty_std": 0.027527790516614914, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.25952810049057007, "reward_total_composite_std": 0.22622127830982208} {"timestamp_utc": "2026-04-12T20:53:22Z", "mode": "train", "global_step": 1285, "epoch": 0.06762801957791695, "loss": -0.1397, "grad_norm": 5.8364434242248535, "learning_rate": 6.10909090909091e-06, "num_tokens": 2281144.0, "completions/mean_length": 121.0, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 65.14286041259766, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.7154441475868225, "rewards/meter/std": 0.3799416124820709, "rewards/count_adherence/mean": 0.6750000715255737, "rewards/count_adherence/std": 0.14880476891994476, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 0.9024999737739563, "rewards/count_floor/std": 0.04464143142104149, "rewards/lexical_plausibility/mean": 0.9469554424285889, "rewards/lexical_plausibility/std": 0.15003259479999542, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.16850179433822632, "rewards/repeat_penalty/mean": 0.8863404989242554, "rewards/repeat_penalty/std": 0.07637932151556015, "rewards/repeat_floor/mean": 0.9869344234466553, "rewards/repeat_floor/std": 0.008240737952291965, "rewards/near_duplicate_penalty/mean": 0.9557437300682068, "rewards/near_duplicate_penalty/std": 0.025231685489416122, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9337952136993408, "rewards/distinct_2/std": 0.05908522382378578, "rewards/total_composite/mean": 0.20943179726600647, "rewards/total_composite/std": 0.16537350416183472, "reward": 0.20943179726600647, "reward_std": 0.16537350416183472, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15690886974334717, "sampling/sampling_logp_difference/max": 1.7209768295288086, "sampling/importance_sampling_ratio/min": 0.17889131605625153, "sampling/importance_sampling_ratio/mean": 1.0197601318359375, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8006609156727791, "clip_ratio/low_mean": 0.07394255138933659, "clip_ratio/low_min": 0.07394255138933659, "clip_ratio/high_mean": 0.08503968454897404, "clip_ratio/high_max": 0.08503968454897404, "clip_ratio/region_mean": 0.15898223593831062, "reward_total_mean": 0.20943179726600647, "reward_meter_mean": 0.7154441475868225, "reward_meter_std": 0.3799416124820709, "reward_count_adherence_mean": 0.6750000715255737, "reward_count_adherence_std": 0.14880476891994476, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 0.9024999737739563, "reward_count_floor_std": 0.04464143142104149, "reward_lexical_plausibility_mean": 0.9469554424285889, "reward_lexical_plausibility_std": 0.15003259479999542, "reward_repeat_penalty_mean": 0.8863404989242554, "reward_repeat_penalty_std": 0.07637932151556015, "reward_repeat_floor_mean": 0.9869344234466553, "reward_repeat_floor_std": 0.008240737952291965, "reward_near_duplicate_penalty_mean": 0.9557437300682068, "reward_near_duplicate_penalty_std": 0.025231685489416122, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9337952136993408, "reward_distinct_2_std": 0.05908522382378578, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.16850179433822632, "reward_total_composite_mean": 0.20943179726600647, "reward_total_composite_std": 0.16537350416183472} {"timestamp_utc": "2026-04-12T20:53:32Z", "mode": "train", "global_step": 1286, "epoch": 0.067680648386927, "loss": 0.0628, "grad_norm": 15.974264144897461, "learning_rate": 6.106060606060606e-06, "num_tokens": 2282649.0, "completions/mean_length": 28.125, "completions/min_length": 24.0, "completions/max_length": 32.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 28.125, "completions/min_terminated_length": 24.0, "completions/max_terminated_length": 32.0, "rewards/meter/mean": 0.4469379782676697, "rewards/meter/std": 0.21926090121269226, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.21390503644943237, "rewards/repeat_penalty/mean": 0.9348220229148865, "rewards/repeat_penalty/std": 0.04650967940688133, "rewards/repeat_floor/mean": 0.9902232885360718, "rewards/repeat_floor/std": 0.0069764466024935246, "rewards/near_duplicate_penalty/mean": 0.9348220229148865, "rewards/near_duplicate_penalty/std": 0.04650967940688133, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20960259437561035, "rewards/total_composite/std": 0.1295873373746872, "reward": 0.20960259437561035, "reward_std": 0.1295873373746872, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14299459755420685, "sampling/sampling_logp_difference/max": 1.3126544952392578, "sampling/importance_sampling_ratio/min": 0.2691047787666321, "sampling/importance_sampling_ratio/mean": 1.0156716108322144, "sampling/importance_sampling_ratio/max": 1.7582467794418335, "entropy": 0.7529254257678986, "clip_ratio/low_mean": 0.07921245554462075, "clip_ratio/low_min": 0.07921245554462075, "clip_ratio/high_mean": 0.07598907081410289, "clip_ratio/high_max": 0.07598907081410289, "clip_ratio/region_mean": 0.15520152635872364, "reward_total_mean": 0.20960259437561035, "reward_meter_mean": 0.4469379782676697, "reward_meter_std": 0.21926090121269226, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9348220229148865, "reward_repeat_penalty_std": 0.04650967940688133, "reward_repeat_floor_mean": 0.9902232885360718, "reward_repeat_floor_std": 0.0069764466024935246, "reward_near_duplicate_penalty_mean": 0.9348220229148865, "reward_near_duplicate_penalty_std": 0.04650967940688133, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.21390503644943237, "reward_total_composite_mean": 0.20960259437561035, "reward_total_composite_std": 0.1295873373746872} {"timestamp_utc": "2026-04-12T20:53:41Z", "mode": "train", "global_step": 1287, "epoch": 0.06773327719593705, "loss": 0.0199, "grad_norm": 25.172632217407227, "learning_rate": 6.103030303030304e-06, "num_tokens": 2284070.0, "completions/mean_length": 20.625, "completions/min_length": 19.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.625, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.8185949325561523, "rewards/meter/std": 0.3426293730735779, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9345755577087402, "rewards/lexical_plausibility/std": 0.13747143745422363, "rewards/judge_quality/mean": 0.5175000429153442, "rewards/judge_quality/std": 0.26868730783462524, "rewards/repeat_penalty/mean": 0.7785084247589111, "rewards/repeat_penalty/std": 0.08966934680938721, "rewards/repeat_floor/mean": 0.9863266944885254, "rewards/repeat_floor/std": 0.005636090412735939, "rewards/near_duplicate_penalty/mean": 0.9963445663452148, "rewards/near_duplicate_penalty/std": 0.007573677226901054, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.462772011756897, "rewards/total_composite/std": 0.29279395937919617, "reward": 0.462772011756897, "reward_std": 0.29279395937919617, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.22643554210662842, "sampling/sampling_logp_difference/max": 1.3879175186157227, "sampling/importance_sampling_ratio/min": 0.2495945394039154, "sampling/importance_sampling_ratio/mean": 1.034777283668518, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 2.004843458533287, "clip_ratio/low_mean": 0.11690094834193587, "clip_ratio/low_min": 0.11690094834193587, "clip_ratio/high_mean": 0.04204545542597771, "clip_ratio/high_max": 0.04204545542597771, "clip_ratio/region_mean": 0.15894640376791358, "reward_total_mean": 0.462772011756897, "reward_meter_mean": 0.8185949325561523, "reward_meter_std": 0.3426293730735779, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9345755577087402, "reward_lexical_plausibility_std": 0.13747143745422363, "reward_repeat_penalty_mean": 0.7785084247589111, "reward_repeat_penalty_std": 0.08966934680938721, "reward_repeat_floor_mean": 0.9863266944885254, "reward_repeat_floor_std": 0.005636090412735939, "reward_near_duplicate_penalty_mean": 0.9963445663452148, "reward_near_duplicate_penalty_std": 0.007573677226901054, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5175000429153442, "reward_judge_quality_std": 0.26868730783462524, "reward_total_composite_mean": 0.462772011756897, "reward_total_composite_std": 0.29279395937919617} {"timestamp_utc": "2026-04-12T20:53:51Z", "mode": "train", "global_step": 1288, "epoch": 0.0677859060049471, "loss": 0.0692, "grad_norm": 14.786998748779297, "learning_rate": 6.1e-06, "num_tokens": 2285553.0, "completions/mean_length": 34.375, "completions/min_length": 30.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.375, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.551730751991272, "rewards/meter/std": 0.4425676763057709, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9871809482574463, "rewards/repeat_penalty/std": 0.01605856604874134, "rewards/repeat_floor/mean": 0.9980771541595459, "rewards/repeat_floor/std": 0.0024087761994451284, "rewards/near_duplicate_penalty/mean": 0.9871809482574463, "rewards/near_duplicate_penalty/std": 0.01605856604874134, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22984516620635986, "rewards/total_composite/std": 0.19475726783275604, "reward": 0.22984516620635986, "reward_std": 0.19475726783275604, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.21011680364608765, "sampling/sampling_logp_difference/max": 2.3008906841278076, "sampling/importance_sampling_ratio/min": 0.1001695841550827, "sampling/importance_sampling_ratio/mean": 1.0125607252120972, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.554593026638031, "clip_ratio/low_mean": 0.08579343743622303, "clip_ratio/low_min": 0.08579343743622303, "clip_ratio/high_mean": 0.09757401421666145, "clip_ratio/high_max": 0.09757401421666145, "clip_ratio/region_mean": 0.18336745165288448, "reward_total_mean": 0.22984516620635986, "reward_meter_mean": 0.551730751991272, "reward_meter_std": 0.4425676763057709, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9871809482574463, "reward_repeat_penalty_std": 0.01605856604874134, "reward_repeat_floor_mean": 0.9980771541595459, "reward_repeat_floor_std": 0.0024087761994451284, "reward_near_duplicate_penalty_mean": 0.9871809482574463, "reward_near_duplicate_penalty_std": 0.01605856604874134, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.22984516620635986, "reward_total_composite_std": 0.19475726783275604} {"timestamp_utc": "2026-04-12T20:54:05Z", "mode": "train", "global_step": 1289, "epoch": 0.06783853481395716, "loss": -0.0897, "grad_norm": 3.2224481105804443, "learning_rate": 6.096969696969698e-06, "num_tokens": 2286896.0, "completions/mean_length": 95.875, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 36.42857360839844, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.8115239143371582, "rewards/meter/std": 0.15003734827041626, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.936459481716156, "rewards/lexical_plausibility/std": 0.1797197312116623, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.8086724877357483, "rewards/repeat_penalty/std": 0.2693471908569336, "rewards/repeat_floor/mean": 0.9807487726211548, "rewards/repeat_floor/std": 0.027442872524261475, "rewards/near_duplicate_penalty/mean": 0.9522339105606079, "rewards/near_duplicate_penalty/std": 0.058630239218473434, "rewards/opening_diversity/mean": 0.859375, "rewards/opening_diversity/std": 0.2259652018547058, "rewards/distinct_2/mean": 0.9594579339027405, "rewards/distinct_2/std": 0.06129398196935654, "rewards/total_composite/mean": 0.28309640288352966, "rewards/total_composite/std": 0.12222478538751602, "reward": 0.28309640288352966, "reward_std": 0.12222477793693542, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14320380985736847, "sampling/sampling_logp_difference/max": 1.214773178100586, "sampling/importance_sampling_ratio/min": 0.2967773377895355, "sampling/importance_sampling_ratio/mean": 1.0355345010757446, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0828647539019585, "clip_ratio/low_mean": 0.04904306307435036, "clip_ratio/low_min": 0.04904306307435036, "clip_ratio/high_mean": 0.08503476483747363, "clip_ratio/high_max": 0.08503476483747363, "clip_ratio/region_mean": 0.134077827911824, "reward_total_mean": 0.28309640288352966, "reward_meter_mean": 0.8115239143371582, "reward_meter_std": 0.15003734827041626, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.936459481716156, "reward_lexical_plausibility_std": 0.1797197312116623, "reward_repeat_penalty_mean": 0.8086724877357483, "reward_repeat_penalty_std": 0.2693471908569336, "reward_repeat_floor_mean": 0.9807487726211548, "reward_repeat_floor_std": 0.027442872524261475, "reward_near_duplicate_penalty_mean": 0.9522339105606079, "reward_near_duplicate_penalty_std": 0.058630239218473434, "reward_opening_diversity_mean": 0.859375, "reward_opening_diversity_std": 0.2259652018547058, "reward_distinct_2_mean": 0.9594579339027405, "reward_distinct_2_std": 0.06129398196935654, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.28309640288352966, "reward_total_composite_std": 0.12222478538751602} {"timestamp_utc": "2026-04-12T20:54:15Z", "mode": "train", "global_step": 1290, "epoch": 0.06789116362296721, "loss": 0.0747, "grad_norm": 15.839608192443848, "learning_rate": 6.0939393939393946e-06, "num_tokens": 2288413.0, "completions/mean_length": 35.625, "completions/min_length": 31.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.625, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.6005629301071167, "rewards/meter/std": 0.44296953082084656, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9887223839759827, "rewards/repeat_penalty/std": 0.01224371138960123, "rewards/repeat_floor/mean": 0.9983083605766296, "rewards/repeat_floor/std": 0.0018365527503192425, "rewards/near_duplicate_penalty/mean": 0.9887223839759827, "rewards/near_duplicate_penalty/std": 0.01224371138960123, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2462134212255478, "rewards/total_composite/std": 0.1885007917881012, "reward": 0.2462134212255478, "reward_std": 0.18850077688694, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17666497826576233, "sampling/sampling_logp_difference/max": 1.56201171875, "sampling/importance_sampling_ratio/min": 0.20971375703811646, "sampling/importance_sampling_ratio/mean": 1.0257396697998047, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5847289711236954, "clip_ratio/low_mean": 0.05239400640130043, "clip_ratio/low_min": 0.05239400640130043, "clip_ratio/high_mean": 0.11932100262492895, "clip_ratio/high_max": 0.11932100262492895, "clip_ratio/region_mean": 0.17171500902622938, "reward_total_mean": 0.2462134212255478, "reward_meter_mean": 0.6005629301071167, "reward_meter_std": 0.44296953082084656, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9887223839759827, "reward_repeat_penalty_std": 0.01224371138960123, "reward_repeat_floor_mean": 0.9983083605766296, "reward_repeat_floor_std": 0.0018365527503192425, "reward_near_duplicate_penalty_mean": 0.9887223839759827, "reward_near_duplicate_penalty_std": 0.01224371138960123, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.2462134212255478, "reward_total_composite_std": 0.1885007917881012} {"timestamp_utc": "2026-04-12T20:54:29Z", "mode": "train", "global_step": 1291, "epoch": 0.06794379243197726, "loss": -0.0949, "grad_norm": 3.454296350479126, "learning_rate": 6.090909090909092e-06, "num_tokens": 2289912.0, "completions/mean_length": 163.375, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 47.16666793823242, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.538061797618866, "rewards/meter/std": 0.4162462651729584, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.05175492912530899, "rewards/lexical_plausibility/mean": 0.9052866101264954, "rewards/lexical_plausibility/std": 0.17761211097240448, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1767766922712326, "rewards/repeat_penalty/mean": 0.5908900499343872, "rewards/repeat_penalty/std": 0.19897331297397614, "rewards/repeat_floor/mean": 0.9611257314682007, "rewards/repeat_floor/std": 0.019320053979754448, "rewards/near_duplicate_penalty/mean": 0.9115623235702515, "rewards/near_duplicate_penalty/std": 0.05392604321241379, "rewards/opening_diversity/mean": 0.703125, "rewards/opening_diversity/std": 0.1882425844669342, "rewards/distinct_2/mean": 0.9133763909339905, "rewards/distinct_2/std": 0.059238214045763016, "rewards/total_composite/mean": 0.19371573626995087, "rewards/total_composite/std": 0.17422915995121002, "reward": 0.19371573626995087, "reward_std": 0.17422915995121002, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11189450323581696, "sampling/sampling_logp_difference/max": 1.0207560062408447, "sampling/importance_sampling_ratio/min": 0.3603224456310272, "sampling/importance_sampling_ratio/mean": 1.028931736946106, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.761118933558464, "clip_ratio/low_mean": 0.02691798936575651, "clip_ratio/low_min": 0.02691798936575651, "clip_ratio/high_mean": 0.04535717656835914, "clip_ratio/high_max": 0.04535717656835914, "clip_ratio/region_mean": 0.07227516593411565, "reward_total_mean": 0.19371573626995087, "reward_meter_mean": 0.538061797618866, "reward_meter_std": 0.4162462651729584, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.05175492912530899, "reward_lexical_plausibility_mean": 0.9052866101264954, "reward_lexical_plausibility_std": 0.17761211097240448, "reward_repeat_penalty_mean": 0.5908900499343872, "reward_repeat_penalty_std": 0.19897331297397614, "reward_repeat_floor_mean": 0.9611257314682007, "reward_repeat_floor_std": 0.019320053979754448, "reward_near_duplicate_penalty_mean": 0.9115623235702515, "reward_near_duplicate_penalty_std": 0.05392604321241379, "reward_opening_diversity_mean": 0.703125, "reward_opening_diversity_std": 0.1882425844669342, "reward_distinct_2_mean": 0.9133763909339905, "reward_distinct_2_std": 0.059238214045763016, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1767766922712326, "reward_total_composite_mean": 0.19371573626995087, "reward_total_composite_std": 0.17422915995121002} {"timestamp_utc": "2026-04-12T20:54:44Z", "mode": "train", "global_step": 1292, "epoch": 0.06799642124098731, "loss": -0.0531, "grad_norm": 5.128190517425537, "learning_rate": 6.087878787878788e-06, "num_tokens": 2291342.0, "completions/mean_length": 97.75, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.57143020629883, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.43891412019729614, "rewards/meter/std": 0.3075217604637146, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9566828608512878, "rewards/lexical_plausibility/std": 0.12251932919025421, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9951488971710205, "rewards/repeat_penalty/std": 0.006459453608840704, "rewards/repeat_floor/mean": 0.999272346496582, "rewards/repeat_floor/std": 0.0009689141297712922, "rewards/near_duplicate_penalty/mean": 0.9951488971710205, "rewards/near_duplicate_penalty/std": 0.006459453608840704, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12514343857765198, "rewards/total_composite/std": 0.09997636824846268, "reward": 0.12514343857765198, "reward_std": 0.09997636079788208, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1624237596988678, "sampling/sampling_logp_difference/max": 1.6810216903686523, "sampling/importance_sampling_ratio/min": 0.18618366122245789, "sampling/importance_sampling_ratio/mean": 1.036087155342102, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3929873704910278, "clip_ratio/low_mean": 0.09315388463437557, "clip_ratio/low_min": 0.09315388463437557, "clip_ratio/high_mean": 0.06837544031441212, "clip_ratio/high_max": 0.06837544031441212, "clip_ratio/region_mean": 0.1615293249487877, "reward_total_mean": 0.12514343857765198, "reward_meter_mean": 0.43891412019729614, "reward_meter_std": 0.3075217604637146, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9566828608512878, "reward_lexical_plausibility_std": 0.12251932919025421, "reward_repeat_penalty_mean": 0.9951488971710205, "reward_repeat_penalty_std": 0.006459453608840704, "reward_repeat_floor_mean": 0.999272346496582, "reward_repeat_floor_std": 0.0009689141297712922, "reward_near_duplicate_penalty_mean": 0.9951488971710205, "reward_near_duplicate_penalty_std": 0.006459453608840704, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.12514343857765198, "reward_total_composite_std": 0.09997636824846268} {"timestamp_utc": "2026-04-12T20:54:58Z", "mode": "train", "global_step": 1293, "epoch": 0.06804905004999737, "loss": -0.1105, "grad_norm": 2.3477559089660645, "learning_rate": 6.0848484848484855e-06, "num_tokens": 2292845.0, "completions/mean_length": 97.875, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.71428680419922, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.8492938280105591, "rewards/meter/std": 0.2699936628341675, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.938922643661499, "rewards/lexical_plausibility/std": 0.17275281250476837, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.9123156070709229, "rewards/repeat_penalty/std": 0.05167490988969803, "rewards/repeat_floor/mean": 0.9868473410606384, "rewards/repeat_floor/std": 0.00775123480707407, "rewards/near_duplicate_penalty/mean": 0.9123156070709229, "rewards/near_duplicate_penalty/std": 0.05167490988969803, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33280426263809204, "rewards/total_composite/std": 0.13991817831993103, "reward": 0.33280426263809204, "reward_std": 0.13991817831993103, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14128628373146057, "sampling/sampling_logp_difference/max": 1.5668621063232422, "sampling/importance_sampling_ratio/min": 0.208699032664299, "sampling/importance_sampling_ratio/mean": 1.0547375679016113, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0181243270635605, "clip_ratio/low_mean": 0.038194444961845875, "clip_ratio/low_min": 0.038194444961845875, "clip_ratio/high_mean": 0.0634755166247487, "clip_ratio/high_max": 0.0634755166247487, "clip_ratio/region_mean": 0.10166996158659458, "reward_total_mean": 0.33280426263809204, "reward_meter_mean": 0.8492938280105591, "reward_meter_std": 0.2699936628341675, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.938922643661499, "reward_lexical_plausibility_std": 0.17275281250476837, "reward_repeat_penalty_mean": 0.9123156070709229, "reward_repeat_penalty_std": 0.05167490988969803, "reward_repeat_floor_mean": 0.9868473410606384, "reward_repeat_floor_std": 0.00775123480707407, "reward_near_duplicate_penalty_mean": 0.9123156070709229, "reward_near_duplicate_penalty_std": 0.05167490988969803, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.33280426263809204, "reward_total_composite_std": 0.13991817831993103} {"timestamp_utc": "2026-04-12T20:55:12Z", "mode": "train", "global_step": 1294, "epoch": 0.06810167885900742, "loss": -0.1314, "grad_norm": 2.8284456729888916, "learning_rate": 6.081818181818182e-06, "num_tokens": 2295149.0, "completions/mean_length": 202.0, "completions/min_length": 86.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 98.66667175292969, "completions/min_terminated_length": 86.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.7316447496414185, "rewards/meter/std": 0.21830470860004425, "rewards/count_adherence/mean": 0.5833333730697632, "rewards/count_adherence/std": 0.15430335700511932, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.875, "rewards/count_floor/std": 0.046290989965200424, "rewards/lexical_plausibility/mean": 0.9123651385307312, "rewards/lexical_plausibility/std": 0.16310109198093414, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.16850179433822632, "rewards/repeat_penalty/mean": 0.9727830290794373, "rewards/repeat_penalty/std": 0.03844749927520752, "rewards/repeat_floor/mean": 0.9968199729919434, "rewards/repeat_floor/std": 0.004119279328733683, "rewards/near_duplicate_penalty/mean": 0.9884527325630188, "rewards/near_duplicate_penalty/std": 0.010653919540345669, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839115142822266, "rewards/distinct_2/std": 0.029867565259337425, "rewards/total_composite/mean": 0.2000296264886856, "rewards/total_composite/std": 0.1373065710067749, "reward": 0.2000296264886856, "reward_std": 0.1373065710067749, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13939042389392853, "sampling/sampling_logp_difference/max": 2.2049474716186523, "sampling/importance_sampling_ratio/min": 0.11025631427764893, "sampling/importance_sampling_ratio/mean": 1.0134644508361816, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7392666414380074, "clip_ratio/low_mean": 0.030182072892785072, "clip_ratio/low_min": 0.030182072892785072, "clip_ratio/high_mean": 0.06121049169450998, "clip_ratio/high_max": 0.06121049169450998, "clip_ratio/region_mean": 0.09139256458729506, "reward_total_mean": 0.2000296264886856, "reward_meter_mean": 0.7316447496414185, "reward_meter_std": 0.21830470860004425, "reward_count_adherence_mean": 0.5833333730697632, "reward_count_adherence_std": 0.15430335700511932, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.875, "reward_count_floor_std": 0.046290989965200424, "reward_lexical_plausibility_mean": 0.9123651385307312, "reward_lexical_plausibility_std": 0.16310109198093414, "reward_repeat_penalty_mean": 0.9727830290794373, "reward_repeat_penalty_std": 0.03844749927520752, "reward_repeat_floor_mean": 0.9968199729919434, "reward_repeat_floor_std": 0.004119279328733683, "reward_near_duplicate_penalty_mean": 0.9884527325630188, "reward_near_duplicate_penalty_std": 0.010653919540345669, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839115142822266, "reward_distinct_2_std": 0.029867565259337425, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.16850179433822632, "reward_total_composite_mean": 0.2000296264886856, "reward_total_composite_std": 0.1373065710067749} {"timestamp_utc": "2026-04-12T20:55:26Z", "mode": "train", "global_step": 1295, "epoch": 0.06815430766801747, "loss": -0.0312, "grad_norm": 6.965628147125244, "learning_rate": 6.07878787878788e-06, "num_tokens": 2296697.0, "completions/mean_length": 91.5, "completions/min_length": 28.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 31.428573608398438, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.3820682168006897, "rewards/meter/std": 0.43224993348121643, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9436441659927368, "rewards/lexical_plausibility/std": 0.1593983769416809, "rewards/judge_quality/mean": 0.42500001192092896, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.9394865036010742, "rewards/repeat_penalty/std": 0.0780569463968277, "rewards/repeat_floor/mean": 0.9913161396980286, "rewards/repeat_floor/std": 0.010765504091978073, "rewards/near_duplicate_penalty/mean": 0.948517918586731, "rewards/near_duplicate_penalty/std": 0.05753665417432785, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9893162250518799, "rewards/distinct_2/std": 0.03021823801100254, "rewards/total_composite/mean": 0.19535186886787415, "rewards/total_composite/std": 0.25788185000419617, "reward": 0.19535186886787415, "reward_std": 0.2578818202018738, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16937421262264252, "sampling/sampling_logp_difference/max": 1.2371962070465088, "sampling/importance_sampling_ratio/min": 0.3047093152999878, "sampling/importance_sampling_ratio/mean": 1.0371733903884888, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1494939476251602, "clip_ratio/low_mean": 0.04092689557000995, "clip_ratio/low_min": 0.04092689557000995, "clip_ratio/high_mean": 0.05595238134264946, "clip_ratio/high_max": 0.05595238134264946, "clip_ratio/region_mean": 0.0968792769126594, "reward_total_mean": 0.19535186886787415, "reward_meter_mean": 0.3820682168006897, "reward_meter_std": 0.43224993348121643, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9436441659927368, "reward_lexical_plausibility_std": 0.1593983769416809, "reward_repeat_penalty_mean": 0.9394865036010742, "reward_repeat_penalty_std": 0.0780569463968277, "reward_repeat_floor_mean": 0.9913161396980286, "reward_repeat_floor_std": 0.010765504091978073, "reward_near_duplicate_penalty_mean": 0.948517918586731, "reward_near_duplicate_penalty_std": 0.05753665417432785, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9893162250518799, "reward_distinct_2_std": 0.03021823801100254, "reward_judge_quality_mean": 0.42500001192092896, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.19535186886787415, "reward_total_composite_std": 0.25788185000419617} {"timestamp_utc": "2026-04-12T20:55:44Z", "mode": "train", "global_step": 1296, "epoch": 0.06820693647702752, "loss": -0.0967, "grad_norm": 2.3545382022857666, "learning_rate": 6.0757575757575755e-06, "num_tokens": 2298451.0, "completions/mean_length": 231.25, "completions/min_length": 59.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 62.79999923706055, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.6328991651535034, "rewards/meter/std": 0.46825525164604187, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 0.8044552803039551, "rewards/lexical_plausibility/std": 0.2723645269870758, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.8559375405311584, "rewards/repeat_penalty/std": 0.17017002403736115, "rewards/repeat_floor/mean": 0.9816082715988159, "rewards/repeat_floor/std": 0.01958322897553444, "rewards/near_duplicate_penalty/mean": 0.9228945970535278, "rewards/near_duplicate_penalty/std": 0.048808202147483826, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9449899196624756, "rewards/distinct_2/std": 0.09677664190530777, "rewards/total_composite/mean": 0.19450627267360687, "rewards/total_composite/std": 0.19062136113643646, "reward": 0.19450627267360687, "reward_std": 0.19062136113643646, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1399243324995041, "sampling/sampling_logp_difference/max": 1.9881031513214111, "sampling/importance_sampling_ratio/min": 0.13695494830608368, "sampling/importance_sampling_ratio/mean": 1.0335744619369507, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6328702121973038, "clip_ratio/low_mean": 0.02330508455634117, "clip_ratio/low_min": 0.02330508455634117, "clip_ratio/high_mean": 0.07017860561609268, "clip_ratio/high_max": 0.07017860561609268, "clip_ratio/region_mean": 0.09348369017243385, "reward_total_mean": 0.19450627267360687, "reward_meter_mean": 0.6328991651535034, "reward_meter_std": 0.46825525164604187, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 0.8044552803039551, "reward_lexical_plausibility_std": 0.2723645269870758, "reward_repeat_penalty_mean": 0.8559375405311584, "reward_repeat_penalty_std": 0.17017002403736115, "reward_repeat_floor_mean": 0.9816082715988159, "reward_repeat_floor_std": 0.01958322897553444, "reward_near_duplicate_penalty_mean": 0.9228945970535278, "reward_near_duplicate_penalty_std": 0.048808202147483826, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9449899196624756, "reward_distinct_2_std": 0.09677664190530777, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.19450627267360687, "reward_total_composite_std": 0.19062136113643646} {"timestamp_utc": "2026-04-12T20:55:53Z", "mode": "train", "global_step": 1297, "epoch": 0.06825956528603758, "loss": -0.0416, "grad_norm": 18.243976593017578, "learning_rate": 6.072727272727274e-06, "num_tokens": 2299935.0, "completions/mean_length": 35.5, "completions/min_length": 19.0, "completions/max_length": 44.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.5, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.8618534803390503, "rewards/meter/std": 0.3101614713668823, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.20951901376247406, "rewards/repeat_penalty/mean": 0.864165186882019, "rewards/repeat_penalty/std": 0.17676688730716705, "rewards/repeat_floor/mean": 0.9873805046081543, "rewards/repeat_floor/std": 0.017130037769675255, "rewards/near_duplicate_penalty/mean": 0.9669445753097534, "rewards/near_duplicate_penalty/std": 0.04131477326154709, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9773755669593811, "rewards/distinct_2/std": 0.06399156153202057, "rewards/total_composite/mean": 0.39117056131362915, "rewards/total_composite/std": 0.24060793220996857, "reward": 0.39117056131362915, "reward_std": 0.24060791730880737, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16465415060520172, "sampling/sampling_logp_difference/max": 1.4147634506225586, "sampling/importance_sampling_ratio/min": 0.2746078073978424, "sampling/importance_sampling_ratio/mean": 1.0316237211227417, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2209869027137756, "clip_ratio/low_mean": 0.08628104254603386, "clip_ratio/low_min": 0.08628104254603386, "clip_ratio/high_mean": 0.09904278069734573, "clip_ratio/high_max": 0.09904278069734573, "clip_ratio/region_mean": 0.1853238232433796, "reward_total_mean": 0.39117056131362915, "reward_meter_mean": 0.8618534803390503, "reward_meter_std": 0.3101614713668823, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.864165186882019, "reward_repeat_penalty_std": 0.17676688730716705, "reward_repeat_floor_mean": 0.9873805046081543, "reward_repeat_floor_std": 0.017130037769675255, "reward_near_duplicate_penalty_mean": 0.9669445753097534, "reward_near_duplicate_penalty_std": 0.04131477326154709, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9773755669593811, "reward_distinct_2_std": 0.06399156153202057, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.20951901376247406, "reward_total_composite_mean": 0.39117056131362915, "reward_total_composite_std": 0.24060793220996857} {"timestamp_utc": "2026-04-12T20:56:02Z", "mode": "train", "global_step": 1298, "epoch": 0.06831219409504763, "loss": 0.0695, "grad_norm": 11.957763671875, "learning_rate": 6.06969696969697e-06, "num_tokens": 2301799.0, "completions/mean_length": 70.0, "completions/min_length": 56.0, "completions/max_length": 89.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 70.0, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 89.0, "rewards/meter/mean": 0.9721131920814514, "rewards/meter/std": 0.036159951239824295, "rewards/count_adherence/mean": 0.6500000357627869, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8949999809265137, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5249999761581421, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9271843433380127, "rewards/repeat_penalty/std": 0.06422819942235947, "rewards/repeat_floor/mean": 0.9918217658996582, "rewards/repeat_floor/std": 0.007283197250217199, "rewards/near_duplicate_penalty/mean": 0.9757203459739685, "rewards/near_duplicate_penalty/std": 0.025583982467651367, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9495973587036133, "rewards/distinct_2/std": 0.04776235297322273, "rewards/total_composite/mean": 0.4547930359840393, "rewards/total_composite/std": 0.10195016860961914, "reward": 0.4547930359840393, "reward_std": 0.10195016115903854, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16802051663398743, "sampling/sampling_logp_difference/max": 2.2862086296081543, "sampling/importance_sampling_ratio/min": 0.10165112465620041, "sampling/importance_sampling_ratio/mean": 1.0065144300460815, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9691305160522461, "clip_ratio/low_mean": 0.0830877535045147, "clip_ratio/low_min": 0.0830877535045147, "clip_ratio/high_mean": 0.0645708478987217, "clip_ratio/high_max": 0.0645708478987217, "clip_ratio/region_mean": 0.1476586014032364, "reward_total_mean": 0.4547930359840393, "reward_meter_mean": 0.9721131920814514, "reward_meter_std": 0.036159951239824295, "reward_count_adherence_mean": 0.6500000357627869, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8949999809265137, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9271843433380127, "reward_repeat_penalty_std": 0.06422819942235947, "reward_repeat_floor_mean": 0.9918217658996582, "reward_repeat_floor_std": 0.007283197250217199, "reward_near_duplicate_penalty_mean": 0.9757203459739685, "reward_near_duplicate_penalty_std": 0.025583982467651367, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9495973587036133, "reward_distinct_2_std": 0.04776235297322273, "reward_judge_quality_mean": 0.5249999761581421, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.4547930359840393, "reward_total_composite_std": 0.10195016860961914} {"timestamp_utc": "2026-04-12T20:56:13Z", "mode": "train", "global_step": 1299, "epoch": 0.06836482290405768, "loss": -0.0045, "grad_norm": 9.149087905883789, "learning_rate": 6.066666666666667e-06, "num_tokens": 2304051.0, "completions/mean_length": 94.5, "completions/min_length": 82.0, "completions/max_length": 107.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 94.5, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 107.0, "rewards/meter/mean": 0.0871487706899643, "rewards/meter/std": 0.05589567869901657, "rewards/count_adherence/mean": 0.59375, "rewards/count_adherence/std": 0.0578637570142746, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8781249523162842, "rewards/count_floor/std": 0.017359111458063126, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.8439352512359619, "rewards/repeat_penalty/std": 0.11250229924917221, "rewards/repeat_floor/mean": 0.9819709062576294, "rewards/repeat_floor/std": 0.014264138415455818, "rewards/near_duplicate_penalty/mean": 0.9465708136558533, "rewards/near_duplicate_penalty/std": 0.04803643375635147, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.8939341306686401, "rewards/distinct_2/std": 0.06730176508426666, "rewards/total_composite/mean": 0.02984056994318962, "rewards/total_composite/std": 0.018717072904109955, "reward": 0.02984056994318962, "reward_std": 0.018717072904109955, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1701647937297821, "sampling/sampling_logp_difference/max": 4.698284149169922, "sampling/importance_sampling_ratio/min": 0.009110896848142147, "sampling/importance_sampling_ratio/mean": 1.019084095954895, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.194883018732071, "clip_ratio/low_mean": 0.04696781188249588, "clip_ratio/low_min": 0.04696781188249588, "clip_ratio/high_mean": 0.09871867671608925, "clip_ratio/high_max": 0.09871867671608925, "clip_ratio/region_mean": 0.14568648859858513, "reward_total_mean": 0.02984056994318962, "reward_meter_mean": 0.0871487706899643, "reward_meter_std": 0.05589567869901657, "reward_count_adherence_mean": 0.59375, "reward_count_adherence_std": 0.0578637570142746, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8781249523162842, "reward_count_floor_std": 0.017359111458063126, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8439352512359619, "reward_repeat_penalty_std": 0.11250229924917221, "reward_repeat_floor_mean": 0.9819709062576294, "reward_repeat_floor_std": 0.014264138415455818, "reward_near_duplicate_penalty_mean": 0.9465708136558533, "reward_near_duplicate_penalty_std": 0.04803643375635147, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.8939341306686401, "reward_distinct_2_std": 0.06730176508426666, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.02984056994318962, "reward_total_composite_std": 0.018717072904109955} {"timestamp_utc": "2026-04-12T20:56:27Z", "mode": "train", "global_step": 1300, "epoch": 0.06841745171306773, "loss": -0.114, "grad_norm": 2.764055013656616, "learning_rate": 6.063636363636364e-06, "num_tokens": 2305478.0, "completions/mean_length": 99.375, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 40.42857360839844, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.8953641653060913, "rewards/meter/std": 0.1911994367837906, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9293834567070007, "rewards/lexical_plausibility/std": 0.19973376393318176, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.9048247933387756, "rewards/repeat_penalty/std": 0.12128104269504547, "rewards/repeat_floor/mean": 0.9914360046386719, "rewards/repeat_floor/std": 0.008178388699889183, "rewards/near_duplicate_penalty/mean": 0.9736760854721069, "rewards/near_duplicate_penalty/std": 0.02217986062169075, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.990384578704834, "rewards/distinct_2/std": 0.027196412906050682, "rewards/total_composite/mean": 0.34310245513916016, "rewards/total_composite/std": 0.14191284775733948, "reward": 0.34310245513916016, "reward_std": 0.14191284775733948, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14120209217071533, "sampling/sampling_logp_difference/max": 1.3661503791809082, "sampling/importance_sampling_ratio/min": 0.2550870478153229, "sampling/importance_sampling_ratio/mean": 1.0422509908676147, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9768808931112289, "clip_ratio/low_mean": 0.04039634112268686, "clip_ratio/low_min": 0.04039634112268686, "clip_ratio/high_mean": 0.05309934401884675, "clip_ratio/high_max": 0.05309934401884675, "clip_ratio/region_mean": 0.09349568514153361, "reward_total_mean": 0.34310245513916016, "reward_meter_mean": 0.8953641653060913, "reward_meter_std": 0.1911994367837906, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9293834567070007, "reward_lexical_plausibility_std": 0.19973376393318176, "reward_repeat_penalty_mean": 0.9048247933387756, "reward_repeat_penalty_std": 0.12128104269504547, "reward_repeat_floor_mean": 0.9914360046386719, "reward_repeat_floor_std": 0.008178388699889183, "reward_near_duplicate_penalty_mean": 0.9736760854721069, "reward_near_duplicate_penalty_std": 0.02217986062169075, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.990384578704834, "reward_distinct_2_std": 0.027196412906050682, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.34310245513916016, "reward_total_composite_std": 0.14191284775733948} {"timestamp_utc": "2026-04-12T20:58:29Z", "mode": "eval", "global_step": 1300, "epoch": 0.06841745171306773, "eval_loss": NaN, "eval_runtime": 120.9789, "eval_samples_per_second": 0.86, "eval_steps_per_second": 0.107, "eval_num_tokens": 2305478.0, "eval_completions/mean_length": 109.5576923076923, "eval_completions/min_length": 33.92307692307692, "eval_completions/max_length": 296.2307692307692, "eval_completions/clipped_ratio": 0.038461538461538464, "eval_completions/mean_terminated_length": 93.45741858849159, "eval_completions/min_terminated_length": 33.92307692307692, "eval_completions/max_terminated_length": 196.0, "eval_rewards/meter/mean": 0.6069046258926392, "eval_rewards/meter/std": 0.361237400999436, "eval_rewards/count_adherence/mean": 0.7424028653364915, "eval_rewards/count_adherence/std": 0.16372321718014204, "eval_rewards/arabic_clean/mean": 0.9326923076923077, "eval_rewards/arabic_clean/std": 0.15280617429659918, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9971153827813956, "eval_rewards/arabic_floor/std": 0.00534126850274893, "eval_rewards/count_floor/mean": 0.9227208632689256, "eval_rewards/count_floor/std": 0.04911696968170313, "eval_rewards/lexical_plausibility/mean": 0.9813547226098868, "eval_rewards/lexical_plausibility/std": 0.047964142492184274, "eval_rewards/judge_quality/mean": 0.4107692241668701, "eval_rewards/judge_quality/std": 0.17742446007636878, "eval_rewards/repeat_penalty/mean": 0.8255389011823214, "eval_rewards/repeat_penalty/std": 0.1907717648607034, "eval_rewards/repeat_floor/mean": 0.9801494341630203, "eval_rewards/repeat_floor/std": 0.022458405162279423, "eval_rewards/near_duplicate_penalty/mean": 0.9443351626396179, "eval_rewards/near_duplicate_penalty/std": 0.05648960918188095, "eval_rewards/opening_diversity/mean": 0.9528421988854041, "eval_rewards/opening_diversity/std": 0.087744112771291, "eval_rewards/distinct_2/mean": 0.9036515125861535, "eval_rewards/distinct_2/std": 0.1262516829256828, "eval_rewards/total_composite/mean": 0.23303316189692572, "eval_rewards/total_composite/std": 0.18125356791111139, "eval_reward": 0.23303316189692572, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.07943717848796111, "eval_sampling/sampling_logp_difference/max": 1.0771342057448168, "eval_sampling/importance_sampling_ratio/min": 0.3445100234105037, "eval_sampling/importance_sampling_ratio/mean": 1.0226388894594634, "eval_sampling/importance_sampling_ratio/max": 1.5075985926848192, "eval_entropy": 0.9149978986153235, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.23303316189692572, "eval_reward_meter_mean": 0.6069046258926392, "eval_reward_meter_std": 0.361237400999436, "eval_reward_count_adherence_mean": 0.7424028653364915, "eval_reward_count_adherence_std": 0.16372321718014204, "eval_reward_arabic_clean_mean": 0.9326923076923077, "eval_reward_arabic_clean_std": 0.15280617429659918, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9971153827813956, "eval_reward_arabic_floor_std": 0.00534126850274893, "eval_reward_count_floor_mean": 0.9227208632689256, "eval_reward_count_floor_std": 0.04911696968170313, "eval_reward_lexical_plausibility_mean": 0.9813547226098868, "eval_reward_lexical_plausibility_std": 0.047964142492184274, "eval_reward_repeat_penalty_mean": 0.8255389011823214, "eval_reward_repeat_penalty_std": 0.1907717648607034, "eval_reward_repeat_floor_mean": 0.9801494341630203, "eval_reward_repeat_floor_std": 0.022458405162279423, "eval_reward_near_duplicate_penalty_mean": 0.9443351626396179, "eval_reward_near_duplicate_penalty_std": 0.05648960918188095, "eval_reward_opening_diversity_mean": 0.9528421988854041, "eval_reward_opening_diversity_std": 0.087744112771291, "eval_reward_distinct_2_mean": 0.9036515125861535, "eval_reward_distinct_2_std": 0.1262516829256828, "eval_reward_judge_quality_mean": 0.4107692241668701, "eval_reward_judge_quality_std": 0.17742446007636878, "eval_reward_total_composite_mean": 0.23303316189692572, "eval_reward_total_composite_std": 0.18125356791111139} {"timestamp_utc": "2026-04-12T20:58:46Z", "mode": "train", "global_step": 1301, "epoch": 0.06847008052207779, "loss": -0.0484, "grad_norm": 2.3586647510528564, "learning_rate": 6.060606060606061e-06, "num_tokens": 2307009.0, "completions/mean_length": 221.375, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 47.0, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 52.0, "rewards/meter/mean": 0.056619659066200256, "rewards/meter/std": 0.06666263937950134, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.8429890871047974, "rewards/lexical_plausibility/std": 0.21044902503490448, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.1767766922712326, "rewards/repeat_penalty/mean": 0.7565028071403503, "rewards/repeat_penalty/std": 0.17413675785064697, "rewards/repeat_floor/mean": 0.9719423651695251, "rewards/repeat_floor/std": 0.022083863615989685, "rewards/near_duplicate_penalty/mean": 0.8957297801971436, "rewards/near_duplicate_penalty/std": 0.07852613180875778, "rewards/opening_diversity/mean": 0.893750011920929, "rewards/opening_diversity/std": 0.1237436905503273, "rewards/distinct_2/mean": 0.9328654408454895, "rewards/distinct_2/std": 0.07793726772069931, "rewards/total_composite/mean": 0.01084198523312807, "rewards/total_composite/std": 0.015057297423481941, "reward": 0.01084198523312807, "reward_std": 0.015057297423481941, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13505558669567108, "sampling/sampling_logp_difference/max": 1.7290325164794922, "sampling/importance_sampling_ratio/min": 0.17745602130889893, "sampling/importance_sampling_ratio/mean": 1.0444562435150146, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.941662922501564, "clip_ratio/low_mean": 0.033517041709274054, "clip_ratio/low_min": 0.033517041709274054, "clip_ratio/high_mean": 0.03996829688549042, "clip_ratio/high_max": 0.03996829688549042, "clip_ratio/region_mean": 0.07348533859476447, "reward_total_mean": 0.01084198523312807, "reward_meter_mean": 0.056619659066200256, "reward_meter_std": 0.06666263937950134, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.8429890871047974, "reward_lexical_plausibility_std": 0.21044902503490448, "reward_repeat_penalty_mean": 0.7565028071403503, "reward_repeat_penalty_std": 0.17413675785064697, "reward_repeat_floor_mean": 0.9719423651695251, "reward_repeat_floor_std": 0.022083863615989685, "reward_near_duplicate_penalty_mean": 0.8957297801971436, "reward_near_duplicate_penalty_std": 0.07852613180875778, "reward_opening_diversity_mean": 0.893750011920929, "reward_opening_diversity_std": 0.1237436905503273, "reward_distinct_2_mean": 0.9328654408454895, "reward_distinct_2_std": 0.07793726772069931, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.1767766922712326, "reward_total_composite_mean": 0.01084198523312807, "reward_total_composite_std": 0.015057297423481941} {"timestamp_utc": "2026-04-12T20:58:56Z", "mode": "train", "global_step": 1302, "epoch": 0.06852270933108784, "loss": 0.0079, "grad_norm": 13.128995895385742, "learning_rate": 6.057575757575757e-06, "num_tokens": 2308613.0, "completions/mean_length": 37.5, "completions/min_length": 26.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.5, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.947344958782196, "rewards/meter/std": 0.06553370505571365, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.7058526277542114, "rewards/repeat_penalty/std": 0.3451331853866577, "rewards/repeat_floor/mean": 0.9632654190063477, "rewards/repeat_floor/std": 0.04565392807126045, "rewards/near_duplicate_penalty/mean": 0.9015648365020752, "rewards/near_duplicate_penalty/std": 0.10774897783994675, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.2834733724594116, "rewards/distinct_2/mean": 0.8808964490890503, "rewards/distinct_2/std": 0.14804908633232117, "rewards/total_composite/mean": 0.2578604817390442, "rewards/total_composite/std": 0.10757430642843246, "reward": 0.2578604817390442, "reward_std": 0.10757429152727127, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14275914430618286, "sampling/sampling_logp_difference/max": 1.5708026885986328, "sampling/importance_sampling_ratio/min": 0.2078782469034195, "sampling/importance_sampling_ratio/mean": 1.0205974578857422, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0866042152047157, "clip_ratio/low_mean": 0.02970750373788178, "clip_ratio/low_min": 0.02970750373788178, "clip_ratio/high_mean": 0.08215924631804228, "clip_ratio/high_max": 0.08215924631804228, "clip_ratio/region_mean": 0.11186675005592406, "reward_total_mean": 0.2578604817390442, "reward_meter_mean": 0.947344958782196, "reward_meter_std": 0.06553370505571365, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7058526277542114, "reward_repeat_penalty_std": 0.3451331853866577, "reward_repeat_floor_mean": 0.9632654190063477, "reward_repeat_floor_std": 0.04565392807126045, "reward_near_duplicate_penalty_mean": 0.9015648365020752, "reward_near_duplicate_penalty_std": 0.10774897783994675, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.2834733724594116, "reward_distinct_2_mean": 0.8808964490890503, "reward_distinct_2_std": 0.14804908633232117, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.2578604817390442, "reward_total_composite_std": 0.10757430642843246} {"timestamp_utc": "2026-04-12T20:59:06Z", "mode": "train", "global_step": 1303, "epoch": 0.06857533814009789, "loss": -0.0018, "grad_norm": 15.61508560180664, "learning_rate": 6.0545454545454555e-06, "num_tokens": 2310201.0, "completions/mean_length": 31.5, "completions/min_length": 23.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.5, "completions/min_terminated_length": 23.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.3252526521682739, "rewards/meter/std": 0.33772918581962585, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.956250011920929, "rewards/arabic_floor/std": 0.1237436980009079, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.3142679035663605, "rewards/repeat_penalty/mean": 0.9827235341072083, "rewards/repeat_penalty/std": 0.014099577441811562, "rewards/repeat_floor/mean": 0.9974085688591003, "rewards/repeat_floor/std": 0.0021149360109120607, "rewards/near_duplicate_penalty/mean": 0.9827235341072083, "rewards/near_duplicate_penalty/std": 0.014099577441811562, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.10949956625699997, "rewards/total_composite/std": 0.10760539025068283, "reward": 0.10949956625699997, "reward_std": 0.10760539025068283, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1416730284690857, "sampling/sampling_logp_difference/max": 1.2041034698486328, "sampling/importance_sampling_ratio/min": 0.345889151096344, "sampling/importance_sampling_ratio/mean": 1.0523443222045898, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9178810492157936, "clip_ratio/low_mean": 0.09333518287166953, "clip_ratio/low_min": 0.09333518287166953, "clip_ratio/high_mean": 0.06143673602491617, "clip_ratio/high_max": 0.06143673602491617, "clip_ratio/region_mean": 0.1547719188965857, "reward_total_mean": 0.10949956625699997, "reward_meter_mean": 0.3252526521682739, "reward_meter_std": 0.33772918581962585, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.956250011920929, "reward_arabic_floor_std": 0.1237436980009079, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9827235341072083, "reward_repeat_penalty_std": 0.014099577441811562, "reward_repeat_floor_mean": 0.9974085688591003, "reward_repeat_floor_std": 0.0021149360109120607, "reward_near_duplicate_penalty_mean": 0.9827235341072083, "reward_near_duplicate_penalty_std": 0.014099577441811562, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.3142679035663605, "reward_total_composite_mean": 0.10949956625699997, "reward_total_composite_std": 0.10760539025068283} {"timestamp_utc": "2026-04-12T20:59:14Z", "mode": "train", "global_step": 1304, "epoch": 0.06862796694910794, "loss": 0.0429, "grad_norm": 24.225555419921875, "learning_rate": 6.051515151515152e-06, "num_tokens": 2311558.0, "completions/mean_length": 16.625, "completions/min_length": 15.0, "completions/max_length": 18.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.625, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 18.0, "rewards/meter/mean": 0.9575055837631226, "rewards/meter/std": 0.05491168797016144, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.831250011920929, "rewards/judge_quality/std": 0.27559998631477356, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7807838320732117, "rewards/total_composite/std": 0.26158440113067627, "reward": 0.7807838320732117, "reward_std": 0.2615843713283539, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13659630715847015, "sampling/sampling_logp_difference/max": 1.3137197494506836, "sampling/importance_sampling_ratio/min": 0.2688182592391968, "sampling/importance_sampling_ratio/mean": 1.015814185142517, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8701995760202408, "clip_ratio/low_mean": 0.0363562093116343, "clip_ratio/low_min": 0.0363562093116343, "clip_ratio/high_mean": 0.1007046583108604, "clip_ratio/high_max": 0.1007046583108604, "clip_ratio/region_mean": 0.1370608676224947, "reward_total_mean": 0.7807838320732117, "reward_meter_mean": 0.9575055837631226, "reward_meter_std": 0.05491168797016144, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.831250011920929, "reward_judge_quality_std": 0.27559998631477356, "reward_total_composite_mean": 0.7807838320732117, "reward_total_composite_std": 0.26158440113067627} {"timestamp_utc": "2026-04-12T20:59:21Z", "mode": "train", "global_step": 1305, "epoch": 0.068680595758118, "loss": 0.108, "grad_norm": 20.345901489257812, "learning_rate": 6.048484848484849e-06, "num_tokens": 2312988.0, "completions/mean_length": 21.75, "completions/min_length": 19.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.75, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.6204198598861694, "rewards/meter/std": 0.4102761447429657, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6762499809265137, "rewards/judge_quality/std": 0.3651198446750641, "rewards/repeat_penalty/mean": 0.7637537717819214, "rewards/repeat_penalty/std": 0.09457574039697647, "rewards/repeat_floor/mean": 0.9846832752227783, "rewards/repeat_floor/std": 0.006749381311237812, "rewards/near_duplicate_penalty/mean": 0.9969267845153809, "rewards/near_duplicate_penalty/std": 0.008692282252013683, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9807692170143127, "rewards/distinct_2/std": 0.054392825812101364, "rewards/total_composite/mean": 0.4669201970100403, "rewards/total_composite/std": 0.4180513024330139, "reward": 0.4669201970100403, "reward_std": 0.41805127263069153, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13564196228981018, "sampling/sampling_logp_difference/max": 1.8703927993774414, "sampling/importance_sampling_ratio/min": 0.1540631353855133, "sampling/importance_sampling_ratio/mean": 1.0397413969039917, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.033564269542694, "clip_ratio/low_mean": 0.08855090383440256, "clip_ratio/low_min": 0.08855090383440256, "clip_ratio/high_mean": 0.025689222384244204, "clip_ratio/high_max": 0.025689222384244204, "clip_ratio/region_mean": 0.11424012621864676, "reward_total_mean": 0.4669201970100403, "reward_meter_mean": 0.6204198598861694, "reward_meter_std": 0.4102761447429657, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7637537717819214, "reward_repeat_penalty_std": 0.09457574039697647, "reward_repeat_floor_mean": 0.9846832752227783, "reward_repeat_floor_std": 0.006749381311237812, "reward_near_duplicate_penalty_mean": 0.9969267845153809, "reward_near_duplicate_penalty_std": 0.008692282252013683, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9807692170143127, "reward_distinct_2_std": 0.054392825812101364, "reward_judge_quality_mean": 0.6762499809265137, "reward_judge_quality_std": 0.3651198446750641, "reward_total_composite_mean": 0.4669201970100403, "reward_total_composite_std": 0.4180513024330139} {"timestamp_utc": "2026-04-12T20:59:35Z", "mode": "train", "global_step": 1306, "epoch": 0.06873322456712805, "loss": -0.1344, "grad_norm": 2.2445077896118164, "learning_rate": 6.0454545454545456e-06, "num_tokens": 2315013.0, "completions/mean_length": 245.125, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 85.0, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.6065161228179932, "rewards/meter/std": 0.27965378761291504, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 0.8701736927032471, "rewards/lexical_plausibility/std": 0.18445897102355957, "rewards/judge_quality/mean": 0.2562499940395355, "rewards/judge_quality/std": 0.16569657623767853, "rewards/repeat_penalty/mean": 0.950911819934845, "rewards/repeat_penalty/std": 0.015403605066239834, "rewards/repeat_floor/mean": 0.9935417771339417, "rewards/repeat_floor/std": 0.0018675546161830425, "rewards/near_duplicate_penalty/mean": 0.9666640758514404, "rewards/near_duplicate_penalty/std": 0.013528765179216862, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9838022589683533, "rewards/distinct_2/std": 0.01680346392095089, "rewards/total_composite/mean": 0.1783428192138672, "rewards/total_composite/std": 0.12931343913078308, "reward": 0.1783428192138672, "reward_std": 0.1293134242296219, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1359337866306305, "sampling/sampling_logp_difference/max": 1.2560145854949951, "sampling/importance_sampling_ratio/min": 0.28478676080703735, "sampling/importance_sampling_ratio/mean": 1.013946294784546, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6520774513483047, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.0884337117895484, "clip_ratio/high_max": 0.0884337117895484, "clip_ratio/region_mean": 0.0884337117895484, "reward_total_mean": 0.1783428192138672, "reward_meter_mean": 0.6065161228179932, "reward_meter_std": 0.27965378761291504, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 0.8701736927032471, "reward_lexical_plausibility_std": 0.18445897102355957, "reward_repeat_penalty_mean": 0.950911819934845, "reward_repeat_penalty_std": 0.015403605066239834, "reward_repeat_floor_mean": 0.9935417771339417, "reward_repeat_floor_std": 0.0018675546161830425, "reward_near_duplicate_penalty_mean": 0.9666640758514404, "reward_near_duplicate_penalty_std": 0.013528765179216862, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9838022589683533, "reward_distinct_2_std": 0.01680346392095089, "reward_judge_quality_mean": 0.2562499940395355, "reward_judge_quality_std": 0.16569657623767853, "reward_total_composite_mean": 0.1783428192138672, "reward_total_composite_std": 0.12931343913078308} {"timestamp_utc": "2026-04-12T20:59:43Z", "mode": "train", "global_step": 1307, "epoch": 0.0687858533761381, "loss": -0.0239, "grad_norm": 16.9303035736084, "learning_rate": 6.042424242424243e-06, "num_tokens": 2316525.0, "completions/mean_length": 21.0, "completions/min_length": 19.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.0, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.9783234000205994, "rewards/meter/std": 0.021103810518980026, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9800419807434082, "rewards/lexical_plausibility/std": 0.05644970014691353, "rewards/judge_quality/mean": 0.8612500429153442, "rewards/judge_quality/std": 0.16617010533809662, "rewards/repeat_penalty/mean": 0.7399276494979858, "rewards/repeat_penalty/std": 0.028488805517554283, "rewards/repeat_floor/mean": 0.9829855561256409, "rewards/repeat_floor/std": 0.005697769112884998, "rewards/near_duplicate_penalty/mean": 0.9865702390670776, "rewards/near_duplicate_penalty/std": 0.03798507899045944, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.8284487724304199, "rewards/total_composite/std": 0.16166505217552185, "reward": 0.8284487724304199, "reward_std": 0.16166505217552185, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14091189205646515, "sampling/sampling_logp_difference/max": 1.6892740726470947, "sampling/importance_sampling_ratio/min": 0.18465352058410645, "sampling/importance_sampling_ratio/mean": 0.9874743819236755, "sampling/importance_sampling_ratio/max": 1.9850788116455078, "entropy": 0.8596550449728966, "clip_ratio/low_mean": 0.01315789483487606, "clip_ratio/low_min": 0.01315789483487606, "clip_ratio/high_mean": 0.14212603773921728, "clip_ratio/high_max": 0.14212603773921728, "clip_ratio/region_mean": 0.15528393257409334, "reward_total_mean": 0.8284487724304199, "reward_meter_mean": 0.9783234000205994, "reward_meter_std": 0.021103810518980026, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9800419807434082, "reward_lexical_plausibility_std": 0.05644970014691353, "reward_repeat_penalty_mean": 0.7399276494979858, "reward_repeat_penalty_std": 0.028488805517554283, "reward_repeat_floor_mean": 0.9829855561256409, "reward_repeat_floor_std": 0.005697769112884998, "reward_near_duplicate_penalty_mean": 0.9865702390670776, "reward_near_duplicate_penalty_std": 0.03798507899045944, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8612500429153442, "reward_judge_quality_std": 0.16617010533809662, "reward_total_composite_mean": 0.8284487724304199, "reward_total_composite_std": 0.16166505217552185} {"timestamp_utc": "2026-04-12T20:59:57Z", "mode": "train", "global_step": 1308, "epoch": 0.06883848218514815, "loss": -0.1655, "grad_norm": 2.0397679805755615, "learning_rate": 6.039393939393939e-06, "num_tokens": 2318476.0, "completions/mean_length": 190.875, "completions/min_length": 64.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 83.83333587646484, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.9645935297012329, "rewards/meter/std": 0.02735067345201969, "rewards/count_adherence/mean": 0.90625, "rewards/count_adherence/std": 0.12938730418682098, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.971875011920929, "rewards/count_floor/std": 0.0388161838054657, "rewards/lexical_plausibility/mean": 0.9290376305580139, "rewards/lexical_plausibility/std": 0.1357519030570984, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.8682023286819458, "rewards/repeat_penalty/std": 0.07635921239852905, "rewards/repeat_floor/mean": 0.9851706027984619, "rewards/repeat_floor/std": 0.00832895003259182, "rewards/near_duplicate_penalty/mean": 0.9575604200363159, "rewards/near_duplicate_penalty/std": 0.024139340966939926, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9059618711471558, "rewards/distinct_2/std": 0.06573186069726944, "rewards/total_composite/mean": 0.32616159319877625, "rewards/total_composite/std": 0.15014615654945374, "reward": 0.32616159319877625, "reward_std": 0.15014615654945374, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16500526666641235, "sampling/sampling_logp_difference/max": 1.8273468017578125, "sampling/importance_sampling_ratio/min": 0.1608397364616394, "sampling/importance_sampling_ratio/mean": 1.0042880773544312, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6830124631524086, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.11945360247045755, "clip_ratio/high_max": 0.11945360247045755, "clip_ratio/region_mean": 0.11945360247045755, "reward_total_mean": 0.32616159319877625, "reward_meter_mean": 0.9645935297012329, "reward_meter_std": 0.02735067345201969, "reward_count_adherence_mean": 0.90625, "reward_count_adherence_std": 0.12938730418682098, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.971875011920929, "reward_count_floor_std": 0.0388161838054657, "reward_lexical_plausibility_mean": 0.9290376305580139, "reward_lexical_plausibility_std": 0.1357519030570984, "reward_repeat_penalty_mean": 0.8682023286819458, "reward_repeat_penalty_std": 0.07635921239852905, "reward_repeat_floor_mean": 0.9851706027984619, "reward_repeat_floor_std": 0.00832895003259182, "reward_near_duplicate_penalty_mean": 0.9575604200363159, "reward_near_duplicate_penalty_std": 0.024139340966939926, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9059618711471558, "reward_distinct_2_std": 0.06573186069726944, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.32616159319877625, "reward_total_composite_std": 0.15014615654945374} {"timestamp_utc": "2026-04-12T21:00:06Z", "mode": "train", "global_step": 1309, "epoch": 0.0688911109941582, "loss": -0.0161, "grad_norm": 10.594659805297852, "learning_rate": 6.0363636363636365e-06, "num_tokens": 2320583.0, "completions/mean_length": 80.375, "completions/min_length": 68.0, "completions/max_length": 97.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 80.375, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 97.0, "rewards/meter/mean": 0.6064520478248596, "rewards/meter/std": 0.43351876735687256, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9343750476837158, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9555724263191223, "rewards/repeat_penalty/std": 0.058471377938985825, "rewards/repeat_floor/mean": 0.9941740036010742, "rewards/repeat_floor/std": 0.00724637508392334, "rewards/near_duplicate_penalty/mean": 0.9713509678840637, "rewards/near_duplicate_penalty/std": 0.029811298474669456, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9830142855644226, "rewards/distinct_2/std": 0.03562766686081886, "rewards/total_composite/mean": 0.21657785773277283, "rewards/total_composite/std": 0.15629920363426208, "reward": 0.21657785773277283, "reward_std": 0.15629920363426208, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15427684783935547, "sampling/sampling_logp_difference/max": 1.7791357040405273, "sampling/importance_sampling_ratio/min": 0.1687839776277542, "sampling/importance_sampling_ratio/mean": 1.006324052810669, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0275729671120644, "clip_ratio/low_mean": 0.05930265784263611, "clip_ratio/low_min": 0.05930265784263611, "clip_ratio/high_mean": 0.08229111041873693, "clip_ratio/high_max": 0.08229111041873693, "clip_ratio/region_mean": 0.14159376826137304, "reward_total_mean": 0.21657785773277283, "reward_meter_mean": 0.6064520478248596, "reward_meter_std": 0.43351876735687256, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9343750476837158, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9555724263191223, "reward_repeat_penalty_std": 0.058471377938985825, "reward_repeat_floor_mean": 0.9941740036010742, "reward_repeat_floor_std": 0.00724637508392334, "reward_near_duplicate_penalty_mean": 0.9713509678840637, "reward_near_duplicate_penalty_std": 0.029811298474669456, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9830142855644226, "reward_distinct_2_std": 0.03562766686081886, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.21657785773277283, "reward_total_composite_std": 0.15629920363426208} {"timestamp_utc": "2026-04-12T21:00:16Z", "mode": "train", "global_step": 1310, "epoch": 0.06894373980316826, "loss": 0.0243, "grad_norm": 12.423072814941406, "learning_rate": 6.033333333333335e-06, "num_tokens": 2322872.0, "completions/mean_length": 83.125, "completions/min_length": 74.0, "completions/max_length": 92.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 83.125, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.7969707250595093, "rewards/meter/std": 0.2704329192638397, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.887499988079071, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9143716096878052, "rewards/repeat_penalty/std": 0.055609311908483505, "rewards/repeat_floor/mean": 0.9902158379554749, "rewards/repeat_floor/std": 0.00613121222704649, "rewards/near_duplicate_penalty/mean": 0.9686281085014343, "rewards/near_duplicate_penalty/std": 0.019577756524086, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9435734748840332, "rewards/distinct_2/std": 0.04531228914856911, "rewards/total_composite/mean": 0.29415443539619446, "rewards/total_composite/std": 0.10011166334152222, "reward": 0.29415443539619446, "reward_std": 0.10011165589094162, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18388620018959045, "sampling/sampling_logp_difference/max": 3.9115958213806152, "sampling/importance_sampling_ratio/min": 0.020008545368909836, "sampling/importance_sampling_ratio/mean": 1.0047262907028198, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9870238676667213, "clip_ratio/low_mean": 0.05580186937004328, "clip_ratio/low_min": 0.05580186937004328, "clip_ratio/high_mean": 0.10272555612027645, "clip_ratio/high_max": 0.10272555612027645, "clip_ratio/region_mean": 0.15852742549031973, "reward_total_mean": 0.29415443539619446, "reward_meter_mean": 0.7969707250595093, "reward_meter_std": 0.2704329192638397, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.887499988079071, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9143716096878052, "reward_repeat_penalty_std": 0.055609311908483505, "reward_repeat_floor_mean": 0.9902158379554749, "reward_repeat_floor_std": 0.00613121222704649, "reward_near_duplicate_penalty_mean": 0.9686281085014343, "reward_near_duplicate_penalty_std": 0.019577756524086, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9435734748840332, "reward_distinct_2_std": 0.04531228914856911, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.29415443539619446, "reward_total_composite_std": 0.10011166334152222} {"timestamp_utc": "2026-04-12T21:00:25Z", "mode": "train", "global_step": 1311, "epoch": 0.06899636861217831, "loss": 0.0398, "grad_norm": 12.791458129882812, "learning_rate": 6.030303030303031e-06, "num_tokens": 2325039.0, "completions/mean_length": 93.875, "completions/min_length": 77.0, "completions/max_length": 104.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.875, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.9819897413253784, "rewards/meter/std": 0.03369574621319771, "rewards/count_adherence/mean": 0.6666666865348816, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8999999761581421, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.718949019908905, "rewards/repeat_penalty/std": 0.1386510133743286, "rewards/repeat_floor/mean": 0.969192624092102, "rewards/repeat_floor/std": 0.015712536871433258, "rewards/near_duplicate_penalty/mean": 0.9355074167251587, "rewards/near_duplicate_penalty/std": 0.03240552917122841, "rewards/opening_diversity/mean": 0.984375, "rewards/opening_diversity/std": 0.0289318785071373, "rewards/distinct_2/mean": 0.7755997180938721, "rewards/distinct_2/std": 0.11071112751960754, "rewards/total_composite/mean": 0.3096751570701599, "rewards/total_composite/std": 0.08193899691104889, "reward": 0.3096751570701599, "reward_std": 0.08193900436162949, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14177894592285156, "sampling/sampling_logp_difference/max": 2.0536086559295654, "sampling/importance_sampling_ratio/min": 0.1282711774110794, "sampling/importance_sampling_ratio/mean": 1.015848994255066, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9214318841695786, "clip_ratio/low_mean": 0.07762840390205383, "clip_ratio/low_min": 0.07762840390205383, "clip_ratio/high_mean": 0.0579518536105752, "clip_ratio/high_max": 0.0579518536105752, "clip_ratio/region_mean": 0.13558025751262903, "reward_total_mean": 0.3096751570701599, "reward_meter_mean": 0.9819897413253784, "reward_meter_std": 0.03369574621319771, "reward_count_adherence_mean": 0.6666666865348816, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8999999761581421, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.718949019908905, "reward_repeat_penalty_std": 0.1386510133743286, "reward_repeat_floor_mean": 0.969192624092102, "reward_repeat_floor_std": 0.015712536871433258, "reward_near_duplicate_penalty_mean": 0.9355074167251587, "reward_near_duplicate_penalty_std": 0.03240552917122841, "reward_opening_diversity_mean": 0.984375, "reward_opening_diversity_std": 0.0289318785071373, "reward_distinct_2_mean": 0.7755997180938721, "reward_distinct_2_std": 0.11071112751960754, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.3096751570701599, "reward_total_composite_std": 0.08193899691104889} {"timestamp_utc": "2026-04-12T21:00:35Z", "mode": "train", "global_step": 1312, "epoch": 0.06904899742118836, "loss": 0.0195, "grad_norm": 12.449087142944336, "learning_rate": 6.027272727272728e-06, "num_tokens": 2327132.0, "completions/mean_length": 87.625, "completions/min_length": 72.0, "completions/max_length": 103.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.625, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 103.0, "rewards/meter/mean": 0.8854688405990601, "rewards/meter/std": 0.16350716352462769, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.08908706158399582, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.02672613225877285, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.7740010619163513, "rewards/repeat_penalty/std": 0.23590870201587677, "rewards/repeat_floor/mean": 0.9746969938278198, "rewards/repeat_floor/std": 0.02535582147538662, "rewards/near_duplicate_penalty/mean": 0.9258442521095276, "rewards/near_duplicate_penalty/std": 0.06613500416278839, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.847656786441803, "rewards/distinct_2/std": 0.16402672231197357, "rewards/total_composite/mean": 0.3287997841835022, "rewards/total_composite/std": 0.07662955671548843, "reward": 0.3287997841835022, "reward_std": 0.07662956416606903, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13598813116550446, "sampling/sampling_logp_difference/max": 2.357959747314453, "sampling/importance_sampling_ratio/min": 0.09461306035518646, "sampling/importance_sampling_ratio/mean": 1.0301519632339478, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9698840007185936, "clip_ratio/low_mean": 0.060020530596375465, "clip_ratio/low_min": 0.060020530596375465, "clip_ratio/high_mean": 0.050905884243547916, "clip_ratio/high_max": 0.050905884243547916, "clip_ratio/region_mean": 0.11092641483992338, "reward_total_mean": 0.3287997841835022, "reward_meter_mean": 0.8854688405990601, "reward_meter_std": 0.16350716352462769, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.08908706158399582, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.02672613225877285, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7740010619163513, "reward_repeat_penalty_std": 0.23590870201587677, "reward_repeat_floor_mean": 0.9746969938278198, "reward_repeat_floor_std": 0.02535582147538662, "reward_near_duplicate_penalty_mean": 0.9258442521095276, "reward_near_duplicate_penalty_std": 0.06613500416278839, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.847656786441803, "reward_distinct_2_std": 0.16402672231197357, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.3287997841835022, "reward_total_composite_std": 0.07662955671548843} {"timestamp_utc": "2026-04-12T21:00:44Z", "mode": "train", "global_step": 1313, "epoch": 0.06910162623019842, "loss": 0.006, "grad_norm": 14.321449279785156, "learning_rate": 6.024242424242425e-06, "num_tokens": 2328826.0, "completions/mean_length": 37.75, "completions/min_length": 33.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.75, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.8645392656326294, "rewards/meter/std": 0.29772910475730896, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.4675000011920929, "rewards/judge_quality/std": 0.28768783807754517, "rewards/repeat_penalty/mean": 0.8131360411643982, "rewards/repeat_penalty/std": 0.2588255703449249, "rewards/repeat_floor/mean": 0.9789941310882568, "rewards/repeat_floor/std": 0.02537693828344345, "rewards/near_duplicate_penalty/mean": 0.9252829551696777, "rewards/near_duplicate_penalty/std": 0.06041572988033295, "rewards/opening_diversity/mean": 0.890625, "rewards/opening_diversity/std": 0.2259652018547058, "rewards/distinct_2/mean": 0.964046835899353, "rewards/distinct_2/std": 0.06678803265094757, "rewards/total_composite/mean": 0.4043280780315399, "rewards/total_composite/std": 0.29879361391067505, "reward": 0.4043280780315399, "reward_std": 0.29879361391067505, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17448312044143677, "sampling/sampling_logp_difference/max": 1.6411969661712646, "sampling/importance_sampling_ratio/min": 0.19374798238277435, "sampling/importance_sampling_ratio/mean": 1.0407819747924805, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.324341043829918, "clip_ratio/low_mean": 0.0916575170122087, "clip_ratio/low_min": 0.0916575170122087, "clip_ratio/high_mean": 0.024187306873500347, "clip_ratio/high_max": 0.024187306873500347, "clip_ratio/region_mean": 0.11584482388570905, "reward_total_mean": 0.4043280780315399, "reward_meter_mean": 0.8645392656326294, "reward_meter_std": 0.29772910475730896, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.8131360411643982, "reward_repeat_penalty_std": 0.2588255703449249, "reward_repeat_floor_mean": 0.9789941310882568, "reward_repeat_floor_std": 0.02537693828344345, "reward_near_duplicate_penalty_mean": 0.9252829551696777, "reward_near_duplicate_penalty_std": 0.06041572988033295, "reward_opening_diversity_mean": 0.890625, "reward_opening_diversity_std": 0.2259652018547058, "reward_distinct_2_mean": 0.964046835899353, "reward_distinct_2_std": 0.06678803265094757, "reward_judge_quality_mean": 0.4675000011920929, "reward_judge_quality_std": 0.28768783807754517, "reward_total_composite_mean": 0.4043280780315399, "reward_total_composite_std": 0.29879361391067505} {"timestamp_utc": "2026-04-12T21:00:54Z", "mode": "train", "global_step": 1314, "epoch": 0.06915425503920847, "loss": 0.0849, "grad_norm": 11.951732635498047, "learning_rate": 6.021212121212122e-06, "num_tokens": 2330931.0, "completions/mean_length": 73.125, "completions/min_length": 60.0, "completions/max_length": 86.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 73.125, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.05381731688976288, "rewards/meter/std": 0.07238277792930603, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9381395578384399, "rewards/repeat_penalty/std": 0.03527694568037987, "rewards/repeat_floor/mean": 0.9920425415039062, "rewards/repeat_floor/std": 0.003405706724151969, "rewards/near_duplicate_penalty/mean": 0.9612358212471008, "rewards/near_duplicate_penalty/std": 0.01571418158710003, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.976190447807312, "rewards/distinct_2/std": 0.03930572792887688, "rewards/total_composite/mean": 0.015479287132620811, "rewards/total_composite/std": 0.02345142886042595, "reward": 0.015479287132620811, "reward_std": 0.02345142886042595, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14509731531143188, "sampling/sampling_logp_difference/max": 3.974477529525757, "sampling/importance_sampling_ratio/min": 0.01878911629319191, "sampling/importance_sampling_ratio/mean": 1.0299352407455444, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8261949345469475, "clip_ratio/low_mean": 0.07739626802504063, "clip_ratio/low_min": 0.07739626802504063, "clip_ratio/high_mean": 0.024249551817774773, "clip_ratio/high_max": 0.024249551817774773, "clip_ratio/region_mean": 0.1016458198428154, "reward_total_mean": 0.015479287132620811, "reward_meter_mean": 0.05381731688976288, "reward_meter_std": 0.07238277792930603, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9381395578384399, "reward_repeat_penalty_std": 0.03527694568037987, "reward_repeat_floor_mean": 0.9920425415039062, "reward_repeat_floor_std": 0.003405706724151969, "reward_near_duplicate_penalty_mean": 0.9612358212471008, "reward_near_duplicate_penalty_std": 0.01571418158710003, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.976190447807312, "reward_distinct_2_std": 0.03930572792887688, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.015479287132620811, "reward_total_composite_std": 0.02345142886042595} {"timestamp_utc": "2026-04-12T21:01:08Z", "mode": "train", "global_step": 1315, "epoch": 0.06920688384821852, "loss": -0.0505, "grad_norm": 3.983793020248413, "learning_rate": 6.018181818181818e-06, "num_tokens": 2332539.0, "completions/mean_length": 100.0, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 41.142860412597656, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.8745691776275635, "rewards/meter/std": 0.31833603978157043, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9495176076889038, "rewards/lexical_plausibility/std": 0.14278587698936462, "rewards/judge_quality/mean": 0.3712499737739563, "rewards/judge_quality/std": 0.2622124254703522, "rewards/repeat_penalty/mean": 0.9335485696792603, "rewards/repeat_penalty/std": 0.06857750564813614, "rewards/repeat_floor/mean": 0.9913874268531799, "rewards/repeat_floor/std": 0.008522238582372665, "rewards/near_duplicate_penalty/mean": 0.959395170211792, "rewards/near_duplicate_penalty/std": 0.035574499517679214, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9719797372817993, "rewards/distinct_2/std": 0.038789909332990646, "rewards/total_composite/mean": 0.35731732845306396, "rewards/total_composite/std": 0.26430076360702515, "reward": 0.35731732845306396, "reward_std": 0.26430076360702515, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14089587330818176, "sampling/sampling_logp_difference/max": 1.3785748481750488, "sampling/importance_sampling_ratio/min": 0.2519373595714569, "sampling/importance_sampling_ratio/mean": 1.0218290090560913, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7774863839149475, "clip_ratio/low_mean": 0.06027312437072396, "clip_ratio/low_min": 0.06027312437072396, "clip_ratio/high_mean": 0.06789530161768198, "clip_ratio/high_max": 0.06789530161768198, "clip_ratio/region_mean": 0.12816842598840594, "reward_total_mean": 0.35731732845306396, "reward_meter_mean": 0.8745691776275635, "reward_meter_std": 0.31833603978157043, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9495176076889038, "reward_lexical_plausibility_std": 0.14278587698936462, "reward_repeat_penalty_mean": 0.9335485696792603, "reward_repeat_penalty_std": 0.06857750564813614, "reward_repeat_floor_mean": 0.9913874268531799, "reward_repeat_floor_std": 0.008522238582372665, "reward_near_duplicate_penalty_mean": 0.959395170211792, "reward_near_duplicate_penalty_std": 0.035574499517679214, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9719797372817993, "reward_distinct_2_std": 0.038789909332990646, "reward_judge_quality_mean": 0.3712499737739563, "reward_judge_quality_std": 0.2622124254703522, "reward_total_composite_mean": 0.35731732845306396, "reward_total_composite_std": 0.26430076360702515} {"timestamp_utc": "2026-04-12T21:01:16Z", "mode": "train", "global_step": 1316, "epoch": 0.06925951265722857, "loss": -0.0924, "grad_norm": 13.727326393127441, "learning_rate": 6.015151515151516e-06, "num_tokens": 2333996.0, "completions/mean_length": 35.125, "completions/min_length": 30.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.125, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.5148382186889648, "rewards/meter/std": 0.4152170419692993, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9445988535881042, "rewards/repeat_penalty/std": 0.06967490911483765, "rewards/repeat_floor/mean": 0.993800699710846, "rewards/repeat_floor/std": 0.007518926169723272, "rewards/near_duplicate_penalty/mean": 0.9818398356437683, "rewards/near_duplicate_penalty/std": 0.020505281165242195, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9613858461380005, "rewards/distinct_2/std": 0.057023826986551285, "rewards/total_composite/mean": 0.2743109464645386, "rewards/total_composite/std": 0.2878408432006836, "reward": 0.2743109464645386, "reward_std": 0.2878408432006836, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13995783030986786, "sampling/sampling_logp_difference/max": 1.7937779426574707, "sampling/importance_sampling_ratio/min": 0.16633060574531555, "sampling/importance_sampling_ratio/mean": 1.020034670829773, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9805162474513054, "clip_ratio/low_mean": 0.08769271802157164, "clip_ratio/low_min": 0.08769271802157164, "clip_ratio/high_mean": 0.05447733961045742, "clip_ratio/high_max": 0.05447733961045742, "clip_ratio/region_mean": 0.14217005763202906, "reward_total_mean": 0.2743109464645386, "reward_meter_mean": 0.5148382186889648, "reward_meter_std": 0.4152170419692993, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9445988535881042, "reward_repeat_penalty_std": 0.06967490911483765, "reward_repeat_floor_mean": 0.993800699710846, "reward_repeat_floor_std": 0.007518926169723272, "reward_near_duplicate_penalty_mean": 0.9818398356437683, "reward_near_duplicate_penalty_std": 0.020505281165242195, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9613858461380005, "reward_distinct_2_std": 0.057023826986551285, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.2743109464645386, "reward_total_composite_std": 0.2878408432006836} {"timestamp_utc": "2026-04-12T21:01:30Z", "mode": "train", "global_step": 1317, "epoch": 0.06931214146623862, "loss": -0.1153, "grad_norm": 5.6942853927612305, "learning_rate": 6.012121212121213e-06, "num_tokens": 2335949.0, "completions/mean_length": 118.125, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 61.857147216796875, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.49686211347579956, "rewards/meter/std": 0.3207494616508484, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9501303434371948, "rewards/lexical_plausibility/std": 0.14105276763439178, "rewards/judge_quality/mean": 0.3837500214576721, "rewards/judge_quality/std": 0.24076886475086212, "rewards/repeat_penalty/mean": 0.922383189201355, "rewards/repeat_penalty/std": 0.06103139743208885, "rewards/repeat_floor/mean": 0.9903059005737305, "rewards/repeat_floor/std": 0.007146673742681742, "rewards/near_duplicate_penalty/mean": 0.9581903219223022, "rewards/near_duplicate_penalty/std": 0.026926938444375992, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.961970865726471, "rewards/distinct_2/std": 0.043403610587120056, "rewards/total_composite/mean": 0.15692131221294403, "rewards/total_composite/std": 0.10595479607582092, "reward": 0.15692131221294403, "reward_std": 0.10595478862524033, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14740301668643951, "sampling/sampling_logp_difference/max": 1.5146105289459229, "sampling/importance_sampling_ratio/min": 0.32130512595176697, "sampling/importance_sampling_ratio/mean": 1.0112230777740479, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6793710291385651, "clip_ratio/low_mean": 0.05092772003263235, "clip_ratio/low_min": 0.05092772003263235, "clip_ratio/high_mean": 0.07314252480864525, "clip_ratio/high_max": 0.07314252480864525, "clip_ratio/region_mean": 0.1240702448412776, "reward_total_mean": 0.15692131221294403, "reward_meter_mean": 0.49686211347579956, "reward_meter_std": 0.3207494616508484, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9501303434371948, "reward_lexical_plausibility_std": 0.14105276763439178, "reward_repeat_penalty_mean": 0.922383189201355, "reward_repeat_penalty_std": 0.06103139743208885, "reward_repeat_floor_mean": 0.9903059005737305, "reward_repeat_floor_std": 0.007146673742681742, "reward_near_duplicate_penalty_mean": 0.9581903219223022, "reward_near_duplicate_penalty_std": 0.026926938444375992, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.961970865726471, "reward_distinct_2_std": 0.043403610587120056, "reward_judge_quality_mean": 0.3837500214576721, "reward_judge_quality_std": 0.24076886475086212, "reward_total_composite_mean": 0.15692131221294403, "reward_total_composite_std": 0.10595479607582092} {"timestamp_utc": "2026-04-12T21:01:44Z", "mode": "train", "global_step": 1318, "epoch": 0.06936477027524868, "loss": -0.038, "grad_norm": 4.971512317657471, "learning_rate": 6.00909090909091e-06, "num_tokens": 2337457.0, "completions/mean_length": 94.5, "completions/min_length": 27.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 34.85714340209961, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.7518837451934814, "rewards/meter/std": 0.3673200011253357, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9454420804977417, "rewards/lexical_plausibility/std": 0.15431299805641174, "rewards/judge_quality/mean": 0.4462500214576721, "rewards/judge_quality/std": 0.2855539917945862, "rewards/repeat_penalty/mean": 0.8880783915519714, "rewards/repeat_penalty/std": 0.15090906620025635, "rewards/repeat_floor/mean": 0.9858551025390625, "rewards/repeat_floor/std": 0.01885424740612507, "rewards/near_duplicate_penalty/mean": 0.9459102153778076, "rewards/near_duplicate_penalty/std": 0.06418748199939728, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9329836964607239, "rewards/distinct_2/std": 0.10612636059522629, "rewards/total_composite/mean": 0.30501455068588257, "rewards/total_composite/std": 0.2405243217945099, "reward": 0.30501455068588257, "reward_std": 0.2405243217945099, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16135302186012268, "sampling/sampling_logp_difference/max": 1.5767261981964111, "sampling/importance_sampling_ratio/min": 0.2066505253314972, "sampling/importance_sampling_ratio/mean": 1.0379185676574707, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9826783165335655, "clip_ratio/low_mean": 0.04921874962747097, "clip_ratio/low_min": 0.04921874962747097, "clip_ratio/high_mean": 0.09913973836228251, "clip_ratio/high_max": 0.09913973836228251, "clip_ratio/region_mean": 0.14835848798975348, "reward_total_mean": 0.30501455068588257, "reward_meter_mean": 0.7518837451934814, "reward_meter_std": 0.3673200011253357, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9454420804977417, "reward_lexical_plausibility_std": 0.15431299805641174, "reward_repeat_penalty_mean": 0.8880783915519714, "reward_repeat_penalty_std": 0.15090906620025635, "reward_repeat_floor_mean": 0.9858551025390625, "reward_repeat_floor_std": 0.01885424740612507, "reward_near_duplicate_penalty_mean": 0.9459102153778076, "reward_near_duplicate_penalty_std": 0.06418748199939728, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9329836964607239, "reward_distinct_2_std": 0.10612636059522629, "reward_judge_quality_mean": 0.4462500214576721, "reward_judge_quality_std": 0.2855539917945862, "reward_total_composite_mean": 0.30501455068588257, "reward_total_composite_std": 0.2405243217945099} {"timestamp_utc": "2026-04-12T21:01:52Z", "mode": "train", "global_step": 1319, "epoch": 0.06941739908425873, "loss": 0.0385, "grad_norm": 9.739234924316406, "learning_rate": 6.0060606060606065e-06, "num_tokens": 2339079.0, "completions/mean_length": 46.75, "completions/min_length": 42.0, "completions/max_length": 51.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.75, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 51.0, "rewards/meter/mean": 0.9708136320114136, "rewards/meter/std": 0.02970542199909687, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42500001192092896, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9489890336990356, "rewards/repeat_penalty/std": 0.0525766983628273, "rewards/repeat_floor/mean": 0.9932128190994263, "rewards/repeat_floor/std": 0.006497122347354889, "rewards/near_duplicate_penalty/mean": 0.965013325214386, "rewards/near_duplicate_penalty/std": 0.029271913692355156, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9828975200653076, "rewards/distinct_2/std": 0.031678035855293274, "rewards/total_composite/mean": 0.4109557867050171, "rewards/total_composite/std": 0.1414686143398285, "reward": 0.4109557867050171, "reward_std": 0.1414686143398285, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16364572942256927, "sampling/sampling_logp_difference/max": 1.5967597961425781, "sampling/importance_sampling_ratio/min": 0.20255176723003387, "sampling/importance_sampling_ratio/mean": 1.0076313018798828, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9042903259396553, "clip_ratio/low_mean": 0.07417727634310722, "clip_ratio/low_min": 0.07417727634310722, "clip_ratio/high_mean": 0.035674708895385265, "clip_ratio/high_max": 0.035674708895385265, "clip_ratio/region_mean": 0.10985198523849249, "reward_total_mean": 0.4109557867050171, "reward_meter_mean": 0.9708136320114136, "reward_meter_std": 0.02970542199909687, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9489890336990356, "reward_repeat_penalty_std": 0.0525766983628273, "reward_repeat_floor_mean": 0.9932128190994263, "reward_repeat_floor_std": 0.006497122347354889, "reward_near_duplicate_penalty_mean": 0.965013325214386, "reward_near_duplicate_penalty_std": 0.029271913692355156, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9828975200653076, "reward_distinct_2_std": 0.031678035855293274, "reward_judge_quality_mean": 0.42500001192092896, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.4109557867050171, "reward_total_composite_std": 0.1414686143398285} {"timestamp_utc": "2026-04-12T21:02:01Z", "mode": "train", "global_step": 1320, "epoch": 0.06947002789326878, "loss": 0.2271, "grad_norm": 14.736226081848145, "learning_rate": 6.003030303030304e-06, "num_tokens": 2340326.0, "completions/mean_length": 36.875, "completions/min_length": 21.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.875, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.9866637587547302, "rewards/meter/std": 0.023029297590255737, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5299999713897705, "rewards/judge_quality/std": 0.24512389302253723, "rewards/repeat_penalty/mean": 0.8360481262207031, "rewards/repeat_penalty/std": 0.11681586503982544, "rewards/repeat_floor/mean": 0.9855867624282837, "rewards/repeat_floor/std": 0.008560135960578918, "rewards/near_duplicate_penalty/mean": 0.9689322710037231, "rewards/near_duplicate_penalty/std": 0.02249053306877613, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.954132080078125, "rewards/distinct_2/std": 0.054448146373033524, "rewards/total_composite/mean": 0.47399526834487915, "rewards/total_composite/std": 0.1828477829694748, "reward": 0.47399526834487915, "reward_std": 0.1828477829694748, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16722162067890167, "sampling/sampling_logp_difference/max": 2.1273062229156494, "sampling/importance_sampling_ratio/min": 0.11915784329175949, "sampling/importance_sampling_ratio/mean": 1.0354115962982178, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5829506516456604, "clip_ratio/low_mean": 0.09206017386168242, "clip_ratio/low_min": 0.09206017386168242, "clip_ratio/high_mean": 0.04840909130871296, "clip_ratio/high_max": 0.04840909130871296, "clip_ratio/region_mean": 0.14046926517039537, "reward_total_mean": 0.47399526834487915, "reward_meter_mean": 0.9866637587547302, "reward_meter_std": 0.023029297590255737, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8360481262207031, "reward_repeat_penalty_std": 0.11681586503982544, "reward_repeat_floor_mean": 0.9855867624282837, "reward_repeat_floor_std": 0.008560135960578918, "reward_near_duplicate_penalty_mean": 0.9689322710037231, "reward_near_duplicate_penalty_std": 0.02249053306877613, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.954132080078125, "reward_distinct_2_std": 0.054448146373033524, "reward_judge_quality_mean": 0.5299999713897705, "reward_judge_quality_std": 0.24512389302253723, "reward_total_composite_mean": 0.47399526834487915, "reward_total_composite_std": 0.1828477829694748} {"timestamp_utc": "2026-04-12T21:02:09Z", "mode": "train", "global_step": 1321, "epoch": 0.06952265670227882, "loss": -0.0097, "grad_norm": 14.679240226745605, "learning_rate": 6e-06, "num_tokens": 2341754.0, "completions/mean_length": 34.5, "completions/min_length": 31.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.9376527070999146, "rewards/meter/std": 0.09049329161643982, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48749998211860657, "rewards/judge_quality/std": 0.1060660257935524, "rewards/repeat_penalty/mean": 0.93580162525177, "rewards/repeat_penalty/std": 0.024152051657438278, "rewards/repeat_floor/mean": 0.9903702735900879, "rewards/repeat_floor/std": 0.0036228084936738014, "rewards/near_duplicate_penalty/mean": 0.93580162525177, "rewards/near_duplicate_penalty/std": 0.024152051657438278, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4537506103515625, "rewards/total_composite/std": 0.11392330378293991, "reward": 0.4537506103515625, "reward_std": 0.11392328888177872, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1428253948688507, "sampling/sampling_logp_difference/max": 1.610318660736084, "sampling/importance_sampling_ratio/min": 0.19982393085956573, "sampling/importance_sampling_ratio/mean": 1.0028667449951172, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6616759896278381, "clip_ratio/low_mean": 0.12112255487591028, "clip_ratio/low_min": 0.12112255487591028, "clip_ratio/high_mean": 0.0032051282469183207, "clip_ratio/high_max": 0.0032051282469183207, "clip_ratio/region_mean": 0.1243276831228286, "reward_total_mean": 0.4537506103515625, "reward_meter_mean": 0.9376527070999146, "reward_meter_std": 0.09049329161643982, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.93580162525177, "reward_repeat_penalty_std": 0.024152051657438278, "reward_repeat_floor_mean": 0.9903702735900879, "reward_repeat_floor_std": 0.0036228084936738014, "reward_near_duplicate_penalty_mean": 0.93580162525177, "reward_near_duplicate_penalty_std": 0.024152051657438278, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48749998211860657, "reward_judge_quality_std": 0.1060660257935524, "reward_total_composite_mean": 0.4537506103515625, "reward_total_composite_std": 0.11392330378293991} {"timestamp_utc": "2026-04-12T21:02:23Z", "mode": "train", "global_step": 1322, "epoch": 0.06957528551128887, "loss": -0.0318, "grad_norm": 6.467280387878418, "learning_rate": 5.996969696969697e-06, "num_tokens": 2343272.0, "completions/mean_length": 92.75, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 32.85714340209961, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.5087072253227234, "rewards/meter/std": 0.43609893321990967, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9415919780731201, "rewards/lexical_plausibility/std": 0.14164769649505615, "rewards/judge_quality/mean": 0.3712499737739563, "rewards/judge_quality/std": 0.25670647621154785, "rewards/repeat_penalty/mean": 0.9200747013092041, "rewards/repeat_penalty/std": 0.1338854283094406, "rewards/repeat_floor/mean": 0.9911704063415527, "rewards/repeat_floor/std": 0.013205713592469692, "rewards/near_duplicate_penalty/mean": 0.9681156873703003, "rewards/near_duplicate_penalty/std": 0.03609072044491768, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9758672714233398, "rewards/distinct_2/std": 0.04480134695768356, "rewards/total_composite/mean": 0.16547256708145142, "rewards/total_composite/std": 0.13278472423553467, "reward": 0.16547256708145142, "reward_std": 0.13278470933437347, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17435140907764435, "sampling/sampling_logp_difference/max": 2.1308696269989014, "sampling/importance_sampling_ratio/min": 0.11873398721218109, "sampling/importance_sampling_ratio/mean": 0.9970294237136841, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8414795845746994, "clip_ratio/low_mean": 0.061873641330748796, "clip_ratio/low_min": 0.061873641330748796, "clip_ratio/high_mean": 0.06802262924611568, "clip_ratio/high_max": 0.06802262924611568, "clip_ratio/region_mean": 0.12989627057686448, "reward_total_mean": 0.16547256708145142, "reward_meter_mean": 0.5087072253227234, "reward_meter_std": 0.43609893321990967, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9415919780731201, "reward_lexical_plausibility_std": 0.14164769649505615, "reward_repeat_penalty_mean": 0.9200747013092041, "reward_repeat_penalty_std": 0.1338854283094406, "reward_repeat_floor_mean": 0.9911704063415527, "reward_repeat_floor_std": 0.013205713592469692, "reward_near_duplicate_penalty_mean": 0.9681156873703003, "reward_near_duplicate_penalty_std": 0.03609072044491768, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9758672714233398, "reward_distinct_2_std": 0.04480134695768356, "reward_judge_quality_mean": 0.3712499737739563, "reward_judge_quality_std": 0.25670647621154785, "reward_total_composite_mean": 0.16547256708145142, "reward_total_composite_std": 0.13278472423553467} {"timestamp_utc": "2026-04-12T21:02:31Z", "mode": "train", "global_step": 1323, "epoch": 0.06962791432029893, "loss": 0.0436, "grad_norm": 16.48020362854004, "learning_rate": 5.993939393939394e-06, "num_tokens": 2344847.0, "completions/mean_length": 27.875, "completions/min_length": 26.0, "completions/max_length": 31.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.875, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 31.0, "rewards/meter/mean": 0.25278496742248535, "rewards/meter/std": 0.22370514273643494, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.49125000834465027, "rewards/judge_quality/std": 0.16092921793460846, "rewards/repeat_penalty/mean": 0.9452831745147705, "rewards/repeat_penalty/std": 0.07141169905662537, "rewards/repeat_floor/mean": 0.9928609132766724, "rewards/repeat_floor/std": 0.007813921198248863, "rewards/near_duplicate_penalty/mean": 0.9652265310287476, "rewards/near_duplicate_penalty/std": 0.021553587168455124, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.12173649668693542, "rewards/total_composite/std": 0.10125062614679337, "reward": 0.12173649668693542, "reward_std": 0.10125061869621277, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1733459234237671, "sampling/sampling_logp_difference/max": 1.4115428924560547, "sampling/importance_sampling_ratio/min": 0.2437668889760971, "sampling/importance_sampling_ratio/mean": 1.004873514175415, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1955547407269478, "clip_ratio/low_mean": 0.09232541639357805, "clip_ratio/low_min": 0.09232541639357805, "clip_ratio/high_mean": 0.08802655804902315, "clip_ratio/high_max": 0.08802655804902315, "clip_ratio/region_mean": 0.1803519744426012, "reward_total_mean": 0.12173649668693542, "reward_meter_mean": 0.25278496742248535, "reward_meter_std": 0.22370514273643494, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9452831745147705, "reward_repeat_penalty_std": 0.07141169905662537, "reward_repeat_floor_mean": 0.9928609132766724, "reward_repeat_floor_std": 0.007813921198248863, "reward_near_duplicate_penalty_mean": 0.9652265310287476, "reward_near_duplicate_penalty_std": 0.021553587168455124, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.49125000834465027, "reward_judge_quality_std": 0.16092921793460846, "reward_total_composite_mean": 0.12173649668693542, "reward_total_composite_std": 0.10125062614679337} {"timestamp_utc": "2026-04-12T21:02:41Z", "mode": "train", "global_step": 1324, "epoch": 0.06968054312930898, "loss": 0.0327, "grad_norm": 14.842118263244629, "learning_rate": 5.990909090909092e-06, "num_tokens": 2346405.0, "completions/mean_length": 36.75, "completions/min_length": 32.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.75, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.6028118133544922, "rewards/meter/std": 0.41412031650543213, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.983134925365448, "rewards/lexical_plausibility/std": 0.037750594317913055, "rewards/judge_quality/mean": 0.5249999761581421, "rewards/judge_quality/std": 0.13887302577495575, "rewards/repeat_penalty/mean": 0.8834500312805176, "rewards/repeat_penalty/std": 0.14494600892066956, "rewards/repeat_floor/mean": 0.9892170429229736, "rewards/repeat_floor/std": 0.012261439114809036, "rewards/near_duplicate_penalty/mean": 0.9768266677856445, "rewards/near_duplicate_penalty/std": 0.027350183576345444, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9604780673980713, "rewards/distinct_2/std": 0.042326003313064575, "rewards/total_composite/mean": 0.307438462972641, "rewards/total_composite/std": 0.24083061516284943, "reward": 0.307438462972641, "reward_std": 0.24083060026168823, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16083471477031708, "sampling/sampling_logp_difference/max": 2.03851318359375, "sampling/importance_sampling_ratio/min": 0.13022218644618988, "sampling/importance_sampling_ratio/mean": 0.9952160120010376, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7971574068069458, "clip_ratio/low_mean": 0.05712006613612175, "clip_ratio/low_min": 0.05712006613612175, "clip_ratio/high_mean": 0.08258928637951612, "clip_ratio/high_max": 0.08258928637951612, "clip_ratio/region_mean": 0.13970935251563787, "reward_total_mean": 0.307438462972641, "reward_meter_mean": 0.6028118133544922, "reward_meter_std": 0.41412031650543213, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.983134925365448, "reward_lexical_plausibility_std": 0.037750594317913055, "reward_repeat_penalty_mean": 0.8834500312805176, "reward_repeat_penalty_std": 0.14494600892066956, "reward_repeat_floor_mean": 0.9892170429229736, "reward_repeat_floor_std": 0.012261439114809036, "reward_near_duplicate_penalty_mean": 0.9768266677856445, "reward_near_duplicate_penalty_std": 0.027350183576345444, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9604780673980713, "reward_distinct_2_std": 0.042326003313064575, "reward_judge_quality_mean": 0.5249999761581421, "reward_judge_quality_std": 0.13887302577495575, "reward_total_composite_mean": 0.307438462972641, "reward_total_composite_std": 0.24083061516284943} {"timestamp_utc": "2026-04-12T21:02:49Z", "mode": "train", "global_step": 1325, "epoch": 0.06973317193831903, "loss": 0.0546, "grad_norm": 29.41624641418457, "learning_rate": 5.987878787878788e-06, "num_tokens": 2347687.0, "completions/mean_length": 22.25, "completions/min_length": 19.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.25, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.9083833694458008, "rewards/meter/std": 0.16666342318058014, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9574281573295593, "rewards/lexical_plausibility/std": 0.09763853251934052, "rewards/judge_quality/mean": 0.8525000214576721, "rewards/judge_quality/std": 0.20331189036369324, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.7594344615936279, "rewards/total_composite/std": 0.23033544421195984, "reward": 0.7594344615936279, "reward_std": 0.23033544421195984, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.136161670088768, "sampling/sampling_logp_difference/max": 1.8659148216247559, "sampling/importance_sampling_ratio/min": 0.15475456416606903, "sampling/importance_sampling_ratio/mean": 0.993350088596344, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8273940756917, "clip_ratio/low_mean": 0.049761904403567314, "clip_ratio/low_min": 0.049761904403567314, "clip_ratio/high_mean": 0.112219940405339, "clip_ratio/high_max": 0.112219940405339, "clip_ratio/region_mean": 0.16198184480890632, "reward_total_mean": 0.7594344615936279, "reward_meter_mean": 0.9083833694458008, "reward_meter_std": 0.16666342318058014, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9574281573295593, "reward_lexical_plausibility_std": 0.09763853251934052, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8525000214576721, "reward_judge_quality_std": 0.20331189036369324, "reward_total_composite_mean": 0.7594344615936279, "reward_total_composite_std": 0.23033544421195984} {"timestamp_utc": "2026-04-12T21:03:02Z", "mode": "train", "global_step": 1326, "epoch": 0.06978580074732908, "loss": -0.0678, "grad_norm": 5.055856227874756, "learning_rate": 5.984848484848486e-06, "num_tokens": 2349200.0, "completions/mean_length": 99.125, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 40.142860412597656, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.5484107732772827, "rewards/meter/std": 0.41628241539001465, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.942851185798645, "rewards/lexical_plausibility/std": 0.1616411954164505, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.29364702105522156, "rewards/repeat_penalty/mean": 0.8851054906845093, "rewards/repeat_penalty/std": 0.11812806874513626, "rewards/repeat_floor/mean": 0.9843192100524902, "rewards/repeat_floor/std": 0.015226820483803749, "rewards/near_duplicate_penalty/mean": 0.9205446839332581, "rewards/near_duplicate_penalty/std": 0.062098801136016846, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9581940174102783, "rewards/distinct_2/std": 0.07944715023040771, "rewards/total_composite/mean": 0.30883216857910156, "rewards/total_composite/std": 0.24022093415260315, "reward": 0.30883216857910156, "reward_std": 0.24022091925144196, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11366228759288788, "sampling/sampling_logp_difference/max": 1.4165725708007812, "sampling/importance_sampling_ratio/min": 0.24254390597343445, "sampling/importance_sampling_ratio/mean": 1.0237001180648804, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6658881455659866, "clip_ratio/low_mean": 0.028819444123655558, "clip_ratio/low_min": 0.028819444123655558, "clip_ratio/high_mean": 0.0543975536711514, "clip_ratio/high_max": 0.0543975536711514, "clip_ratio/region_mean": 0.08321699779480696, "reward_total_mean": 0.30883216857910156, "reward_meter_mean": 0.5484107732772827, "reward_meter_std": 0.41628241539001465, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.942851185798645, "reward_lexical_plausibility_std": 0.1616411954164505, "reward_repeat_penalty_mean": 0.8851054906845093, "reward_repeat_penalty_std": 0.11812806874513626, "reward_repeat_floor_mean": 0.9843192100524902, "reward_repeat_floor_std": 0.015226820483803749, "reward_near_duplicate_penalty_mean": 0.9205446839332581, "reward_near_duplicate_penalty_std": 0.062098801136016846, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9581940174102783, "reward_distinct_2_std": 0.07944715023040771, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.29364702105522156, "reward_total_composite_mean": 0.30883216857910156, "reward_total_composite_std": 0.24022093415260315} {"timestamp_utc": "2026-04-12T21:03:11Z", "mode": "train", "global_step": 1327, "epoch": 0.06983842955633913, "loss": -0.0074, "grad_norm": 11.903730392456055, "learning_rate": 5.981818181818182e-06, "num_tokens": 2350940.0, "completions/mean_length": 39.5, "completions/min_length": 37.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.5, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.8935865163803101, "rewards/meter/std": 0.16214394569396973, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.6039083003997803, "rewards/repeat_penalty/std": 0.32538071274757385, "rewards/repeat_floor/mean": 0.9577351212501526, "rewards/repeat_floor/std": 0.03346175327897072, "rewards/near_duplicate_penalty/mean": 0.8908302783966064, "rewards/near_duplicate_penalty/std": 0.06586231291294098, "rewards/opening_diversity/mean": 0.703125, "rewards/opening_diversity/std": 0.290761798620224, "rewards/distinct_2/mean": 0.9102563858032227, "rewards/distinct_2/std": 0.07952458411455154, "rewards/total_composite/mean": 0.31969985365867615, "rewards/total_composite/std": 0.06430788338184357, "reward": 0.31969985365867615, "reward_std": 0.06430788338184357, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13153253495693207, "sampling/sampling_logp_difference/max": 1.143632411956787, "sampling/importance_sampling_ratio/min": 0.3186594247817993, "sampling/importance_sampling_ratio/mean": 1.0315687656402588, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.03305284678936, "clip_ratio/low_mean": 0.03309078235179186, "clip_ratio/low_min": 0.03309078235179186, "clip_ratio/high_mean": 0.08435847330838442, "clip_ratio/high_max": 0.08435847330838442, "clip_ratio/region_mean": 0.11744925566017628, "reward_total_mean": 0.31969985365867615, "reward_meter_mean": 0.8935865163803101, "reward_meter_std": 0.16214394569396973, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6039083003997803, "reward_repeat_penalty_std": 0.32538071274757385, "reward_repeat_floor_mean": 0.9577351212501526, "reward_repeat_floor_std": 0.03346175327897072, "reward_near_duplicate_penalty_mean": 0.8908302783966064, "reward_near_duplicate_penalty_std": 0.06586231291294098, "reward_opening_diversity_mean": 0.703125, "reward_opening_diversity_std": 0.290761798620224, "reward_distinct_2_mean": 0.9102563858032227, "reward_distinct_2_std": 0.07952458411455154, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.31969985365867615, "reward_total_composite_std": 0.06430788338184357} {"timestamp_utc": "2026-04-12T21:03:19Z", "mode": "train", "global_step": 1328, "epoch": 0.06989105836534919, "loss": 0.0451, "grad_norm": 23.10528564453125, "learning_rate": 5.978787878787879e-06, "num_tokens": 2352330.0, "completions/mean_length": 17.75, "completions/min_length": 15.0, "completions/max_length": 20.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 17.75, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 20.0, "rewards/meter/mean": 0.8451917171478271, "rewards/meter/std": 0.26264089345932007, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.8487499952316284, "rewards/judge_quality/std": 0.20152544975280762, "rewards/repeat_penalty/mean": 0.7129127979278564, "rewards/repeat_penalty/std": 0.05004237964749336, "rewards/repeat_floor/mean": 0.9787973761558533, "rewards/repeat_floor/std": 0.007357305381447077, "rewards/near_duplicate_penalty/mean": 0.9714695811271667, "rewards/near_duplicate_penalty/std": 0.036223381757736206, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.6928799748420715, "rewards/total_composite/std": 0.27362367510795593, "reward": 0.6928799748420715, "reward_std": 0.27362367510795593, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1491914689540863, "sampling/sampling_logp_difference/max": 1.5200119018554688, "sampling/importance_sampling_ratio/min": 0.2187092900276184, "sampling/importance_sampling_ratio/mean": 1.0318156480789185, "sampling/importance_sampling_ratio/max": 1.6486778259277344, "entropy": 1.2375606149435043, "clip_ratio/low_mean": 0.027820777613669634, "clip_ratio/low_min": 0.027820777613669634, "clip_ratio/high_mean": 0.08621162362396717, "clip_ratio/high_max": 0.08621162362396717, "clip_ratio/region_mean": 0.1140324012376368, "reward_total_mean": 0.6928799748420715, "reward_meter_mean": 0.8451917171478271, "reward_meter_std": 0.26264089345932007, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7129127979278564, "reward_repeat_penalty_std": 0.05004237964749336, "reward_repeat_floor_mean": 0.9787973761558533, "reward_repeat_floor_std": 0.007357305381447077, "reward_near_duplicate_penalty_mean": 0.9714695811271667, "reward_near_duplicate_penalty_std": 0.036223381757736206, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.8487499952316284, "reward_judge_quality_std": 0.20152544975280762, "reward_total_composite_mean": 0.6928799748420715, "reward_total_composite_std": 0.27362367510795593} {"timestamp_utc": "2026-04-12T21:03:28Z", "mode": "train", "global_step": 1329, "epoch": 0.06994368717435924, "loss": 0.0199, "grad_norm": 12.892824172973633, "learning_rate": 5.975757575757576e-06, "num_tokens": 2354196.0, "completions/mean_length": 52.25, "completions/min_length": 47.0, "completions/max_length": 63.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.25, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.5871219635009766, "rewards/meter/std": 0.3183690905570984, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9343750476837158, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.9443455338478088, "rewards/repeat_penalty/std": 0.06944360584020615, "rewards/repeat_floor/mean": 0.992408275604248, "rewards/repeat_floor/std": 0.008408610709011555, "rewards/near_duplicate_penalty/mean": 0.9594216346740723, "rewards/near_duplicate_penalty/std": 0.03177790343761444, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9832775592803955, "rewards/distinct_2/std": 0.0472981221973896, "rewards/total_composite/mean": 0.1908721923828125, "rewards/total_composite/std": 0.12809525430202484, "reward": 0.1908721923828125, "reward_std": 0.12809525430202484, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12676312029361725, "sampling/sampling_logp_difference/max": 1.7793502807617188, "sampling/importance_sampling_ratio/min": 0.16874775290489197, "sampling/importance_sampling_ratio/mean": 1.0191175937652588, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6296042837202549, "clip_ratio/low_mean": 0.08223074488341808, "clip_ratio/low_min": 0.08223074488341808, "clip_ratio/high_mean": 0.04419934703037143, "clip_ratio/high_max": 0.04419934703037143, "clip_ratio/region_mean": 0.1264300919137895, "reward_total_mean": 0.1908721923828125, "reward_meter_mean": 0.5871219635009766, "reward_meter_std": 0.3183690905570984, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9343750476837158, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9443455338478088, "reward_repeat_penalty_std": 0.06944360584020615, "reward_repeat_floor_mean": 0.992408275604248, "reward_repeat_floor_std": 0.008408610709011555, "reward_near_duplicate_penalty_mean": 0.9594216346740723, "reward_near_duplicate_penalty_std": 0.03177790343761444, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9832775592803955, "reward_distinct_2_std": 0.0472981221973896, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.1908721923828125, "reward_total_composite_std": 0.12809525430202484} {"timestamp_utc": "2026-04-12T21:03:37Z", "mode": "train", "global_step": 1330, "epoch": 0.06999631598336929, "loss": 0.0165, "grad_norm": 13.198930740356445, "learning_rate": 5.972727272727274e-06, "num_tokens": 2355877.0, "completions/mean_length": 40.125, "completions/min_length": 32.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.125, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.5731260776519775, "rewards/meter/std": 0.2905130088329315, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48374998569488525, "rewards/judge_quality/std": 0.18196842074394226, "rewards/repeat_penalty/mean": 0.9875781536102295, "rewards/repeat_penalty/std": 0.01274846214801073, "rewards/repeat_floor/mean": 0.9981367588043213, "rewards/repeat_floor/std": 0.0019122709054499865, "rewards/near_duplicate_penalty/mean": 0.9875781536102295, "rewards/near_duplicate_penalty/std": 0.01274846214801073, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.27391618490219116, "rewards/total_composite/std": 0.16317319869995117, "reward": 0.27391618490219116, "reward_std": 0.16317319869995117, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14458508789539337, "sampling/sampling_logp_difference/max": 1.3310105800628662, "sampling/importance_sampling_ratio/min": 0.2642101049423218, "sampling/importance_sampling_ratio/mean": 1.0001013278961182, "sampling/importance_sampling_ratio/max": 1.8657915592193604, "entropy": 0.8650990799069405, "clip_ratio/low_mean": 0.06866229884326458, "clip_ratio/low_min": 0.06866229884326458, "clip_ratio/high_mean": 0.09004537668079138, "clip_ratio/high_max": 0.09004537668079138, "clip_ratio/region_mean": 0.15870767552405596, "reward_total_mean": 0.27391618490219116, "reward_meter_mean": 0.5731260776519775, "reward_meter_std": 0.2905130088329315, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9875781536102295, "reward_repeat_penalty_std": 0.01274846214801073, "reward_repeat_floor_mean": 0.9981367588043213, "reward_repeat_floor_std": 0.0019122709054499865, "reward_near_duplicate_penalty_mean": 0.9875781536102295, "reward_near_duplicate_penalty_std": 0.01274846214801073, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48374998569488525, "reward_judge_quality_std": 0.18196842074394226, "reward_total_composite_mean": 0.27391618490219116, "reward_total_composite_std": 0.16317319869995117} {"timestamp_utc": "2026-04-12T21:03:51Z", "mode": "train", "global_step": 1331, "epoch": 0.07004894479237934, "loss": -0.0359, "grad_norm": 5.450880527496338, "learning_rate": 5.96969696969697e-06, "num_tokens": 2357417.0, "completions/mean_length": 99.5, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 40.57143020629883, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.41248220205307007, "rewards/meter/std": 0.3949904441833496, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9381199479103088, "rewards/lexical_plausibility/std": 0.17502321302890778, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.16035674512386322, "rewards/repeat_penalty/mean": 0.8331549763679504, "rewards/repeat_penalty/std": 0.2011079639196396, "rewards/repeat_floor/mean": 0.980330765247345, "rewards/repeat_floor/std": 0.023782573640346527, "rewards/near_duplicate_penalty/mean": 0.93040531873703, "rewards/near_duplicate_penalty/std": 0.077924445271492, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9391106367111206, "rewards/distinct_2/std": 0.08394287526607513, "rewards/total_composite/mean": 0.12054440379142761, "rewards/total_composite/std": 0.14209884405136108, "reward": 0.12054440379142761, "reward_std": 0.14209885895252228, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15003983676433563, "sampling/sampling_logp_difference/max": 2.1318397521972656, "sampling/importance_sampling_ratio/min": 0.11861886084079742, "sampling/importance_sampling_ratio/mean": 1.0325063467025757, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2800438106060028, "clip_ratio/low_mean": 0.07968073710799217, "clip_ratio/low_min": 0.07968073710799217, "clip_ratio/high_mean": 0.04280869476497173, "clip_ratio/high_max": 0.04280869476497173, "clip_ratio/region_mean": 0.1224894318729639, "reward_total_mean": 0.12054440379142761, "reward_meter_mean": 0.41248220205307007, "reward_meter_std": 0.3949904441833496, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9381199479103088, "reward_lexical_plausibility_std": 0.17502321302890778, "reward_repeat_penalty_mean": 0.8331549763679504, "reward_repeat_penalty_std": 0.2011079639196396, "reward_repeat_floor_mean": 0.980330765247345, "reward_repeat_floor_std": 0.023782573640346527, "reward_near_duplicate_penalty_mean": 0.93040531873703, "reward_near_duplicate_penalty_std": 0.077924445271492, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9391106367111206, "reward_distinct_2_std": 0.08394287526607513, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.16035674512386322, "reward_total_composite_mean": 0.12054440379142761, "reward_total_composite_std": 0.14209884405136108} {"timestamp_utc": "2026-04-12T21:04:00Z", "mode": "train", "global_step": 1332, "epoch": 0.0701015736013894, "loss": 0.0256, "grad_norm": 12.972583770751953, "learning_rate": 5.966666666666667e-06, "num_tokens": 2359148.0, "completions/mean_length": 47.375, "completions/min_length": 42.0, "completions/max_length": 58.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.375, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.5087057948112488, "rewards/meter/std": 0.2856754660606384, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.35875001549720764, "rewards/judge_quality/std": 0.2547512948513031, "rewards/repeat_penalty/mean": 0.9703654050827026, "rewards/repeat_penalty/std": 0.030687464401125908, "rewards/repeat_floor/mean": 0.9955548048019409, "rewards/repeat_floor/std": 0.004603128414601088, "rewards/near_duplicate_penalty/mean": 0.9703654050827026, "rewards/near_duplicate_penalty/std": 0.030687464401125908, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19225703179836273, "rewards/total_composite/std": 0.23409301042556763, "reward": 0.19225703179836273, "reward_std": 0.23409299552440643, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12546521425247192, "sampling/sampling_logp_difference/max": 1.9128966331481934, "sampling/importance_sampling_ratio/min": 0.14765207469463348, "sampling/importance_sampling_ratio/mean": 1.0062079429626465, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7576346695423126, "clip_ratio/low_mean": 0.06588046811521053, "clip_ratio/low_min": 0.06588046811521053, "clip_ratio/high_mean": 0.03418661281466484, "clip_ratio/high_max": 0.03418661281466484, "clip_ratio/region_mean": 0.10006708092987537, "reward_total_mean": 0.19225703179836273, "reward_meter_mean": 0.5087057948112488, "reward_meter_std": 0.2856754660606384, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9703654050827026, "reward_repeat_penalty_std": 0.030687464401125908, "reward_repeat_floor_mean": 0.9955548048019409, "reward_repeat_floor_std": 0.004603128414601088, "reward_near_duplicate_penalty_mean": 0.9703654050827026, "reward_near_duplicate_penalty_std": 0.030687464401125908, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.35875001549720764, "reward_judge_quality_std": 0.2547512948513031, "reward_total_composite_mean": 0.19225703179836273, "reward_total_composite_std": 0.23409301042556763} {"timestamp_utc": "2026-04-12T21:04:07Z", "mode": "train", "global_step": 1333, "epoch": 0.07015420241039945, "loss": 0.0849, "grad_norm": 19.595592498779297, "learning_rate": 5.963636363636364e-06, "num_tokens": 2360587.0, "completions/mean_length": 19.875, "completions/min_length": 17.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.875, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.631788969039917, "rewards/meter/std": 0.30732953548431396, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8274999856948853, "rewards/judge_quality/std": 0.27395257353782654, "rewards/repeat_penalty/mean": 0.7358227968215942, "rewards/repeat_penalty/std": 0.021537406370043755, "rewards/repeat_floor/mean": 0.9821645021438599, "rewards/repeat_floor/std": 0.004307494033128023, "rewards/near_duplicate_penalty/mean": 0.9810969829559326, "rewards/near_duplicate_penalty/std": 0.02871653251349926, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5233801603317261, "rewards/total_composite/std": 0.33242127299308777, "reward": 0.5233801603317261, "reward_std": 0.33242127299308777, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12777064740657806, "sampling/sampling_logp_difference/max": 0.9108784198760986, "sampling/importance_sampling_ratio/min": 0.4021708071231842, "sampling/importance_sampling_ratio/mean": 0.9895033836364746, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0007993504405022, "clip_ratio/low_mean": 0.016612200532108545, "clip_ratio/low_min": 0.016612200532108545, "clip_ratio/high_mean": 0.10523990355432034, "clip_ratio/high_max": 0.10523990355432034, "clip_ratio/region_mean": 0.12185210408642888, "reward_total_mean": 0.5233801603317261, "reward_meter_mean": 0.631788969039917, "reward_meter_std": 0.30732953548431396, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7358227968215942, "reward_repeat_penalty_std": 0.021537406370043755, "reward_repeat_floor_mean": 0.9821645021438599, "reward_repeat_floor_std": 0.004307494033128023, "reward_near_duplicate_penalty_mean": 0.9810969829559326, "reward_near_duplicate_penalty_std": 0.02871653251349926, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8274999856948853, "reward_judge_quality_std": 0.27395257353782654, "reward_total_composite_mean": 0.5233801603317261, "reward_total_composite_std": 0.33242127299308777} {"timestamp_utc": "2026-04-12T21:04:21Z", "mode": "train", "global_step": 1334, "epoch": 0.0702068312194095, "loss": -0.0093, "grad_norm": 4.876037120819092, "learning_rate": 5.960606060606061e-06, "num_tokens": 2362005.0, "completions/mean_length": 90.25, "completions/min_length": 25.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 30.000001907348633, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.31388479471206665, "rewards/meter/std": 0.31333035230636597, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.928798258304596, "rewards/lexical_plausibility/std": 0.14532391726970673, "rewards/judge_quality/mean": 0.5512499809265137, "rewards/judge_quality/std": 0.32965078949928284, "rewards/repeat_penalty/mean": 0.9824309349060059, "rewards/repeat_penalty/std": 0.024257978424429893, "rewards/repeat_floor/mean": 0.9973646402359009, "rewards/repeat_floor/std": 0.003638692433014512, "rewards/near_duplicate_penalty/mean": 0.9824309349060059, "rewards/near_duplicate_penalty/std": 0.024257978424429893, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.16911378502845764, "rewards/total_composite/std": 0.21125462651252747, "reward": 0.16911378502845764, "reward_std": 0.21125461161136627, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15908081829547882, "sampling/sampling_logp_difference/max": 2.7745375633239746, "sampling/importance_sampling_ratio/min": 0.06237831339240074, "sampling/importance_sampling_ratio/mean": 1.030200481414795, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6044005341827869, "clip_ratio/low_mean": 0.06565580330789089, "clip_ratio/low_min": 0.06565580330789089, "clip_ratio/high_mean": 0.04785714251920581, "clip_ratio/high_max": 0.04785714251920581, "clip_ratio/region_mean": 0.1135129458270967, "reward_total_mean": 0.16911378502845764, "reward_meter_mean": 0.31388479471206665, "reward_meter_std": 0.31333035230636597, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.928798258304596, "reward_lexical_plausibility_std": 0.14532391726970673, "reward_repeat_penalty_mean": 0.9824309349060059, "reward_repeat_penalty_std": 0.024257978424429893, "reward_repeat_floor_mean": 0.9973646402359009, "reward_repeat_floor_std": 0.003638692433014512, "reward_near_duplicate_penalty_mean": 0.9824309349060059, "reward_near_duplicate_penalty_std": 0.024257978424429893, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5512499809265137, "reward_judge_quality_std": 0.32965078949928284, "reward_total_composite_mean": 0.16911378502845764, "reward_total_composite_std": 0.21125462651252747} {"timestamp_utc": "2026-04-12T21:04:30Z", "mode": "train", "global_step": 1335, "epoch": 0.07025946002841955, "loss": 0.0229, "grad_norm": 15.11474609375, "learning_rate": 5.9575757575757575e-06, "num_tokens": 2363454.0, "completions/mean_length": 31.125, "completions/min_length": 30.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.125, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.7449922561645508, "rewards/meter/std": 0.345890611410141, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.8962662220001221, "rewards/repeat_penalty/std": 0.12483160197734833, "rewards/repeat_floor/mean": 0.9873902797698975, "rewards/repeat_floor/std": 0.012200391851365566, "rewards/near_duplicate_penalty/mean": 0.9420095682144165, "rewards/near_duplicate_penalty/std": 0.031333182007074356, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9773755669593811, "rewards/distinct_2/std": 0.041892312467098236, "rewards/total_composite/mean": 0.2827579975128174, "rewards/total_composite/std": 0.141471728682518, "reward": 0.2827579975128174, "reward_std": 0.1414717137813568, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13726504147052765, "sampling/sampling_logp_difference/max": 1.2310478687286377, "sampling/importance_sampling_ratio/min": 0.3327532708644867, "sampling/importance_sampling_ratio/mean": 1.0139583349227905, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8659693971276283, "clip_ratio/low_mean": 0.03214885760098696, "clip_ratio/low_min": 0.03214885760098696, "clip_ratio/high_mean": 0.07657701056450605, "clip_ratio/high_max": 0.07657701056450605, "clip_ratio/region_mean": 0.10872586816549301, "reward_total_mean": 0.2827579975128174, "reward_meter_mean": 0.7449922561645508, "reward_meter_std": 0.345890611410141, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8962662220001221, "reward_repeat_penalty_std": 0.12483160197734833, "reward_repeat_floor_mean": 0.9873902797698975, "reward_repeat_floor_std": 0.012200391851365566, "reward_near_duplicate_penalty_mean": 0.9420095682144165, "reward_near_duplicate_penalty_std": 0.031333182007074356, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9773755669593811, "reward_distinct_2_std": 0.041892312467098236, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.2827579975128174, "reward_total_composite_std": 0.141471728682518} {"timestamp_utc": "2026-04-12T21:04:38Z", "mode": "train", "global_step": 1336, "epoch": 0.0703120888374296, "loss": 0.0494, "grad_norm": 18.25756072998047, "learning_rate": 5.954545454545455e-06, "num_tokens": 2364797.0, "completions/mean_length": 18.875, "completions/min_length": 17.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.875, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.4056404232978821, "rewards/meter/std": 0.4821144640445709, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9583333134651184, "rewards/lexical_plausibility/std": 0.07715168595314026, "rewards/judge_quality/mean": 0.6312500238418579, "rewards/judge_quality/std": 0.3985128402709961, "rewards/repeat_penalty/mean": 0.7222431898117065, "rewards/repeat_penalty/std": 0.043818067759275436, "rewards/repeat_floor/mean": 0.9804101586341858, "rewards/repeat_floor/std": 0.007357505150139332, "rewards/near_duplicate_penalty/mean": 0.9790165424346924, "rewards/near_duplicate_penalty/std": 0.04612409323453903, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9839743375778198, "rewards/distinct_2/std": 0.045327357947826385, "rewards/total_composite/mean": 0.27239811420440674, "rewards/total_composite/std": 0.38402673602104187, "reward": 0.27239811420440674, "reward_std": 0.38402673602104187, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1581733375787735, "sampling/sampling_logp_difference/max": 1.3176019191741943, "sampling/importance_sampling_ratio/min": 0.2677766680717468, "sampling/importance_sampling_ratio/mean": 1.024709701538086, "sampling/importance_sampling_ratio/max": 1.932660698890686, "entropy": 1.444681629538536, "clip_ratio/low_mean": 0.0983396009542048, "clip_ratio/low_min": 0.0983396009542048, "clip_ratio/high_mean": 0.020955882500857115, "clip_ratio/high_max": 0.020955882500857115, "clip_ratio/region_mean": 0.11929548345506191, "reward_total_mean": 0.27239811420440674, "reward_meter_mean": 0.4056404232978821, "reward_meter_std": 0.4821144640445709, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9583333134651184, "reward_lexical_plausibility_std": 0.07715168595314026, "reward_repeat_penalty_mean": 0.7222431898117065, "reward_repeat_penalty_std": 0.043818067759275436, "reward_repeat_floor_mean": 0.9804101586341858, "reward_repeat_floor_std": 0.007357505150139332, "reward_near_duplicate_penalty_mean": 0.9790165424346924, "reward_near_duplicate_penalty_std": 0.04612409323453903, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9839743375778198, "reward_distinct_2_std": 0.045327357947826385, "reward_judge_quality_mean": 0.6312500238418579, "reward_judge_quality_std": 0.3985128402709961, "reward_total_composite_mean": 0.27239811420440674, "reward_total_composite_std": 0.38402673602104187} {"timestamp_utc": "2026-04-12T21:04:46Z", "mode": "train", "global_step": 1337, "epoch": 0.07036471764643966, "loss": 0.0489, "grad_norm": 19.248550415039062, "learning_rate": 5.951515151515151e-06, "num_tokens": 2366363.0, "completions/mean_length": 29.75, "completions/min_length": 26.0, "completions/max_length": 34.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.75, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 34.0, "rewards/meter/mean": 0.7595674991607666, "rewards/meter/std": 0.31441497802734375, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.706250011920929, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.9774717092514038, "rewards/repeat_penalty/std": 0.02531072497367859, "rewards/repeat_floor/mean": 0.996620774269104, "rewards/repeat_floor/std": 0.0037966088857501745, "rewards/near_duplicate_penalty/mean": 0.9774717092514038, "rewards/near_duplicate_penalty/std": 0.02531072497367859, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.49833065271377563, "rewards/total_composite/std": 0.3029429018497467, "reward": 0.49833065271377563, "reward_std": 0.3029429018497467, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13983580470085144, "sampling/sampling_logp_difference/max": 2.5629851818084717, "sampling/importance_sampling_ratio/min": 0.0770743116736412, "sampling/importance_sampling_ratio/mean": 1.0089911222457886, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.654912032186985, "clip_ratio/low_mean": 0.06771845556795597, "clip_ratio/low_min": 0.06771845556795597, "clip_ratio/high_mean": 0.051996528171002865, "clip_ratio/high_max": 0.051996528171002865, "clip_ratio/region_mean": 0.11971498373895884, "reward_total_mean": 0.49833065271377563, "reward_meter_mean": 0.7595674991607666, "reward_meter_std": 0.31441497802734375, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9774717092514038, "reward_repeat_penalty_std": 0.02531072497367859, "reward_repeat_floor_mean": 0.996620774269104, "reward_repeat_floor_std": 0.0037966088857501745, "reward_near_duplicate_penalty_mean": 0.9774717092514038, "reward_near_duplicate_penalty_std": 0.02531072497367859, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.706250011920929, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.49833065271377563, "reward_total_composite_std": 0.3029429018497467} {"timestamp_utc": "2026-04-12T21:04:55Z", "mode": "train", "global_step": 1338, "epoch": 0.07041734645544971, "loss": 0.0239, "grad_norm": 16.78009605407715, "learning_rate": 5.948484848484849e-06, "num_tokens": 2367850.0, "completions/mean_length": 22.875, "completions/min_length": 21.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.875, "completions/min_terminated_length": 21.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.6153329610824585, "rewards/meter/std": 0.4986436665058136, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8966874480247498, "rewards/lexical_plausibility/std": 0.19146236777305603, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.31664496660232544, "rewards/total_composite/std": 0.303794801235199, "reward": 0.31664496660232544, "reward_std": 0.30379483103752136, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.132952019572258, "sampling/sampling_logp_difference/max": 1.6494522094726562, "sampling/importance_sampling_ratio/min": 0.1921551376581192, "sampling/importance_sampling_ratio/mean": 1.018856167793274, "sampling/importance_sampling_ratio/max": 1.979230523109436, "entropy": 0.7560481987893581, "clip_ratio/low_mean": 0.022727273404598236, "clip_ratio/low_min": 0.022727273404598236, "clip_ratio/high_mean": 0.0716314953751862, "clip_ratio/high_max": 0.0716314953751862, "clip_ratio/region_mean": 0.09435876877978444, "reward_total_mean": 0.31664496660232544, "reward_meter_mean": 0.6153329610824585, "reward_meter_std": 0.4986436665058136, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8966874480247498, "reward_lexical_plausibility_std": 0.19146236777305603, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.31664496660232544, "reward_total_composite_std": 0.303794801235199} {"timestamp_utc": "2026-04-12T21:05:04Z", "mode": "train", "global_step": 1339, "epoch": 0.07046997526445976, "loss": 0.027, "grad_norm": 12.262737274169922, "learning_rate": 5.9454545454545465e-06, "num_tokens": 2369434.0, "completions/mean_length": 43.0, "completions/min_length": 34.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.0, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.2623853385448456, "rewards/meter/std": 0.20935364067554474, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.19272480905056, "rewards/repeat_penalty/mean": 0.8575524091720581, "rewards/repeat_penalty/std": 0.14713476598262787, "rewards/repeat_floor/mean": 0.9816502928733826, "rewards/repeat_floor/std": 0.01966172643005848, "rewards/near_duplicate_penalty/mean": 0.9254277944564819, "rewards/near_duplicate_penalty/std": 0.07353144884109497, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9204013347625732, "rewards/distinct_2/std": 0.1032467931509018, "rewards/total_composite/mean": 0.10366801917552948, "rewards/total_composite/std": 0.11016611754894257, "reward": 0.10366801917552948, "reward_std": 0.11016611009836197, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14227178692817688, "sampling/sampling_logp_difference/max": 1.1470770835876465, "sampling/importance_sampling_ratio/min": 0.3489612936973572, "sampling/importance_sampling_ratio/mean": 1.0451797246932983, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0176433250308037, "clip_ratio/low_mean": 0.05705008003860712, "clip_ratio/low_min": 0.05705008003860712, "clip_ratio/high_mean": 0.04405931103974581, "clip_ratio/high_max": 0.04405931103974581, "clip_ratio/region_mean": 0.10110939107835293, "reward_total_mean": 0.10366801917552948, "reward_meter_mean": 0.2623853385448456, "reward_meter_std": 0.20935364067554474, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.8575524091720581, "reward_repeat_penalty_std": 0.14713476598262787, "reward_repeat_floor_mean": 0.9816502928733826, "reward_repeat_floor_std": 0.01966172643005848, "reward_near_duplicate_penalty_mean": 0.9254277944564819, "reward_near_duplicate_penalty_std": 0.07353144884109497, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9204013347625732, "reward_distinct_2_std": 0.1032467931509018, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.19272480905056, "reward_total_composite_mean": 0.10366801917552948, "reward_total_composite_std": 0.11016611754894257} {"timestamp_utc": "2026-04-12T21:05:13Z", "mode": "train", "global_step": 1340, "epoch": 0.07052260407346982, "loss": 0.0322, "grad_norm": 16.645898818969727, "learning_rate": 5.942424242424243e-06, "num_tokens": 2370831.0, "completions/mean_length": 21.625, "completions/min_length": 20.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 21.625, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.8770867586135864, "rewards/meter/std": 0.15601903200149536, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.7244318127632141, "rewards/repeat_penalty/std": 0.07231773436069489, "rewards/repeat_floor/mean": 0.9798864126205444, "rewards/repeat_floor/std": 0.014463555067777634, "rewards/near_duplicate_penalty/mean": 0.9659091234207153, "rewards/near_duplicate_penalty/std": 0.09642364084720612, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2758499085903168, "rewards/total_composite/std": 0.12271127849817276, "reward": 0.2758499085903168, "reward_std": 0.12271127104759216, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11157049983739853, "sampling/sampling_logp_difference/max": 1.4268903732299805, "sampling/importance_sampling_ratio/min": 0.35402795672416687, "sampling/importance_sampling_ratio/mean": 1.0266693830490112, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0060660168528557, "clip_ratio/low_mean": 0.03436147281900048, "clip_ratio/low_min": 0.03436147281900048, "clip_ratio/high_mean": 0.029051383957266808, "clip_ratio/high_max": 0.029051383957266808, "clip_ratio/region_mean": 0.06341285677626729, "reward_total_mean": 0.2758499085903168, "reward_meter_mean": 0.8770867586135864, "reward_meter_std": 0.15601903200149536, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7244318127632141, "reward_repeat_penalty_std": 0.07231773436069489, "reward_repeat_floor_mean": 0.9798864126205444, "reward_repeat_floor_std": 0.014463555067777634, "reward_near_duplicate_penalty_mean": 0.9659091234207153, "reward_near_duplicate_penalty_std": 0.09642364084720612, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.2758499085903168, "reward_total_composite_std": 0.12271127849817276} {"timestamp_utc": "2026-04-12T21:05:22Z", "mode": "train", "global_step": 1341, "epoch": 0.07057523288247987, "loss": -0.0235, "grad_norm": 18.747194290161133, "learning_rate": 5.93939393939394e-06, "num_tokens": 2372133.0, "completions/mean_length": 19.75, "completions/min_length": 16.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.75, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.69395911693573, "rewards/meter/std": 0.4084942936897278, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.4424999952316284, "rewards/judge_quality/std": 0.32101404666900635, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2757655084133148, "rewards/total_composite/std": 0.283772349357605, "reward": 0.2757655084133148, "reward_std": 0.2837723195552826, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1769968569278717, "sampling/sampling_logp_difference/max": 1.8524599075317383, "sampling/importance_sampling_ratio/min": 0.15685085952281952, "sampling/importance_sampling_ratio/mean": 1.0295871496200562, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4551164731383324, "clip_ratio/low_mean": 0.10098127275705338, "clip_ratio/low_min": 0.10098127275705338, "clip_ratio/high_mean": 0.08438108954578638, "clip_ratio/high_max": 0.08438108954578638, "clip_ratio/region_mean": 0.18536236230283976, "reward_total_mean": 0.2757655084133148, "reward_meter_mean": 0.69395911693573, "reward_meter_std": 0.4084942936897278, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4424999952316284, "reward_judge_quality_std": 0.32101404666900635, "reward_total_composite_mean": 0.2757655084133148, "reward_total_composite_std": 0.283772349357605} {"timestamp_utc": "2026-04-12T21:05:30Z", "mode": "train", "global_step": 1342, "epoch": 0.07062786169148992, "loss": 0.0421, "grad_norm": 22.94560432434082, "learning_rate": 5.936363636363637e-06, "num_tokens": 2373481.0, "completions/mean_length": 20.5, "completions/min_length": 17.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.5, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.7192360162734985, "rewards/meter/std": 0.40795576572418213, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8970077037811279, "rewards/lexical_plausibility/std": 0.15017901360988617, "rewards/judge_quality/mean": 0.48000001907348633, "rewards/judge_quality/std": 0.28400203585624695, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3278992176055908, "rewards/total_composite/std": 0.26390430331230164, "reward": 0.3278992176055908, "reward_std": 0.26390430331230164, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13400386273860931, "sampling/sampling_logp_difference/max": 1.407149314880371, "sampling/importance_sampling_ratio/min": 0.24484024941921234, "sampling/importance_sampling_ratio/mean": 0.990134060382843, "sampling/importance_sampling_ratio/max": 1.6668946743011475, "entropy": 0.8336775004863739, "clip_ratio/low_mean": 0.029051383957266808, "clip_ratio/low_min": 0.029051383957266808, "clip_ratio/high_mean": 0.08135981857776642, "clip_ratio/high_max": 0.08135981857776642, "clip_ratio/region_mean": 0.11041120253503323, "reward_total_mean": 0.3278992176055908, "reward_meter_mean": 0.7192360162734985, "reward_meter_std": 0.40795576572418213, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8970077037811279, "reward_lexical_plausibility_std": 0.15017901360988617, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.48000001907348633, "reward_judge_quality_std": 0.28400203585624695, "reward_total_composite_mean": 0.3278992176055908, "reward_total_composite_std": 0.26390430331230164} {"timestamp_utc": "2026-04-12T21:05:39Z", "mode": "train", "global_step": 1343, "epoch": 0.07068049050049997, "loss": -0.2433, "grad_norm": 28.78751564025879, "learning_rate": 5.933333333333335e-06, "num_tokens": 2375007.0, "completions/mean_length": 23.75, "completions/min_length": 20.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 23.75, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.1911235898733139, "rewards/meter/std": 0.31535324454307556, "rewards/count_adherence/mean": 0.5625, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8687500357627869, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5425000190734863, "rewards/judge_quality/std": 0.24300207197666168, "rewards/repeat_penalty/mean": 0.6611138582229614, "rewards/repeat_penalty/std": 0.1448705792427063, "rewards/repeat_floor/mean": 0.9642741084098816, "rewards/repeat_floor/std": 0.02458568662405014, "rewards/near_duplicate_penalty/mean": 0.8653113842010498, "rewards/near_duplicate_penalty/std": 0.13877561688423157, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9733599424362183, "rewards/distinct_2/std": 0.05244094878435135, "rewards/total_composite/mean": 0.08030793815851212, "rewards/total_composite/std": 0.13778293132781982, "reward": 0.08030793815851212, "reward_std": 0.13778293132781982, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11889927834272385, "sampling/sampling_logp_difference/max": 1.9986169338226318, "sampling/importance_sampling_ratio/min": 0.13552258908748627, "sampling/importance_sampling_ratio/mean": 1.0226681232452393, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5903017409145832, "clip_ratio/low_mean": 0.059188548009842634, "clip_ratio/low_min": 0.059188548009842634, "clip_ratio/high_mean": 0.048096624203026295, "clip_ratio/high_max": 0.048096624203026295, "clip_ratio/region_mean": 0.10728517221286893, "reward_total_mean": 0.08030793815851212, "reward_meter_mean": 0.1911235898733139, "reward_meter_std": 0.31535324454307556, "reward_count_adherence_mean": 0.5625, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8687500357627869, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6611138582229614, "reward_repeat_penalty_std": 0.1448705792427063, "reward_repeat_floor_mean": 0.9642741084098816, "reward_repeat_floor_std": 0.02458568662405014, "reward_near_duplicate_penalty_mean": 0.8653113842010498, "reward_near_duplicate_penalty_std": 0.13877561688423157, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9733599424362183, "reward_distinct_2_std": 0.05244094878435135, "reward_judge_quality_mean": 0.5425000190734863, "reward_judge_quality_std": 0.24300207197666168, "reward_total_composite_mean": 0.08030793815851212, "reward_total_composite_std": 0.13778293132781982} {"timestamp_utc": "2026-04-12T21:05:53Z", "mode": "train", "global_step": 1344, "epoch": 0.07073311930951003, "loss": -0.0507, "grad_norm": 4.89669132232666, "learning_rate": 5.93030303030303e-06, "num_tokens": 2376668.0, "completions/mean_length": 95.625, "completions/min_length": 32.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 36.142860412597656, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.762590765953064, "rewards/meter/std": 0.39094144105911255, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9368090629577637, "rewards/lexical_plausibility/std": 0.17873097956180573, "rewards/judge_quality/mean": 0.3712500035762787, "rewards/judge_quality/std": 0.26221245527267456, "rewards/repeat_penalty/mean": 0.9478107690811157, "rewards/repeat_penalty/std": 0.06123568117618561, "rewards/repeat_floor/mean": 0.9921716451644897, "rewards/repeat_floor/std": 0.009185356087982655, "rewards/near_duplicate_penalty/mean": 0.9478107690811157, "rewards/near_duplicate_penalty/std": 0.06123568117618561, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33013030886650085, "rewards/total_composite/std": 0.2820541262626648, "reward": 0.33013030886650085, "reward_std": 0.2820541262626648, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1354329138994217, "sampling/sampling_logp_difference/max": 1.396352767944336, "sampling/importance_sampling_ratio/min": 0.24749800562858582, "sampling/importance_sampling_ratio/mean": 1.0293217897415161, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.849513866007328, "clip_ratio/low_mean": 0.024766900576651096, "clip_ratio/low_min": 0.024766900576651096, "clip_ratio/high_mean": 0.07912216754630208, "clip_ratio/high_max": 0.07912216754630208, "clip_ratio/region_mean": 0.10388906812295318, "reward_total_mean": 0.33013030886650085, "reward_meter_mean": 0.762590765953064, "reward_meter_std": 0.39094144105911255, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9368090629577637, "reward_lexical_plausibility_std": 0.17873097956180573, "reward_repeat_penalty_mean": 0.9478107690811157, "reward_repeat_penalty_std": 0.06123568117618561, "reward_repeat_floor_mean": 0.9921716451644897, "reward_repeat_floor_std": 0.009185356087982655, "reward_near_duplicate_penalty_mean": 0.9478107690811157, "reward_near_duplicate_penalty_std": 0.06123568117618561, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3712500035762787, "reward_judge_quality_std": 0.26221245527267456, "reward_total_composite_mean": 0.33013030886650085, "reward_total_composite_std": 0.2820541262626648} {"timestamp_utc": "2026-04-12T21:06:03Z", "mode": "train", "global_step": 1345, "epoch": 0.07078574811852008, "loss": 0.0159, "grad_norm": 11.656355857849121, "learning_rate": 5.927272727272728e-06, "num_tokens": 2378719.0, "completions/mean_length": 69.375, "completions/min_length": 50.0, "completions/max_length": 87.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 69.375, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.23912623524665833, "rewards/meter/std": 0.10712283104658127, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9455697536468506, "rewards/repeat_penalty/std": 0.04058167710900307, "rewards/repeat_floor/mean": 0.99339759349823, "rewards/repeat_floor/std": 0.004497841466218233, "rewards/near_duplicate_penalty/mean": 0.9730124473571777, "rewards/near_duplicate_penalty/std": 0.016804536804556847, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9716193675994873, "rewards/distinct_2/std": 0.03252477943897247, "rewards/total_composite/mean": 0.12076690047979355, "rewards/total_composite/std": 0.08739064633846283, "reward": 0.12076690047979355, "reward_std": 0.08739064633846283, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12272132933139801, "sampling/sampling_logp_difference/max": 2.1556904315948486, "sampling/importance_sampling_ratio/min": 0.11582319438457489, "sampling/importance_sampling_ratio/mean": 1.021725058555603, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8600974380970001, "clip_ratio/low_mean": 0.08951093722134829, "clip_ratio/low_min": 0.08951093722134829, "clip_ratio/high_mean": 0.03435477614402771, "clip_ratio/high_max": 0.03435477614402771, "clip_ratio/region_mean": 0.123865713365376, "reward_total_mean": 0.12076690047979355, "reward_meter_mean": 0.23912623524665833, "reward_meter_std": 0.10712283104658127, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9455697536468506, "reward_repeat_penalty_std": 0.04058167710900307, "reward_repeat_floor_mean": 0.99339759349823, "reward_repeat_floor_std": 0.004497841466218233, "reward_near_duplicate_penalty_mean": 0.9730124473571777, "reward_near_duplicate_penalty_std": 0.016804536804556847, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9716193675994873, "reward_distinct_2_std": 0.03252477943897247, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.12076690047979355, "reward_total_composite_std": 0.08739064633846283} {"timestamp_utc": "2026-04-12T21:06:12Z", "mode": "train", "global_step": 1346, "epoch": 0.07083837692753013, "loss": 0.1058, "grad_norm": 11.502700805664062, "learning_rate": 5.924242424242425e-06, "num_tokens": 2380523.0, "completions/mean_length": 52.5, "completions/min_length": 47.0, "completions/max_length": 61.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 52.5, "completions/min_terminated_length": 47.0, "completions/max_terminated_length": 61.0, "rewards/meter/mean": 0.5352987051010132, "rewards/meter/std": 0.39597681164741516, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5037499666213989, "rewards/judge_quality/std": 0.20063738524913788, "rewards/repeat_penalty/mean": 0.9632002115249634, "rewards/repeat_penalty/std": 0.035562869161367416, "rewards/repeat_floor/mean": 0.9944800138473511, "rewards/repeat_floor/std": 0.005334425717592239, "rewards/near_duplicate_penalty/mean": 0.9632002115249634, "rewards/near_duplicate_penalty/std": 0.035562869161367416, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24508020281791687, "rewards/total_composite/std": 0.24223540723323822, "reward": 0.24508020281791687, "reward_std": 0.24223540723323822, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1574449986219406, "sampling/sampling_logp_difference/max": 1.6950253248214722, "sampling/importance_sampling_ratio/min": 0.18359458446502686, "sampling/importance_sampling_ratio/mean": 1.0045570135116577, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9134382382035255, "clip_ratio/low_mean": 0.06826232187449932, "clip_ratio/low_min": 0.06826232187449932, "clip_ratio/high_mean": 0.06593528389930725, "clip_ratio/high_max": 0.06593528389930725, "clip_ratio/region_mean": 0.13419760577380657, "reward_total_mean": 0.24508020281791687, "reward_meter_mean": 0.5352987051010132, "reward_meter_std": 0.39597681164741516, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9632002115249634, "reward_repeat_penalty_std": 0.035562869161367416, "reward_repeat_floor_mean": 0.9944800138473511, "reward_repeat_floor_std": 0.005334425717592239, "reward_near_duplicate_penalty_mean": 0.9632002115249634, "reward_near_duplicate_penalty_std": 0.035562869161367416, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5037499666213989, "reward_judge_quality_std": 0.20063738524913788, "reward_total_composite_mean": 0.24508020281791687, "reward_total_composite_std": 0.24223540723323822} {"timestamp_utc": "2026-04-12T21:06:22Z", "mode": "train", "global_step": 1347, "epoch": 0.07089100573654018, "loss": -0.0308, "grad_norm": 15.962719917297363, "learning_rate": 5.921212121212122e-06, "num_tokens": 2382024.0, "completions/mean_length": 34.625, "completions/min_length": 30.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.625, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.34192168712615967, "rewards/meter/std": 0.4041561782360077, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.8611999154090881, "rewards/repeat_penalty/std": 0.1596219688653946, "rewards/repeat_floor/mean": 0.9850544929504395, "rewards/repeat_floor/std": 0.016116490587592125, "rewards/near_duplicate_penalty/mean": 0.9493511319160461, "rewards/near_duplicate_penalty/std": 0.051018115133047104, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9600202441215515, "rewards/distinct_2/std": 0.0427606962621212, "rewards/total_composite/mean": 0.15181896090507507, "rewards/total_composite/std": 0.17981407046318054, "reward": 0.15181896090507507, "reward_std": 0.17981407046318054, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13988859951496124, "sampling/sampling_logp_difference/max": 1.478764533996582, "sampling/importance_sampling_ratio/min": 0.2279191017150879, "sampling/importance_sampling_ratio/mean": 1.0210132598876953, "sampling/importance_sampling_ratio/max": 1.8616483211517334, "entropy": 0.812345951795578, "clip_ratio/low_mean": 0.06189163215458393, "clip_ratio/low_min": 0.06189163215458393, "clip_ratio/high_mean": 0.05940402578562498, "clip_ratio/high_max": 0.05940402578562498, "clip_ratio/region_mean": 0.12129565794020891, "reward_total_mean": 0.15181896090507507, "reward_meter_mean": 0.34192168712615967, "reward_meter_std": 0.4041561782360077, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8611999154090881, "reward_repeat_penalty_std": 0.1596219688653946, "reward_repeat_floor_mean": 0.9850544929504395, "reward_repeat_floor_std": 0.016116490587592125, "reward_near_duplicate_penalty_mean": 0.9493511319160461, "reward_near_duplicate_penalty_std": 0.051018115133047104, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9600202441215515, "reward_distinct_2_std": 0.0427606962621212, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.15181896090507507, "reward_total_composite_std": 0.17981407046318054} {"timestamp_utc": "2026-04-12T21:06:32Z", "mode": "train", "global_step": 1348, "epoch": 0.07094363454555024, "loss": -0.0222, "grad_norm": 8.237163543701172, "learning_rate": 5.9181818181818184e-06, "num_tokens": 2384064.0, "completions/mean_length": 81.0, "completions/min_length": 71.0, "completions/max_length": 86.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 81.0, "completions/min_terminated_length": 71.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.4922606945037842, "rewards/meter/std": 0.28914427757263184, "rewards/count_adherence/mean": 0.7749999761581421, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9325000047683716, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.6950436234474182, "rewards/repeat_penalty/std": 0.15762493014335632, "rewards/repeat_floor/mean": 0.9687133431434631, "rewards/repeat_floor/std": 0.014708437956869602, "rewards/near_duplicate_penalty/mean": 0.9244886636734009, "rewards/near_duplicate_penalty/std": 0.026336971670389175, "rewards/opening_diversity/mean": 0.8459821343421936, "rewards/opening_diversity/std": 0.13788791000843048, "rewards/distinct_2/mean": 0.8809012174606323, "rewards/distinct_2/std": 0.056934669613838196, "rewards/total_composite/mean": 0.15719106793403625, "rewards/total_composite/std": 0.09392759203910828, "reward": 0.15719106793403625, "reward_std": 0.09392759203910828, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09304961562156677, "sampling/sampling_logp_difference/max": 1.6117572784423828, "sampling/importance_sampling_ratio/min": 0.19953665137290955, "sampling/importance_sampling_ratio/mean": 1.0139282941818237, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5484872162342072, "clip_ratio/low_mean": 0.04864370170980692, "clip_ratio/low_min": 0.04864370170980692, "clip_ratio/high_mean": 0.04072190914303064, "clip_ratio/high_max": 0.04072190914303064, "clip_ratio/region_mean": 0.08936561085283756, "reward_total_mean": 0.15719106793403625, "reward_meter_mean": 0.4922606945037842, "reward_meter_std": 0.28914427757263184, "reward_count_adherence_mean": 0.7749999761581421, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9325000047683716, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6950436234474182, "reward_repeat_penalty_std": 0.15762493014335632, "reward_repeat_floor_mean": 0.9687133431434631, "reward_repeat_floor_std": 0.014708437956869602, "reward_near_duplicate_penalty_mean": 0.9244886636734009, "reward_near_duplicate_penalty_std": 0.026336971670389175, "reward_opening_diversity_mean": 0.8459821343421936, "reward_opening_diversity_std": 0.13788791000843048, "reward_distinct_2_mean": 0.8809012174606323, "reward_distinct_2_std": 0.056934669613838196, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.15719106793403625, "reward_total_composite_std": 0.09392759203910828} {"timestamp_utc": "2026-04-12T21:06:42Z", "mode": "train", "global_step": 1349, "epoch": 0.07099626335456029, "loss": 0.0481, "grad_norm": 18.330005645751953, "learning_rate": 5.915151515151516e-06, "num_tokens": 2386218.0, "completions/mean_length": 77.25, "completions/min_length": 57.0, "completions/max_length": 93.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 77.25, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 93.0, "rewards/meter/mean": 0.7401382923126221, "rewards/meter/std": 0.29889345169067383, "rewards/count_adherence/mean": 0.7291666269302368, "rewards/count_adherence/std": 0.0862581729888916, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.918749988079071, "rewards/count_floor/std": 0.025877466425299644, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.8779439926147461, "rewards/repeat_penalty/std": 0.14439068734645844, "rewards/repeat_floor/mean": 0.9890173673629761, "rewards/repeat_floor/std": 0.01079222746193409, "rewards/near_duplicate_penalty/mean": 0.9661540389060974, "rewards/near_duplicate_penalty/std": 0.018562816083431244, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9395886659622192, "rewards/distinct_2/std": 0.09003165364265442, "rewards/total_composite/mean": 0.23585084080696106, "rewards/total_composite/std": 0.09582413733005524, "reward": 0.23585084080696106, "reward_std": 0.09582413733005524, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1618015468120575, "sampling/sampling_logp_difference/max": 2.6795687675476074, "sampling/importance_sampling_ratio/min": 0.06859272718429565, "sampling/importance_sampling_ratio/mean": 0.9965869784355164, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7429374642670155, "clip_ratio/low_mean": 0.036150677129626274, "clip_ratio/low_min": 0.036150677129626274, "clip_ratio/high_mean": 0.0889024892821908, "clip_ratio/high_max": 0.0889024892821908, "clip_ratio/region_mean": 0.12505316641181707, "reward_total_mean": 0.23585084080696106, "reward_meter_mean": 0.7401382923126221, "reward_meter_std": 0.29889345169067383, "reward_count_adherence_mean": 0.7291666269302368, "reward_count_adherence_std": 0.0862581729888916, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.918749988079071, "reward_count_floor_std": 0.025877466425299644, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8779439926147461, "reward_repeat_penalty_std": 0.14439068734645844, "reward_repeat_floor_mean": 0.9890173673629761, "reward_repeat_floor_std": 0.01079222746193409, "reward_near_duplicate_penalty_mean": 0.9661540389060974, "reward_near_duplicate_penalty_std": 0.018562816083431244, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9395886659622192, "reward_distinct_2_std": 0.09003165364265442, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.23585084080696106, "reward_total_composite_std": 0.09582413733005524} {"timestamp_utc": "2026-04-12T21:06:55Z", "mode": "train", "global_step": 1350, "epoch": 0.07104889216357034, "loss": -0.1168, "grad_norm": 4.394704341888428, "learning_rate": 5.912121212121212e-06, "num_tokens": 2387843.0, "completions/mean_length": 133.125, "completions/min_length": 58.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 79.0, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 87.0, "rewards/meter/mean": 0.7351717352867126, "rewards/meter/std": 0.2567211985588074, "rewards/count_adherence/mean": 0.7000000476837158, "rewards/count_adherence/std": 0.10690449178218842, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9099999666213989, "rewards/count_floor/std": 0.03207135200500488, "rewards/lexical_plausibility/mean": 0.9479739665985107, "rewards/lexical_plausibility/std": 0.14715181291103363, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.16850179433822632, "rewards/repeat_penalty/mean": 0.6231215000152588, "rewards/repeat_penalty/std": 0.1780499666929245, "rewards/repeat_floor/mean": 0.9563164114952087, "rewards/repeat_floor/std": 0.021974630653858185, "rewards/near_duplicate_penalty/mean": 0.8819572925567627, "rewards/near_duplicate_penalty/std": 0.06823018938302994, "rewards/opening_diversity/mean": 0.9821428656578064, "rewards/opening_diversity/std": 0.05050762742757797, "rewards/distinct_2/mean": 0.723268985748291, "rewards/distinct_2/std": 0.1439959555864334, "rewards/total_composite/mean": 0.19434238970279694, "rewards/total_composite/std": 0.1278955191373825, "reward": 0.19434238970279694, "reward_std": 0.1278955042362213, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15208876132965088, "sampling/sampling_logp_difference/max": 1.3241920471191406, "sampling/importance_sampling_ratio/min": 0.2660177946090698, "sampling/importance_sampling_ratio/mean": 1.0494314432144165, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2887413948774338, "clip_ratio/low_mean": 0.0809740275144577, "clip_ratio/low_min": 0.0809740275144577, "clip_ratio/high_mean": 0.031374077312648296, "clip_ratio/high_max": 0.031374077312648296, "clip_ratio/region_mean": 0.112348104827106, "reward_total_mean": 0.19434238970279694, "reward_meter_mean": 0.7351717352867126, "reward_meter_std": 0.2567211985588074, "reward_count_adherence_mean": 0.7000000476837158, "reward_count_adherence_std": 0.10690449178218842, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9099999666213989, "reward_count_floor_std": 0.03207135200500488, "reward_lexical_plausibility_mean": 0.9479739665985107, "reward_lexical_plausibility_std": 0.14715181291103363, "reward_repeat_penalty_mean": 0.6231215000152588, "reward_repeat_penalty_std": 0.1780499666929245, "reward_repeat_floor_mean": 0.9563164114952087, "reward_repeat_floor_std": 0.021974630653858185, "reward_near_duplicate_penalty_mean": 0.8819572925567627, "reward_near_duplicate_penalty_std": 0.06823018938302994, "reward_opening_diversity_mean": 0.9821428656578064, "reward_opening_diversity_std": 0.05050762742757797, "reward_distinct_2_mean": 0.723268985748291, "reward_distinct_2_std": 0.1439959555864334, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.16850179433822632, "reward_total_composite_mean": 0.19434238970279694, "reward_total_composite_std": 0.1278955191373825} {"timestamp_utc": "2026-04-12T21:08:49Z", "mode": "eval", "global_step": 1350, "epoch": 0.07104889216357034, "eval_loss": NaN, "eval_runtime": 113.8978, "eval_samples_per_second": 0.913, "eval_steps_per_second": 0.114, "eval_num_tokens": 2387843.0, "eval_completions/mean_length": 123.10576923076923, "eval_completions/min_length": 34.38461538461539, "eval_completions/max_length": 296.84615384615387, "eval_completions/clipped_ratio": 0.057692307692307696, "eval_completions/mean_terminated_length": 98.96456263615535, "eval_completions/min_terminated_length": 34.38461538461539, "eval_completions/max_terminated_length": 201.07692307692307, "eval_rewards/meter/mean": 0.3967132041087517, "eval_rewards/meter/std": 0.323750662115904, "eval_rewards/count_adherence/mean": 0.77610732958867, "eval_rewards/count_adherence/std": 0.1695853414443823, "eval_rewards/arabic_clean/mean": 0.9134615384615384, "eval_rewards/arabic_clean/std": 0.202989963384775, "eval_rewards/hard_gate/mean": 0.9903846153846154, "eval_rewards/hard_gate/std": 0.027196414195574246, "eval_rewards/arabic_floor/mean": 0.9985576913906977, "eval_rewards/arabic_floor/std": 0.004079461670838869, "eval_rewards/count_floor/mean": 0.9328321997935956, "eval_rewards/count_floor/std": 0.05087560472580103, "eval_rewards/lexical_plausibility/mean": 0.9669988705561712, "eval_rewards/lexical_plausibility/std": 0.06795883981081155, "eval_rewards/judge_quality/mean": 0.36019229888916016, "eval_rewards/judge_quality/std": 0.1346744207235483, "eval_rewards/repeat_penalty/mean": 0.8318327757028433, "eval_rewards/repeat_penalty/std": 0.17920942375293145, "eval_rewards/repeat_floor/mean": 0.9802892116399912, "eval_rewards/repeat_floor/std": 0.021804944038964234, "eval_rewards/near_duplicate_penalty/mean": 0.9425610762376052, "eval_rewards/near_duplicate_penalty/std": 0.05716199628435648, "eval_rewards/opening_diversity/mean": 0.9599059866024897, "eval_rewards/opening_diversity/std": 0.10513016638847497, "eval_rewards/distinct_2/mean": 0.9034522496736966, "eval_rewards/distinct_2/std": 0.11727129410092647, "eval_rewards/total_composite/mean": 0.1378111976843614, "eval_rewards/total_composite/std": 0.13167950023825353, "eval_reward": 0.1378111976843614, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.08142225730877656, "eval_sampling/sampling_logp_difference/max": 1.2555783711946928, "eval_sampling/importance_sampling_ratio/min": 0.2909806794845141, "eval_sampling/importance_sampling_ratio/mean": 1.0189277667265673, "eval_sampling/importance_sampling_ratio/max": 1.6015074253082275, "eval_entropy": 0.9267999208890475, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.1378111976843614, "eval_reward_meter_mean": 0.3967132041087517, "eval_reward_meter_std": 0.323750662115904, "eval_reward_count_adherence_mean": 0.77610732958867, "eval_reward_count_adherence_std": 0.1695853414443823, "eval_reward_arabic_clean_mean": 0.9134615384615384, "eval_reward_arabic_clean_std": 0.202989963384775, "eval_reward_hard_gate_mean": 0.9903846153846154, "eval_reward_hard_gate_std": 0.027196414195574246, "eval_reward_arabic_floor_mean": 0.9985576913906977, "eval_reward_arabic_floor_std": 0.004079461670838869, "eval_reward_count_floor_mean": 0.9328321997935956, "eval_reward_count_floor_std": 0.05087560472580103, "eval_reward_lexical_plausibility_mean": 0.9669988705561712, "eval_reward_lexical_plausibility_std": 0.06795883981081155, "eval_reward_repeat_penalty_mean": 0.8318327757028433, "eval_reward_repeat_penalty_std": 0.17920942375293145, "eval_reward_repeat_floor_mean": 0.9802892116399912, "eval_reward_repeat_floor_std": 0.021804944038964234, "eval_reward_near_duplicate_penalty_mean": 0.9425610762376052, "eval_reward_near_duplicate_penalty_std": 0.05716199628435648, "eval_reward_opening_diversity_mean": 0.9599059866024897, "eval_reward_opening_diversity_std": 0.10513016638847497, "eval_reward_distinct_2_mean": 0.9034522496736966, "eval_reward_distinct_2_std": 0.11727129410092647, "eval_reward_judge_quality_mean": 0.36019229888916016, "eval_reward_judge_quality_std": 0.1346744207235483, "eval_reward_total_composite_mean": 0.1378111976843614, "eval_reward_total_composite_std": 0.13167950023825353} {"timestamp_utc": "2026-04-12T21:09:04Z", "mode": "train", "global_step": 1351, "epoch": 0.07110152097258039, "loss": 0.1002, "grad_norm": 8.832219123840332, "learning_rate": 5.90909090909091e-06, "num_tokens": 2391010.0, "completions/mean_length": 166.875, "completions/min_length": 129.0, "completions/max_length": 192.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 166.875, "completions/min_terminated_length": 129.0, "completions/max_terminated_length": 192.0, "rewards/meter/mean": 0.41311126947402954, "rewards/meter/std": 0.36640501022338867, "rewards/count_adherence/mean": 0.7019230723381042, "rewards/count_adherence/std": 0.10432328283786774, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9105769395828247, "rewards/count_floor/std": 0.0312969833612442, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.29687660932540894, "rewards/repeat_penalty/std": 0.2861458957195282, "rewards/repeat_floor/mean": 0.9037836194038391, "rewards/repeat_floor/std": 0.05622662603855133, "rewards/near_duplicate_penalty/mean": 0.7750030159950256, "rewards/near_duplicate_penalty/std": 0.13784529268741608, "rewards/opening_diversity/mean": 0.7093137502670288, "rewards/opening_diversity/std": 0.2800697386264801, "rewards/distinct_2/mean": 0.4997152090072632, "rewards/distinct_2/std": 0.23885813355445862, "rewards/total_composite/mean": 0.11222703009843826, "rewards/total_composite/std": 0.11665745824575424, "reward": 0.11222703009843826, "reward_std": 0.11665745079517365, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11122331768274307, "sampling/sampling_logp_difference/max": 2.2513864040374756, "sampling/importance_sampling_ratio/min": 0.1052531972527504, "sampling/importance_sampling_ratio/mean": 1.008052945137024, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5516439266502857, "clip_ratio/low_mean": 0.07277052337303758, "clip_ratio/low_min": 0.07277052337303758, "clip_ratio/high_mean": 0.028003876097500324, "clip_ratio/high_max": 0.028003876097500324, "clip_ratio/region_mean": 0.1007743994705379, "reward_total_mean": 0.11222703009843826, "reward_meter_mean": 0.41311126947402954, "reward_meter_std": 0.36640501022338867, "reward_count_adherence_mean": 0.7019230723381042, "reward_count_adherence_std": 0.10432328283786774, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9105769395828247, "reward_count_floor_std": 0.0312969833612442, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.29687660932540894, "reward_repeat_penalty_std": 0.2861458957195282, "reward_repeat_floor_mean": 0.9037836194038391, "reward_repeat_floor_std": 0.05622662603855133, "reward_near_duplicate_penalty_mean": 0.7750030159950256, "reward_near_duplicate_penalty_std": 0.13784529268741608, "reward_opening_diversity_mean": 0.7093137502670288, "reward_opening_diversity_std": 0.2800697386264801, "reward_distinct_2_mean": 0.4997152090072632, "reward_distinct_2_std": 0.23885813355445862, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.11222703009843826, "reward_total_composite_std": 0.11665745824575424} {"timestamp_utc": "2026-04-12T21:09:13Z", "mode": "train", "global_step": 1352, "epoch": 0.07115414978159045, "loss": 0.0392, "grad_norm": 11.583563804626465, "learning_rate": 5.906060606060607e-06, "num_tokens": 2392905.0, "completions/mean_length": 61.875, "completions/min_length": 43.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 61.875, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.3075094223022461, "rewards/meter/std": 0.3981509804725647, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9286723136901855, "rewards/repeat_penalty/std": 0.0527019128203392, "rewards/repeat_floor/mean": 0.9909531474113464, "rewards/repeat_floor/std": 0.005987527780234814, "rewards/near_duplicate_penalty/mean": 0.9588726162910461, "rewards/near_duplicate_penalty/std": 0.019831784069538116, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.968024730682373, "rewards/distinct_2/std": 0.03976638615131378, "rewards/total_composite/mean": 0.12538199126720428, "rewards/total_composite/std": 0.15767979621887207, "reward": 0.12538199126720428, "reward_std": 0.15767979621887207, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14805741608142853, "sampling/sampling_logp_difference/max": 1.8405616283416748, "sampling/importance_sampling_ratio/min": 0.15872825682163239, "sampling/importance_sampling_ratio/mean": 0.9996080994606018, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8243724331259727, "clip_ratio/low_mean": 0.05267860344611108, "clip_ratio/low_min": 0.05267860344611108, "clip_ratio/high_mean": 0.042106867767870426, "clip_ratio/high_max": 0.042106867767870426, "clip_ratio/region_mean": 0.09478547121398151, "reward_total_mean": 0.12538199126720428, "reward_meter_mean": 0.3075094223022461, "reward_meter_std": 0.3981509804725647, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9286723136901855, "reward_repeat_penalty_std": 0.0527019128203392, "reward_repeat_floor_mean": 0.9909531474113464, "reward_repeat_floor_std": 0.005987527780234814, "reward_near_duplicate_penalty_mean": 0.9588726162910461, "reward_near_duplicate_penalty_std": 0.019831784069538116, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.968024730682373, "reward_distinct_2_std": 0.03976638615131378, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.12538199126720428, "reward_total_composite_std": 0.15767979621887207} {"timestamp_utc": "2026-04-12T21:09:21Z", "mode": "train", "global_step": 1353, "epoch": 0.0712067785906005, "loss": 0.1589, "grad_norm": 16.21390151977539, "learning_rate": 5.903030303030304e-06, "num_tokens": 2394530.0, "completions/mean_length": 38.125, "completions/min_length": 26.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.125, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.5851883292198181, "rewards/meter/std": 0.28261780738830566, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.08017836511135101, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.9855026602745056, "rewards/repeat_penalty/std": 0.014037727378308773, "rewards/repeat_floor/mean": 0.9978253841400146, "rewards/repeat_floor/std": 0.0021056621335446835, "rewards/near_duplicate_penalty/mean": 0.9855026602745056, "rewards/near_duplicate_penalty/std": 0.014037727378308773, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2699908912181854, "rewards/total_composite/std": 0.17090578377246857, "reward": 0.2699908912181854, "reward_std": 0.17090578377246857, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1833714246749878, "sampling/sampling_logp_difference/max": 1.799229621887207, "sampling/importance_sampling_ratio/min": 0.16542628407478333, "sampling/importance_sampling_ratio/mean": 1.009809970855713, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.16598941385746, "clip_ratio/low_mean": 0.06562512181699276, "clip_ratio/low_min": 0.06562512181699276, "clip_ratio/high_mean": 0.04002100881189108, "clip_ratio/high_max": 0.04002100881189108, "clip_ratio/region_mean": 0.10564613062888384, "reward_total_mean": 0.2699908912181854, "reward_meter_mean": 0.5851883292198181, "reward_meter_std": 0.28261780738830566, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.08017836511135101, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9855026602745056, "reward_repeat_penalty_std": 0.014037727378308773, "reward_repeat_floor_mean": 0.9978253841400146, "reward_repeat_floor_std": 0.0021056621335446835, "reward_near_duplicate_penalty_mean": 0.9855026602745056, "reward_near_duplicate_penalty_std": 0.014037727378308773, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.2699908912181854, "reward_total_composite_std": 0.17090578377246857} {"timestamp_utc": "2026-04-12T21:09:35Z", "mode": "train", "global_step": 1354, "epoch": 0.07125940739961055, "loss": -0.0749, "grad_norm": 2.1872777938842773, "learning_rate": 5.9e-06, "num_tokens": 2395954.0, "completions/mean_length": 156.0, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 37.333335876464844, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.5997096300125122, "rewards/meter/std": 0.38438868522644043, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.8902959227561951, "rewards/lexical_plausibility/std": 0.20633329451084137, "rewards/judge_quality/mean": 0.29624998569488525, "rewards/judge_quality/std": 0.19115717709064484, "rewards/repeat_penalty/mean": 0.9697509407997131, "rewards/repeat_penalty/std": 0.033267371356487274, "rewards/repeat_floor/mean": 0.9954626560211182, "rewards/repeat_floor/std": 0.004990102257579565, "rewards/near_duplicate_penalty/mean": 0.9697509407997131, "rewards/near_duplicate_penalty/std": 0.033267371356487274, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22220458090305328, "rewards/total_composite/std": 0.15941786766052246, "reward": 0.22220458090305328, "reward_std": 0.15941786766052246, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16308002173900604, "sampling/sampling_logp_difference/max": 1.8037405014038086, "sampling/importance_sampling_ratio/min": 0.16468174755573273, "sampling/importance_sampling_ratio/mean": 1.0090183019638062, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7480884790420532, "clip_ratio/low_mean": 0.015625, "clip_ratio/low_min": 0.015625, "clip_ratio/high_mean": 0.08500408753752708, "clip_ratio/high_max": 0.08500408753752708, "clip_ratio/region_mean": 0.10062908753752708, "reward_total_mean": 0.22220458090305328, "reward_meter_mean": 0.5997096300125122, "reward_meter_std": 0.38438868522644043, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.8902959227561951, "reward_lexical_plausibility_std": 0.20633329451084137, "reward_repeat_penalty_mean": 0.9697509407997131, "reward_repeat_penalty_std": 0.033267371356487274, "reward_repeat_floor_mean": 0.9954626560211182, "reward_repeat_floor_std": 0.004990102257579565, "reward_near_duplicate_penalty_mean": 0.9697509407997131, "reward_near_duplicate_penalty_std": 0.033267371356487274, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.29624998569488525, "reward_judge_quality_std": 0.19115717709064484, "reward_total_composite_mean": 0.22220458090305328, "reward_total_composite_std": 0.15941786766052246} {"timestamp_utc": "2026-04-12T21:09:44Z", "mode": "train", "global_step": 1355, "epoch": 0.0713120362086206, "loss": -0.003, "grad_norm": 11.956860542297363, "learning_rate": 5.8969696969696975e-06, "num_tokens": 2397766.0, "completions/mean_length": 64.5, "completions/min_length": 55.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.5, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.3731825053691864, "rewards/meter/std": 0.31172871589660645, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9521870613098145, "rewards/repeat_penalty/std": 0.04388941824436188, "rewards/repeat_floor/mean": 0.9940490126609802, "rewards/repeat_floor/std": 0.004772914573550224, "rewards/near_duplicate_penalty/mean": 0.9739071726799011, "rewards/near_duplicate_penalty/std": 0.012133183889091015, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9773657321929932, "rewards/distinct_2/std": 0.03421974554657936, "rewards/total_composite/mean": 0.1522723287343979, "rewards/total_composite/std": 0.13348764181137085, "reward": 0.1522723287343979, "reward_std": 0.13348765671253204, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15042823553085327, "sampling/sampling_logp_difference/max": 1.8057926893234253, "sampling/importance_sampling_ratio/min": 0.16434413194656372, "sampling/importance_sampling_ratio/mean": 1.0341154336929321, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1172214671969414, "clip_ratio/low_mean": 0.08428987581282854, "clip_ratio/low_min": 0.08428987581282854, "clip_ratio/high_mean": 0.04304391983896494, "clip_ratio/high_max": 0.04304391983896494, "clip_ratio/region_mean": 0.12733379565179348, "reward_total_mean": 0.1522723287343979, "reward_meter_mean": 0.3731825053691864, "reward_meter_std": 0.31172871589660645, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9521870613098145, "reward_repeat_penalty_std": 0.04388941824436188, "reward_repeat_floor_mean": 0.9940490126609802, "reward_repeat_floor_std": 0.004772914573550224, "reward_near_duplicate_penalty_mean": 0.9739071726799011, "reward_near_duplicate_penalty_std": 0.012133183889091015, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9773657321929932, "reward_distinct_2_std": 0.03421974554657936, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.1522723287343979, "reward_total_composite_std": 0.13348764181137085} {"timestamp_utc": "2026-04-12T21:09:58Z", "mode": "train", "global_step": 1356, "epoch": 0.07136466501763065, "loss": -0.0346, "grad_norm": 5.269680500030518, "learning_rate": 5.893939393939394e-06, "num_tokens": 2399313.0, "completions/mean_length": 90.375, "completions/min_length": 25.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 30.142858505249023, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.5154728889465332, "rewards/meter/std": 0.4530288577079773, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9640141725540161, "rewards/lexical_plausibility/std": 0.10178320854902267, "rewards/judge_quality/mean": 0.6937500238418579, "rewards/judge_quality/std": 0.335769385099411, "rewards/repeat_penalty/mean": 0.9006885886192322, "rewards/repeat_penalty/std": 0.1884777545928955, "rewards/repeat_floor/mean": 0.9870600700378418, "rewards/repeat_floor/std": 0.022856641560792923, "rewards/near_duplicate_penalty/mean": 0.9465957880020142, "rewards/near_duplicate_penalty/std": 0.06550285965204239, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.966063380241394, "rewards/distinct_2/std": 0.09598734229803085, "rewards/total_composite/mean": 0.35103386640548706, "rewards/total_composite/std": 0.3306849002838135, "reward": 0.35103386640548706, "reward_std": 0.3306848704814911, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16407063603401184, "sampling/sampling_logp_difference/max": 2.409271240234375, "sampling/importance_sampling_ratio/min": 0.08988077938556671, "sampling/importance_sampling_ratio/mean": 1.0390325784683228, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1144169569015503, "clip_ratio/low_mean": 0.022288603708148003, "clip_ratio/low_min": 0.022288603708148003, "clip_ratio/high_mean": 0.07925925962626934, "clip_ratio/high_max": 0.07925925962626934, "clip_ratio/region_mean": 0.10154786333441734, "reward_total_mean": 0.35103386640548706, "reward_meter_mean": 0.5154728889465332, "reward_meter_std": 0.4530288577079773, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9640141725540161, "reward_lexical_plausibility_std": 0.10178320854902267, "reward_repeat_penalty_mean": 0.9006885886192322, "reward_repeat_penalty_std": 0.1884777545928955, "reward_repeat_floor_mean": 0.9870600700378418, "reward_repeat_floor_std": 0.022856641560792923, "reward_near_duplicate_penalty_mean": 0.9465957880020142, "reward_near_duplicate_penalty_std": 0.06550285965204239, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.966063380241394, "reward_distinct_2_std": 0.09598734229803085, "reward_judge_quality_mean": 0.6937500238418579, "reward_judge_quality_std": 0.335769385099411, "reward_total_composite_mean": 0.35103386640548706, "reward_total_composite_std": 0.3306849002838135} {"timestamp_utc": "2026-04-12T21:10:07Z", "mode": "train", "global_step": 1357, "epoch": 0.07141729382664071, "loss": 0.0673, "grad_norm": 16.956844329833984, "learning_rate": 5.890909090909091e-06, "num_tokens": 2400868.0, "completions/mean_length": 39.375, "completions/min_length": 36.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.335527241230011, "rewards/meter/std": 0.26939159631729126, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.9629907608032227, "rewards/repeat_penalty/std": 0.04661880061030388, "rewards/repeat_floor/mean": 0.9949173331260681, "rewards/repeat_floor/std": 0.006006376817822456, "rewards/near_duplicate_penalty/mean": 0.9716099500656128, "rewards/near_duplicate_penalty/std": 0.031306542456150055, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.1155606210231781, "rewards/total_composite/std": 0.10034933686256409, "reward": 0.1155606210231781, "reward_std": 0.10034932941198349, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17751607298851013, "sampling/sampling_logp_difference/max": 1.6329107284545898, "sampling/importance_sampling_ratio/min": 0.19536009430885315, "sampling/importance_sampling_ratio/mean": 1.037315011024475, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3439089804887772, "clip_ratio/low_mean": 0.07852805173024535, "clip_ratio/low_min": 0.07852805173024535, "clip_ratio/high_mean": 0.06803776789456606, "clip_ratio/high_max": 0.06803776789456606, "clip_ratio/region_mean": 0.1465658196248114, "reward_total_mean": 0.1155606210231781, "reward_meter_mean": 0.335527241230011, "reward_meter_std": 0.26939159631729126, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.9629907608032227, "reward_repeat_penalty_std": 0.04661880061030388, "reward_repeat_floor_mean": 0.9949173331260681, "reward_repeat_floor_std": 0.006006376817822456, "reward_near_duplicate_penalty_mean": 0.9716099500656128, "reward_near_duplicate_penalty_std": 0.031306542456150055, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.1155606210231781, "reward_total_composite_std": 0.10034933686256409} {"timestamp_utc": "2026-04-12T21:10:20Z", "mode": "train", "global_step": 1358, "epoch": 0.07146992263565076, "loss": 0.0105, "grad_norm": 6.21705961227417, "learning_rate": 5.887878787878788e-06, "num_tokens": 2402892.0, "completions/mean_length": 125.0, "completions/min_length": 57.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 69.71428680419922, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 90.0, "rewards/meter/mean": 0.26811739802360535, "rewards/meter/std": 0.31841468811035156, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9474999904632568, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.9584158658981323, "rewards/lexical_plausibility/std": 0.11761771887540817, "rewards/judge_quality/mean": 0.34999996423721313, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9397847056388855, "rewards/repeat_penalty/std": 0.04290353134274483, "rewards/repeat_floor/mean": 0.9927159547805786, "rewards/repeat_floor/std": 0.0050594499334692955, "rewards/near_duplicate_penalty/mean": 0.9707650542259216, "rewards/near_duplicate_penalty/std": 0.02095148153603077, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9677910804748535, "rewards/distinct_2/std": 0.029113205149769783, "rewards/total_composite/mean": 0.09462591260671616, "rewards/total_composite/std": 0.1390860378742218, "reward": 0.09462591260671616, "reward_std": 0.1390860378742218, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17054177820682526, "sampling/sampling_logp_difference/max": 1.2233905792236328, "sampling/importance_sampling_ratio/min": 0.2942308485507965, "sampling/importance_sampling_ratio/mean": 1.0266481637954712, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1378167420625687, "clip_ratio/low_mean": 0.1034215921536088, "clip_ratio/low_min": 0.1034215921536088, "clip_ratio/high_mean": 0.051551453769207, "clip_ratio/high_max": 0.051551453769207, "clip_ratio/region_mean": 0.1549730459228158, "reward_total_mean": 0.09462591260671616, "reward_meter_mean": 0.26811739802360535, "reward_meter_std": 0.31841468811035156, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9474999904632568, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.9584158658981323, "reward_lexical_plausibility_std": 0.11761771887540817, "reward_repeat_penalty_mean": 0.9397847056388855, "reward_repeat_penalty_std": 0.04290353134274483, "reward_repeat_floor_mean": 0.9927159547805786, "reward_repeat_floor_std": 0.0050594499334692955, "reward_near_duplicate_penalty_mean": 0.9707650542259216, "reward_near_duplicate_penalty_std": 0.02095148153603077, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9677910804748535, "reward_distinct_2_std": 0.029113205149769783, "reward_judge_quality_mean": 0.34999996423721313, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.09462591260671616, "reward_total_composite_std": 0.1390860378742218} {"timestamp_utc": "2026-04-12T21:10:29Z", "mode": "train", "global_step": 1359, "epoch": 0.07152255144466081, "loss": 0.0241, "grad_norm": 11.658727645874023, "learning_rate": 5.884848484848486e-06, "num_tokens": 2404701.0, "completions/mean_length": 60.125, "completions/min_length": 56.0, "completions/max_length": 65.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.125, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.7138677835464478, "rewards/meter/std": 0.23756182193756104, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.71875, "rewards/judge_quality/std": 0.2794605791568756, "rewards/repeat_penalty/mean": 0.9727405905723572, "rewards/repeat_penalty/std": 0.026929466053843498, "rewards/repeat_floor/mean": 0.9962838888168335, "rewards/repeat_floor/std": 0.003047413658350706, "rewards/near_duplicate_penalty/mean": 0.9793470501899719, "rewards/near_duplicate_penalty/std": 0.010606988333165646, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9931318759918213, "rewards/distinct_2/std": 0.01942601054906845, "rewards/total_composite/mean": 0.5407896637916565, "rewards/total_composite/std": 0.2931385934352875, "reward": 0.5407896637916565, "reward_std": 0.2931385934352875, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12463036179542542, "sampling/sampling_logp_difference/max": 2.492025136947632, "sampling/importance_sampling_ratio/min": 0.08274222910404205, "sampling/importance_sampling_ratio/mean": 0.9909713864326477, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6973786652088165, "clip_ratio/low_mean": 0.03901098994538188, "clip_ratio/low_min": 0.03901098994538188, "clip_ratio/high_mean": 0.07961014751344919, "clip_ratio/high_max": 0.07961014751344919, "clip_ratio/region_mean": 0.11862113745883107, "reward_total_mean": 0.5407896637916565, "reward_meter_mean": 0.7138677835464478, "reward_meter_std": 0.23756182193756104, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9727405905723572, "reward_repeat_penalty_std": 0.026929466053843498, "reward_repeat_floor_mean": 0.9962838888168335, "reward_repeat_floor_std": 0.003047413658350706, "reward_near_duplicate_penalty_mean": 0.9793470501899719, "reward_near_duplicate_penalty_std": 0.010606988333165646, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9931318759918213, "reward_distinct_2_std": 0.01942601054906845, "reward_judge_quality_mean": 0.71875, "reward_judge_quality_std": 0.2794605791568756, "reward_total_composite_mean": 0.5407896637916565, "reward_total_composite_std": 0.2931385934352875} {"timestamp_utc": "2026-04-12T21:10:42Z", "mode": "train", "global_step": 1360, "epoch": 0.07157518025367086, "loss": -0.0461, "grad_norm": 4.810898780822754, "learning_rate": 5.881818181818182e-06, "num_tokens": 2406301.0, "completions/mean_length": 99.0, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 40.0, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.3990902304649353, "rewards/meter/std": 0.4627956748008728, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.8402870893478394, "rewards/lexical_plausibility/std": 0.18085414171218872, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.8204519748687744, "rewards/repeat_penalty/std": 0.27600109577178955, "rewards/repeat_floor/mean": 0.9796364307403564, "rewards/repeat_floor/std": 0.030433200299739838, "rewards/near_duplicate_penalty/mean": 0.9380507469177246, "rewards/near_duplicate_penalty/std": 0.0795394778251648, "rewards/opening_diversity/mean": 0.890625, "rewards/opening_diversity/std": 0.2259652018547058, "rewards/distinct_2/mean": 0.9499030113220215, "rewards/distinct_2/std": 0.07513502985239029, "rewards/total_composite/mean": 0.11561507731676102, "rewards/total_composite/std": 0.14266031980514526, "reward": 0.11561507731676102, "reward_std": 0.14266031980514526, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12486492097377777, "sampling/sampling_logp_difference/max": 1.2106590270996094, "sampling/importance_sampling_ratio/min": 0.2980008125305176, "sampling/importance_sampling_ratio/mean": 1.0246108770370483, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0419716835021973, "clip_ratio/low_mean": 0.04115276248194277, "clip_ratio/low_min": 0.04115276248194277, "clip_ratio/high_mean": 0.03902312647551298, "clip_ratio/high_max": 0.03902312647551298, "clip_ratio/region_mean": 0.08017588895745575, "reward_total_mean": 0.11561507731676102, "reward_meter_mean": 0.3990902304649353, "reward_meter_std": 0.4627956748008728, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.8402870893478394, "reward_lexical_plausibility_std": 0.18085414171218872, "reward_repeat_penalty_mean": 0.8204519748687744, "reward_repeat_penalty_std": 0.27600109577178955, "reward_repeat_floor_mean": 0.9796364307403564, "reward_repeat_floor_std": 0.030433200299739838, "reward_near_duplicate_penalty_mean": 0.9380507469177246, "reward_near_duplicate_penalty_std": 0.0795394778251648, "reward_opening_diversity_mean": 0.890625, "reward_opening_diversity_std": 0.2259652018547058, "reward_distinct_2_mean": 0.9499030113220215, "reward_distinct_2_std": 0.07513502985239029, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.11561507731676102, "reward_total_composite_std": 0.14266031980514526} {"timestamp_utc": "2026-04-12T21:10:56Z", "mode": "train", "global_step": 1361, "epoch": 0.07162780906268092, "loss": -0.1028, "grad_norm": 3.076615571975708, "learning_rate": 5.878787878787879e-06, "num_tokens": 2408021.0, "completions/mean_length": 172.0, "completions/min_length": 46.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 58.66666793823242, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.2548764646053314, "rewards/meter/std": 0.2447020262479782, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9249999523162842, "rewards/count_floor/std": 0.0707106813788414, "rewards/lexical_plausibility/mean": 0.9021851420402527, "rewards/lexical_plausibility/std": 0.18599532544612885, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.8881406784057617, "rewards/repeat_penalty/std": 0.1280057728290558, "rewards/repeat_floor/mean": 0.9888988733291626, "rewards/repeat_floor/std": 0.010923240333795547, "rewards/near_duplicate_penalty/mean": 0.9595867991447449, "rewards/near_duplicate_penalty/std": 0.03943898528814316, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9856764078140259, "rewards/distinct_2/std": 0.02661900594830513, "rewards/total_composite/mean": 0.052175745368003845, "rewards/total_composite/std": 0.04424585774540901, "reward": 0.052175745368003845, "reward_std": 0.04424585774540901, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1724514365196228, "sampling/sampling_logp_difference/max": 1.8498058319091797, "sampling/importance_sampling_ratio/min": 0.1572677046060562, "sampling/importance_sampling_ratio/mean": 1.0251553058624268, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2266998514533043, "clip_ratio/low_mean": 0.03442029049620032, "clip_ratio/low_min": 0.03442029049620032, "clip_ratio/high_mean": 0.09937055967748165, "clip_ratio/high_max": 0.09937055967748165, "clip_ratio/region_mean": 0.13379085017368197, "reward_total_mean": 0.052175745368003845, "reward_meter_mean": 0.2548764646053314, "reward_meter_std": 0.2447020262479782, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9249999523162842, "reward_count_floor_std": 0.0707106813788414, "reward_lexical_plausibility_mean": 0.9021851420402527, "reward_lexical_plausibility_std": 0.18599532544612885, "reward_repeat_penalty_mean": 0.8881406784057617, "reward_repeat_penalty_std": 0.1280057728290558, "reward_repeat_floor_mean": 0.9888988733291626, "reward_repeat_floor_std": 0.010923240333795547, "reward_near_duplicate_penalty_mean": 0.9595867991447449, "reward_near_duplicate_penalty_std": 0.03943898528814316, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9856764078140259, "reward_distinct_2_std": 0.02661900594830513, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.052175745368003845, "reward_total_composite_std": 0.04424585774540901} {"timestamp_utc": "2026-04-12T21:11:11Z", "mode": "train", "global_step": 1362, "epoch": 0.07168043787169097, "loss": -0.0958, "grad_norm": 4.198287010192871, "learning_rate": 5.875757575757576e-06, "num_tokens": 2410815.0, "completions/mean_length": 181.25, "completions/min_length": 109.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 134.0, "completions/min_terminated_length": 109.0, "completions/max_terminated_length": 165.0, "rewards/meter/mean": 0.33927029371261597, "rewards/meter/std": 0.23474349081516266, "rewards/count_adherence/mean": 0.8214285373687744, "rewards/count_adherence/std": 0.10101525485515594, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9464285373687744, "rewards/count_floor/std": 0.030304571613669395, "rewards/lexical_plausibility/mean": 0.9662079811096191, "rewards/lexical_plausibility/std": 0.09557818621397018, "rewards/judge_quality/mean": 0.38124996423721313, "rewards/judge_quality/std": 0.15797263383865356, "rewards/repeat_penalty/mean": 0.9583768248558044, "rewards/repeat_penalty/std": 0.03497450798749924, "rewards/repeat_floor/mean": 0.9950957298278809, "rewards/repeat_floor/std": 0.003586851991713047, "rewards/near_duplicate_penalty/mean": 0.981342077255249, "rewards/near_duplicate_penalty/std": 0.013582875952124596, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9766049385070801, "rewards/distinct_2/std": 0.03318921476602554, "rewards/total_composite/mean": 0.12686169147491455, "rewards/total_composite/std": 0.10618890076875687, "reward": 0.12686169147491455, "reward_std": 0.10618889331817627, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12347649037837982, "sampling/sampling_logp_difference/max": 1.9963264465332031, "sampling/importance_sampling_ratio/min": 0.13583335280418396, "sampling/importance_sampling_ratio/mean": 1.0084747076034546, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7365588247776031, "clip_ratio/low_mean": 0.058945417404174805, "clip_ratio/low_min": 0.058945417404174805, "clip_ratio/high_mean": 0.04070075694471598, "clip_ratio/high_max": 0.04070075694471598, "clip_ratio/region_mean": 0.09964617434889078, "reward_total_mean": 0.12686169147491455, "reward_meter_mean": 0.33927029371261597, "reward_meter_std": 0.23474349081516266, "reward_count_adherence_mean": 0.8214285373687744, "reward_count_adherence_std": 0.10101525485515594, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9464285373687744, "reward_count_floor_std": 0.030304571613669395, "reward_lexical_plausibility_mean": 0.9662079811096191, "reward_lexical_plausibility_std": 0.09557818621397018, "reward_repeat_penalty_mean": 0.9583768248558044, "reward_repeat_penalty_std": 0.03497450798749924, "reward_repeat_floor_mean": 0.9950957298278809, "reward_repeat_floor_std": 0.003586851991713047, "reward_near_duplicate_penalty_mean": 0.981342077255249, "reward_near_duplicate_penalty_std": 0.013582875952124596, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9766049385070801, "reward_distinct_2_std": 0.03318921476602554, "reward_judge_quality_mean": 0.38124996423721313, "reward_judge_quality_std": 0.15797263383865356, "reward_total_composite_mean": 0.12686169147491455, "reward_total_composite_std": 0.10618890076875687} {"timestamp_utc": "2026-04-12T21:11:24Z", "mode": "train", "global_step": 1363, "epoch": 0.07173306668070102, "loss": -0.0695, "grad_norm": 4.720059871673584, "learning_rate": 5.872727272727273e-06, "num_tokens": 2412419.0, "completions/mean_length": 111.5, "completions/min_length": 51.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 54.28571701049805, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.13672298192977905, "rewards/meter/std": 0.14602231979370117, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9417310357093811, "rewards/lexical_plausibility/std": 0.16480956971645355, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.11649647355079651, "rewards/repeat_penalty/mean": 0.9243472218513489, "rewards/repeat_penalty/std": 0.05871216952800751, "rewards/repeat_floor/mean": 0.9911385774612427, "rewards/repeat_floor/std": 0.006358617916703224, "rewards/near_duplicate_penalty/mean": 0.9686267375946045, "rewards/near_duplicate_penalty/std": 0.01730871945619583, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9538290500640869, "rewards/distinct_2/std": 0.04971982166171074, "rewards/total_composite/mean": 0.02115466445684433, "rewards/total_composite/std": 0.020929690450429916, "reward": 0.02115466445684433, "reward_std": 0.020929690450429916, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1577281653881073, "sampling/sampling_logp_difference/max": 1.5699477195739746, "sampling/importance_sampling_ratio/min": 0.2652134597301483, "sampling/importance_sampling_ratio/mean": 1.0405060052871704, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2455516830086708, "clip_ratio/low_mean": 0.07088014390319586, "clip_ratio/low_min": 0.07088014390319586, "clip_ratio/high_mean": 0.04233583714812994, "clip_ratio/high_max": 0.04233583714812994, "clip_ratio/region_mean": 0.1132159810513258, "reward_total_mean": 0.02115466445684433, "reward_meter_mean": 0.13672298192977905, "reward_meter_std": 0.14602231979370117, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9417310357093811, "reward_lexical_plausibility_std": 0.16480956971645355, "reward_repeat_penalty_mean": 0.9243472218513489, "reward_repeat_penalty_std": 0.05871216952800751, "reward_repeat_floor_mean": 0.9911385774612427, "reward_repeat_floor_std": 0.006358617916703224, "reward_near_duplicate_penalty_mean": 0.9686267375946045, "reward_near_duplicate_penalty_std": 0.01730871945619583, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9538290500640869, "reward_distinct_2_std": 0.04971982166171074, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.11649647355079651, "reward_total_composite_mean": 0.02115466445684433, "reward_total_composite_std": 0.020929690450429916} {"timestamp_utc": "2026-04-12T21:11:33Z", "mode": "train", "global_step": 1364, "epoch": 0.07178569548971107, "loss": 0.0257, "grad_norm": 8.75416374206543, "learning_rate": 5.8696969696969694e-06, "num_tokens": 2414589.0, "completions/mean_length": 84.25, "completions/min_length": 74.0, "completions/max_length": 98.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 84.25, "completions/min_terminated_length": 74.0, "completions/max_terminated_length": 98.0, "rewards/meter/mean": 0.7619160413742065, "rewards/meter/std": 0.2968056797981262, "rewards/count_adherence/mean": 0.7749999761581421, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9325000047683716, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.8796122074127197, "rewards/repeat_penalty/std": 0.062147945165634155, "rewards/repeat_floor/mean": 0.9859489798545837, "rewards/repeat_floor/std": 0.007579122669994831, "rewards/near_duplicate_penalty/mean": 0.9530795812606812, "rewards/near_duplicate_penalty/std": 0.028114236891269684, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9220781326293945, "rewards/distinct_2/std": 0.04306622967123985, "rewards/total_composite/mean": 0.19920063018798828, "rewards/total_composite/std": 0.10604803264141083, "reward": 0.19920063018798828, "reward_std": 0.10604802519083023, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1493125855922699, "sampling/sampling_logp_difference/max": 4.442129611968994, "sampling/importance_sampling_ratio/min": 0.011770844459533691, "sampling/importance_sampling_ratio/mean": 1.0320141315460205, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1193640530109406, "clip_ratio/low_mean": 0.0734433950856328, "clip_ratio/low_min": 0.0734433950856328, "clip_ratio/high_mean": 0.047249577939510345, "clip_ratio/high_max": 0.047249577939510345, "clip_ratio/region_mean": 0.12069297302514315, "reward_total_mean": 0.19920063018798828, "reward_meter_mean": 0.7619160413742065, "reward_meter_std": 0.2968056797981262, "reward_count_adherence_mean": 0.7749999761581421, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9325000047683716, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8796122074127197, "reward_repeat_penalty_std": 0.062147945165634155, "reward_repeat_floor_mean": 0.9859489798545837, "reward_repeat_floor_std": 0.007579122669994831, "reward_near_duplicate_penalty_mean": 0.9530795812606812, "reward_near_duplicate_penalty_std": 0.028114236891269684, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9220781326293945, "reward_distinct_2_std": 0.04306622967123985, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.19920063018798828, "reward_total_composite_std": 0.10604803264141083} {"timestamp_utc": "2026-04-12T21:11:44Z", "mode": "train", "global_step": 1365, "epoch": 0.07183832429872113, "loss": 0.0532, "grad_norm": 7.535861492156982, "learning_rate": 5.8666666666666675e-06, "num_tokens": 2417230.0, "completions/mean_length": 107.125, "completions/min_length": 100.0, "completions/max_length": 114.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 107.125, "completions/min_terminated_length": 100.0, "completions/max_terminated_length": 114.0, "rewards/meter/mean": 0.31687265634536743, "rewards/meter/std": 0.2848235070705414, "rewards/count_adherence/mean": 0.6428571939468384, "rewards/count_adherence/std": 0.07636035233736038, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8928571343421936, "rewards/count_floor/std": 0.022908121347427368, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9028449058532715, "rewards/repeat_penalty/std": 0.037171151489019394, "rewards/repeat_floor/mean": 0.9894146919250488, "rewards/repeat_floor/std": 0.0042105065658688545, "rewards/near_duplicate_penalty/mean": 0.9724725484848022, "rewards/near_duplicate_penalty/std": 0.01640428975224495, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9282649755477905, "rewards/distinct_2/std": 0.030583176761865616, "rewards/total_composite/mean": 0.11097601056098938, "rewards/total_composite/std": 0.11250045150518417, "reward": 0.11097601056098938, "reward_std": 0.11250045150518417, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14996173977851868, "sampling/sampling_logp_difference/max": 3.206545829772949, "sampling/importance_sampling_ratio/min": 0.040496256202459335, "sampling/importance_sampling_ratio/mean": 1.0081321001052856, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9402342960238457, "clip_ratio/low_mean": 0.0886575486510992, "clip_ratio/low_min": 0.0886575486510992, "clip_ratio/high_mean": 0.030782858841121197, "clip_ratio/high_max": 0.030782858841121197, "clip_ratio/region_mean": 0.1194404074922204, "reward_total_mean": 0.11097601056098938, "reward_meter_mean": 0.31687265634536743, "reward_meter_std": 0.2848235070705414, "reward_count_adherence_mean": 0.6428571939468384, "reward_count_adherence_std": 0.07636035233736038, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8928571343421936, "reward_count_floor_std": 0.022908121347427368, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9028449058532715, "reward_repeat_penalty_std": 0.037171151489019394, "reward_repeat_floor_mean": 0.9894146919250488, "reward_repeat_floor_std": 0.0042105065658688545, "reward_near_duplicate_penalty_mean": 0.9724725484848022, "reward_near_duplicate_penalty_std": 0.01640428975224495, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9282649755477905, "reward_distinct_2_std": 0.030583176761865616, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.11097601056098938, "reward_total_composite_std": 0.11250045150518417} {"timestamp_utc": "2026-04-12T21:11:58Z", "mode": "train", "global_step": 1366, "epoch": 0.07189095310773118, "loss": 0.0196, "grad_norm": 14.12635326385498, "learning_rate": 5.863636363636364e-06, "num_tokens": 2418917.0, "completions/mean_length": 32.875, "completions/min_length": 29.0, "completions/max_length": 37.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.875, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.4733375906944275, "rewards/meter/std": 0.3433862030506134, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6425000429153442, "rewards/judge_quality/std": 0.21558891236782074, "rewards/repeat_penalty/mean": 0.9666086435317993, "rewards/repeat_penalty/std": 0.05108451470732689, "rewards/repeat_floor/mean": 0.9956244230270386, "rewards/repeat_floor/std": 0.006222573108971119, "rewards/near_duplicate_penalty/mean": 0.9780410528182983, "rewards/near_duplicate_penalty/std": 0.02936101146042347, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9879807829856873, "rewards/distinct_2/std": 0.03399552404880524, "rewards/total_composite/mean": 0.2751588225364685, "rewards/total_composite/std": 0.21421192586421967, "reward": 0.2751588225364685, "reward_std": 0.21421192586421967, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13260090351104736, "sampling/sampling_logp_difference/max": 1.8856416940689087, "sampling/importance_sampling_ratio/min": 0.1517316699028015, "sampling/importance_sampling_ratio/mean": 1.02219557762146, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8842187747359276, "clip_ratio/low_mean": 0.05132781062275171, "clip_ratio/low_min": 0.05132781062275171, "clip_ratio/high_mean": 0.07079154346138239, "clip_ratio/high_max": 0.07079154346138239, "clip_ratio/region_mean": 0.1221193540841341, "reward_total_mean": 0.2751588225364685, "reward_meter_mean": 0.4733375906944275, "reward_meter_std": 0.3433862030506134, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9666086435317993, "reward_repeat_penalty_std": 0.05108451470732689, "reward_repeat_floor_mean": 0.9956244230270386, "reward_repeat_floor_std": 0.006222573108971119, "reward_near_duplicate_penalty_mean": 0.9780410528182983, "reward_near_duplicate_penalty_std": 0.02936101146042347, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9879807829856873, "reward_distinct_2_std": 0.03399552404880524, "reward_judge_quality_mean": 0.6425000429153442, "reward_judge_quality_std": 0.21558891236782074, "reward_total_composite_mean": 0.2751588225364685, "reward_total_composite_std": 0.21421192586421967} {"timestamp_utc": "2026-04-12T21:12:11Z", "mode": "train", "global_step": 1367, "epoch": 0.07194358191674123, "loss": -0.0389, "grad_norm": 4.24796199798584, "learning_rate": 5.860606060606061e-06, "num_tokens": 2420577.0, "completions/mean_length": 100.5, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 41.71428680419922, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.18226322531700134, "rewards/meter/std": 0.18298299610614777, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9473918676376343, "rewards/lexical_plausibility/std": 0.1269720047712326, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.9929934144020081, "rewards/repeat_penalty/std": 0.00786297582089901, "rewards/repeat_floor/mean": 0.9989490509033203, "rewards/repeat_floor/std": 0.0011794412275776267, "rewards/near_duplicate_penalty/mean": 0.9929934144020081, "rewards/near_duplicate_penalty/std": 0.00786297582089901, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.050226546823978424, "rewards/total_composite/std": 0.06132219359278679, "reward": 0.050226546823978424, "reward_std": 0.06132219359278679, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14662757515907288, "sampling/sampling_logp_difference/max": 1.2821555137634277, "sampling/importance_sampling_ratio/min": 0.2774386405944824, "sampling/importance_sampling_ratio/mean": 1.0189090967178345, "sampling/importance_sampling_ratio/max": 1.8976069688796997, "entropy": 1.428486630320549, "clip_ratio/low_mean": 0.07684226986020803, "clip_ratio/low_min": 0.07684226986020803, "clip_ratio/high_mean": 0.04945652186870575, "clip_ratio/high_max": 0.04945652186870575, "clip_ratio/region_mean": 0.12629879172891378, "reward_total_mean": 0.050226546823978424, "reward_meter_mean": 0.18226322531700134, "reward_meter_std": 0.18298299610614777, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9473918676376343, "reward_lexical_plausibility_std": 0.1269720047712326, "reward_repeat_penalty_mean": 0.9929934144020081, "reward_repeat_penalty_std": 0.00786297582089901, "reward_repeat_floor_mean": 0.9989490509033203, "reward_repeat_floor_std": 0.0011794412275776267, "reward_near_duplicate_penalty_mean": 0.9929934144020081, "reward_near_duplicate_penalty_std": 0.00786297582089901, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.050226546823978424, "reward_total_composite_std": 0.06132219359278679} {"timestamp_utc": "2026-04-12T21:12:20Z", "mode": "train", "global_step": 1368, "epoch": 0.07199621072575127, "loss": 0.0017, "grad_norm": 18.617734909057617, "learning_rate": 5.8575757575757584e-06, "num_tokens": 2421965.0, "completions/mean_length": 35.5, "completions/min_length": 31.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.228774756193161, "rewards/meter/std": 0.2565818428993225, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5087499618530273, "rewards/judge_quality/std": 0.2811424434185028, "rewards/repeat_penalty/mean": 0.9844053983688354, "rewards/repeat_penalty/std": 0.017846377566456795, "rewards/repeat_floor/mean": 0.9976608157157898, "rewards/repeat_floor/std": 0.0026769612450152636, "rewards/near_duplicate_penalty/mean": 0.9844053983688354, "rewards/near_duplicate_penalty/std": 0.017846377566456795, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.13428552448749542, "rewards/total_composite/std": 0.21110010147094727, "reward": 0.13428552448749542, "reward_std": 0.21110008656978607, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1675732284784317, "sampling/sampling_logp_difference/max": 1.9700037240982056, "sampling/importance_sampling_ratio/min": 0.13945633172988892, "sampling/importance_sampling_ratio/mean": 1.0281715393066406, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2026347368955612, "clip_ratio/low_mean": 0.0811789813451469, "clip_ratio/low_min": 0.0811789813451469, "clip_ratio/high_mean": 0.020270270761102438, "clip_ratio/high_max": 0.020270270761102438, "clip_ratio/region_mean": 0.10144925210624933, "reward_total_mean": 0.13428552448749542, "reward_meter_mean": 0.228774756193161, "reward_meter_std": 0.2565818428993225, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9844053983688354, "reward_repeat_penalty_std": 0.017846377566456795, "reward_repeat_floor_mean": 0.9976608157157898, "reward_repeat_floor_std": 0.0026769612450152636, "reward_near_duplicate_penalty_mean": 0.9844053983688354, "reward_near_duplicate_penalty_std": 0.017846377566456795, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5087499618530273, "reward_judge_quality_std": 0.2811424434185028, "reward_total_composite_mean": 0.13428552448749542, "reward_total_composite_std": 0.21110010147094727} {"timestamp_utc": "2026-04-12T21:12:29Z", "mode": "train", "global_step": 1369, "epoch": 0.07204883953476132, "loss": 0.0474, "grad_norm": 10.18528938293457, "learning_rate": 5.854545454545455e-06, "num_tokens": 2423826.0, "completions/mean_length": 60.625, "completions/min_length": 54.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.625, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.5438340902328491, "rewards/meter/std": 0.38540804386138916, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.8463025093078613, "rewards/repeat_penalty/std": 0.10108055174350739, "rewards/repeat_floor/mean": 0.9810028076171875, "rewards/repeat_floor/std": 0.011964036151766777, "rewards/near_duplicate_penalty/mean": 0.9267818927764893, "rewards/near_duplicate_penalty/std": 0.03889380395412445, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9109505414962769, "rewards/distinct_2/std": 0.07523106783628464, "rewards/total_composite/mean": 0.23085661232471466, "rewards/total_composite/std": 0.1908019483089447, "reward": 0.23085661232471466, "reward_std": 0.1908019483089447, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1349177211523056, "sampling/sampling_logp_difference/max": 1.3860890865325928, "sampling/importance_sampling_ratio/min": 0.2656486928462982, "sampling/importance_sampling_ratio/mean": 1.022133708000183, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9961529895663261, "clip_ratio/low_mean": 0.0491155069321394, "clip_ratio/low_min": 0.0491155069321394, "clip_ratio/high_mean": 0.07743468973785639, "clip_ratio/high_max": 0.07743468973785639, "clip_ratio/region_mean": 0.12655019666999578, "reward_total_mean": 0.23085661232471466, "reward_meter_mean": 0.5438340902328491, "reward_meter_std": 0.38540804386138916, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8463025093078613, "reward_repeat_penalty_std": 0.10108055174350739, "reward_repeat_floor_mean": 0.9810028076171875, "reward_repeat_floor_std": 0.011964036151766777, "reward_near_duplicate_penalty_mean": 0.9267818927764893, "reward_near_duplicate_penalty_std": 0.03889380395412445, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9109505414962769, "reward_distinct_2_std": 0.07523106783628464, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.23085661232471466, "reward_total_composite_std": 0.1908019483089447} {"timestamp_utc": "2026-04-12T21:12:39Z", "mode": "train", "global_step": 1370, "epoch": 0.07210146834377137, "loss": 0.0216, "grad_norm": 10.985562324523926, "learning_rate": 5.851515151515152e-06, "num_tokens": 2425781.0, "completions/mean_length": 68.375, "completions/min_length": 42.0, "completions/max_length": 86.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 68.375, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.7853902578353882, "rewards/meter/std": 0.345671147108078, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9756944179534912, "rewards/lexical_plausibility/std": 0.058338064700365067, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.10690449178218842, "rewards/repeat_penalty/mean": 0.7724920511245728, "rewards/repeat_penalty/std": 0.17106185853481293, "rewards/repeat_floor/mean": 0.9715359807014465, "rewards/repeat_floor/std": 0.023085223510861397, "rewards/near_duplicate_penalty/mean": 0.9013967514038086, "rewards/near_duplicate_penalty/std": 0.08656418323516846, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8480718731880188, "rewards/distinct_2/std": 0.11974718421697617, "rewards/total_composite/mean": 0.20746755599975586, "rewards/total_composite/std": 0.1367490440607071, "reward": 0.20746755599975586, "reward_std": 0.1367490440607071, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14865341782569885, "sampling/sampling_logp_difference/max": 1.4660074710845947, "sampling/importance_sampling_ratio/min": 0.23084531724452972, "sampling/importance_sampling_ratio/mean": 1.0330126285552979, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.332340568304062, "clip_ratio/low_mean": 0.0659127002581954, "clip_ratio/low_min": 0.0659127002581954, "clip_ratio/high_mean": 0.0766943134367466, "clip_ratio/high_max": 0.0766943134367466, "clip_ratio/region_mean": 0.142607013694942, "reward_total_mean": 0.20746755599975586, "reward_meter_mean": 0.7853902578353882, "reward_meter_std": 0.345671147108078, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9756944179534912, "reward_lexical_plausibility_std": 0.058338064700365067, "reward_repeat_penalty_mean": 0.7724920511245728, "reward_repeat_penalty_std": 0.17106185853481293, "reward_repeat_floor_mean": 0.9715359807014465, "reward_repeat_floor_std": 0.023085223510861397, "reward_near_duplicate_penalty_mean": 0.9013967514038086, "reward_near_duplicate_penalty_std": 0.08656418323516846, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8480718731880188, "reward_distinct_2_std": 0.11974718421697617, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.10690449178218842, "reward_total_composite_mean": 0.20746755599975586, "reward_total_composite_std": 0.1367490440607071} {"timestamp_utc": "2026-04-12T21:12:48Z", "mode": "train", "global_step": 1371, "epoch": 0.07215409715278143, "loss": 0.0238, "grad_norm": 12.143315315246582, "learning_rate": 5.8484848484848485e-06, "num_tokens": 2427545.0, "completions/mean_length": 64.5, "completions/min_length": 62.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 64.5, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.22518661618232727, "rewards/meter/std": 0.30453017354011536, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.9323565363883972, "rewards/repeat_penalty/std": 0.05915520712733269, "rewards/repeat_floor/mean": 0.9920791387557983, "rewards/repeat_floor/std": 0.00636344263330102, "rewards/near_duplicate_penalty/mean": 0.9719240665435791, "rewards/near_duplicate_penalty/std": 0.016151413321495056, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9587832689285278, "rewards/distinct_2/std": 0.0489928312599659, "rewards/total_composite/mean": 0.10005968064069748, "rewards/total_composite/std": 0.13596297800540924, "reward": 0.10005968064069748, "reward_std": 0.13596297800540924, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13936345279216766, "sampling/sampling_logp_difference/max": 2.1678781509399414, "sampling/importance_sampling_ratio/min": 0.11442014575004578, "sampling/importance_sampling_ratio/mean": 1.0268821716308594, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0624381750822067, "clip_ratio/low_mean": 0.08691003918647766, "clip_ratio/low_min": 0.08691003918647766, "clip_ratio/high_mean": 0.028846153989434242, "clip_ratio/high_max": 0.028846153989434242, "clip_ratio/region_mean": 0.1157561931759119, "reward_total_mean": 0.10005968064069748, "reward_meter_mean": 0.22518661618232727, "reward_meter_std": 0.30453017354011536, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9323565363883972, "reward_repeat_penalty_std": 0.05915520712733269, "reward_repeat_floor_mean": 0.9920791387557983, "reward_repeat_floor_std": 0.00636344263330102, "reward_near_duplicate_penalty_mean": 0.9719240665435791, "reward_near_duplicate_penalty_std": 0.016151413321495056, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9587832689285278, "reward_distinct_2_std": 0.0489928312599659, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.10005968064069748, "reward_total_composite_std": 0.13596297800540924} {"timestamp_utc": "2026-04-12T21:12:57Z", "mode": "train", "global_step": 1372, "epoch": 0.07220672596179148, "loss": 0.0828, "grad_norm": 8.046740531921387, "learning_rate": 5.845454545454547e-06, "num_tokens": 2429674.0, "completions/mean_length": 81.125, "completions/min_length": 68.0, "completions/max_length": 94.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 81.125, "completions/min_terminated_length": 68.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.18508780002593994, "rewards/meter/std": 0.32934829592704773, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9343750476837158, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.18795421719551086, "rewards/repeat_penalty/mean": 0.9501427412033081, "rewards/repeat_penalty/std": 0.03616981953382492, "rewards/repeat_floor/mean": 0.9939243197441101, "rewards/repeat_floor/std": 0.003354514017701149, "rewards/near_duplicate_penalty/mean": 0.9742391109466553, "rewards/near_duplicate_penalty/std": 0.012213360518217087, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9754273891448975, "rewards/distinct_2/std": 0.03964797407388687, "rewards/total_composite/mean": 0.1263751983642578, "rewards/total_composite/std": 0.2864478528499603, "reward": 0.1263751983642578, "reward_std": 0.2864478528499603, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16321052610874176, "sampling/sampling_logp_difference/max": 1.7143049240112305, "sampling/importance_sampling_ratio/min": 0.1800888627767563, "sampling/importance_sampling_ratio/mean": 1.0199953317642212, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1901763826608658, "clip_ratio/low_mean": 0.12560637015849352, "clip_ratio/low_min": 0.12560637015849352, "clip_ratio/high_mean": 0.011029412038624287, "clip_ratio/high_max": 0.011029412038624287, "clip_ratio/region_mean": 0.1366357821971178, "reward_total_mean": 0.1263751983642578, "reward_meter_mean": 0.18508780002593994, "reward_meter_std": 0.32934829592704773, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9343750476837158, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9501427412033081, "reward_repeat_penalty_std": 0.03616981953382492, "reward_repeat_floor_mean": 0.9939243197441101, "reward_repeat_floor_std": 0.003354514017701149, "reward_near_duplicate_penalty_mean": 0.9742391109466553, "reward_near_duplicate_penalty_std": 0.012213360518217087, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9754273891448975, "reward_distinct_2_std": 0.03964797407388687, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.18795421719551086, "reward_total_composite_mean": 0.1263751983642578, "reward_total_composite_std": 0.2864478528499603} {"timestamp_utc": "2026-04-12T21:13:06Z", "mode": "train", "global_step": 1373, "epoch": 0.07225935477080153, "loss": 0.0445, "grad_norm": 12.134416580200195, "learning_rate": 5.842424242424243e-06, "num_tokens": 2431360.0, "completions/mean_length": 38.75, "completions/min_length": 33.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.75, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.10883817076683044, "rewards/meter/std": 0.13237561285495758, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.28630343079566956, "rewards/repeat_penalty/mean": 0.9554584622383118, "rewards/repeat_penalty/std": 0.06852570176124573, "rewards/repeat_floor/mean": 0.9942131638526917, "rewards/repeat_floor/std": 0.007829461246728897, "rewards/near_duplicate_penalty/mean": 0.9724100828170776, "rewards/near_duplicate_penalty/std": 0.024116821587085724, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9816849827766418, "rewards/distinct_2/std": 0.05180269479751587, "rewards/total_composite/mean": 0.06725022196769714, "rewards/total_composite/std": 0.09920899569988251, "reward": 0.06725022196769714, "reward_std": 0.0992090031504631, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13775679469108582, "sampling/sampling_logp_difference/max": 1.2311906814575195, "sampling/importance_sampling_ratio/min": 0.2919447720050812, "sampling/importance_sampling_ratio/mean": 1.0210661888122559, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.348797246813774, "clip_ratio/low_mean": 0.11056662816554308, "clip_ratio/low_min": 0.11056662816554308, "clip_ratio/high_mean": 0.031759907491505146, "clip_ratio/high_max": 0.031759907491505146, "clip_ratio/region_mean": 0.14232653565704823, "reward_total_mean": 0.06725022196769714, "reward_meter_mean": 0.10883817076683044, "reward_meter_std": 0.13237561285495758, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.9554584622383118, "reward_repeat_penalty_std": 0.06852570176124573, "reward_repeat_floor_mean": 0.9942131638526917, "reward_repeat_floor_std": 0.007829461246728897, "reward_near_duplicate_penalty_mean": 0.9724100828170776, "reward_near_duplicate_penalty_std": 0.024116821587085724, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9816849827766418, "reward_distinct_2_std": 0.05180269479751587, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.28630343079566956, "reward_total_composite_mean": 0.06725022196769714, "reward_total_composite_std": 0.09920899569988251} {"timestamp_utc": "2026-04-12T21:13:15Z", "mode": "train", "global_step": 1374, "epoch": 0.07231198357981158, "loss": 0.0664, "grad_norm": 14.10013484954834, "learning_rate": 5.83939393939394e-06, "num_tokens": 2432937.0, "completions/mean_length": 34.125, "completions/min_length": 31.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.125, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.9319015145301819, "rewards/meter/std": 0.13963213562965393, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9271719455718994, "rewards/repeat_penalty/std": 0.12586134672164917, "rewards/repeat_floor/mean": 0.991751492023468, "rewards/repeat_floor/std": 0.012157819233834743, "rewards/near_duplicate_penalty/mean": 0.9642972946166992, "rewards/near_duplicate_penalty/std": 0.04767512530088425, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9886877536773682, "rewards/distinct_2/std": 0.031995780766010284, "rewards/total_composite/mean": 0.37901413440704346, "rewards/total_composite/std": 0.06541632860898972, "reward": 0.37901413440704346, "reward_std": 0.06541632860898972, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1121741458773613, "sampling/sampling_logp_difference/max": 2.3811964988708496, "sampling/importance_sampling_ratio/min": 0.09243990480899811, "sampling/importance_sampling_ratio/mean": 1.0020999908447266, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6387466639280319, "clip_ratio/low_mean": 0.03424250823445618, "clip_ratio/low_min": 0.03424250823445618, "clip_ratio/high_mean": 0.04973118286579847, "clip_ratio/high_max": 0.04973118286579847, "clip_ratio/region_mean": 0.08397369110025465, "reward_total_mean": 0.37901413440704346, "reward_meter_mean": 0.9319015145301819, "reward_meter_std": 0.13963213562965393, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9271719455718994, "reward_repeat_penalty_std": 0.12586134672164917, "reward_repeat_floor_mean": 0.991751492023468, "reward_repeat_floor_std": 0.012157819233834743, "reward_near_duplicate_penalty_mean": 0.9642972946166992, "reward_near_duplicate_penalty_std": 0.04767512530088425, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9886877536773682, "reward_distinct_2_std": 0.031995780766010284, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.37901413440704346, "reward_total_composite_std": 0.06541632860898972} {"timestamp_utc": "2026-04-12T21:13:29Z", "mode": "train", "global_step": 1375, "epoch": 0.07236461238882164, "loss": -0.0394, "grad_norm": 2.623197317123413, "learning_rate": 5.836363636363637e-06, "num_tokens": 2434423.0, "completions/mean_length": 154.75, "completions/min_length": 30.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 35.66666793823242, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.44823598861694336, "rewards/meter/std": 0.38567957282066345, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8820353746414185, "rewards/lexical_plausibility/std": 0.21875672042369843, "rewards/judge_quality/mean": 0.29374998807907104, "rewards/judge_quality/std": 0.19537052512168884, "rewards/repeat_penalty/mean": 0.9160169959068298, "rewards/repeat_penalty/std": 0.09169948101043701, "rewards/repeat_floor/mean": 0.9906015396118164, "rewards/repeat_floor/std": 0.0074348971247673035, "rewards/near_duplicate_penalty/mean": 0.9565833210945129, "rewards/near_duplicate_penalty/std": 0.0336182564496994, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9887669086456299, "rewards/distinct_2/std": 0.028349952772259712, "rewards/total_composite/mean": 0.12254895269870758, "rewards/total_composite/std": 0.15505245327949524, "reward": 0.12254895269870758, "reward_std": 0.15505243837833405, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13303308188915253, "sampling/sampling_logp_difference/max": 0.940190315246582, "sampling/importance_sampling_ratio/min": 0.3905535042285919, "sampling/importance_sampling_ratio/mean": 1.0239512920379639, "sampling/importance_sampling_ratio/max": 1.8268417119979858, "entropy": 0.7729804664850235, "clip_ratio/low_mean": 0.06234984891489148, "clip_ratio/low_min": 0.06234984891489148, "clip_ratio/high_mean": 0.03040540497750044, "clip_ratio/high_max": 0.03040540497750044, "clip_ratio/region_mean": 0.09275525389239192, "reward_total_mean": 0.12254895269870758, "reward_meter_mean": 0.44823598861694336, "reward_meter_std": 0.38567957282066345, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8820353746414185, "reward_lexical_plausibility_std": 0.21875672042369843, "reward_repeat_penalty_mean": 0.9160169959068298, "reward_repeat_penalty_std": 0.09169948101043701, "reward_repeat_floor_mean": 0.9906015396118164, "reward_repeat_floor_std": 0.0074348971247673035, "reward_near_duplicate_penalty_mean": 0.9565833210945129, "reward_near_duplicate_penalty_std": 0.0336182564496994, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9887669086456299, "reward_distinct_2_std": 0.028349952772259712, "reward_judge_quality_mean": 0.29374998807907104, "reward_judge_quality_std": 0.19537052512168884, "reward_total_composite_mean": 0.12254895269870758, "reward_total_composite_std": 0.15505245327949524} {"timestamp_utc": "2026-04-12T21:13:43Z", "mode": "train", "global_step": 1376, "epoch": 0.07241724119783169, "loss": -0.0935, "grad_norm": 6.4571051597595215, "learning_rate": 5.833333333333334e-06, "num_tokens": 2436490.0, "completions/mean_length": 139.375, "completions/min_length": 66.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 86.14286041259766, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 105.0, "rewards/meter/mean": 0.39170604944229126, "rewards/meter/std": 0.266248881816864, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.05892555043101311, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.01767767407000065, "rewards/lexical_plausibility/mean": 0.9198315143585205, "rewards/lexical_plausibility/std": 0.15002666413784027, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1414213478565216, "rewards/repeat_penalty/mean": 0.8627588748931885, "rewards/repeat_penalty/std": 0.09677524119615555, "rewards/repeat_floor/mean": 0.9852653741836548, "rewards/repeat_floor/std": 0.009832357987761497, "rewards/near_duplicate_penalty/mean": 0.9551376104354858, "rewards/near_duplicate_penalty/std": 0.03070751577615738, "rewards/opening_diversity/mean": 0.9624999761581421, "rewards/opening_diversity/std": 0.05175492912530899, "rewards/distinct_2/mean": 0.9360523223876953, "rewards/distinct_2/std": 0.051112402230501175, "rewards/total_composite/mean": 0.09740854799747467, "rewards/total_composite/std": 0.07821636646986008, "reward": 0.09740854799747467, "reward_std": 0.07821635901927948, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16103622317314148, "sampling/sampling_logp_difference/max": 3.0257763862609863, "sampling/importance_sampling_ratio/min": 0.04852013662457466, "sampling/importance_sampling_ratio/mean": 1.0246303081512451, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9950046166777611, "clip_ratio/low_mean": 0.058809525333344936, "clip_ratio/low_min": 0.058809525333344936, "clip_ratio/high_mean": 0.06535284221172333, "clip_ratio/high_max": 0.06535284221172333, "clip_ratio/region_mean": 0.12416236754506826, "reward_total_mean": 0.09740854799747467, "reward_meter_mean": 0.39170604944229126, "reward_meter_std": 0.266248881816864, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.05892555043101311, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.01767767407000065, "reward_lexical_plausibility_mean": 0.9198315143585205, "reward_lexical_plausibility_std": 0.15002666413784027, "reward_repeat_penalty_mean": 0.8627588748931885, "reward_repeat_penalty_std": 0.09677524119615555, "reward_repeat_floor_mean": 0.9852653741836548, "reward_repeat_floor_std": 0.009832357987761497, "reward_near_duplicate_penalty_mean": 0.9551376104354858, "reward_near_duplicate_penalty_std": 0.03070751577615738, "reward_opening_diversity_mean": 0.9624999761581421, "reward_opening_diversity_std": 0.05175492912530899, "reward_distinct_2_mean": 0.9360523223876953, "reward_distinct_2_std": 0.051112402230501175, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1414213478565216, "reward_total_composite_mean": 0.09740854799747467, "reward_total_composite_std": 0.07821636646986008} {"timestamp_utc": "2026-04-12T21:13:57Z", "mode": "train", "global_step": 1377, "epoch": 0.07246987000684174, "loss": -0.0428, "grad_norm": 3.8730804920196533, "learning_rate": 5.83030303030303e-06, "num_tokens": 2438551.0, "completions/mean_length": 190.625, "completions/min_length": 69.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 83.5, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 91.0, "rewards/meter/mean": 0.2339208424091339, "rewards/meter/std": 0.3111248314380646, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.04008918255567551, "rewards/lexical_plausibility/mean": 0.8983363509178162, "rewards/lexical_plausibility/std": 0.1886088103055954, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.1552647352218628, "rewards/repeat_penalty/mean": 0.9519809484481812, "rewards/repeat_penalty/std": 0.05712372064590454, "rewards/repeat_floor/mean": 0.9948340654373169, "rewards/repeat_floor/std": 0.005274706520140171, "rewards/near_duplicate_penalty/mean": 0.9842805862426758, "rewards/near_duplicate_penalty/std": 0.012290792539715767, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9740083813667297, "rewards/distinct_2/std": 0.03490973263978958, "rewards/total_composite/mean": 0.07561470568180084, "rewards/total_composite/std": 0.1330641657114029, "reward": 0.07561470568180084, "reward_std": 0.1330641657114029, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14303164184093475, "sampling/sampling_logp_difference/max": 1.6218986511230469, "sampling/importance_sampling_ratio/min": 0.1975233256816864, "sampling/importance_sampling_ratio/mean": 1.0300137996673584, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9534309580922127, "clip_ratio/low_mean": 0.07406182214617729, "clip_ratio/low_min": 0.07406182214617729, "clip_ratio/high_mean": 0.010416666977107525, "clip_ratio/high_max": 0.010416666977107525, "clip_ratio/region_mean": 0.08447848912328482, "reward_total_mean": 0.07561470568180084, "reward_meter_mean": 0.2339208424091339, "reward_meter_std": 0.3111248314380646, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.04008918255567551, "reward_lexical_plausibility_mean": 0.8983363509178162, "reward_lexical_plausibility_std": 0.1886088103055954, "reward_repeat_penalty_mean": 0.9519809484481812, "reward_repeat_penalty_std": 0.05712372064590454, "reward_repeat_floor_mean": 0.9948340654373169, "reward_repeat_floor_std": 0.005274706520140171, "reward_near_duplicate_penalty_mean": 0.9842805862426758, "reward_near_duplicate_penalty_std": 0.012290792539715767, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9740083813667297, "reward_distinct_2_std": 0.03490973263978958, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.1552647352218628, "reward_total_composite_mean": 0.07561470568180084, "reward_total_composite_std": 0.1330641657114029} {"timestamp_utc": "2026-04-12T21:14:06Z", "mode": "train", "global_step": 1378, "epoch": 0.0725224988158518, "loss": 0.0106, "grad_norm": 12.528951644897461, "learning_rate": 5.8272727272727285e-06, "num_tokens": 2440160.0, "completions/mean_length": 35.125, "completions/min_length": 31.0, "completions/max_length": 41.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.125, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.11679422110319138, "rewards/meter/std": 0.10038521885871887, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5137500166893005, "rewards/judge_quality/std": 0.3586059510707855, "rewards/repeat_penalty/mean": 0.9802839756011963, "rewards/repeat_penalty/std": 0.028267215937376022, "rewards/repeat_floor/mean": 0.9970425963401794, "rewards/repeat_floor/std": 0.004240076523274183, "rewards/near_duplicate_penalty/mean": 0.9802839756011963, "rewards/near_duplicate_penalty/std": 0.028267215937376022, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.07801657170057297, "rewards/total_composite/std": 0.10824630409479141, "reward": 0.07801657170057297, "reward_std": 0.10824630409479141, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1653551459312439, "sampling/sampling_logp_difference/max": 1.6351332664489746, "sampling/importance_sampling_ratio/min": 0.1949263960123062, "sampling/importance_sampling_ratio/mean": 1.0139355659484863, "sampling/importance_sampling_ratio/max": 1.9271697998046875, "entropy": 1.1497474610805511, "clip_ratio/low_mean": 0.06785545218735933, "clip_ratio/low_min": 0.06785545218735933, "clip_ratio/high_mean": 0.03943745046854019, "clip_ratio/high_max": 0.03943745046854019, "clip_ratio/region_mean": 0.10729290265589952, "reward_total_mean": 0.07801657170057297, "reward_meter_mean": 0.11679422110319138, "reward_meter_std": 0.10038521885871887, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9802839756011963, "reward_repeat_penalty_std": 0.028267215937376022, "reward_repeat_floor_mean": 0.9970425963401794, "reward_repeat_floor_std": 0.004240076523274183, "reward_near_duplicate_penalty_mean": 0.9802839756011963, "reward_near_duplicate_penalty_std": 0.028267215937376022, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5137500166893005, "reward_judge_quality_std": 0.3586059510707855, "reward_total_composite_mean": 0.07801657170057297, "reward_total_composite_std": 0.10824630409479141} {"timestamp_utc": "2026-04-12T21:14:20Z", "mode": "train", "global_step": 1379, "epoch": 0.07257512762486185, "loss": -0.0275, "grad_norm": 6.189452648162842, "learning_rate": 5.824242424242425e-06, "num_tokens": 2441908.0, "completions/mean_length": 116.5, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 60.000003814697266, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.4092772603034973, "rewards/meter/std": 0.3240372836589813, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9319329261779785, "rewards/lexical_plausibility/std": 0.1623733937740326, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.1927248239517212, "rewards/repeat_penalty/mean": 0.9625256061553955, "rewards/repeat_penalty/std": 0.04014236479997635, "rewards/repeat_floor/mean": 0.9951406121253967, "rewards/repeat_floor/std": 0.0049741859547793865, "rewards/near_duplicate_penalty/mean": 0.9759984612464905, "rewards/near_duplicate_penalty/std": 0.024664591997861862, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9860093593597412, "rewards/distinct_2/std": 0.025911342352628708, "rewards/total_composite/mean": 0.19492483139038086, "rewards/total_composite/std": 0.23800775408744812, "reward": 0.19492483139038086, "reward_std": 0.23800775408744812, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15827898681163788, "sampling/sampling_logp_difference/max": 1.7638483047485352, "sampling/importance_sampling_ratio/min": 0.1713840514421463, "sampling/importance_sampling_ratio/mean": 1.0424138307571411, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9292081221938133, "clip_ratio/low_mean": 0.059855757281184196, "clip_ratio/low_min": 0.059855757281184196, "clip_ratio/high_mean": 0.05416002217680216, "clip_ratio/high_max": 0.05416002217680216, "clip_ratio/region_mean": 0.11401577945798635, "reward_total_mean": 0.19492483139038086, "reward_meter_mean": 0.4092772603034973, "reward_meter_std": 0.3240372836589813, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9319329261779785, "reward_lexical_plausibility_std": 0.1623733937740326, "reward_repeat_penalty_mean": 0.9625256061553955, "reward_repeat_penalty_std": 0.04014236479997635, "reward_repeat_floor_mean": 0.9951406121253967, "reward_repeat_floor_std": 0.0049741859547793865, "reward_near_duplicate_penalty_mean": 0.9759984612464905, "reward_near_duplicate_penalty_std": 0.024664591997861862, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9860093593597412, "reward_distinct_2_std": 0.025911342352628708, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.1927248239517212, "reward_total_composite_mean": 0.19492483139038086, "reward_total_composite_std": 0.23800775408744812} {"timestamp_utc": "2026-04-12T21:14:28Z", "mode": "train", "global_step": 1380, "epoch": 0.0726277564338719, "loss": -0.0042, "grad_norm": 11.943592071533203, "learning_rate": 5.821212121212122e-06, "num_tokens": 2443402.0, "completions/mean_length": 33.75, "completions/min_length": 31.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.75, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.5656245350837708, "rewards/meter/std": 0.3941541910171509, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8062499761581421, "rewards/judge_quality/std": 0.22012577950954437, "rewards/repeat_penalty/mean": 0.981610894203186, "rewards/repeat_penalty/std": 0.018419211730360985, "rewards/repeat_floor/mean": 0.9972416162490845, "rewards/repeat_floor/std": 0.0027628839015960693, "rewards/near_duplicate_penalty/mean": 0.981610894203186, "rewards/near_duplicate_penalty/std": 0.018419211730360985, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4673754572868347, "rewards/total_composite/std": 0.3525567948818207, "reward": 0.4673754572868347, "reward_std": 0.35255682468414307, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10308034718036652, "sampling/sampling_logp_difference/max": 1.1686080694198608, "sampling/importance_sampling_ratio/min": 0.3700951337814331, "sampling/importance_sampling_ratio/mean": 1.032747745513916, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6752573549747467, "clip_ratio/low_mean": 0.08257925044745207, "clip_ratio/low_min": 0.08257925044745207, "clip_ratio/high_mean": 0.05479426775127649, "clip_ratio/high_max": 0.05479426775127649, "clip_ratio/region_mean": 0.13737351819872856, "reward_total_mean": 0.4673754572868347, "reward_meter_mean": 0.5656245350837708, "reward_meter_std": 0.3941541910171509, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.981610894203186, "reward_repeat_penalty_std": 0.018419211730360985, "reward_repeat_floor_mean": 0.9972416162490845, "reward_repeat_floor_std": 0.0027628839015960693, "reward_near_duplicate_penalty_mean": 0.981610894203186, "reward_near_duplicate_penalty_std": 0.018419211730360985, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8062499761581421, "reward_judge_quality_std": 0.22012577950954437, "reward_total_composite_mean": 0.4673754572868347, "reward_total_composite_std": 0.3525567948818207} {"timestamp_utc": "2026-04-12T21:14:43Z", "mode": "train", "global_step": 1381, "epoch": 0.07268038524288195, "loss": -0.0656, "grad_norm": 8.257170677185059, "learning_rate": 5.8181818181818185e-06, "num_tokens": 2445372.0, "completions/mean_length": 133.25, "completions/min_length": 70.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 79.14286041259766, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 88.0, "rewards/meter/mean": 0.5085207223892212, "rewards/meter/std": 0.3166560232639313, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9343750476837158, "rewards/count_floor/std": 0.026516498997807503, "rewards/lexical_plausibility/mean": 0.9388819932937622, "rewards/lexical_plausibility/std": 0.1728677898645401, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9647260904312134, "rewards/repeat_penalty/std": 0.040419209748506546, "rewards/repeat_floor/mean": 0.9958482384681702, "rewards/repeat_floor/std": 0.004399863071739674, "rewards/near_duplicate_penalty/mean": 0.9845747351646423, "rewards/near_duplicate_penalty/std": 0.01241633202880621, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9795782566070557, "rewards/distinct_2/std": 0.03128037601709366, "rewards/total_composite/mean": 0.14327138662338257, "rewards/total_composite/std": 0.09918083250522614, "reward": 0.14327138662338257, "reward_std": 0.09918083250522614, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1695936769247055, "sampling/sampling_logp_difference/max": 1.5722389221191406, "sampling/importance_sampling_ratio/min": 0.20757991075515747, "sampling/importance_sampling_ratio/mean": 1.0253328084945679, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2447847500443459, "clip_ratio/low_mean": 0.03497899230569601, "clip_ratio/low_min": 0.03497899230569601, "clip_ratio/high_mean": 0.10276469774544239, "clip_ratio/high_max": 0.10276469774544239, "clip_ratio/region_mean": 0.1377436900511384, "reward_total_mean": 0.14327138662338257, "reward_meter_mean": 0.5085207223892212, "reward_meter_std": 0.3166560232639313, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9343750476837158, "reward_count_floor_std": 0.026516498997807503, "reward_lexical_plausibility_mean": 0.9388819932937622, "reward_lexical_plausibility_std": 0.1728677898645401, "reward_repeat_penalty_mean": 0.9647260904312134, "reward_repeat_penalty_std": 0.040419209748506546, "reward_repeat_floor_mean": 0.9958482384681702, "reward_repeat_floor_std": 0.004399863071739674, "reward_near_duplicate_penalty_mean": 0.9845747351646423, "reward_near_duplicate_penalty_std": 0.01241633202880621, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9795782566070557, "reward_distinct_2_std": 0.03128037601709366, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.14327138662338257, "reward_total_composite_std": 0.09918083250522614} {"timestamp_utc": "2026-04-12T21:14:53Z", "mode": "train", "global_step": 1382, "epoch": 0.072733014051892, "loss": 0.0384, "grad_norm": 10.212300300598145, "learning_rate": 5.815151515151516e-06, "num_tokens": 2447828.0, "completions/mean_length": 89.0, "completions/min_length": 82.0, "completions/max_length": 96.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 89.0, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 96.0, "rewards/meter/mean": 0.43377628922462463, "rewards/meter/std": 0.3504347503185272, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9399999976158142, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5887500047683716, "rewards/judge_quality/std": 0.27740830183029175, "rewards/repeat_penalty/mean": 0.9600228071212769, "rewards/repeat_penalty/std": 0.031417373567819595, "rewards/repeat_floor/mean": 0.995720624923706, "rewards/repeat_floor/std": 0.0031103522051125765, "rewards/near_duplicate_penalty/mean": 0.98921799659729, "rewards/near_duplicate_penalty/std": 0.007008589804172516, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9704216718673706, "rewards/distinct_2/std": 0.02851642481982708, "rewards/total_composite/mean": 0.23056016862392426, "rewards/total_composite/std": 0.25362980365753174, "reward": 0.23056016862392426, "reward_std": 0.25362980365753174, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13449743390083313, "sampling/sampling_logp_difference/max": 1.7509427070617676, "sampling/importance_sampling_ratio/min": 0.17361019551753998, "sampling/importance_sampling_ratio/mean": 1.0187311172485352, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0623348504304886, "clip_ratio/low_mean": 0.06945235095918179, "clip_ratio/low_min": 0.06945235095918179, "clip_ratio/high_mean": 0.04316510818898678, "clip_ratio/high_max": 0.04316510818898678, "clip_ratio/region_mean": 0.11261745914816856, "reward_total_mean": 0.23056016862392426, "reward_meter_mean": 0.43377628922462463, "reward_meter_std": 0.3504347503185272, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9399999976158142, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9600228071212769, "reward_repeat_penalty_std": 0.031417373567819595, "reward_repeat_floor_mean": 0.995720624923706, "reward_repeat_floor_std": 0.0031103522051125765, "reward_near_duplicate_penalty_mean": 0.98921799659729, "reward_near_duplicate_penalty_std": 0.007008589804172516, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9704216718673706, "reward_distinct_2_std": 0.02851642481982708, "reward_judge_quality_mean": 0.5887500047683716, "reward_judge_quality_std": 0.27740830183029175, "reward_total_composite_mean": 0.23056016862392426, "reward_total_composite_std": 0.25362980365753174} {"timestamp_utc": "2026-04-12T21:15:02Z", "mode": "train", "global_step": 1383, "epoch": 0.07278564286090206, "loss": 0.0386, "grad_norm": 14.913884162902832, "learning_rate": 5.812121212121212e-06, "num_tokens": 2449484.0, "completions/mean_length": 37.0, "completions/min_length": 35.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.43368643522262573, "rewards/meter/std": 0.3672539293766022, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.890625, "rewards/lexical_plausibility/std": 0.20005889236927032, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.08345229178667068, "rewards/repeat_penalty/mean": 0.8921650052070618, "rewards/repeat_penalty/std": 0.11480287462472916, "rewards/repeat_floor/mean": 0.9849240779876709, "rewards/repeat_floor/std": 0.01506594568490982, "rewards/near_duplicate_penalty/mean": 0.9197890758514404, "rewards/near_duplicate_penalty/std": 0.0587652288377285, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9661751389503479, "rewards/distinct_2/std": 0.07171893864870071, "rewards/total_composite/mean": 0.2104009985923767, "rewards/total_composite/std": 0.18752139806747437, "reward": 0.2104009985923767, "reward_std": 0.18752138316631317, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13715417683124542, "sampling/sampling_logp_difference/max": 2.148918390274048, "sampling/importance_sampling_ratio/min": 0.11661022156476974, "sampling/importance_sampling_ratio/mean": 1.0305767059326172, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0850043445825577, "clip_ratio/low_mean": 0.04096700111404061, "clip_ratio/low_min": 0.04096700111404061, "clip_ratio/high_mean": 0.04990326915867627, "clip_ratio/high_max": 0.04990326915867627, "clip_ratio/region_mean": 0.09087027027271688, "reward_total_mean": 0.2104009985923767, "reward_meter_mean": 0.43368643522262573, "reward_meter_std": 0.3672539293766022, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.890625, "reward_lexical_plausibility_std": 0.20005889236927032, "reward_repeat_penalty_mean": 0.8921650052070618, "reward_repeat_penalty_std": 0.11480287462472916, "reward_repeat_floor_mean": 0.9849240779876709, "reward_repeat_floor_std": 0.01506594568490982, "reward_near_duplicate_penalty_mean": 0.9197890758514404, "reward_near_duplicate_penalty_std": 0.0587652288377285, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9661751389503479, "reward_distinct_2_std": 0.07171893864870071, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.08345229178667068, "reward_total_composite_mean": 0.2104009985923767, "reward_total_composite_std": 0.18752139806747437} {"timestamp_utc": "2026-04-12T21:15:11Z", "mode": "train", "global_step": 1384, "epoch": 0.07283827166991211, "loss": 0.0516, "grad_norm": 15.159344673156738, "learning_rate": 5.8090909090909095e-06, "num_tokens": 2450963.0, "completions/mean_length": 33.875, "completions/min_length": 31.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.875, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.21777233481407166, "rewards/meter/std": 0.2769502103328705, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.9761722087860107, "rewards/repeat_penalty/std": 0.023667991161346436, "rewards/repeat_floor/mean": 0.9964258670806885, "rewards/repeat_floor/std": 0.003550207242369652, "rewards/near_duplicate_penalty/mean": 0.9761722087860107, "rewards/near_duplicate_penalty/std": 0.023667991161346436, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08764076232910156, "rewards/total_composite/std": 0.12652982771396637, "reward": 0.08764076232910156, "reward_std": 0.12652981281280518, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1754465103149414, "sampling/sampling_logp_difference/max": 1.8747997283935547, "sampling/importance_sampling_ratio/min": 0.1533856838941574, "sampling/importance_sampling_ratio/mean": 1.0349808931350708, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.621047243475914, "clip_ratio/low_mean": 0.09394368529319763, "clip_ratio/low_min": 0.09394368529319763, "clip_ratio/high_mean": 0.034155597910284996, "clip_ratio/high_max": 0.034155597910284996, "clip_ratio/region_mean": 0.12809928320348263, "reward_total_mean": 0.08764076232910156, "reward_meter_mean": 0.21777233481407166, "reward_meter_std": 0.2769502103328705, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9761722087860107, "reward_repeat_penalty_std": 0.023667991161346436, "reward_repeat_floor_mean": 0.9964258670806885, "reward_repeat_floor_std": 0.003550207242369652, "reward_near_duplicate_penalty_mean": 0.9761722087860107, "reward_near_duplicate_penalty_std": 0.023667991161346436, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.08764076232910156, "reward_total_composite_std": 0.12652982771396637} {"timestamp_utc": "2026-04-12T21:15:21Z", "mode": "train", "global_step": 1385, "epoch": 0.07289090047892216, "loss": -0.0093, "grad_norm": 16.93290901184082, "learning_rate": 5.806060606060606e-06, "num_tokens": 2452194.0, "completions/mean_length": 20.875, "completions/min_length": 19.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.875, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.6003322005271912, "rewards/meter/std": 0.42994600534439087, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.21756774187088013, "rewards/repeat_penalty/mean": 0.7139315605163574, "rewards/repeat_penalty/std": 0.06942594796419144, "rewards/repeat_floor/mean": 0.9786067008972168, "rewards/repeat_floor/std": 0.013073219917714596, "rewards/near_duplicate_penalty/mean": 0.9662534594535828, "rewards/near_duplicate_penalty/std": 0.08387837558984756, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.3169105648994446, "rewards/total_composite/std": 0.2148708552122116, "reward": 0.3169105648994446, "reward_std": 0.2148708552122116, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15424107015132904, "sampling/sampling_logp_difference/max": 1.8576135635375977, "sampling/importance_sampling_ratio/min": 0.15604457259178162, "sampling/importance_sampling_ratio/mean": 1.0220803022384644, "sampling/importance_sampling_ratio/max": 1.6014626026153564, "entropy": 1.1259381845593452, "clip_ratio/low_mean": 0.05131579004228115, "clip_ratio/low_min": 0.05131579004228115, "clip_ratio/high_mean": 0.09645593632012606, "clip_ratio/high_max": 0.09645593632012606, "clip_ratio/region_mean": 0.1477717263624072, "reward_total_mean": 0.3169105648994446, "reward_meter_mean": 0.6003322005271912, "reward_meter_std": 0.42994600534439087, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.7139315605163574, "reward_repeat_penalty_std": 0.06942594796419144, "reward_repeat_floor_mean": 0.9786067008972168, "reward_repeat_floor_std": 0.013073219917714596, "reward_near_duplicate_penalty_mean": 0.9662534594535828, "reward_near_duplicate_penalty_std": 0.08387837558984756, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.21756774187088013, "reward_total_composite_mean": 0.3169105648994446, "reward_total_composite_std": 0.2148708552122116} {"timestamp_utc": "2026-04-12T21:15:30Z", "mode": "train", "global_step": 1386, "epoch": 0.07294352928793221, "loss": 0.0852, "grad_norm": 14.418100357055664, "learning_rate": 5.803030303030304e-06, "num_tokens": 2453766.0, "completions/mean_length": 35.5, "completions/min_length": 25.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.5, "completions/min_terminated_length": 25.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.6023249626159668, "rewards/meter/std": 0.38541167974472046, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9407806396484375, "rewards/repeat_penalty/std": 0.07284440845251083, "rewards/repeat_floor/mean": 0.9925022125244141, "rewards/repeat_floor/std": 0.008648661896586418, "rewards/near_duplicate_penalty/mean": 0.9665827751159668, "rewards/near_duplicate_penalty/std": 0.03403427451848984, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9723865985870361, "rewards/distinct_2/std": 0.051303714513778687, "rewards/total_composite/mean": 0.237629234790802, "rewards/total_composite/std": 0.15501956641674042, "reward": 0.237629234790802, "reward_std": 0.15501955151557922, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1717086285352707, "sampling/sampling_logp_difference/max": 1.6316661834716797, "sampling/importance_sampling_ratio/min": 0.1956033855676651, "sampling/importance_sampling_ratio/mean": 1.0156081914901733, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2342327982187271, "clip_ratio/low_mean": 0.06301843374967575, "clip_ratio/low_min": 0.06301843374967575, "clip_ratio/high_mean": 0.12470238283276558, "clip_ratio/high_max": 0.12470238283276558, "clip_ratio/region_mean": 0.18772081658244133, "reward_total_mean": 0.237629234790802, "reward_meter_mean": 0.6023249626159668, "reward_meter_std": 0.38541167974472046, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9407806396484375, "reward_repeat_penalty_std": 0.07284440845251083, "reward_repeat_floor_mean": 0.9925022125244141, "reward_repeat_floor_std": 0.008648661896586418, "reward_near_duplicate_penalty_mean": 0.9665827751159668, "reward_near_duplicate_penalty_std": 0.03403427451848984, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9723865985870361, "reward_distinct_2_std": 0.051303714513778687, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.237629234790802, "reward_total_composite_std": 0.15501956641674042} {"timestamp_utc": "2026-04-12T21:15:40Z", "mode": "train", "global_step": 1387, "epoch": 0.07299615809694227, "loss": 0.0322, "grad_norm": 22.800981521606445, "learning_rate": 5.8e-06, "num_tokens": 2455203.0, "completions/mean_length": 15.625, "completions/min_length": 13.0, "completions/max_length": 18.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 15.625, "completions/min_terminated_length": 13.0, "completions/max_terminated_length": 18.0, "rewards/meter/mean": 0.5446288585662842, "rewards/meter/std": 0.4736005961894989, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8100000023841858, "rewards/judge_quality/std": 0.22258225083351135, "rewards/repeat_penalty/mean": 0.7348276972770691, "rewards/repeat_penalty/std": 0.031104182824492455, "rewards/repeat_floor/mean": 0.9819655418395996, "rewards/repeat_floor/std": 0.006220838986337185, "rewards/near_duplicate_penalty/mean": 0.9797701835632324, "rewards/near_duplicate_penalty/std": 0.04147225245833397, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4695475697517395, "rewards/total_composite/std": 0.44437405467033386, "reward": 0.4695475697517395, "reward_std": 0.4443740248680115, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15417081117630005, "sampling/sampling_logp_difference/max": 1.1479153633117676, "sampling/importance_sampling_ratio/min": 0.3172975480556488, "sampling/importance_sampling_ratio/mean": 1.007819652557373, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2510360851883888, "clip_ratio/low_mean": 0.07854920905083418, "clip_ratio/low_min": 0.07854920905083418, "clip_ratio/high_mean": 0.09047619253396988, "clip_ratio/high_max": 0.09047619253396988, "clip_ratio/region_mean": 0.16902540158480406, "reward_total_mean": 0.4695475697517395, "reward_meter_mean": 0.5446288585662842, "reward_meter_std": 0.4736005961894989, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7348276972770691, "reward_repeat_penalty_std": 0.031104182824492455, "reward_repeat_floor_mean": 0.9819655418395996, "reward_repeat_floor_std": 0.006220838986337185, "reward_near_duplicate_penalty_mean": 0.9797701835632324, "reward_near_duplicate_penalty_std": 0.04147225245833397, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8100000023841858, "reward_judge_quality_std": 0.22258225083351135, "reward_total_composite_mean": 0.4695475697517395, "reward_total_composite_std": 0.44437405467033386} {"timestamp_utc": "2026-04-12T21:15:48Z", "mode": "train", "global_step": 1388, "epoch": 0.07304878690595232, "loss": 0.0466, "grad_norm": 10.965044021606445, "learning_rate": 5.796969696969698e-06, "num_tokens": 2456872.0, "completions/mean_length": 38.625, "completions/min_length": 36.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.625, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.23914378881454468, "rewards/meter/std": 0.37572500109672546, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.5924999713897705, "rewards/judge_quality/std": 0.21359175443649292, "rewards/repeat_penalty/mean": 0.9583553075790405, "rewards/repeat_penalty/std": 0.04497262090444565, "rewards/repeat_floor/mean": 0.9943298697471619, "rewards/repeat_floor/std": 0.005261747166514397, "rewards/near_duplicate_penalty/mean": 0.9689866304397583, "rewards/near_duplicate_penalty/std": 0.020228583365678787, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9886877536773682, "rewards/distinct_2/std": 0.031995780766010284, "rewards/total_composite/mean": 0.16297760605812073, "rewards/total_composite/std": 0.2972034215927124, "reward": 0.16297760605812073, "reward_std": 0.2972034215927124, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11396858841180801, "sampling/sampling_logp_difference/max": 1.8433475494384766, "sampling/importance_sampling_ratio/min": 0.1582866758108139, "sampling/importance_sampling_ratio/mean": 1.0197510719299316, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6444540061056614, "clip_ratio/low_mean": 0.057240667287260294, "clip_ratio/low_min": 0.057240667287260294, "clip_ratio/high_mean": 0.020285087637603283, "clip_ratio/high_max": 0.020285087637603283, "clip_ratio/region_mean": 0.07752575492486358, "reward_total_mean": 0.16297760605812073, "reward_meter_mean": 0.23914378881454468, "reward_meter_std": 0.37572500109672546, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.9583553075790405, "reward_repeat_penalty_std": 0.04497262090444565, "reward_repeat_floor_mean": 0.9943298697471619, "reward_repeat_floor_std": 0.005261747166514397, "reward_near_duplicate_penalty_mean": 0.9689866304397583, "reward_near_duplicate_penalty_std": 0.020228583365678787, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9886877536773682, "reward_distinct_2_std": 0.031995780766010284, "reward_judge_quality_mean": 0.5924999713897705, "reward_judge_quality_std": 0.21359175443649292, "reward_total_composite_mean": 0.16297760605812073, "reward_total_composite_std": 0.2972034215927124} {"timestamp_utc": "2026-04-12T21:15:56Z", "mode": "train", "global_step": 1389, "epoch": 0.07310141571496237, "loss": -0.0334, "grad_norm": 21.580530166625977, "learning_rate": 5.793939393939394e-06, "num_tokens": 2458306.0, "completions/mean_length": 19.25, "completions/min_length": 16.0, "completions/max_length": 22.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.25, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.4622415602207184, "rewards/meter/std": 0.3959689736366272, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9791666269302368, "rewards/lexical_plausibility/std": 0.0589255727827549, "rewards/judge_quality/mean": 0.5550000071525574, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.734375, "rewards/repeat_penalty/std": 0.04419417306780815, "rewards/repeat_floor/mean": 0.9818750023841858, "rewards/repeat_floor/std": 0.00883884821087122, "rewards/near_duplicate_penalty/mean": 0.9791666269302368, "rewards/near_duplicate_penalty/std": 0.0589255727827549, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.22148087620735168, "rewards/total_composite/std": 0.17652671039104462, "reward": 0.22148087620735168, "reward_std": 0.17652671039104462, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14687377214431763, "sampling/sampling_logp_difference/max": 0.9140610694885254, "sampling/importance_sampling_ratio/min": 0.40089288353919983, "sampling/importance_sampling_ratio/mean": 1.0245178937911987, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2652703747153282, "clip_ratio/low_mean": 0.05480628600344062, "clip_ratio/low_min": 0.05480628600344062, "clip_ratio/high_mean": 0.10457963310182095, "clip_ratio/high_max": 0.10457963310182095, "clip_ratio/region_mean": 0.15938591910526156, "reward_total_mean": 0.22148087620735168, "reward_meter_mean": 0.4622415602207184, "reward_meter_std": 0.3959689736366272, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9791666269302368, "reward_lexical_plausibility_std": 0.0589255727827549, "reward_repeat_penalty_mean": 0.734375, "reward_repeat_penalty_std": 0.04419417306780815, "reward_repeat_floor_mean": 0.9818750023841858, "reward_repeat_floor_std": 0.00883884821087122, "reward_near_duplicate_penalty_mean": 0.9791666269302368, "reward_near_duplicate_penalty_std": 0.0589255727827549, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5550000071525574, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.22148087620735168, "reward_total_composite_std": 0.17652671039104462} {"timestamp_utc": "2026-04-12T21:16:11Z", "mode": "train", "global_step": 1390, "epoch": 0.07315404452397242, "loss": -0.0699, "grad_norm": 2.766141176223755, "learning_rate": 5.790909090909091e-06, "num_tokens": 2460013.0, "completions/mean_length": 162.375, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 45.833335876464844, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.5453200936317444, "rewards/meter/std": 0.3683542311191559, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8880355358123779, "rewards/lexical_plausibility/std": 0.20765499770641327, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.34450533986091614, "rewards/repeat_penalty/mean": 0.9565514326095581, "rewards/repeat_penalty/std": 0.08521240949630737, "rewards/repeat_floor/mean": 0.9962952136993408, "rewards/repeat_floor/std": 0.005242377519607544, "rewards/near_duplicate_penalty/mean": 0.9878014326095581, "rewards/near_duplicate_penalty/std": 0.017887946218252182, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.29501891136169434, "rewards/total_composite/std": 0.2677532136440277, "reward": 0.29501891136169434, "reward_std": 0.2677531838417053, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13857948780059814, "sampling/sampling_logp_difference/max": 1.079117774963379, "sampling/importance_sampling_ratio/min": 0.36188220977783203, "sampling/importance_sampling_ratio/mean": 1.023341417312622, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6298702880740166, "clip_ratio/low_mean": 0.039922481402754784, "clip_ratio/low_min": 0.039922481402754784, "clip_ratio/high_mean": 0.06304641393944621, "clip_ratio/high_max": 0.06304641393944621, "clip_ratio/region_mean": 0.102968895342201, "reward_total_mean": 0.29501891136169434, "reward_meter_mean": 0.5453200936317444, "reward_meter_std": 0.3683542311191559, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8880355358123779, "reward_lexical_plausibility_std": 0.20765499770641327, "reward_repeat_penalty_mean": 0.9565514326095581, "reward_repeat_penalty_std": 0.08521240949630737, "reward_repeat_floor_mean": 0.9962952136993408, "reward_repeat_floor_std": 0.005242377519607544, "reward_near_duplicate_penalty_mean": 0.9878014326095581, "reward_near_duplicate_penalty_std": 0.017887946218252182, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.34450533986091614, "reward_total_composite_mean": 0.29501891136169434, "reward_total_composite_std": 0.2677532136440277} {"timestamp_utc": "2026-04-12T21:16:20Z", "mode": "train", "global_step": 1391, "epoch": 0.07320667333298247, "loss": -0.0077, "grad_norm": 14.41737174987793, "learning_rate": 5.787878787878788e-06, "num_tokens": 2461631.0, "completions/mean_length": 35.25, "completions/min_length": 31.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.25, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.7549124360084534, "rewards/meter/std": 0.36974912881851196, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.20951901376247406, "rewards/repeat_penalty/mean": 0.9899245500564575, "rewards/repeat_penalty/std": 0.015155394561588764, "rewards/repeat_floor/mean": 0.9984886646270752, "rewards/repeat_floor/std": 0.0022733111400157213, "rewards/near_duplicate_penalty/mean": 0.9899245500564575, "rewards/near_duplicate_penalty/std": 0.015155394561588764, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.39334648847579956, "rewards/total_composite/std": 0.27005499601364136, "reward": 0.39334648847579956, "reward_std": 0.27005499601364136, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14865972101688385, "sampling/sampling_logp_difference/max": 1.7956857681274414, "sampling/importance_sampling_ratio/min": 0.16601356863975525, "sampling/importance_sampling_ratio/mean": 1.0352250337600708, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.225643515586853, "clip_ratio/low_mean": 0.05947580561041832, "clip_ratio/low_min": 0.05947580561041832, "clip_ratio/high_mean": 0.09717901097610593, "clip_ratio/high_max": 0.09717901097610593, "clip_ratio/region_mean": 0.15665481658652425, "reward_total_mean": 0.39334648847579956, "reward_meter_mean": 0.7549124360084534, "reward_meter_std": 0.36974912881851196, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9899245500564575, "reward_repeat_penalty_std": 0.015155394561588764, "reward_repeat_floor_mean": 0.9984886646270752, "reward_repeat_floor_std": 0.0022733111400157213, "reward_near_duplicate_penalty_mean": 0.9899245500564575, "reward_near_duplicate_penalty_std": 0.015155394561588764, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.20951901376247406, "reward_total_composite_mean": 0.39334648847579956, "reward_total_composite_std": 0.27005499601364136} {"timestamp_utc": "2026-04-12T21:16:35Z", "mode": "train", "global_step": 1392, "epoch": 0.07325930214199253, "loss": -0.1069, "grad_norm": 4.598461151123047, "learning_rate": 5.784848484848486e-06, "num_tokens": 2463695.0, "completions/mean_length": 141.0, "completions/min_length": 75.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 88.00000762939453, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 97.0, "rewards/meter/mean": 0.745202898979187, "rewards/meter/std": 0.3547601103782654, "rewards/count_adherence/mean": 0.5833333730697632, "rewards/count_adherence/std": 0.17817416787147522, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.875, "rewards/count_floor/std": 0.05345223844051361, "rewards/lexical_plausibility/mean": 0.935979962348938, "rewards/lexical_plausibility/std": 0.18107600510120392, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9186392426490784, "rewards/repeat_penalty/std": 0.07243224233388901, "rewards/repeat_floor/mean": 0.9918870329856873, "rewards/repeat_floor/std": 0.004103685263544321, "rewards/near_duplicate_penalty/mean": 0.972297191619873, "rewards/near_duplicate_penalty/std": 0.02004527859389782, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9768607020378113, "rewards/distinct_2/std": 0.021140994504094124, "rewards/total_composite/mean": 0.2701265215873718, "rewards/total_composite/std": 0.15338243544101715, "reward": 0.2701265215873718, "reward_std": 0.15338243544101715, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15899266302585602, "sampling/sampling_logp_difference/max": 2.2129554748535156, "sampling/importance_sampling_ratio/min": 0.10937691479921341, "sampling/importance_sampling_ratio/mean": 1.0513575077056885, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3165737092494965, "clip_ratio/low_mean": 0.02946512121707201, "clip_ratio/low_min": 0.02946512121707201, "clip_ratio/high_mean": 0.07904779957607388, "clip_ratio/high_max": 0.07904779957607388, "clip_ratio/region_mean": 0.1085129207931459, "reward_total_mean": 0.2701265215873718, "reward_meter_mean": 0.745202898979187, "reward_meter_std": 0.3547601103782654, "reward_count_adherence_mean": 0.5833333730697632, "reward_count_adherence_std": 0.17817416787147522, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.875, "reward_count_floor_std": 0.05345223844051361, "reward_lexical_plausibility_mean": 0.935979962348938, "reward_lexical_plausibility_std": 0.18107600510120392, "reward_repeat_penalty_mean": 0.9186392426490784, "reward_repeat_penalty_std": 0.07243224233388901, "reward_repeat_floor_mean": 0.9918870329856873, "reward_repeat_floor_std": 0.004103685263544321, "reward_near_duplicate_penalty_mean": 0.972297191619873, "reward_near_duplicate_penalty_std": 0.02004527859389782, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9768607020378113, "reward_distinct_2_std": 0.021140994504094124, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.2701265215873718, "reward_total_composite_std": 0.15338243544101715} {"timestamp_utc": "2026-04-12T21:16:49Z", "mode": "train", "global_step": 1393, "epoch": 0.07331193095100258, "loss": -0.0428, "grad_norm": 4.447368144989014, "learning_rate": 5.781818181818181e-06, "num_tokens": 2465196.0, "completions/mean_length": 100.625, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 41.85714340209961, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.4454975724220276, "rewards/meter/std": 0.3531752824783325, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9515846967697144, "rewards/lexical_plausibility/std": 0.1369391828775406, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.2856946587562561, "rewards/repeat_penalty/mean": 0.8021814823150635, "rewards/repeat_penalty/std": 0.1420968621969223, "rewards/repeat_floor/mean": 0.980101466178894, "rewards/repeat_floor/std": 0.014370224438607693, "rewards/near_duplicate_penalty/mean": 0.953133761882782, "rewards/near_duplicate_penalty/std": 0.04253828153014183, "rewards/opening_diversity/mean": 0.925000011920929, "rewards/opening_diversity/std": 0.11338934302330017, "rewards/distinct_2/mean": 0.9070154428482056, "rewards/distinct_2/std": 0.08476367592811584, "rewards/total_composite/mean": 0.2772789001464844, "rewards/total_composite/std": 0.29282382130622864, "reward": 0.2772789001464844, "reward_std": 0.29282379150390625, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14055874943733215, "sampling/sampling_logp_difference/max": 1.5892038345336914, "sampling/importance_sampling_ratio/min": 0.204088032245636, "sampling/importance_sampling_ratio/mean": 1.0233770608901978, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9646820798516273, "clip_ratio/low_mean": 0.03883565682917833, "clip_ratio/low_min": 0.03883565682917833, "clip_ratio/high_mean": 0.06705451477319002, "clip_ratio/high_max": 0.06705451477319002, "clip_ratio/region_mean": 0.10589017160236835, "reward_total_mean": 0.2772789001464844, "reward_meter_mean": 0.4454975724220276, "reward_meter_std": 0.3531752824783325, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9515846967697144, "reward_lexical_plausibility_std": 0.1369391828775406, "reward_repeat_penalty_mean": 0.8021814823150635, "reward_repeat_penalty_std": 0.1420968621969223, "reward_repeat_floor_mean": 0.980101466178894, "reward_repeat_floor_std": 0.014370224438607693, "reward_near_duplicate_penalty_mean": 0.953133761882782, "reward_near_duplicate_penalty_std": 0.04253828153014183, "reward_opening_diversity_mean": 0.925000011920929, "reward_opening_diversity_std": 0.11338934302330017, "reward_distinct_2_mean": 0.9070154428482056, "reward_distinct_2_std": 0.08476367592811584, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.2856946587562561, "reward_total_composite_mean": 0.2772789001464844, "reward_total_composite_std": 0.29282382130622864} {"timestamp_utc": "2026-04-12T21:16:58Z", "mode": "train", "global_step": 1394, "epoch": 0.07336455976001263, "loss": 0.0387, "grad_norm": 12.977887153625488, "learning_rate": 5.7787878787878795e-06, "num_tokens": 2466842.0, "completions/mean_length": 35.75, "completions/min_length": 33.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.75, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.31210851669311523, "rewards/meter/std": 0.3221641480922699, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.0707106739282608, "rewards/repeat_penalty/mean": 0.7786849737167358, "rewards/repeat_penalty/std": 0.17316633462905884, "rewards/repeat_floor/mean": 0.980579137802124, "rewards/repeat_floor/std": 0.014859617687761784, "rewards/near_duplicate_penalty/mean": 0.9640665054321289, "rewards/near_duplicate_penalty/std": 0.03026820346713066, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9482681155204773, "rewards/distinct_2/std": 0.04287854582071304, "rewards/total_composite/mean": 0.103264719247818, "rewards/total_composite/std": 0.1123870387673378, "reward": 0.103264719247818, "reward_std": 0.1123870462179184, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18829724192619324, "sampling/sampling_logp_difference/max": 1.236257553100586, "sampling/importance_sampling_ratio/min": 0.290469229221344, "sampling/importance_sampling_ratio/mean": 0.9899457097053528, "sampling/importance_sampling_ratio/max": 1.819714903831482, "entropy": 1.378494381904602, "clip_ratio/low_mean": 0.10288808681070805, "clip_ratio/low_min": 0.10288808681070805, "clip_ratio/high_mean": 0.04393939487636089, "clip_ratio/high_max": 0.04393939487636089, "clip_ratio/region_mean": 0.14682748168706894, "reward_total_mean": 0.103264719247818, "reward_meter_mean": 0.31210851669311523, "reward_meter_std": 0.3221641480922699, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.7786849737167358, "reward_repeat_penalty_std": 0.17316633462905884, "reward_repeat_floor_mean": 0.980579137802124, "reward_repeat_floor_std": 0.014859617687761784, "reward_near_duplicate_penalty_mean": 0.9640665054321289, "reward_near_duplicate_penalty_std": 0.03026820346713066, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9482681155204773, "reward_distinct_2_std": 0.04287854582071304, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.0707106739282608, "reward_total_composite_mean": 0.103264719247818, "reward_total_composite_std": 0.1123870387673378} {"timestamp_utc": "2026-04-12T21:17:07Z", "mode": "train", "global_step": 1395, "epoch": 0.07341718856902268, "loss": 0.0203, "grad_norm": 11.854384422302246, "learning_rate": 5.775757575757577e-06, "num_tokens": 2468615.0, "completions/mean_length": 55.625, "completions/min_length": 52.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 55.625, "completions/min_terminated_length": 52.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.7061129808425903, "rewards/meter/std": 0.22467495501041412, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.934695303440094, "rewards/repeat_penalty/std": 0.06023397669196129, "rewards/repeat_floor/mean": 0.9917354583740234, "rewards/repeat_floor/std": 0.007443113252520561, "rewards/near_duplicate_penalty/mean": 0.9630705118179321, "rewards/near_duplicate_penalty/std": 0.03057786077260971, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9697216749191284, "rewards/distinct_2/std": 0.03538288548588753, "rewards/total_composite/mean": 0.26837730407714844, "rewards/total_composite/std": 0.08743525296449661, "reward": 0.26837730407714844, "reward_std": 0.08743525296449661, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16467240452766418, "sampling/sampling_logp_difference/max": 1.2084300518035889, "sampling/importance_sampling_ratio/min": 0.29909101128578186, "sampling/importance_sampling_ratio/mean": 1.03805410861969, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4293698072433472, "clip_ratio/low_mean": 0.06443057395517826, "clip_ratio/low_min": 0.06443057395517826, "clip_ratio/high_mean": 0.07486285362392664, "clip_ratio/high_max": 0.07486285362392664, "clip_ratio/region_mean": 0.1392934275791049, "reward_total_mean": 0.26837730407714844, "reward_meter_mean": 0.7061129808425903, "reward_meter_std": 0.22467495501041412, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.934695303440094, "reward_repeat_penalty_std": 0.06023397669196129, "reward_repeat_floor_mean": 0.9917354583740234, "reward_repeat_floor_std": 0.007443113252520561, "reward_near_duplicate_penalty_mean": 0.9630705118179321, "reward_near_duplicate_penalty_std": 0.03057786077260971, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9697216749191284, "reward_distinct_2_std": 0.03538288548588753, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.26837730407714844, "reward_total_composite_std": 0.08743525296449661} {"timestamp_utc": "2026-04-12T21:17:16Z", "mode": "train", "global_step": 1396, "epoch": 0.07346981737803274, "loss": 0.0021, "grad_norm": 12.468035697937012, "learning_rate": 5.772727272727273e-06, "num_tokens": 2470739.0, "completions/mean_length": 88.5, "completions/min_length": 79.0, "completions/max_length": 101.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 88.5, "completions/min_terminated_length": 79.0, "completions/max_terminated_length": 101.0, "rewards/meter/mean": 0.8280707001686096, "rewards/meter/std": 0.2732466459274292, "rewards/count_adherence/mean": 0.5535714626312256, "rewards/count_adherence/std": 0.05050763860344887, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8660714626312256, "rewards/count_floor/std": 0.015152277424931526, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9188646078109741, "rewards/repeat_penalty/std": 0.063174769282341, "rewards/repeat_floor/mean": 0.9897975921630859, "rewards/repeat_floor/std": 0.007479171734303236, "rewards/near_duplicate_penalty/mean": 0.9554382562637329, "rewards/near_duplicate_penalty/std": 0.027047229930758476, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9609095454216003, "rewards/distinct_2/std": 0.043837759643793106, "rewards/total_composite/mean": 0.26857444643974304, "rewards/total_composite/std": 0.09987671673297882, "reward": 0.26857444643974304, "reward_std": 0.09987672418355942, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18102264404296875, "sampling/sampling_logp_difference/max": 2.163116931915283, "sampling/importance_sampling_ratio/min": 0.11496621370315552, "sampling/importance_sampling_ratio/mean": 1.0297086238861084, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.5483673512935638, "clip_ratio/low_mean": 0.03540109843015671, "clip_ratio/low_min": 0.03540109843015671, "clip_ratio/high_mean": 0.126251928973943, "clip_ratio/high_max": 0.126251928973943, "clip_ratio/region_mean": 0.1616530274040997, "reward_total_mean": 0.26857444643974304, "reward_meter_mean": 0.8280707001686096, "reward_meter_std": 0.2732466459274292, "reward_count_adherence_mean": 0.5535714626312256, "reward_count_adherence_std": 0.05050763860344887, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8660714626312256, "reward_count_floor_std": 0.015152277424931526, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9188646078109741, "reward_repeat_penalty_std": 0.063174769282341, "reward_repeat_floor_mean": 0.9897975921630859, "reward_repeat_floor_std": 0.007479171734303236, "reward_near_duplicate_penalty_mean": 0.9554382562637329, "reward_near_duplicate_penalty_std": 0.027047229930758476, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9609095454216003, "reward_distinct_2_std": 0.043837759643793106, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.26857444643974304, "reward_total_composite_std": 0.09987671673297882} {"timestamp_utc": "2026-04-12T21:17:32Z", "mode": "train", "global_step": 1397, "epoch": 0.07352244618704279, "loss": 0.0148, "grad_norm": 5.432043552398682, "learning_rate": 5.76969696969697e-06, "num_tokens": 2473010.0, "completions/mean_length": 148.875, "completions/min_length": 84.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 97.00000762939453, "completions/min_terminated_length": 84.0, "completions/max_terminated_length": 103.0, "rewards/meter/mean": 0.43902188539505005, "rewards/meter/std": 0.35895174741744995, "rewards/count_adherence/mean": 0.6964285969734192, "rewards/count_adherence/std": 0.05050762742757797, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9089285731315613, "rewards/count_floor/std": 0.015152297914028168, "rewards/lexical_plausibility/mean": 0.9462568759918213, "rewards/lexical_plausibility/std": 0.1520085334777832, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.1035098284482956, "rewards/repeat_penalty/mean": 0.9578856229782104, "rewards/repeat_penalty/std": 0.03811657428741455, "rewards/repeat_floor/mean": 0.9951677918434143, "rewards/repeat_floor/std": 0.004027257207781076, "rewards/near_duplicate_penalty/mean": 0.9835860729217529, "rewards/near_duplicate_penalty/std": 0.009844898246228695, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9736655950546265, "rewards/distinct_2/std": 0.031053410843014717, "rewards/total_composite/mean": 0.13947707414627075, "rewards/total_composite/std": 0.12120145559310913, "reward": 0.13947707414627075, "reward_std": 0.12120144069194794, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1529514491558075, "sampling/sampling_logp_difference/max": 2.056504249572754, "sampling/importance_sampling_ratio/min": 0.12790028750896454, "sampling/importance_sampling_ratio/mean": 1.0159367322921753, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.944608248770237, "clip_ratio/low_mean": 0.06300278846174479, "clip_ratio/low_min": 0.06300278846174479, "clip_ratio/high_mean": 0.07215203810483217, "clip_ratio/high_max": 0.07215203810483217, "clip_ratio/region_mean": 0.13515482656657696, "reward_total_mean": 0.13947707414627075, "reward_meter_mean": 0.43902188539505005, "reward_meter_std": 0.35895174741744995, "reward_count_adherence_mean": 0.6964285969734192, "reward_count_adherence_std": 0.05050762742757797, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9089285731315613, "reward_count_floor_std": 0.015152297914028168, "reward_lexical_plausibility_mean": 0.9462568759918213, "reward_lexical_plausibility_std": 0.1520085334777832, "reward_repeat_penalty_mean": 0.9578856229782104, "reward_repeat_penalty_std": 0.03811657428741455, "reward_repeat_floor_mean": 0.9951677918434143, "reward_repeat_floor_std": 0.004027257207781076, "reward_near_duplicate_penalty_mean": 0.9835860729217529, "reward_near_duplicate_penalty_std": 0.009844898246228695, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9736655950546265, "reward_distinct_2_std": 0.031053410843014717, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.1035098284482956, "reward_total_composite_mean": 0.13947707414627075, "reward_total_composite_std": 0.12120145559310913} {"timestamp_utc": "2026-04-12T21:17:40Z", "mode": "train", "global_step": 1398, "epoch": 0.07357507499605284, "loss": -0.0021, "grad_norm": 13.82620620727539, "learning_rate": 5.766666666666667e-06, "num_tokens": 2474659.0, "completions/mean_length": 46.125, "completions/min_length": 37.0, "completions/max_length": 53.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 46.125, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 53.0, "rewards/meter/mean": 0.6501312851905823, "rewards/meter/std": 0.3600732386112213, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9114729166030884, "rewards/repeat_penalty/std": 0.09514358639717102, "rewards/repeat_floor/mean": 0.989188551902771, "rewards/repeat_floor/std": 0.010733425617218018, "rewards/near_duplicate_penalty/mean": 0.9580814838409424, "rewards/near_duplicate_penalty/std": 0.029647180810570717, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9497377872467041, "rewards/distinct_2/std": 0.07673981040716171, "rewards/total_composite/mean": 0.28176149725914, "rewards/total_composite/std": 0.15719543397426605, "reward": 0.28176149725914, "reward_std": 0.15719541907310486, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11914115399122238, "sampling/sampling_logp_difference/max": 1.2555313110351562, "sampling/importance_sampling_ratio/min": 0.2849244475364685, "sampling/importance_sampling_ratio/mean": 1.006868600845337, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7540392652153969, "clip_ratio/low_mean": 0.06602221913635731, "clip_ratio/low_min": 0.06602221913635731, "clip_ratio/high_mean": 0.09253221191465855, "clip_ratio/high_max": 0.09253221191465855, "clip_ratio/region_mean": 0.15855443105101585, "reward_total_mean": 0.28176149725914, "reward_meter_mean": 0.6501312851905823, "reward_meter_std": 0.3600732386112213, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9114729166030884, "reward_repeat_penalty_std": 0.09514358639717102, "reward_repeat_floor_mean": 0.989188551902771, "reward_repeat_floor_std": 0.010733425617218018, "reward_near_duplicate_penalty_mean": 0.9580814838409424, "reward_near_duplicate_penalty_std": 0.029647180810570717, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9497377872467041, "reward_distinct_2_std": 0.07673981040716171, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.28176149725914, "reward_total_composite_std": 0.15719543397426605} {"timestamp_utc": "2026-04-12T21:17:50Z", "mode": "train", "global_step": 1399, "epoch": 0.0736277038050629, "loss": 0.0243, "grad_norm": 16.468103408813477, "learning_rate": 5.763636363636365e-06, "num_tokens": 2476289.0, "completions/mean_length": 41.75, "completions/min_length": 38.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.75, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.10651238262653351, "rewards/meter/std": 0.14343857765197754, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9478118419647217, "rewards/lexical_plausibility/std": 0.12429578602313995, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9843199253082275, "rewards/repeat_penalty/std": 0.020986884832382202, "rewards/repeat_floor/mean": 0.9976480007171631, "rewards/repeat_floor/std": 0.0031480323523283005, "rewards/near_duplicate_penalty/mean": 0.9843199253082275, "rewards/near_duplicate_penalty/std": 0.020986884832382202, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.03929522633552551, "rewards/total_composite/std": 0.04974899813532829, "reward": 0.03929522633552551, "reward_std": 0.049748994410037994, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1659487932920456, "sampling/sampling_logp_difference/max": 1.5837574005126953, "sampling/importance_sampling_ratio/min": 0.2052026242017746, "sampling/importance_sampling_ratio/mean": 1.0307378768920898, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.280714675784111, "clip_ratio/low_mean": 0.06626155646517873, "clip_ratio/low_min": 0.06626155646517873, "clip_ratio/high_mean": 0.034325397573411465, "clip_ratio/high_max": 0.034325397573411465, "clip_ratio/region_mean": 0.10058695403859019, "reward_total_mean": 0.03929522633552551, "reward_meter_mean": 0.10651238262653351, "reward_meter_std": 0.14343857765197754, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9478118419647217, "reward_lexical_plausibility_std": 0.12429578602313995, "reward_repeat_penalty_mean": 0.9843199253082275, "reward_repeat_penalty_std": 0.020986884832382202, "reward_repeat_floor_mean": 0.9976480007171631, "reward_repeat_floor_std": 0.0031480323523283005, "reward_near_duplicate_penalty_mean": 0.9843199253082275, "reward_near_duplicate_penalty_std": 0.020986884832382202, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.03929522633552551, "reward_total_composite_std": 0.04974899813532829} {"timestamp_utc": "2026-04-12T21:18:05Z", "mode": "train", "global_step": 1400, "epoch": 0.07368033261407295, "loss": -0.0703, "grad_norm": 4.668569564819336, "learning_rate": 5.760606060606061e-06, "num_tokens": 2478639.0, "completions/mean_length": 154.75, "completions/min_length": 89.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 103.71428680419922, "completions/min_terminated_length": 89.0, "completions/max_terminated_length": 116.0, "rewards/meter/mean": 0.29255253076553345, "rewards/meter/std": 0.22243665158748627, "rewards/count_adherence/mean": 0.6428571939468384, "rewards/count_adherence/std": 0.07636035233736038, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8928571343421936, "rewards/count_floor/std": 0.022908121347427368, "rewards/lexical_plausibility/mean": 0.953578770160675, "rewards/lexical_plausibility/std": 0.13129906356334686, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078858494758606, "rewards/repeat_penalty/mean": 0.9560514688491821, "rewards/repeat_penalty/std": 0.07047851383686066, "rewards/repeat_floor/mean": 0.9954732656478882, "rewards/repeat_floor/std": 0.0063373553566634655, "rewards/near_duplicate_penalty/mean": 0.9873337149620056, "rewards/near_duplicate_penalty/std": 0.010340740904211998, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.9791463613510132, "rewards/distinct_2/std": 0.03381364792585373, "rewards/total_composite/mean": 0.09594075381755829, "rewards/total_composite/std": 0.08763573318719864, "reward": 0.09594075381755829, "reward_std": 0.08763572573661804, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11450890451669693, "sampling/sampling_logp_difference/max": 1.700124740600586, "sampling/importance_sampling_ratio/min": 0.18266074359416962, "sampling/importance_sampling_ratio/mean": 1.0187299251556396, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6725115776062012, "clip_ratio/low_mean": 0.05052894912660122, "clip_ratio/low_min": 0.05052894912660122, "clip_ratio/high_mean": 0.04498100187629461, "clip_ratio/high_max": 0.04498100187629461, "clip_ratio/region_mean": 0.09550995100289583, "reward_total_mean": 0.09594075381755829, "reward_meter_mean": 0.29255253076553345, "reward_meter_std": 0.22243665158748627, "reward_count_adherence_mean": 0.6428571939468384, "reward_count_adherence_std": 0.07636035233736038, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8928571343421936, "reward_count_floor_std": 0.022908121347427368, "reward_lexical_plausibility_mean": 0.953578770160675, "reward_lexical_plausibility_std": 0.13129906356334686, "reward_repeat_penalty_mean": 0.9560514688491821, "reward_repeat_penalty_std": 0.07047851383686066, "reward_repeat_floor_mean": 0.9954732656478882, "reward_repeat_floor_std": 0.0063373553566634655, "reward_near_duplicate_penalty_mean": 0.9873337149620056, "reward_near_duplicate_penalty_std": 0.010340740904211998, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.9791463613510132, "reward_distinct_2_std": 0.03381364792585373, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078858494758606, "reward_total_composite_mean": 0.09594075381755829, "reward_total_composite_std": 0.08763573318719864} {"timestamp_utc": "2026-04-12T21:20:35Z", "mode": "eval", "global_step": 1400, "epoch": 0.07368033261407295, "eval_loss": NaN, "eval_runtime": 149.9257, "eval_samples_per_second": 0.694, "eval_steps_per_second": 0.087, "eval_num_tokens": 2478639.0, "eval_completions/mean_length": 186.91346153846155, "eval_completions/min_length": 37.15384615384615, "eval_completions/max_length": 486.46153846153845, "eval_completions/clipped_ratio": 0.2403846153846154, "eval_completions/mean_terminated_length": 85.32271341177133, "eval_completions/min_terminated_length": 37.15384615384615, "eval_completions/max_terminated_length": 158.3846153846154, "eval_rewards/meter/mean": 0.4560626917160474, "eval_rewards/meter/std": 0.3552854909346654, "eval_rewards/count_adherence/mean": 0.6974545808938833, "eval_rewards/count_adherence/std": 0.20306277733582717, "eval_rewards/arabic_clean/mean": 0.7403846153846154, "eval_rewards/arabic_clean/std": 0.43055543074241054, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 1.0, "eval_rewards/arabic_floor/std": 0.0, "eval_rewards/count_floor/mean": 0.9092363806871268, "eval_rewards/count_floor/std": 0.06091883649619726, "eval_rewards/lexical_plausibility/mean": 0.9040030791209295, "eval_rewards/lexical_plausibility/std": 0.1509883015488203, "eval_rewards/judge_quality/mean": 0.3560576851551349, "eval_rewards/judge_quality/std": 0.1958783446596219, "eval_rewards/repeat_penalty/mean": 0.9114883129413311, "eval_rewards/repeat_penalty/std": 0.11260175246458787, "eval_rewards/repeat_floor/mean": 0.9902560802606436, "eval_rewards/repeat_floor/std": 0.011564714404252859, "eval_rewards/near_duplicate_penalty/mean": 0.9695396377490118, "eval_rewards/near_duplicate_penalty/std": 0.031319281014685445, "eval_rewards/opening_diversity/mean": 0.9863149432035593, "eval_rewards/opening_diversity/std": 0.030451504656901725, "eval_rewards/distinct_2/mean": 0.9516249253199651, "eval_rewards/distinct_2/std": 0.07838768153809585, "eval_rewards/total_composite/mean": 0.15268873881835204, "eval_rewards/total_composite/std": 0.15279024638808691, "eval_reward": 0.15268873881835204, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.08628819624965008, "eval_sampling/sampling_logp_difference/max": 0.9887015269352839, "eval_sampling/importance_sampling_ratio/min": 0.3846321117419463, "eval_sampling/importance_sampling_ratio/mean": 1.0270672394679143, "eval_sampling/importance_sampling_ratio/max": 1.5628197284845204, "eval_entropy": 1.0947969326606164, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.15268873881835204, "eval_reward_meter_mean": 0.4560626917160474, "eval_reward_meter_std": 0.3552854909346654, "eval_reward_count_adherence_mean": 0.6974545808938833, "eval_reward_count_adherence_std": 0.20306277733582717, "eval_reward_arabic_clean_mean": 0.7403846153846154, "eval_reward_arabic_clean_std": 0.43055543074241054, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 1.0, "eval_reward_arabic_floor_std": 0.0, "eval_reward_count_floor_mean": 0.9092363806871268, "eval_reward_count_floor_std": 0.06091883649619726, "eval_reward_lexical_plausibility_mean": 0.9040030791209295, "eval_reward_lexical_plausibility_std": 0.1509883015488203, "eval_reward_repeat_penalty_mean": 0.9114883129413311, "eval_reward_repeat_penalty_std": 0.11260175246458787, "eval_reward_repeat_floor_mean": 0.9902560802606436, "eval_reward_repeat_floor_std": 0.011564714404252859, "eval_reward_near_duplicate_penalty_mean": 0.9695396377490118, "eval_reward_near_duplicate_penalty_std": 0.031319281014685445, "eval_reward_opening_diversity_mean": 0.9863149432035593, "eval_reward_opening_diversity_std": 0.030451504656901725, "eval_reward_distinct_2_mean": 0.9516249253199651, "eval_reward_distinct_2_std": 0.07838768153809585, "eval_reward_judge_quality_mean": 0.3560576851551349, "eval_reward_judge_quality_std": 0.1958783446596219, "eval_reward_total_composite_mean": 0.15268873881835204, "eval_reward_total_composite_std": 0.15279024638808691} {"timestamp_utc": "2026-04-12T21:20:54Z", "mode": "train", "global_step": 1401, "epoch": 0.073732961423083, "loss": -0.0081, "grad_norm": 3.8046207427978516, "learning_rate": 5.7575757575757586e-06, "num_tokens": 2479960.0, "completions/mean_length": 81.125, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 19.571430206298828, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.28679224848747253, "rewards/meter/std": 0.369350790977478, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9336142539978027, "rewards/lexical_plausibility/std": 0.16397839784622192, "rewards/judge_quality/mean": 0.41874998807907104, "rewards/judge_quality/std": 0.26040831208229065, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.12404048442840576, "rewards/total_composite/std": 0.16422851383686066, "reward": 0.12404048442840576, "reward_std": 0.16422851383686066, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1284990906715393, "sampling/sampling_logp_difference/max": 1.0953989028930664, "sampling/importance_sampling_ratio/min": 0.33440616726875305, "sampling/importance_sampling_ratio/mean": 1.031387209892273, "sampling/importance_sampling_ratio/max": 1.5019066333770752, "entropy": 1.1772644519805908, "clip_ratio/low_mean": 0.06630117073655128, "clip_ratio/low_min": 0.06630117073655128, "clip_ratio/high_mean": 0.03345588315278292, "clip_ratio/high_max": 0.03345588315278292, "clip_ratio/region_mean": 0.0997570538893342, "reward_total_mean": 0.12404048442840576, "reward_meter_mean": 0.28679224848747253, "reward_meter_std": 0.369350790977478, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9336142539978027, "reward_lexical_plausibility_std": 0.16397839784622192, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.41874998807907104, "reward_judge_quality_std": 0.26040831208229065, "reward_total_composite_mean": 0.12404048442840576, "reward_total_composite_std": 0.16422851383686066} {"timestamp_utc": "2026-04-12T21:21:08Z", "mode": "train", "global_step": 1402, "epoch": 0.07378559023209305, "loss": -0.0321, "grad_norm": 3.853543758392334, "learning_rate": 5.754545454545455e-06, "num_tokens": 2481265.0, "completions/mean_length": 82.125, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.71428680419922, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.6381834745407104, "rewards/meter/std": 0.48102855682373047, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.4629100561141968, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.75, "rewards/hard_gate/std": 0.4629100561141968, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.13887302577495575, "rewards/lexical_plausibility/mean": 0.9355192184448242, "rewards/lexical_plausibility/std": 0.18237926065921783, "rewards/judge_quality/mean": 0.4962499737739563, "rewards/judge_quality/std": 0.38799622654914856, "rewards/repeat_penalty/mean": 0.741767406463623, "rewards/repeat_penalty/std": 0.19237299263477325, "rewards/repeat_floor/mean": 0.977429986000061, "rewards/repeat_floor/std": 0.022154675796628, "rewards/near_duplicate_penalty/mean": 0.9600359797477722, "rewards/near_duplicate_penalty/std": 0.0788830816745758, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9408284425735474, "rewards/distinct_2/std": 0.12651419639587402, "rewards/total_composite/mean": 0.3597506880760193, "rewards/total_composite/std": 0.36664658784866333, "reward": 0.3597506880760193, "reward_std": 0.36664658784866333, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14676345884799957, "sampling/sampling_logp_difference/max": 0.9957623481750488, "sampling/importance_sampling_ratio/min": 0.3694417178630829, "sampling/importance_sampling_ratio/mean": 1.0442439317703247, "sampling/importance_sampling_ratio/max": 1.798816442489624, "entropy": 1.2173472940921783, "clip_ratio/low_mean": 0.03612209111452103, "clip_ratio/low_min": 0.03612209111452103, "clip_ratio/high_mean": 0.04114906908944249, "clip_ratio/high_max": 0.04114906908944249, "clip_ratio/region_mean": 0.07727116020396352, "reward_total_mean": 0.3597506880760193, "reward_meter_mean": 0.6381834745407104, "reward_meter_std": 0.48102855682373047, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.4629100561141968, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.75, "reward_hard_gate_std": 0.4629100561141968, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.13887302577495575, "reward_lexical_plausibility_mean": 0.9355192184448242, "reward_lexical_plausibility_std": 0.18237926065921783, "reward_repeat_penalty_mean": 0.741767406463623, "reward_repeat_penalty_std": 0.19237299263477325, "reward_repeat_floor_mean": 0.977429986000061, "reward_repeat_floor_std": 0.022154675796628, "reward_near_duplicate_penalty_mean": 0.9600359797477722, "reward_near_duplicate_penalty_std": 0.0788830816745758, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9408284425735474, "reward_distinct_2_std": 0.12651419639587402, "reward_judge_quality_mean": 0.4962499737739563, "reward_judge_quality_std": 0.38799622654914856, "reward_total_composite_mean": 0.3597506880760193, "reward_total_composite_std": 0.36664658784866333} {"timestamp_utc": "2026-04-12T21:21:22Z", "mode": "train", "global_step": 1403, "epoch": 0.0738382190411031, "loss": -0.0245, "grad_norm": 2.5551223754882812, "learning_rate": 5.751515151515152e-06, "num_tokens": 2482645.0, "completions/mean_length": 157.5, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 39.333335876464844, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.48084402084350586, "rewards/meter/std": 0.3628159761428833, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8688361048698425, "rewards/lexical_plausibility/std": 0.24340996146202087, "rewards/judge_quality/mean": 0.3787499964237213, "rewards/judge_quality/std": 0.26840469241142273, "rewards/repeat_penalty/mean": 0.9991028308868408, "rewards/repeat_penalty/std": 0.0025374721735715866, "rewards/repeat_floor/mean": 0.9998654127120972, "rewards/repeat_floor/std": 0.000380628218408674, "rewards/near_duplicate_penalty/mean": 0.9991028308868408, "rewards/near_duplicate_penalty/std": 0.0025374721735715866, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14752501249313354, "rewards/total_composite/std": 0.17671120166778564, "reward": 0.14752501249313354, "reward_std": 0.17671118676662445, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14429503679275513, "sampling/sampling_logp_difference/max": 1.2014061212539673, "sampling/importance_sampling_ratio/min": 0.30077099800109863, "sampling/importance_sampling_ratio/mean": 1.0254474878311157, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9729900285601616, "clip_ratio/low_mean": 0.037819070275872946, "clip_ratio/low_min": 0.037819070275872946, "clip_ratio/high_mean": 0.03910875227302313, "clip_ratio/high_max": 0.03910875227302313, "clip_ratio/region_mean": 0.07692782254889607, "reward_total_mean": 0.14752501249313354, "reward_meter_mean": 0.48084402084350586, "reward_meter_std": 0.3628159761428833, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8688361048698425, "reward_lexical_plausibility_std": 0.24340996146202087, "reward_repeat_penalty_mean": 0.9991028308868408, "reward_repeat_penalty_std": 0.0025374721735715866, "reward_repeat_floor_mean": 0.9998654127120972, "reward_repeat_floor_std": 0.000380628218408674, "reward_near_duplicate_penalty_mean": 0.9991028308868408, "reward_near_duplicate_penalty_std": 0.0025374721735715866, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3787499964237213, "reward_judge_quality_std": 0.26840469241142273, "reward_total_composite_mean": 0.14752501249313354, "reward_total_composite_std": 0.17671120166778564} {"timestamp_utc": "2026-04-12T21:21:36Z", "mode": "train", "global_step": 1404, "epoch": 0.07389084785011316, "loss": -0.0233, "grad_norm": 0.686887264251709, "learning_rate": 5.748484848484849e-06, "num_tokens": 2483937.0, "completions/mean_length": 203.5, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 18.399999618530273, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 20.0, "rewards/meter/mean": 0.5003769397735596, "rewards/meter/std": 0.3927370309829712, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.7925765514373779, "rewards/lexical_plausibility/std": 0.2922649383544922, "rewards/judge_quality/mean": 0.33375000953674316, "rewards/judge_quality/std": 0.29587340354919434, "rewards/repeat_penalty/mean": 0.73777174949646, "rewards/repeat_penalty/std": 0.03458673879504204, "rewards/repeat_floor/mean": 0.9825543761253357, "rewards/repeat_floor/std": 0.006917351391166449, "rewards/near_duplicate_penalty/mean": 0.9836956262588501, "rewards/near_duplicate_penalty/std": 0.04611567035317421, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24678762257099152, "rewards/total_composite/std": 0.2963058650493622, "reward": 0.24678762257099152, "reward_std": 0.2963058650493622, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1610114872455597, "sampling/sampling_logp_difference/max": 1.126420021057129, "sampling/importance_sampling_ratio/min": 0.32419177889823914, "sampling/importance_sampling_ratio/mean": 1.0037342309951782, "sampling/importance_sampling_ratio/max": 1.7762905359268188, "entropy": 0.9222633987665176, "clip_ratio/low_mean": 0.05625000223517418, "clip_ratio/low_min": 0.05625000223517418, "clip_ratio/high_mean": 0.07968750037252903, "clip_ratio/high_max": 0.07968750037252903, "clip_ratio/region_mean": 0.1359375026077032, "reward_total_mean": 0.24678762257099152, "reward_meter_mean": 0.5003769397735596, "reward_meter_std": 0.3927370309829712, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.7925765514373779, "reward_lexical_plausibility_std": 0.2922649383544922, "reward_repeat_penalty_mean": 0.73777174949646, "reward_repeat_penalty_std": 0.03458673879504204, "reward_repeat_floor_mean": 0.9825543761253357, "reward_repeat_floor_std": 0.006917351391166449, "reward_near_duplicate_penalty_mean": 0.9836956262588501, "reward_near_duplicate_penalty_std": 0.04611567035317421, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.33375000953674316, "reward_judge_quality_std": 0.29587340354919434, "reward_total_composite_mean": 0.24678762257099152, "reward_total_composite_std": 0.2963058650493622} {"timestamp_utc": "2026-04-12T21:21:51Z", "mode": "train", "global_step": 1405, "epoch": 0.07394347665912321, "loss": -0.0445, "grad_norm": 4.785051345825195, "learning_rate": 5.745454545454546e-06, "num_tokens": 2485551.0, "completions/mean_length": 98.75, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 39.71428680419922, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.5539117455482483, "rewards/meter/std": 0.42445749044418335, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9246437549591064, "rewards/lexical_plausibility/std": 0.17393621802330017, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.1597989797592163, "rewards/repeat_penalty/mean": 0.8558858633041382, "rewards/repeat_penalty/std": 0.15046103298664093, "rewards/repeat_floor/mean": 0.9876335859298706, "rewards/repeat_floor/std": 0.012660117819905281, "rewards/near_duplicate_penalty/mean": 0.9776385426521301, "rewards/near_duplicate_penalty/std": 0.029019419103860855, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9623643755912781, "rewards/distinct_2/std": 0.04035434126853943, "rewards/total_composite/mean": 0.18734672665596008, "rewards/total_composite/std": 0.17887605726718903, "reward": 0.18734672665596008, "reward_std": 0.17887605726718903, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18387193977832794, "sampling/sampling_logp_difference/max": 1.6910743713378906, "sampling/importance_sampling_ratio/min": 0.18432138860225677, "sampling/importance_sampling_ratio/mean": 1.0273374319076538, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2359858304262161, "clip_ratio/low_mean": 0.06231571780517697, "clip_ratio/low_min": 0.06231571780517697, "clip_ratio/high_mean": 0.06808288767933846, "clip_ratio/high_max": 0.06808288767933846, "clip_ratio/region_mean": 0.13039860548451543, "reward_total_mean": 0.18734672665596008, "reward_meter_mean": 0.5539117455482483, "reward_meter_std": 0.42445749044418335, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9246437549591064, "reward_lexical_plausibility_std": 0.17393621802330017, "reward_repeat_penalty_mean": 0.8558858633041382, "reward_repeat_penalty_std": 0.15046103298664093, "reward_repeat_floor_mean": 0.9876335859298706, "reward_repeat_floor_std": 0.012660117819905281, "reward_near_duplicate_penalty_mean": 0.9776385426521301, "reward_near_duplicate_penalty_std": 0.029019419103860855, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9623643755912781, "reward_distinct_2_std": 0.04035434126853943, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.1597989797592163, "reward_total_composite_mean": 0.18734672665596008, "reward_total_composite_std": 0.17887605726718903} {"timestamp_utc": "2026-04-12T21:22:00Z", "mode": "train", "global_step": 1406, "epoch": 0.07399610546813326, "loss": 0.0912, "grad_norm": 10.590453147888184, "learning_rate": 5.742424242424242e-06, "num_tokens": 2487653.0, "completions/mean_length": 80.75, "completions/min_length": 70.0, "completions/max_length": 93.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 80.75, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 93.0, "rewards/meter/mean": 0.12493743002414703, "rewards/meter/std": 0.10775718837976456, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9625000357627869, "rewards/count_floor/std": 0.031052952632308006, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4999999701976776, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.9810932874679565, "rewards/repeat_penalty/std": 0.016915034502744675, "rewards/repeat_floor/mean": 0.9974523782730103, "rewards/repeat_floor/std": 0.0017508569872006774, "rewards/near_duplicate_penalty/mean": 0.9860525131225586, "rewards/near_duplicate_penalty/std": 0.0044753397814929485, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9949392676353455, "rewards/distinct_2/std": 0.014313912950456142, "rewards/total_composite/mean": 0.05946630612015724, "rewards/total_composite/std": 0.0506991371512413, "reward": 0.05946630612015724, "reward_std": 0.050699133425951004, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1436416506767273, "sampling/sampling_logp_difference/max": 2.2766549587249756, "sampling/importance_sampling_ratio/min": 0.10262692719697952, "sampling/importance_sampling_ratio/mean": 1.0181658267974854, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7794519662857056, "clip_ratio/low_mean": 0.07820118963718414, "clip_ratio/low_min": 0.07820118963718414, "clip_ratio/high_mean": 0.05505612678825855, "clip_ratio/high_max": 0.05505612678825855, "clip_ratio/region_mean": 0.1332573164254427, "reward_total_mean": 0.05946630612015724, "reward_meter_mean": 0.12493743002414703, "reward_meter_std": 0.10775718837976456, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9625000357627869, "reward_count_floor_std": 0.031052952632308006, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9810932874679565, "reward_repeat_penalty_std": 0.016915034502744675, "reward_repeat_floor_mean": 0.9974523782730103, "reward_repeat_floor_std": 0.0017508569872006774, "reward_near_duplicate_penalty_mean": 0.9860525131225586, "reward_near_duplicate_penalty_std": 0.0044753397814929485, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9949392676353455, "reward_distinct_2_std": 0.014313912950456142, "reward_judge_quality_mean": 0.4999999701976776, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.05946630612015724, "reward_total_composite_std": 0.0506991371512413} {"timestamp_utc": "2026-04-12T21:22:15Z", "mode": "train", "global_step": 1407, "epoch": 0.07404873427714331, "loss": -0.0098, "grad_norm": 5.847170352935791, "learning_rate": 5.73939393939394e-06, "num_tokens": 2489642.0, "completions/mean_length": 134.625, "completions/min_length": 69.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 80.71428680419922, "completions/min_terminated_length": 69.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.2960163950920105, "rewards/meter/std": 0.3309500813484192, "rewards/count_adherence/mean": 0.7708333730697632, "rewards/count_adherence/std": 0.0862581729888916, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9312499761581421, "rewards/count_floor/std": 0.025877466425299644, "rewards/lexical_plausibility/mean": 0.9628743529319763, "rewards/lexical_plausibility/std": 0.10500723123550415, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.16903084516525269, "rewards/repeat_penalty/mean": 0.9943349361419678, "rewards/repeat_penalty/std": 0.0050043282099068165, "rewards/repeat_floor/mean": 0.999150276184082, "rewards/repeat_floor/std": 0.0007506543770432472, "rewards/near_duplicate_penalty/mean": 0.9943349361419678, "rewards/near_duplicate_penalty/std": 0.0050043282099068165, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.08322226256132126, "rewards/total_composite/std": 0.1092400848865509, "reward": 0.08322226256132126, "reward_std": 0.1092400774359703, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14656026661396027, "sampling/sampling_logp_difference/max": 1.395003318786621, "sampling/importance_sampling_ratio/min": 0.24783220887184143, "sampling/importance_sampling_ratio/mean": 1.022430658340454, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0365147441625595, "clip_ratio/low_mean": 0.04992985911667347, "clip_ratio/low_min": 0.04992985911667347, "clip_ratio/high_mean": 0.08346572518348694, "clip_ratio/high_max": 0.08346572518348694, "clip_ratio/region_mean": 0.1333955843001604, "reward_total_mean": 0.08322226256132126, "reward_meter_mean": 0.2960163950920105, "reward_meter_std": 0.3309500813484192, "reward_count_adherence_mean": 0.7708333730697632, "reward_count_adherence_std": 0.0862581729888916, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9312499761581421, "reward_count_floor_std": 0.025877466425299644, "reward_lexical_plausibility_mean": 0.9628743529319763, "reward_lexical_plausibility_std": 0.10500723123550415, "reward_repeat_penalty_mean": 0.9943349361419678, "reward_repeat_penalty_std": 0.0050043282099068165, "reward_repeat_floor_mean": 0.999150276184082, "reward_repeat_floor_std": 0.0007506543770432472, "reward_near_duplicate_penalty_mean": 0.9943349361419678, "reward_near_duplicate_penalty_std": 0.0050043282099068165, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.16903084516525269, "reward_total_composite_mean": 0.08322226256132126, "reward_total_composite_std": 0.1092400848865509} {"timestamp_utc": "2026-04-12T21:22:26Z", "mode": "train", "global_step": 1408, "epoch": 0.07410136308615337, "loss": -0.0124, "grad_norm": 12.23988151550293, "learning_rate": 5.736363636363637e-06, "num_tokens": 2491438.0, "completions/mean_length": 51.5, "completions/min_length": 45.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.5, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.7885805368423462, "rewards/meter/std": 0.2926645278930664, "rewards/count_adherence/mean": 0.7083333730697632, "rewards/count_adherence/std": 0.11785111576318741, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9124999642372131, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4662500023841858, "rewards/judge_quality/std": 0.17435084283351898, "rewards/repeat_penalty/mean": 0.7986570596694946, "rewards/repeat_penalty/std": 0.12854698300361633, "rewards/repeat_floor/mean": 0.977705180644989, "rewards/repeat_floor/std": 0.012192374095320702, "rewards/near_duplicate_penalty/mean": 0.9311705827713013, "rewards/near_duplicate_penalty/std": 0.022871362045407295, "rewards/opening_diversity/mean": 0.9437500238418579, "rewards/opening_diversity/std": 0.09038607776165009, "rewards/distinct_2/mean": 0.904495120048523, "rewards/distinct_2/std": 0.06510571390390396, "rewards/total_composite/mean": 0.29079192876815796, "rewards/total_composite/std": 0.08249565213918686, "reward": 0.29079192876815796, "reward_std": 0.08249565213918686, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17599311470985413, "sampling/sampling_logp_difference/max": 2.4814858436584473, "sampling/importance_sampling_ratio/min": 0.0836188867688179, "sampling/importance_sampling_ratio/mean": 1.0232452154159546, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4229249060153961, "clip_ratio/low_mean": 0.02803983259946108, "clip_ratio/low_min": 0.02803983259946108, "clip_ratio/high_mean": 0.11394911538809538, "clip_ratio/high_max": 0.11394911538809538, "clip_ratio/region_mean": 0.14198894798755646, "reward_total_mean": 0.29079192876815796, "reward_meter_mean": 0.7885805368423462, "reward_meter_std": 0.2926645278930664, "reward_count_adherence_mean": 0.7083333730697632, "reward_count_adherence_std": 0.11785111576318741, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9124999642372131, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7986570596694946, "reward_repeat_penalty_std": 0.12854698300361633, "reward_repeat_floor_mean": 0.977705180644989, "reward_repeat_floor_std": 0.012192374095320702, "reward_near_duplicate_penalty_mean": 0.9311705827713013, "reward_near_duplicate_penalty_std": 0.022871362045407295, "reward_opening_diversity_mean": 0.9437500238418579, "reward_opening_diversity_std": 0.09038607776165009, "reward_distinct_2_mean": 0.904495120048523, "reward_distinct_2_std": 0.06510571390390396, "reward_judge_quality_mean": 0.4662500023841858, "reward_judge_quality_std": 0.17435084283351898, "reward_total_composite_mean": 0.29079192876815796, "reward_total_composite_std": 0.08249565213918686} {"timestamp_utc": "2026-04-12T21:22:40Z", "mode": "train", "global_step": 1409, "epoch": 0.07415399189516342, "loss": -0.0446, "grad_norm": 2.180145263671875, "learning_rate": 5.733333333333334e-06, "num_tokens": 2492975.0, "completions/mean_length": 229.125, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 59.400001525878906, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.17504672706127167, "rewards/meter/std": 0.3301781415939331, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.0707106739282608, "rewards/lexical_plausibility/mean": 0.8438267111778259, "rewards/lexical_plausibility/std": 0.22010590136051178, "rewards/judge_quality/mean": 0.17500001192092896, "rewards/judge_quality/std": 0.14880475401878357, "rewards/repeat_penalty/mean": 0.8769052028656006, "rewards/repeat_penalty/std": 0.14940084517002106, "rewards/repeat_floor/mean": 0.9878734946250916, "rewards/repeat_floor/std": 0.014392049983143806, "rewards/near_duplicate_penalty/mean": 0.9670385122299194, "rewards/near_duplicate_penalty/std": 0.034258898347616196, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.96186363697052, "rewards/distinct_2/std": 0.05792667344212532, "rewards/total_composite/mean": 0.05738497152924538, "rewards/total_composite/std": 0.11863113194704056, "reward": 0.05738497152924538, "reward_std": 0.11863112449645996, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1607528030872345, "sampling/sampling_logp_difference/max": 1.4583063125610352, "sampling/importance_sampling_ratio/min": 0.2326299548149109, "sampling/importance_sampling_ratio/mean": 1.0338927507400513, "sampling/importance_sampling_ratio/max": 1.8721318244934082, "entropy": 1.2141825556755066, "clip_ratio/low_mean": 0.04575598519295454, "clip_ratio/low_min": 0.04575598519295454, "clip_ratio/high_mean": 0.051229506731033325, "clip_ratio/high_max": 0.051229506731033325, "clip_ratio/region_mean": 0.09698549192398787, "reward_total_mean": 0.05738497152924538, "reward_meter_mean": 0.17504672706127167, "reward_meter_std": 0.3301781415939331, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.0707106739282608, "reward_lexical_plausibility_mean": 0.8438267111778259, "reward_lexical_plausibility_std": 0.22010590136051178, "reward_repeat_penalty_mean": 0.8769052028656006, "reward_repeat_penalty_std": 0.14940084517002106, "reward_repeat_floor_mean": 0.9878734946250916, "reward_repeat_floor_std": 0.014392049983143806, "reward_near_duplicate_penalty_mean": 0.9670385122299194, "reward_near_duplicate_penalty_std": 0.034258898347616196, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.96186363697052, "reward_distinct_2_std": 0.05792667344212532, "reward_judge_quality_mean": 0.17500001192092896, "reward_judge_quality_std": 0.14880475401878357, "reward_total_composite_mean": 0.05738497152924538, "reward_total_composite_std": 0.11863113194704056} {"timestamp_utc": "2026-04-12T21:22:55Z", "mode": "train", "global_step": 1410, "epoch": 0.07420662070417347, "loss": -0.1162, "grad_norm": 4.727728366851807, "learning_rate": 5.7303030303030305e-06, "num_tokens": 2495150.0, "completions/mean_length": 136.875, "completions/min_length": 66.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 83.28572082519531, "completions/min_terminated_length": 66.0, "completions/max_terminated_length": 100.0, "rewards/meter/mean": 0.7368236184120178, "rewards/meter/std": 0.29515108466148376, "rewards/count_adherence/mean": 0.6750000715255737, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9024999737739563, "rewards/count_floor/std": 0.031052952632308006, "rewards/lexical_plausibility/mean": 0.9466106295585632, "rewards/lexical_plausibility/std": 0.13613402843475342, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.1060660108923912, "rewards/repeat_penalty/mean": 0.9404205083847046, "rewards/repeat_penalty/std": 0.06177308410406113, "rewards/repeat_floor/mean": 0.9935632348060608, "rewards/repeat_floor/std": 0.006866373121738434, "rewards/near_duplicate_penalty/mean": 0.9842514991760254, "rewards/near_duplicate_penalty/std": 0.019076792523264885, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9547277092933655, "rewards/distinct_2/std": 0.04511205852031708, "rewards/total_composite/mean": 0.21358276903629303, "rewards/total_composite/std": 0.11908823996782303, "reward": 0.21358276903629303, "reward_std": 0.11908823251724243, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15063251554965973, "sampling/sampling_logp_difference/max": 2.350043296813965, "sampling/importance_sampling_ratio/min": 0.09536503255367279, "sampling/importance_sampling_ratio/mean": 1.018662452697754, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9848711788654327, "clip_ratio/low_mean": 0.033502329140901566, "clip_ratio/low_min": 0.033502329140901566, "clip_ratio/high_mean": 0.10390935186296701, "clip_ratio/high_max": 0.10390935186296701, "clip_ratio/region_mean": 0.13741168100386858, "reward_total_mean": 0.21358276903629303, "reward_meter_mean": 0.7368236184120178, "reward_meter_std": 0.29515108466148376, "reward_count_adherence_mean": 0.6750000715255737, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9024999737739563, "reward_count_floor_std": 0.031052952632308006, "reward_lexical_plausibility_mean": 0.9466106295585632, "reward_lexical_plausibility_std": 0.13613402843475342, "reward_repeat_penalty_mean": 0.9404205083847046, "reward_repeat_penalty_std": 0.06177308410406113, "reward_repeat_floor_mean": 0.9935632348060608, "reward_repeat_floor_std": 0.006866373121738434, "reward_near_duplicate_penalty_mean": 0.9842514991760254, "reward_near_duplicate_penalty_std": 0.019076792523264885, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9547277092933655, "reward_distinct_2_std": 0.04511205852031708, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.1060660108923912, "reward_total_composite_mean": 0.21358276903629303, "reward_total_composite_std": 0.11908823996782303} {"timestamp_utc": "2026-04-12T21:23:12Z", "mode": "train", "global_step": 1411, "epoch": 0.07425924951318352, "loss": -0.0877, "grad_norm": 2.2400755882263184, "learning_rate": 5.727272727272728e-06, "num_tokens": 2496904.0, "completions/mean_length": 232.25, "completions/min_length": 54.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 64.4000015258789, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 79.0, "rewards/meter/mean": 0.49991118907928467, "rewards/meter/std": 0.357992023229599, "rewards/count_adherence/mean": 0.78125, "rewards/count_adherence/std": 0.1602174937725067, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9343750476837158, "rewards/count_floor/std": 0.04806523770093918, "rewards/lexical_plausibility/mean": 0.8410376310348511, "rewards/lexical_plausibility/std": 0.21619945764541626, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.16903086006641388, "rewards/repeat_penalty/mean": 0.9938429594039917, "rewards/repeat_penalty/std": 0.006350129842758179, "rewards/repeat_floor/mean": 0.9990764260292053, "rewards/repeat_floor/std": 0.00095252605387941, "rewards/near_duplicate_penalty/mean": 0.9938429594039917, "rewards/near_duplicate_penalty/std": 0.006350129842758179, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.14490261673927307, "rewards/total_composite/std": 0.1520993560552597, "reward": 0.14490261673927307, "reward_std": 0.1520993709564209, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1719357967376709, "sampling/sampling_logp_difference/max": 1.1508255004882812, "sampling/importance_sampling_ratio/min": 0.3163754940032959, "sampling/importance_sampling_ratio/mean": 1.0270270109176636, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1170873790979385, "clip_ratio/low_mean": 0.009765625, "clip_ratio/low_min": 0.009765625, "clip_ratio/high_mean": 0.08834995981305838, "clip_ratio/high_max": 0.08834995981305838, "clip_ratio/region_mean": 0.09811558481305838, "reward_total_mean": 0.14490261673927307, "reward_meter_mean": 0.49991118907928467, "reward_meter_std": 0.357992023229599, "reward_count_adherence_mean": 0.78125, "reward_count_adherence_std": 0.1602174937725067, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9343750476837158, "reward_count_floor_std": 0.04806523770093918, "reward_lexical_plausibility_mean": 0.8410376310348511, "reward_lexical_plausibility_std": 0.21619945764541626, "reward_repeat_penalty_mean": 0.9938429594039917, "reward_repeat_penalty_std": 0.006350129842758179, "reward_repeat_floor_mean": 0.9990764260292053, "reward_repeat_floor_std": 0.00095252605387941, "reward_near_duplicate_penalty_mean": 0.9938429594039917, "reward_near_duplicate_penalty_std": 0.006350129842758179, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.16903086006641388, "reward_total_composite_mean": 0.14490261673927307, "reward_total_composite_std": 0.1520993560552597} {"timestamp_utc": "2026-04-12T21:23:21Z", "mode": "train", "global_step": 1412, "epoch": 0.07431187832219358, "loss": 0.0286, "grad_norm": 12.705042839050293, "learning_rate": 5.724242424242424e-06, "num_tokens": 2498389.0, "completions/mean_length": 33.625, "completions/min_length": 30.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.625, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.7463754415512085, "rewards/meter/std": 0.30197617411613464, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4624999761581421, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.9858032464981079, "rewards/repeat_penalty/std": 0.014091964811086655, "rewards/repeat_floor/mean": 0.9978704452514648, "rewards/repeat_floor/std": 0.0021138025913387537, "rewards/near_duplicate_penalty/mean": 0.9858032464981079, "rewards/near_duplicate_penalty/std": 0.014091964811086655, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3601909279823303, "rewards/total_composite/std": 0.18580298125743866, "reward": 0.3601909279823303, "reward_std": 0.18580298125743866, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15604948997497559, "sampling/sampling_logp_difference/max": 1.7259682416915894, "sampling/importance_sampling_ratio/min": 0.17800061404705048, "sampling/importance_sampling_ratio/mean": 1.0356197357177734, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.4667446464300156, "clip_ratio/low_mean": 0.06213459558784962, "clip_ratio/low_min": 0.06213459558784962, "clip_ratio/high_mean": 0.07902002241462469, "clip_ratio/high_max": 0.07902002241462469, "clip_ratio/region_mean": 0.1411546180024743, "reward_total_mean": 0.3601909279823303, "reward_meter_mean": 0.7463754415512085, "reward_meter_std": 0.30197617411613464, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9858032464981079, "reward_repeat_penalty_std": 0.014091964811086655, "reward_repeat_floor_mean": 0.9978704452514648, "reward_repeat_floor_std": 0.0021138025913387537, "reward_near_duplicate_penalty_mean": 0.9858032464981079, "reward_near_duplicate_penalty_std": 0.014091964811086655, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4624999761581421, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.3601909279823303, "reward_total_composite_std": 0.18580298125743866} {"timestamp_utc": "2026-04-12T21:23:30Z", "mode": "train", "global_step": 1413, "epoch": 0.07436450713120363, "loss": 0.0188, "grad_norm": 16.99075698852539, "learning_rate": 5.721212121212122e-06, "num_tokens": 2499900.0, "completions/mean_length": 19.875, "completions/min_length": 16.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.875, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.6092807054519653, "rewards/meter/std": 0.48635751008987427, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.7100000381469727, "rewards/judge_quality/std": 0.3123185336589813, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4129544496536255, "rewards/total_composite/std": 0.42000505328178406, "reward": 0.4129544496536255, "reward_std": 0.42000505328178406, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1676495373249054, "sampling/sampling_logp_difference/max": 1.0294160842895508, "sampling/importance_sampling_ratio/min": 0.3572154939174652, "sampling/importance_sampling_ratio/mean": 1.055390477180481, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.585373617708683, "clip_ratio/low_mean": 0.07655888330191374, "clip_ratio/low_min": 0.07655888330191374, "clip_ratio/high_mean": 0.08583960123360157, "clip_ratio/high_max": 0.08583960123360157, "clip_ratio/region_mean": 0.1623984845355153, "reward_total_mean": 0.4129544496536255, "reward_meter_mean": 0.6092807054519653, "reward_meter_std": 0.48635751008987427, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.7100000381469727, "reward_judge_quality_std": 0.3123185336589813, "reward_total_composite_mean": 0.4129544496536255, "reward_total_composite_std": 0.42000505328178406} {"timestamp_utc": "2026-04-12T21:23:39Z", "mode": "train", "global_step": 1414, "epoch": 0.07441713594021367, "loss": -0.0018, "grad_norm": 11.382184982299805, "learning_rate": 5.718181818181819e-06, "num_tokens": 2501765.0, "completions/mean_length": 60.125, "completions/min_length": 39.0, "completions/max_length": 68.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.125, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.761445164680481, "rewards/meter/std": 0.3242763578891754, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44624999165534973, "rewards/judge_quality/std": 0.19668231904506683, "rewards/repeat_penalty/mean": 0.9319169521331787, "rewards/repeat_penalty/std": 0.06158699095249176, "rewards/repeat_floor/mean": 0.9922173619270325, "rewards/repeat_floor/std": 0.00667576864361763, "rewards/near_duplicate_penalty/mean": 0.9745862483978271, "rewards/near_duplicate_penalty/std": 0.023200392723083496, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9558823108673096, "rewards/distinct_2/std": 0.052539508789777756, "rewards/total_composite/mean": 0.3547138571739197, "rewards/total_composite/std": 0.26118040084838867, "reward": 0.3547138571739197, "reward_std": 0.26118040084838867, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15082022547721863, "sampling/sampling_logp_difference/max": 1.1497068405151367, "sampling/importance_sampling_ratio/min": 0.3167296051979065, "sampling/importance_sampling_ratio/mean": 1.0293949842453003, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.437969148159027, "clip_ratio/low_mean": 0.06293540028855205, "clip_ratio/low_min": 0.06293540028855205, "clip_ratio/high_mean": 0.04487109184265137, "clip_ratio/high_max": 0.04487109184265137, "clip_ratio/region_mean": 0.10780649213120341, "reward_total_mean": 0.3547138571739197, "reward_meter_mean": 0.761445164680481, "reward_meter_std": 0.3242763578891754, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9319169521331787, "reward_repeat_penalty_std": 0.06158699095249176, "reward_repeat_floor_mean": 0.9922173619270325, "reward_repeat_floor_std": 0.00667576864361763, "reward_near_duplicate_penalty_mean": 0.9745862483978271, "reward_near_duplicate_penalty_std": 0.023200392723083496, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9558823108673096, "reward_distinct_2_std": 0.052539508789777756, "reward_judge_quality_mean": 0.44624999165534973, "reward_judge_quality_std": 0.19668231904506683, "reward_total_composite_mean": 0.3547138571739197, "reward_total_composite_std": 0.26118040084838867} {"timestamp_utc": "2026-04-12T21:23:49Z", "mode": "train", "global_step": 1415, "epoch": 0.07446976474922372, "loss": 0.0526, "grad_norm": 10.996042251586914, "learning_rate": 5.715151515151516e-06, "num_tokens": 2503788.0, "completions/mean_length": 75.875, "completions/min_length": 67.0, "completions/max_length": 101.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 75.875, "completions/min_terminated_length": 67.0, "completions/max_terminated_length": 101.0, "rewards/meter/mean": 0.865246593952179, "rewards/meter/std": 0.24865683913230896, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9665993452072144, "rewards/repeat_penalty/std": 0.03361032158136368, "rewards/repeat_floor/mean": 0.9959484338760376, "rewards/repeat_floor/std": 0.003226237604394555, "rewards/near_duplicate_penalty/mean": 0.9829816818237305, "rewards/near_duplicate_penalty/std": 0.008810799568891525, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9833458662033081, "rewards/distinct_2/std": 0.03337503597140312, "rewards/total_composite/mean": 0.3502022922039032, "rewards/total_composite/std": 0.09896644204854965, "reward": 0.3502022922039032, "reward_std": 0.09896643459796906, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13796325027942657, "sampling/sampling_logp_difference/max": 1.9771487712860107, "sampling/importance_sampling_ratio/min": 0.13846345245838165, "sampling/importance_sampling_ratio/mean": 1.027772307395935, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1937409937381744, "clip_ratio/low_mean": 0.012345679104328156, "clip_ratio/low_min": 0.012345679104328156, "clip_ratio/high_mean": 0.10648495145142078, "clip_ratio/high_max": 0.10648495145142078, "clip_ratio/region_mean": 0.11883063055574894, "reward_total_mean": 0.3502022922039032, "reward_meter_mean": 0.865246593952179, "reward_meter_std": 0.24865683913230896, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9665993452072144, "reward_repeat_penalty_std": 0.03361032158136368, "reward_repeat_floor_mean": 0.9959484338760376, "reward_repeat_floor_std": 0.003226237604394555, "reward_near_duplicate_penalty_mean": 0.9829816818237305, "reward_near_duplicate_penalty_std": 0.008810799568891525, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9833458662033081, "reward_distinct_2_std": 0.03337503597140312, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.3502022922039032, "reward_total_composite_std": 0.09896644204854965} {"timestamp_utc": "2026-04-12T21:24:11Z", "mode": "train", "global_step": 1416, "epoch": 0.07452239355823377, "loss": -0.0741, "grad_norm": 5.223179340362549, "learning_rate": 5.712121212121212e-06, "num_tokens": 2505517.0, "completions/mean_length": 109.125, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 51.57143020629883, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.44829630851745605, "rewards/meter/std": 0.4435102045536041, "rewards/count_adherence/mean": 0.8333333730697632, "rewards/count_adherence/std": 0.17817415297031403, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0534522607922554, "rewards/lexical_plausibility/mean": 0.9490580558776855, "rewards/lexical_plausibility/std": 0.14408555626869202, "rewards/judge_quality/mean": 0.4087499976158142, "rewards/judge_quality/std": 0.258370578289032, "rewards/repeat_penalty/mean": 0.9909513592720032, "rewards/repeat_penalty/std": 0.016185717657208443, "rewards/repeat_floor/mean": 0.9986426830291748, "rewards/repeat_floor/std": 0.0024278489872813225, "rewards/near_duplicate_penalty/mean": 0.9909513592720032, "rewards/near_duplicate_penalty/std": 0.016185717657208443, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.1802024096250534, "rewards/total_composite/std": 0.1855441778898239, "reward": 0.1802024096250534, "reward_std": 0.18554414808750153, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16368629038333893, "sampling/sampling_logp_difference/max": 3.311824083328247, "sampling/importance_sampling_ratio/min": 0.036449626088142395, "sampling/importance_sampling_ratio/mean": 1.0357638597488403, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.105742834508419, "clip_ratio/low_mean": 0.07330342661589384, "clip_ratio/low_min": 0.07330342661589384, "clip_ratio/high_mean": 0.05628856550902128, "clip_ratio/high_max": 0.05628856550902128, "clip_ratio/region_mean": 0.12959199212491512, "reward_total_mean": 0.1802024096250534, "reward_meter_mean": 0.44829630851745605, "reward_meter_std": 0.4435102045536041, "reward_count_adherence_mean": 0.8333333730697632, "reward_count_adherence_std": 0.17817415297031403, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0534522607922554, "reward_lexical_plausibility_mean": 0.9490580558776855, "reward_lexical_plausibility_std": 0.14408555626869202, "reward_repeat_penalty_mean": 0.9909513592720032, "reward_repeat_penalty_std": 0.016185717657208443, "reward_repeat_floor_mean": 0.9986426830291748, "reward_repeat_floor_std": 0.0024278489872813225, "reward_near_duplicate_penalty_mean": 0.9909513592720032, "reward_near_duplicate_penalty_std": 0.016185717657208443, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4087499976158142, "reward_judge_quality_std": 0.258370578289032, "reward_total_composite_mean": 0.1802024096250534, "reward_total_composite_std": 0.1855441778898239} {"timestamp_utc": "2026-04-12T21:24:25Z", "mode": "train", "global_step": 1417, "epoch": 0.07457502236724382, "loss": -0.0832, "grad_norm": 2.090524435043335, "learning_rate": 5.7090909090909096e-06, "num_tokens": 2507170.0, "completions/mean_length": 226.625, "completions/min_length": 39.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 55.400001525878906, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 65.0, "rewards/meter/mean": 0.7362270355224609, "rewards/meter/std": 0.3507269322872162, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.24800792336463928, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.07440238445997238, "rewards/lexical_plausibility/mean": 0.8188418745994568, "rewards/lexical_plausibility/std": 0.25061509013175964, "rewards/judge_quality/mean": 0.25, "rewards/judge_quality/std": 0.1927248239517212, "rewards/repeat_penalty/mean": 0.917361855506897, "rewards/repeat_penalty/std": 0.07393814623355865, "rewards/repeat_floor/mean": 0.9913511276245117, "rewards/repeat_floor/std": 0.0043833497911691666, "rewards/near_duplicate_penalty/mean": 0.9649782776832581, "rewards/near_duplicate_penalty/std": 0.025960108265280724, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9831043481826782, "rewards/distinct_2/std": 0.029155395925045013, "rewards/total_composite/mean": 0.20332878828048706, "rewards/total_composite/std": 0.19292476773262024, "reward": 0.20332878828048706, "reward_std": 0.19292476773262024, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20183491706848145, "sampling/sampling_logp_difference/max": 1.5915579795837402, "sampling/importance_sampling_ratio/min": 0.20360814034938812, "sampling/importance_sampling_ratio/mean": 1.0448663234710693, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0840475112199783, "clip_ratio/low_mean": 0.0438209343701601, "clip_ratio/low_min": 0.0438209343701601, "clip_ratio/high_mean": 0.06816853396594524, "clip_ratio/high_max": 0.06816853396594524, "clip_ratio/region_mean": 0.11198946833610535, "reward_total_mean": 0.20332878828048706, "reward_meter_mean": 0.7362270355224609, "reward_meter_std": 0.3507269322872162, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.24800792336463928, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.07440238445997238, "reward_lexical_plausibility_mean": 0.8188418745994568, "reward_lexical_plausibility_std": 0.25061509013175964, "reward_repeat_penalty_mean": 0.917361855506897, "reward_repeat_penalty_std": 0.07393814623355865, "reward_repeat_floor_mean": 0.9913511276245117, "reward_repeat_floor_std": 0.0043833497911691666, "reward_near_duplicate_penalty_mean": 0.9649782776832581, "reward_near_duplicate_penalty_std": 0.025960108265280724, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9831043481826782, "reward_distinct_2_std": 0.029155395925045013, "reward_judge_quality_mean": 0.25, "reward_judge_quality_std": 0.1927248239517212, "reward_total_composite_mean": 0.20332878828048706, "reward_total_composite_std": 0.19292476773262024} {"timestamp_utc": "2026-04-12T21:24:38Z", "mode": "train", "global_step": 1418, "epoch": 0.07462765117625388, "loss": -0.1125, "grad_norm": 2.6924631595611572, "learning_rate": 5.706060606060606e-06, "num_tokens": 2509161.0, "completions/mean_length": 179.875, "completions/min_length": 61.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 69.16667175292969, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.7423150539398193, "rewards/meter/std": 0.3726646900177002, "rewards/count_adherence/mean": 0.6000000238418579, "rewards/count_adherence/std": 0.10690449923276901, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.8799999952316284, "rewards/count_floor/std": 0.03207135200500488, "rewards/lexical_plausibility/mean": 0.8673089742660522, "rewards/lexical_plausibility/std": 0.2240522801876068, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.16690459847450256, "rewards/repeat_penalty/mean": 0.9715592861175537, "rewards/repeat_penalty/std": 0.03581685945391655, "rewards/repeat_floor/mean": 0.9962940216064453, "rewards/repeat_floor/std": 0.003976048436015844, "rewards/near_duplicate_penalty/mean": 0.981366753578186, "rewards/near_duplicate_penalty/std": 0.015348234213888645, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.20716926455497742, "rewards/total_composite/std": 0.1545560508966446, "reward": 0.20716926455497742, "reward_std": 0.1545560508966446, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1818479299545288, "sampling/sampling_logp_difference/max": 1.5515947341918945, "sampling/importance_sampling_ratio/min": 0.21190977096557617, "sampling/importance_sampling_ratio/mean": 1.0296623706817627, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1521000415086746, "clip_ratio/low_mean": 0.023076923564076424, "clip_ratio/low_min": 0.023076923564076424, "clip_ratio/high_mean": 0.11405929550528526, "clip_ratio/high_max": 0.11405929550528526, "clip_ratio/region_mean": 0.1371362190693617, "reward_total_mean": 0.20716926455497742, "reward_meter_mean": 0.7423150539398193, "reward_meter_std": 0.3726646900177002, "reward_count_adherence_mean": 0.6000000238418579, "reward_count_adherence_std": 0.10690449923276901, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.8799999952316284, "reward_count_floor_std": 0.03207135200500488, "reward_lexical_plausibility_mean": 0.8673089742660522, "reward_lexical_plausibility_std": 0.2240522801876068, "reward_repeat_penalty_mean": 0.9715592861175537, "reward_repeat_penalty_std": 0.03581685945391655, "reward_repeat_floor_mean": 0.9962940216064453, "reward_repeat_floor_std": 0.003976048436015844, "reward_near_duplicate_penalty_mean": 0.981366753578186, "reward_near_duplicate_penalty_std": 0.015348234213888645, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.16690459847450256, "reward_total_composite_mean": 0.20716926455497742, "reward_total_composite_std": 0.1545560508966446} {"timestamp_utc": "2026-04-12T21:24:53Z", "mode": "train", "global_step": 1419, "epoch": 0.07468027998526393, "loss": -0.0712, "grad_norm": 3.0327870845794678, "learning_rate": 5.703030303030303e-06, "num_tokens": 2511066.0, "completions/mean_length": 172.125, "completions/min_length": 53.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 58.833335876464844, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 64.0, "rewards/meter/mean": 0.46629881858825684, "rewards/meter/std": 0.39893838763237, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.8942897319793701, "rewards/lexical_plausibility/std": 0.19582656025886536, "rewards/judge_quality/mean": 0.2499999850988388, "rewards/judge_quality/std": 0.16903084516525269, "rewards/repeat_penalty/mean": 0.9377177953720093, "rewards/repeat_penalty/std": 0.054013270884752274, "rewards/repeat_floor/mean": 0.991885781288147, "rewards/repeat_floor/std": 0.006311929319053888, "rewards/near_duplicate_penalty/mean": 0.9604518413543701, "rewards/near_duplicate_penalty/std": 0.022788435220718384, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9757559299468994, "rewards/distinct_2/std": 0.03709888085722923, "rewards/total_composite/mean": 0.15347814559936523, "rewards/total_composite/std": 0.16966484487056732, "reward": 0.15347814559936523, "reward_std": 0.16966484487056732, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14197510480880737, "sampling/sampling_logp_difference/max": 1.073725700378418, "sampling/importance_sampling_ratio/min": 0.3417329490184784, "sampling/importance_sampling_ratio/mean": 1.0360581874847412, "sampling/importance_sampling_ratio/max": 1.882956624031067, "entropy": 1.0979614108800888, "clip_ratio/low_mean": 0.04020364489406347, "clip_ratio/low_min": 0.04020364489406347, "clip_ratio/high_mean": 0.040330946911126375, "clip_ratio/high_max": 0.040330946911126375, "clip_ratio/region_mean": 0.08053459180518985, "reward_total_mean": 0.15347814559936523, "reward_meter_mean": 0.46629881858825684, "reward_meter_std": 0.39893838763237, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.8942897319793701, "reward_lexical_plausibility_std": 0.19582656025886536, "reward_repeat_penalty_mean": 0.9377177953720093, "reward_repeat_penalty_std": 0.054013270884752274, "reward_repeat_floor_mean": 0.991885781288147, "reward_repeat_floor_std": 0.006311929319053888, "reward_near_duplicate_penalty_mean": 0.9604518413543701, "reward_near_duplicate_penalty_std": 0.022788435220718384, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9757559299468994, "reward_distinct_2_std": 0.03709888085722923, "reward_judge_quality_mean": 0.2499999850988388, "reward_judge_quality_std": 0.16903084516525269, "reward_total_composite_mean": 0.15347814559936523, "reward_total_composite_std": 0.16966484487056732} {"timestamp_utc": "2026-04-12T21:25:08Z", "mode": "train", "global_step": 1420, "epoch": 0.07473290879427398, "loss": -0.0982, "grad_norm": 2.394282102584839, "learning_rate": 5.7e-06, "num_tokens": 2512947.0, "completions/mean_length": 247.125, "completions/min_length": 79.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 88.20000457763672, "completions/min_terminated_length": 79.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.25709956884384155, "rewards/meter/std": 0.21952390670776367, "rewards/count_adherence/mean": 0.675000011920929, "rewards/count_adherence/std": 0.23754701018333435, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9025000333786011, "rewards/count_floor/std": 0.0712641030550003, "rewards/lexical_plausibility/mean": 0.8210036754608154, "rewards/lexical_plausibility/std": 0.2591615319252014, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.2070196568965912, "rewards/repeat_penalty/mean": 0.923556923866272, "rewards/repeat_penalty/std": 0.08092190325260162, "rewards/repeat_floor/mean": 0.9922753572463989, "rewards/repeat_floor/std": 0.005748991388827562, "rewards/near_duplicate_penalty/mean": 0.9716846942901611, "rewards/near_duplicate_penalty/std": 0.02343595214188099, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9821963906288147, "rewards/distinct_2/std": 0.023891696706414223, "rewards/total_composite/mean": 0.08479015529155731, "rewards/total_composite/std": 0.09267206490039825, "reward": 0.08479015529155731, "reward_std": 0.09267206490039825, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16568785905838013, "sampling/sampling_logp_difference/max": 1.5872840881347656, "sampling/importance_sampling_ratio/min": 0.20448020100593567, "sampling/importance_sampling_ratio/mean": 1.011500358581543, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8012524545192719, "clip_ratio/low_mean": 0.036545682698488235, "clip_ratio/low_min": 0.036545682698488235, "clip_ratio/high_mean": 0.05723891407251358, "clip_ratio/high_max": 0.05723891407251358, "clip_ratio/region_mean": 0.09378459677100182, "reward_total_mean": 0.08479015529155731, "reward_meter_mean": 0.25709956884384155, "reward_meter_std": 0.21952390670776367, "reward_count_adherence_mean": 0.675000011920929, "reward_count_adherence_std": 0.23754701018333435, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9025000333786011, "reward_count_floor_std": 0.0712641030550003, "reward_lexical_plausibility_mean": 0.8210036754608154, "reward_lexical_plausibility_std": 0.2591615319252014, "reward_repeat_penalty_mean": 0.923556923866272, "reward_repeat_penalty_std": 0.08092190325260162, "reward_repeat_floor_mean": 0.9922753572463989, "reward_repeat_floor_std": 0.005748991388827562, "reward_near_duplicate_penalty_mean": 0.9716846942901611, "reward_near_duplicate_penalty_std": 0.02343595214188099, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9821963906288147, "reward_distinct_2_std": 0.023891696706414223, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.2070196568965912, "reward_total_composite_mean": 0.08479015529155731, "reward_total_composite_std": 0.09267206490039825} {"timestamp_utc": "2026-04-12T21:25:22Z", "mode": "train", "global_step": 1421, "epoch": 0.07478553760328403, "loss": -0.1351, "grad_norm": 2.1773228645324707, "learning_rate": 5.696969696969698e-06, "num_tokens": 2515080.0, "completions/mean_length": 256.625, "completions/min_length": 88.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 103.4000015258789, "completions/min_terminated_length": 88.0, "completions/max_terminated_length": 117.0, "rewards/meter/mean": 0.7861090302467346, "rewards/meter/std": 0.3016795516014099, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.13363061845302582, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8499999642372131, "rewards/count_floor/std": 0.040089186280965805, "rewards/lexical_plausibility/mean": 0.8296400308609009, "rewards/lexical_plausibility/std": 0.24067197740077972, "rewards/judge_quality/mean": 0.26249998807907104, "rewards/judge_quality/std": 0.18077215552330017, "rewards/repeat_penalty/mean": 0.880561888217926, "rewards/repeat_penalty/std": 0.10514307022094727, "rewards/repeat_floor/mean": 0.9877530932426453, "rewards/repeat_floor/std": 0.009224310517311096, "rewards/near_duplicate_penalty/mean": 0.962739109992981, "rewards/near_duplicate_penalty/std": 0.026324665173888206, "rewards/opening_diversity/mean": 0.956250011920929, "rewards/opening_diversity/std": 0.09038607776165009, "rewards/distinct_2/mean": 0.9551913738250732, "rewards/distinct_2/std": 0.03991148620843887, "rewards/total_composite/mean": 0.18429060280323029, "rewards/total_composite/std": 0.13176029920578003, "reward": 0.18429060280323029, "reward_std": 0.13176031410694122, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14812849462032318, "sampling/sampling_logp_difference/max": 1.5598716735839844, "sampling/importance_sampling_ratio/min": 0.21016304194927216, "sampling/importance_sampling_ratio/mean": 1.0318808555603027, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8566962331533432, "clip_ratio/low_mean": 0.02350427396595478, "clip_ratio/low_min": 0.02350427396595478, "clip_ratio/high_mean": 0.0722195915877819, "clip_ratio/high_max": 0.0722195915877819, "clip_ratio/region_mean": 0.09572386555373669, "reward_total_mean": 0.18429060280323029, "reward_meter_mean": 0.7861090302467346, "reward_meter_std": 0.3016795516014099, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.13363061845302582, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8499999642372131, "reward_count_floor_std": 0.040089186280965805, "reward_lexical_plausibility_mean": 0.8296400308609009, "reward_lexical_plausibility_std": 0.24067197740077972, "reward_repeat_penalty_mean": 0.880561888217926, "reward_repeat_penalty_std": 0.10514307022094727, "reward_repeat_floor_mean": 0.9877530932426453, "reward_repeat_floor_std": 0.009224310517311096, "reward_near_duplicate_penalty_mean": 0.962739109992981, "reward_near_duplicate_penalty_std": 0.026324665173888206, "reward_opening_diversity_mean": 0.956250011920929, "reward_opening_diversity_std": 0.09038607776165009, "reward_distinct_2_mean": 0.9551913738250732, "reward_distinct_2_std": 0.03991148620843887, "reward_judge_quality_mean": 0.26249998807907104, "reward_judge_quality_std": 0.18077215552330017, "reward_total_composite_mean": 0.18429060280323029, "reward_total_composite_std": 0.13176029920578003} {"timestamp_utc": "2026-04-12T21:25:36Z", "mode": "train", "global_step": 1422, "epoch": 0.07483816641229409, "loss": -0.0525, "grad_norm": 4.93320369720459, "learning_rate": 5.693939393939394e-06, "num_tokens": 2517334.0, "completions/mean_length": 144.75, "completions/min_length": 72.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 92.28572082519531, "completions/min_terminated_length": 72.0, "completions/max_terminated_length": 108.0, "rewards/meter/mean": 0.5939919352531433, "rewards/meter/std": 0.31222984194755554, "rewards/count_adherence/mean": 0.6071429252624512, "rewards/count_adherence/std": 0.10101525485515594, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8821429014205933, "rewards/count_floor/std": 0.03030458092689514, "rewards/lexical_plausibility/mean": 0.9413983821868896, "rewards/lexical_plausibility/std": 0.16575030982494354, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.8164722919464111, "rewards/repeat_penalty/std": 0.13678307831287384, "rewards/repeat_floor/mean": 0.9817279577255249, "rewards/repeat_floor/std": 0.011806267313659191, "rewards/near_duplicate_penalty/mean": 0.958777666091919, "rewards/near_duplicate_penalty/std": 0.015340616926550865, "rewards/opening_diversity/mean": 0.9255208373069763, "rewards/opening_diversity/std": 0.11379190534353256, "rewards/distinct_2/mean": 0.9153342247009277, "rewards/distinct_2/std": 0.04667168855667114, "rewards/total_composite/mean": 0.19468994438648224, "rewards/total_composite/std": 0.13996662199497223, "reward": 0.19468994438648224, "reward_std": 0.13996662199497223, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13757051527500153, "sampling/sampling_logp_difference/max": 2.128413677215576, "sampling/importance_sampling_ratio/min": 0.11902596056461334, "sampling/importance_sampling_ratio/mean": 1.0129565000534058, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9266053065657616, "clip_ratio/low_mean": 0.056586208287626505, "clip_ratio/low_min": 0.056586208287626505, "clip_ratio/high_mean": 0.05667359568178654, "clip_ratio/high_max": 0.05667359568178654, "clip_ratio/region_mean": 0.11325980396941304, "reward_total_mean": 0.19468994438648224, "reward_meter_mean": 0.5939919352531433, "reward_meter_std": 0.31222984194755554, "reward_count_adherence_mean": 0.6071429252624512, "reward_count_adherence_std": 0.10101525485515594, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8821429014205933, "reward_count_floor_std": 0.03030458092689514, "reward_lexical_plausibility_mean": 0.9413983821868896, "reward_lexical_plausibility_std": 0.16575030982494354, "reward_repeat_penalty_mean": 0.8164722919464111, "reward_repeat_penalty_std": 0.13678307831287384, "reward_repeat_floor_mean": 0.9817279577255249, "reward_repeat_floor_std": 0.011806267313659191, "reward_near_duplicate_penalty_mean": 0.958777666091919, "reward_near_duplicate_penalty_std": 0.015340616926550865, "reward_opening_diversity_mean": 0.9255208373069763, "reward_opening_diversity_std": 0.11379190534353256, "reward_distinct_2_mean": 0.9153342247009277, "reward_distinct_2_std": 0.04667168855667114, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.19468994438648224, "reward_total_composite_std": 0.13996662199497223} {"timestamp_utc": "2026-04-12T21:25:50Z", "mode": "train", "global_step": 1423, "epoch": 0.07489079522130414, "loss": -0.0403, "grad_norm": 4.625883102416992, "learning_rate": 5.690909090909091e-06, "num_tokens": 2518794.0, "completions/mean_length": 95.5, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 36.0, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.32400161027908325, "rewards/meter/std": 0.3609822988510132, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9517061710357666, "rewards/lexical_plausibility/std": 0.13659556210041046, "rewards/judge_quality/mean": 0.5512499809265137, "rewards/judge_quality/std": 0.3296508193016052, "rewards/repeat_penalty/mean": 0.975520133972168, "rewards/repeat_penalty/std": 0.019892379641532898, "rewards/repeat_floor/mean": 0.9963279962539673, "rewards/repeat_floor/std": 0.00298385345377028, "rewards/near_duplicate_penalty/mean": 0.975520133972168, "rewards/near_duplicate_penalty/std": 0.019892379641532898, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.15501461923122406, "rewards/total_composite/std": 0.1385594606399536, "reward": 0.15501461923122406, "reward_std": 0.1385594606399536, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1565273255109787, "sampling/sampling_logp_difference/max": 3.7504048347473145, "sampling/importance_sampling_ratio/min": 0.023508228361606598, "sampling/importance_sampling_ratio/mean": 1.002364158630371, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6725737601518631, "clip_ratio/low_mean": 0.05694728344678879, "clip_ratio/low_min": 0.05694728344678879, "clip_ratio/high_mean": 0.08240068983286619, "clip_ratio/high_max": 0.08240068983286619, "clip_ratio/region_mean": 0.13934797327965498, "reward_total_mean": 0.15501461923122406, "reward_meter_mean": 0.32400161027908325, "reward_meter_std": 0.3609822988510132, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9517061710357666, "reward_lexical_plausibility_std": 0.13659556210041046, "reward_repeat_penalty_mean": 0.975520133972168, "reward_repeat_penalty_std": 0.019892379641532898, "reward_repeat_floor_mean": 0.9963279962539673, "reward_repeat_floor_std": 0.00298385345377028, "reward_near_duplicate_penalty_mean": 0.975520133972168, "reward_near_duplicate_penalty_std": 0.019892379641532898, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5512499809265137, "reward_judge_quality_std": 0.3296508193016052, "reward_total_composite_mean": 0.15501461923122406, "reward_total_composite_std": 0.1385594606399536} {"timestamp_utc": "2026-04-12T21:26:00Z", "mode": "train", "global_step": 1424, "epoch": 0.07494342403031419, "loss": 0.0166, "grad_norm": 11.637589454650879, "learning_rate": 5.687878787878789e-06, "num_tokens": 2520349.0, "completions/mean_length": 36.375, "completions/min_length": 33.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 36.375, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.8646896481513977, "rewards/meter/std": 0.21324127912521362, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3375000059604645, "rewards/judge_quality/std": 0.12464234232902527, "rewards/repeat_penalty/mean": 0.5698262453079224, "rewards/repeat_penalty/std": 0.1878826916217804, "rewards/repeat_floor/mean": 0.9449223279953003, "rewards/repeat_floor/std": 0.02574588544666767, "rewards/near_duplicate_penalty/mean": 0.805144190788269, "rewards/near_duplicate_penalty/std": 0.10607056319713593, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.7961185574531555, "rewards/distinct_2/std": 0.10696239769458771, "rewards/total_composite/mean": 0.2628685235977173, "rewards/total_composite/std": 0.0961027517914772, "reward": 0.2628685235977173, "reward_std": 0.0961027517914772, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13617858290672302, "sampling/sampling_logp_difference/max": 1.6272382736206055, "sampling/importance_sampling_ratio/min": 0.1964714229106903, "sampling/importance_sampling_ratio/mean": 1.0462281703948975, "sampling/importance_sampling_ratio/max": 1.905685305595398, "entropy": 1.3303654342889786, "clip_ratio/low_mean": 0.055872919503599405, "clip_ratio/low_min": 0.055872919503599405, "clip_ratio/high_mean": 0.0699146525003016, "clip_ratio/high_max": 0.0699146525003016, "clip_ratio/region_mean": 0.125787572003901, "reward_total_mean": 0.2628685235977173, "reward_meter_mean": 0.8646896481513977, "reward_meter_std": 0.21324127912521362, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.5698262453079224, "reward_repeat_penalty_std": 0.1878826916217804, "reward_repeat_floor_mean": 0.9449223279953003, "reward_repeat_floor_std": 0.02574588544666767, "reward_near_duplicate_penalty_mean": 0.805144190788269, "reward_near_duplicate_penalty_std": 0.10607056319713593, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.7961185574531555, "reward_distinct_2_std": 0.10696239769458771, "reward_judge_quality_mean": 0.3375000059604645, "reward_judge_quality_std": 0.12464234232902527, "reward_total_composite_mean": 0.2628685235977173, "reward_total_composite_std": 0.0961027517914772} {"timestamp_utc": "2026-04-12T21:26:10Z", "mode": "train", "global_step": 1425, "epoch": 0.07499605283932424, "loss": 0.0416, "grad_norm": 14.353424072265625, "learning_rate": 5.684848484848485e-06, "num_tokens": 2521967.0, "completions/mean_length": 42.25, "completions/min_length": 37.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.25, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.7335023283958435, "rewards/meter/std": 0.3352108597755432, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.21756774187088013, "rewards/repeat_penalty/mean": 0.9804375171661377, "rewards/repeat_penalty/std": 0.0216483473777771, "rewards/repeat_floor/mean": 0.9970656037330627, "rewards/repeat_floor/std": 0.0032472480088472366, "rewards/near_duplicate_penalty/mean": 0.9804375171661377, "rewards/near_duplicate_penalty/std": 0.0216483473777771, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3722691535949707, "rewards/total_composite/std": 0.18204954266548157, "reward": 0.3722691535949707, "reward_std": 0.18204952776432037, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1473720371723175, "sampling/sampling_logp_difference/max": 1.531935691833496, "sampling/importance_sampling_ratio/min": 0.21611693501472473, "sampling/importance_sampling_ratio/mean": 1.0309715270996094, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3216603696346283, "clip_ratio/low_mean": 0.04184154234826565, "clip_ratio/low_min": 0.04184154234826565, "clip_ratio/high_mean": 0.08992148283869028, "clip_ratio/high_max": 0.08992148283869028, "clip_ratio/region_mean": 0.13176302518695593, "reward_total_mean": 0.3722691535949707, "reward_meter_mean": 0.7335023283958435, "reward_meter_std": 0.3352108597755432, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9804375171661377, "reward_repeat_penalty_std": 0.0216483473777771, "reward_repeat_floor_mean": 0.9970656037330627, "reward_repeat_floor_std": 0.0032472480088472366, "reward_near_duplicate_penalty_mean": 0.9804375171661377, "reward_near_duplicate_penalty_std": 0.0216483473777771, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.21756774187088013, "reward_total_composite_mean": 0.3722691535949707, "reward_total_composite_std": 0.18204954266548157} {"timestamp_utc": "2026-04-12T21:26:23Z", "mode": "train", "global_step": 1426, "epoch": 0.0750486816483343, "loss": -0.0966, "grad_norm": 2.5535073280334473, "learning_rate": 5.681818181818183e-06, "num_tokens": 2523679.0, "completions/mean_length": 233.0, "completions/min_length": 61.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 65.5999984741211, "completions/min_terminated_length": 61.0, "completions/max_terminated_length": 74.0, "rewards/meter/mean": 0.7778260111808777, "rewards/meter/std": 0.3299368917942047, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.053032997995615005, "rewards/lexical_plausibility/mean": 0.8410569429397583, "rewards/lexical_plausibility/std": 0.2204350382089615, "rewards/judge_quality/mean": 0.32874998450279236, "rewards/judge_quality/std": 0.284677118062973, "rewards/repeat_penalty/mean": 0.7332978248596191, "rewards/repeat_penalty/std": 0.28560400009155273, "rewards/repeat_floor/mean": 0.9716359972953796, "rewards/repeat_floor/std": 0.03159656748175621, "rewards/near_duplicate_penalty/mean": 0.9330688714981079, "rewards/near_duplicate_penalty/std": 0.06271221488714218, "rewards/opening_diversity/mean": 0.8696428537368774, "rewards/opening_diversity/std": 0.15559300780296326, "rewards/distinct_2/mean": 0.88330078125, "rewards/distinct_2/std": 0.18401280045509338, "rewards/total_composite/mean": 0.2714325487613678, "rewards/total_composite/std": 0.26420652866363525, "reward": 0.2714325487613678, "reward_std": 0.26420652866363525, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13892415165901184, "sampling/sampling_logp_difference/max": 1.608747124671936, "sampling/importance_sampling_ratio/min": 0.20013821125030518, "sampling/importance_sampling_ratio/mean": 1.0274556875228882, "sampling/importance_sampling_ratio/max": 1.9897373914718628, "entropy": 0.7331947535276413, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.059100549668073654, "clip_ratio/high_max": 0.059100549668073654, "clip_ratio/region_mean": 0.059100549668073654, "reward_total_mean": 0.2714325487613678, "reward_meter_mean": 0.7778260111808777, "reward_meter_std": 0.3299368917942047, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.053032997995615005, "reward_lexical_plausibility_mean": 0.8410569429397583, "reward_lexical_plausibility_std": 0.2204350382089615, "reward_repeat_penalty_mean": 0.7332978248596191, "reward_repeat_penalty_std": 0.28560400009155273, "reward_repeat_floor_mean": 0.9716359972953796, "reward_repeat_floor_std": 0.03159656748175621, "reward_near_duplicate_penalty_mean": 0.9330688714981079, "reward_near_duplicate_penalty_std": 0.06271221488714218, "reward_opening_diversity_mean": 0.8696428537368774, "reward_opening_diversity_std": 0.15559300780296326, "reward_distinct_2_mean": 0.88330078125, "reward_distinct_2_std": 0.18401280045509338, "reward_judge_quality_mean": 0.32874998450279236, "reward_judge_quality_std": 0.284677118062973, "reward_total_composite_mean": 0.2714325487613678, "reward_total_composite_std": 0.26420652866363525} {"timestamp_utc": "2026-04-12T21:26:38Z", "mode": "train", "global_step": 1427, "epoch": 0.07510131045734435, "loss": -0.0987, "grad_norm": 3.4083316326141357, "learning_rate": 5.67878787878788e-06, "num_tokens": 2525468.0, "completions/mean_length": 113.625, "completions/min_length": 55.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 56.71428680419922, "completions/min_terminated_length": 55.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.6425893902778625, "rewards/meter/std": 0.3112960755825043, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9448069334030151, "rewards/lexical_plausibility/std": 0.15610963106155396, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.8449782133102417, "rewards/repeat_penalty/std": 0.08276111632585526, "rewards/repeat_floor/mean": 0.9810770750045776, "rewards/repeat_floor/std": 0.009634961374104023, "rewards/near_duplicate_penalty/mean": 0.9288694858551025, "rewards/near_duplicate_penalty/std": 0.02703668735921383, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9082965850830078, "rewards/distinct_2/std": 0.06722333282232285, "rewards/total_composite/mean": 0.24714139103889465, "rewards/total_composite/std": 0.13522407412528992, "reward": 0.24714139103889465, "reward_std": 0.13522405922412872, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15562821924686432, "sampling/sampling_logp_difference/max": 2.1100234985351562, "sampling/importance_sampling_ratio/min": 0.12123511731624603, "sampling/importance_sampling_ratio/mean": 1.0316572189331055, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0921587944030762, "clip_ratio/low_mean": 0.021780303679406643, "clip_ratio/low_min": 0.021780303679406643, "clip_ratio/high_mean": 0.09094184171408415, "clip_ratio/high_max": 0.09094184171408415, "clip_ratio/region_mean": 0.11272214539349079, "reward_total_mean": 0.24714139103889465, "reward_meter_mean": 0.6425893902778625, "reward_meter_std": 0.3112960755825043, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9448069334030151, "reward_lexical_plausibility_std": 0.15610963106155396, "reward_repeat_penalty_mean": 0.8449782133102417, "reward_repeat_penalty_std": 0.08276111632585526, "reward_repeat_floor_mean": 0.9810770750045776, "reward_repeat_floor_std": 0.009634961374104023, "reward_near_duplicate_penalty_mean": 0.9288694858551025, "reward_near_duplicate_penalty_std": 0.02703668735921383, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9082965850830078, "reward_distinct_2_std": 0.06722333282232285, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.24714139103889465, "reward_total_composite_std": 0.13522407412528992} {"timestamp_utc": "2026-04-12T21:26:47Z", "mode": "train", "global_step": 1428, "epoch": 0.0751539392663544, "loss": 0.1098, "grad_norm": 11.471367835998535, "learning_rate": 5.675757575757577e-06, "num_tokens": 2527285.0, "completions/mean_length": 51.125, "completions/min_length": 42.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 51.125, "completions/min_terminated_length": 42.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.6151893734931946, "rewards/meter/std": 0.3938708007335663, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6212500333786011, "rewards/judge_quality/std": 0.19134393334388733, "rewards/repeat_penalty/mean": 0.9832082390785217, "rewards/repeat_penalty/std": 0.02674015797674656, "rewards/repeat_floor/mean": 0.9977906942367554, "rewards/repeat_floor/std": 0.0032035009935498238, "rewards/near_duplicate_penalty/mean": 0.9886648654937744, "rewards/near_duplicate_penalty/std": 0.013352897018194199, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9943438768386841, "rewards/distinct_2/std": 0.015997890383005142, "rewards/total_composite/mean": 0.4150158166885376, "rewards/total_composite/std": 0.3356136381626129, "reward": 0.4150158166885376, "reward_std": 0.3356136381626129, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12866315245628357, "sampling/sampling_logp_difference/max": 1.5372400283813477, "sampling/importance_sampling_ratio/min": 0.21497361361980438, "sampling/importance_sampling_ratio/mean": 1.0516523122787476, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1902798116207123, "clip_ratio/low_mean": 0.09253580030053854, "clip_ratio/low_min": 0.09253580030053854, "clip_ratio/high_mean": 0.029715219978243113, "clip_ratio/high_max": 0.029715219978243113, "clip_ratio/region_mean": 0.12225102027878165, "reward_total_mean": 0.4150158166885376, "reward_meter_mean": 0.6151893734931946, "reward_meter_std": 0.3938708007335663, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9832082390785217, "reward_repeat_penalty_std": 0.02674015797674656, "reward_repeat_floor_mean": 0.9977906942367554, "reward_repeat_floor_std": 0.0032035009935498238, "reward_near_duplicate_penalty_mean": 0.9886648654937744, "reward_near_duplicate_penalty_std": 0.013352897018194199, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9943438768386841, "reward_distinct_2_std": 0.015997890383005142, "reward_judge_quality_mean": 0.6212500333786011, "reward_judge_quality_std": 0.19134393334388733, "reward_total_composite_mean": 0.4150158166885376, "reward_total_composite_std": 0.3356136381626129} {"timestamp_utc": "2026-04-12T21:27:01Z", "mode": "train", "global_step": 1429, "epoch": 0.07520656807536445, "loss": -0.0657, "grad_norm": 4.530540943145752, "learning_rate": 5.672727272727273e-06, "num_tokens": 2529140.0, "completions/mean_length": 119.875, "completions/min_length": 57.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 63.857147216796875, "completions/min_terminated_length": 57.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.39749693870544434, "rewards/meter/std": 0.3820936977863312, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.2357022762298584, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.0707106739282608, "rewards/lexical_plausibility/mean": 0.9280478358268738, "rewards/lexical_plausibility/std": 0.20351143181324005, "rewards/judge_quality/mean": 0.7400000095367432, "rewards/judge_quality/std": 0.34280356764793396, "rewards/repeat_penalty/mean": 0.7069588899612427, "rewards/repeat_penalty/std": 0.2796173691749573, "rewards/repeat_floor/mean": 0.9735864400863647, "rewards/repeat_floor/std": 0.027258770540356636, "rewards/near_duplicate_penalty/mean": 0.9582749605178833, "rewards/near_duplicate_penalty/std": 0.051941584795713425, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.28149792551994324, "rewards/distinct_2/mean": 0.9218907356262207, "rewards/distinct_2/std": 0.07085563987493515, "rewards/total_composite/mean": 0.3610021471977234, "rewards/total_composite/std": 0.35330790281295776, "reward": 0.3610021471977234, "reward_std": 0.3533078730106354, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13061189651489258, "sampling/sampling_logp_difference/max": 3.2633328437805176, "sampling/importance_sampling_ratio/min": 0.038260672241449356, "sampling/importance_sampling_ratio/mean": 1.01331627368927, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5737249925732613, "clip_ratio/low_mean": 0.06658971542492509, "clip_ratio/low_min": 0.06658971542492509, "clip_ratio/high_mean": 0.04152960516512394, "clip_ratio/high_max": 0.04152960516512394, "clip_ratio/region_mean": 0.10811932059004903, "reward_total_mean": 0.3610021471977234, "reward_meter_mean": 0.39749693870544434, "reward_meter_std": 0.3820936977863312, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.2357022762298584, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.0707106739282608, "reward_lexical_plausibility_mean": 0.9280478358268738, "reward_lexical_plausibility_std": 0.20351143181324005, "reward_repeat_penalty_mean": 0.7069588899612427, "reward_repeat_penalty_std": 0.2796173691749573, "reward_repeat_floor_mean": 0.9735864400863647, "reward_repeat_floor_std": 0.027258770540356636, "reward_near_duplicate_penalty_mean": 0.9582749605178833, "reward_near_duplicate_penalty_std": 0.051941584795713425, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.28149792551994324, "reward_distinct_2_mean": 0.9218907356262207, "reward_distinct_2_std": 0.07085563987493515, "reward_judge_quality_mean": 0.7400000095367432, "reward_judge_quality_std": 0.34280356764793396, "reward_total_composite_mean": 0.3610021471977234, "reward_total_composite_std": 0.35330790281295776} {"timestamp_utc": "2026-04-12T21:27:15Z", "mode": "train", "global_step": 1430, "epoch": 0.0752591968843745, "loss": -0.0997, "grad_norm": 2.382554531097412, "learning_rate": 5.6696969696969705e-06, "num_tokens": 2530843.0, "completions/mean_length": 287.875, "completions/min_length": 59.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 63.75, "completions/min_terminated_length": 59.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.7674127817153931, "rewards/meter/std": 0.37033113837242126, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.26726123690605164, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.887499988079071, "rewards/count_floor/std": 0.08017838001251221, "rewards/lexical_plausibility/mean": 0.7275892496109009, "rewards/lexical_plausibility/std": 0.2960568368434906, "rewards/judge_quality/mean": 0.21875, "rewards/judge_quality/std": 0.19809359312057495, "rewards/repeat_penalty/mean": 0.961026132106781, "rewards/repeat_penalty/std": 0.03477640822529793, "rewards/repeat_floor/mean": 0.9950242638587952, "rewards/repeat_floor/std": 0.004474334418773651, "rewards/near_duplicate_penalty/mean": 0.9762563705444336, "rewards/near_duplicate_penalty/std": 0.02430010214447975, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9842867255210876, "rewards/distinct_2/std": 0.020308425650000572, "rewards/total_composite/mean": 0.18792983889579773, "rewards/total_composite/std": 0.18820473551750183, "reward": 0.18792983889579773, "reward_std": 0.18820473551750183, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18625052273273468, "sampling/sampling_logp_difference/max": 4.266085624694824, "sampling/importance_sampling_ratio/min": 0.01403662096709013, "sampling/importance_sampling_ratio/mean": 1.0408921241760254, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9037230908870697, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.06337859574705362, "clip_ratio/high_max": 0.06337859574705362, "clip_ratio/region_mean": 0.06337859574705362, "reward_total_mean": 0.18792983889579773, "reward_meter_mean": 0.7674127817153931, "reward_meter_std": 0.37033113837242126, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.26726123690605164, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.887499988079071, "reward_count_floor_std": 0.08017838001251221, "reward_lexical_plausibility_mean": 0.7275892496109009, "reward_lexical_plausibility_std": 0.2960568368434906, "reward_repeat_penalty_mean": 0.961026132106781, "reward_repeat_penalty_std": 0.03477640822529793, "reward_repeat_floor_mean": 0.9950242638587952, "reward_repeat_floor_std": 0.004474334418773651, "reward_near_duplicate_penalty_mean": 0.9762563705444336, "reward_near_duplicate_penalty_std": 0.02430010214447975, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9842867255210876, "reward_distinct_2_std": 0.020308425650000572, "reward_judge_quality_mean": 0.21875, "reward_judge_quality_std": 0.19809359312057495, "reward_total_composite_mean": 0.18792983889579773, "reward_total_composite_std": 0.18820473551750183} {"timestamp_utc": "2026-04-12T21:27:26Z", "mode": "train", "global_step": 1431, "epoch": 0.07531182569338456, "loss": 0.025, "grad_norm": 13.66073226928711, "learning_rate": 5.666666666666667e-06, "num_tokens": 2532534.0, "completions/mean_length": 34.375, "completions/min_length": 31.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.375, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.772925615310669, "rewards/meter/std": 0.4008168876171112, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6387499570846558, "rewards/judge_quality/std": 0.2639501094818115, "rewards/repeat_penalty/mean": 0.9684585928916931, "rewards/repeat_penalty/std": 0.03413161262869835, "rewards/repeat_floor/mean": 0.9956202507019043, "rewards/repeat_floor/std": 0.0043912623077631, "rewards/near_duplicate_penalty/mean": 0.9747804403305054, "rewards/near_duplicate_penalty/std": 0.023137658834457397, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9933686852455139, "rewards/distinct_2/std": 0.01875614933669567, "rewards/total_composite/mean": 0.4710928201675415, "rewards/total_composite/std": 0.3410051465034485, "reward": 0.4710928201675415, "reward_std": 0.3410051465034485, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14480949938297272, "sampling/sampling_logp_difference/max": 1.6082849502563477, "sampling/importance_sampling_ratio/min": 0.20023071765899658, "sampling/importance_sampling_ratio/mean": 0.9996879696846008, "sampling/importance_sampling_ratio/max": 1.7699857950210571, "entropy": 1.0403863191604614, "clip_ratio/low_mean": 0.08572594448924065, "clip_ratio/low_min": 0.08572594448924065, "clip_ratio/high_mean": 0.059783825650811195, "clip_ratio/high_max": 0.059783825650811195, "clip_ratio/region_mean": 0.14550977014005184, "reward_total_mean": 0.4710928201675415, "reward_meter_mean": 0.772925615310669, "reward_meter_std": 0.4008168876171112, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9684585928916931, "reward_repeat_penalty_std": 0.03413161262869835, "reward_repeat_floor_mean": 0.9956202507019043, "reward_repeat_floor_std": 0.0043912623077631, "reward_near_duplicate_penalty_mean": 0.9747804403305054, "reward_near_duplicate_penalty_std": 0.023137658834457397, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9933686852455139, "reward_distinct_2_std": 0.01875614933669567, "reward_judge_quality_mean": 0.6387499570846558, "reward_judge_quality_std": 0.2639501094818115, "reward_total_composite_mean": 0.4710928201675415, "reward_total_composite_std": 0.3410051465034485} {"timestamp_utc": "2026-04-12T21:27:40Z", "mode": "train", "global_step": 1432, "epoch": 0.07536445450239461, "loss": -0.0843, "grad_norm": 3.8338301181793213, "learning_rate": 5.663636363636364e-06, "num_tokens": 2534201.0, "completions/mean_length": 116.375, "completions/min_length": 50.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 59.857147216796875, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 76.0, "rewards/meter/mean": 0.9751989841461182, "rewards/meter/std": 0.027916021645069122, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.9547233581542969, "rewards/lexical_plausibility/std": 0.12806160748004913, "rewards/judge_quality/mean": 0.2750000059604645, "rewards/judge_quality/std": 0.14880475401878357, "rewards/repeat_penalty/mean": 0.893029510974884, "rewards/repeat_penalty/std": 0.08625410497188568, "rewards/repeat_floor/mean": 0.9868086576461792, "rewards/repeat_floor/std": 0.009888304397463799, "rewards/near_duplicate_penalty/mean": 0.9464174509048462, "rewards/near_duplicate_penalty/std": 0.03807366266846657, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9427334070205688, "rewards/distinct_2/std": 0.07041586190462112, "rewards/total_composite/mean": 0.2611513137817383, "rewards/total_composite/std": 0.14535030722618103, "reward": 0.2611513137817383, "reward_std": 0.14535030722618103, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14724820852279663, "sampling/sampling_logp_difference/max": 1.667689323425293, "sampling/importance_sampling_ratio/min": 0.18868255615234375, "sampling/importance_sampling_ratio/mean": 1.0426467657089233, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1246240213513374, "clip_ratio/low_mean": 0.044358803890645504, "clip_ratio/low_min": 0.044358803890645504, "clip_ratio/high_mean": 0.06831552786752582, "clip_ratio/high_max": 0.06831552786752582, "clip_ratio/region_mean": 0.11267433175817132, "reward_total_mean": 0.2611513137817383, "reward_meter_mean": 0.9751989841461182, "reward_meter_std": 0.027916021645069122, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.9547233581542969, "reward_lexical_plausibility_std": 0.12806160748004913, "reward_repeat_penalty_mean": 0.893029510974884, "reward_repeat_penalty_std": 0.08625410497188568, "reward_repeat_floor_mean": 0.9868086576461792, "reward_repeat_floor_std": 0.009888304397463799, "reward_near_duplicate_penalty_mean": 0.9464174509048462, "reward_near_duplicate_penalty_std": 0.03807366266846657, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9427334070205688, "reward_distinct_2_std": 0.07041586190462112, "reward_judge_quality_mean": 0.2750000059604645, "reward_judge_quality_std": 0.14880475401878357, "reward_total_composite_mean": 0.2611513137817383, "reward_total_composite_std": 0.14535030722618103} {"timestamp_utc": "2026-04-12T21:27:53Z", "mode": "train", "global_step": 1433, "epoch": 0.07541708331140466, "loss": 0.0155, "grad_norm": 10.815335273742676, "learning_rate": 5.6606060606060606e-06, "num_tokens": 2535821.0, "completions/mean_length": 47.5, "completions/min_length": 44.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 47.5, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.8035632371902466, "rewards/meter/std": 0.35357198119163513, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.2512255907058716, "rewards/repeat_penalty/mean": 0.925196647644043, "rewards/repeat_penalty/std": 0.09327761828899384, "rewards/repeat_floor/mean": 0.9913779497146606, "rewards/repeat_floor/std": 0.011129924096167088, "rewards/near_duplicate_penalty/mean": 0.97325599193573, "rewards/near_duplicate_penalty/std": 0.03835231438279152, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9487727284431458, "rewards/distinct_2/std": 0.06601634621620178, "rewards/total_composite/mean": 0.559435248374939, "rewards/total_composite/std": 0.31340456008911133, "reward": 0.559435248374939, "reward_std": 0.3134045898914337, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12842796742916107, "sampling/sampling_logp_difference/max": 1.2949838638305664, "sampling/importance_sampling_ratio/min": 0.2739022970199585, "sampling/importance_sampling_ratio/mean": 1.0260000228881836, "sampling/importance_sampling_ratio/max": 1.9964464902877808, "entropy": 0.9089308679103851, "clip_ratio/low_mean": 0.09015991259366274, "clip_ratio/low_min": 0.09015991259366274, "clip_ratio/high_mean": 0.029072696343064308, "clip_ratio/high_max": 0.029072696343064308, "clip_ratio/region_mean": 0.11923260893672705, "reward_total_mean": 0.559435248374939, "reward_meter_mean": 0.8035632371902466, "reward_meter_std": 0.35357198119163513, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.925196647644043, "reward_repeat_penalty_std": 0.09327761828899384, "reward_repeat_floor_mean": 0.9913779497146606, "reward_repeat_floor_std": 0.011129924096167088, "reward_near_duplicate_penalty_mean": 0.97325599193573, "reward_near_duplicate_penalty_std": 0.03835231438279152, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9487727284431458, "reward_distinct_2_std": 0.06601634621620178, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.2512255907058716, "reward_total_composite_mean": 0.559435248374939, "reward_total_composite_std": 0.31340456008911133} {"timestamp_utc": "2026-04-12T21:28:01Z", "mode": "train", "global_step": 1434, "epoch": 0.07546971212041471, "loss": 0.0235, "grad_norm": 12.809391975402832, "learning_rate": 5.657575757575759e-06, "num_tokens": 2537327.0, "completions/mean_length": 42.25, "completions/min_length": 40.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.25, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.6077009439468384, "rewards/meter/std": 0.4388333261013031, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5674999952316284, "rewards/judge_quality/std": 0.21756774187088013, "rewards/repeat_penalty/mean": 0.9670984745025635, "rewards/repeat_penalty/std": 0.05196331813931465, "rewards/repeat_floor/mean": 0.9955167174339294, "rewards/repeat_floor/std": 0.006778073497116566, "rewards/near_duplicate_penalty/mean": 0.9756060242652893, "rewards/near_duplicate_penalty/std": 0.03486240282654762, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.3359838128089905, "rewards/total_composite/std": 0.2881816327571869, "reward": 0.3359838128089905, "reward_std": 0.2881816327571869, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12209069728851318, "sampling/sampling_logp_difference/max": 1.4627957344055176, "sampling/importance_sampling_ratio/min": 0.23158791661262512, "sampling/importance_sampling_ratio/mean": 1.0027520656585693, "sampling/importance_sampling_ratio/max": 1.8436205387115479, "entropy": 0.7831537052989006, "clip_ratio/low_mean": 0.047203767113387585, "clip_ratio/low_min": 0.047203767113387585, "clip_ratio/high_mean": 0.05719283316284418, "clip_ratio/high_max": 0.05719283316284418, "clip_ratio/region_mean": 0.10439660027623177, "reward_total_mean": 0.3359838128089905, "reward_meter_mean": 0.6077009439468384, "reward_meter_std": 0.4388333261013031, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9670984745025635, "reward_repeat_penalty_std": 0.05196331813931465, "reward_repeat_floor_mean": 0.9955167174339294, "reward_repeat_floor_std": 0.006778073497116566, "reward_near_duplicate_penalty_mean": 0.9756060242652893, "reward_near_duplicate_penalty_std": 0.03486240282654762, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.5674999952316284, "reward_judge_quality_std": 0.21756774187088013, "reward_total_composite_mean": 0.3359838128089905, "reward_total_composite_std": 0.2881816327571869} {"timestamp_utc": "2026-04-12T21:28:11Z", "mode": "train", "global_step": 1435, "epoch": 0.07552234092942477, "loss": -0.0376, "grad_norm": 11.316720962524414, "learning_rate": 5.654545454545455e-06, "num_tokens": 2539044.0, "completions/mean_length": 42.625, "completions/min_length": 34.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.625, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.7937230467796326, "rewards/meter/std": 0.2995172142982483, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42499998211860657, "rewards/judge_quality/std": 0.04629100486636162, "rewards/repeat_penalty/mean": 0.9687439799308777, "rewards/repeat_penalty/std": 0.02794233150780201, "rewards/repeat_floor/mean": 0.9953116178512573, "rewards/repeat_floor/std": 0.004191352054476738, "rewards/near_duplicate_penalty/mean": 0.9687439799308777, "rewards/near_duplicate_penalty/std": 0.02794233150780201, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.33091306686401367, "rewards/total_composite/std": 0.12386972457170486, "reward": 0.33091306686401367, "reward_std": 0.12386971712112427, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15386852622032166, "sampling/sampling_logp_difference/max": 1.954709768295288, "sampling/importance_sampling_ratio/min": 0.14160557091236115, "sampling/importance_sampling_ratio/mean": 1.0349780321121216, "sampling/importance_sampling_ratio/max": 1.8183578252792358, "entropy": 1.1979315429925919, "clip_ratio/low_mean": 0.020582706667482853, "clip_ratio/low_min": 0.020582706667482853, "clip_ratio/high_mean": 0.11941523663699627, "clip_ratio/high_max": 0.11941523663699627, "clip_ratio/region_mean": 0.13999794330447912, "reward_total_mean": 0.33091306686401367, "reward_meter_mean": 0.7937230467796326, "reward_meter_std": 0.2995172142982483, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9687439799308777, "reward_repeat_penalty_std": 0.02794233150780201, "reward_repeat_floor_mean": 0.9953116178512573, "reward_repeat_floor_std": 0.004191352054476738, "reward_near_duplicate_penalty_mean": 0.9687439799308777, "reward_near_duplicate_penalty_std": 0.02794233150780201, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42499998211860657, "reward_judge_quality_std": 0.04629100486636162, "reward_total_composite_mean": 0.33091306686401367, "reward_total_composite_std": 0.12386972457170486} {"timestamp_utc": "2026-04-12T21:28:26Z", "mode": "train", "global_step": 1436, "epoch": 0.07557496973843482, "loss": -0.1499, "grad_norm": 2.8543624877929688, "learning_rate": 5.651515151515152e-06, "num_tokens": 2540968.0, "completions/mean_length": 253.5, "completions/min_length": 88.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 98.4000015258789, "completions/min_terminated_length": 88.0, "completions/max_terminated_length": 114.0, "rewards/meter/mean": 0.8084597587585449, "rewards/meter/std": 0.3178073465824127, "rewards/count_adherence/mean": 0.5357142686843872, "rewards/count_adherence/std": 0.12662933766841888, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.860714316368103, "rewards/count_floor/std": 0.03798879683017731, "rewards/lexical_plausibility/mean": 0.8361128568649292, "rewards/lexical_plausibility/std": 0.2306813895702362, "rewards/judge_quality/mean": 0.20624999701976776, "rewards/judge_quality/std": 0.1590990275144577, "rewards/repeat_penalty/mean": 0.9289405345916748, "rewards/repeat_penalty/std": 0.053262174129486084, "rewards/repeat_floor/mean": 0.9920302629470825, "rewards/repeat_floor/std": 0.005751530174165964, "rewards/near_duplicate_penalty/mean": 0.9761865139007568, "rewards/near_duplicate_penalty/std": 0.015039334073662758, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9511362314224243, "rewards/distinct_2/std": 0.04154196381568909, "rewards/total_composite/mean": 0.16314910352230072, "rewards/total_composite/std": 0.13803774118423462, "reward": 0.16314910352230072, "reward_std": 0.13803774118423462, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20392070710659027, "sampling/sampling_logp_difference/max": 2.021611213684082, "sampling/importance_sampling_ratio/min": 0.132441908121109, "sampling/importance_sampling_ratio/mean": 1.0531235933303833, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1845258176326752, "clip_ratio/low_mean": 0.01315789483487606, "clip_ratio/low_min": 0.01315789483487606, "clip_ratio/high_mean": 0.07894021738320589, "clip_ratio/high_max": 0.07894021738320589, "clip_ratio/region_mean": 0.09209811221808195, "reward_total_mean": 0.16314910352230072, "reward_meter_mean": 0.8084597587585449, "reward_meter_std": 0.3178073465824127, "reward_count_adherence_mean": 0.5357142686843872, "reward_count_adherence_std": 0.12662933766841888, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.860714316368103, "reward_count_floor_std": 0.03798879683017731, "reward_lexical_plausibility_mean": 0.8361128568649292, "reward_lexical_plausibility_std": 0.2306813895702362, "reward_repeat_penalty_mean": 0.9289405345916748, "reward_repeat_penalty_std": 0.053262174129486084, "reward_repeat_floor_mean": 0.9920302629470825, "reward_repeat_floor_std": 0.005751530174165964, "reward_near_duplicate_penalty_mean": 0.9761865139007568, "reward_near_duplicate_penalty_std": 0.015039334073662758, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9511362314224243, "reward_distinct_2_std": 0.04154196381568909, "reward_judge_quality_mean": 0.20624999701976776, "reward_judge_quality_std": 0.1590990275144577, "reward_total_composite_mean": 0.16314910352230072, "reward_total_composite_std": 0.13803774118423462} {"timestamp_utc": "2026-04-12T21:28:35Z", "mode": "train", "global_step": 1437, "epoch": 0.07562759854744487, "loss": 0.0239, "grad_norm": 11.36780071258545, "learning_rate": 5.648484848484849e-06, "num_tokens": 2542758.0, "completions/mean_length": 58.75, "completions/min_length": 51.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.75, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.852945864200592, "rewards/meter/std": 0.28729549050331116, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.10690448433160782, "rewards/repeat_penalty/mean": 0.9559943675994873, "rewards/repeat_penalty/std": 0.07664373517036438, "rewards/repeat_floor/mean": 0.9953839778900146, "rewards/repeat_floor/std": 0.007098164409399033, "rewards/near_duplicate_penalty/mean": 0.9863051176071167, "rewards/near_duplicate_penalty/std": 0.014090240933001041, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.9798692464828491, "rewards/distinct_2/std": 0.0397031269967556, "rewards/total_composite/mean": 0.3271406292915344, "rewards/total_composite/std": 0.14686590433120728, "reward": 0.3271406292915344, "reward_std": 0.14686588943004608, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14686284959316254, "sampling/sampling_logp_difference/max": 1.56541109085083, "sampling/importance_sampling_ratio/min": 0.2090020626783371, "sampling/importance_sampling_ratio/mean": 1.029215693473816, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0047723203897476, "clip_ratio/low_mean": 0.029373468831181526, "clip_ratio/low_min": 0.029373468831181526, "clip_ratio/high_mean": 0.11431877501308918, "clip_ratio/high_max": 0.11431877501308918, "clip_ratio/region_mean": 0.1436922438442707, "reward_total_mean": 0.3271406292915344, "reward_meter_mean": 0.852945864200592, "reward_meter_std": 0.28729549050331116, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9559943675994873, "reward_repeat_penalty_std": 0.07664373517036438, "reward_repeat_floor_mean": 0.9953839778900146, "reward_repeat_floor_std": 0.007098164409399033, "reward_near_duplicate_penalty_mean": 0.9863051176071167, "reward_near_duplicate_penalty_std": 0.014090240933001041, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.9798692464828491, "reward_distinct_2_std": 0.0397031269967556, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.10690448433160782, "reward_total_composite_mean": 0.3271406292915344, "reward_total_composite_std": 0.14686590433120728} {"timestamp_utc": "2026-04-12T21:28:50Z", "mode": "train", "global_step": 1438, "epoch": 0.07568022735645492, "loss": -0.1688, "grad_norm": 2.5985569953918457, "learning_rate": 5.645454545454546e-06, "num_tokens": 2545097.0, "completions/mean_length": 267.375, "completions/min_length": 108.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 120.5999984741211, "completions/min_terminated_length": 108.0, "completions/max_terminated_length": 133.0, "rewards/meter/mean": 0.8278605341911316, "rewards/meter/std": 0.2633938491344452, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.06681530922651291, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.887499988079071, "rewards/count_floor/std": 0.020044591277837753, "rewards/lexical_plausibility/mean": 0.8392350673675537, "rewards/lexical_plausibility/std": 0.22488006949424744, "rewards/judge_quality/mean": 0.22499999403953552, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.9627857208251953, "rewards/repeat_penalty/std": 0.035533227026462555, "rewards/repeat_floor/mean": 0.9952646493911743, "rewards/repeat_floor/std": 0.0038585616275668144, "rewards/near_duplicate_penalty/mean": 0.9776012897491455, "rewards/near_duplicate_penalty/std": 0.013215497136116028, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9847158193588257, "rewards/distinct_2/std": 0.029535382986068726, "rewards/total_composite/mean": 0.18558116257190704, "rewards/total_composite/std": 0.12809965014457703, "reward": 0.18558116257190704, "reward_std": 0.12809965014457703, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16897639632225037, "sampling/sampling_logp_difference/max": 3.12882661819458, "sampling/importance_sampling_ratio/min": 0.043769124895334244, "sampling/importance_sampling_ratio/mean": 1.0234577655792236, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8054457157850266, "clip_ratio/low_mean": 0.02187499962747097, "clip_ratio/low_min": 0.02187499962747097, "clip_ratio/high_mean": 0.07969456352293491, "clip_ratio/high_max": 0.07969456352293491, "clip_ratio/region_mean": 0.10156956315040588, "reward_total_mean": 0.18558116257190704, "reward_meter_mean": 0.8278605341911316, "reward_meter_std": 0.2633938491344452, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.06681530922651291, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.887499988079071, "reward_count_floor_std": 0.020044591277837753, "reward_lexical_plausibility_mean": 0.8392350673675537, "reward_lexical_plausibility_std": 0.22488006949424744, "reward_repeat_penalty_mean": 0.9627857208251953, "reward_repeat_penalty_std": 0.035533227026462555, "reward_repeat_floor_mean": 0.9952646493911743, "reward_repeat_floor_std": 0.0038585616275668144, "reward_near_duplicate_penalty_mean": 0.9776012897491455, "reward_near_duplicate_penalty_std": 0.013215497136116028, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9847158193588257, "reward_distinct_2_std": 0.029535382986068726, "reward_judge_quality_mean": 0.22499999403953552, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.18558116257190704, "reward_total_composite_std": 0.12809965014457703} {"timestamp_utc": "2026-04-12T21:28:58Z", "mode": "train", "global_step": 1439, "epoch": 0.07573285616546498, "loss": 0.0401, "grad_norm": 15.01860237121582, "learning_rate": 5.642424242424242e-06, "num_tokens": 2546841.0, "completions/mean_length": 38.0, "completions/min_length": 35.0, "completions/max_length": 43.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.9474092721939087, "rewards/meter/std": 0.10505027323961258, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6212500333786011, "rewards/judge_quality/std": 0.19134393334388733, "rewards/repeat_penalty/mean": 0.8722543716430664, "rewards/repeat_penalty/std": 0.16646598279476166, "rewards/repeat_floor/mean": 0.9894043803215027, "rewards/repeat_floor/std": 0.013198469765484333, "rewards/near_duplicate_penalty/mean": 0.9841701984405518, "rewards/near_duplicate_penalty/std": 0.015411601401865482, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9711538553237915, "rewards/distinct_2/std": 0.039811473339796066, "rewards/total_composite/mean": 0.5893003344535828, "rewards/total_composite/std": 0.20974105596542358, "reward": 0.5893003344535828, "reward_std": 0.20974107086658478, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1472310572862625, "sampling/sampling_logp_difference/max": 1.385605812072754, "sampling/importance_sampling_ratio/min": 0.2501721978187561, "sampling/importance_sampling_ratio/mean": 1.0171046257019043, "sampling/importance_sampling_ratio/max": 1.8697993755340576, "entropy": 1.0474810674786568, "clip_ratio/low_mean": 0.05385982058942318, "clip_ratio/low_min": 0.05385982058942318, "clip_ratio/high_mean": 0.08811751566827297, "clip_ratio/high_max": 0.08811751566827297, "clip_ratio/region_mean": 0.14197733625769615, "reward_total_mean": 0.5893003344535828, "reward_meter_mean": 0.9474092721939087, "reward_meter_std": 0.10505027323961258, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8722543716430664, "reward_repeat_penalty_std": 0.16646598279476166, "reward_repeat_floor_mean": 0.9894043803215027, "reward_repeat_floor_std": 0.013198469765484333, "reward_near_duplicate_penalty_mean": 0.9841701984405518, "reward_near_duplicate_penalty_std": 0.015411601401865482, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9711538553237915, "reward_distinct_2_std": 0.039811473339796066, "reward_judge_quality_mean": 0.6212500333786011, "reward_judge_quality_std": 0.19134393334388733, "reward_total_composite_mean": 0.5893003344535828, "reward_total_composite_std": 0.20974105596542358} {"timestamp_utc": "2026-04-12T21:29:08Z", "mode": "train", "global_step": 1440, "epoch": 0.07578548497447503, "loss": 0.069, "grad_norm": 12.151432991027832, "learning_rate": 5.6393939393939405e-06, "num_tokens": 2548666.0, "completions/mean_length": 62.125, "completions/min_length": 58.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 62.125, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.6526681184768677, "rewards/meter/std": 0.29940924048423767, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.9337679147720337, "rewards/repeat_penalty/std": 0.046768590807914734, "rewards/repeat_floor/mean": 0.992020845413208, "rewards/repeat_floor/std": 0.005467830691486597, "rewards/near_duplicate_penalty/mean": 0.9685639142990112, "rewards/near_duplicate_penalty/std": 0.02111426740884781, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9637367129325867, "rewards/distinct_2/std": 0.03472144901752472, "rewards/total_composite/mean": 0.22972485423088074, "rewards/total_composite/std": 0.09843901544809341, "reward": 0.22972485423088074, "reward_std": 0.09843901544809341, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15524837374687195, "sampling/sampling_logp_difference/max": 1.846414566040039, "sampling/importance_sampling_ratio/min": 0.15780194103717804, "sampling/importance_sampling_ratio/mean": 1.0249295234680176, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8301663920283318, "clip_ratio/low_mean": 0.0634230524301529, "clip_ratio/low_min": 0.0634230524301529, "clip_ratio/high_mean": 0.07499332632869482, "clip_ratio/high_max": 0.07499332632869482, "clip_ratio/region_mean": 0.1384163787588477, "reward_total_mean": 0.22972485423088074, "reward_meter_mean": 0.6526681184768677, "reward_meter_std": 0.29940924048423767, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9337679147720337, "reward_repeat_penalty_std": 0.046768590807914734, "reward_repeat_floor_mean": 0.992020845413208, "reward_repeat_floor_std": 0.005467830691486597, "reward_near_duplicate_penalty_mean": 0.9685639142990112, "reward_near_duplicate_penalty_std": 0.02111426740884781, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9637367129325867, "reward_distinct_2_std": 0.03472144901752472, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.22972485423088074, "reward_total_composite_std": 0.09843901544809341} {"timestamp_utc": "2026-04-12T21:29:22Z", "mode": "train", "global_step": 1441, "epoch": 0.07583811378348508, "loss": -0.0184, "grad_norm": 5.862575531005859, "learning_rate": 5.636363636363636e-06, "num_tokens": 2550185.0, "completions/mean_length": 90.875, "completions/min_length": 28.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 30.71428680419922, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.4679519534111023, "rewards/meter/std": 0.40002721548080444, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9398874044418335, "rewards/lexical_plausibility/std": 0.170024111866951, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.16690458357334137, "rewards/repeat_penalty/mean": 0.9132769107818604, "rewards/repeat_penalty/std": 0.1240047886967659, "rewards/repeat_floor/mean": 0.9895557761192322, "rewards/repeat_floor/std": 0.01305301021784544, "rewards/near_duplicate_penalty/mean": 0.9486858248710632, "rewards/near_duplicate_penalty/std": 0.054175253957509995, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9903097748756409, "rewards/distinct_2/std": 0.025729352608323097, "rewards/total_composite/mean": 0.20433664321899414, "rewards/total_composite/std": 0.22805427014827728, "reward": 0.20433664321899414, "reward_std": 0.22805428504943848, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16726423799991608, "sampling/sampling_logp_difference/max": 1.3706603050231934, "sampling/importance_sampling_ratio/min": 0.2539392113685608, "sampling/importance_sampling_ratio/mean": 1.0363671779632568, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.016862913966179, "clip_ratio/low_mean": 0.042008758056908846, "clip_ratio/low_min": 0.042008758056908846, "clip_ratio/high_mean": 0.06507230084389448, "clip_ratio/high_max": 0.06507230084389448, "clip_ratio/region_mean": 0.10708105890080333, "reward_total_mean": 0.20433664321899414, "reward_meter_mean": 0.4679519534111023, "reward_meter_std": 0.40002721548080444, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9398874044418335, "reward_lexical_plausibility_std": 0.170024111866951, "reward_repeat_penalty_mean": 0.9132769107818604, "reward_repeat_penalty_std": 0.1240047886967659, "reward_repeat_floor_mean": 0.9895557761192322, "reward_repeat_floor_std": 0.01305301021784544, "reward_near_duplicate_penalty_mean": 0.9486858248710632, "reward_near_duplicate_penalty_std": 0.054175253957509995, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9903097748756409, "reward_distinct_2_std": 0.025729352608323097, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.16690458357334137, "reward_total_composite_mean": 0.20433664321899414, "reward_total_composite_std": 0.22805427014827728} {"timestamp_utc": "2026-04-12T21:29:37Z", "mode": "train", "global_step": 1442, "epoch": 0.07589074259249513, "loss": -0.0929, "grad_norm": 1.5667822360992432, "learning_rate": 5.633333333333334e-06, "num_tokens": 2551771.0, "completions/mean_length": 221.25, "completions/min_length": 44.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 46.79999923706055, "completions/min_terminated_length": 44.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.8781077861785889, "rewards/meter/std": 0.23861871659755707, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.827507495880127, "rewards/lexical_plausibility/std": 0.2392042726278305, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.19955307245254517, "rewards/repeat_penalty/mean": 0.9672141075134277, "rewards/repeat_penalty/std": 0.049560315907001495, "rewards/repeat_floor/mean": 0.9958791732788086, "rewards/repeat_floor/std": 0.006192892324179411, "rewards/near_duplicate_penalty/mean": 0.9816303253173828, "rewards/near_duplicate_penalty/std": 0.028096236288547516, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9848290085792542, "rewards/distinct_2/std": 0.026992013677954674, "rewards/total_composite/mean": 0.2753852903842926, "rewards/total_composite/std": 0.20176035165786743, "reward": 0.2753852903842926, "reward_std": 0.20176035165786743, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16209512948989868, "sampling/sampling_logp_difference/max": 1.6074860095977783, "sampling/importance_sampling_ratio/min": 0.2003907561302185, "sampling/importance_sampling_ratio/mean": 1.0195982456207275, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7363856211304665, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.08630292490124702, "clip_ratio/high_max": 0.08630292490124702, "clip_ratio/region_mean": 0.08630292490124702, "reward_total_mean": 0.2753852903842926, "reward_meter_mean": 0.8781077861785889, "reward_meter_std": 0.23861871659755707, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.827507495880127, "reward_lexical_plausibility_std": 0.2392042726278305, "reward_repeat_penalty_mean": 0.9672141075134277, "reward_repeat_penalty_std": 0.049560315907001495, "reward_repeat_floor_mean": 0.9958791732788086, "reward_repeat_floor_std": 0.006192892324179411, "reward_near_duplicate_penalty_mean": 0.9816303253173828, "reward_near_duplicate_penalty_std": 0.028096236288547516, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9848290085792542, "reward_distinct_2_std": 0.026992013677954674, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.19955307245254517, "reward_total_composite_mean": 0.2753852903842926, "reward_total_composite_std": 0.20176035165786743} {"timestamp_utc": "2026-04-12T21:29:46Z", "mode": "train", "global_step": 1443, "epoch": 0.07594337140150519, "loss": 0.0226, "grad_norm": 18.40782928466797, "learning_rate": 5.630303030303031e-06, "num_tokens": 2553212.0, "completions/mean_length": 31.125, "completions/min_length": 19.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.125, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.6279726028442383, "rewards/meter/std": 0.43741652369499207, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.5345224738121033, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.16035674512386322, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.8512497544288635, "rewards/repeat_penalty/std": 0.14278069138526917, "rewards/repeat_floor/mean": 0.9887473583221436, "rewards/repeat_floor/std": 0.010075317695736885, "rewards/near_duplicate_penalty/mean": 0.9810548424720764, "rewards/near_duplicate_penalty/std": 0.01773335039615631, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.15707695484161377, "rewards/total_composite/std": 0.14221549034118652, "reward": 0.15707695484161377, "reward_std": 0.14221547544002533, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14728401601314545, "sampling/sampling_logp_difference/max": 1.8133232593536377, "sampling/importance_sampling_ratio/min": 0.16311118006706238, "sampling/importance_sampling_ratio/mean": 1.0340102910995483, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.921648733317852, "clip_ratio/low_mean": 0.07453275099396706, "clip_ratio/low_min": 0.07453275099396706, "clip_ratio/high_mean": 0.056966845877468586, "clip_ratio/high_max": 0.056966845877468586, "clip_ratio/region_mean": 0.13149959687143564, "reward_total_mean": 0.15707695484161377, "reward_meter_mean": 0.6279726028442383, "reward_meter_std": 0.43741652369499207, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.5345224738121033, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.16035674512386322, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8512497544288635, "reward_repeat_penalty_std": 0.14278069138526917, "reward_repeat_floor_mean": 0.9887473583221436, "reward_repeat_floor_std": 0.010075317695736885, "reward_near_duplicate_penalty_mean": 0.9810548424720764, "reward_near_duplicate_penalty_std": 0.01773335039615631, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.15707695484161377, "reward_total_composite_std": 0.14221549034118652} {"timestamp_utc": "2026-04-12T21:30:00Z", "mode": "train", "global_step": 1444, "epoch": 0.07599600021051524, "loss": -0.0213, "grad_norm": 5.70648717880249, "learning_rate": 5.627272727272728e-06, "num_tokens": 2554822.0, "completions/mean_length": 93.25, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 33.42857360839844, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.12548930943012238, "rewards/meter/std": 0.16755937039852142, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9460666179656982, "rewards/lexical_plausibility/std": 0.1525467336177826, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.35087648034095764, "rewards/repeat_penalty/mean": 0.7169134616851807, "rewards/repeat_penalty/std": 0.2304912954568863, "rewards/repeat_floor/mean": 0.9687427282333374, "rewards/repeat_floor/std": 0.02760075405240059, "rewards/near_duplicate_penalty/mean": 0.9079367518424988, "rewards/near_duplicate_penalty/std": 0.07836468517780304, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9103026390075684, "rewards/distinct_2/std": 0.11174733191728592, "rewards/total_composite/mean": 0.103962741792202, "rewards/total_composite/std": 0.15143881738185883, "reward": 0.103962741792202, "reward_std": 0.15143880248069763, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10993009060621262, "sampling/sampling_logp_difference/max": 0.8074464797973633, "sampling/importance_sampling_ratio/min": 0.4459955096244812, "sampling/importance_sampling_ratio/mean": 1.0364493131637573, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.621724434196949, "clip_ratio/low_mean": 0.06739372527226806, "clip_ratio/low_min": 0.06739372527226806, "clip_ratio/high_mean": 0.01481729093939066, "clip_ratio/high_max": 0.01481729093939066, "clip_ratio/region_mean": 0.08221101621165872, "reward_total_mean": 0.103962741792202, "reward_meter_mean": 0.12548930943012238, "reward_meter_std": 0.16755937039852142, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9460666179656982, "reward_lexical_plausibility_std": 0.1525467336177826, "reward_repeat_penalty_mean": 0.7169134616851807, "reward_repeat_penalty_std": 0.2304912954568863, "reward_repeat_floor_mean": 0.9687427282333374, "reward_repeat_floor_std": 0.02760075405240059, "reward_near_duplicate_penalty_mean": 0.9079367518424988, "reward_near_duplicate_penalty_std": 0.07836468517780304, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9103026390075684, "reward_distinct_2_std": 0.11174733191728592, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.35087648034095764, "reward_total_composite_mean": 0.103962741792202, "reward_total_composite_std": 0.15143881738185883} {"timestamp_utc": "2026-04-12T21:30:14Z", "mode": "train", "global_step": 1445, "epoch": 0.07604862901952529, "loss": -0.0874, "grad_norm": 2.906337261199951, "learning_rate": 5.624242424242424e-06, "num_tokens": 2556547.0, "completions/mean_length": 98.625, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 39.57143020629883, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.8600119352340698, "rewards/meter/std": 0.34526491165161133, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9370453357696533, "rewards/lexical_plausibility/std": 0.17806260287761688, "rewards/judge_quality/mean": 0.42500001192092896, "rewards/judge_quality/std": 0.19086270034313202, "rewards/repeat_penalty/mean": 0.9552587270736694, "rewards/repeat_penalty/std": 0.08494306355714798, "rewards/repeat_floor/mean": 0.9961013197898865, "rewards/repeat_floor/std": 0.005262878257781267, "rewards/near_duplicate_penalty/mean": 0.9865087270736694, "rewards/near_duplicate_penalty/std": 0.01914379559457302, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4105956554412842, "rewards/total_composite/std": 0.2022566795349121, "reward": 0.4105956554412842, "reward_std": 0.2022566944360733, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15023012459278107, "sampling/sampling_logp_difference/max": 1.6220568418502808, "sampling/importance_sampling_ratio/min": 0.1974920630455017, "sampling/importance_sampling_ratio/mean": 1.0156630277633667, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9702880829572678, "clip_ratio/low_mean": 0.01923076994717121, "clip_ratio/low_min": 0.01923076994717121, "clip_ratio/high_mean": 0.12259170645847917, "clip_ratio/high_max": 0.12259170645847917, "clip_ratio/region_mean": 0.14182247640565038, "reward_total_mean": 0.4105956554412842, "reward_meter_mean": 0.8600119352340698, "reward_meter_std": 0.34526491165161133, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9370453357696533, "reward_lexical_plausibility_std": 0.17806260287761688, "reward_repeat_penalty_mean": 0.9552587270736694, "reward_repeat_penalty_std": 0.08494306355714798, "reward_repeat_floor_mean": 0.9961013197898865, "reward_repeat_floor_std": 0.005262878257781267, "reward_near_duplicate_penalty_mean": 0.9865087270736694, "reward_near_duplicate_penalty_std": 0.01914379559457302, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42500001192092896, "reward_judge_quality_std": 0.19086270034313202, "reward_total_composite_mean": 0.4105956554412842, "reward_total_composite_std": 0.2022566795349121} {"timestamp_utc": "2026-04-12T21:30:24Z", "mode": "train", "global_step": 1446, "epoch": 0.07610125782853534, "loss": 0.0723, "grad_norm": 10.862899780273438, "learning_rate": 5.6212121212121215e-06, "num_tokens": 2558358.0, "completions/mean_length": 68.375, "completions/min_length": 62.0, "completions/max_length": 90.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 68.375, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 90.0, "rewards/meter/mean": 0.6186676025390625, "rewards/meter/std": 0.28509220480918884, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48749998211860657, "rewards/judge_quality/std": 0.14078859984874725, "rewards/repeat_penalty/mean": 0.9670566916465759, "rewards/repeat_penalty/std": 0.05191989988088608, "rewards/repeat_floor/mean": 0.9961279630661011, "rewards/repeat_floor/std": 0.005744150374084711, "rewards/near_duplicate_penalty/mean": 0.9859901666641235, "rewards/near_duplicate_penalty/std": 0.016596216708421707, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9803271293640137, "rewards/distinct_2/std": 0.039262957870960236, "rewards/total_composite/mean": 0.29716455936431885, "rewards/total_composite/std": 0.19716593623161316, "reward": 0.29716455936431885, "reward_std": 0.19716592133045197, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10598771274089813, "sampling/sampling_logp_difference/max": 1.25407075881958, "sampling/importance_sampling_ratio/min": 0.2853408753871918, "sampling/importance_sampling_ratio/mean": 1.0259636640548706, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8285898119211197, "clip_ratio/low_mean": 0.06666329968720675, "clip_ratio/low_min": 0.06666329968720675, "clip_ratio/high_mean": 0.033678301610052586, "clip_ratio/high_max": 0.033678301610052586, "clip_ratio/region_mean": 0.10034160129725933, "reward_total_mean": 0.29716455936431885, "reward_meter_mean": 0.6186676025390625, "reward_meter_std": 0.28509220480918884, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9670566916465759, "reward_repeat_penalty_std": 0.05191989988088608, "reward_repeat_floor_mean": 0.9961279630661011, "reward_repeat_floor_std": 0.005744150374084711, "reward_near_duplicate_penalty_mean": 0.9859901666641235, "reward_near_duplicate_penalty_std": 0.016596216708421707, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9803271293640137, "reward_distinct_2_std": 0.039262957870960236, "reward_judge_quality_mean": 0.48749998211860657, "reward_judge_quality_std": 0.14078859984874725, "reward_total_composite_mean": 0.29716455936431885, "reward_total_composite_std": 0.19716593623161316} {"timestamp_utc": "2026-04-12T21:30:33Z", "mode": "train", "global_step": 1447, "epoch": 0.0761538866375454, "loss": 0.2793, "grad_norm": 12.900527954101562, "learning_rate": 5.618181818181818e-06, "num_tokens": 2559791.0, "completions/mean_length": 33.125, "completions/min_length": 19.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.125, "completions/min_terminated_length": 19.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.9007810354232788, "rewards/meter/std": 0.13912810385227203, "rewards/count_adherence/mean": 0.375, "rewards/count_adherence/std": 0.5175492167472839, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8125, "rewards/count_floor/std": 0.15526476502418518, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5174999833106995, "rewards/judge_quality/std": 0.26868730783462524, "rewards/repeat_penalty/mean": 0.8558162450790405, "rewards/repeat_penalty/std": 0.14621999859809875, "rewards/repeat_floor/mean": 0.9869076013565063, "rewards/repeat_floor/std": 0.01457811426371336, "rewards/near_duplicate_penalty/mean": 0.9607065916061401, "rewards/near_duplicate_penalty/std": 0.06303125619888306, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9825174808502197, "rewards/distinct_2/std": 0.049448031932115555, "rewards/total_composite/mean": 0.42034912109375, "rewards/total_composite/std": 0.30853331089019775, "reward": 0.42034912109375, "reward_std": 0.30853328108787537, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14884044229984283, "sampling/sampling_logp_difference/max": 2.026609420776367, "sampling/importance_sampling_ratio/min": 0.13178159296512604, "sampling/importance_sampling_ratio/mean": 1.0054724216461182, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8013309985399246, "clip_ratio/low_mean": 0.07981733372434974, "clip_ratio/low_min": 0.07981733372434974, "clip_ratio/high_mean": 0.044407895766198635, "clip_ratio/high_max": 0.044407895766198635, "clip_ratio/region_mean": 0.12422522949054837, "reward_total_mean": 0.42034912109375, "reward_meter_mean": 0.9007810354232788, "reward_meter_std": 0.13912810385227203, "reward_count_adherence_mean": 0.375, "reward_count_adherence_std": 0.5175492167472839, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8125, "reward_count_floor_std": 0.15526476502418518, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8558162450790405, "reward_repeat_penalty_std": 0.14621999859809875, "reward_repeat_floor_mean": 0.9869076013565063, "reward_repeat_floor_std": 0.01457811426371336, "reward_near_duplicate_penalty_mean": 0.9607065916061401, "reward_near_duplicate_penalty_std": 0.06303125619888306, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9825174808502197, "reward_distinct_2_std": 0.049448031932115555, "reward_judge_quality_mean": 0.5174999833106995, "reward_judge_quality_std": 0.26868730783462524, "reward_total_composite_mean": 0.42034912109375, "reward_total_composite_std": 0.30853331089019775} {"timestamp_utc": "2026-04-12T21:30:47Z", "mode": "train", "global_step": 1448, "epoch": 0.07620651544655545, "loss": -0.0362, "grad_norm": 6.789714336395264, "learning_rate": 5.615151515151516e-06, "num_tokens": 2561280.0, "completions/mean_length": 95.125, "completions/min_length": 33.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 35.57143020629883, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.3045957684516907, "rewards/meter/std": 0.21977011859416962, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9153863191604614, "rewards/lexical_plausibility/std": 0.16365289688110352, "rewards/judge_quality/mean": 0.39625000953674316, "rewards/judge_quality/std": 0.2585087716579437, "rewards/repeat_penalty/mean": 0.8437164425849915, "rewards/repeat_penalty/std": 0.18094368278980255, "rewards/repeat_floor/mean": 0.984000563621521, "rewards/repeat_floor/std": 0.0171316210180521, "rewards/near_duplicate_penalty/mean": 0.9471008777618408, "rewards/near_duplicate_penalty/std": 0.04772946611046791, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9728937745094299, "rewards/distinct_2/std": 0.04889722540974617, "rewards/total_composite/mean": 0.12607242166996002, "rewards/total_composite/std": 0.09509876370429993, "reward": 0.12607242166996002, "reward_std": 0.09509876370429993, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13479502499103546, "sampling/sampling_logp_difference/max": 1.485246181488037, "sampling/importance_sampling_ratio/min": 0.22644659876823425, "sampling/importance_sampling_ratio/mean": 1.0138142108917236, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.735356479883194, "clip_ratio/low_mean": 0.023489835672080517, "clip_ratio/low_min": 0.023489835672080517, "clip_ratio/high_mean": 0.043710211757570505, "clip_ratio/high_max": 0.043710211757570505, "clip_ratio/region_mean": 0.06720004742965102, "reward_total_mean": 0.12607242166996002, "reward_meter_mean": 0.3045957684516907, "reward_meter_std": 0.21977011859416962, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9153863191604614, "reward_lexical_plausibility_std": 0.16365289688110352, "reward_repeat_penalty_mean": 0.8437164425849915, "reward_repeat_penalty_std": 0.18094368278980255, "reward_repeat_floor_mean": 0.984000563621521, "reward_repeat_floor_std": 0.0171316210180521, "reward_near_duplicate_penalty_mean": 0.9471008777618408, "reward_near_duplicate_penalty_std": 0.04772946611046791, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9728937745094299, "reward_distinct_2_std": 0.04889722540974617, "reward_judge_quality_mean": 0.39625000953674316, "reward_judge_quality_std": 0.2585087716579437, "reward_total_composite_mean": 0.12607242166996002, "reward_total_composite_std": 0.09509876370429993} {"timestamp_utc": "2026-04-12T21:31:01Z", "mode": "train", "global_step": 1449, "epoch": 0.0762591442555655, "loss": -0.05, "grad_norm": 6.012845039367676, "learning_rate": 5.612121212121212e-06, "num_tokens": 2562859.0, "completions/mean_length": 94.375, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 34.71428680419922, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.5517988204956055, "rewards/meter/std": 0.3980918228626251, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9247732162475586, "rewards/lexical_plausibility/std": 0.17357861995697021, "rewards/judge_quality/mean": 0.3374999761581421, "rewards/judge_quality/std": 0.1552647352218628, "rewards/repeat_penalty/mean": 0.9935404062271118, "rewards/repeat_penalty/std": 0.0078064752742648125, "rewards/repeat_floor/mean": 0.9990310668945312, "rewards/repeat_floor/std": 0.0011709689861163497, "rewards/near_duplicate_penalty/mean": 0.9935404062271118, "rewards/near_duplicate_penalty/std": 0.0078064752742648125, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.18930363655090332, "rewards/total_composite/std": 0.15464147925376892, "reward": 0.18930363655090332, "reward_std": 0.15464146435260773, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15794429183006287, "sampling/sampling_logp_difference/max": 1.5865812301635742, "sampling/importance_sampling_ratio/min": 0.2046239674091339, "sampling/importance_sampling_ratio/mean": 1.0130412578582764, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9310573041439056, "clip_ratio/low_mean": 0.07002380397170782, "clip_ratio/low_min": 0.07002380397170782, "clip_ratio/high_mean": 0.03570431470870972, "clip_ratio/high_max": 0.03570431470870972, "clip_ratio/region_mean": 0.10572811868041754, "reward_total_mean": 0.18930363655090332, "reward_meter_mean": 0.5517988204956055, "reward_meter_std": 0.3980918228626251, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9247732162475586, "reward_lexical_plausibility_std": 0.17357861995697021, "reward_repeat_penalty_mean": 0.9935404062271118, "reward_repeat_penalty_std": 0.0078064752742648125, "reward_repeat_floor_mean": 0.9990310668945312, "reward_repeat_floor_std": 0.0011709689861163497, "reward_near_duplicate_penalty_mean": 0.9935404062271118, "reward_near_duplicate_penalty_std": 0.0078064752742648125, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3374999761581421, "reward_judge_quality_std": 0.1552647352218628, "reward_total_composite_mean": 0.18930363655090332, "reward_total_composite_std": 0.15464147925376892} {"timestamp_utc": "2026-04-12T21:31:11Z", "mode": "train", "global_step": 1450, "epoch": 0.07631177306457555, "loss": 0.1182, "grad_norm": 13.827315330505371, "learning_rate": 5.60909090909091e-06, "num_tokens": 2564522.0, "completions/mean_length": 50.875, "completions/min_length": 43.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 50.875, "completions/min_terminated_length": 43.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.9243301749229431, "rewards/meter/std": 0.06853026896715164, "rewards/count_adherence/mean": 0.7916666865348816, "rewards/count_adherence/std": 0.17251639068126678, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9375, "rewards/count_floor/std": 0.05175492912530899, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.30933108925819397, "rewards/repeat_penalty/mean": 0.9664291143417358, "rewards/repeat_penalty/std": 0.06967398524284363, "rewards/repeat_floor/mean": 0.9959158897399902, "rewards/repeat_floor/std": 0.007901218719780445, "rewards/near_duplicate_penalty/mean": 0.9839391112327576, "rewards/near_duplicate_penalty/std": 0.026036009192466736, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.981389582157135, "rewards/distinct_2/std": 0.052638232707977295, "rewards/total_composite/mean": 0.5376390814781189, "rewards/total_composite/std": 0.24836792051792145, "reward": 0.5376390814781189, "reward_std": 0.24836792051792145, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11453325301408768, "sampling/sampling_logp_difference/max": 1.2618434429168701, "sampling/importance_sampling_ratio/min": 0.28313159942626953, "sampling/importance_sampling_ratio/mean": 1.0313094854354858, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8031835108995438, "clip_ratio/low_mean": 0.07638262957334518, "clip_ratio/low_min": 0.07638262957334518, "clip_ratio/high_mean": 0.0561265810392797, "clip_ratio/high_max": 0.0561265810392797, "clip_ratio/region_mean": 0.13250921061262488, "reward_total_mean": 0.5376390814781189, "reward_meter_mean": 0.9243301749229431, "reward_meter_std": 0.06853026896715164, "reward_count_adherence_mean": 0.7916666865348816, "reward_count_adherence_std": 0.17251639068126678, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9375, "reward_count_floor_std": 0.05175492912530899, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9664291143417358, "reward_repeat_penalty_std": 0.06967398524284363, "reward_repeat_floor_mean": 0.9959158897399902, "reward_repeat_floor_std": 0.007901218719780445, "reward_near_duplicate_penalty_mean": 0.9839391112327576, "reward_near_duplicate_penalty_std": 0.026036009192466736, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.981389582157135, "reward_distinct_2_std": 0.052638232707977295, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.30933108925819397, "reward_total_composite_mean": 0.5376390814781189, "reward_total_composite_std": 0.24836792051792145} {"timestamp_utc": "2026-04-12T21:33:08Z", "mode": "eval", "global_step": 1450, "epoch": 0.07631177306457555, "eval_loss": NaN, "eval_runtime": 116.8578, "eval_samples_per_second": 0.89, "eval_steps_per_second": 0.111, "eval_num_tokens": 2564522.0, "eval_completions/mean_length": 123.38461538461539, "eval_completions/min_length": 36.07692307692308, "eval_completions/max_length": 314.84615384615387, "eval_completions/clipped_ratio": 0.057692307692307696, "eval_completions/mean_terminated_length": 99.989012498122, "eval_completions/min_terminated_length": 36.07692307692308, "eval_completions/max_terminated_length": 193.53846153846155, "eval_rewards/meter/mean": 0.4948628590657161, "eval_rewards/meter/std": 0.3793173890847426, "eval_rewards/count_adherence/mean": 0.7469225571705744, "eval_rewards/count_adherence/std": 0.1673047777551871, "eval_rewards/arabic_clean/mean": 0.9038461538461539, "eval_rewards/arabic_clean/std": 0.21561105434711164, "eval_rewards/hard_gate/mean": 1.0, "eval_rewards/hard_gate/std": 0.0, "eval_rewards/arabic_floor/mean": 0.9985576913906977, "eval_rewards/arabic_floor/std": 0.004079461670838869, "eval_rewards/count_floor/mean": 0.9240767772381122, "eval_rewards/count_floor/std": 0.050191439115084134, "eval_rewards/lexical_plausibility/mean": 0.974945774445167, "eval_rewards/lexical_plausibility/std": 0.06377692921803547, "eval_rewards/judge_quality/mean": 0.42788461309212905, "eval_rewards/judge_quality/std": 0.1789561833899755, "eval_rewards/repeat_penalty/mean": 0.8445180150178763, "eval_rewards/repeat_penalty/std": 0.17082588661175507, "eval_rewards/repeat_floor/mean": 0.9832773712965158, "eval_rewards/repeat_floor/std": 0.018256844236300543, "eval_rewards/near_duplicate_penalty/mean": 0.9598250480798575, "eval_rewards/near_duplicate_penalty/std": 0.03725613632167761, "eval_rewards/opening_diversity/mean": 0.9624566665062537, "eval_rewards/opening_diversity/std": 0.08163573478276913, "eval_rewards/distinct_2/mean": 0.9061803038303669, "eval_rewards/distinct_2/std": 0.1165417289504638, "eval_rewards/total_composite/mean": 0.20722378847690728, "eval_rewards/total_composite/std": 0.21472871933992094, "eval_reward": 0.20722378847690728, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.07099351286888123, "eval_sampling/sampling_logp_difference/max": 1.083869824042687, "eval_sampling/importance_sampling_ratio/min": 0.3429002177256804, "eval_sampling/importance_sampling_ratio/mean": 1.0191162091035109, "eval_sampling/importance_sampling_ratio/max": 1.4892533467366145, "eval_entropy": 0.8099038279973544, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.20722378847690728, "eval_reward_meter_mean": 0.4948628590657161, "eval_reward_meter_std": 0.3793173890847426, "eval_reward_count_adherence_mean": 0.7469225571705744, "eval_reward_count_adherence_std": 0.1673047777551871, "eval_reward_arabic_clean_mean": 0.9038461538461539, "eval_reward_arabic_clean_std": 0.21561105434711164, "eval_reward_hard_gate_mean": 1.0, "eval_reward_hard_gate_std": 0.0, "eval_reward_arabic_floor_mean": 0.9985576913906977, "eval_reward_arabic_floor_std": 0.004079461670838869, "eval_reward_count_floor_mean": 0.9240767772381122, "eval_reward_count_floor_std": 0.050191439115084134, "eval_reward_lexical_plausibility_mean": 0.974945774445167, "eval_reward_lexical_plausibility_std": 0.06377692921803547, "eval_reward_repeat_penalty_mean": 0.8445180150178763, "eval_reward_repeat_penalty_std": 0.17082588661175507, "eval_reward_repeat_floor_mean": 0.9832773712965158, "eval_reward_repeat_floor_std": 0.018256844236300543, "eval_reward_near_duplicate_penalty_mean": 0.9598250480798575, "eval_reward_near_duplicate_penalty_std": 0.03725613632167761, "eval_reward_opening_diversity_mean": 0.9624566665062537, "eval_reward_opening_diversity_std": 0.08163573478276913, "eval_reward_distinct_2_mean": 0.9061803038303669, "eval_reward_distinct_2_std": 0.1165417289504638, "eval_reward_judge_quality_mean": 0.42788461309212905, "eval_reward_judge_quality_std": 0.1789561833899755, "eval_reward_total_composite_mean": 0.20722378847690728, "eval_reward_total_composite_std": 0.21472871933992094} {"timestamp_utc": "2026-04-12T21:33:19Z", "mode": "train", "global_step": 1451, "epoch": 0.0763644018735856, "loss": -0.0245, "grad_norm": 15.212316513061523, "learning_rate": 5.606060606060606e-06, "num_tokens": 2565929.0, "completions/mean_length": 18.875, "completions/min_length": 18.0, "completions/max_length": 21.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 18.875, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.6307111978530884, "rewards/meter/std": 0.5018659234046936, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.852787971496582, "rewards/lexical_plausibility/std": 0.17906473577022552, "rewards/judge_quality/mean": 0.8462499976158142, "rewards/judge_quality/std": 0.28152328729629517, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.48879387974739075, "rewards/total_composite/std": 0.46672311425209045, "reward": 0.48879387974739075, "reward_std": 0.46672311425209045, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10528997331857681, "sampling/sampling_logp_difference/max": 0.9088325500488281, "sampling/importance_sampling_ratio/min": 0.40660393238067627, "sampling/importance_sampling_ratio/mean": 1.0172096490859985, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5657436288893223, "clip_ratio/low_mean": 0.0486111119389534, "clip_ratio/low_min": 0.0486111119389534, "clip_ratio/high_mean": 0.042888471856713295, "clip_ratio/high_max": 0.042888471856713295, "clip_ratio/region_mean": 0.0914995837956667, "reward_total_mean": 0.48879387974739075, "reward_meter_mean": 0.6307111978530884, "reward_meter_std": 0.5018659234046936, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.852787971496582, "reward_lexical_plausibility_std": 0.17906473577022552, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.8462499976158142, "reward_judge_quality_std": 0.28152328729629517, "reward_total_composite_mean": 0.48879387974739075, "reward_total_composite_std": 0.46672311425209045} {"timestamp_utc": "2026-04-12T21:33:29Z", "mode": "train", "global_step": 1452, "epoch": 0.07641703068259566, "loss": 0.0865, "grad_norm": 15.49891471862793, "learning_rate": 5.603030303030303e-06, "num_tokens": 2567597.0, "completions/mean_length": 42.5, "completions/min_length": 35.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.5, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.7769848108291626, "rewards/meter/std": 0.3613482415676117, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9822304248809814, "rewards/lexical_plausibility/std": 0.0502600334584713, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.09258200228214264, "rewards/repeat_penalty/mean": 0.98424232006073, "rewards/repeat_penalty/std": 0.03573727235198021, "rewards/repeat_floor/mean": 0.9981409311294556, "rewards/repeat_floor/std": 0.003948426805436611, "rewards/near_duplicate_penalty/mean": 0.9931008815765381, "rewards/near_duplicate_penalty/std": 0.011313963681459427, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9908424615859985, "rewards/distinct_2/std": 0.025901345536112785, "rewards/total_composite/mean": 0.27035024762153625, "rewards/total_composite/std": 0.15232446789741516, "reward": 0.27035024762153625, "reward_std": 0.15232446789741516, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1547611951828003, "sampling/sampling_logp_difference/max": 1.599407434463501, "sampling/importance_sampling_ratio/min": 0.2020161896944046, "sampling/importance_sampling_ratio/mean": 1.0268700122833252, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8347392901778221, "clip_ratio/low_mean": 0.05114811006933451, "clip_ratio/low_min": 0.05114811006933451, "clip_ratio/high_mean": 0.0972203891724348, "clip_ratio/high_max": 0.0972203891724348, "clip_ratio/region_mean": 0.1483684992417693, "reward_total_mean": 0.27035024762153625, "reward_meter_mean": 0.7769848108291626, "reward_meter_std": 0.3613482415676117, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9822304248809814, "reward_lexical_plausibility_std": 0.0502600334584713, "reward_repeat_penalty_mean": 0.98424232006073, "reward_repeat_penalty_std": 0.03573727235198021, "reward_repeat_floor_mean": 0.9981409311294556, "reward_repeat_floor_std": 0.003948426805436611, "reward_near_duplicate_penalty_mean": 0.9931008815765381, "reward_near_duplicate_penalty_std": 0.011313963681459427, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9908424615859985, "reward_distinct_2_std": 0.025901345536112785, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.09258200228214264, "reward_total_composite_mean": 0.27035024762153625, "reward_total_composite_std": 0.15232446789741516} {"timestamp_utc": "2026-04-12T21:33:38Z", "mode": "train", "global_step": 1453, "epoch": 0.07646965949160571, "loss": 0.0524, "grad_norm": 12.834370613098145, "learning_rate": 5.600000000000001e-06, "num_tokens": 2569359.0, "completions/mean_length": 53.25, "completions/min_length": 45.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.25, "completions/min_terminated_length": 45.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.6973351240158081, "rewards/meter/std": 0.4103483259677887, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.9479973316192627, "rewards/repeat_penalty/std": 0.06794706732034683, "rewards/repeat_floor/mean": 0.9937500953674316, "rewards/repeat_floor/std": 0.007863028906285763, "rewards/near_duplicate_penalty/mean": 0.976303219795227, "rewards/near_duplicate_penalty/std": 0.026468992233276367, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9700506925582886, "rewards/distinct_2/std": 0.04615097492933273, "rewards/total_composite/mean": 0.2968471944332123, "rewards/total_composite/std": 0.17945891618728638, "reward": 0.2968471944332123, "reward_std": 0.17945891618728638, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14051197469234467, "sampling/sampling_logp_difference/max": 1.5314531326293945, "sampling/importance_sampling_ratio/min": 0.21622124314308167, "sampling/importance_sampling_ratio/mean": 1.0060518980026245, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9625870659947395, "clip_ratio/low_mean": 0.04444444552063942, "clip_ratio/low_min": 0.04444444552063942, "clip_ratio/high_mean": 0.07614768436178565, "clip_ratio/high_max": 0.07614768436178565, "clip_ratio/region_mean": 0.12059212988242507, "reward_total_mean": 0.2968471944332123, "reward_meter_mean": 0.6973351240158081, "reward_meter_std": 0.4103483259677887, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9479973316192627, "reward_repeat_penalty_std": 0.06794706732034683, "reward_repeat_floor_mean": 0.9937500953674316, "reward_repeat_floor_std": 0.007863028906285763, "reward_near_duplicate_penalty_mean": 0.976303219795227, "reward_near_duplicate_penalty_std": 0.026468992233276367, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9700506925582886, "reward_distinct_2_std": 0.04615097492933273, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.2968471944332123, "reward_total_composite_std": 0.17945891618728638} {"timestamp_utc": "2026-04-12T21:33:48Z", "mode": "train", "global_step": 1454, "epoch": 0.07652228830061576, "loss": 0.0128, "grad_norm": 9.163919448852539, "learning_rate": 5.596969696969697e-06, "num_tokens": 2571715.0, "completions/mean_length": 87.5, "completions/min_length": 77.0, "completions/max_length": 97.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 87.5, "completions/min_terminated_length": 77.0, "completions/max_terminated_length": 97.0, "rewards/meter/mean": 0.844443678855896, "rewards/meter/std": 0.23527929186820984, "rewards/count_adherence/mean": 0.5892857313156128, "rewards/count_adherence/std": 0.05050762742757797, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8767856955528259, "rewards/count_floor/std": 0.015152297914028168, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9178019165992737, "rewards/repeat_penalty/std": 0.025992587208747864, "rewards/repeat_floor/mean": 0.9889581203460693, "rewards/repeat_floor/std": 0.0027362657710909843, "rewards/near_duplicate_penalty/mean": 0.9412369728088379, "rewards/near_duplicate_penalty/std": 0.014868483878672123, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9752515554428101, "rewards/distinct_2/std": 0.029101964086294174, "rewards/total_composite/mean": 0.32958167791366577, "rewards/total_composite/std": 0.09200555831193924, "reward": 0.32958167791366577, "reward_std": 0.09200555086135864, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1267203837633133, "sampling/sampling_logp_difference/max": 4.170647144317627, "sampling/importance_sampling_ratio/min": 0.015442264266312122, "sampling/importance_sampling_ratio/mean": 0.9946044683456421, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5722476579248905, "clip_ratio/low_mean": 0.02560240961611271, "clip_ratio/low_min": 0.02560240961611271, "clip_ratio/high_mean": 0.09039441123604774, "clip_ratio/high_max": 0.09039441123604774, "clip_ratio/region_mean": 0.11599682085216045, "reward_total_mean": 0.32958167791366577, "reward_meter_mean": 0.844443678855896, "reward_meter_std": 0.23527929186820984, "reward_count_adherence_mean": 0.5892857313156128, "reward_count_adherence_std": 0.05050762742757797, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8767856955528259, "reward_count_floor_std": 0.015152297914028168, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9178019165992737, "reward_repeat_penalty_std": 0.025992587208747864, "reward_repeat_floor_mean": 0.9889581203460693, "reward_repeat_floor_std": 0.0027362657710909843, "reward_near_duplicate_penalty_mean": 0.9412369728088379, "reward_near_duplicate_penalty_std": 0.014868483878672123, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9752515554428101, "reward_distinct_2_std": 0.029101964086294174, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.32958167791366577, "reward_total_composite_std": 0.09200555831193924} {"timestamp_utc": "2026-04-12T21:34:02Z", "mode": "train", "global_step": 1455, "epoch": 0.07657491710962581, "loss": -0.0348, "grad_norm": 4.8910017013549805, "learning_rate": 5.593939393939395e-06, "num_tokens": 2573015.0, "completions/mean_length": 81.5, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.0, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.7246298789978027, "rewards/meter/std": 0.4203140139579773, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.7343491315841675, "rewards/lexical_plausibility/std": 0.3033807873725891, "rewards/judge_quality/mean": 0.6349999904632568, "rewards/judge_quality/std": 0.33161941170692444, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.544529139995575, "rewards/total_composite/std": 0.38631463050842285, "reward": 0.544529139995575, "reward_std": 0.38631460070610046, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18220755457878113, "sampling/sampling_logp_difference/max": 1.6146444082260132, "sampling/importance_sampling_ratio/min": 0.19896140694618225, "sampling/importance_sampling_ratio/mean": 1.0120280981063843, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8820024505257607, "clip_ratio/low_mean": 0.03759398451074958, "clip_ratio/low_min": 0.03759398451074958, "clip_ratio/high_mean": 0.05915404297411442, "clip_ratio/high_max": 0.05915404297411442, "clip_ratio/region_mean": 0.096748027484864, "reward_total_mean": 0.544529139995575, "reward_meter_mean": 0.7246298789978027, "reward_meter_std": 0.4203140139579773, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.7343491315841675, "reward_lexical_plausibility_std": 0.3033807873725891, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6349999904632568, "reward_judge_quality_std": 0.33161941170692444, "reward_total_composite_mean": 0.544529139995575, "reward_total_composite_std": 0.38631463050842285} {"timestamp_utc": "2026-04-12T21:34:12Z", "mode": "train", "global_step": 1456, "epoch": 0.07662754591863587, "loss": -0.0021, "grad_norm": 10.771652221679688, "learning_rate": 5.5909090909090915e-06, "num_tokens": 2574660.0, "completions/mean_length": 59.625, "completions/min_length": 51.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 59.625, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.7960054874420166, "rewards/meter/std": 0.33846190571784973, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.7404118180274963, "rewards/repeat_penalty/std": 0.21907556056976318, "rewards/repeat_floor/mean": 0.973548412322998, "rewards/repeat_floor/std": 0.021930187940597534, "rewards/near_duplicate_penalty/mean": 0.9327205419540405, "rewards/near_duplicate_penalty/std": 0.045159511268138885, "rewards/opening_diversity/mean": 0.9071428775787354, "rewards/opening_diversity/std": 0.173793226480484, "rewards/distinct_2/mean": 0.8801308274269104, "rewards/distinct_2/std": 0.08492591232061386, "rewards/total_composite/mean": 0.2411336600780487, "rewards/total_composite/std": 0.14135272800922394, "reward": 0.2411336600780487, "reward_std": 0.14135274291038513, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12735137343406677, "sampling/sampling_logp_difference/max": 1.7067031860351562, "sampling/importance_sampling_ratio/min": 0.1814630627632141, "sampling/importance_sampling_ratio/mean": 1.014919638633728, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7837313786149025, "clip_ratio/low_mean": 0.02834524679929018, "clip_ratio/low_min": 0.02834524679929018, "clip_ratio/high_mean": 0.06697310274466872, "clip_ratio/high_max": 0.06697310274466872, "clip_ratio/region_mean": 0.0953183495439589, "reward_total_mean": 0.2411336600780487, "reward_meter_mean": 0.7960054874420166, "reward_meter_std": 0.33846190571784973, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7404118180274963, "reward_repeat_penalty_std": 0.21907556056976318, "reward_repeat_floor_mean": 0.973548412322998, "reward_repeat_floor_std": 0.021930187940597534, "reward_near_duplicate_penalty_mean": 0.9327205419540405, "reward_near_duplicate_penalty_std": 0.045159511268138885, "reward_opening_diversity_mean": 0.9071428775787354, "reward_opening_diversity_std": 0.173793226480484, "reward_distinct_2_mean": 0.8801308274269104, "reward_distinct_2_std": 0.08492591232061386, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.2411336600780487, "reward_total_composite_std": 0.14135272800922394} {"timestamp_utc": "2026-04-12T21:34:22Z", "mode": "train", "global_step": 1457, "epoch": 0.07668017472764592, "loss": -0.0128, "grad_norm": 10.029252052307129, "learning_rate": 5.587878787878789e-06, "num_tokens": 2577283.0, "completions/mean_length": 103.875, "completions/min_length": 80.0, "completions/max_length": 117.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 103.875, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 117.0, "rewards/meter/mean": 0.5449814796447754, "rewards/meter/std": 0.34511974453926086, "rewards/count_adherence/mean": 0.7291666865348816, "rewards/count_adherence/std": 0.0862581729888916, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9187499284744263, "rewards/count_floor/std": 0.025877466425299644, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42124998569488525, "rewards/judge_quality/std": 0.20152543485164642, "rewards/repeat_penalty/mean": 0.992195188999176, "rewards/repeat_penalty/std": 0.004715257324278355, "rewards/repeat_floor/mean": 0.9988293051719666, "rewards/repeat_floor/std": 0.0007072848384268582, "rewards/near_duplicate_penalty/mean": 0.992195188999176, "rewards/near_duplicate_penalty/std": 0.004715257324278355, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20172077417373657, "rewards/total_composite/std": 0.12398242205381393, "reward": 0.20172077417373657, "reward_std": 0.12398242205381393, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14147800207138062, "sampling/sampling_logp_difference/max": 4.002121448516846, "sampling/importance_sampling_ratio/min": 0.018276823684573174, "sampling/importance_sampling_ratio/mean": 1.0025047063827515, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7168181985616684, "clip_ratio/low_mean": 0.026059217751026154, "clip_ratio/low_min": 0.026059217751026154, "clip_ratio/high_mean": 0.06202992983162403, "clip_ratio/high_max": 0.06202992983162403, "clip_ratio/region_mean": 0.08808914758265018, "reward_total_mean": 0.20172077417373657, "reward_meter_mean": 0.5449814796447754, "reward_meter_std": 0.34511974453926086, "reward_count_adherence_mean": 0.7291666865348816, "reward_count_adherence_std": 0.0862581729888916, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9187499284744263, "reward_count_floor_std": 0.025877466425299644, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.992195188999176, "reward_repeat_penalty_std": 0.004715257324278355, "reward_repeat_floor_mean": 0.9988293051719666, "reward_repeat_floor_std": 0.0007072848384268582, "reward_near_duplicate_penalty_mean": 0.992195188999176, "reward_near_duplicate_penalty_std": 0.004715257324278355, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.42124998569488525, "reward_judge_quality_std": 0.20152543485164642, "reward_total_composite_mean": 0.20172077417373657, "reward_total_composite_std": 0.12398242205381393} {"timestamp_utc": "2026-04-12T21:34:36Z", "mode": "train", "global_step": 1458, "epoch": 0.07673280353665597, "loss": -0.0324, "grad_norm": 4.993852138519287, "learning_rate": 5.584848484848485e-06, "num_tokens": 2579045.0, "completions/mean_length": 114.25, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 57.42857360839844, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.24118903279304504, "rewards/meter/std": 0.21816526353359222, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.24800792336463928, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.07440238445997238, "rewards/lexical_plausibility/mean": 0.9310699105262756, "rewards/lexical_plausibility/std": 0.1949637234210968, "rewards/judge_quality/mean": 0.4099999964237213, "rewards/judge_quality/std": 0.24041630327701569, "rewards/repeat_penalty/mean": 0.9280463457107544, "rewards/repeat_penalty/std": 0.07874472439289093, "rewards/repeat_floor/mean": 0.9930820465087891, "rewards/repeat_floor/std": 0.004956471733748913, "rewards/near_duplicate_penalty/mean": 0.977810800075531, "rewards/near_duplicate_penalty/std": 0.019915655255317688, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.980948805809021, "rewards/distinct_2/std": 0.026327626779675484, "rewards/total_composite/mean": 0.14034301042556763, "rewards/total_composite/std": 0.20952698588371277, "reward": 0.14034301042556763, "reward_std": 0.20952698588371277, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1216459646821022, "sampling/sampling_logp_difference/max": 1.603621482849121, "sampling/importance_sampling_ratio/min": 0.20116667449474335, "sampling/importance_sampling_ratio/mean": 1.011099934577942, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6306528896093369, "clip_ratio/low_mean": 0.0635438822209835, "clip_ratio/low_min": 0.0635438822209835, "clip_ratio/high_mean": 0.013392857275903225, "clip_ratio/high_max": 0.013392857275903225, "clip_ratio/region_mean": 0.07693673949688673, "reward_total_mean": 0.14034301042556763, "reward_meter_mean": 0.24118903279304504, "reward_meter_std": 0.21816526353359222, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.24800792336463928, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.07440238445997238, "reward_lexical_plausibility_mean": 0.9310699105262756, "reward_lexical_plausibility_std": 0.1949637234210968, "reward_repeat_penalty_mean": 0.9280463457107544, "reward_repeat_penalty_std": 0.07874472439289093, "reward_repeat_floor_mean": 0.9930820465087891, "reward_repeat_floor_std": 0.004956471733748913, "reward_near_duplicate_penalty_mean": 0.977810800075531, "reward_near_duplicate_penalty_std": 0.019915655255317688, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.980948805809021, "reward_distinct_2_std": 0.026327626779675484, "reward_judge_quality_mean": 0.4099999964237213, "reward_judge_quality_std": 0.24041630327701569, "reward_total_composite_mean": 0.14034301042556763, "reward_total_composite_std": 0.20952698588371277} {"timestamp_utc": "2026-04-12T21:34:47Z", "mode": "train", "global_step": 1459, "epoch": 0.07678543234566602, "loss": 0.0482, "grad_norm": 11.061907768249512, "learning_rate": 5.5818181818181824e-06, "num_tokens": 2580937.0, "completions/mean_length": 65.5, "completions/min_length": 62.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.5, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.797038197517395, "rewards/meter/std": 0.2192562371492386, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6212500333786011, "rewards/judge_quality/std": 0.26626721024513245, "rewards/repeat_penalty/mean": 0.9703969359397888, "rewards/repeat_penalty/std": 0.034107450395822525, "rewards/repeat_floor/mean": 0.9966459274291992, "rewards/repeat_floor/std": 0.003730526426807046, "rewards/near_duplicate_penalty/mean": 0.9890539050102234, "rewards/near_duplicate_penalty/std": 0.012349693104624748, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9809759855270386, "rewards/distinct_2/std": 0.026260556653141975, "rewards/total_composite/mean": 0.5113263726234436, "rewards/total_composite/std": 0.29251784086227417, "reward": 0.5113263726234436, "reward_std": 0.29251787066459656, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1326427310705185, "sampling/sampling_logp_difference/max": 2.559915542602539, "sampling/importance_sampling_ratio/min": 0.07731126993894577, "sampling/importance_sampling_ratio/mean": 1.0033767223358154, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6349594257771969, "clip_ratio/low_mean": 0.07067729264963418, "clip_ratio/low_min": 0.07067729264963418, "clip_ratio/high_mean": 0.04168027266860008, "clip_ratio/high_max": 0.04168027266860008, "clip_ratio/region_mean": 0.11235756531823426, "reward_total_mean": 0.5113263726234436, "reward_meter_mean": 0.797038197517395, "reward_meter_std": 0.2192562371492386, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9703969359397888, "reward_repeat_penalty_std": 0.034107450395822525, "reward_repeat_floor_mean": 0.9966459274291992, "reward_repeat_floor_std": 0.003730526426807046, "reward_near_duplicate_penalty_mean": 0.9890539050102234, "reward_near_duplicate_penalty_std": 0.012349693104624748, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9809759855270386, "reward_distinct_2_std": 0.026260556653141975, "reward_judge_quality_mean": 0.6212500333786011, "reward_judge_quality_std": 0.26626721024513245, "reward_total_composite_mean": 0.5113263726234436, "reward_total_composite_std": 0.29251784086227417} {"timestamp_utc": "2026-04-12T21:34:55Z", "mode": "train", "global_step": 1460, "epoch": 0.07683806115467606, "loss": 0.0541, "grad_norm": 18.399173736572266, "learning_rate": 5.578787878787879e-06, "num_tokens": 2582536.0, "completions/mean_length": 34.875, "completions/min_length": 31.0, "completions/max_length": 36.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.875, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.26310494542121887, "rewards/meter/std": 0.23746247589588165, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.9200000166893005, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9997294545173645, "rewards/repeat_penalty/std": 0.0007652603671886027, "rewards/repeat_floor/mean": 0.999959409236908, "rewards/repeat_floor/std": 0.00011478694068500772, "rewards/near_duplicate_penalty/mean": 0.9997294545173645, "rewards/near_duplicate_penalty/std": 0.0007652603671886027, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.24205397069454193, "rewards/total_composite/std": 0.2184678614139557, "reward": 0.24205397069454193, "reward_std": 0.21846787631511688, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1296447068452835, "sampling/sampling_logp_difference/max": 1.6458253860473633, "sampling/importance_sampling_ratio/min": 0.19285331666469574, "sampling/importance_sampling_ratio/mean": 0.9987260103225708, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6240876615047455, "clip_ratio/low_mean": 0.060707886004820466, "clip_ratio/low_min": 0.060707886004820466, "clip_ratio/high_mean": 0.06086601410061121, "clip_ratio/high_max": 0.06086601410061121, "clip_ratio/region_mean": 0.12157390010543168, "reward_total_mean": 0.24205397069454193, "reward_meter_mean": 0.26310494542121887, "reward_meter_std": 0.23746247589588165, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9997294545173645, "reward_repeat_penalty_std": 0.0007652603671886027, "reward_repeat_floor_mean": 0.999959409236908, "reward_repeat_floor_std": 0.00011478694068500772, "reward_near_duplicate_penalty_mean": 0.9997294545173645, "reward_near_duplicate_penalty_std": 0.0007652603671886027, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.9200000166893005, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.24205397069454193, "reward_total_composite_std": 0.2184678614139557} {"timestamp_utc": "2026-04-12T21:35:03Z", "mode": "train", "global_step": 1461, "epoch": 0.07689068996368612, "loss": 0.0321, "grad_norm": 16.66950798034668, "learning_rate": 5.575757575757577e-06, "num_tokens": 2584043.0, "completions/mean_length": 39.375, "completions/min_length": 36.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.375, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.6944570541381836, "rewards/meter/std": 0.38515704870224, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4925000071525574, "rewards/judge_quality/std": 0.2796298861503601, "rewards/repeat_penalty/mean": 0.9830665588378906, "rewards/repeat_penalty/std": 0.028471464291214943, "rewards/repeat_floor/mean": 0.9980672597885132, "rewards/repeat_floor/std": 0.0028028227388858795, "rewards/near_duplicate_penalty/mean": 0.9931880235671997, "rewards/near_duplicate_penalty/std": 0.012192907743155956, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.3138124346733093, "rewards/total_composite/std": 0.27168527245521545, "reward": 0.3138124346733093, "reward_std": 0.27168530225753784, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14927981793880463, "sampling/sampling_logp_difference/max": 1.4698505401611328, "sampling/importance_sampling_ratio/min": 0.22995984554290771, "sampling/importance_sampling_ratio/mean": 0.9951277375221252, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8751384690403938, "clip_ratio/low_mean": 0.08426490612328053, "clip_ratio/low_min": 0.08426490612328053, "clip_ratio/high_mean": 0.058296571020036936, "clip_ratio/high_max": 0.058296571020036936, "clip_ratio/region_mean": 0.14256147714331746, "reward_total_mean": 0.3138124346733093, "reward_meter_mean": 0.6944570541381836, "reward_meter_std": 0.38515704870224, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9830665588378906, "reward_repeat_penalty_std": 0.028471464291214943, "reward_repeat_floor_mean": 0.9980672597885132, "reward_repeat_floor_std": 0.0028028227388858795, "reward_near_duplicate_penalty_mean": 0.9931880235671997, "reward_near_duplicate_penalty_std": 0.012192907743155956, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.4925000071525574, "reward_judge_quality_std": 0.2796298861503601, "reward_total_composite_mean": 0.3138124346733093, "reward_total_composite_std": 0.27168527245521545} {"timestamp_utc": "2026-04-12T21:35:12Z", "mode": "train", "global_step": 1462, "epoch": 0.07694331877269617, "loss": 0.0702, "grad_norm": 16.789833068847656, "learning_rate": 5.572727272727273e-06, "num_tokens": 2585502.0, "completions/mean_length": 34.375, "completions/min_length": 30.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.375, "completions/min_terminated_length": 30.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.7005495429039001, "rewards/meter/std": 0.37462905049324036, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6725000143051147, "rewards/judge_quality/std": 0.2666056752204895, "rewards/repeat_penalty/mean": 0.9376727342605591, "rewards/repeat_penalty/std": 0.06537135690450668, "rewards/repeat_floor/mean": 0.9915980100631714, "rewards/repeat_floor/std": 0.008354512974619865, "rewards/near_duplicate_penalty/mean": 0.9558917284011841, "rewards/near_duplicate_penalty/std": 0.03984785079956055, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9801586866378784, "rewards/distinct_2/std": 0.036883533000946045, "rewards/total_composite/mean": 0.48158371448516846, "rewards/total_composite/std": 0.3427993059158325, "reward": 0.48158371448516846, "reward_std": 0.3427993059158325, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1685110330581665, "sampling/sampling_logp_difference/max": 1.707540512084961, "sampling/importance_sampling_ratio/min": 0.18131117522716522, "sampling/importance_sampling_ratio/mean": 1.0167186260223389, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.1643597856163979, "clip_ratio/low_mean": 0.09971459209918976, "clip_ratio/low_min": 0.09971459209918976, "clip_ratio/high_mean": 0.04715909156948328, "clip_ratio/high_max": 0.04715909156948328, "clip_ratio/region_mean": 0.14687368366867304, "reward_total_mean": 0.48158371448516846, "reward_meter_mean": 0.7005495429039001, "reward_meter_std": 0.37462905049324036, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9376727342605591, "reward_repeat_penalty_std": 0.06537135690450668, "reward_repeat_floor_mean": 0.9915980100631714, "reward_repeat_floor_std": 0.008354512974619865, "reward_near_duplicate_penalty_mean": 0.9558917284011841, "reward_near_duplicate_penalty_std": 0.03984785079956055, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9801586866378784, "reward_distinct_2_std": 0.036883533000946045, "reward_judge_quality_mean": 0.6725000143051147, "reward_judge_quality_std": 0.2666056752204895, "reward_total_composite_mean": 0.48158371448516846, "reward_total_composite_std": 0.3427993059158325} {"timestamp_utc": "2026-04-12T21:35:21Z", "mode": "train", "global_step": 1463, "epoch": 0.07699594758170622, "loss": -0.0049, "grad_norm": 17.285612106323242, "learning_rate": 5.569696969696971e-06, "num_tokens": 2587018.0, "completions/mean_length": 31.5, "completions/min_length": 29.0, "completions/max_length": 33.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 31.5, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 33.0, "rewards/meter/mean": 0.41260722279548645, "rewards/meter/std": 0.40489640831947327, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5037499666213989, "rewards/judge_quality/std": 0.2209678441286087, "rewards/repeat_penalty/mean": 0.9876722693443298, "rewards/repeat_penalty/std": 0.01332098338752985, "rewards/repeat_floor/mean": 0.9981508255004883, "rewards/repeat_floor/std": 0.0019981428049504757, "rewards/near_duplicate_penalty/mean": 0.9876722693443298, "rewards/near_duplicate_penalty/std": 0.01332098338752985, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.19124242663383484, "rewards/total_composite/std": 0.24342593550682068, "reward": 0.19124242663383484, "reward_std": 0.24342593550682068, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11594981700181961, "sampling/sampling_logp_difference/max": 1.809114933013916, "sampling/importance_sampling_ratio/min": 0.16379904747009277, "sampling/importance_sampling_ratio/mean": 0.9999021887779236, "sampling/importance_sampling_ratio/max": 1.8358376026153564, "entropy": 0.7771306931972504, "clip_ratio/low_mean": 0.09983001556247473, "clip_ratio/low_min": 0.09983001556247473, "clip_ratio/high_mean": 0.03042140230536461, "clip_ratio/high_max": 0.03042140230536461, "clip_ratio/region_mean": 0.13025141786783934, "reward_total_mean": 0.19124242663383484, "reward_meter_mean": 0.41260722279548645, "reward_meter_std": 0.40489640831947327, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9876722693443298, "reward_repeat_penalty_std": 0.01332098338752985, "reward_repeat_floor_mean": 0.9981508255004883, "reward_repeat_floor_std": 0.0019981428049504757, "reward_near_duplicate_penalty_mean": 0.9876722693443298, "reward_near_duplicate_penalty_std": 0.01332098338752985, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5037499666213989, "reward_judge_quality_std": 0.2209678441286087, "reward_total_composite_mean": 0.19124242663383484, "reward_total_composite_std": 0.24342593550682068} {"timestamp_utc": "2026-04-12T21:35:36Z", "mode": "train", "global_step": 1464, "epoch": 0.07704857639071627, "loss": -0.053, "grad_norm": 6.3476481437683105, "learning_rate": 5.566666666666667e-06, "num_tokens": 2588812.0, "completions/mean_length": 121.25, "completions/min_length": 56.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 65.42857360839844, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.42968156933784485, "rewards/meter/std": 0.3897289037704468, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9489843845367432, "rewards/lexical_plausibility/std": 0.14429405331611633, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093072175979614, "rewards/repeat_penalty/mean": 0.8424714207649231, "rewards/repeat_penalty/std": 0.1445269137620926, "rewards/repeat_floor/mean": 0.9826183319091797, "rewards/repeat_floor/std": 0.014140552841126919, "rewards/near_duplicate_penalty/mean": 0.9461427330970764, "rewards/near_duplicate_penalty/std": 0.030269332230091095, "rewards/opening_diversity/mean": 0.9508928656578064, "rewards/opening_diversity/std": 0.09533105045557022, "rewards/distinct_2/mean": 0.9293700456619263, "rewards/distinct_2/std": 0.06268090754747391, "rewards/total_composite/mean": 0.1584310233592987, "rewards/total_composite/std": 0.17256559431552887, "reward": 0.1584310233592987, "reward_std": 0.17256557941436768, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15980832278728485, "sampling/sampling_logp_difference/max": 1.949110984802246, "sampling/importance_sampling_ratio/min": 0.1424006074666977, "sampling/importance_sampling_ratio/mean": 1.0366225242614746, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8533193469047546, "clip_ratio/low_mean": 0.06362336687743664, "clip_ratio/low_min": 0.06362336687743664, "clip_ratio/high_mean": 0.05051523260772228, "clip_ratio/high_max": 0.05051523260772228, "clip_ratio/region_mean": 0.11413859948515892, "reward_total_mean": 0.1584310233592987, "reward_meter_mean": 0.42968156933784485, "reward_meter_std": 0.3897289037704468, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9489843845367432, "reward_lexical_plausibility_std": 0.14429405331611633, "reward_repeat_penalty_mean": 0.8424714207649231, "reward_repeat_penalty_std": 0.1445269137620926, "reward_repeat_floor_mean": 0.9826183319091797, "reward_repeat_floor_std": 0.014140552841126919, "reward_near_duplicate_penalty_mean": 0.9461427330970764, "reward_near_duplicate_penalty_std": 0.030269332230091095, "reward_opening_diversity_mean": 0.9508928656578064, "reward_opening_diversity_std": 0.09533105045557022, "reward_distinct_2_mean": 0.9293700456619263, "reward_distinct_2_std": 0.06268090754747391, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093072175979614, "reward_total_composite_mean": 0.1584310233592987, "reward_total_composite_std": 0.17256559431552887} {"timestamp_utc": "2026-04-12T21:35:45Z", "mode": "train", "global_step": 1465, "epoch": 0.07710120519972632, "loss": 0.0986, "grad_norm": 23.177236557006836, "learning_rate": 5.563636363636364e-06, "num_tokens": 2590313.0, "completions/mean_length": 38.625, "completions/min_length": 32.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.625, "completions/min_terminated_length": 32.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.827404260635376, "rewards/meter/std": 0.28178417682647705, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9921875, "rewards/lexical_plausibility/std": 0.022097086533904076, "rewards/judge_quality/mean": 0.4749999940395355, "rewards/judge_quality/std": 0.11649646610021591, "rewards/repeat_penalty/mean": 0.9689664244651794, "rewards/repeat_penalty/std": 0.04249228909611702, "rewards/repeat_floor/mean": 0.9963927865028381, "rewards/repeat_floor/std": 0.004672999028116465, "rewards/near_duplicate_penalty/mean": 0.987041711807251, "rewards/near_duplicate_penalty/std": 0.017708996310830116, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9815173149108887, "rewards/distinct_2/std": 0.03442956507205963, "rewards/total_composite/mean": 0.3947297930717468, "rewards/total_composite/std": 0.17811062932014465, "reward": 0.3947297930717468, "reward_std": 0.17811061441898346, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14125335216522217, "sampling/sampling_logp_difference/max": 1.6986949443817139, "sampling/importance_sampling_ratio/min": 0.21040359139442444, "sampling/importance_sampling_ratio/mean": 1.0032693147659302, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9236818850040436, "clip_ratio/low_mean": 0.03358563641086221, "clip_ratio/low_min": 0.03358563641086221, "clip_ratio/high_mean": 0.07814845256507397, "clip_ratio/high_max": 0.07814845256507397, "clip_ratio/region_mean": 0.11173408897593617, "reward_total_mean": 0.3947297930717468, "reward_meter_mean": 0.827404260635376, "reward_meter_std": 0.28178417682647705, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9921875, "reward_lexical_plausibility_std": 0.022097086533904076, "reward_repeat_penalty_mean": 0.9689664244651794, "reward_repeat_penalty_std": 0.04249228909611702, "reward_repeat_floor_mean": 0.9963927865028381, "reward_repeat_floor_std": 0.004672999028116465, "reward_near_duplicate_penalty_mean": 0.987041711807251, "reward_near_duplicate_penalty_std": 0.017708996310830116, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9815173149108887, "reward_distinct_2_std": 0.03442956507205963, "reward_judge_quality_mean": 0.4749999940395355, "reward_judge_quality_std": 0.11649646610021591, "reward_total_composite_mean": 0.3947297930717468, "reward_total_composite_std": 0.17811062932014465} {"timestamp_utc": "2026-04-12T21:36:00Z", "mode": "train", "global_step": 1466, "epoch": 0.07715383400873638, "loss": -0.079, "grad_norm": 4.824151992797852, "learning_rate": 5.560606060606061e-06, "num_tokens": 2591807.0, "completions/mean_length": 94.75, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 35.142860412597656, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.7681292295455933, "rewards/meter/std": 0.39944857358932495, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9221006631851196, "rewards/lexical_plausibility/std": 0.22033251821994781, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.18516400456428528, "rewards/repeat_penalty/mean": 0.8969316482543945, "rewards/repeat_penalty/std": 0.12550103664398193, "rewards/repeat_floor/mean": 0.9893254041671753, "rewards/repeat_floor/std": 0.013125483877956867, "rewards/near_duplicate_penalty/mean": 0.9673749804496765, "rewards/near_duplicate_penalty/std": 0.043096814304590225, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9566013813018799, "rewards/distinct_2/std": 0.08165136724710464, "rewards/total_composite/mean": 0.38969165086746216, "rewards/total_composite/std": 0.22181619703769684, "reward": 0.38969165086746216, "reward_std": 0.22181621193885803, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14818120002746582, "sampling/sampling_logp_difference/max": 1.7204985618591309, "sampling/importance_sampling_ratio/min": 0.1789768934249878, "sampling/importance_sampling_ratio/mean": 1.0239019393920898, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.78403040766716, "clip_ratio/low_mean": 0.011363636702299118, "clip_ratio/low_min": 0.011363636702299118, "clip_ratio/high_mean": 0.09900515992194414, "clip_ratio/high_max": 0.09900515992194414, "clip_ratio/region_mean": 0.11036879662424326, "reward_total_mean": 0.38969165086746216, "reward_meter_mean": 0.7681292295455933, "reward_meter_std": 0.39944857358932495, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9221006631851196, "reward_lexical_plausibility_std": 0.22033251821994781, "reward_repeat_penalty_mean": 0.8969316482543945, "reward_repeat_penalty_std": 0.12550103664398193, "reward_repeat_floor_mean": 0.9893254041671753, "reward_repeat_floor_std": 0.013125483877956867, "reward_near_duplicate_penalty_mean": 0.9673749804496765, "reward_near_duplicate_penalty_std": 0.043096814304590225, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9566013813018799, "reward_distinct_2_std": 0.08165136724710464, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.18516400456428528, "reward_total_composite_mean": 0.38969165086746216, "reward_total_composite_std": 0.22181619703769684} {"timestamp_utc": "2026-04-12T21:36:09Z", "mode": "train", "global_step": 1467, "epoch": 0.07720646281774643, "loss": 0.026, "grad_norm": 10.648513793945312, "learning_rate": 5.557575757575758e-06, "num_tokens": 2593293.0, "completions/mean_length": 40.75, "completions/min_length": 38.0, "completions/max_length": 46.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.75, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 46.0, "rewards/meter/mean": 0.7763723134994507, "rewards/meter/std": 0.3710571825504303, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.9292891621589661, "rewards/repeat_penalty/std": 0.11720864474773407, "rewards/repeat_floor/mean": 0.9919396042823792, "rewards/repeat_floor/std": 0.01083588507026434, "rewards/near_duplicate_penalty/mean": 0.9632017016410828, "rewards/near_duplicate_penalty/std": 0.03623322397470474, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9926035404205322, "rewards/distinct_2/std": 0.020920326933264732, "rewards/total_composite/mean": 0.27405762672424316, "rewards/total_composite/std": 0.12334898114204407, "reward": 0.27405762672424316, "reward_std": 0.12334898114204407, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15289442241191864, "sampling/sampling_logp_difference/max": 1.4374723434448242, "sampling/importance_sampling_ratio/min": 0.23752740025520325, "sampling/importance_sampling_ratio/mean": 1.0133510828018188, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0599054545164108, "clip_ratio/low_mean": 0.044391026720404625, "clip_ratio/low_min": 0.044391026720404625, "clip_ratio/high_mean": 0.12404589354991913, "clip_ratio/high_max": 0.12404589354991913, "clip_ratio/region_mean": 0.16843692027032375, "reward_total_mean": 0.27405762672424316, "reward_meter_mean": 0.7763723134994507, "reward_meter_std": 0.3710571825504303, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9292891621589661, "reward_repeat_penalty_std": 0.11720864474773407, "reward_repeat_floor_mean": 0.9919396042823792, "reward_repeat_floor_std": 0.01083588507026434, "reward_near_duplicate_penalty_mean": 0.9632017016410828, "reward_near_duplicate_penalty_std": 0.03623322397470474, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9926035404205322, "reward_distinct_2_std": 0.020920326933264732, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.27405762672424316, "reward_total_composite_std": 0.12334898114204407} {"timestamp_utc": "2026-04-12T21:36:18Z", "mode": "train", "global_step": 1468, "epoch": 0.07725909162675648, "loss": 0.0396, "grad_norm": 14.380463600158691, "learning_rate": 5.554545454545454e-06, "num_tokens": 2595749.0, "completions/mean_length": 93.0, "completions/min_length": 84.0, "completions/max_length": 107.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 93.0, "completions/min_terminated_length": 84.0, "completions/max_terminated_length": 107.0, "rewards/meter/mean": 0.8517998456954956, "rewards/meter/std": 0.23740869760513306, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.887499988079071, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4662500023841858, "rewards/judge_quality/std": 0.1743508279323578, "rewards/repeat_penalty/mean": 0.9787132143974304, "rewards/repeat_penalty/std": 0.03088396228849888, "rewards/repeat_floor/mean": 0.9975749850273132, "rewards/repeat_floor/std": 0.003145806025713682, "rewards/near_duplicate_penalty/mean": 0.9918221831321716, "rewards/near_duplicate_penalty/std": 0.007289330009371042, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9866847991943359, "rewards/distinct_2/std": 0.026523606851696968, "rewards/total_composite/mean": 0.3590654730796814, "rewards/total_composite/std": 0.18661890923976898, "reward": 0.3590654730796814, "reward_std": 0.18661890923976898, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13440656661987305, "sampling/sampling_logp_difference/max": 1.8946889638900757, "sampling/importance_sampling_ratio/min": 0.15036509931087494, "sampling/importance_sampling_ratio/mean": 1.013350009918213, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7228589132428169, "clip_ratio/low_mean": 0.06182474084198475, "clip_ratio/low_min": 0.06182474084198475, "clip_ratio/high_mean": 0.05634537059813738, "clip_ratio/high_max": 0.05634537059813738, "clip_ratio/region_mean": 0.11817011144012213, "reward_total_mean": 0.3590654730796814, "reward_meter_mean": 0.8517998456954956, "reward_meter_std": 0.23740869760513306, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.887499988079071, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9787132143974304, "reward_repeat_penalty_std": 0.03088396228849888, "reward_repeat_floor_mean": 0.9975749850273132, "reward_repeat_floor_std": 0.003145806025713682, "reward_near_duplicate_penalty_mean": 0.9918221831321716, "reward_near_duplicate_penalty_std": 0.007289330009371042, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9866847991943359, "reward_distinct_2_std": 0.026523606851696968, "reward_judge_quality_mean": 0.4662500023841858, "reward_judge_quality_std": 0.1743508279323578, "reward_total_composite_mean": 0.3590654730796814, "reward_total_composite_std": 0.18661890923976898} {"timestamp_utc": "2026-04-12T21:36:28Z", "mode": "train", "global_step": 1469, "epoch": 0.07731172043576653, "loss": 0.054, "grad_norm": 12.183830261230469, "learning_rate": 5.5515151515151524e-06, "num_tokens": 2597553.0, "completions/mean_length": 53.5, "completions/min_length": 46.0, "completions/max_length": 62.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.5, "completions/min_terminated_length": 46.0, "completions/max_terminated_length": 62.0, "rewards/meter/mean": 0.6609489917755127, "rewards/meter/std": 0.36367860436439514, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.9624999761581421, "rewards/arabic_floor/std": 0.06943649053573608, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3499999940395355, "rewards/judge_quality/std": 0.13093073666095734, "rewards/repeat_penalty/mean": 0.9753797054290771, "rewards/repeat_penalty/std": 0.014399535022675991, "rewards/repeat_floor/mean": 0.9963070154190063, "rewards/repeat_floor/std": 0.0021599384490400553, "rewards/near_duplicate_penalty/mean": 0.9753797054290771, "rewards/near_duplicate_penalty/std": 0.014399535022675991, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2325470745563507, "rewards/total_composite/std": 0.17948530614376068, "reward": 0.2325470745563507, "reward_std": 0.17948530614376068, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16152890026569366, "sampling/sampling_logp_difference/max": 1.8105525970458984, "sampling/importance_sampling_ratio/min": 0.16356372833251953, "sampling/importance_sampling_ratio/mean": 1.010656476020813, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9364163056015968, "clip_ratio/low_mean": 0.07524390611797571, "clip_ratio/low_min": 0.07524390611797571, "clip_ratio/high_mean": 0.07295853178948164, "clip_ratio/high_max": 0.07295853178948164, "clip_ratio/region_mean": 0.14820243790745735, "reward_total_mean": 0.2325470745563507, "reward_meter_mean": 0.6609489917755127, "reward_meter_std": 0.36367860436439514, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.9624999761581421, "reward_arabic_floor_std": 0.06943649053573608, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9753797054290771, "reward_repeat_penalty_std": 0.014399535022675991, "reward_repeat_floor_mean": 0.9963070154190063, "reward_repeat_floor_std": 0.0021599384490400553, "reward_near_duplicate_penalty_mean": 0.9753797054290771, "reward_near_duplicate_penalty_std": 0.014399535022675991, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3499999940395355, "reward_judge_quality_std": 0.13093073666095734, "reward_total_composite_mean": 0.2325470745563507, "reward_total_composite_std": 0.17948530614376068} {"timestamp_utc": "2026-04-12T21:36:37Z", "mode": "train", "global_step": 1470, "epoch": 0.07736434924477659, "loss": 0.0716, "grad_norm": 14.52413272857666, "learning_rate": 5.548484848484849e-06, "num_tokens": 2599172.0, "completions/mean_length": 37.375, "completions/min_length": 31.0, "completions/max_length": 50.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.375, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.6708568930625916, "rewards/meter/std": 0.37073376774787903, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6850000023841858, "rewards/judge_quality/std": 0.2512255907058716, "rewards/repeat_penalty/mean": 0.9427042007446289, "rewards/repeat_penalty/std": 0.11969783157110214, "rewards/repeat_floor/mean": 0.9924949407577515, "rewards/repeat_floor/std": 0.014933905564248562, "rewards/near_duplicate_penalty/mean": 0.9674487709999084, "rewards/near_duplicate_penalty/std": 0.052374377846717834, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9708625078201294, "rewards/distinct_2/std": 0.08241338282823563, "rewards/total_composite/mean": 0.4312814176082611, "rewards/total_composite/std": 0.3087232708930969, "reward": 0.4312814176082611, "reward_std": 0.3087233006954193, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14285679161548615, "sampling/sampling_logp_difference/max": 1.5482988357543945, "sampling/importance_sampling_ratio/min": 0.21260933578014374, "sampling/importance_sampling_ratio/mean": 1.0080362558364868, "sampling/importance_sampling_ratio/max": 1.7865575551986694, "entropy": 0.9456106573343277, "clip_ratio/low_mean": 0.09007683023810387, "clip_ratio/low_min": 0.09007683023810387, "clip_ratio/high_mean": 0.0358193286228925, "clip_ratio/high_max": 0.0358193286228925, "clip_ratio/region_mean": 0.12589615886099637, "reward_total_mean": 0.4312814176082611, "reward_meter_mean": 0.6708568930625916, "reward_meter_std": 0.37073376774787903, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9427042007446289, "reward_repeat_penalty_std": 0.11969783157110214, "reward_repeat_floor_mean": 0.9924949407577515, "reward_repeat_floor_std": 0.014933905564248562, "reward_near_duplicate_penalty_mean": 0.9674487709999084, "reward_near_duplicate_penalty_std": 0.052374377846717834, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9708625078201294, "reward_distinct_2_std": 0.08241338282823563, "reward_judge_quality_mean": 0.6850000023841858, "reward_judge_quality_std": 0.2512255907058716, "reward_total_composite_mean": 0.4312814176082611, "reward_total_composite_std": 0.3087232708930969} {"timestamp_utc": "2026-04-12T21:36:46Z", "mode": "train", "global_step": 1471, "epoch": 0.07741697805378664, "loss": 0.0502, "grad_norm": 13.896950721740723, "learning_rate": 5.545454545454546e-06, "num_tokens": 2600713.0, "completions/mean_length": 33.625, "completions/min_length": 28.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 33.625, "completions/min_terminated_length": 28.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.903566300868988, "rewards/meter/std": 0.12202103435993195, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6637500524520874, "rewards/judge_quality/std": 0.2351861149072647, "rewards/repeat_penalty/mean": 0.980202853679657, "rewards/repeat_penalty/std": 0.025147607550024986, "rewards/repeat_floor/mean": 0.9970304369926453, "rewards/repeat_floor/std": 0.003772138385102153, "rewards/near_duplicate_penalty/mean": 0.980202853679657, "rewards/near_duplicate_penalty/std": 0.025147607550024986, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.604533314704895, "rewards/total_composite/std": 0.24003581702709198, "reward": 0.604533314704895, "reward_std": 0.24003581702709198, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11794211715459824, "sampling/sampling_logp_difference/max": 1.3657530546188354, "sampling/importance_sampling_ratio/min": 0.2551884353160858, "sampling/importance_sampling_ratio/mean": 1.035339593887329, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8341148272156715, "clip_ratio/low_mean": 0.04921622667461634, "clip_ratio/low_min": 0.04921622667461634, "clip_ratio/high_mean": 0.059879032894968987, "clip_ratio/high_max": 0.059879032894968987, "clip_ratio/region_mean": 0.10909525956958532, "reward_total_mean": 0.604533314704895, "reward_meter_mean": 0.903566300868988, "reward_meter_std": 0.12202103435993195, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.980202853679657, "reward_repeat_penalty_std": 0.025147607550024986, "reward_repeat_floor_mean": 0.9970304369926453, "reward_repeat_floor_std": 0.003772138385102153, "reward_near_duplicate_penalty_mean": 0.980202853679657, "reward_near_duplicate_penalty_std": 0.025147607550024986, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6637500524520874, "reward_judge_quality_std": 0.2351861149072647, "reward_total_composite_mean": 0.604533314704895, "reward_total_composite_std": 0.24003581702709198} {"timestamp_utc": "2026-04-12T21:37:00Z", "mode": "train", "global_step": 1472, "epoch": 0.07746960686279669, "loss": -0.0901, "grad_norm": 1.7235727310180664, "learning_rate": 5.5424242424242425e-06, "num_tokens": 2602192.0, "completions/mean_length": 219.875, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 44.60000228881836, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.5801786780357361, "rewards/meter/std": 0.3490472435951233, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8448355197906494, "rewards/lexical_plausibility/std": 0.22178836166858673, "rewards/judge_quality/mean": 0.2874999940395355, "rewards/judge_quality/std": 0.19955307245254517, "rewards/repeat_penalty/mean": 0.8767648339271545, "rewards/repeat_penalty/std": 0.09850464761257172, "rewards/repeat_floor/mean": 0.9871397614479065, "rewards/repeat_floor/std": 0.009073498658835888, "rewards/near_duplicate_penalty/mean": 0.9392648339271545, "rewards/near_duplicate_penalty/std": 0.07061699777841568, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.21015127003192902, "rewards/total_composite/std": 0.17606578767299652, "reward": 0.21015127003192902, "reward_std": 0.17606577277183533, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1457851082086563, "sampling/sampling_logp_difference/max": 1.569849967956543, "sampling/importance_sampling_ratio/min": 0.2080763876438141, "sampling/importance_sampling_ratio/mean": 1.0451232194900513, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7417897805571556, "clip_ratio/low_mean": 0.027027027681469917, "clip_ratio/low_min": 0.027027027681469917, "clip_ratio/high_mean": 0.07155514415353537, "clip_ratio/high_max": 0.07155514415353537, "clip_ratio/region_mean": 0.09858217183500528, "reward_total_mean": 0.21015127003192902, "reward_meter_mean": 0.5801786780357361, "reward_meter_std": 0.3490472435951233, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8448355197906494, "reward_lexical_plausibility_std": 0.22178836166858673, "reward_repeat_penalty_mean": 0.8767648339271545, "reward_repeat_penalty_std": 0.09850464761257172, "reward_repeat_floor_mean": 0.9871397614479065, "reward_repeat_floor_std": 0.009073498658835888, "reward_near_duplicate_penalty_mean": 0.9392648339271545, "reward_near_duplicate_penalty_std": 0.07061699777841568, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.2874999940395355, "reward_judge_quality_std": 0.19955307245254517, "reward_total_composite_mean": 0.21015127003192902, "reward_total_composite_std": 0.17606578767299652} {"timestamp_utc": "2026-04-12T21:37:13Z", "mode": "train", "global_step": 1473, "epoch": 0.07752223567180674, "loss": -0.0381, "grad_norm": 4.544206142425537, "learning_rate": 5.53939393939394e-06, "num_tokens": 2603787.0, "completions/mean_length": 106.375, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 48.42857360839844, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.3125974237918854, "rewards/meter/std": 0.3656372129917145, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.942984938621521, "rewards/lexical_plausibility/std": 0.16126291453838348, "rewards/judge_quality/mean": 0.7599999904632568, "rewards/judge_quality/std": 0.3326946496963501, "rewards/repeat_penalty/mean": 0.9846710562705994, "rewards/repeat_penalty/std": 0.025053514167666435, "rewards/repeat_floor/mean": 0.9982251524925232, "rewards/repeat_floor/std": 0.0025504808872938156, "rewards/near_duplicate_penalty/mean": 0.9934123158454895, "rewards/near_duplicate_penalty/std": 0.012166498228907585, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.2731981575489044, "rewards/total_composite/std": 0.34586209058761597, "reward": 0.2731981575489044, "reward_std": 0.34586209058761597, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13730488717556, "sampling/sampling_logp_difference/max": 1.5517511367797852, "sampling/importance_sampling_ratio/min": 0.21187661588191986, "sampling/importance_sampling_ratio/mean": 1.007899284362793, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8874154984951019, "clip_ratio/low_mean": 0.06453917641192675, "clip_ratio/low_min": 0.06453917641192675, "clip_ratio/high_mean": 0.03988925367593765, "clip_ratio/high_max": 0.03988925367593765, "clip_ratio/region_mean": 0.1044284300878644, "reward_total_mean": 0.2731981575489044, "reward_meter_mean": 0.3125974237918854, "reward_meter_std": 0.3656372129917145, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.942984938621521, "reward_lexical_plausibility_std": 0.16126291453838348, "reward_repeat_penalty_mean": 0.9846710562705994, "reward_repeat_penalty_std": 0.025053514167666435, "reward_repeat_floor_mean": 0.9982251524925232, "reward_repeat_floor_std": 0.0025504808872938156, "reward_near_duplicate_penalty_mean": 0.9934123158454895, "reward_near_duplicate_penalty_std": 0.012166498228907585, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.7599999904632568, "reward_judge_quality_std": 0.3326946496963501, "reward_total_composite_mean": 0.2731981575489044, "reward_total_composite_std": 0.34586209058761597} {"timestamp_utc": "2026-04-12T21:37:22Z", "mode": "train", "global_step": 1474, "epoch": 0.0775748644808168, "loss": 0.0519, "grad_norm": 16.62087059020996, "learning_rate": 5.536363636363636e-06, "num_tokens": 2605207.0, "completions/mean_length": 29.5, "completions/min_length": 20.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 29.5, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.29854297637939453, "rewards/meter/std": 0.39993488788604736, "rewards/count_adherence/mean": 0.625, "rewards/count_adherence/std": 0.5175492167472839, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8875000476837158, "rewards/count_floor/std": 0.15526476502418518, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5549999475479126, "rewards/judge_quality/std": 0.22790977358818054, "rewards/repeat_penalty/mean": 0.9033284783363342, "rewards/repeat_penalty/std": 0.12703187763690948, "rewards/repeat_floor/mean": 0.9939367771148682, "rewards/repeat_floor/std": 0.007424952462315559, "rewards/near_duplicate_penalty/mean": 0.9970784783363342, "rewards/near_duplicate_penalty/std": 0.0046976786106824875, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.11308514326810837, "rewards/total_composite/std": 0.15752579271793365, "reward": 0.11308514326810837, "reward_std": 0.15752580761909485, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16352230310440063, "sampling/sampling_logp_difference/max": 1.9650976657867432, "sampling/importance_sampling_ratio/min": 0.14014220237731934, "sampling/importance_sampling_ratio/mean": 1.01524019241333, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8454306125640869, "clip_ratio/low_mean": 0.11931326892226934, "clip_ratio/low_min": 0.11931326892226934, "clip_ratio/high_mean": 0.031746032647788525, "clip_ratio/high_max": 0.031746032647788525, "clip_ratio/region_mean": 0.15105930157005787, "reward_total_mean": 0.11308514326810837, "reward_meter_mean": 0.29854297637939453, "reward_meter_std": 0.39993488788604736, "reward_count_adherence_mean": 0.625, "reward_count_adherence_std": 0.5175492167472839, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8875000476837158, "reward_count_floor_std": 0.15526476502418518, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9033284783363342, "reward_repeat_penalty_std": 0.12703187763690948, "reward_repeat_floor_mean": 0.9939367771148682, "reward_repeat_floor_std": 0.007424952462315559, "reward_near_duplicate_penalty_mean": 0.9970784783363342, "reward_near_duplicate_penalty_std": 0.0046976786106824875, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5549999475479126, "reward_judge_quality_std": 0.22790977358818054, "reward_total_composite_mean": 0.11308514326810837, "reward_total_composite_std": 0.15752579271793365} {"timestamp_utc": "2026-04-12T21:37:32Z", "mode": "train", "global_step": 1475, "epoch": 0.07762749328982685, "loss": 0.0404, "grad_norm": 9.530497550964355, "learning_rate": 5.533333333333334e-06, "num_tokens": 2608300.0, "completions/mean_length": 133.625, "completions/min_length": 122.0, "completions/max_length": 154.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 133.625, "completions/min_terminated_length": 122.0, "completions/max_terminated_length": 154.0, "rewards/meter/mean": 0.9528020620346069, "rewards/meter/std": 0.08151319622993469, "rewards/count_adherence/mean": 0.65625, "rewards/count_adherence/std": 0.0578637570142746, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8968750238418579, "rewards/count_floor/std": 0.017359137535095215, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.38749998807907104, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.9439680576324463, "rewards/repeat_penalty/std": 0.04404127225279808, "rewards/repeat_floor/mean": 0.9939197301864624, "rewards/repeat_floor/std": 0.004599173087626696, "rewards/near_duplicate_penalty/mean": 0.9840735197067261, "rewards/near_duplicate_penalty/std": 0.0099300816655159, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9589853286743164, "rewards/distinct_2/std": 0.03691066429018974, "rewards/total_composite/mean": 0.33041584491729736, "rewards/total_composite/std": 0.061515677720308304, "reward": 0.33041584491729736, "reward_std": 0.0615156814455986, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14891010522842407, "sampling/sampling_logp_difference/max": 2.926743984222412, "sampling/importance_sampling_ratio/min": 0.0535711832344532, "sampling/importance_sampling_ratio/mean": 1.0132691860198975, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9275376498699188, "clip_ratio/low_mean": 0.0870408657938242, "clip_ratio/low_min": 0.0870408657938242, "clip_ratio/high_mean": 0.04037346690893173, "clip_ratio/high_max": 0.04037346690893173, "clip_ratio/region_mean": 0.12741433270275593, "reward_total_mean": 0.33041584491729736, "reward_meter_mean": 0.9528020620346069, "reward_meter_std": 0.08151319622993469, "reward_count_adherence_mean": 0.65625, "reward_count_adherence_std": 0.0578637570142746, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8968750238418579, "reward_count_floor_std": 0.017359137535095215, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9439680576324463, "reward_repeat_penalty_std": 0.04404127225279808, "reward_repeat_floor_mean": 0.9939197301864624, "reward_repeat_floor_std": 0.004599173087626696, "reward_near_duplicate_penalty_mean": 0.9840735197067261, "reward_near_duplicate_penalty_std": 0.0099300816655159, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9589853286743164, "reward_distinct_2_std": 0.03691066429018974, "reward_judge_quality_mean": 0.38749998807907104, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.33041584491729736, "reward_total_composite_std": 0.061515677720308304} {"timestamp_utc": "2026-04-12T21:37:46Z", "mode": "train", "global_step": 1476, "epoch": 0.0776801220988369, "loss": -0.0059, "grad_norm": 2.84600567817688, "learning_rate": 5.530303030303031e-06, "num_tokens": 2609522.0, "completions/mean_length": 144.75, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 22.33333396911621, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.7057888507843018, "rewards/meter/std": 0.3767654597759247, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.8561461567878723, "rewards/lexical_plausibility/std": 0.2663852572441101, "rewards/judge_quality/mean": 0.32124999165534973, "rewards/judge_quality/std": 0.2923519015312195, "rewards/repeat_penalty/mean": 0.8104128241539001, "rewards/repeat_penalty/std": 0.16286340355873108, "rewards/repeat_floor/mean": 0.9842416048049927, "rewards/repeat_floor/std": 0.01870684139430523, "rewards/near_duplicate_penalty/mean": 0.9574443101882935, "rewards/near_duplicate_penalty/std": 0.10259455442428589, "rewards/opening_diversity/mean": 0.84375, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2286793738603592, "rewards/total_composite/std": 0.29948046803474426, "reward": 0.2286793738603592, "reward_std": 0.29948046803474426, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15166312456130981, "sampling/sampling_logp_difference/max": 1.2029943466186523, "sampling/importance_sampling_ratio/min": 0.3002936840057373, "sampling/importance_sampling_ratio/mean": 1.0375717878341675, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0161238610744476, "clip_ratio/low_mean": 0.06118742423132062, "clip_ratio/low_min": 0.06118742423132062, "clip_ratio/high_mean": 0.014705882407724857, "clip_ratio/high_max": 0.014705882407724857, "clip_ratio/region_mean": 0.07589330663904548, "reward_total_mean": 0.2286793738603592, "reward_meter_mean": 0.7057888507843018, "reward_meter_std": 0.3767654597759247, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.8561461567878723, "reward_lexical_plausibility_std": 0.2663852572441101, "reward_repeat_penalty_mean": 0.8104128241539001, "reward_repeat_penalty_std": 0.16286340355873108, "reward_repeat_floor_mean": 0.9842416048049927, "reward_repeat_floor_std": 0.01870684139430523, "reward_near_duplicate_penalty_mean": 0.9574443101882935, "reward_near_duplicate_penalty_std": 0.10259455442428589, "reward_opening_diversity_mean": 0.84375, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.32124999165534973, "reward_judge_quality_std": 0.2923519015312195, "reward_total_composite_mean": 0.2286793738603592, "reward_total_composite_std": 0.29948046803474426} {"timestamp_utc": "2026-04-12T21:37:55Z", "mode": "train", "global_step": 1477, "epoch": 0.07773275090784695, "loss": 0.0347, "grad_norm": 23.032712936401367, "learning_rate": 5.527272727272728e-06, "num_tokens": 2610904.0, "completions/mean_length": 20.75, "completions/min_length": 17.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 20.75, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.37311288714408875, "rewards/meter/std": 0.47168493270874023, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.953125, "rewards/lexical_plausibility/std": 0.13258251547813416, "rewards/judge_quality/mean": 0.4925000071525574, "rewards/judge_quality/std": 0.2796298861503601, "rewards/repeat_penalty/mean": 0.7299373149871826, "rewards/repeat_penalty/std": 0.04513396695256233, "rewards/repeat_floor/mean": 0.9822695255279541, "rewards/repeat_floor/std": 0.005590358749032021, "rewards/near_duplicate_penalty/mean": 0.994617223739624, "rewards/near_duplicate_penalty/std": 0.015224790200591087, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.1464983969926834, "rewards/total_composite/std": 0.17938017845153809, "reward": 0.1464983969926834, "reward_std": 0.17938017845153809, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15937772393226624, "sampling/sampling_logp_difference/max": 1.2131202220916748, "sampling/importance_sampling_ratio/min": 0.2972683012485504, "sampling/importance_sampling_ratio/mean": 1.016886591911316, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8530717939138412, "clip_ratio/low_mean": 0.09069953998550773, "clip_ratio/low_min": 0.09069953998550773, "clip_ratio/high_mean": 0.06439394131302834, "clip_ratio/high_max": 0.06439394131302834, "clip_ratio/region_mean": 0.15509348129853606, "reward_total_mean": 0.1464983969926834, "reward_meter_mean": 0.37311288714408875, "reward_meter_std": 0.47168493270874023, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.953125, "reward_lexical_plausibility_std": 0.13258251547813416, "reward_repeat_penalty_mean": 0.7299373149871826, "reward_repeat_penalty_std": 0.04513396695256233, "reward_repeat_floor_mean": 0.9822695255279541, "reward_repeat_floor_std": 0.005590358749032021, "reward_near_duplicate_penalty_mean": 0.994617223739624, "reward_near_duplicate_penalty_std": 0.015224790200591087, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.4925000071525574, "reward_judge_quality_std": 0.2796298861503601, "reward_total_composite_mean": 0.1464983969926834, "reward_total_composite_std": 0.17938017845153809} {"timestamp_utc": "2026-04-12T21:38:09Z", "mode": "train", "global_step": 1478, "epoch": 0.077785379716857, "loss": -0.158, "grad_norm": 4.232932090759277, "learning_rate": 5.524242424242424e-06, "num_tokens": 2613641.0, "completions/mean_length": 197.125, "completions/min_length": 137.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 152.1428680419922, "completions/min_terminated_length": 137.0, "completions/max_terminated_length": 171.0, "rewards/meter/mean": 0.7354157567024231, "rewards/meter/std": 0.16244816780090332, "rewards/count_adherence/mean": 0.7625000476837158, "rewards/count_adherence/std": 0.05175492912530899, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9287500381469727, "rewards/count_floor/std": 0.015526460483670235, "rewards/lexical_plausibility/mean": 0.9670959711074829, "rewards/lexical_plausibility/std": 0.0930667370557785, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.07440237700939178, "rewards/repeat_penalty/mean": 0.6656760573387146, "rewards/repeat_penalty/std": 0.16788245737552643, "rewards/repeat_floor/mean": 0.9651086330413818, "rewards/repeat_floor/std": 0.017652025446295738, "rewards/near_duplicate_penalty/mean": 0.9291567802429199, "rewards/near_duplicate_penalty/std": 0.02458607591688633, "rewards/opening_diversity/mean": 0.8861607313156128, "rewards/opening_diversity/std": 0.0864999070763588, "rewards/distinct_2/mean": 0.8062828183174133, "rewards/distinct_2/std": 0.11577828228473663, "rewards/total_composite/mean": 0.19909149408340454, "rewards/total_composite/std": 0.04298942908644676, "reward": 0.19909149408340454, "reward_std": 0.04298942908644676, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1250392496585846, "sampling/sampling_logp_difference/max": 2.6524553298950195, "sampling/importance_sampling_ratio/min": 0.07047795504331589, "sampling/importance_sampling_ratio/mean": 1.0133577585220337, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6019513010978699, "clip_ratio/low_mean": 0.04865333251655102, "clip_ratio/low_min": 0.04865333251655102, "clip_ratio/high_mean": 0.06369003001600504, "clip_ratio/high_max": 0.06369003001600504, "clip_ratio/region_mean": 0.11234336253255606, "reward_total_mean": 0.19909149408340454, "reward_meter_mean": 0.7354157567024231, "reward_meter_std": 0.16244816780090332, "reward_count_adherence_mean": 0.7625000476837158, "reward_count_adherence_std": 0.05175492912530899, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9287500381469727, "reward_count_floor_std": 0.015526460483670235, "reward_lexical_plausibility_mean": 0.9670959711074829, "reward_lexical_plausibility_std": 0.0930667370557785, "reward_repeat_penalty_mean": 0.6656760573387146, "reward_repeat_penalty_std": 0.16788245737552643, "reward_repeat_floor_mean": 0.9651086330413818, "reward_repeat_floor_std": 0.017652025446295738, "reward_near_duplicate_penalty_mean": 0.9291567802429199, "reward_near_duplicate_penalty_std": 0.02458607591688633, "reward_opening_diversity_mean": 0.8861607313156128, "reward_opening_diversity_std": 0.0864999070763588, "reward_distinct_2_mean": 0.8062828183174133, "reward_distinct_2_std": 0.11577828228473663, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.07440237700939178, "reward_total_composite_mean": 0.19909149408340454, "reward_total_composite_std": 0.04298942908644676} {"timestamp_utc": "2026-04-12T21:38:19Z", "mode": "train", "global_step": 1479, "epoch": 0.07783800852586706, "loss": 0.0326, "grad_norm": 12.372693061828613, "learning_rate": 5.521212121212122e-06, "num_tokens": 2615541.0, "completions/mean_length": 65.5, "completions/min_length": 51.0, "completions/max_length": 71.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.5, "completions/min_terminated_length": 51.0, "completions/max_terminated_length": 71.0, "rewards/meter/mean": 0.6939051747322083, "rewards/meter/std": 0.30842527747154236, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4375, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.8855779767036438, "rewards/repeat_penalty/std": 0.0997515395283699, "rewards/repeat_floor/mean": 0.987216591835022, "rewards/repeat_floor/std": 0.010126245208084583, "rewards/near_duplicate_penalty/mean": 0.9627809524536133, "rewards/near_duplicate_penalty/std": 0.020330019295215607, "rewards/opening_diversity/mean": 0.9921875, "rewards/opening_diversity/std": 0.022097086533904076, "rewards/distinct_2/mean": 0.9252022504806519, "rewards/distinct_2/std": 0.08017771691083908, "rewards/total_composite/mean": 0.30763912200927734, "rewards/total_composite/std": 0.18136948347091675, "reward": 0.30763912200927734, "reward_std": 0.18136949837207794, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15677587687969208, "sampling/sampling_logp_difference/max": 2.489776134490967, "sampling/importance_sampling_ratio/min": 0.08292853087186813, "sampling/importance_sampling_ratio/mean": 1.008183240890503, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8283580169081688, "clip_ratio/low_mean": 0.07551028952002525, "clip_ratio/low_min": 0.07551028952002525, "clip_ratio/high_mean": 0.0631263256072998, "clip_ratio/high_max": 0.0631263256072998, "clip_ratio/region_mean": 0.13863661512732506, "reward_total_mean": 0.30763912200927734, "reward_meter_mean": 0.6939051747322083, "reward_meter_std": 0.30842527747154236, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8855779767036438, "reward_repeat_penalty_std": 0.0997515395283699, "reward_repeat_floor_mean": 0.987216591835022, "reward_repeat_floor_std": 0.010126245208084583, "reward_near_duplicate_penalty_mean": 0.9627809524536133, "reward_near_duplicate_penalty_std": 0.020330019295215607, "reward_opening_diversity_mean": 0.9921875, "reward_opening_diversity_std": 0.022097086533904076, "reward_distinct_2_mean": 0.9252022504806519, "reward_distinct_2_std": 0.08017771691083908, "reward_judge_quality_mean": 0.4375, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.30763912200927734, "reward_total_composite_std": 0.18136948347091675} {"timestamp_utc": "2026-04-12T21:38:28Z", "mode": "train", "global_step": 1480, "epoch": 0.07789063733487711, "loss": 0.0687, "grad_norm": 13.060455322265625, "learning_rate": 5.518181818181818e-06, "num_tokens": 2617105.0, "completions/mean_length": 37.5, "completions/min_length": 31.0, "completions/max_length": 45.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.5, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 45.0, "rewards/meter/mean": 0.9345614910125732, "rewards/meter/std": 0.07272852957248688, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5462499856948853, "rewards/judge_quality/std": 0.18392060697078705, "rewards/repeat_penalty/mean": 0.85737144947052, "rewards/repeat_penalty/std": 0.08898493647575378, "rewards/repeat_floor/mean": 0.9819572567939758, "rewards/repeat_floor/std": 0.010493194684386253, "rewards/near_duplicate_penalty/mean": 0.923769474029541, "rewards/near_duplicate_penalty/std": 0.03479602187871933, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9265761971473694, "rewards/distinct_2/std": 0.06919492781162262, "rewards/total_composite/mean": 0.4943440854549408, "rewards/total_composite/std": 0.1385333091020584, "reward": 0.4943440854549408, "reward_std": 0.1385333389043808, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12273003160953522, "sampling/sampling_logp_difference/max": 1.4212586879730225, "sampling/importance_sampling_ratio/min": 0.24140998721122742, "sampling/importance_sampling_ratio/mean": 1.0026049613952637, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6941500902175903, "clip_ratio/low_mean": 0.07864060625433922, "clip_ratio/low_min": 0.07864060625433922, "clip_ratio/high_mean": 0.01785714295692742, "clip_ratio/high_max": 0.01785714295692742, "clip_ratio/region_mean": 0.09649774921126664, "reward_total_mean": 0.4943440854549408, "reward_meter_mean": 0.9345614910125732, "reward_meter_std": 0.07272852957248688, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.85737144947052, "reward_repeat_penalty_std": 0.08898493647575378, "reward_repeat_floor_mean": 0.9819572567939758, "reward_repeat_floor_std": 0.010493194684386253, "reward_near_duplicate_penalty_mean": 0.923769474029541, "reward_near_duplicate_penalty_std": 0.03479602187871933, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9265761971473694, "reward_distinct_2_std": 0.06919492781162262, "reward_judge_quality_mean": 0.5462499856948853, "reward_judge_quality_std": 0.18392060697078705, "reward_total_composite_mean": 0.4943440854549408, "reward_total_composite_std": 0.1385333091020584} {"timestamp_utc": "2026-04-12T21:38:36Z", "mode": "train", "global_step": 1481, "epoch": 0.07794326614388716, "loss": 0.0926, "grad_norm": 20.302675247192383, "learning_rate": 5.515151515151515e-06, "num_tokens": 2618461.0, "completions/mean_length": 30.5, "completions/min_length": 27.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 30.5, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.8041801452636719, "rewards/meter/std": 0.24927420914173126, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4962500035762787, "rewards/judge_quality/std": 0.17476005852222443, "rewards/repeat_penalty/mean": 0.976553738117218, "rewards/repeat_penalty/std": 0.03615066409111023, "rewards/repeat_floor/mean": 0.9969298243522644, "rewards/repeat_floor/std": 0.004829831421375275, "rewards/near_duplicate_penalty/mean": 0.9841476082801819, "rewards/near_duplicate_penalty/std": 0.029976798221468925, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9923076629638672, "rewards/distinct_2/std": 0.021757129579782486, "rewards/total_composite/mean": 0.38019245862960815, "rewards/total_composite/std": 0.13928818702697754, "reward": 0.38019245862960815, "reward_std": 0.13928818702697754, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18236510455608368, "sampling/sampling_logp_difference/max": 1.8239991664886475, "sampling/importance_sampling_ratio/min": 0.16137908399105072, "sampling/importance_sampling_ratio/mean": 0.9616653323173523, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8683034181594849, "clip_ratio/low_mean": 0.053973354399204254, "clip_ratio/low_min": 0.053973354399204254, "clip_ratio/high_mean": 0.13541666604578495, "clip_ratio/high_max": 0.13541666604578495, "clip_ratio/region_mean": 0.1893900204449892, "reward_total_mean": 0.38019245862960815, "reward_meter_mean": 0.8041801452636719, "reward_meter_std": 0.24927420914173126, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.976553738117218, "reward_repeat_penalty_std": 0.03615066409111023, "reward_repeat_floor_mean": 0.9969298243522644, "reward_repeat_floor_std": 0.004829831421375275, "reward_near_duplicate_penalty_mean": 0.9841476082801819, "reward_near_duplicate_penalty_std": 0.029976798221468925, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9923076629638672, "reward_distinct_2_std": 0.021757129579782486, "reward_judge_quality_mean": 0.4962500035762787, "reward_judge_quality_std": 0.17476005852222443, "reward_total_composite_mean": 0.38019245862960815, "reward_total_composite_std": 0.13928818702697754} {"timestamp_utc": "2026-04-12T21:38:49Z", "mode": "train", "global_step": 1482, "epoch": 0.07799589495289722, "loss": -0.0613, "grad_norm": 12.659420013427734, "learning_rate": 5.512121212121213e-06, "num_tokens": 2619834.0, "completions/mean_length": 98.625, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 39.57143020629883, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.6670266389846802, "rewards/meter/std": 0.3609144687652588, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9494751691818237, "rewards/lexical_plausibility/std": 0.14290589094161987, "rewards/judge_quality/mean": 0.375, "rewards/judge_quality/std": 0.13887301087379456, "rewards/repeat_penalty/mean": 0.8963013291358948, "rewards/repeat_penalty/std": 0.1631539762020111, "rewards/repeat_floor/mean": 0.9881108403205872, "rewards/repeat_floor/std": 0.01716705597937107, "rewards/near_duplicate_penalty/mean": 0.9567710757255554, "rewards/near_duplicate_penalty/std": 0.03095054067671299, "rewards/opening_diversity/mean": 0.956250011920929, "rewards/opening_diversity/std": 0.09038607776165009, "rewards/distinct_2/mean": 0.9691130518913269, "rewards/distinct_2/std": 0.08568475395441055, "rewards/total_composite/mean": 0.24383217096328735, "rewards/total_composite/std": 0.1715419441461563, "reward": 0.24383217096328735, "reward_std": 0.1715419441461563, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1116553246974945, "sampling/sampling_logp_difference/max": 1.348264217376709, "sampling/importance_sampling_ratio/min": 0.25969064235687256, "sampling/importance_sampling_ratio/mean": 1.0265294313430786, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7966594099998474, "clip_ratio/low_mean": 0.036683558486402035, "clip_ratio/low_min": 0.036683558486402035, "clip_ratio/high_mean": 0.06691124010831118, "clip_ratio/high_max": 0.06691124010831118, "clip_ratio/region_mean": 0.10359479859471321, "reward_total_mean": 0.24383217096328735, "reward_meter_mean": 0.6670266389846802, "reward_meter_std": 0.3609144687652588, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9494751691818237, "reward_lexical_plausibility_std": 0.14290589094161987, "reward_repeat_penalty_mean": 0.8963013291358948, "reward_repeat_penalty_std": 0.1631539762020111, "reward_repeat_floor_mean": 0.9881108403205872, "reward_repeat_floor_std": 0.01716705597937107, "reward_near_duplicate_penalty_mean": 0.9567710757255554, "reward_near_duplicate_penalty_std": 0.03095054067671299, "reward_opening_diversity_mean": 0.956250011920929, "reward_opening_diversity_std": 0.09038607776165009, "reward_distinct_2_mean": 0.9691130518913269, "reward_distinct_2_std": 0.08568475395441055, "reward_judge_quality_mean": 0.375, "reward_judge_quality_std": 0.13887301087379456, "reward_total_composite_mean": 0.24383217096328735, "reward_total_composite_std": 0.1715419441461563} {"timestamp_utc": "2026-04-12T21:38:57Z", "mode": "train", "global_step": 1483, "epoch": 0.07804852376190727, "loss": 0.0302, "grad_norm": 15.642985343933105, "learning_rate": 5.50909090909091e-06, "num_tokens": 2621541.0, "completions/mean_length": 53.375, "completions/min_length": 50.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 53.375, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.4391917586326599, "rewards/meter/std": 0.31837061047554016, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.8650000095367432, "rewards/judge_quality/std": 0.16801361739635468, "rewards/repeat_penalty/mean": 0.8100943565368652, "rewards/repeat_penalty/std": 0.1832367479801178, "rewards/repeat_floor/mean": 0.981307864189148, "rewards/repeat_floor/std": 0.01715531386435032, "rewards/near_duplicate_penalty/mean": 0.9617388248443604, "rewards/near_duplicate_penalty/std": 0.028309646993875504, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.918578565120697, "rewards/distinct_2/std": 0.0732157975435257, "rewards/total_composite/mean": 0.3797881305217743, "rewards/total_composite/std": 0.3076392710208893, "reward": 0.3797881305217743, "reward_std": 0.3076392412185669, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12488719820976257, "sampling/sampling_logp_difference/max": 1.6914520263671875, "sampling/importance_sampling_ratio/min": 0.1842517852783203, "sampling/importance_sampling_ratio/mean": 1.0219050645828247, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6671174019575119, "clip_ratio/low_mean": 0.06702635623514652, "clip_ratio/low_min": 0.06702635623514652, "clip_ratio/high_mean": 0.06447712425142527, "clip_ratio/high_max": 0.06447712425142527, "clip_ratio/region_mean": 0.1315034804865718, "reward_total_mean": 0.3797881305217743, "reward_meter_mean": 0.4391917586326599, "reward_meter_std": 0.31837061047554016, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8100943565368652, "reward_repeat_penalty_std": 0.1832367479801178, "reward_repeat_floor_mean": 0.981307864189148, "reward_repeat_floor_std": 0.01715531386435032, "reward_near_duplicate_penalty_mean": 0.9617388248443604, "reward_near_duplicate_penalty_std": 0.028309646993875504, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.918578565120697, "reward_distinct_2_std": 0.0732157975435257, "reward_judge_quality_mean": 0.8650000095367432, "reward_judge_quality_std": 0.16801361739635468, "reward_total_composite_mean": 0.3797881305217743, "reward_total_composite_std": 0.3076392710208893} {"timestamp_utc": "2026-04-12T21:39:08Z", "mode": "train", "global_step": 1484, "epoch": 0.07810115257091732, "loss": 0.0481, "grad_norm": 9.162497520446777, "learning_rate": 5.506060606060607e-06, "num_tokens": 2624119.0, "completions/mean_length": 119.25, "completions/min_length": 103.0, "completions/max_length": 146.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 119.25, "completions/min_terminated_length": 103.0, "completions/max_terminated_length": 146.0, "rewards/meter/mean": 0.8776699900627136, "rewards/meter/std": 0.16596528887748718, "rewards/count_adherence/mean": 0.671875, "rewards/count_adherence/std": 0.06469365209341049, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.901562511920929, "rewards/count_floor/std": 0.019408106803894043, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3999999761581421, "rewards/judge_quality/std": 0.05345224589109421, "rewards/repeat_penalty/mean": 0.9527665376663208, "rewards/repeat_penalty/std": 0.040672667324543, "rewards/repeat_floor/mean": 0.9944452047348022, "rewards/repeat_floor/std": 0.004806766752153635, "rewards/near_duplicate_penalty/mean": 0.9795374870300293, "rewards/near_duplicate_penalty/std": 0.019689787179231644, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9723844528198242, "rewards/distinct_2/std": 0.026663072407245636, "rewards/total_composite/mean": 0.31343966722488403, "rewards/total_composite/std": 0.06773490458726883, "reward": 0.31343966722488403, "reward_std": 0.06773491203784943, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1395310014486313, "sampling/sampling_logp_difference/max": 2.542202949523926, "sampling/importance_sampling_ratio/min": 0.07869285345077515, "sampling/importance_sampling_ratio/mean": 1.0206793546676636, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8869970813393593, "clip_ratio/low_mean": 0.07193025480955839, "clip_ratio/low_min": 0.07193025480955839, "clip_ratio/high_mean": 0.06542260386049747, "clip_ratio/high_max": 0.06542260386049747, "clip_ratio/region_mean": 0.13735285867005587, "reward_total_mean": 0.31343966722488403, "reward_meter_mean": 0.8776699900627136, "reward_meter_std": 0.16596528887748718, "reward_count_adherence_mean": 0.671875, "reward_count_adherence_std": 0.06469365209341049, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.901562511920929, "reward_count_floor_std": 0.019408106803894043, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9527665376663208, "reward_repeat_penalty_std": 0.040672667324543, "reward_repeat_floor_mean": 0.9944452047348022, "reward_repeat_floor_std": 0.004806766752153635, "reward_near_duplicate_penalty_mean": 0.9795374870300293, "reward_near_duplicate_penalty_std": 0.019689787179231644, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9723844528198242, "reward_distinct_2_std": 0.026663072407245636, "reward_judge_quality_mean": 0.3999999761581421, "reward_judge_quality_std": 0.05345224589109421, "reward_total_composite_mean": 0.31343966722488403, "reward_total_composite_std": 0.06773490458726883} {"timestamp_utc": "2026-04-12T21:39:21Z", "mode": "train", "global_step": 1485, "epoch": 0.07815378137992737, "loss": -0.0462, "grad_norm": 3.93593692779541, "learning_rate": 5.5030303030303034e-06, "num_tokens": 2625619.0, "completions/mean_length": 164.5, "completions/min_length": 36.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 48.66666793823242, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 68.0, "rewards/meter/mean": 0.5685986280441284, "rewards/meter/std": 0.3968857228755951, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8860464692115784, "rewards/lexical_plausibility/std": 0.22089797258377075, "rewards/judge_quality/mean": 0.23749999701976776, "rewards/judge_quality/std": 0.155264750123024, "rewards/repeat_penalty/mean": 0.8654284477233887, "rewards/repeat_penalty/std": 0.13551020622253418, "rewards/repeat_floor/mean": 0.9869046211242676, "rewards/repeat_floor/std": 0.011987159959971905, "rewards/near_duplicate_penalty/mean": 0.9661963582038879, "rewards/near_duplicate_penalty/std": 0.027471110224723816, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9525013566017151, "rewards/distinct_2/std": 0.053281817585229874, "rewards/total_composite/mean": 0.12828464806079865, "rewards/total_composite/std": 0.15320289134979248, "reward": 0.12828464806079865, "reward_std": 0.15320289134979248, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14334425330162048, "sampling/sampling_logp_difference/max": 1.959779977798462, "sampling/importance_sampling_ratio/min": 0.14088942110538483, "sampling/importance_sampling_ratio/mean": 1.039678692817688, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.930069625377655, "clip_ratio/low_mean": 0.054975331760942936, "clip_ratio/low_min": 0.054975331760942936, "clip_ratio/high_mean": 0.033018868416547775, "clip_ratio/high_max": 0.033018868416547775, "clip_ratio/region_mean": 0.08799420017749071, "reward_total_mean": 0.12828464806079865, "reward_meter_mean": 0.5685986280441284, "reward_meter_std": 0.3968857228755951, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8860464692115784, "reward_lexical_plausibility_std": 0.22089797258377075, "reward_repeat_penalty_mean": 0.8654284477233887, "reward_repeat_penalty_std": 0.13551020622253418, "reward_repeat_floor_mean": 0.9869046211242676, "reward_repeat_floor_std": 0.011987159959971905, "reward_near_duplicate_penalty_mean": 0.9661963582038879, "reward_near_duplicate_penalty_std": 0.027471110224723816, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9525013566017151, "reward_distinct_2_std": 0.053281817585229874, "reward_judge_quality_mean": 0.23749999701976776, "reward_judge_quality_std": 0.155264750123024, "reward_total_composite_mean": 0.12828464806079865, "reward_total_composite_std": 0.15320289134979248} {"timestamp_utc": "2026-04-12T21:39:35Z", "mode": "train", "global_step": 1486, "epoch": 0.07820641018893743, "loss": -0.0118, "grad_norm": 1.9544090032577515, "learning_rate": 5.500000000000001e-06, "num_tokens": 2627037.0, "completions/mean_length": 148.25, "completions/min_length": 16.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 27.0, "completions/min_terminated_length": 16.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.6240063309669495, "rewards/meter/std": 0.43916282057762146, "rewards/count_adherence/mean": 0.5, "rewards/count_adherence/std": 0.5345224738121033, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8500000238418579, "rewards/count_floor/std": 0.16035674512386322, "rewards/lexical_plausibility/mean": 0.873565673828125, "rewards/lexical_plausibility/std": 0.23518669605255127, "rewards/judge_quality/mean": 0.30000001192092896, "rewards/judge_quality/std": 0.18516401946544647, "rewards/repeat_penalty/mean": 0.7838403582572937, "rewards/repeat_penalty/std": 0.1432766318321228, "rewards/repeat_floor/mean": 0.9840992093086243, "rewards/repeat_floor/std": 0.01313428208231926, "rewards/near_duplicate_penalty/mean": 0.9821920990943909, "rewards/near_duplicate_penalty/std": 0.038857847452163696, "rewards/opening_diversity/mean": 0.8125, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.978003978729248, "rewards/distinct_2/std": 0.04075079411268234, "rewards/total_composite/mean": 0.21810519695281982, "rewards/total_composite/std": 0.1997922956943512, "reward": 0.21810519695281982, "reward_std": 0.1997922956943512, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15405714511871338, "sampling/sampling_logp_difference/max": 0.9355897903442383, "sampling/importance_sampling_ratio/min": 0.39235439896583557, "sampling/importance_sampling_ratio/mean": 1.0509032011032104, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.2151992172002792, "clip_ratio/low_mean": 0.021042471285909414, "clip_ratio/low_min": 0.021042471285909414, "clip_ratio/high_mean": 0.07353148516267538, "clip_ratio/high_max": 0.07353148516267538, "clip_ratio/region_mean": 0.0945739564485848, "reward_total_mean": 0.21810519695281982, "reward_meter_mean": 0.6240063309669495, "reward_meter_std": 0.43916282057762146, "reward_count_adherence_mean": 0.5, "reward_count_adherence_std": 0.5345224738121033, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8500000238418579, "reward_count_floor_std": 0.16035674512386322, "reward_lexical_plausibility_mean": 0.873565673828125, "reward_lexical_plausibility_std": 0.23518669605255127, "reward_repeat_penalty_mean": 0.7838403582572937, "reward_repeat_penalty_std": 0.1432766318321228, "reward_repeat_floor_mean": 0.9840992093086243, "reward_repeat_floor_std": 0.01313428208231926, "reward_near_duplicate_penalty_mean": 0.9821920990943909, "reward_near_duplicate_penalty_std": 0.038857847452163696, "reward_opening_diversity_mean": 0.8125, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.978003978729248, "reward_distinct_2_std": 0.04075079411268234, "reward_judge_quality_mean": 0.30000001192092896, "reward_judge_quality_std": 0.18516401946544647, "reward_total_composite_mean": 0.21810519695281982, "reward_total_composite_std": 0.1997922956943512} {"timestamp_utc": "2026-04-12T21:39:48Z", "mode": "train", "global_step": 1487, "epoch": 0.07825903899794748, "loss": -0.1709, "grad_norm": 3.3017332553863525, "learning_rate": 5.496969696969697e-06, "num_tokens": 2629177.0, "completions/mean_length": 145.5, "completions/min_length": 82.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 93.14286041259766, "completions/min_terminated_length": 82.0, "completions/max_terminated_length": 106.0, "rewards/meter/mean": 0.8524502515792847, "rewards/meter/std": 0.1989641934633255, "rewards/count_adherence/mean": 0.8333333134651184, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.949999988079071, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9373282194137573, "rewards/lexical_plausibility/std": 0.1772625595331192, "rewards/judge_quality/mean": 0.32499998807907104, "rewards/judge_quality/std": 0.12817397713661194, "rewards/repeat_penalty/mean": 0.7223489284515381, "rewards/repeat_penalty/std": 0.1824721097946167, "rewards/repeat_floor/mean": 0.9715101718902588, "rewards/repeat_floor/std": 0.017117882147431374, "rewards/near_duplicate_penalty/mean": 0.9337801933288574, "rewards/near_duplicate_penalty/std": 0.02307550422847271, "rewards/opening_diversity/mean": 0.9323863983154297, "rewards/opening_diversity/std": 0.08456561714410782, "rewards/distinct_2/mean": 0.8388886451721191, "rewards/distinct_2/std": 0.11587636917829514, "rewards/total_composite/mean": 0.2683011591434479, "rewards/total_composite/std": 0.1135934367775917, "reward": 0.2683011591434479, "reward_std": 0.1135934367775917, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1571616530418396, "sampling/sampling_logp_difference/max": 3.443772792816162, "sampling/importance_sampling_ratio/min": 0.03194394335150719, "sampling/importance_sampling_ratio/mean": 1.0295419692993164, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7630656883120537, "clip_ratio/low_mean": 0.021341463550925255, "clip_ratio/low_min": 0.021341463550925255, "clip_ratio/high_mean": 0.09213289897888899, "clip_ratio/high_max": 0.09213289897888899, "clip_ratio/region_mean": 0.11347436252981424, "reward_total_mean": 0.2683011591434479, "reward_meter_mean": 0.8524502515792847, "reward_meter_std": 0.1989641934633255, "reward_count_adherence_mean": 0.8333333134651184, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.949999988079071, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9373282194137573, "reward_lexical_plausibility_std": 0.1772625595331192, "reward_repeat_penalty_mean": 0.7223489284515381, "reward_repeat_penalty_std": 0.1824721097946167, "reward_repeat_floor_mean": 0.9715101718902588, "reward_repeat_floor_std": 0.017117882147431374, "reward_near_duplicate_penalty_mean": 0.9337801933288574, "reward_near_duplicate_penalty_std": 0.02307550422847271, "reward_opening_diversity_mean": 0.9323863983154297, "reward_opening_diversity_std": 0.08456561714410782, "reward_distinct_2_mean": 0.8388886451721191, "reward_distinct_2_std": 0.11587636917829514, "reward_judge_quality_mean": 0.32499998807907104, "reward_judge_quality_std": 0.12817397713661194, "reward_total_composite_mean": 0.2683011591434479, "reward_total_composite_std": 0.1135934367775917} {"timestamp_utc": "2026-04-12T21:39:58Z", "mode": "train", "global_step": 1488, "epoch": 0.07831166780695753, "loss": 0.0485, "grad_norm": 11.664468765258789, "learning_rate": 5.493939393939395e-06, "num_tokens": 2631049.0, "completions/mean_length": 70.0, "completions/min_length": 64.0, "completions/max_length": 77.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 70.0, "completions/min_terminated_length": 64.0, "completions/max_terminated_length": 77.0, "rewards/meter/mean": 0.5656070113182068, "rewards/meter/std": 0.38506126403808594, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41249996423721313, "rewards/judge_quality/std": 0.0517549142241478, "rewards/repeat_penalty/mean": 0.8139246702194214, "rewards/repeat_penalty/std": 0.09003651887178421, "rewards/repeat_floor/mean": 0.9799196124076843, "rewards/repeat_floor/std": 0.010779653675854206, "rewards/near_duplicate_penalty/mean": 0.9567646384239197, "rewards/near_duplicate_penalty/std": 0.031647518277168274, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8489433526992798, "rewards/distinct_2/std": 0.07170760631561279, "rewards/total_composite/mean": 0.21787984669208527, "rewards/total_composite/std": 0.15066687762737274, "reward": 0.21787984669208527, "reward_std": 0.15066687762737274, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16216185688972473, "sampling/sampling_logp_difference/max": 1.274740219116211, "sampling/importance_sampling_ratio/min": 0.27950355410575867, "sampling/importance_sampling_ratio/mean": 1.0116816759109497, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.190341092646122, "clip_ratio/low_mean": 0.05594387277960777, "clip_ratio/low_min": 0.05594387277960777, "clip_ratio/high_mean": 0.12318585999310017, "clip_ratio/high_max": 0.12318585999310017, "clip_ratio/region_mean": 0.17912973277270794, "reward_total_mean": 0.21787984669208527, "reward_meter_mean": 0.5656070113182068, "reward_meter_std": 0.38506126403808594, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8139246702194214, "reward_repeat_penalty_std": 0.09003651887178421, "reward_repeat_floor_mean": 0.9799196124076843, "reward_repeat_floor_std": 0.010779653675854206, "reward_near_duplicate_penalty_mean": 0.9567646384239197, "reward_near_duplicate_penalty_std": 0.031647518277168274, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8489433526992798, "reward_distinct_2_std": 0.07170760631561279, "reward_judge_quality_mean": 0.41249996423721313, "reward_judge_quality_std": 0.0517549142241478, "reward_total_composite_mean": 0.21787984669208527, "reward_total_composite_std": 0.15066687762737274} {"timestamp_utc": "2026-04-12T21:40:13Z", "mode": "train", "global_step": 1489, "epoch": 0.07836429661596758, "loss": -0.0086, "grad_norm": 13.06687068939209, "learning_rate": 5.490909090909091e-06, "num_tokens": 2632709.0, "completions/mean_length": 42.5, "completions/min_length": 37.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.5, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.3592393100261688, "rewards/meter/std": 0.37753790616989136, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.731249988079071, "rewards/judge_quality/std": 0.2623213827610016, "rewards/repeat_penalty/mean": 0.929060697555542, "rewards/repeat_penalty/std": 0.05514172464609146, "rewards/repeat_floor/mean": 0.9909193515777588, "rewards/repeat_floor/std": 0.0063325450755655766, "rewards/near_duplicate_penalty/mean": 0.9576809406280518, "rewards/near_duplicate_penalty/std": 0.02281358651816845, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9696356058120728, "rewards/distinct_2/std": 0.04190681502223015, "rewards/total_composite/mean": 0.26232224702835083, "rewards/total_composite/std": 0.30432623624801636, "reward": 0.26232224702835083, "reward_std": 0.30432623624801636, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12602795660495758, "sampling/sampling_logp_difference/max": 1.3015408515930176, "sampling/importance_sampling_ratio/min": 0.2721121907234192, "sampling/importance_sampling_ratio/mean": 1.0090632438659668, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6958280131220818, "clip_ratio/low_mean": 0.0829486520960927, "clip_ratio/low_min": 0.0829486520960927, "clip_ratio/high_mean": 0.03374537592753768, "clip_ratio/high_max": 0.03374537592753768, "clip_ratio/region_mean": 0.11669402802363038, "reward_total_mean": 0.26232224702835083, "reward_meter_mean": 0.3592393100261688, "reward_meter_std": 0.37753790616989136, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.929060697555542, "reward_repeat_penalty_std": 0.05514172464609146, "reward_repeat_floor_mean": 0.9909193515777588, "reward_repeat_floor_std": 0.0063325450755655766, "reward_near_duplicate_penalty_mean": 0.9576809406280518, "reward_near_duplicate_penalty_std": 0.02281358651816845, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9696356058120728, "reward_distinct_2_std": 0.04190681502223015, "reward_judge_quality_mean": 0.731249988079071, "reward_judge_quality_std": 0.2623213827610016, "reward_total_composite_mean": 0.26232224702835083, "reward_total_composite_std": 0.30432623624801636} {"timestamp_utc": "2026-04-12T21:40:27Z", "mode": "train", "global_step": 1490, "epoch": 0.07841692542497763, "loss": -0.0428, "grad_norm": 1.673332929611206, "learning_rate": 5.487878787878789e-06, "num_tokens": 2634104.0, "completions/mean_length": 143.375, "completions/min_length": 20.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 20.5, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 21.0, "rewards/meter/mean": 0.7184266448020935, "rewards/meter/std": 0.4443516433238983, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.8509981632232666, "rewards/lexical_plausibility/std": 0.2576138377189636, "rewards/judge_quality/mean": 0.6000000238418579, "rewards/judge_quality/std": 0.44352486729621887, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.5575048923492432, "rewards/total_composite/std": 0.42457643151283264, "reward": 0.5575048923492432, "reward_std": 0.42457643151283264, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10896066576242447, "sampling/sampling_logp_difference/max": 0.9587488174438477, "sampling/importance_sampling_ratio/min": 0.3833722770214081, "sampling/importance_sampling_ratio/mean": 1.0135163068771362, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5921568423509598, "clip_ratio/low_mean": 0.02380952425301075, "clip_ratio/low_min": 0.02380952425301075, "clip_ratio/high_mean": 0.030654762405902147, "clip_ratio/high_max": 0.030654762405902147, "clip_ratio/region_mean": 0.0544642866589129, "reward_total_mean": 0.5575048923492432, "reward_meter_mean": 0.7184266448020935, "reward_meter_std": 0.4443516433238983, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.8509981632232666, "reward_lexical_plausibility_std": 0.2576138377189636, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.6000000238418579, "reward_judge_quality_std": 0.44352486729621887, "reward_total_composite_mean": 0.5575048923492432, "reward_total_composite_std": 0.42457643151283264} {"timestamp_utc": "2026-04-12T21:40:37Z", "mode": "train", "global_step": 1491, "epoch": 0.07846955423398769, "loss": 0.0606, "grad_norm": 8.14633560180664, "learning_rate": 5.484848484848485e-06, "num_tokens": 2636447.0, "completions/mean_length": 89.875, "completions/min_length": 75.0, "completions/max_length": 104.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 89.875, "completions/min_terminated_length": 75.0, "completions/max_terminated_length": 104.0, "rewards/meter/mean": 0.707213282585144, "rewards/meter/std": 0.2729416787624359, "rewards/count_adherence/mean": 0.8500000238418579, "rewards/count_adherence/std": 0.09258200973272324, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9550000429153442, "rewards/count_floor/std": 0.02777460590004921, "rewards/lexical_plausibility/mean": 0.9965277910232544, "rewards/lexical_plausibility/std": 0.009820932522416115, "rewards/judge_quality/mean": 0.5537499785423279, "rewards/judge_quality/std": 0.18469570577144623, "rewards/repeat_penalty/mean": 0.7755419611930847, "rewards/repeat_penalty/std": 0.13996149599552155, "rewards/repeat_floor/mean": 0.9788610339164734, "rewards/repeat_floor/std": 0.013142640702426434, "rewards/near_duplicate_penalty/mean": 0.9672986268997192, "rewards/near_duplicate_penalty/std": 0.02037934772670269, "rewards/opening_diversity/mean": 0.8932291269302368, "rewards/opening_diversity/std": 0.10232751816511154, "rewards/distinct_2/mean": 0.8908056616783142, "rewards/distinct_2/std": 0.05121969059109688, "rewards/total_composite/mean": 0.34950780868530273, "rewards/total_composite/std": 0.20279620587825775, "reward": 0.34950780868530273, "reward_std": 0.20279620587825775, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1235978901386261, "sampling/sampling_logp_difference/max": 1.5745749473571777, "sampling/importance_sampling_ratio/min": 0.20709556341171265, "sampling/importance_sampling_ratio/mean": 0.9896231889724731, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6195723824203014, "clip_ratio/low_mean": 0.09080421086400747, "clip_ratio/low_min": 0.09080421086400747, "clip_ratio/high_mean": 0.033072915859520435, "clip_ratio/high_max": 0.033072915859520435, "clip_ratio/region_mean": 0.12387712672352791, "reward_total_mean": 0.34950780868530273, "reward_meter_mean": 0.707213282585144, "reward_meter_std": 0.2729416787624359, "reward_count_adherence_mean": 0.8500000238418579, "reward_count_adherence_std": 0.09258200973272324, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9550000429153442, "reward_count_floor_std": 0.02777460590004921, "reward_lexical_plausibility_mean": 0.9965277910232544, "reward_lexical_plausibility_std": 0.009820932522416115, "reward_repeat_penalty_mean": 0.7755419611930847, "reward_repeat_penalty_std": 0.13996149599552155, "reward_repeat_floor_mean": 0.9788610339164734, "reward_repeat_floor_std": 0.013142640702426434, "reward_near_duplicate_penalty_mean": 0.9672986268997192, "reward_near_duplicate_penalty_std": 0.02037934772670269, "reward_opening_diversity_mean": 0.8932291269302368, "reward_opening_diversity_std": 0.10232751816511154, "reward_distinct_2_mean": 0.8908056616783142, "reward_distinct_2_std": 0.05121969059109688, "reward_judge_quality_mean": 0.5537499785423279, "reward_judge_quality_std": 0.18469570577144623, "reward_total_composite_mean": 0.34950780868530273, "reward_total_composite_std": 0.20279620587825775} {"timestamp_utc": "2026-04-12T21:40:47Z", "mode": "train", "global_step": 1492, "epoch": 0.07852218304299774, "loss": -0.0241, "grad_norm": 12.305021286010742, "learning_rate": 5.4818181818181825e-06, "num_tokens": 2638512.0, "completions/mean_length": 82.125, "completions/min_length": 73.0, "completions/max_length": 89.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 82.125, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 89.0, "rewards/meter/mean": 0.8114791512489319, "rewards/meter/std": 0.27180203795433044, "rewards/count_adherence/mean": 0.800000011920929, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9399999976158142, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.0353553369641304, "rewards/repeat_penalty/mean": 0.7008771300315857, "rewards/repeat_penalty/std": 0.07706035673618317, "rewards/repeat_floor/mean": 0.9699922800064087, "rewards/repeat_floor/std": 0.007471021264791489, "rewards/near_duplicate_penalty/mean": 0.9324653148651123, "rewards/near_duplicate_penalty/std": 0.02045949548482895, "rewards/opening_diversity/mean": 0.9765625, "rewards/opening_diversity/std": 0.032346826046705246, "rewards/distinct_2/mean": 0.7947638034820557, "rewards/distinct_2/std": 0.07021769881248474, "rewards/total_composite/mean": 0.26756078004837036, "rewards/total_composite/std": 0.10327073931694031, "reward": 0.26756078004837036, "reward_std": 0.10327073931694031, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1463538408279419, "sampling/sampling_logp_difference/max": 2.0251224040985107, "sampling/importance_sampling_ratio/min": 0.13197769224643707, "sampling/importance_sampling_ratio/mean": 1.0007835626602173, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7512584701180458, "clip_ratio/low_mean": 0.024697049520909786, "clip_ratio/low_min": 0.024697049520909786, "clip_ratio/high_mean": 0.09512386005371809, "clip_ratio/high_max": 0.09512386005371809, "clip_ratio/region_mean": 0.11982090957462788, "reward_total_mean": 0.26756078004837036, "reward_meter_mean": 0.8114791512489319, "reward_meter_std": 0.27180203795433044, "reward_count_adherence_mean": 0.800000011920929, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9399999976158142, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7008771300315857, "reward_repeat_penalty_std": 0.07706035673618317, "reward_repeat_floor_mean": 0.9699922800064087, "reward_repeat_floor_std": 0.007471021264791489, "reward_near_duplicate_penalty_mean": 0.9324653148651123, "reward_near_duplicate_penalty_std": 0.02045949548482895, "reward_opening_diversity_mean": 0.9765625, "reward_opening_diversity_std": 0.032346826046705246, "reward_distinct_2_mean": 0.7947638034820557, "reward_distinct_2_std": 0.07021769881248474, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.0353553369641304, "reward_total_composite_mean": 0.26756078004837036, "reward_total_composite_std": 0.10327073931694031} {"timestamp_utc": "2026-04-12T21:41:01Z", "mode": "train", "global_step": 1493, "epoch": 0.07857481185200779, "loss": 0.001, "grad_norm": 6.434122562408447, "learning_rate": 5.478787878787879e-06, "num_tokens": 2639919.0, "completions/mean_length": 82.875, "completions/min_length": 17.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 21.571430206298828, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 36.0, "rewards/meter/mean": 0.6664613485336304, "rewards/meter/std": 0.3683927059173584, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9344984292984009, "rewards/lexical_plausibility/std": 0.18526646494865417, "rewards/judge_quality/mean": 0.668749988079071, "rewards/judge_quality/std": 0.3589046001434326, "rewards/repeat_penalty/mean": 0.78125, "rewards/repeat_penalty/std": 0.0883883461356163, "rewards/repeat_floor/mean": 0.9868749976158142, "rewards/repeat_floor/std": 0.00530329579487443, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.42003118991851807, "rewards/total_composite/std": 0.3424651026725769, "reward": 0.42003118991851807, "reward_std": 0.3424651026725769, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15595580637454987, "sampling/sampling_logp_difference/max": 2.0770986080169678, "sampling/importance_sampling_ratio/min": 0.12529321014881134, "sampling/importance_sampling_ratio/mean": 1.0601035356521606, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7379826530814171, "clip_ratio/low_mean": 0.10134804295375943, "clip_ratio/low_min": 0.10134804295375943, "clip_ratio/high_mean": 0.05871212296187878, "clip_ratio/high_max": 0.05871212296187878, "clip_ratio/region_mean": 0.1600601659156382, "reward_total_mean": 0.42003118991851807, "reward_meter_mean": 0.6664613485336304, "reward_meter_std": 0.3683927059173584, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9344984292984009, "reward_lexical_plausibility_std": 0.18526646494865417, "reward_repeat_penalty_mean": 0.78125, "reward_repeat_penalty_std": 0.0883883461356163, "reward_repeat_floor_mean": 0.9868749976158142, "reward_repeat_floor_std": 0.00530329579487443, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.668749988079071, "reward_judge_quality_std": 0.3589046001434326, "reward_total_composite_mean": 0.42003118991851807, "reward_total_composite_std": 0.3424651026725769} {"timestamp_utc": "2026-04-12T21:41:14Z", "mode": "train", "global_step": 1494, "epoch": 0.07862744066101784, "loss": -0.0158, "grad_norm": 4.789248466491699, "learning_rate": 5.475757575757576e-06, "num_tokens": 2641538.0, "completions/mean_length": 100.375, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 41.57143020629883, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.5468735098838806, "rewards/meter/std": 0.4477143883705139, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.9311972260475159, "rewards/lexical_plausibility/std": 0.19460363686084747, "rewards/judge_quality/mean": 0.5212500095367432, "rewards/judge_quality/std": 0.27523690462112427, "rewards/repeat_penalty/mean": 0.9528023600578308, "rewards/repeat_penalty/std": 0.08412477374076843, "rewards/repeat_floor/mean": 0.995732843875885, "rewards/repeat_floor/std": 0.005191707983613014, "rewards/near_duplicate_penalty/mean": 0.9840523600578308, "rewards/near_duplicate_penalty/std": 0.02008967101573944, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3218480050563812, "rewards/total_composite/std": 0.31258994340896606, "reward": 0.3218480050563812, "reward_std": 0.31258994340896606, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13717229664325714, "sampling/sampling_logp_difference/max": 1.1928362846374512, "sampling/importance_sampling_ratio/min": 0.30335962772369385, "sampling/importance_sampling_ratio/mean": 1.0361531972885132, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8859149366617203, "clip_ratio/low_mean": 0.040857032872736454, "clip_ratio/low_min": 0.040857032872736454, "clip_ratio/high_mean": 0.055024946574121714, "clip_ratio/high_max": 0.055024946574121714, "clip_ratio/region_mean": 0.09588197944685817, "reward_total_mean": 0.3218480050563812, "reward_meter_mean": 0.5468735098838806, "reward_meter_std": 0.4477143883705139, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.9311972260475159, "reward_lexical_plausibility_std": 0.19460363686084747, "reward_repeat_penalty_mean": 0.9528023600578308, "reward_repeat_penalty_std": 0.08412477374076843, "reward_repeat_floor_mean": 0.995732843875885, "reward_repeat_floor_std": 0.005191707983613014, "reward_near_duplicate_penalty_mean": 0.9840523600578308, "reward_near_duplicate_penalty_std": 0.02008967101573944, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.5212500095367432, "reward_judge_quality_std": 0.27523690462112427, "reward_total_composite_mean": 0.3218480050563812, "reward_total_composite_std": 0.31258994340896606} {"timestamp_utc": "2026-04-12T21:41:24Z", "mode": "train", "global_step": 1495, "epoch": 0.0786800694700279, "loss": -0.03, "grad_norm": 10.359344482421875, "learning_rate": 5.472727272727273e-06, "num_tokens": 2643390.0, "completions/mean_length": 60.5, "completions/min_length": 54.0, "completions/max_length": 69.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 60.5, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 69.0, "rewards/meter/mean": 0.7368300557136536, "rewards/meter/std": 0.31711530685424805, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.48749998211860657, "rewards/judge_quality/std": 0.1060660257935524, "rewards/repeat_penalty/mean": 0.8162379860877991, "rewards/repeat_penalty/std": 0.18616178631782532, "rewards/repeat_floor/mean": 0.9810099601745605, "rewards/repeat_floor/std": 0.018245793879032135, "rewards/near_duplicate_penalty/mean": 0.9489593505859375, "rewards/near_duplicate_penalty/std": 0.03879024088382721, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9365675449371338, "rewards/distinct_2/std": 0.06015472486615181, "rewards/total_composite/mean": 0.3489229083061218, "rewards/total_composite/std": 0.14641989767551422, "reward": 0.3489229083061218, "reward_std": 0.14641989767551422, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1227312907576561, "sampling/sampling_logp_difference/max": 1.6666741371154785, "sampling/importance_sampling_ratio/min": 0.18887419998645782, "sampling/importance_sampling_ratio/mean": 1.0128438472747803, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9465381503105164, "clip_ratio/low_mean": 0.036210318095982075, "clip_ratio/low_min": 0.036210318095982075, "clip_ratio/high_mean": 0.10332394111901522, "clip_ratio/high_max": 0.10332394111901522, "clip_ratio/region_mean": 0.1395342592149973, "reward_total_mean": 0.3489229083061218, "reward_meter_mean": 0.7368300557136536, "reward_meter_std": 0.31711530685424805, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8162379860877991, "reward_repeat_penalty_std": 0.18616178631782532, "reward_repeat_floor_mean": 0.9810099601745605, "reward_repeat_floor_std": 0.018245793879032135, "reward_near_duplicate_penalty_mean": 0.9489593505859375, "reward_near_duplicate_penalty_std": 0.03879024088382721, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9365675449371338, "reward_distinct_2_std": 0.06015472486615181, "reward_judge_quality_mean": 0.48749998211860657, "reward_judge_quality_std": 0.1060660257935524, "reward_total_composite_mean": 0.3489229083061218, "reward_total_composite_std": 0.14641989767551422} {"timestamp_utc": "2026-04-12T21:41:34Z", "mode": "train", "global_step": 1496, "epoch": 0.07873269827903795, "loss": 0.0842, "grad_norm": 14.571981430053711, "learning_rate": 5.469696969696971e-06, "num_tokens": 2645079.0, "completions/mean_length": 41.125, "completions/min_length": 36.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 41.125, "completions/min_terminated_length": 36.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.7244601845741272, "rewards/meter/std": 0.35150283575057983, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.550000011920929, "rewards/judge_quality/std": 0.21902382373809814, "rewards/repeat_penalty/mean": 0.965584397315979, "rewards/repeat_penalty/std": 0.031008455902338028, "rewards/repeat_floor/mean": 0.9948376417160034, "rewards/repeat_floor/std": 0.004651259630918503, "rewards/near_duplicate_penalty/mean": 0.965584397315979, "rewards/near_duplicate_penalty/std": 0.031008455902338028, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.41951608657836914, "rewards/total_composite/std": 0.30211377143859863, "reward": 0.41951608657836914, "reward_std": 0.30211377143859863, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1708325445652008, "sampling/sampling_logp_difference/max": 2.2356536388397217, "sampling/importance_sampling_ratio/min": 0.1069222167134285, "sampling/importance_sampling_ratio/mean": 1.0017690658569336, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.046118751168251, "clip_ratio/low_mean": 0.06589591037482023, "clip_ratio/low_min": 0.06589591037482023, "clip_ratio/high_mean": 0.053077406249940395, "clip_ratio/high_max": 0.053077406249940395, "clip_ratio/region_mean": 0.11897331662476063, "reward_total_mean": 0.41951608657836914, "reward_meter_mean": 0.7244601845741272, "reward_meter_std": 0.35150283575057983, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.965584397315979, "reward_repeat_penalty_std": 0.031008455902338028, "reward_repeat_floor_mean": 0.9948376417160034, "reward_repeat_floor_std": 0.004651259630918503, "reward_near_duplicate_penalty_mean": 0.965584397315979, "reward_near_duplicate_penalty_std": 0.031008455902338028, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.550000011920929, "reward_judge_quality_std": 0.21902382373809814, "reward_total_composite_mean": 0.41951608657836914, "reward_total_composite_std": 0.30211377143859863} {"timestamp_utc": "2026-04-12T21:41:47Z", "mode": "train", "global_step": 1497, "epoch": 0.078785327088048, "loss": -0.0631, "grad_norm": 2.9713034629821777, "learning_rate": 5.466666666666667e-06, "num_tokens": 2646603.0, "completions/mean_length": 155.5, "completions/min_length": 29.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 36.66666793823242, "completions/min_terminated_length": 29.0, "completions/max_terminated_length": 49.0, "rewards/meter/mean": 0.003530373563989997, "rewards/meter/std": 0.003565644845366478, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.8572268486022949, "rewards/lexical_plausibility/std": 0.24691884219646454, "rewards/judge_quality/mean": 0.5850000381469727, "rewards/judge_quality/std": 0.38873422145843506, "rewards/repeat_penalty/mean": 0.9400744438171387, "rewards/repeat_penalty/std": 0.10531332343816757, "rewards/repeat_floor/mean": 0.9924274682998657, "rewards/repeat_floor/std": 0.013014971278607845, "rewards/near_duplicate_penalty/mean": 0.9691842794418335, "rewards/near_duplicate_penalty/std": 0.046577438712120056, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9672203063964844, "rewards/distinct_2/std": 0.06894759088754654, "rewards/total_composite/mean": 0.0021841018460690975, "rewards/total_composite/std": 0.0018069708021357656, "reward": 0.0021841018460690975, "reward_std": 0.0018069706857204437, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.17462275922298431, "sampling/sampling_logp_difference/max": 3.2488083839416504, "sampling/importance_sampling_ratio/min": 0.03882044181227684, "sampling/importance_sampling_ratio/mean": 1.0238977670669556, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9586880058050156, "clip_ratio/low_mean": 0.05899064056575298, "clip_ratio/low_min": 0.05899064056575298, "clip_ratio/high_mean": 0.09824727475643158, "clip_ratio/high_max": 0.09824727475643158, "clip_ratio/region_mean": 0.15723791532218456, "reward_total_mean": 0.0021841018460690975, "reward_meter_mean": 0.003530373563989997, "reward_meter_std": 0.003565644845366478, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.8572268486022949, "reward_lexical_plausibility_std": 0.24691884219646454, "reward_repeat_penalty_mean": 0.9400744438171387, "reward_repeat_penalty_std": 0.10531332343816757, "reward_repeat_floor_mean": 0.9924274682998657, "reward_repeat_floor_std": 0.013014971278607845, "reward_near_duplicate_penalty_mean": 0.9691842794418335, "reward_near_duplicate_penalty_std": 0.046577438712120056, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9672203063964844, "reward_distinct_2_std": 0.06894759088754654, "reward_judge_quality_mean": 0.5850000381469727, "reward_judge_quality_std": 0.38873422145843506, "reward_total_composite_mean": 0.0021841018460690975, "reward_total_composite_std": 0.0018069708021357656} {"timestamp_utc": "2026-04-12T21:41:56Z", "mode": "train", "global_step": 1498, "epoch": 0.07883795589705805, "loss": 0.0322, "grad_norm": 12.15373420715332, "learning_rate": 5.463636363636364e-06, "num_tokens": 2648308.0, "completions/mean_length": 56.125, "completions/min_length": 53.0, "completions/max_length": 60.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 56.125, "completions/min_terminated_length": 53.0, "completions/max_terminated_length": 60.0, "rewards/meter/mean": 0.8618424534797668, "rewards/meter/std": 0.21899884939193726, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.44999998807907104, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9447248578071594, "rewards/repeat_penalty/std": 0.06420300900936127, "rewards/repeat_floor/mean": 0.9930490255355835, "rewards/repeat_floor/std": 0.007730742450803518, "rewards/near_duplicate_penalty/mean": 0.9694256782531738, "rewards/near_duplicate_penalty/std": 0.031231814995408058, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9737240076065063, "rewards/distinct_2/std": 0.04157579690217972, "rewards/total_composite/mean": 0.38480257987976074, "rewards/total_composite/std": 0.09682688117027283, "reward": 0.38480257987976074, "reward_std": 0.09682688862085342, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10703235119581223, "sampling/sampling_logp_difference/max": 1.5997743606567383, "sampling/importance_sampling_ratio/min": 0.2019420713186264, "sampling/importance_sampling_ratio/mean": 1.0039345026016235, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6510071456432343, "clip_ratio/low_mean": 0.021558132953941822, "clip_ratio/low_min": 0.021558132953941822, "clip_ratio/high_mean": 0.06633547181263566, "clip_ratio/high_max": 0.06633547181263566, "clip_ratio/region_mean": 0.08789360476657748, "reward_total_mean": 0.38480257987976074, "reward_meter_mean": 0.8618424534797668, "reward_meter_std": 0.21899884939193726, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9447248578071594, "reward_repeat_penalty_std": 0.06420300900936127, "reward_repeat_floor_mean": 0.9930490255355835, "reward_repeat_floor_std": 0.007730742450803518, "reward_near_duplicate_penalty_mean": 0.9694256782531738, "reward_near_duplicate_penalty_std": 0.031231814995408058, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9737240076065063, "reward_distinct_2_std": 0.04157579690217972, "reward_judge_quality_mean": 0.44999998807907104, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.38480257987976074, "reward_total_composite_std": 0.09682688117027283} {"timestamp_utc": "2026-04-12T21:42:09Z", "mode": "train", "global_step": 1499, "epoch": 0.0788905847060681, "loss": -0.0718, "grad_norm": 5.17856502532959, "learning_rate": 5.460606060606061e-06, "num_tokens": 2649814.0, "completions/mean_length": 97.25, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.0, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 44.0, "rewards/meter/mean": 0.7419392466545105, "rewards/meter/std": 0.35429903864860535, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9380473494529724, "rewards/lexical_plausibility/std": 0.17522861063480377, "rewards/judge_quality/mean": 0.4712499976158142, "rewards/judge_quality/std": 0.26384180784225464, "rewards/repeat_penalty/mean": 0.9611736536026001, "rewards/repeat_penalty/std": 0.06628385186195374, "rewards/repeat_floor/mean": 0.9945216178894043, "rewards/repeat_floor/std": 0.009005018509924412, "rewards/near_duplicate_penalty/mean": 0.968722403049469, "rewards/near_duplicate_penalty/std": 0.04608163982629776, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9912587404251099, "rewards/distinct_2/std": 0.024724015966057777, "rewards/total_composite/mean": 0.3988385498523712, "rewards/total_composite/std": 0.2777070701122284, "reward": 0.3988385498523712, "reward_std": 0.2777070701122284, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14017628133296967, "sampling/sampling_logp_difference/max": 1.3838778734207153, "sampling/importance_sampling_ratio/min": 0.2506048381328583, "sampling/importance_sampling_ratio/mean": 1.0108575820922852, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8696282655000687, "clip_ratio/low_mean": 0.04787644650787115, "clip_ratio/low_min": 0.04787644650787115, "clip_ratio/high_mean": 0.06470645405352116, "clip_ratio/high_max": 0.06470645405352116, "clip_ratio/region_mean": 0.11258290056139231, "reward_total_mean": 0.3988385498523712, "reward_meter_mean": 0.7419392466545105, "reward_meter_std": 0.35429903864860535, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9380473494529724, "reward_lexical_plausibility_std": 0.17522861063480377, "reward_repeat_penalty_mean": 0.9611736536026001, "reward_repeat_penalty_std": 0.06628385186195374, "reward_repeat_floor_mean": 0.9945216178894043, "reward_repeat_floor_std": 0.009005018509924412, "reward_near_duplicate_penalty_mean": 0.968722403049469, "reward_near_duplicate_penalty_std": 0.04608163982629776, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9912587404251099, "reward_distinct_2_std": 0.024724015966057777, "reward_judge_quality_mean": 0.4712499976158142, "reward_judge_quality_std": 0.26384180784225464, "reward_total_composite_mean": 0.3988385498523712, "reward_total_composite_std": 0.2777070701122284} {"timestamp_utc": "2026-04-12T21:42:19Z", "mode": "train", "global_step": 1500, "epoch": 0.07894321351507816, "loss": 0.0934, "grad_norm": 11.850004196166992, "learning_rate": 5.457575757575758e-06, "num_tokens": 2651717.0, "completions/mean_length": 65.875, "completions/min_length": 62.0, "completions/max_length": 80.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.875, "completions/min_terminated_length": 62.0, "completions/max_terminated_length": 80.0, "rewards/meter/mean": 0.828018844127655, "rewards/meter/std": 0.33673205971717834, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4374999701976776, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.7612658739089966, "rewards/repeat_penalty/std": 0.1380801945924759, "rewards/repeat_floor/mean": 0.9732581377029419, "rewards/repeat_floor/std": 0.013619935140013695, "rewards/near_duplicate_penalty/mean": 0.9182708263397217, "rewards/near_duplicate_penalty/std": 0.036135610193014145, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.8807505369186401, "rewards/distinct_2/std": 0.06856482475996017, "rewards/total_composite/mean": 0.32490718364715576, "rewards/total_composite/std": 0.15903796255588531, "reward": 0.32490718364715576, "reward_std": 0.15903796255588531, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1432938128709793, "sampling/sampling_logp_difference/max": 1.5977137088775635, "sampling/importance_sampling_ratio/min": 0.2155953198671341, "sampling/importance_sampling_ratio/mean": 1.0119035243988037, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.857727088034153, "clip_ratio/low_mean": 0.08351230248808861, "clip_ratio/low_min": 0.08351230248808861, "clip_ratio/high_mean": 0.04989119339734316, "clip_ratio/high_max": 0.04989119339734316, "clip_ratio/region_mean": 0.13340349588543177, "reward_total_mean": 0.32490718364715576, "reward_meter_mean": 0.828018844127655, "reward_meter_std": 0.33673205971717834, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7612658739089966, "reward_repeat_penalty_std": 0.1380801945924759, "reward_repeat_floor_mean": 0.9732581377029419, "reward_repeat_floor_std": 0.013619935140013695, "reward_near_duplicate_penalty_mean": 0.9182708263397217, "reward_near_duplicate_penalty_std": 0.036135610193014145, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.8807505369186401, "reward_distinct_2_std": 0.06856482475996017, "reward_judge_quality_mean": 0.4374999701976776, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.32490718364715576, "reward_total_composite_std": 0.15903796255588531} {"timestamp_utc": "2026-04-12T21:44:28Z", "mode": "eval", "global_step": 1500, "epoch": 0.07894321351507816, "eval_loss": NaN, "eval_runtime": 128.8856, "eval_samples_per_second": 0.807, "eval_steps_per_second": 0.101, "eval_num_tokens": 2651717.0, "eval_completions/mean_length": 138.44230769230768, "eval_completions/min_length": 34.46153846153846, "eval_completions/max_length": 363.38461538461536, "eval_completions/clipped_ratio": 0.09615384615384616, "eval_completions/mean_terminated_length": 98.25925181462215, "eval_completions/min_terminated_length": 34.46153846153846, "eval_completions/max_terminated_length": 186.53846153846155, "eval_rewards/meter/mean": 0.5205199214128348, "eval_rewards/meter/std": 0.3734464542223857, "eval_rewards/count_adherence/mean": 0.7607057553071243, "eval_rewards/count_adherence/std": 0.19632262048813012, "eval_rewards/arabic_clean/mean": 0.8653846153846154, "eval_rewards/arabic_clean/std": 0.320187671826436, "eval_rewards/hard_gate/mean": 0.9903846153846154, "eval_rewards/hard_gate/std": 0.027196414195574246, "eval_rewards/arabic_floor/mean": 0.9971153827813956, "eval_rewards/arabic_floor/std": 0.008158923341677738, "eval_rewards/count_floor/mean": 0.9282117256751428, "eval_rewards/count_floor/std": 0.05889678803774027, "eval_rewards/lexical_plausibility/mean": 0.952255340722891, "eval_rewards/lexical_plausibility/std": 0.10383106080385354, "eval_rewards/judge_quality/mean": 0.40288461630160993, "eval_rewards/judge_quality/std": 0.191096341667267, "eval_rewards/repeat_penalty/mean": 0.8246570871426508, "eval_rewards/repeat_penalty/std": 0.18076111978063217, "eval_rewards/repeat_floor/mean": 0.9809717169174781, "eval_rewards/repeat_floor/std": 0.019479196697760087, "eval_rewards/near_duplicate_penalty/mean": 0.952797912634336, "eval_rewards/near_duplicate_penalty/std": 0.042314441301501714, "eval_rewards/opening_diversity/mean": 0.9644750494223374, "eval_rewards/opening_diversity/std": 0.08255957468197896, "eval_rewards/distinct_2/mean": 0.8909281308834369, "eval_rewards/distinct_2/std": 0.13125740163601363, "eval_rewards/total_composite/mean": 0.18016218164792427, "eval_rewards/total_composite/std": 0.16037252316108117, "eval_reward": 0.18016218164792427, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.07613115356518672, "eval_sampling/sampling_logp_difference/max": 1.0884063977461595, "eval_sampling/importance_sampling_ratio/min": 0.3465814143419266, "eval_sampling/importance_sampling_ratio/mean": 1.0177436058337872, "eval_sampling/importance_sampling_ratio/max": 1.5422767400741577, "eval_entropy": 0.830715876359206, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.18016218164792427, "eval_reward_meter_mean": 0.5205199214128348, "eval_reward_meter_std": 0.3734464542223857, "eval_reward_count_adherence_mean": 0.7607057553071243, "eval_reward_count_adherence_std": 0.19632262048813012, "eval_reward_arabic_clean_mean": 0.8653846153846154, "eval_reward_arabic_clean_std": 0.320187671826436, "eval_reward_hard_gate_mean": 0.9903846153846154, "eval_reward_hard_gate_std": 0.027196414195574246, "eval_reward_arabic_floor_mean": 0.9971153827813956, "eval_reward_arabic_floor_std": 0.008158923341677738, "eval_reward_count_floor_mean": 0.9282117256751428, "eval_reward_count_floor_std": 0.05889678803774027, "eval_reward_lexical_plausibility_mean": 0.952255340722891, "eval_reward_lexical_plausibility_std": 0.10383106080385354, "eval_reward_repeat_penalty_mean": 0.8246570871426508, "eval_reward_repeat_penalty_std": 0.18076111978063217, "eval_reward_repeat_floor_mean": 0.9809717169174781, "eval_reward_repeat_floor_std": 0.019479196697760087, "eval_reward_near_duplicate_penalty_mean": 0.952797912634336, "eval_reward_near_duplicate_penalty_std": 0.042314441301501714, "eval_reward_opening_diversity_mean": 0.9644750494223374, "eval_reward_opening_diversity_std": 0.08255957468197896, "eval_reward_distinct_2_mean": 0.8909281308834369, "eval_reward_distinct_2_std": 0.13125740163601363, "eval_reward_judge_quality_mean": 0.40288461630160993, "eval_reward_judge_quality_std": 0.191096341667267, "eval_reward_total_composite_mean": 0.18016218164792427, "eval_reward_total_composite_std": 0.16037252316108117} {"timestamp_utc": "2026-04-12T21:44:46Z", "mode": "train", "global_step": 1501, "epoch": 0.07899584232408821, "loss": -0.0327, "grad_norm": 1.1844478845596313, "learning_rate": 5.4545454545454545e-06, "num_tokens": 2653108.0, "completions/mean_length": 334.875, "completions/min_length": 39.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 39.66666793823242, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.4636211395263672, "rewards/meter/std": 0.41752588748931885, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.722219705581665, "rewards/lexical_plausibility/std": 0.23276673257350922, "rewards/judge_quality/mean": 0.3125, "rewards/judge_quality/std": 0.3881365656852722, "rewards/repeat_penalty/mean": 0.9706431031227112, "rewards/repeat_penalty/std": 0.06275924295186996, "rewards/repeat_floor/mean": 0.9960339069366455, "rewards/repeat_floor/std": 0.008184741251170635, "rewards/near_duplicate_penalty/mean": 0.9796320796012878, "rewards/near_duplicate_penalty/std": 0.03757540136575699, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9898785352706909, "rewards/distinct_2/std": 0.028627805411815643, "rewards/total_composite/mean": 0.15541711449623108, "rewards/total_composite/std": 0.2921048700809479, "reward": 0.15541711449623108, "reward_std": 0.2921048700809479, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11035260558128357, "sampling/sampling_logp_difference/max": 1.0038478374481201, "sampling/importance_sampling_ratio/min": 0.4140963554382324, "sampling/importance_sampling_ratio/mean": 1.0581837892532349, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.31593991816043854, "clip_ratio/low_mean": 0.00937500037252903, "clip_ratio/low_min": 0.00937500037252903, "clip_ratio/high_mean": 0.02227564202621579, "clip_ratio/high_max": 0.02227564202621579, "clip_ratio/region_mean": 0.03165064239874482, "reward_total_mean": 0.15541711449623108, "reward_meter_mean": 0.4636211395263672, "reward_meter_std": 0.41752588748931885, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.722219705581665, "reward_lexical_plausibility_std": 0.23276673257350922, "reward_repeat_penalty_mean": 0.9706431031227112, "reward_repeat_penalty_std": 0.06275924295186996, "reward_repeat_floor_mean": 0.9960339069366455, "reward_repeat_floor_std": 0.008184741251170635, "reward_near_duplicate_penalty_mean": 0.9796320796012878, "reward_near_duplicate_penalty_std": 0.03757540136575699, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9898785352706909, "reward_distinct_2_std": 0.028627805411815643, "reward_judge_quality_mean": 0.3125, "reward_judge_quality_std": 0.3881365656852722, "reward_total_composite_mean": 0.15541711449623108, "reward_total_composite_std": 0.2921048700809479} {"timestamp_utc": "2026-04-12T21:44:54Z", "mode": "train", "global_step": 1502, "epoch": 0.07904847113309826, "loss": 0.0201, "grad_norm": 19.518024444580078, "learning_rate": 5.451515151515152e-06, "num_tokens": 2654656.0, "completions/mean_length": 22.5, "completions/min_length": 20.0, "completions/max_length": 27.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.5, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 27.0, "rewards/meter/mean": 0.7743388414382935, "rewards/meter/std": 0.3545885384082794, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.706250011920929, "rewards/judge_quality/std": 0.3091896176338196, "rewards/repeat_penalty/mean": 0.7211898565292358, "rewards/repeat_penalty/std": 0.05438433960080147, "rewards/repeat_floor/mean": 0.979237973690033, "rewards/repeat_floor/std": 0.010876880958676338, "rewards/near_duplicate_penalty/mean": 0.9615864753723145, "rewards/near_duplicate_penalty/std": 0.0725124403834343, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4979093074798584, "rewards/total_composite/std": 0.33453577756881714, "reward": 0.4979093074798584, "reward_std": 0.33453577756881714, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13807715475559235, "sampling/sampling_logp_difference/max": 1.2705497741699219, "sampling/importance_sampling_ratio/min": 0.28067725896835327, "sampling/importance_sampling_ratio/mean": 1.0295438766479492, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.3630553856492043, "clip_ratio/low_mean": 0.0863395887427032, "clip_ratio/low_min": 0.0863395887427032, "clip_ratio/high_mean": 0.05358391720801592, "clip_ratio/high_max": 0.05358391720801592, "clip_ratio/region_mean": 0.13992350595071912, "reward_total_mean": 0.4979093074798584, "reward_meter_mean": 0.7743388414382935, "reward_meter_std": 0.3545885384082794, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7211898565292358, "reward_repeat_penalty_std": 0.05438433960080147, "reward_repeat_floor_mean": 0.979237973690033, "reward_repeat_floor_std": 0.010876880958676338, "reward_near_duplicate_penalty_mean": 0.9615864753723145, "reward_near_duplicate_penalty_std": 0.0725124403834343, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.706250011920929, "reward_judge_quality_std": 0.3091896176338196, "reward_total_composite_mean": 0.4979093074798584, "reward_total_composite_std": 0.33453577756881714} {"timestamp_utc": "2026-04-12T21:45:11Z", "mode": "train", "global_step": 1503, "epoch": 0.07910109994210832, "loss": -0.0226, "grad_norm": 5.816728115081787, "learning_rate": 5.448484848484848e-06, "num_tokens": 2656318.0, "completions/mean_length": 105.75, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 47.71428680419922, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 78.0, "rewards/meter/mean": 0.4968388080596924, "rewards/meter/std": 0.4825288653373718, "rewards/count_adherence/mean": 0.8125, "rewards/count_adherence/std": 0.25877460837364197, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9437500238418579, "rewards/count_floor/std": 0.0776323676109314, "rewards/lexical_plausibility/mean": 0.935044527053833, "rewards/lexical_plausibility/std": 0.18372172117233276, "rewards/judge_quality/mean": 0.5175000429153442, "rewards/judge_quality/std": 0.2841905951499939, "rewards/repeat_penalty/mean": 0.8561388254165649, "rewards/repeat_penalty/std": 0.19052931666374207, "rewards/repeat_floor/mean": 0.9834905862808228, "rewards/repeat_floor/std": 0.022917786613106728, "rewards/near_duplicate_penalty/mean": 0.9394563436508179, "rewards/near_duplicate_penalty/std": 0.07918263226747513, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9591346383094788, "rewards/distinct_2/std": 0.08378557860851288, "rewards/total_composite/mean": 0.3224206566810608, "rewards/total_composite/std": 0.37920036911964417, "reward": 0.3224206566810608, "reward_std": 0.37920036911964417, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14845776557922363, "sampling/sampling_logp_difference/max": 3.0565102100372314, "sampling/importance_sampling_ratio/min": 0.04705160856246948, "sampling/importance_sampling_ratio/mean": 1.0048623085021973, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5755541920661926, "clip_ratio/low_mean": 0.039290034445002675, "clip_ratio/low_min": 0.039290034445002675, "clip_ratio/high_mean": 0.04572284361347556, "clip_ratio/high_max": 0.04572284361347556, "clip_ratio/region_mean": 0.08501287805847824, "reward_total_mean": 0.3224206566810608, "reward_meter_mean": 0.4968388080596924, "reward_meter_std": 0.4825288653373718, "reward_count_adherence_mean": 0.8125, "reward_count_adherence_std": 0.25877460837364197, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9437500238418579, "reward_count_floor_std": 0.0776323676109314, "reward_lexical_plausibility_mean": 0.935044527053833, "reward_lexical_plausibility_std": 0.18372172117233276, "reward_repeat_penalty_mean": 0.8561388254165649, "reward_repeat_penalty_std": 0.19052931666374207, "reward_repeat_floor_mean": 0.9834905862808228, "reward_repeat_floor_std": 0.022917786613106728, "reward_near_duplicate_penalty_mean": 0.9394563436508179, "reward_near_duplicate_penalty_std": 0.07918263226747513, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9591346383094788, "reward_distinct_2_std": 0.08378557860851288, "reward_judge_quality_mean": 0.5175000429153442, "reward_judge_quality_std": 0.2841905951499939, "reward_total_composite_mean": 0.3224206566810608, "reward_total_composite_std": 0.37920036911964417} {"timestamp_utc": "2026-04-12T21:45:20Z", "mode": "train", "global_step": 1504, "epoch": 0.07915372875111837, "loss": 0.0467, "grad_norm": 9.911951065063477, "learning_rate": 5.445454545454546e-06, "num_tokens": 2658307.0, "completions/mean_length": 77.625, "completions/min_length": 73.0, "completions/max_length": 84.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 77.625, "completions/min_terminated_length": 73.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.8497236371040344, "rewards/meter/std": 0.20450463891029358, "rewards/count_adherence/mean": 0.7250000238418579, "rewards/count_adherence/std": 0.1035098284482956, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9174999594688416, "rewards/count_floor/std": 0.031052952632308006, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36249998211860657, "rewards/judge_quality/std": 0.09910311549901962, "rewards/repeat_penalty/mean": 0.8421530723571777, "rewards/repeat_penalty/std": 0.1271183043718338, "rewards/repeat_floor/mean": 0.9819009304046631, "rewards/repeat_floor/std": 0.014206822961568832, "rewards/near_duplicate_penalty/mean": 0.9481204748153687, "rewards/near_duplicate_penalty/std": 0.03183474764227867, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8853652477264404, "rewards/distinct_2/std": 0.10835153609514236, "rewards/total_composite/mean": 0.27107545733451843, "rewards/total_composite/std": 0.09206779301166534, "reward": 0.27107545733451843, "reward_std": 0.09206779301166534, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13171453773975372, "sampling/sampling_logp_difference/max": 4.11968994140625, "sampling/importance_sampling_ratio/min": 0.016249552369117737, "sampling/importance_sampling_ratio/mean": 1.0106518268585205, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9071650430560112, "clip_ratio/low_mean": 0.04211115650832653, "clip_ratio/low_min": 0.04211115650832653, "clip_ratio/high_mean": 0.07172557269223034, "clip_ratio/high_max": 0.07172557269223034, "clip_ratio/region_mean": 0.11383672920055687, "reward_total_mean": 0.27107545733451843, "reward_meter_mean": 0.8497236371040344, "reward_meter_std": 0.20450463891029358, "reward_count_adherence_mean": 0.7250000238418579, "reward_count_adherence_std": 0.1035098284482956, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9174999594688416, "reward_count_floor_std": 0.031052952632308006, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8421530723571777, "reward_repeat_penalty_std": 0.1271183043718338, "reward_repeat_floor_mean": 0.9819009304046631, "reward_repeat_floor_std": 0.014206822961568832, "reward_near_duplicate_penalty_mean": 0.9481204748153687, "reward_near_duplicate_penalty_std": 0.03183474764227867, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8853652477264404, "reward_distinct_2_std": 0.10835153609514236, "reward_judge_quality_mean": 0.36249998211860657, "reward_judge_quality_std": 0.09910311549901962, "reward_total_composite_mean": 0.27107545733451843, "reward_total_composite_std": 0.09206779301166534} {"timestamp_utc": "2026-04-12T21:45:29Z", "mode": "train", "global_step": 1505, "epoch": 0.07920635756012842, "loss": -0.0028, "grad_norm": 15.74963092803955, "learning_rate": 5.442424242424243e-06, "num_tokens": 2659760.0, "completions/mean_length": 32.625, "completions/min_length": 26.0, "completions/max_length": 38.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 32.625, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.8095187544822693, "rewards/meter/std": 0.2534782290458679, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.45875000953674316, "rewards/judge_quality/std": 0.192831352353096, "rewards/repeat_penalty/mean": 0.9941810965538025, "rewards/repeat_penalty/std": 0.009612584486603737, "rewards/repeat_floor/mean": 0.9991271495819092, "rewards/repeat_floor/std": 0.0014418804785236716, "rewards/near_duplicate_penalty/mean": 0.9941810965538025, "rewards/near_duplicate_penalty/std": 0.009612584486603737, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.3758554756641388, "rewards/total_composite/std": 0.22956426441669464, "reward": 0.3758554756641388, "reward_std": 0.22956423461437225, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18263065814971924, "sampling/sampling_logp_difference/max": 1.4986176490783691, "sampling/importance_sampling_ratio/min": 0.2234388291835785, "sampling/importance_sampling_ratio/mean": 1.0401262044906616, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.265030175447464, "clip_ratio/low_mean": 0.1291364375501871, "clip_ratio/low_min": 0.1291364375501871, "clip_ratio/high_mean": 0.049573054537177086, "clip_ratio/high_max": 0.049573054537177086, "clip_ratio/region_mean": 0.1787094920873642, "reward_total_mean": 0.3758554756641388, "reward_meter_mean": 0.8095187544822693, "reward_meter_std": 0.2534782290458679, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9941810965538025, "reward_repeat_penalty_std": 0.009612584486603737, "reward_repeat_floor_mean": 0.9991271495819092, "reward_repeat_floor_std": 0.0014418804785236716, "reward_near_duplicate_penalty_mean": 0.9941810965538025, "reward_near_duplicate_penalty_std": 0.009612584486603737, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.45875000953674316, "reward_judge_quality_std": 0.192831352353096, "reward_total_composite_mean": 0.3758554756641388, "reward_total_composite_std": 0.22956426441669464} {"timestamp_utc": "2026-04-12T21:45:38Z", "mode": "train", "global_step": 1506, "epoch": 0.07925898636913847, "loss": 0.0277, "grad_norm": 13.640207290649414, "learning_rate": 5.43939393939394e-06, "num_tokens": 2661249.0, "completions/mean_length": 44.125, "completions/min_length": 33.0, "completions/max_length": 54.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.125, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 54.0, "rewards/meter/mean": 0.7546921968460083, "rewards/meter/std": 0.30970534682273865, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.36250001192092896, "rewards/judge_quality/std": 0.13562026619911194, "rewards/repeat_penalty/mean": 0.8982670307159424, "rewards/repeat_penalty/std": 0.09006664901971817, "rewards/repeat_floor/mean": 0.987313985824585, "rewards/repeat_floor/std": 0.011077425442636013, "rewards/near_duplicate_penalty/mean": 0.9483059644699097, "rewards/near_duplicate_penalty/std": 0.04114063084125519, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9452006220817566, "rewards/distinct_2/std": 0.05571816489100456, "rewards/total_composite/mean": 0.24329471588134766, "rewards/total_composite/std": 0.12118619680404663, "reward": 0.24329471588134766, "reward_std": 0.12118618935346603, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12625190615653992, "sampling/sampling_logp_difference/max": 2.643170118331909, "sampling/importance_sampling_ratio/min": 0.07113540917634964, "sampling/importance_sampling_ratio/mean": 0.9974692463874817, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6669752933084965, "clip_ratio/low_mean": 0.052506458945572376, "clip_ratio/low_min": 0.052506458945572376, "clip_ratio/high_mean": 0.05770864710211754, "clip_ratio/high_max": 0.05770864710211754, "clip_ratio/region_mean": 0.11021510604768991, "reward_total_mean": 0.24329471588134766, "reward_meter_mean": 0.7546921968460083, "reward_meter_std": 0.30970534682273865, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8982670307159424, "reward_repeat_penalty_std": 0.09006664901971817, "reward_repeat_floor_mean": 0.987313985824585, "reward_repeat_floor_std": 0.011077425442636013, "reward_near_duplicate_penalty_mean": 0.9483059644699097, "reward_near_duplicate_penalty_std": 0.04114063084125519, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9452006220817566, "reward_distinct_2_std": 0.05571816489100456, "reward_judge_quality_mean": 0.36250001192092896, "reward_judge_quality_std": 0.13562026619911194, "reward_total_composite_mean": 0.24329471588134766, "reward_total_composite_std": 0.12118619680404663} {"timestamp_utc": "2026-04-12T21:45:46Z", "mode": "train", "global_step": 1507, "epoch": 0.07931161517814851, "loss": -0.0711, "grad_norm": 15.191036224365234, "learning_rate": 5.436363636363636e-06, "num_tokens": 2662557.0, "completions/mean_length": 19.5, "completions/min_length": 17.0, "completions/max_length": 23.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.5, "completions/min_terminated_length": 17.0, "completions/max_terminated_length": 23.0, "rewards/meter/mean": 0.9796422719955444, "rewards/meter/std": 0.020406179130077362, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.21250000596046448, "rewards/judge_quality/std": 0.11877349019050598, "rewards/repeat_penalty/mean": 0.75, "rewards/repeat_penalty/std": 0.0, "rewards/repeat_floor/mean": 0.9850000143051147, "rewards/repeat_floor/std": 0.0, "rewards/near_duplicate_penalty/mean": 1.0, "rewards/near_duplicate_penalty/std": 0.0, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.20541267096996307, "rewards/total_composite/std": 0.11572809517383575, "reward": 0.20541267096996307, "reward_std": 0.11572809517383575, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.047722648829221725, "sampling/sampling_logp_difference/max": 0.8962516784667969, "sampling/importance_sampling_ratio/min": 0.40809646248817444, "sampling/importance_sampling_ratio/mean": 1.0133461952209473, "sampling/importance_sampling_ratio/max": 1.3490544557571411, "entropy": 0.39085325971245766, "clip_ratio/low_mean": 0.03484477149322629, "clip_ratio/low_min": 0.03484477149322629, "clip_ratio/high_mean": 0.02766798436641693, "clip_ratio/high_max": 0.02766798436641693, "clip_ratio/region_mean": 0.06251275585964322, "reward_total_mean": 0.20541267096996307, "reward_meter_mean": 0.9796422719955444, "reward_meter_std": 0.020406179130077362, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.75, "reward_repeat_penalty_std": 0.0, "reward_repeat_floor_mean": 0.9850000143051147, "reward_repeat_floor_std": 0.0, "reward_near_duplicate_penalty_mean": 1.0, "reward_near_duplicate_penalty_std": 0.0, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.21250000596046448, "reward_judge_quality_std": 0.11877349019050598, "reward_total_composite_mean": 0.20541267096996307, "reward_total_composite_std": 0.11572809517383575} {"timestamp_utc": "2026-04-12T21:46:01Z", "mode": "train", "global_step": 1508, "epoch": 0.07936424398715856, "loss": -0.1422, "grad_norm": 3.514066457748413, "learning_rate": 5.4333333333333335e-06, "num_tokens": 2664914.0, "completions/mean_length": 209.625, "completions/min_length": 101.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 108.83333587646484, "completions/min_terminated_length": 101.0, "completions/max_terminated_length": 120.0, "rewards/meter/mean": 0.4659782648086548, "rewards/meter/std": 0.30951109528541565, "rewards/count_adherence/mean": 0.4861111342906952, "rewards/count_adherence/std": 0.20520134270191193, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.8458333611488342, "rewards/count_floor/std": 0.06156039610505104, "rewards/lexical_plausibility/mean": 0.8928514719009399, "rewards/lexical_plausibility/std": 0.19861266016960144, "rewards/judge_quality/mean": 0.24374999105930328, "rewards/judge_quality/std": 0.17816023528575897, "rewards/repeat_penalty/mean": 0.8520583510398865, "rewards/repeat_penalty/std": 0.12227675318717957, "rewards/repeat_floor/mean": 0.983232319355011, "rewards/repeat_floor/std": 0.013877196237444878, "rewards/near_duplicate_penalty/mean": 0.9538599252700806, "rewards/near_duplicate_penalty/std": 0.033677831292152405, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8905925154685974, "rewards/distinct_2/std": 0.10430935770273209, "rewards/total_composite/mean": 0.11469920724630356, "rewards/total_composite/std": 0.1024836003780365, "reward": 0.11469920724630356, "reward_std": 0.1024836003780365, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13628514111042023, "sampling/sampling_logp_difference/max": 1.3663530349731445, "sampling/importance_sampling_ratio/min": 0.2550353705883026, "sampling/importance_sampling_ratio/mean": 1.014146327972412, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.697959378361702, "clip_ratio/low_mean": 0.029232016764581203, "clip_ratio/low_min": 0.029232016764581203, "clip_ratio/high_mean": 0.06191588006913662, "clip_ratio/high_max": 0.06191588006913662, "clip_ratio/region_mean": 0.09114789683371782, "reward_total_mean": 0.11469920724630356, "reward_meter_mean": 0.4659782648086548, "reward_meter_std": 0.30951109528541565, "reward_count_adherence_mean": 0.4861111342906952, "reward_count_adherence_std": 0.20520134270191193, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.8458333611488342, "reward_count_floor_std": 0.06156039610505104, "reward_lexical_plausibility_mean": 0.8928514719009399, "reward_lexical_plausibility_std": 0.19861266016960144, "reward_repeat_penalty_mean": 0.8520583510398865, "reward_repeat_penalty_std": 0.12227675318717957, "reward_repeat_floor_mean": 0.983232319355011, "reward_repeat_floor_std": 0.013877196237444878, "reward_near_duplicate_penalty_mean": 0.9538599252700806, "reward_near_duplicate_penalty_std": 0.033677831292152405, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8905925154685974, "reward_distinct_2_std": 0.10430935770273209, "reward_judge_quality_mean": 0.24374999105930328, "reward_judge_quality_std": 0.17816023528575897, "reward_total_composite_mean": 0.11469920724630356, "reward_total_composite_std": 0.1024836003780365} {"timestamp_utc": "2026-04-12T21:46:10Z", "mode": "train", "global_step": 1509, "epoch": 0.07941687279616862, "loss": 0.0063, "grad_norm": 13.724625587463379, "learning_rate": 5.430303030303032e-06, "num_tokens": 2666489.0, "completions/mean_length": 35.875, "completions/min_length": 33.0, "completions/max_length": 39.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 35.875, "completions/min_terminated_length": 33.0, "completions/max_terminated_length": 39.0, "rewards/meter/mean": 0.8653483390808105, "rewards/meter/std": 0.24270948767662048, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.47499996423721313, "rewards/judge_quality/std": 0.1164964810013771, "rewards/repeat_penalty/mean": 0.9800074696540833, "rewards/repeat_penalty/std": 0.032433781772851944, "rewards/repeat_floor/mean": 0.9970011115074158, "rewards/repeat_floor/std": 0.0048650591634213924, "rewards/near_duplicate_penalty/mean": 0.9800074696540833, "rewards/near_duplicate_penalty/std": 0.032433781772851944, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.4095819890499115, "rewards/total_composite/std": 0.15033851563930511, "reward": 0.4095819890499115, "reward_std": 0.15033851563930511, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16545505821704865, "sampling/sampling_logp_difference/max": 1.5893678665161133, "sampling/importance_sampling_ratio/min": 0.2040545642375946, "sampling/importance_sampling_ratio/mean": 1.0241625308990479, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9418702125549316, "clip_ratio/low_mean": 0.042293233796954155, "clip_ratio/low_min": 0.042293233796954155, "clip_ratio/high_mean": 0.07090657064691186, "clip_ratio/high_max": 0.07090657064691186, "clip_ratio/region_mean": 0.11319980444386601, "reward_total_mean": 0.4095819890499115, "reward_meter_mean": 0.8653483390808105, "reward_meter_std": 0.24270948767662048, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9800074696540833, "reward_repeat_penalty_std": 0.032433781772851944, "reward_repeat_floor_mean": 0.9970011115074158, "reward_repeat_floor_std": 0.0048650591634213924, "reward_near_duplicate_penalty_mean": 0.9800074696540833, "reward_near_duplicate_penalty_std": 0.032433781772851944, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.47499996423721313, "reward_judge_quality_std": 0.1164964810013771, "reward_total_composite_mean": 0.4095819890499115, "reward_total_composite_std": 0.15033851563930511} {"timestamp_utc": "2026-04-12T21:46:23Z", "mode": "train", "global_step": 1510, "epoch": 0.07946950160517867, "loss": -0.0542, "grad_norm": 3.9751882553100586, "learning_rate": 5.427272727272728e-06, "num_tokens": 2668030.0, "completions/mean_length": 97.625, "completions/min_length": 35.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 38.42857360839844, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.533435046672821, "rewards/meter/std": 0.4034217596054077, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9351696372032166, "rewards/lexical_plausibility/std": 0.18336790800094604, "rewards/judge_quality/mean": 0.4612500071525574, "rewards/judge_quality/std": 0.20469054579734802, "rewards/repeat_penalty/mean": 0.8853815793991089, "rewards/repeat_penalty/std": 0.07688191533088684, "rewards/repeat_floor/mean": 0.9850950241088867, "rewards/repeat_floor/std": 0.010502473451197147, "rewards/near_duplicate_penalty/mean": 0.9283722639083862, "rewards/near_duplicate_penalty/std": 0.06372316926717758, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.953769326210022, "rewards/distinct_2/std": 0.05108838528394699, "rewards/total_composite/mean": 0.21596336364746094, "rewards/total_composite/std": 0.18015703558921814, "reward": 0.21596336364746094, "reward_std": 0.18015703558921814, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11728202551603317, "sampling/sampling_logp_difference/max": 0.9407529830932617, "sampling/importance_sampling_ratio/min": 0.39033380150794983, "sampling/importance_sampling_ratio/mean": 1.0317085981369019, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7383372858166695, "clip_ratio/low_mean": 0.05126689188182354, "clip_ratio/low_min": 0.05126689188182354, "clip_ratio/high_mean": 0.044203305849805474, "clip_ratio/high_max": 0.044203305849805474, "clip_ratio/region_mean": 0.09547019773162901, "reward_total_mean": 0.21596336364746094, "reward_meter_mean": 0.533435046672821, "reward_meter_std": 0.4034217596054077, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9351696372032166, "reward_lexical_plausibility_std": 0.18336790800094604, "reward_repeat_penalty_mean": 0.8853815793991089, "reward_repeat_penalty_std": 0.07688191533088684, "reward_repeat_floor_mean": 0.9850950241088867, "reward_repeat_floor_std": 0.010502473451197147, "reward_near_duplicate_penalty_mean": 0.9283722639083862, "reward_near_duplicate_penalty_std": 0.06372316926717758, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.953769326210022, "reward_distinct_2_std": 0.05108838528394699, "reward_judge_quality_mean": 0.4612500071525574, "reward_judge_quality_std": 0.20469054579734802, "reward_total_composite_mean": 0.21596336364746094, "reward_total_composite_std": 0.18015703558921814} {"timestamp_utc": "2026-04-12T21:46:35Z", "mode": "train", "global_step": 1511, "epoch": 0.07952213041418872, "loss": -0.1036, "grad_norm": 6.0721116065979, "learning_rate": 5.424242424242425e-06, "num_tokens": 2670306.0, "completions/mean_length": 156.5, "completions/min_length": 95.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 105.71428680419922, "completions/min_terminated_length": 95.0, "completions/max_terminated_length": 114.0, "rewards/meter/mean": 0.5891748666763306, "rewards/meter/std": 0.3977961540222168, "rewards/count_adherence/mean": 0.6875, "rewards/count_adherence/std": 0.2878147065639496, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.90625, "rewards/count_floor/std": 0.086344413459301, "rewards/lexical_plausibility/mean": 0.9368640780448914, "rewards/lexical_plausibility/std": 0.17857539653778076, "rewards/judge_quality/mean": 0.4112499952316284, "rewards/judge_quality/std": 0.1797965168952942, "rewards/repeat_penalty/mean": 0.9631444215774536, "rewards/repeat_penalty/std": 0.034029312431812286, "rewards/repeat_floor/mean": 0.9954419136047363, "rewards/repeat_floor/std": 0.004139741417020559, "rewards/near_duplicate_penalty/mean": 0.9800870418548584, "rewards/near_duplicate_penalty/std": 0.019236844033002853, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9825426340103149, "rewards/distinct_2/std": 0.021234121173620224, "rewards/total_composite/mean": 0.2614912986755371, "rewards/total_composite/std": 0.20411521196365356, "reward": 0.2614912986755371, "reward_std": 0.20411522686481476, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12111324071884155, "sampling/sampling_logp_difference/max": 2.742553949356079, "sampling/importance_sampling_ratio/min": 0.0644056424498558, "sampling/importance_sampling_ratio/mean": 1.0143250226974487, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.752310611307621, "clip_ratio/low_mean": 0.03820488788187504, "clip_ratio/low_min": 0.03820488788187504, "clip_ratio/high_mean": 0.05722587741911411, "clip_ratio/high_max": 0.05722587741911411, "clip_ratio/region_mean": 0.09543076530098915, "reward_total_mean": 0.2614912986755371, "reward_meter_mean": 0.5891748666763306, "reward_meter_std": 0.3977961540222168, "reward_count_adherence_mean": 0.6875, "reward_count_adherence_std": 0.2878147065639496, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.90625, "reward_count_floor_std": 0.086344413459301, "reward_lexical_plausibility_mean": 0.9368640780448914, "reward_lexical_plausibility_std": 0.17857539653778076, "reward_repeat_penalty_mean": 0.9631444215774536, "reward_repeat_penalty_std": 0.034029312431812286, "reward_repeat_floor_mean": 0.9954419136047363, "reward_repeat_floor_std": 0.004139741417020559, "reward_near_duplicate_penalty_mean": 0.9800870418548584, "reward_near_duplicate_penalty_std": 0.019236844033002853, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9825426340103149, "reward_distinct_2_std": 0.021234121173620224, "reward_judge_quality_mean": 0.4112499952316284, "reward_judge_quality_std": 0.1797965168952942, "reward_total_composite_mean": 0.2614912986755371, "reward_total_composite_std": 0.20411521196365356} {"timestamp_utc": "2026-04-12T21:46:46Z", "mode": "train", "global_step": 1512, "epoch": 0.07957475922319877, "loss": -0.0397, "grad_norm": 5.631893634796143, "learning_rate": 5.421212121212122e-06, "num_tokens": 2671739.0, "completions/mean_length": 91.125, "completions/min_length": 26.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 31.000001907348633, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 38.0, "rewards/meter/mean": 0.2916238307952881, "rewards/meter/std": 0.23950965702533722, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.950294554233551, "rewards/lexical_plausibility/std": 0.1405882090330124, "rewards/judge_quality/mean": 0.4987500011920929, "rewards/judge_quality/std": 0.28965190052986145, "rewards/repeat_penalty/mean": 0.9739413261413574, "rewards/repeat_penalty/std": 0.025588728487491608, "rewards/repeat_floor/mean": 0.9961215257644653, "rewards/repeat_floor/std": 0.003854460082948208, "rewards/near_duplicate_penalty/mean": 0.9744541645050049, "rewards/near_duplicate_penalty/std": 0.025886302813887596, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9994816780090332, "rewards/distinct_2/std": 0.0014661203604191542, "rewards/total_composite/mean": 0.13043023645877838, "rewards/total_composite/std": 0.10295972228050232, "reward": 0.13043023645877838, "reward_std": 0.10295972228050232, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.16739794611930847, "sampling/sampling_logp_difference/max": 2.154484748840332, "sampling/importance_sampling_ratio/min": 0.1159629225730896, "sampling/importance_sampling_ratio/mean": 0.9954019784927368, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7971791326999664, "clip_ratio/low_mean": 0.02935222629457712, "clip_ratio/low_min": 0.02935222629457712, "clip_ratio/high_mean": 0.08494540583342314, "clip_ratio/high_max": 0.08494540583342314, "clip_ratio/region_mean": 0.11429763212800026, "reward_total_mean": 0.13043023645877838, "reward_meter_mean": 0.2916238307952881, "reward_meter_std": 0.23950965702533722, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.950294554233551, "reward_lexical_plausibility_std": 0.1405882090330124, "reward_repeat_penalty_mean": 0.9739413261413574, "reward_repeat_penalty_std": 0.025588728487491608, "reward_repeat_floor_mean": 0.9961215257644653, "reward_repeat_floor_std": 0.003854460082948208, "reward_near_duplicate_penalty_mean": 0.9744541645050049, "reward_near_duplicate_penalty_std": 0.025886302813887596, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9994816780090332, "reward_distinct_2_std": 0.0014661203604191542, "reward_judge_quality_mean": 0.4987500011920929, "reward_judge_quality_std": 0.28965190052986145, "reward_total_composite_mean": 0.13043023645877838, "reward_total_composite_std": 0.10295972228050232} {"timestamp_utc": "2026-04-12T21:46:54Z", "mode": "train", "global_step": 1513, "epoch": 0.07962738803220883, "loss": 0.0059, "grad_norm": 11.002195358276367, "learning_rate": 5.418181818181819e-06, "num_tokens": 2673848.0, "completions/mean_length": 94.625, "completions/min_length": 86.0, "completions/max_length": 111.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 94.625, "completions/min_terminated_length": 86.0, "completions/max_terminated_length": 111.0, "rewards/meter/mean": 0.822895884513855, "rewards/meter/std": 0.21343597769737244, "rewards/count_adherence/mean": 0.7708333134651184, "rewards/count_adherence/std": 0.0862581729888916, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9312499761581421, "rewards/count_floor/std": 0.025877464562654495, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6074999570846558, "rewards/judge_quality/std": 0.15526477992534637, "rewards/repeat_penalty/mean": 0.8126115202903748, "rewards/repeat_penalty/std": 0.13901011645793915, "rewards/repeat_floor/mean": 0.9795634746551514, "rewards/repeat_floor/std": 0.01371503435075283, "rewards/near_duplicate_penalty/mean": 0.9438788294792175, "rewards/near_duplicate_penalty/std": 0.030512496829032898, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.866461992263794, "rewards/distinct_2/std": 0.1032836064696312, "rewards/total_composite/mean": 0.4423291087150574, "rewards/total_composite/std": 0.1346423327922821, "reward": 0.4423291087150574, "reward_std": 0.1346423327922821, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13650833070278168, "sampling/sampling_logp_difference/max": 2.0763885974884033, "sampling/importance_sampling_ratio/min": 0.125382199883461, "sampling/importance_sampling_ratio/mean": 1.0190232992172241, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7314606606960297, "clip_ratio/low_mean": 0.07198336906731129, "clip_ratio/low_min": 0.07198336906731129, "clip_ratio/high_mean": 0.048810635693371296, "clip_ratio/high_max": 0.048810635693371296, "clip_ratio/region_mean": 0.12079400476068258, "reward_total_mean": 0.4423291087150574, "reward_meter_mean": 0.822895884513855, "reward_meter_std": 0.21343597769737244, "reward_count_adherence_mean": 0.7708333134651184, "reward_count_adherence_std": 0.0862581729888916, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9312499761581421, "reward_count_floor_std": 0.025877464562654495, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8126115202903748, "reward_repeat_penalty_std": 0.13901011645793915, "reward_repeat_floor_mean": 0.9795634746551514, "reward_repeat_floor_std": 0.01371503435075283, "reward_near_duplicate_penalty_mean": 0.9438788294792175, "reward_near_duplicate_penalty_std": 0.030512496829032898, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.866461992263794, "reward_distinct_2_std": 0.1032836064696312, "reward_judge_quality_mean": 0.6074999570846558, "reward_judge_quality_std": 0.15526477992534637, "reward_total_composite_mean": 0.4423291087150574, "reward_total_composite_std": 0.1346423327922821} {"timestamp_utc": "2026-04-12T21:47:06Z", "mode": "train", "global_step": 1514, "epoch": 0.07968001684121888, "loss": -0.0423, "grad_norm": 4.147073745727539, "learning_rate": 5.415151515151515e-06, "num_tokens": 2675335.0, "completions/mean_length": 93.875, "completions/min_length": 31.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 34.142860412597656, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 41.0, "rewards/meter/mean": 0.47963839769363403, "rewards/meter/std": 0.36328837275505066, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9479241967201233, "rewards/lexical_plausibility/std": 0.1472925841808319, "rewards/judge_quality/mean": 0.3100000023841858, "rewards/judge_quality/std": 0.1345893144607544, "rewards/repeat_penalty/mean": 0.7378515005111694, "rewards/repeat_penalty/std": 0.2528228461742401, "rewards/repeat_floor/mean": 0.9738674163818359, "rewards/repeat_floor/std": 0.023671019822359085, "rewards/near_duplicate_penalty/mean": 0.9177777767181396, "rewards/near_duplicate_penalty/std": 0.06464187055826187, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.9300079345703125, "rewards/distinct_2/std": 0.09348642826080322, "rewards/total_composite/mean": 0.15357424318790436, "rewards/total_composite/std": 0.1161903589963913, "reward": 0.15357424318790436, "reward_std": 0.1161903589963913, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15072131156921387, "sampling/sampling_logp_difference/max": 1.581021785736084, "sampling/importance_sampling_ratio/min": 0.2057647407054901, "sampling/importance_sampling_ratio/mean": 1.0171388387680054, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8746337741613388, "clip_ratio/low_mean": 0.036672474816441536, "clip_ratio/low_min": 0.036672474816441536, "clip_ratio/high_mean": 0.0700973947532475, "clip_ratio/high_max": 0.0700973947532475, "clip_ratio/region_mean": 0.10676986956968904, "reward_total_mean": 0.15357424318790436, "reward_meter_mean": 0.47963839769363403, "reward_meter_std": 0.36328837275505066, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9479241967201233, "reward_lexical_plausibility_std": 0.1472925841808319, "reward_repeat_penalty_mean": 0.7378515005111694, "reward_repeat_penalty_std": 0.2528228461742401, "reward_repeat_floor_mean": 0.9738674163818359, "reward_repeat_floor_std": 0.023671019822359085, "reward_near_duplicate_penalty_mean": 0.9177777767181396, "reward_near_duplicate_penalty_std": 0.06464187055826187, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.9300079345703125, "reward_distinct_2_std": 0.09348642826080322, "reward_judge_quality_mean": 0.3100000023841858, "reward_judge_quality_std": 0.1345893144607544, "reward_total_composite_mean": 0.15357424318790436, "reward_total_composite_std": 0.1161903589963913} {"timestamp_utc": "2026-04-12T21:47:12Z", "mode": "train", "global_step": 1515, "epoch": 0.07973264565022893, "loss": -0.0147, "grad_norm": 18.05291175842285, "learning_rate": 5.412121212121213e-06, "num_tokens": 2676658.0, "completions/mean_length": 16.375, "completions/min_length": 15.0, "completions/max_length": 17.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 16.375, "completions/min_terminated_length": 15.0, "completions/max_terminated_length": 17.0, "rewards/meter/mean": 0.6703294515609741, "rewards/meter/std": 0.4293660819530487, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4312500059604645, "rewards/judge_quality/std": 0.015526476316154003, "rewards/repeat_penalty/mean": 0.7236356735229492, "rewards/repeat_penalty/std": 0.04696202650666237, "rewards/repeat_floor/mean": 0.9797271490097046, "rewards/repeat_floor/std": 0.009392405860126019, "rewards/near_duplicate_penalty/mean": 0.9648475646972656, "rewards/near_duplicate_penalty/std": 0.06261603534221649, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.28660327196121216, "rewards/total_composite/std": 0.186248779296875, "reward": 0.28660327196121216, "reward_std": 0.1862487643957138, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1236686110496521, "sampling/sampling_logp_difference/max": 1.156153678894043, "sampling/importance_sampling_ratio/min": 0.31469428539276123, "sampling/importance_sampling_ratio/mean": 1.0033175945281982, "sampling/importance_sampling_ratio/max": 1.6952159404754639, "entropy": 0.7346522063016891, "clip_ratio/low_mean": 0.0474571087397635, "clip_ratio/low_min": 0.0474571087397635, "clip_ratio/high_mean": 0.060661765281111, "clip_ratio/high_max": 0.060661765281111, "clip_ratio/region_mean": 0.1081188740208745, "reward_total_mean": 0.28660327196121216, "reward_meter_mean": 0.6703294515609741, "reward_meter_std": 0.4293660819530487, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7236356735229492, "reward_repeat_penalty_std": 0.04696202650666237, "reward_repeat_floor_mean": 0.9797271490097046, "reward_repeat_floor_std": 0.009392405860126019, "reward_near_duplicate_penalty_mean": 0.9648475646972656, "reward_near_duplicate_penalty_std": 0.06261603534221649, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.4312500059604645, "reward_judge_quality_std": 0.015526476316154003, "reward_total_composite_mean": 0.28660327196121216, "reward_total_composite_std": 0.186248779296875} {"timestamp_utc": "2026-04-12T21:47:20Z", "mode": "train", "global_step": 1516, "epoch": 0.07978527445923898, "loss": -0.0229, "grad_norm": 15.29035758972168, "learning_rate": 5.409090909090909e-06, "num_tokens": 2678562.0, "completions/mean_length": 62.0, "completions/min_length": 50.0, "completions/max_length": 72.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 62.0, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 72.0, "rewards/meter/mean": 0.9803504347801208, "rewards/meter/std": 0.00986937154084444, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5575000047683716, "rewards/judge_quality/std": 0.19955310225486755, "rewards/repeat_penalty/mean": 0.7859803438186646, "rewards/repeat_penalty/std": 0.11170168220996857, "rewards/repeat_floor/mean": 0.9761965274810791, "rewards/repeat_floor/std": 0.012812917120754719, "rewards/near_duplicate_penalty/mean": 0.938115119934082, "rewards/near_duplicate_penalty/std": 0.03744295984506607, "rewards/opening_diversity/mean": 0.9750000238418579, "rewards/opening_diversity/std": 0.04629101976752281, "rewards/distinct_2/mean": 0.8553248643875122, "rewards/distinct_2/std": 0.0700458213686943, "rewards/total_composite/mean": 0.5239804983139038, "rewards/total_composite/std": 0.20022590458393097, "reward": 0.5239804983139038, "reward_std": 0.20022590458393097, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1125568151473999, "sampling/sampling_logp_difference/max": 1.176687240600586, "sampling/importance_sampling_ratio/min": 0.30829837918281555, "sampling/importance_sampling_ratio/mean": 1.0040172338485718, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8430889993906021, "clip_ratio/low_mean": 0.06538659706711769, "clip_ratio/low_min": 0.06538659706711769, "clip_ratio/high_mean": 0.0486111119389534, "clip_ratio/high_max": 0.0486111119389534, "clip_ratio/region_mean": 0.11399770900607109, "reward_total_mean": 0.5239804983139038, "reward_meter_mean": 0.9803504347801208, "reward_meter_std": 0.00986937154084444, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7859803438186646, "reward_repeat_penalty_std": 0.11170168220996857, "reward_repeat_floor_mean": 0.9761965274810791, "reward_repeat_floor_std": 0.012812917120754719, "reward_near_duplicate_penalty_mean": 0.938115119934082, "reward_near_duplicate_penalty_std": 0.03744295984506607, "reward_opening_diversity_mean": 0.9750000238418579, "reward_opening_diversity_std": 0.04629101976752281, "reward_distinct_2_mean": 0.8553248643875122, "reward_distinct_2_std": 0.0700458213686943, "reward_judge_quality_mean": 0.5575000047683716, "reward_judge_quality_std": 0.19955310225486755, "reward_total_composite_mean": 0.5239804983139038, "reward_total_composite_std": 0.20022590458393097} {"timestamp_utc": "2026-04-12T21:47:33Z", "mode": "train", "global_step": 1517, "epoch": 0.07983790326824904, "loss": -0.0504, "grad_norm": 4.940978050231934, "learning_rate": 5.406060606060607e-06, "num_tokens": 2679924.0, "completions/mean_length": 91.25, "completions/min_length": 27.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 31.142858505249023, "completions/min_terminated_length": 27.0, "completions/max_terminated_length": 37.0, "rewards/meter/mean": 0.7435610294342041, "rewards/meter/std": 0.3742123246192932, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9426130056381226, "rewards/lexical_plausibility/std": 0.16231493651866913, "rewards/judge_quality/mean": 0.3812500238418579, "rewards/judge_quality/std": 0.13452960550785065, "rewards/repeat_penalty/mean": 0.8528552651405334, "rewards/repeat_penalty/std": 0.1847434788942337, "rewards/repeat_floor/mean": 0.9854755401611328, "rewards/repeat_floor/std": 0.018479827791452408, "rewards/near_duplicate_penalty/mean": 0.9577878713607788, "rewards/near_duplicate_penalty/std": 0.05102771893143654, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.971470832824707, "rewards/distinct_2/std": 0.05287402868270874, "rewards/total_composite/mean": 0.30584797263145447, "rewards/total_composite/std": 0.1784461885690689, "reward": 0.30584797263145447, "reward_std": 0.1784461885690689, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12514343857765198, "sampling/sampling_logp_difference/max": 1.3416500091552734, "sampling/importance_sampling_ratio/min": 0.2614139914512634, "sampling/importance_sampling_ratio/mean": 1.0078914165496826, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5223672538995743, "clip_ratio/low_mean": 0.014285714365541935, "clip_ratio/low_min": 0.014285714365541935, "clip_ratio/high_mean": 0.09308868274092674, "clip_ratio/high_max": 0.09308868274092674, "clip_ratio/region_mean": 0.10737439710646868, "reward_total_mean": 0.30584797263145447, "reward_meter_mean": 0.7435610294342041, "reward_meter_std": 0.3742123246192932, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9426130056381226, "reward_lexical_plausibility_std": 0.16231493651866913, "reward_repeat_penalty_mean": 0.8528552651405334, "reward_repeat_penalty_std": 0.1847434788942337, "reward_repeat_floor_mean": 0.9854755401611328, "reward_repeat_floor_std": 0.018479827791452408, "reward_near_duplicate_penalty_mean": 0.9577878713607788, "reward_near_duplicate_penalty_std": 0.05102771893143654, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.971470832824707, "reward_distinct_2_std": 0.05287402868270874, "reward_judge_quality_mean": 0.3812500238418579, "reward_judge_quality_std": 0.13452960550785065, "reward_total_composite_mean": 0.30584797263145447, "reward_total_composite_std": 0.1784461885690689} {"timestamp_utc": "2026-04-12T21:47:45Z", "mode": "train", "global_step": 1518, "epoch": 0.07989053207725909, "loss": -0.0533, "grad_norm": 3.6835150718688965, "learning_rate": 5.4030303030303036e-06, "num_tokens": 2681565.0, "completions/mean_length": 164.125, "completions/min_length": 41.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 48.16666793823242, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 57.0, "rewards/meter/mean": 0.30135756731033325, "rewards/meter/std": 0.32846879959106445, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.8866062760353088, "rewards/lexical_plausibility/std": 0.21001556515693665, "rewards/judge_quality/mean": 0.5, "rewards/judge_quality/std": 0.33445051312446594, "rewards/repeat_penalty/mean": 0.9626946449279785, "rewards/repeat_penalty/std": 0.037383463233709335, "rewards/repeat_floor/mean": 0.9948590397834778, "rewards/repeat_floor/std": 0.0048016090877354145, "rewards/near_duplicate_penalty/mean": 0.9707438349723816, "rewards/near_duplicate_penalty/std": 0.027035821229219437, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9916387796401978, "rewards/distinct_2/std": 0.0236490610986948, "rewards/total_composite/mean": 0.20959311723709106, "rewards/total_composite/std": 0.2918854057788849, "reward": 0.20959311723709106, "reward_std": 0.2918853759765625, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13603657484054565, "sampling/sampling_logp_difference/max": 1.2135319709777832, "sampling/importance_sampling_ratio/min": 0.29714590311050415, "sampling/importance_sampling_ratio/mean": 1.031583309173584, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7734980285167694, "clip_ratio/low_mean": 0.04430373292416334, "clip_ratio/low_min": 0.04430373292416334, "clip_ratio/high_mean": 0.0339311808347702, "clip_ratio/high_max": 0.0339311808347702, "clip_ratio/region_mean": 0.07823491375893354, "reward_total_mean": 0.20959311723709106, "reward_meter_mean": 0.30135756731033325, "reward_meter_std": 0.32846879959106445, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.8866062760353088, "reward_lexical_plausibility_std": 0.21001556515693665, "reward_repeat_penalty_mean": 0.9626946449279785, "reward_repeat_penalty_std": 0.037383463233709335, "reward_repeat_floor_mean": 0.9948590397834778, "reward_repeat_floor_std": 0.0048016090877354145, "reward_near_duplicate_penalty_mean": 0.9707438349723816, "reward_near_duplicate_penalty_std": 0.027035821229219437, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9916387796401978, "reward_distinct_2_std": 0.0236490610986948, "reward_judge_quality_mean": 0.5, "reward_judge_quality_std": 0.33445051312446594, "reward_total_composite_mean": 0.20959311723709106, "reward_total_composite_std": 0.2918854057788849} {"timestamp_utc": "2026-04-12T21:47:56Z", "mode": "train", "global_step": 1519, "epoch": 0.07994316088626914, "loss": -0.0457, "grad_norm": 4.085677146911621, "learning_rate": 5.400000000000001e-06, "num_tokens": 2683274.0, "completions/mean_length": 103.625, "completions/min_length": 40.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 45.28571701049805, "completions/min_terminated_length": 40.0, "completions/max_terminated_length": 58.0, "rewards/meter/mean": 0.7756665945053101, "rewards/meter/std": 0.3952201008796692, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9567331075668335, "rewards/lexical_plausibility/std": 0.12237721681594849, "rewards/judge_quality/mean": 0.38999998569488525, "rewards/judge_quality/std": 0.18845234811306, "rewards/repeat_penalty/mean": 0.9726606607437134, "rewards/repeat_penalty/std": 0.05877441540360451, "rewards/repeat_floor/mean": 0.9966561794281006, "rewards/repeat_floor/std": 0.006725291721522808, "rewards/near_duplicate_penalty/mean": 0.9865835905075073, "rewards/near_duplicate_penalty/std": 0.021426426246762276, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.3402079939842224, "rewards/total_composite/std": 0.21770277619361877, "reward": 0.3402079939842224, "reward_std": 0.21770276129245758, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15535330772399902, "sampling/sampling_logp_difference/max": 1.7656736373901367, "sampling/importance_sampling_ratio/min": 0.17107151448726654, "sampling/importance_sampling_ratio/mean": 0.9973017573356628, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9880257174372673, "clip_ratio/low_mean": 0.028384079225361347, "clip_ratio/low_min": 0.028384079225361347, "clip_ratio/high_mean": 0.12003011628985405, "clip_ratio/high_max": 0.12003011628985405, "clip_ratio/region_mean": 0.1484141955152154, "reward_total_mean": 0.3402079939842224, "reward_meter_mean": 0.7756665945053101, "reward_meter_std": 0.3952201008796692, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9567331075668335, "reward_lexical_plausibility_std": 0.12237721681594849, "reward_repeat_penalty_mean": 0.9726606607437134, "reward_repeat_penalty_std": 0.05877441540360451, "reward_repeat_floor_mean": 0.9966561794281006, "reward_repeat_floor_std": 0.006725291721522808, "reward_near_duplicate_penalty_mean": 0.9865835905075073, "reward_near_duplicate_penalty_std": 0.021426426246762276, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.38999998569488525, "reward_judge_quality_std": 0.18845234811306, "reward_total_composite_mean": 0.3402079939842224, "reward_total_composite_std": 0.21770277619361877} {"timestamp_utc": "2026-04-12T21:48:03Z", "mode": "train", "global_step": 1520, "epoch": 0.07999578969527919, "loss": 0.0235, "grad_norm": 12.409919738769531, "learning_rate": 5.396969696969697e-06, "num_tokens": 2684852.0, "completions/mean_length": 39.25, "completions/min_length": 37.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.25, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.7924405336380005, "rewards/meter/std": 0.34022170305252075, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.7737500667572021, "rewards/judge_quality/std": 0.22032040357589722, "rewards/repeat_penalty/mean": 0.9224278330802917, "rewards/repeat_penalty/std": 0.05909670516848564, "rewards/repeat_floor/mean": 0.9906152486801147, "rewards/repeat_floor/std": 0.006676937453448772, "rewards/near_duplicate_penalty/mean": 0.9625922441482544, "rewards/near_duplicate_penalty/std": 0.02779064141213894, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9580711126327515, "rewards/distinct_2/std": 0.05110624432563782, "rewards/total_composite/mean": 0.5837881565093994, "rewards/total_composite/std": 0.30689722299575806, "reward": 0.5837881565093994, "reward_std": 0.30689719319343567, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.0965077131986618, "sampling/sampling_logp_difference/max": 1.8102085590362549, "sampling/importance_sampling_ratio/min": 0.1636200100183487, "sampling/importance_sampling_ratio/mean": 1.0129787921905518, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5542140938341618, "clip_ratio/low_mean": 0.037042682990431786, "clip_ratio/low_min": 0.037042682990431786, "clip_ratio/high_mean": 0.04445488750934601, "clip_ratio/high_max": 0.04445488750934601, "clip_ratio/region_mean": 0.0814975704997778, "reward_total_mean": 0.5837881565093994, "reward_meter_mean": 0.7924405336380005, "reward_meter_std": 0.34022170305252075, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9224278330802917, "reward_repeat_penalty_std": 0.05909670516848564, "reward_repeat_floor_mean": 0.9906152486801147, "reward_repeat_floor_std": 0.006676937453448772, "reward_near_duplicate_penalty_mean": 0.9625922441482544, "reward_near_duplicate_penalty_std": 0.02779064141213894, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9580711126327515, "reward_distinct_2_std": 0.05110624432563782, "reward_judge_quality_mean": 0.7737500667572021, "reward_judge_quality_std": 0.22032040357589722, "reward_total_composite_mean": 0.5837881565093994, "reward_total_composite_std": 0.30689722299575806} {"timestamp_utc": "2026-04-12T21:48:09Z", "mode": "train", "global_step": 1521, "epoch": 0.08004841850428925, "loss": 0.0872, "grad_norm": 14.308231353759766, "learning_rate": 5.3939393939393945e-06, "num_tokens": 2686391.0, "completions/mean_length": 40.375, "completions/min_length": 35.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.375, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.7918498516082764, "rewards/meter/std": 0.26750698685646057, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.6075000166893005, "rewards/judge_quality/std": 0.25877460837364197, "rewards/repeat_penalty/mean": 0.8959201574325562, "rewards/repeat_penalty/std": 0.09392093122005463, "rewards/repeat_floor/mean": 0.9866591691970825, "rewards/repeat_floor/std": 0.011625532060861588, "rewards/near_duplicate_penalty/mean": 0.9387994408607483, "rewards/near_duplicate_penalty/std": 0.05887793004512787, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9537689685821533, "rewards/distinct_2/std": 0.07117754966020584, "rewards/total_composite/mean": 0.49097132682800293, "rewards/total_composite/std": 0.28832054138183594, "reward": 0.49097132682800293, "reward_std": 0.28832054138183594, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14265866577625275, "sampling/sampling_logp_difference/max": 1.7881091833114624, "sampling/importance_sampling_ratio/min": 0.16727615892887115, "sampling/importance_sampling_ratio/mean": 1.0254676342010498, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9759261161088943, "clip_ratio/low_mean": 0.06911526061594486, "clip_ratio/low_min": 0.06911526061594486, "clip_ratio/high_mean": 0.07159130461513996, "clip_ratio/high_max": 0.07159130461513996, "clip_ratio/region_mean": 0.14070656523108482, "reward_total_mean": 0.49097132682800293, "reward_meter_mean": 0.7918498516082764, "reward_meter_std": 0.26750698685646057, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8959201574325562, "reward_repeat_penalty_std": 0.09392093122005463, "reward_repeat_floor_mean": 0.9866591691970825, "reward_repeat_floor_std": 0.011625532060861588, "reward_near_duplicate_penalty_mean": 0.9387994408607483, "reward_near_duplicate_penalty_std": 0.05887793004512787, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9537689685821533, "reward_distinct_2_std": 0.07117754966020584, "reward_judge_quality_mean": 0.6075000166893005, "reward_judge_quality_std": 0.25877460837364197, "reward_total_composite_mean": 0.49097132682800293, "reward_total_composite_std": 0.28832054138183594} {"timestamp_utc": "2026-04-12T21:48:16Z", "mode": "train", "global_step": 1522, "epoch": 0.0801010473132993, "loss": -0.0108, "grad_norm": 10.884950637817383, "learning_rate": 5.390909090909091e-06, "num_tokens": 2688332.0, "completions/mean_length": 72.625, "completions/min_length": 58.0, "completions/max_length": 78.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 72.625, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 78.0, "rewards/meter/mean": 0.946377694606781, "rewards/meter/std": 0.04489784687757492, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5362499952316284, "rewards/judge_quality/std": 0.1524970978498459, "rewards/repeat_penalty/mean": 0.6585756540298462, "rewards/repeat_penalty/std": 0.1976325511932373, "rewards/repeat_floor/mean": 0.9586641192436218, "rewards/repeat_floor/std": 0.026731295511126518, "rewards/near_duplicate_penalty/mean": 0.8806854486465454, "rewards/near_duplicate_penalty/std": 0.08739843219518661, "rewards/opening_diversity/mean": 0.9140625, "rewards/opening_diversity/std": 0.10531362891197205, "rewards/distinct_2/mean": 0.7968617677688599, "rewards/distinct_2/std": 0.10690400749444962, "rewards/total_composite/mean": 0.47932302951812744, "rewards/total_composite/std": 0.14711469411849976, "reward": 0.47932302951812744, "reward_std": 0.14711467921733856, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13120333850383759, "sampling/sampling_logp_difference/max": 2.2665791511535645, "sampling/importance_sampling_ratio/min": 0.10366620123386383, "sampling/importance_sampling_ratio/mean": 1.0189564228057861, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7270428612828255, "clip_ratio/low_mean": 0.06438386719673872, "clip_ratio/low_min": 0.06438386719673872, "clip_ratio/high_mean": 0.04815789498388767, "clip_ratio/high_max": 0.04815789498388767, "clip_ratio/region_mean": 0.11254176218062639, "reward_total_mean": 0.47932302951812744, "reward_meter_mean": 0.946377694606781, "reward_meter_std": 0.04489784687757492, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6585756540298462, "reward_repeat_penalty_std": 0.1976325511932373, "reward_repeat_floor_mean": 0.9586641192436218, "reward_repeat_floor_std": 0.026731295511126518, "reward_near_duplicate_penalty_mean": 0.8806854486465454, "reward_near_duplicate_penalty_std": 0.08739843219518661, "reward_opening_diversity_mean": 0.9140625, "reward_opening_diversity_std": 0.10531362891197205, "reward_distinct_2_mean": 0.7968617677688599, "reward_distinct_2_std": 0.10690400749444962, "reward_judge_quality_mean": 0.5362499952316284, "reward_judge_quality_std": 0.1524970978498459, "reward_total_composite_mean": 0.47932302951812744, "reward_total_composite_std": 0.14711469411849976} {"timestamp_utc": "2026-04-12T21:48:28Z", "mode": "train", "global_step": 1523, "epoch": 0.08015367612230935, "loss": -0.0684, "grad_norm": 3.554558753967285, "learning_rate": 5.387878787878789e-06, "num_tokens": 2690015.0, "completions/mean_length": 169.375, "completions/min_length": 49.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 55.16666793823242, "completions/min_terminated_length": 49.0, "completions/max_terminated_length": 63.0, "rewards/meter/mean": 0.465198814868927, "rewards/meter/std": 0.39417970180511475, "rewards/count_adherence/mean": 0.75, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.925000011920929, "rewards/count_floor/std": 0.1060660183429718, "rewards/lexical_plausibility/mean": 0.8780081272125244, "rewards/lexical_plausibility/std": 0.22701644897460938, "rewards/judge_quality/mean": 0.32124999165534973, "rewards/judge_quality/std": 0.18333710730075836, "rewards/repeat_penalty/mean": 0.9469808340072632, "rewards/repeat_penalty/std": 0.060167331248521805, "rewards/repeat_floor/mean": 0.9938617944717407, "rewards/repeat_floor/std": 0.0064409468322992325, "rewards/near_duplicate_penalty/mean": 0.9790488481521606, "rewards/near_duplicate_penalty/std": 0.016430774703621864, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9667167663574219, "rewards/distinct_2/std": 0.04897624999284744, "rewards/total_composite/mean": 0.17819607257843018, "rewards/total_composite/std": 0.17153175175189972, "reward": 0.17819607257843018, "reward_std": 0.17153175175189972, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1527625173330307, "sampling/sampling_logp_difference/max": 2.240691661834717, "sampling/importance_sampling_ratio/min": 0.10638489574193954, "sampling/importance_sampling_ratio/mean": 1.0010536909103394, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6078944504261017, "clip_ratio/low_mean": 0.02384559903293848, "clip_ratio/low_min": 0.02384559903293848, "clip_ratio/high_mean": 0.07753779739141464, "clip_ratio/high_max": 0.07753779739141464, "clip_ratio/region_mean": 0.10138339642435312, "reward_total_mean": 0.17819607257843018, "reward_meter_mean": 0.465198814868927, "reward_meter_std": 0.39417970180511475, "reward_count_adherence_mean": 0.75, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.925000011920929, "reward_count_floor_std": 0.1060660183429718, "reward_lexical_plausibility_mean": 0.8780081272125244, "reward_lexical_plausibility_std": 0.22701644897460938, "reward_repeat_penalty_mean": 0.9469808340072632, "reward_repeat_penalty_std": 0.060167331248521805, "reward_repeat_floor_mean": 0.9938617944717407, "reward_repeat_floor_std": 0.0064409468322992325, "reward_near_duplicate_penalty_mean": 0.9790488481521606, "reward_near_duplicate_penalty_std": 0.016430774703621864, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9667167663574219, "reward_distinct_2_std": 0.04897624999284744, "reward_judge_quality_mean": 0.32124999165534973, "reward_judge_quality_std": 0.18333710730075836, "reward_total_composite_mean": 0.17819607257843018, "reward_total_composite_std": 0.17153175175189972} {"timestamp_utc": "2026-04-12T21:48:34Z", "mode": "train", "global_step": 1524, "epoch": 0.0802063049313194, "loss": 0.0089, "grad_norm": 10.494470596313477, "learning_rate": 5.384848484848485e-06, "num_tokens": 2691956.0, "completions/mean_length": 75.625, "completions/min_length": 65.0, "completions/max_length": 86.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 75.625, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 86.0, "rewards/meter/mean": 0.6106592416763306, "rewards/meter/std": 0.34382274746894836, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1157275140285492, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.03471824526786804, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5737500190734863, "rewards/judge_quality/std": 0.1566559225320816, "rewards/repeat_penalty/mean": 0.833951473236084, "rewards/repeat_penalty/std": 0.10136827826499939, "rewards/repeat_floor/mean": 0.9835786819458008, "rewards/repeat_floor/std": 0.009157607331871986, "rewards/near_duplicate_penalty/mean": 0.9619607329368591, "rewards/near_duplicate_penalty/std": 0.01770230010151863, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8809397220611572, "rewards/distinct_2/std": 0.075276218354702, "rewards/total_composite/mean": 0.3298325538635254, "rewards/total_composite/std": 0.22314615547657013, "reward": 0.3298325538635254, "reward_std": 0.22314615547657013, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14376334846019745, "sampling/sampling_logp_difference/max": 1.522964358329773, "sampling/importance_sampling_ratio/min": 0.21806451678276062, "sampling/importance_sampling_ratio/mean": 1.0001769065856934, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6671876981854439, "clip_ratio/low_mean": 0.06491773435845971, "clip_ratio/low_min": 0.06491773435845971, "clip_ratio/high_mean": 0.04397420305758715, "clip_ratio/high_max": 0.04397420305758715, "clip_ratio/region_mean": 0.10889193741604686, "reward_total_mean": 0.3298325538635254, "reward_meter_mean": 0.6106592416763306, "reward_meter_std": 0.34382274746894836, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1157275140285492, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.03471824526786804, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.833951473236084, "reward_repeat_penalty_std": 0.10136827826499939, "reward_repeat_floor_mean": 0.9835786819458008, "reward_repeat_floor_std": 0.009157607331871986, "reward_near_duplicate_penalty_mean": 0.9619607329368591, "reward_near_duplicate_penalty_std": 0.01770230010151863, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8809397220611572, "reward_distinct_2_std": 0.075276218354702, "reward_judge_quality_mean": 0.5737500190734863, "reward_judge_quality_std": 0.1566559225320816, "reward_total_composite_mean": 0.3298325538635254, "reward_total_composite_std": 0.22314615547657013} {"timestamp_utc": "2026-04-12T21:48:41Z", "mode": "train", "global_step": 1525, "epoch": 0.08025893374032946, "loss": 0.0859, "grad_norm": 12.723620414733887, "learning_rate": 5.381818181818183e-06, "num_tokens": 2693578.0, "completions/mean_length": 39.75, "completions/min_length": 35.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 39.75, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.9614500999450684, "rewards/meter/std": 0.049186501652002335, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5149999856948853, "rewards/judge_quality/std": 0.1803172081708908, "rewards/repeat_penalty/mean": 0.9003968238830566, "rewards/repeat_penalty/std": 0.14561787247657776, "rewards/repeat_floor/mean": 0.9882755279541016, "rewards/repeat_floor/std": 0.015324287116527557, "rewards/near_duplicate_penalty/mean": 0.9550296068191528, "rewards/near_duplicate_penalty/std": 0.04247147589921951, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9655120372772217, "rewards/distinct_2/std": 0.057574495673179626, "rewards/total_composite/mean": 0.49208956956863403, "rewards/total_composite/std": 0.1803610622882843, "reward": 0.49208956956863403, "reward_std": 0.1803610622882843, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1361437290906906, "sampling/sampling_logp_difference/max": 2.4802467823028564, "sampling/importance_sampling_ratio/min": 0.0837225615978241, "sampling/importance_sampling_ratio/mean": 0.9915043711662292, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.5932756625115871, "clip_ratio/low_mean": 0.07083026552572846, "clip_ratio/low_min": 0.07083026552572846, "clip_ratio/high_mean": 0.039403016678988934, "clip_ratio/high_max": 0.039403016678988934, "clip_ratio/region_mean": 0.1102332822047174, "reward_total_mean": 0.49208956956863403, "reward_meter_mean": 0.9614500999450684, "reward_meter_std": 0.049186501652002335, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9003968238830566, "reward_repeat_penalty_std": 0.14561787247657776, "reward_repeat_floor_mean": 0.9882755279541016, "reward_repeat_floor_std": 0.015324287116527557, "reward_near_duplicate_penalty_mean": 0.9550296068191528, "reward_near_duplicate_penalty_std": 0.04247147589921951, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9655120372772217, "reward_distinct_2_std": 0.057574495673179626, "reward_judge_quality_mean": 0.5149999856948853, "reward_judge_quality_std": 0.1803172081708908, "reward_total_composite_mean": 0.49208956956863403, "reward_total_composite_std": 0.1803610622882843} {"timestamp_utc": "2026-04-12T21:48:52Z", "mode": "train", "global_step": 1526, "epoch": 0.08031156254933951, "loss": -0.1279, "grad_norm": 3.381234884262085, "learning_rate": 5.378787878787879e-06, "num_tokens": 2695563.0, "completions/mean_length": 124.125, "completions/min_length": 60.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 68.71428680419922, "completions/min_terminated_length": 60.0, "completions/max_terminated_length": 78.0, "rewards/meter/mean": 0.8804305791854858, "rewards/meter/std": 0.2439807653427124, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 0.9360970258712769, "rewards/lexical_plausibility/std": 0.180744931101799, "rewards/judge_quality/mean": 0.4150000214576721, "rewards/judge_quality/std": 0.18031719326972961, "rewards/repeat_penalty/mean": 0.8676546812057495, "rewards/repeat_penalty/std": 0.1129741445183754, "rewards/repeat_floor/mean": 0.9842111468315125, "rewards/repeat_floor/std": 0.013527601025998592, "rewards/near_duplicate_penalty/mean": 0.9460961818695068, "rewards/near_duplicate_penalty/std": 0.045496616512537, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9144079685211182, "rewards/distinct_2/std": 0.0847252905368805, "rewards/total_composite/mean": 0.36114463210105896, "rewards/total_composite/std": 0.19667382538318634, "reward": 0.36114463210105896, "reward_std": 0.19667382538318634, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13826672732830048, "sampling/sampling_logp_difference/max": 4.088789939880371, "sampling/importance_sampling_ratio/min": 0.01675950177013874, "sampling/importance_sampling_ratio/mean": 1.0007166862487793, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6977327093482018, "clip_ratio/low_mean": 0.02083333395421505, "clip_ratio/low_min": 0.02083333395421505, "clip_ratio/high_mean": 0.0925633879378438, "clip_ratio/high_max": 0.0925633879378438, "clip_ratio/region_mean": 0.11339672189205885, "reward_total_mean": 0.36114463210105896, "reward_meter_mean": 0.8804305791854858, "reward_meter_std": 0.2439807653427124, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 0.9360970258712769, "reward_lexical_plausibility_std": 0.180744931101799, "reward_repeat_penalty_mean": 0.8676546812057495, "reward_repeat_penalty_std": 0.1129741445183754, "reward_repeat_floor_mean": 0.9842111468315125, "reward_repeat_floor_std": 0.013527601025998592, "reward_near_duplicate_penalty_mean": 0.9460961818695068, "reward_near_duplicate_penalty_std": 0.045496616512537, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9144079685211182, "reward_distinct_2_std": 0.0847252905368805, "reward_judge_quality_mean": 0.4150000214576721, "reward_judge_quality_std": 0.18031719326972961, "reward_total_composite_mean": 0.36114463210105896, "reward_total_composite_std": 0.19667382538318634} {"timestamp_utc": "2026-04-12T21:49:04Z", "mode": "train", "global_step": 1527, "epoch": 0.08036419135834956, "loss": -0.0648, "grad_norm": 2.375276565551758, "learning_rate": 5.375757575757576e-06, "num_tokens": 2696998.0, "completions/mean_length": 159.375, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 41.833335876464844, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.6439677476882935, "rewards/meter/std": 0.4702589809894562, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.75, "rewards/arabic_clean/std": 0.4629100561141968, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.852933943271637, "rewards/lexical_plausibility/std": 0.27269622683525085, "rewards/judge_quality/mean": 0.3725000023841858, "rewards/judge_quality/std": 0.22282280027866364, "rewards/repeat_penalty/mean": 0.8634754419326782, "rewards/repeat_penalty/std": 0.12386002391576767, "rewards/repeat_floor/mean": 0.9863673448562622, "rewards/repeat_floor/std": 0.013182880356907845, "rewards/near_duplicate_penalty/mean": 0.9531238675117493, "rewards/near_duplicate_penalty/std": 0.06239024177193642, "rewards/opening_diversity/mean": 0.9375, "rewards/opening_diversity/std": 0.1157275140285492, "rewards/distinct_2/mean": 0.9683189392089844, "rewards/distinct_2/std": 0.06502888351678848, "rewards/total_composite/mean": 0.29991188645362854, "rewards/total_composite/std": 0.2601035535335541, "reward": 0.29991188645362854, "reward_std": 0.2601035535335541, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1712958961725235, "sampling/sampling_logp_difference/max": 1.1802854537963867, "sampling/importance_sampling_ratio/min": 0.30719104409217834, "sampling/importance_sampling_ratio/mean": 1.0464965105056763, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0569485574960709, "clip_ratio/low_mean": 0.01595744676887989, "clip_ratio/low_min": 0.01595744676887989, "clip_ratio/high_mean": 0.07877714512869716, "clip_ratio/high_max": 0.07877714512869716, "clip_ratio/region_mean": 0.09473459189757705, "reward_total_mean": 0.29991188645362854, "reward_meter_mean": 0.6439677476882935, "reward_meter_std": 0.4702589809894562, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.75, "reward_arabic_clean_std": 0.4629100561141968, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.852933943271637, "reward_lexical_plausibility_std": 0.27269622683525085, "reward_repeat_penalty_mean": 0.8634754419326782, "reward_repeat_penalty_std": 0.12386002391576767, "reward_repeat_floor_mean": 0.9863673448562622, "reward_repeat_floor_std": 0.013182880356907845, "reward_near_duplicate_penalty_mean": 0.9531238675117493, "reward_near_duplicate_penalty_std": 0.06239024177193642, "reward_opening_diversity_mean": 0.9375, "reward_opening_diversity_std": 0.1157275140285492, "reward_distinct_2_mean": 0.9683189392089844, "reward_distinct_2_std": 0.06502888351678848, "reward_judge_quality_mean": 0.3725000023841858, "reward_judge_quality_std": 0.22282280027866364, "reward_total_composite_mean": 0.29991188645362854, "reward_total_composite_std": 0.2601035535335541} {"timestamp_utc": "2026-04-12T21:49:15Z", "mode": "train", "global_step": 1528, "epoch": 0.08041682016735961, "loss": -0.042, "grad_norm": 5.34360408782959, "learning_rate": 5.372727272727273e-06, "num_tokens": 2698262.0, "completions/mean_length": 82.0, "completions/min_length": 18.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 20.571430206298828, "completions/min_terminated_length": 18.0, "completions/max_terminated_length": 22.0, "rewards/meter/mean": 0.619267463684082, "rewards/meter/std": 0.40426722168922424, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.3535533845424652, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 0.875, "rewards/hard_gate/std": 0.3535533845424652, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.1060660257935524, "rewards/lexical_plausibility/mean": 0.9295322895050049, "rewards/lexical_plausibility/std": 0.1754276156425476, "rewards/judge_quality/mean": 0.3774999976158142, "rewards/judge_quality/std": 0.13274572789669037, "rewards/repeat_penalty/mean": 0.7707452774047852, "rewards/repeat_penalty/std": 0.09718868881464005, "rewards/repeat_floor/mean": 0.9847740530967712, "rewards/repeat_floor/std": 0.008511229418218136, "rewards/near_duplicate_penalty/mean": 0.9859936237335205, "rewards/near_duplicate_penalty/std": 0.03961591050028801, "rewards/opening_diversity/mean": 0.78125, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 1.0, "rewards/distinct_2/std": 0.0, "rewards/total_composite/mean": 0.2586647868156433, "rewards/total_composite/std": 0.1693427413702011, "reward": 0.2586647868156433, "reward_std": 0.1693427562713623, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14291003346443176, "sampling/sampling_logp_difference/max": 1.4642868041992188, "sampling/importance_sampling_ratio/min": 0.23124286532402039, "sampling/importance_sampling_ratio/mean": 1.034210443496704, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7955408729612827, "clip_ratio/low_mean": 0.023989899549633265, "clip_ratio/low_min": 0.023989899549633265, "clip_ratio/high_mean": 0.06154306326061487, "clip_ratio/high_max": 0.06154306326061487, "clip_ratio/region_mean": 0.08553296281024814, "reward_total_mean": 0.2586647868156433, "reward_meter_mean": 0.619267463684082, "reward_meter_std": 0.40426722168922424, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.3535533845424652, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 0.875, "reward_hard_gate_std": 0.3535533845424652, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.1060660257935524, "reward_lexical_plausibility_mean": 0.9295322895050049, "reward_lexical_plausibility_std": 0.1754276156425476, "reward_repeat_penalty_mean": 0.7707452774047852, "reward_repeat_penalty_std": 0.09718868881464005, "reward_repeat_floor_mean": 0.9847740530967712, "reward_repeat_floor_std": 0.008511229418218136, "reward_near_duplicate_penalty_mean": 0.9859936237335205, "reward_near_duplicate_penalty_std": 0.03961591050028801, "reward_opening_diversity_mean": 0.78125, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 1.0, "reward_distinct_2_std": 0.0, "reward_judge_quality_mean": 0.3774999976158142, "reward_judge_quality_std": 0.13274572789669037, "reward_total_composite_mean": 0.2586647868156433, "reward_total_composite_std": 0.1693427413702011} {"timestamp_utc": "2026-04-12T21:49:21Z", "mode": "train", "global_step": 1529, "epoch": 0.08046944897636966, "loss": 0.023, "grad_norm": 18.271020889282227, "learning_rate": 5.36969696969697e-06, "num_tokens": 2699938.0, "completions/mean_length": 37.5, "completions/min_length": 34.0, "completions/max_length": 40.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 37.5, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.8695324063301086, "rewards/meter/std": 0.26024389266967773, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.35999998450279236, "rewards/judge_quality/std": 0.09165150672197342, "rewards/repeat_penalty/mean": 0.7619063854217529, "rewards/repeat_penalty/std": 0.24325452744960785, "rewards/repeat_floor/mean": 0.9734892845153809, "rewards/repeat_floor/std": 0.027102071791887283, "rewards/near_duplicate_penalty/mean": 0.9235715866088867, "rewards/near_duplicate_penalty/std": 0.07062521576881409, "rewards/opening_diversity/mean": 0.875, "rewards/opening_diversity/std": 0.13363061845302582, "rewards/distinct_2/mean": 0.916150689125061, "rewards/distinct_2/std": 0.10905730724334717, "rewards/total_composite/mean": 0.29942119121551514, "rewards/total_composite/std": 0.11908740550279617, "reward": 0.29942119121551514, "reward_std": 0.11908739805221558, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12328280508518219, "sampling/sampling_logp_difference/max": 1.3762907981872559, "sampling/importance_sampling_ratio/min": 0.25251346826553345, "sampling/importance_sampling_ratio/mean": 1.0183333158493042, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6989334225654602, "clip_ratio/low_mean": 0.060727136209607124, "clip_ratio/low_min": 0.060727136209607124, "clip_ratio/high_mean": 0.06254699267446995, "clip_ratio/high_max": 0.06254699267446995, "clip_ratio/region_mean": 0.12327412888407707, "reward_total_mean": 0.29942119121551514, "reward_meter_mean": 0.8695324063301086, "reward_meter_std": 0.26024389266967773, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7619063854217529, "reward_repeat_penalty_std": 0.24325452744960785, "reward_repeat_floor_mean": 0.9734892845153809, "reward_repeat_floor_std": 0.027102071791887283, "reward_near_duplicate_penalty_mean": 0.9235715866088867, "reward_near_duplicate_penalty_std": 0.07062521576881409, "reward_opening_diversity_mean": 0.875, "reward_opening_diversity_std": 0.13363061845302582, "reward_distinct_2_mean": 0.916150689125061, "reward_distinct_2_std": 0.10905730724334717, "reward_judge_quality_mean": 0.35999998450279236, "reward_judge_quality_std": 0.09165150672197342, "reward_total_composite_mean": 0.29942119121551514, "reward_total_composite_std": 0.11908740550279617} {"timestamp_utc": "2026-04-12T21:49:27Z", "mode": "train", "global_step": 1530, "epoch": 0.08052207778537972, "loss": -0.0312, "grad_norm": 15.39715576171875, "learning_rate": 5.366666666666666e-06, "num_tokens": 2701348.0, "completions/mean_length": 22.25, "completions/min_length": 20.0, "completions/max_length": 24.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 22.25, "completions/min_terminated_length": 20.0, "completions/max_terminated_length": 24.0, "rewards/meter/mean": 0.6570097804069519, "rewards/meter/std": 0.36284562945365906, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.844009280204773, "rewards/lexical_plausibility/std": 0.16080482304096222, "rewards/judge_quality/mean": 0.41999998688697815, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.738130509853363, "rewards/repeat_penalty/std": 0.031143037602305412, "rewards/repeat_floor/mean": 0.9835137128829956, "rewards/repeat_floor/std": 0.003728361800312996, "rewards/near_duplicate_penalty/mean": 0.9989669322967529, "rewards/near_duplicate_penalty/std": 0.002921935636550188, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9852070808410645, "rewards/distinct_2/std": 0.041840631514787674, "rewards/total_composite/mean": 0.2716251015663147, "rewards/total_composite/std": 0.15022878348827362, "reward": 0.2716251015663147, "reward_std": 0.15022878348827362, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.10107531398534775, "sampling/sampling_logp_difference/max": 0.9791464805603027, "sampling/importance_sampling_ratio/min": 0.37563157081604004, "sampling/importance_sampling_ratio/mean": 1.0228551626205444, "sampling/importance_sampling_ratio/max": 1.581586241722107, "entropy": 0.9554580301046371, "clip_ratio/low_mean": 0.018452381249517202, "clip_ratio/low_min": 0.018452381249517202, "clip_ratio/high_mean": 0.09584980458021164, "clip_ratio/high_max": 0.09584980458021164, "clip_ratio/region_mean": 0.11430218582972884, "reward_total_mean": 0.2716251015663147, "reward_meter_mean": 0.6570097804069519, "reward_meter_std": 0.36284562945365906, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.844009280204773, "reward_lexical_plausibility_std": 0.16080482304096222, "reward_repeat_penalty_mean": 0.738130509853363, "reward_repeat_penalty_std": 0.031143037602305412, "reward_repeat_floor_mean": 0.9835137128829956, "reward_repeat_floor_std": 0.003728361800312996, "reward_near_duplicate_penalty_mean": 0.9989669322967529, "reward_near_duplicate_penalty_std": 0.002921935636550188, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9852070808410645, "reward_distinct_2_std": 0.041840631514787674, "reward_judge_quality_mean": 0.41999998688697815, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.2716251015663147, "reward_total_composite_std": 0.15022878348827362} {"timestamp_utc": "2026-04-12T21:49:33Z", "mode": "train", "global_step": 1531, "epoch": 0.08057470659438977, "loss": 0.1039, "grad_norm": 24.86589813232422, "learning_rate": 5.3636363636363645e-06, "num_tokens": 2702624.0, "completions/mean_length": 19.5, "completions/min_length": 14.0, "completions/max_length": 25.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 19.5, "completions/min_terminated_length": 14.0, "completions/max_terminated_length": 25.0, "rewards/meter/mean": 0.5760490894317627, "rewards/meter/std": 0.3285415768623352, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4312500059604645, "rewards/judge_quality/std": 0.015526476316154003, "rewards/repeat_penalty/mean": 0.7218390107154846, "rewards/repeat_penalty/std": 0.054339636117219925, "rewards/repeat_floor/mean": 0.980582594871521, "rewards/repeat_floor/std": 0.00819238182157278, "rewards/near_duplicate_penalty/mean": 0.9833712577819824, "rewards/near_duplicate_penalty/std": 0.03924896568059921, "rewards/opening_diversity/mean": 0.75, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9786324501037598, "rewards/distinct_2/std": 0.06043647602200508, "rewards/total_composite/mean": 0.24635758996009827, "rewards/total_composite/std": 0.1442408263683319, "reward": 0.24635758996009827, "reward_std": 0.1442408263683319, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1799771934747696, "sampling/sampling_logp_difference/max": 2.439213514328003, "sampling/importance_sampling_ratio/min": 0.087229423224926, "sampling/importance_sampling_ratio/mean": 0.9935725331306458, "sampling/importance_sampling_ratio/max": 1.798694372177124, "entropy": 0.9039500951766968, "clip_ratio/low_mean": 0.07151016779243946, "clip_ratio/low_min": 0.07151016779243946, "clip_ratio/high_mean": 0.0652725575491786, "clip_ratio/high_max": 0.0652725575491786, "clip_ratio/region_mean": 0.13678272534161806, "reward_total_mean": 0.24635758996009827, "reward_meter_mean": 0.5760490894317627, "reward_meter_std": 0.3285415768623352, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7218390107154846, "reward_repeat_penalty_std": 0.054339636117219925, "reward_repeat_floor_mean": 0.980582594871521, "reward_repeat_floor_std": 0.00819238182157278, "reward_near_duplicate_penalty_mean": 0.9833712577819824, "reward_near_duplicate_penalty_std": 0.03924896568059921, "reward_opening_diversity_mean": 0.75, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9786324501037598, "reward_distinct_2_std": 0.06043647602200508, "reward_judge_quality_mean": 0.4312500059604645, "reward_judge_quality_std": 0.015526476316154003, "reward_total_composite_mean": 0.24635758996009827, "reward_total_composite_std": 0.1442408263683319} {"timestamp_utc": "2026-04-12T21:49:45Z", "mode": "train", "global_step": 1532, "epoch": 0.08062733540339982, "loss": -0.1104, "grad_norm": 3.404844284057617, "learning_rate": 5.360606060606061e-06, "num_tokens": 2704641.0, "completions/mean_length": 193.125, "completions/min_length": 80.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 86.83333587646484, "completions/min_terminated_length": 80.0, "completions/max_terminated_length": 99.0, "rewards/meter/mean": 0.513882577419281, "rewards/meter/std": 0.366549015045166, "rewards/count_adherence/mean": 0.8250000476837158, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9474999904632568, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.8779207468032837, "rewards/lexical_plausibility/std": 0.2269989401102066, "rewards/judge_quality/mean": 0.3774999976158142, "rewards/judge_quality/std": 0.20817232131958008, "rewards/repeat_penalty/mean": 0.8992990255355835, "rewards/repeat_penalty/std": 0.060248106718063354, "rewards/repeat_floor/mean": 0.9890507459640503, "rewards/repeat_floor/std": 0.005993724800646305, "rewards/near_duplicate_penalty/mean": 0.9720340371131897, "rewards/near_duplicate_penalty/std": 0.01015514973551035, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.924951434135437, "rewards/distinct_2/std": 0.05770958960056305, "rewards/total_composite/mean": 0.1910392791032791, "rewards/total_composite/std": 0.16687238216400146, "reward": 0.1910392791032791, "reward_std": 0.16687238216400146, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1429230123758316, "sampling/sampling_logp_difference/max": 2.1384706497192383, "sampling/importance_sampling_ratio/min": 0.1178349107503891, "sampling/importance_sampling_ratio/mean": 1.00698721408844, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7193223834037781, "clip_ratio/low_mean": 0.03324353415518999, "clip_ratio/low_min": 0.03324353415518999, "clip_ratio/high_mean": 0.07775518763810396, "clip_ratio/high_max": 0.07775518763810396, "clip_ratio/region_mean": 0.11099872179329395, "reward_total_mean": 0.1910392791032791, "reward_meter_mean": 0.513882577419281, "reward_meter_std": 0.366549015045166, "reward_count_adherence_mean": 0.8250000476837158, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9474999904632568, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.8779207468032837, "reward_lexical_plausibility_std": 0.2269989401102066, "reward_repeat_penalty_mean": 0.8992990255355835, "reward_repeat_penalty_std": 0.060248106718063354, "reward_repeat_floor_mean": 0.9890507459640503, "reward_repeat_floor_std": 0.005993724800646305, "reward_near_duplicate_penalty_mean": 0.9720340371131897, "reward_near_duplicate_penalty_std": 0.01015514973551035, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.924951434135437, "reward_distinct_2_std": 0.05770958960056305, "reward_judge_quality_mean": 0.3774999976158142, "reward_judge_quality_std": 0.20817232131958008, "reward_total_composite_mean": 0.1910392791032791, "reward_total_composite_std": 0.16687238216400146} {"timestamp_utc": "2026-04-12T21:49:57Z", "mode": "train", "global_step": 1533, "epoch": 0.08067996421240987, "loss": -0.1195, "grad_norm": 3.960251808166504, "learning_rate": 5.357575757575758e-06, "num_tokens": 2706610.0, "completions/mean_length": 127.125, "completions/min_length": 65.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 72.14286041259766, "completions/min_terminated_length": 65.0, "completions/max_terminated_length": 92.0, "rewards/meter/mean": 0.8311418294906616, "rewards/meter/std": 0.22106477618217468, "rewards/count_adherence/mean": 0.7750000357627869, "rewards/count_adherence/std": 0.12817399203777313, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9325000047683716, "rewards/count_floor/std": 0.03845219686627388, "rewards/lexical_plausibility/mean": 0.9463132619857788, "rewards/lexical_plausibility/std": 0.15184898674488068, "rewards/judge_quality/mean": 0.3737499713897705, "rewards/judge_quality/std": 0.13081474602222443, "rewards/repeat_penalty/mean": 0.8302541971206665, "rewards/repeat_penalty/std": 0.15448428690433502, "rewards/repeat_floor/mean": 0.9817454218864441, "rewards/repeat_floor/std": 0.013800125569105148, "rewards/near_duplicate_penalty/mean": 0.9470402598381042, "rewards/near_duplicate_penalty/std": 0.023172305896878242, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8854376077651978, "rewards/distinct_2/std": 0.12076510488986969, "rewards/total_composite/mean": 0.2855883240699768, "rewards/total_composite/std": 0.12879391014575958, "reward": 0.2855883240699768, "reward_std": 0.12879391014575958, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14837683737277985, "sampling/sampling_logp_difference/max": 2.100227117538452, "sampling/importance_sampling_ratio/min": 0.12242861092090607, "sampling/importance_sampling_ratio/mean": 1.0206729173660278, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8774540796875954, "clip_ratio/low_mean": 0.035305808298289776, "clip_ratio/low_min": 0.035305808298289776, "clip_ratio/high_mean": 0.0816015973687172, "clip_ratio/high_max": 0.0816015973687172, "clip_ratio/region_mean": 0.11690740566700697, "reward_total_mean": 0.2855883240699768, "reward_meter_mean": 0.8311418294906616, "reward_meter_std": 0.22106477618217468, "reward_count_adherence_mean": 0.7750000357627869, "reward_count_adherence_std": 0.12817399203777313, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9325000047683716, "reward_count_floor_std": 0.03845219686627388, "reward_lexical_plausibility_mean": 0.9463132619857788, "reward_lexical_plausibility_std": 0.15184898674488068, "reward_repeat_penalty_mean": 0.8302541971206665, "reward_repeat_penalty_std": 0.15448428690433502, "reward_repeat_floor_mean": 0.9817454218864441, "reward_repeat_floor_std": 0.013800125569105148, "reward_near_duplicate_penalty_mean": 0.9470402598381042, "reward_near_duplicate_penalty_std": 0.023172305896878242, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8854376077651978, "reward_distinct_2_std": 0.12076510488986969, "reward_judge_quality_mean": 0.3737499713897705, "reward_judge_quality_std": 0.13081474602222443, "reward_total_composite_mean": 0.2855883240699768, "reward_total_composite_std": 0.12879391014575958} {"timestamp_utc": "2026-04-12T21:50:08Z", "mode": "train", "global_step": 1534, "epoch": 0.08073259302141993, "loss": -0.0644, "grad_norm": 5.147063255310059, "learning_rate": 5.3545454545454546e-06, "num_tokens": 2708651.0, "completions/mean_length": 138.125, "completions/min_length": 78.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 84.71428680419922, "completions/min_terminated_length": 78.0, "completions/max_terminated_length": 101.0, "rewards/meter/mean": 0.45128393173217773, "rewards/meter/std": 0.32359185814857483, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9285992383956909, "rewards/lexical_plausibility/std": 0.2019517868757248, "rewards/judge_quality/mean": 0.44875001907348633, "rewards/judge_quality/std": 0.2105392962694168, "rewards/repeat_penalty/mean": 0.8362984657287598, "rewards/repeat_penalty/std": 0.21853581070899963, "rewards/repeat_floor/mean": 0.9808658361434937, "rewards/repeat_floor/std": 0.027302125468850136, "rewards/near_duplicate_penalty/mean": 0.9547817707061768, "rewards/near_duplicate_penalty/std": 0.06124158203601837, "rewards/opening_diversity/mean": 0.9583333730697632, "rewards/opening_diversity/std": 0.117851123213768, "rewards/distinct_2/mean": 0.8905392289161682, "rewards/distinct_2/std": 0.1314607858657837, "rewards/total_composite/mean": 0.212234765291214, "rewards/total_composite/std": 0.15200981497764587, "reward": 0.212234765291214, "reward_std": 0.15200981497764587, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13178750872612, "sampling/sampling_logp_difference/max": 2.0805277824401855, "sampling/importance_sampling_ratio/min": 0.12486429512500763, "sampling/importance_sampling_ratio/mean": 1.015284776687622, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6982308626174927, "clip_ratio/low_mean": 0.03898688219487667, "clip_ratio/low_min": 0.03898688219487667, "clip_ratio/high_mean": 0.06643756851553917, "clip_ratio/high_max": 0.06643756851553917, "clip_ratio/region_mean": 0.10542445071041584, "reward_total_mean": 0.212234765291214, "reward_meter_mean": 0.45128393173217773, "reward_meter_std": 0.32359185814857483, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9285992383956909, "reward_lexical_plausibility_std": 0.2019517868757248, "reward_repeat_penalty_mean": 0.8362984657287598, "reward_repeat_penalty_std": 0.21853581070899963, "reward_repeat_floor_mean": 0.9808658361434937, "reward_repeat_floor_std": 0.027302125468850136, "reward_near_duplicate_penalty_mean": 0.9547817707061768, "reward_near_duplicate_penalty_std": 0.06124158203601837, "reward_opening_diversity_mean": 0.9583333730697632, "reward_opening_diversity_std": 0.117851123213768, "reward_distinct_2_mean": 0.8905392289161682, "reward_distinct_2_std": 0.1314607858657837, "reward_judge_quality_mean": 0.44875001907348633, "reward_judge_quality_std": 0.2105392962694168, "reward_total_composite_mean": 0.212234765291214, "reward_total_composite_std": 0.15200981497764587} {"timestamp_utc": "2026-04-12T21:50:20Z", "mode": "train", "global_step": 1535, "epoch": 0.08078522183042998, "loss": -0.0511, "grad_norm": 1.641182780265808, "learning_rate": 5.351515151515152e-06, "num_tokens": 2710091.0, "completions/mean_length": 278.0, "completions/min_length": 38.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.5, "completions/mean_terminated_length": 44.0, "completions/min_terminated_length": 38.0, "completions/max_terminated_length": 50.0, "rewards/meter/mean": 0.45078086853027344, "rewards/meter/std": 0.37090060114860535, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.5, "rewards/arabic_clean/std": 0.5345224738121033, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.774194061756134, "rewards/lexical_plausibility/std": 0.2528378665447235, "rewards/judge_quality/mean": 0.2212499976158142, "rewards/judge_quality/std": 0.19357076287269592, "rewards/repeat_penalty/mean": 0.9106108546257019, "rewards/repeat_penalty/std": 0.18619275093078613, "rewards/repeat_floor/mean": 0.9908612966537476, "rewards/repeat_floor/std": 0.019462091848254204, "rewards/near_duplicate_penalty/mean": 0.9902702569961548, "rewards/near_duplicate_penalty/std": 0.022085433825850487, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.9230077862739563, "rewards/distinct_2/std": 0.15756137669086456, "rewards/total_composite/mean": 0.118416428565979, "rewards/total_composite/std": 0.14938929677009583, "reward": 0.118416428565979, "reward_std": 0.14938926696777344, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14951294660568237, "sampling/sampling_logp_difference/max": 1.6516304016113281, "sampling/importance_sampling_ratio/min": 0.19173705577850342, "sampling/importance_sampling_ratio/mean": 1.0335068702697754, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6646767035126686, "clip_ratio/low_mean": 0.011111111380159855, "clip_ratio/low_min": 0.011111111380159855, "clip_ratio/high_mean": 0.05758567899465561, "clip_ratio/high_max": 0.05758567899465561, "clip_ratio/region_mean": 0.06869679037481546, "reward_total_mean": 0.118416428565979, "reward_meter_mean": 0.45078086853027344, "reward_meter_std": 0.37090060114860535, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.5, "reward_arabic_clean_std": 0.5345224738121033, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.774194061756134, "reward_lexical_plausibility_std": 0.2528378665447235, "reward_repeat_penalty_mean": 0.9106108546257019, "reward_repeat_penalty_std": 0.18619275093078613, "reward_repeat_floor_mean": 0.9908612966537476, "reward_repeat_floor_std": 0.019462091848254204, "reward_near_duplicate_penalty_mean": 0.9902702569961548, "reward_near_duplicate_penalty_std": 0.022085433825850487, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.9230077862739563, "reward_distinct_2_std": 0.15756137669086456, "reward_judge_quality_mean": 0.2212499976158142, "reward_judge_quality_std": 0.19357076287269592, "reward_total_composite_mean": 0.118416428565979, "reward_total_composite_std": 0.14938929677009583} {"timestamp_utc": "2026-04-12T21:50:27Z", "mode": "train", "global_step": 1536, "epoch": 0.08083785063944003, "loss": 0.0556, "grad_norm": 17.375411987304688, "learning_rate": 5.348484848484848e-06, "num_tokens": 2711644.0, "completions/mean_length": 38.125, "completions/min_length": 35.0, "completions/max_length": 42.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 38.125, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 42.0, "rewards/meter/mean": 0.20822304487228394, "rewards/meter/std": 0.19521218538284302, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 0.9866071343421936, "rewards/lexical_plausibility/std": 0.03788072615861893, "rewards/judge_quality/mean": 0.5024999976158142, "rewards/judge_quality/std": 0.1348809152841568, "rewards/repeat_penalty/mean": 0.9726599454879761, "rewards/repeat_penalty/std": 0.02959694154560566, "rewards/repeat_floor/mean": 0.9969107508659363, "rewards/repeat_floor/std": 0.0026783111970871687, "rewards/near_duplicate_penalty/mean": 0.9896665811538696, "rewards/near_duplicate_penalty/std": 0.008280138485133648, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9828975200653076, "rewards/distinct_2/std": 0.031678035855293274, "rewards/total_composite/mean": 0.10866338759660721, "rewards/total_composite/std": 0.11096411943435669, "reward": 0.10866338759660721, "reward_std": 0.11096411943435669, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.20482344925403595, "sampling/sampling_logp_difference/max": 3.809886932373047, "sampling/importance_sampling_ratio/min": 0.022150682285428047, "sampling/importance_sampling_ratio/mean": 1.000345230102539, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0398316383361816, "clip_ratio/low_mean": 0.044513950822874904, "clip_ratio/low_min": 0.044513950822874904, "clip_ratio/high_mean": 0.05062741320580244, "clip_ratio/high_max": 0.05062741320580244, "clip_ratio/region_mean": 0.09514136402867734, "reward_total_mean": 0.10866338759660721, "reward_meter_mean": 0.20822304487228394, "reward_meter_std": 0.19521218538284302, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 0.9866071343421936, "reward_lexical_plausibility_std": 0.03788072615861893, "reward_repeat_penalty_mean": 0.9726599454879761, "reward_repeat_penalty_std": 0.02959694154560566, "reward_repeat_floor_mean": 0.9969107508659363, "reward_repeat_floor_std": 0.0026783111970871687, "reward_near_duplicate_penalty_mean": 0.9896665811538696, "reward_near_duplicate_penalty_std": 0.008280138485133648, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9828975200653076, "reward_distinct_2_std": 0.031678035855293274, "reward_judge_quality_mean": 0.5024999976158142, "reward_judge_quality_std": 0.1348809152841568, "reward_total_composite_mean": 0.10866338759660721, "reward_total_composite_std": 0.11096411943435669} {"timestamp_utc": "2026-04-12T21:50:40Z", "mode": "train", "global_step": 1537, "epoch": 0.08089047944845008, "loss": -0.0954, "grad_norm": 4.557192802429199, "learning_rate": 5.3454545454545455e-06, "num_tokens": 2713585.0, "completions/mean_length": 135.625, "completions/min_length": 70.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 81.85714721679688, "completions/min_terminated_length": 70.0, "completions/max_terminated_length": 94.0, "rewards/meter/mean": 0.5788543224334717, "rewards/meter/std": 0.25308576226234436, "rewards/count_adherence/mean": 0.7749999761581421, "rewards/count_adherence/std": 0.0707106739282608, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9325000047683716, "rewards/count_floor/std": 0.02121320553123951, "rewards/lexical_plausibility/mean": 0.9413644075393677, "rewards/lexical_plausibility/std": 0.1658465713262558, "rewards/judge_quality/mean": 0.4150000214576721, "rewards/judge_quality/std": 0.18031719326972961, "rewards/repeat_penalty/mean": 0.856420636177063, "rewards/repeat_penalty/std": 0.0703580304980278, "rewards/repeat_floor/mean": 0.9833903312683105, "rewards/repeat_floor/std": 0.008245175704360008, "rewards/near_duplicate_penalty/mean": 0.946567714214325, "rewards/near_duplicate_penalty/std": 0.03625441715121269, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9045015573501587, "rewards/distinct_2/std": 0.061601005494594574, "rewards/total_composite/mean": 0.20196250081062317, "rewards/total_composite/std": 0.10801875591278076, "reward": 0.20196250081062317, "reward_std": 0.10801874846220016, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15305712819099426, "sampling/sampling_logp_difference/max": 1.261347770690918, "sampling/importance_sampling_ratio/min": 0.28327199816703796, "sampling/importance_sampling_ratio/mean": 1.0075916051864624, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 1.0446966513991356, "clip_ratio/low_mean": 0.03248993679881096, "clip_ratio/low_min": 0.03248993679881096, "clip_ratio/high_mean": 0.10087534971535206, "clip_ratio/high_max": 0.10087534971535206, "clip_ratio/region_mean": 0.13336528651416302, "reward_total_mean": 0.20196250081062317, "reward_meter_mean": 0.5788543224334717, "reward_meter_std": 0.25308576226234436, "reward_count_adherence_mean": 0.7749999761581421, "reward_count_adherence_std": 0.0707106739282608, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9325000047683716, "reward_count_floor_std": 0.02121320553123951, "reward_lexical_plausibility_mean": 0.9413644075393677, "reward_lexical_plausibility_std": 0.1658465713262558, "reward_repeat_penalty_mean": 0.856420636177063, "reward_repeat_penalty_std": 0.0703580304980278, "reward_repeat_floor_mean": 0.9833903312683105, "reward_repeat_floor_std": 0.008245175704360008, "reward_near_duplicate_penalty_mean": 0.946567714214325, "reward_near_duplicate_penalty_std": 0.03625441715121269, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9045015573501587, "reward_distinct_2_std": 0.061601005494594574, "reward_judge_quality_mean": 0.4150000214576721, "reward_judge_quality_std": 0.18031719326972961, "reward_total_composite_mean": 0.20196250081062317, "reward_total_composite_std": 0.10801875591278076} {"timestamp_utc": "2026-04-12T21:50:52Z", "mode": "train", "global_step": 1538, "epoch": 0.08094310825746014, "loss": -0.1273, "grad_norm": 2.0342001914978027, "learning_rate": 5.342424242424244e-06, "num_tokens": 2715336.0, "completions/mean_length": 233.875, "completions/min_length": 56.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.375, "completions/mean_terminated_length": 67.0, "completions/min_terminated_length": 56.0, "completions/max_terminated_length": 84.0, "rewards/meter/mean": 0.6564201712608337, "rewards/meter/std": 0.28901103138923645, "rewards/count_adherence/mean": 0.9166666865348816, "rewards/count_adherence/std": 0.15430334210395813, "rewards/arabic_clean/mean": 0.625, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9750000238418579, "rewards/count_floor/std": 0.04629101976752281, "rewards/lexical_plausibility/mean": 0.8234190940856934, "rewards/lexical_plausibility/std": 0.24398906528949738, "rewards/judge_quality/mean": 0.39375001192092896, "rewards/judge_quality/std": 0.31057265400886536, "rewards/repeat_penalty/mean": 0.9463145732879639, "rewards/repeat_penalty/std": 0.03588086739182472, "rewards/repeat_floor/mean": 0.9932747483253479, "rewards/repeat_floor/std": 0.004338892176747322, "rewards/near_duplicate_penalty/mean": 0.969734787940979, "rewards/near_duplicate_penalty/std": 0.02084873802959919, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9757170081138611, "rewards/distinct_2/std": 0.02509191259741783, "rewards/total_composite/mean": 0.29934364557266235, "rewards/total_composite/std": 0.240284726023674, "reward": 0.29934364557266235, "reward_std": 0.24028471112251282, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15088796615600586, "sampling/sampling_logp_difference/max": 1.6127660274505615, "sampling/importance_sampling_ratio/min": 0.1993354707956314, "sampling/importance_sampling_ratio/mean": 1.037274956703186, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.719944953918457, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.07552995346486568, "clip_ratio/high_max": 0.07552995346486568, "clip_ratio/region_mean": 0.07552995346486568, "reward_total_mean": 0.29934364557266235, "reward_meter_mean": 0.6564201712608337, "reward_meter_std": 0.28901103138923645, "reward_count_adherence_mean": 0.9166666865348816, "reward_count_adherence_std": 0.15430334210395813, "reward_arabic_clean_mean": 0.625, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9750000238418579, "reward_count_floor_std": 0.04629101976752281, "reward_lexical_plausibility_mean": 0.8234190940856934, "reward_lexical_plausibility_std": 0.24398906528949738, "reward_repeat_penalty_mean": 0.9463145732879639, "reward_repeat_penalty_std": 0.03588086739182472, "reward_repeat_floor_mean": 0.9932747483253479, "reward_repeat_floor_std": 0.004338892176747322, "reward_near_duplicate_penalty_mean": 0.969734787940979, "reward_near_duplicate_penalty_std": 0.02084873802959919, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9757170081138611, "reward_distinct_2_std": 0.02509191259741783, "reward_judge_quality_mean": 0.39375001192092896, "reward_judge_quality_std": 0.31057265400886536, "reward_total_composite_mean": 0.29934364557266235, "reward_total_composite_std": 0.240284726023674} {"timestamp_utc": "2026-04-12T21:50:59Z", "mode": "train", "global_step": 1539, "epoch": 0.08099573706647019, "loss": 0.0604, "grad_norm": 10.385834693908691, "learning_rate": 5.33939393939394e-06, "num_tokens": 2717305.0, "completions/mean_length": 65.125, "completions/min_length": 58.0, "completions/max_length": 75.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.125, "completions/min_terminated_length": 58.0, "completions/max_terminated_length": 75.0, "rewards/meter/mean": 0.8148790597915649, "rewards/meter/std": 0.23742079734802246, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.35624998807907104, "rewards/judge_quality/std": 0.08798335492610931, "rewards/repeat_penalty/mean": 0.6886733770370483, "rewards/repeat_penalty/std": 0.15798814594745636, "rewards/repeat_floor/mean": 0.9628767371177673, "rewards/repeat_floor/std": 0.01890617609024048, "rewards/near_duplicate_penalty/mean": 0.8828556537628174, "rewards/near_duplicate_penalty/std": 0.052996646612882614, "rewards/opening_diversity/mean": 0.956250011920929, "rewards/opening_diversity/std": 0.09038607776165009, "rewards/distinct_2/mean": 0.8119268417358398, "rewards/distinct_2/std": 0.13330933451652527, "rewards/total_composite/mean": 0.27073222398757935, "rewards/total_composite/std": 0.10145965963602066, "reward": 0.27073222398757935, "reward_std": 0.10145965963602066, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13211476802825928, "sampling/sampling_logp_difference/max": 1.193953275680542, "sampling/importance_sampling_ratio/min": 0.3030209541320801, "sampling/importance_sampling_ratio/mean": 1.01863694190979, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.9416583776473999, "clip_ratio/low_mean": 0.07649038266390562, "clip_ratio/low_min": 0.07649038266390562, "clip_ratio/high_mean": 0.07816583476960659, "clip_ratio/high_max": 0.07816583476960659, "clip_ratio/region_mean": 0.1546562174335122, "reward_total_mean": 0.27073222398757935, "reward_meter_mean": 0.8148790597915649, "reward_meter_std": 0.23742079734802246, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.6886733770370483, "reward_repeat_penalty_std": 0.15798814594745636, "reward_repeat_floor_mean": 0.9628767371177673, "reward_repeat_floor_std": 0.01890617609024048, "reward_near_duplicate_penalty_mean": 0.8828556537628174, "reward_near_duplicate_penalty_std": 0.052996646612882614, "reward_opening_diversity_mean": 0.956250011920929, "reward_opening_diversity_std": 0.09038607776165009, "reward_distinct_2_mean": 0.8119268417358398, "reward_distinct_2_std": 0.13330933451652527, "reward_judge_quality_mean": 0.35624998807907104, "reward_judge_quality_std": 0.08798335492610931, "reward_total_composite_mean": 0.27073222398757935, "reward_total_composite_std": 0.10145965963602066} {"timestamp_utc": "2026-04-12T21:51:11Z", "mode": "train", "global_step": 1540, "epoch": 0.08104836587548024, "loss": -0.0652, "grad_norm": 3.296373128890991, "learning_rate": 5.336363636363637e-06, "num_tokens": 2718945.0, "completions/mean_length": 100.0, "completions/min_length": 37.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 41.142860412597656, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 43.0, "rewards/meter/mean": 0.8488795757293701, "rewards/meter/std": 0.24881407618522644, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9446155428886414, "rewards/lexical_plausibility/std": 0.15665094554424286, "rewards/judge_quality/mean": 0.6237499713897705, "rewards/judge_quality/std": 0.33907175064086914, "rewards/repeat_penalty/mean": 0.6673555374145508, "rewards/repeat_penalty/std": 0.18606480956077576, "rewards/repeat_floor/mean": 0.953986644744873, "rewards/repeat_floor/std": 0.026274489238858223, "rewards/near_duplicate_penalty/mean": 0.8011376857757568, "rewards/near_duplicate_penalty/std": 0.09802062064409256, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8201777338981628, "rewards/distinct_2/std": 0.1391981989145279, "rewards/total_composite/mean": 0.5084881782531738, "rewards/total_composite/std": 0.3138238191604614, "reward": 0.5084881782531738, "reward_std": 0.31382378935813904, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.1106218621134758, "sampling/sampling_logp_difference/max": 1.3291430473327637, "sampling/importance_sampling_ratio/min": 0.26470398902893066, "sampling/importance_sampling_ratio/mean": 1.0372222661972046, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6519262492656708, "clip_ratio/low_mean": 0.03848958807066083, "clip_ratio/low_min": 0.03848958807066083, "clip_ratio/high_mean": 0.03529640194028616, "clip_ratio/high_max": 0.03529640194028616, "clip_ratio/region_mean": 0.07378599001094699, "reward_total_mean": 0.5084881782531738, "reward_meter_mean": 0.8488795757293701, "reward_meter_std": 0.24881407618522644, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9446155428886414, "reward_lexical_plausibility_std": 0.15665094554424286, "reward_repeat_penalty_mean": 0.6673555374145508, "reward_repeat_penalty_std": 0.18606480956077576, "reward_repeat_floor_mean": 0.953986644744873, "reward_repeat_floor_std": 0.026274489238858223, "reward_near_duplicate_penalty_mean": 0.8011376857757568, "reward_near_duplicate_penalty_std": 0.09802062064409256, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8201777338981628, "reward_distinct_2_std": 0.1391981989145279, "reward_judge_quality_mean": 0.6237499713897705, "reward_judge_quality_std": 0.33907175064086914, "reward_total_composite_mean": 0.5084881782531738, "reward_total_composite_std": 0.3138238191604614} {"timestamp_utc": "2026-04-12T21:51:22Z", "mode": "train", "global_step": 1541, "epoch": 0.0811009946844903, "loss": 0.016, "grad_norm": 11.169768333435059, "learning_rate": 5.333333333333334e-06, "num_tokens": 2720765.0, "completions/mean_length": 58.5, "completions/min_length": 50.0, "completions/max_length": 66.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 58.5, "completions/min_terminated_length": 50.0, "completions/max_terminated_length": 66.0, "rewards/meter/mean": 0.29664599895477295, "rewards/meter/std": 0.31480297446250916, "rewards/count_adherence/mean": 0.9583333730697632, "rewards/count_adherence/std": 0.117851123213768, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.987500011920929, "rewards/count_floor/std": 0.0353553481400013, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4399999976158142, "rewards/judge_quality/std": 0.12906257808208466, "rewards/repeat_penalty/mean": 0.7345658540725708, "rewards/repeat_penalty/std": 0.15851762890815735, "rewards/repeat_floor/mean": 0.968478262424469, "rewards/repeat_floor/std": 0.018966805189847946, "rewards/near_duplicate_penalty/mean": 0.9067052602767944, "rewards/near_duplicate_penalty/std": 0.043794550001621246, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8052495718002319, "rewards/distinct_2/std": 0.14887332916259766, "rewards/total_composite/mean": 0.12190087139606476, "rewards/total_composite/std": 0.12960219383239746, "reward": 0.12190087139606476, "reward_std": 0.12960217893123627, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14092068374156952, "sampling/sampling_logp_difference/max": 1.8606610298156738, "sampling/importance_sampling_ratio/min": 0.1830008178949356, "sampling/importance_sampling_ratio/mean": 1.0127097368240356, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7807648330926895, "clip_ratio/low_mean": 0.07900669239461422, "clip_ratio/low_min": 0.07900669239461422, "clip_ratio/high_mean": 0.03483376791700721, "clip_ratio/high_max": 0.03483376791700721, "clip_ratio/region_mean": 0.11384046031162143, "reward_total_mean": 0.12190087139606476, "reward_meter_mean": 0.29664599895477295, "reward_meter_std": 0.31480297446250916, "reward_count_adherence_mean": 0.9583333730697632, "reward_count_adherence_std": 0.117851123213768, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.987500011920929, "reward_count_floor_std": 0.0353553481400013, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7345658540725708, "reward_repeat_penalty_std": 0.15851762890815735, "reward_repeat_floor_mean": 0.968478262424469, "reward_repeat_floor_std": 0.018966805189847946, "reward_near_duplicate_penalty_mean": 0.9067052602767944, "reward_near_duplicate_penalty_std": 0.043794550001621246, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8052495718002319, "reward_distinct_2_std": 0.14887332916259766, "reward_judge_quality_mean": 0.4399999976158142, "reward_judge_quality_std": 0.12906257808208466, "reward_total_composite_mean": 0.12190087139606476, "reward_total_composite_std": 0.12960219383239746} {"timestamp_utc": "2026-04-12T21:51:34Z", "mode": "train", "global_step": 1542, "epoch": 0.08115362349350035, "loss": -0.0495, "grad_norm": 1.1691104173660278, "learning_rate": 5.330303030303031e-06, "num_tokens": 2722148.0, "completions/mean_length": 333.875, "completions/min_length": 34.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.625, "completions/mean_terminated_length": 37.0, "completions/min_terminated_length": 34.0, "completions/max_terminated_length": 40.0, "rewards/meter/mean": 0.36853447556495667, "rewards/meter/std": 0.5003435611724854, "rewards/count_adherence/mean": 0.875, "rewards/count_adherence/std": 0.2314550280570984, "rewards/arabic_clean/mean": 0.375, "rewards/arabic_clean/std": 0.5175492167472839, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 0.981249988079071, "rewards/arabic_floor/std": 0.053033001720905304, "rewards/count_floor/mean": 0.9624999761581421, "rewards/count_floor/std": 0.06943649053573608, "rewards/lexical_plausibility/mean": 0.6625404357910156, "rewards/lexical_plausibility/std": 0.28458768129348755, "rewards/judge_quality/mean": 0.1887499988079071, "rewards/judge_quality/std": 0.1914931833744049, "rewards/repeat_penalty/mean": 0.8250202536582947, "rewards/repeat_penalty/std": 0.24050584435462952, "rewards/repeat_floor/mean": 0.9841594099998474, "rewards/repeat_floor/std": 0.0224430151283741, "rewards/near_duplicate_penalty/mean": 0.9556620121002197, "rewards/near_duplicate_penalty/std": 0.06206832081079483, "rewards/opening_diversity/mean": 0.90625, "rewards/opening_diversity/std": 0.12938730418682098, "rewards/distinct_2/mean": 0.9603902101516724, "rewards/distinct_2/std": 0.10834155976772308, "rewards/total_composite/mean": 0.14881381392478943, "rewards/total_composite/std": 0.2050238698720932, "reward": 0.14881381392478943, "reward_std": 0.2050238698720932, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13622038066387177, "sampling/sampling_logp_difference/max": 1.5734450817108154, "sampling/importance_sampling_ratio/min": 0.2073296755552292, "sampling/importance_sampling_ratio/mean": 0.995415449142456, "sampling/importance_sampling_ratio/max": 1.5963773727416992, "entropy": 0.3542150482535362, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/high_mean": 0.05432233866304159, "clip_ratio/high_max": 0.05432233866304159, "clip_ratio/region_mean": 0.05432233866304159, "reward_total_mean": 0.14881381392478943, "reward_meter_mean": 0.36853447556495667, "reward_meter_std": 0.5003435611724854, "reward_count_adherence_mean": 0.875, "reward_count_adherence_std": 0.2314550280570984, "reward_arabic_clean_mean": 0.375, "reward_arabic_clean_std": 0.5175492167472839, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 0.981249988079071, "reward_arabic_floor_std": 0.053033001720905304, "reward_count_floor_mean": 0.9624999761581421, "reward_count_floor_std": 0.06943649053573608, "reward_lexical_plausibility_mean": 0.6625404357910156, "reward_lexical_plausibility_std": 0.28458768129348755, "reward_repeat_penalty_mean": 0.8250202536582947, "reward_repeat_penalty_std": 0.24050584435462952, "reward_repeat_floor_mean": 0.9841594099998474, "reward_repeat_floor_std": 0.0224430151283741, "reward_near_duplicate_penalty_mean": 0.9556620121002197, "reward_near_duplicate_penalty_std": 0.06206832081079483, "reward_opening_diversity_mean": 0.90625, "reward_opening_diversity_std": 0.12938730418682098, "reward_distinct_2_mean": 0.9603902101516724, "reward_distinct_2_std": 0.10834155976772308, "reward_judge_quality_mean": 0.1887499988079071, "reward_judge_quality_std": 0.1914931833744049, "reward_total_composite_mean": 0.14881381392478943, "reward_total_composite_std": 0.2050238698720932} {"timestamp_utc": "2026-04-12T21:51:40Z", "mode": "train", "global_step": 1543, "epoch": 0.0812062523025104, "loss": 0.0231, "grad_norm": 19.730863571166992, "learning_rate": 5.327272727272727e-06, "num_tokens": 2723802.0, "completions/mean_length": 27.75, "completions/min_length": 26.0, "completions/max_length": 29.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 27.75, "completions/min_terminated_length": 26.0, "completions/max_terminated_length": 29.0, "rewards/meter/mean": 0.5575295090675354, "rewards/meter/std": 0.3906041383743286, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42750000953674316, "rewards/judge_quality/std": 0.013887302950024605, "rewards/repeat_penalty/mean": 0.9326024055480957, "rewards/repeat_penalty/std": 0.08621253073215485, "rewards/repeat_floor/mean": 0.990406334400177, "rewards/repeat_floor/std": 0.011759807355701923, "rewards/near_duplicate_penalty/mean": 0.9442841410636902, "rewards/near_duplicate_penalty/std": 0.06192629039287567, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9862637519836426, "rewards/distinct_2/std": 0.0388520210981369, "rewards/total_composite/mean": 0.23389223217964172, "rewards/total_composite/std": 0.16279156506061554, "reward": 0.23389223217964172, "reward_std": 0.16279156506061554, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13585558533668518, "sampling/sampling_logp_difference/max": 1.5361089706420898, "sampling/importance_sampling_ratio/min": 0.21521688997745514, "sampling/importance_sampling_ratio/mean": 1.0094985961914062, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7222808226943016, "clip_ratio/low_mean": 0.0888594202697277, "clip_ratio/low_min": 0.0888594202697277, "clip_ratio/high_mean": 0.06620598584413528, "clip_ratio/high_max": 0.06620598584413528, "clip_ratio/region_mean": 0.155065406113863, "reward_total_mean": 0.23389223217964172, "reward_meter_mean": 0.5575295090675354, "reward_meter_std": 0.3906041383743286, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9326024055480957, "reward_repeat_penalty_std": 0.08621253073215485, "reward_repeat_floor_mean": 0.990406334400177, "reward_repeat_floor_std": 0.011759807355701923, "reward_near_duplicate_penalty_mean": 0.9442841410636902, "reward_near_duplicate_penalty_std": 0.06192629039287567, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9862637519836426, "reward_distinct_2_std": 0.0388520210981369, "reward_judge_quality_mean": 0.42750000953674316, "reward_judge_quality_std": 0.013887302950024605, "reward_total_composite_mean": 0.23389223217964172, "reward_total_composite_std": 0.16279156506061554} {"timestamp_utc": "2026-04-12T21:51:53Z", "mode": "train", "global_step": 1544, "epoch": 0.08125888111152045, "loss": -0.0805, "grad_norm": 5.6606221199035645, "learning_rate": 5.324242424242425e-06, "num_tokens": 2726132.0, "completions/mean_length": 153.25, "completions/min_length": 90.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 102.00000762939453, "completions/min_terminated_length": 90.0, "completions/max_terminated_length": 114.0, "rewards/meter/mean": 0.5970669984817505, "rewards/meter/std": 0.40424844622612, "rewards/count_adherence/mean": 0.7291666269302368, "rewards/count_adherence/std": 0.1767766773700714, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.918749988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9492233991622925, "rewards/lexical_plausibility/std": 0.14361795783042908, "rewards/judge_quality/mean": 0.44874998927116394, "rewards/judge_quality/std": 0.2105392962694168, "rewards/repeat_penalty/mean": 0.8727701902389526, "rewards/repeat_penalty/std": 0.10709965974092484, "rewards/repeat_floor/mean": 0.9863566160202026, "rewards/repeat_floor/std": 0.010722039267420769, "rewards/near_duplicate_penalty/mean": 0.9649642705917358, "rewards/near_duplicate_penalty/std": 0.021786026656627655, "rewards/opening_diversity/mean": 0.9791666269302368, "rewards/opening_diversity/std": 0.0589255727827549, "rewards/distinct_2/mean": 0.9206880927085876, "rewards/distinct_2/std": 0.060860540717840195, "rewards/total_composite/mean": 0.20749783515930176, "rewards/total_composite/std": 0.16850578784942627, "reward": 0.20749783515930176, "reward_std": 0.16850577294826508, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.12931886315345764, "sampling/sampling_logp_difference/max": 2.968108654022217, "sampling/importance_sampling_ratio/min": 0.05140043795108795, "sampling/importance_sampling_ratio/mean": 1.0104999542236328, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6217343434691429, "clip_ratio/low_mean": 0.05353942792862654, "clip_ratio/low_min": 0.05353942792862654, "clip_ratio/high_mean": 0.06009184010326862, "clip_ratio/high_max": 0.06009184010326862, "clip_ratio/region_mean": 0.11363126803189516, "reward_total_mean": 0.20749783515930176, "reward_meter_mean": 0.5970669984817505, "reward_meter_std": 0.40424844622612, "reward_count_adherence_mean": 0.7291666269302368, "reward_count_adherence_std": 0.1767766773700714, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.918749988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9492233991622925, "reward_lexical_plausibility_std": 0.14361795783042908, "reward_repeat_penalty_mean": 0.8727701902389526, "reward_repeat_penalty_std": 0.10709965974092484, "reward_repeat_floor_mean": 0.9863566160202026, "reward_repeat_floor_std": 0.010722039267420769, "reward_near_duplicate_penalty_mean": 0.9649642705917358, "reward_near_duplicate_penalty_std": 0.021786026656627655, "reward_opening_diversity_mean": 0.9791666269302368, "reward_opening_diversity_std": 0.0589255727827549, "reward_distinct_2_mean": 0.9206880927085876, "reward_distinct_2_std": 0.060860540717840195, "reward_judge_quality_mean": 0.44874998927116394, "reward_judge_quality_std": 0.2105392962694168, "reward_total_composite_mean": 0.20749783515930176, "reward_total_composite_std": 0.16850578784942627} {"timestamp_utc": "2026-04-12T21:52:04Z", "mode": "train", "global_step": 1545, "epoch": 0.0813115099205305, "loss": 0.0558, "grad_norm": 13.716522216796875, "learning_rate": 5.321212121212122e-06, "num_tokens": 2727969.0, "completions/mean_length": 65.625, "completions/min_length": 54.0, "completions/max_length": 73.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 65.625, "completions/min_terminated_length": 54.0, "completions/max_terminated_length": 73.0, "rewards/meter/mean": 0.39185115694999695, "rewards/meter/std": 0.25724393129348755, "rewards/count_adherence/mean": 0.96875, "rewards/count_adherence/std": 0.0883883461356163, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.9906250238418579, "rewards/count_floor/std": 0.026516500860452652, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.41999998688697815, "rewards/judge_quality/std": 0.0, "rewards/repeat_penalty/mean": 0.9120625853538513, "rewards/repeat_penalty/std": 0.07507210969924927, "rewards/repeat_floor/mean": 0.9899458885192871, "rewards/repeat_floor/std": 0.008587034419178963, "rewards/near_duplicate_penalty/mean": 0.968421459197998, "rewards/near_duplicate_penalty/std": 0.031119329854846, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9409183859825134, "rewards/distinct_2/std": 0.056111954152584076, "rewards/total_composite/mean": 0.1604272872209549, "rewards/total_composite/std": 0.10421840846538544, "reward": 0.1604272872209549, "reward_std": 0.10421840846538544, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.14631056785583496, "sampling/sampling_logp_difference/max": 3.738355875015259, "sampling/importance_sampling_ratio/min": 0.023793190717697144, "sampling/importance_sampling_ratio/mean": 0.9791350364685059, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6832848936319351, "clip_ratio/low_mean": 0.04576245602220297, "clip_ratio/low_min": 0.04576245602220297, "clip_ratio/high_mean": 0.08005691785365343, "clip_ratio/high_max": 0.08005691785365343, "clip_ratio/region_mean": 0.1258193738758564, "reward_total_mean": 0.1604272872209549, "reward_meter_mean": 0.39185115694999695, "reward_meter_std": 0.25724393129348755, "reward_count_adherence_mean": 0.96875, "reward_count_adherence_std": 0.0883883461356163, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.9906250238418579, "reward_count_floor_std": 0.026516500860452652, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9120625853538513, "reward_repeat_penalty_std": 0.07507210969924927, "reward_repeat_floor_mean": 0.9899458885192871, "reward_repeat_floor_std": 0.008587034419178963, "reward_near_duplicate_penalty_mean": 0.968421459197998, "reward_near_duplicate_penalty_std": 0.031119329854846, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9409183859825134, "reward_distinct_2_std": 0.056111954152584076, "reward_judge_quality_mean": 0.41999998688697815, "reward_judge_quality_std": 0.0, "reward_total_composite_mean": 0.1604272872209549, "reward_total_composite_std": 0.10421840846538544} {"timestamp_utc": "2026-04-12T21:52:16Z", "mode": "train", "global_step": 1546, "epoch": 0.08136413872954056, "loss": -0.1122, "grad_norm": 4.126603603363037, "learning_rate": 5.318181818181819e-06, "num_tokens": 2730157.0, "completions/mean_length": 145.5, "completions/min_length": 89.0, "completions/max_length": 512.0, "completions/clipped_ratio": 0.125, "completions/mean_terminated_length": 93.14286041259766, "completions/min_terminated_length": 89.0, "completions/max_terminated_length": 102.0, "rewards/meter/mean": 0.8042241334915161, "rewards/meter/std": 0.30065563321113586, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 0.875, "rewards/arabic_clean/std": 0.3535533845424652, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 0.9537556767463684, "rewards/lexical_plausibility/std": 0.13079874217510223, "rewards/judge_quality/mean": 0.3737499713897705, "rewards/judge_quality/std": 0.13081474602222443, "rewards/repeat_penalty/mean": 0.7879989147186279, "rewards/repeat_penalty/std": 0.12193939834833145, "rewards/repeat_floor/mean": 0.9760335087776184, "rewards/repeat_floor/std": 0.014990242198109627, "rewards/near_duplicate_penalty/mean": 0.9388830661773682, "rewards/near_duplicate_penalty/std": 0.04608868807554245, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.8355673551559448, "rewards/distinct_2/std": 0.09226034581661224, "rewards/total_composite/mean": 0.2881458103656769, "rewards/total_composite/std": 0.15814697742462158, "reward": 0.2881458103656769, "reward_std": 0.15814697742462158, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.139773428440094, "sampling/sampling_logp_difference/max": 2.6370255947113037, "sampling/importance_sampling_ratio/min": 0.07157384604215622, "sampling/importance_sampling_ratio/mean": 1.0097938776016235, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.6622270792722702, "clip_ratio/low_mean": 0.03209064435213804, "clip_ratio/low_min": 0.03209064435213804, "clip_ratio/high_mean": 0.08805008511990309, "clip_ratio/high_max": 0.08805008511990309, "clip_ratio/region_mean": 0.12014072947204113, "reward_total_mean": 0.2881458103656769, "reward_meter_mean": 0.8042241334915161, "reward_meter_std": 0.30065563321113586, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 0.875, "reward_arabic_clean_std": 0.3535533845424652, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 0.9537556767463684, "reward_lexical_plausibility_std": 0.13079874217510223, "reward_repeat_penalty_mean": 0.7879989147186279, "reward_repeat_penalty_std": 0.12193939834833145, "reward_repeat_floor_mean": 0.9760335087776184, "reward_repeat_floor_std": 0.014990242198109627, "reward_near_duplicate_penalty_mean": 0.9388830661773682, "reward_near_duplicate_penalty_std": 0.04608868807554245, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.8355673551559448, "reward_distinct_2_std": 0.09226034581661224, "reward_judge_quality_mean": 0.3737499713897705, "reward_judge_quality_std": 0.13081474602222443, "reward_total_composite_mean": 0.2881458103656769, "reward_total_composite_std": 0.15814697742462158} {"timestamp_utc": "2026-04-12T21:52:22Z", "mode": "train", "global_step": 1547, "epoch": 0.08141676753855061, "loss": 0.0312, "grad_norm": 16.875259399414062, "learning_rate": 5.3151515151515155e-06, "num_tokens": 2731716.0, "completions/mean_length": 42.875, "completions/min_length": 37.0, "completions/max_length": 56.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 42.875, "completions/min_terminated_length": 37.0, "completions/max_terminated_length": 56.0, "rewards/meter/mean": 0.90336012840271, "rewards/meter/std": 0.2108646035194397, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.42750000953674316, "rewards/judge_quality/std": 0.013887302950024605, "rewards/repeat_penalty/mean": 0.8804962038993835, "rewards/repeat_penalty/std": 0.12388050556182861, "rewards/repeat_floor/mean": 0.986414909362793, "rewards/repeat_floor/std": 0.01430308073759079, "rewards/near_duplicate_penalty/mean": 0.9592976570129395, "rewards/near_duplicate_penalty/std": 0.05108080804347992, "rewards/opening_diversity/mean": 0.987500011920929, "rewards/opening_diversity/std": 0.0353553481400013, "rewards/distinct_2/mean": 0.9252249002456665, "rewards/distinct_2/std": 0.07454216480255127, "rewards/total_composite/mean": 0.37330663204193115, "rewards/total_composite/std": 0.08980835974216461, "reward": 0.37330663204193115, "reward_std": 0.08980835974216461, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15155208110809326, "sampling/sampling_logp_difference/max": 3.999438762664795, "sampling/importance_sampling_ratio/min": 0.018325921148061752, "sampling/importance_sampling_ratio/mean": 1.0104871988296509, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.7958294898271561, "clip_ratio/low_mean": 0.02589285746216774, "clip_ratio/low_min": 0.02589285746216774, "clip_ratio/high_mean": 0.10588439274579287, "clip_ratio/high_max": 0.10588439274579287, "clip_ratio/region_mean": 0.1317772502079606, "reward_total_mean": 0.37330663204193115, "reward_meter_mean": 0.90336012840271, "reward_meter_std": 0.2108646035194397, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8804962038993835, "reward_repeat_penalty_std": 0.12388050556182861, "reward_repeat_floor_mean": 0.986414909362793, "reward_repeat_floor_std": 0.01430308073759079, "reward_near_duplicate_penalty_mean": 0.9592976570129395, "reward_near_duplicate_penalty_std": 0.05108080804347992, "reward_opening_diversity_mean": 0.987500011920929, "reward_opening_diversity_std": 0.0353553481400013, "reward_distinct_2_mean": 0.9252249002456665, "reward_distinct_2_std": 0.07454216480255127, "reward_judge_quality_mean": 0.42750000953674316, "reward_judge_quality_std": 0.013887302950024605, "reward_total_composite_mean": 0.37330663204193115, "reward_total_composite_std": 0.08980835974216461} {"timestamp_utc": "2026-04-12T21:52:28Z", "mode": "train", "global_step": 1548, "epoch": 0.08146939634756066, "loss": 0.0933, "grad_norm": 15.812986373901367, "learning_rate": 5.312121212121213e-06, "num_tokens": 2733321.0, "completions/mean_length": 34.625, "completions/min_length": 31.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 34.625, "completions/min_terminated_length": 31.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.7568606734275818, "rewards/meter/std": 0.20686504244804382, "rewards/count_adherence/mean": 0.9375, "rewards/count_adherence/std": 0.1767766922712326, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 0.981249988079071, "rewards/count_floor/std": 0.053033001720905304, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4312500059604645, "rewards/judge_quality/std": 0.015526476316154003, "rewards/repeat_penalty/mean": 0.9419490098953247, "rewards/repeat_penalty/std": 0.06766816973686218, "rewards/repeat_floor/mean": 0.9926952719688416, "rewards/repeat_floor/std": 0.007710225880146027, "rewards/near_duplicate_penalty/mean": 0.9677453637123108, "rewards/near_duplicate_penalty/std": 0.025681620463728905, "rewards/opening_diversity/mean": 1.0, "rewards/opening_diversity/std": 0.0, "rewards/distinct_2/mean": 0.9725937843322754, "rewards/distinct_2/std": 0.0523630827665329, "rewards/total_composite/mean": 0.3215841054916382, "rewards/total_composite/std": 0.10116592794656754, "reward": 0.3215841054916382, "reward_std": 0.10116592049598694, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.09823382645845413, "sampling/sampling_logp_difference/max": 1.6047916412353516, "sampling/importance_sampling_ratio/min": 0.20093141496181488, "sampling/importance_sampling_ratio/mean": 1.0040779113769531, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.3879966586828232, "clip_ratio/low_mean": 0.018481182865798473, "clip_ratio/low_min": 0.018481182865798473, "clip_ratio/high_mean": 0.05277685262262821, "clip_ratio/high_max": 0.05277685262262821, "clip_ratio/region_mean": 0.07125803548842669, "reward_total_mean": 0.3215841054916382, "reward_meter_mean": 0.7568606734275818, "reward_meter_std": 0.20686504244804382, "reward_count_adherence_mean": 0.9375, "reward_count_adherence_std": 0.1767766922712326, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 0.981249988079071, "reward_count_floor_std": 0.053033001720905304, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.9419490098953247, "reward_repeat_penalty_std": 0.06766816973686218, "reward_repeat_floor_mean": 0.9926952719688416, "reward_repeat_floor_std": 0.007710225880146027, "reward_near_duplicate_penalty_mean": 0.9677453637123108, "reward_near_duplicate_penalty_std": 0.025681620463728905, "reward_opening_diversity_mean": 1.0, "reward_opening_diversity_std": 0.0, "reward_distinct_2_mean": 0.9725937843322754, "reward_distinct_2_std": 0.0523630827665329, "reward_judge_quality_mean": 0.4312500059604645, "reward_judge_quality_std": 0.015526476316154003, "reward_total_composite_mean": 0.3215841054916382, "reward_total_composite_std": 0.10116592794656754} {"timestamp_utc": "2026-04-12T21:52:35Z", "mode": "train", "global_step": 1549, "epoch": 0.08152202515657071, "loss": 0.0296, "grad_norm": 12.052055358886719, "learning_rate": 5.309090909090909e-06, "num_tokens": 2734856.0, "completions/mean_length": 44.875, "completions/min_length": 41.0, "completions/max_length": 48.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 44.875, "completions/min_terminated_length": 41.0, "completions/max_terminated_length": 48.0, "rewards/meter/mean": 0.47071734070777893, "rewards/meter/std": 0.3999786078929901, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.3987500071525574, "rewards/judge_quality/std": 0.06010407209396362, "rewards/repeat_penalty/mean": 0.7076892852783203, "rewards/repeat_penalty/std": 0.16064846515655518, "rewards/repeat_floor/mean": 0.9636876583099365, "rewards/repeat_floor/std": 0.01906200684607029, "rewards/near_duplicate_penalty/mean": 0.8726427555084229, "rewards/near_duplicate_penalty/std": 0.05706513300538063, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.8296248912811279, "rewards/distinct_2/std": 0.10697593539953232, "rewards/total_composite/mean": 0.18172188103199005, "rewards/total_composite/std": 0.16507014632225037, "reward": 0.18172188103199005, "reward_std": 0.16507014632225037, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13479001820087433, "sampling/sampling_logp_difference/max": 3.075570583343506, "sampling/importance_sampling_ratio/min": 0.04616328328847885, "sampling/importance_sampling_ratio/mean": 1.0149714946746826, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8421830460429192, "clip_ratio/low_mean": 0.09485042933374643, "clip_ratio/low_min": 0.09485042933374643, "clip_ratio/high_mean": 0.04511863738298416, "clip_ratio/high_max": 0.04511863738298416, "clip_ratio/region_mean": 0.1399690667167306, "reward_total_mean": 0.18172188103199005, "reward_meter_mean": 0.47071734070777893, "reward_meter_std": 0.3999786078929901, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.7076892852783203, "reward_repeat_penalty_std": 0.16064846515655518, "reward_repeat_floor_mean": 0.9636876583099365, "reward_repeat_floor_std": 0.01906200684607029, "reward_near_duplicate_penalty_mean": 0.8726427555084229, "reward_near_duplicate_penalty_std": 0.05706513300538063, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.8296248912811279, "reward_distinct_2_std": 0.10697593539953232, "reward_judge_quality_mean": 0.3987500071525574, "reward_judge_quality_std": 0.06010407209396362, "reward_total_composite_mean": 0.18172188103199005, "reward_total_composite_std": 0.16507014632225037} {"timestamp_utc": "2026-04-12T21:52:42Z", "mode": "train", "global_step": 1550, "epoch": 0.08157465396558077, "loss": -0.0245, "grad_norm": 12.013070106506348, "learning_rate": 5.306060606060606e-06, "num_tokens": 2736447.0, "completions/mean_length": 40.875, "completions/min_length": 35.0, "completions/max_length": 55.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 40.875, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 55.0, "rewards/meter/mean": 0.1458166390657425, "rewards/meter/std": 0.15230119228363037, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.5487500429153442, "rewards/judge_quality/std": 0.22937415540218353, "rewards/repeat_penalty/mean": 0.8864622116088867, "rewards/repeat_penalty/std": 0.13986869156360626, "rewards/repeat_floor/mean": 0.9862712025642395, "rewards/repeat_floor/std": 0.01546245813369751, "rewards/near_duplicate_penalty/mean": 0.9411143660545349, "rewards/near_duplicate_penalty/std": 0.0577935054898262, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9664342403411865, "rewards/distinct_2/std": 0.048219744116067886, "rewards/total_composite/mean": 0.06861890107393265, "rewards/total_composite/std": 0.06434255838394165, "reward": 0.06861890107393265, "reward_std": 0.06434255093336105, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.11489810049533844, "sampling/sampling_logp_difference/max": 1.5114288330078125, "sampling/importance_sampling_ratio/min": 0.22059455513954163, "sampling/importance_sampling_ratio/mean": 1.0160824060440063, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.8503337800502777, "clip_ratio/low_mean": 0.07352757221087813, "clip_ratio/low_min": 0.07352757221087813, "clip_ratio/high_mean": 0.025568182580173016, "clip_ratio/high_max": 0.025568182580173016, "clip_ratio/region_mean": 0.09909575479105115, "reward_total_mean": 0.06861890107393265, "reward_meter_mean": 0.1458166390657425, "reward_meter_std": 0.15230119228363037, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8864622116088867, "reward_repeat_penalty_std": 0.13986869156360626, "reward_repeat_floor_mean": 0.9862712025642395, "reward_repeat_floor_std": 0.01546245813369751, "reward_near_duplicate_penalty_mean": 0.9411143660545349, "reward_near_duplicate_penalty_std": 0.0577935054898262, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9664342403411865, "reward_distinct_2_std": 0.048219744116067886, "reward_judge_quality_mean": 0.5487500429153442, "reward_judge_quality_std": 0.22937415540218353, "reward_total_composite_mean": 0.06861890107393265, "reward_total_composite_std": 0.06434255838394165} {"timestamp_utc": "2026-04-12T21:54:29Z", "mode": "eval", "global_step": 1550, "epoch": 0.08157465396558077, "eval_loss": NaN, "eval_runtime": 106.5921, "eval_samples_per_second": 0.976, "eval_steps_per_second": 0.122, "eval_num_tokens": 2736447.0, "eval_completions/mean_length": 148.26923076923077, "eval_completions/min_length": 37.69230769230769, "eval_completions/max_length": 353.2307692307692, "eval_completions/clipped_ratio": 0.09615384615384616, "eval_completions/mean_terminated_length": 109.64001993032602, "eval_completions/min_terminated_length": 37.69230769230769, "eval_completions/max_terminated_length": 209.6153846153846, "eval_rewards/meter/mean": 0.5370853772530189, "eval_rewards/meter/std": 0.3735564396931575, "eval_rewards/count_adherence/mean": 0.7950394474543058, "eval_rewards/count_adherence/std": 0.1830053117412787, "eval_rewards/arabic_clean/mean": 0.8653846153846154, "eval_rewards/arabic_clean/std": 0.2755125302534837, "eval_rewards/hard_gate/mean": 0.9903846153846154, "eval_rewards/hard_gate/std": 0.027196414195574246, "eval_rewards/arabic_floor/mean": 0.9956730741720933, "eval_rewards/arabic_floor/std": 0.012238385012516608, "eval_rewards/count_floor/mean": 0.9385118301098163, "eval_rewards/count_floor/std": 0.05490159529906053, "eval_rewards/lexical_plausibility/mean": 0.9523813541118915, "eval_rewards/lexical_plausibility/std": 0.09585086657450749, "eval_rewards/judge_quality/mean": 0.43240384413645816, "eval_rewards/judge_quality/std": 0.16614713770552322, "eval_rewards/repeat_penalty/mean": 0.7907334153468792, "eval_rewards/repeat_penalty/std": 0.19797226843925622, "eval_rewards/repeat_floor/mean": 0.9776892845447247, "eval_rewards/repeat_floor/std": 0.021466942933889534, "eval_rewards/near_duplicate_penalty/mean": 0.9485286657626812, "eval_rewards/near_duplicate_penalty/std": 0.04545352521997232, "eval_rewards/opening_diversity/mean": 0.9847964552732614, "eval_rewards/opening_diversity/std": 0.040863610517520174, "eval_rewards/distinct_2/mean": 0.8480243361913241, "eval_rewards/distinct_2/std": 0.17115985401547873, "eval_rewards/total_composite/mean": 0.2187344225553366, "eval_rewards/total_composite/std": 0.1744088610777488, "eval_reward": 0.2187344225553366, "eval_reward_std": NaN, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.06427777701845536, "eval_sampling/sampling_logp_difference/max": 1.0461443937741792, "eval_sampling/importance_sampling_ratio/min": 0.355395835179549, "eval_sampling/importance_sampling_ratio/mean": 1.0153421805455134, "eval_sampling/importance_sampling_ratio/max": 1.4949395656585693, "eval_entropy": 0.6981543944432185, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.2187344225553366, "eval_reward_meter_mean": 0.5370853772530189, "eval_reward_meter_std": 0.3735564396931575, "eval_reward_count_adherence_mean": 0.7950394474543058, "eval_reward_count_adherence_std": 0.1830053117412787, "eval_reward_arabic_clean_mean": 0.8653846153846154, "eval_reward_arabic_clean_std": 0.2755125302534837, "eval_reward_hard_gate_mean": 0.9903846153846154, "eval_reward_hard_gate_std": 0.027196414195574246, "eval_reward_arabic_floor_mean": 0.9956730741720933, "eval_reward_arabic_floor_std": 0.012238385012516608, "eval_reward_count_floor_mean": 0.9385118301098163, "eval_reward_count_floor_std": 0.05490159529906053, "eval_reward_lexical_plausibility_mean": 0.9523813541118915, "eval_reward_lexical_plausibility_std": 0.09585086657450749, "eval_reward_repeat_penalty_mean": 0.7907334153468792, "eval_reward_repeat_penalty_std": 0.19797226843925622, "eval_reward_repeat_floor_mean": 0.9776892845447247, "eval_reward_repeat_floor_std": 0.021466942933889534, "eval_reward_near_duplicate_penalty_mean": 0.9485286657626812, "eval_reward_near_duplicate_penalty_std": 0.04545352521997232, "eval_reward_opening_diversity_mean": 0.9847964552732614, "eval_reward_opening_diversity_std": 0.040863610517520174, "eval_reward_distinct_2_mean": 0.8480243361913241, "eval_reward_distinct_2_std": 0.17115985401547873, "eval_reward_judge_quality_mean": 0.43240384413645816, "eval_reward_judge_quality_std": 0.16614713770552322, "eval_reward_total_composite_mean": 0.2187344225553366, "eval_reward_total_composite_std": 0.1744088610777488} {"timestamp_utc": "2026-04-12T21:54:43Z", "mode": "train", "global_step": 1551, "epoch": 0.08162728277459082, "loss": 0.024, "grad_norm": 11.444884300231934, "learning_rate": 5.303030303030303e-06, "num_tokens": 2738063.0, "completions/mean_length": 43.0, "completions/min_length": 39.0, "completions/max_length": 47.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 43.0, "completions/min_terminated_length": 39.0, "completions/max_terminated_length": 47.0, "rewards/meter/mean": 0.8957365155220032, "rewards/meter/std": 0.20929378271102905, "rewards/count_adherence/mean": 1.0, "rewards/count_adherence/std": 0.0, "rewards/arabic_clean/mean": 1.0, "rewards/arabic_clean/std": 0.0, "rewards/hard_gate/mean": 1.0, "rewards/hard_gate/std": 0.0, "rewards/arabic_floor/mean": 1.0, "rewards/arabic_floor/std": 0.0, "rewards/count_floor/mean": 1.0, "rewards/count_floor/std": 0.0, "rewards/lexical_plausibility/mean": 1.0, "rewards/lexical_plausibility/std": 0.0, "rewards/judge_quality/mean": 0.4950000047683716, "rewards/judge_quality/std": 0.13887304067611694, "rewards/repeat_penalty/mean": 0.8869351148605347, "rewards/repeat_penalty/std": 0.14403527975082397, "rewards/repeat_floor/mean": 0.9862526059150696, "rewards/repeat_floor/std": 0.016092751175165176, "rewards/near_duplicate_penalty/mean": 0.943255603313446, "rewards/near_duplicate_penalty/std": 0.05065969377756119, "rewards/opening_diversity/mean": 0.96875, "rewards/opening_diversity/std": 0.0883883461356163, "rewards/distinct_2/mean": 0.9626585245132446, "rewards/distinct_2/std": 0.045198049396276474, "rewards/total_composite/mean": 0.44593286514282227, "rewards/total_composite/std": 0.18317784368991852, "reward": 0.44593286514282227, "reward_std": 0.18317782878875732, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.13498082756996155, "sampling/sampling_logp_difference/max": 1.7982535362243652, "sampling/importance_sampling_ratio/min": 0.16558782756328583, "sampling/importance_sampling_ratio/mean": 0.9999086260795593, "sampling/importance_sampling_ratio/max": 2.0, "entropy": 0.872445285320282, "clip_ratio/low_mean": 0.09172903839498758, "clip_ratio/low_min": 0.09172903839498758, "clip_ratio/high_mean": 0.043604651466012, "clip_ratio/high_max": 0.043604651466012, "clip_ratio/region_mean": 0.13533368986099958, "reward_total_mean": 0.44593286514282227, "reward_meter_mean": 0.8957365155220032, "reward_meter_std": 0.20929378271102905, "reward_count_adherence_mean": 1.0, "reward_count_adherence_std": 0.0, "reward_arabic_clean_mean": 1.0, "reward_arabic_clean_std": 0.0, "reward_hard_gate_mean": 1.0, "reward_hard_gate_std": 0.0, "reward_arabic_floor_mean": 1.0, "reward_arabic_floor_std": 0.0, "reward_count_floor_mean": 1.0, "reward_count_floor_std": 0.0, "reward_lexical_plausibility_mean": 1.0, "reward_lexical_plausibility_std": 0.0, "reward_repeat_penalty_mean": 0.8869351148605347, "reward_repeat_penalty_std": 0.14403527975082397, "reward_repeat_floor_mean": 0.9862526059150696, "reward_repeat_floor_std": 0.016092751175165176, "reward_near_duplicate_penalty_mean": 0.943255603313446, "reward_near_duplicate_penalty_std": 0.05065969377756119, "reward_opening_diversity_mean": 0.96875, "reward_opening_diversity_std": 0.0883883461356163, "reward_distinct_2_mean": 0.9626585245132446, "reward_distinct_2_std": 0.045198049396276474, "reward_judge_quality_mean": 0.4950000047683716, "reward_judge_quality_std": 0.13887304067611694, "reward_total_composite_mean": 0.44593286514282227, "reward_total_composite_std": 0.18317784368991852}