{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 25.253968253968253, "eval_steps": 500, "global_step": 101, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 665.0, "completions/max_terminated_length": 665.0, "completions/mean_length": 276.375, "completions/mean_terminated_length": 294.8, "completions/min_length": 0.0, "completions/min_terminated_length": 10.0, "epoch": 0.25396825396825395, "format_failures": 0.0, "grad_norm": 0.0, "kl": 0.0, "learning_rate": 0.0, "loss": 0.0, "num_tokens": 22736.0, "reward": 0.0, "reward_std": 0.0, "step": 1 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 139.0, "completions/max_terminated_length": 139.0, "completions/mean_length": 97.875, "completions/mean_terminated_length": 104.4, "completions/min_length": 0.0, "completions/min_terminated_length": 58.0, "epoch": 0.5079365079365079, "format_failures": 0.0, "grad_norm": 0.0, "kl": 0.0, "learning_rate": 1e-06, "loss": 0.0, "num_tokens": 37248.0, "reward": 0.0, "reward_std": 0.0, "step": 2 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 99.0, "completions/max_terminated_length": 99.0, "completions/mean_length": 58.3125, "completions/mean_terminated_length": 62.2, "completions/min_length": 0.0, "completions/min_terminated_length": 19.0, "epoch": 0.7619047619047619, "format_failures": 0.0, "grad_norm": 0.6239897012710571, "kl": 0.0, "learning_rate": 1e-06, "loss": 0.0488, "num_tokens": 48928.0, "reward": 0.0625, "reward_std": 0.25, "step": 3 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 448.0, "completions/max_terminated_length": 448.0, "completions/mean_length": 152.25, "completions/mean_terminated_length": 162.4, "completions/min_length": 0.0, "completions/min_terminated_length": 32.0, "epoch": 1.0, "format_failures": 0.0, "grad_norm": 0.00910494290292263, "kl": 0.0008740964151608447, "learning_rate": 1e-06, "loss": 0.0, "num_tokens": 78400.0, "reward": 0.0, "reward_std": 0.0, "step": 4 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 142.0, "completions/max_terminated_length": 142.0, "completions/mean_length": 99.75, "completions/mean_terminated_length": 106.4, "completions/min_length": 0.0, "completions/min_terminated_length": 61.0, "epoch": 1.253968253968254, "format_failures": 0.0, "grad_norm": 0.027804767712950706, "kl": 0.007422657770803198, "learning_rate": 1e-06, "loss": 0.0, "num_tokens": 88208.0, "reward": 0.0, "reward_std": 0.0, "step": 5 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 205.0, "completions/max_terminated_length": 205.0, "completions/mean_length": 119.3125, "completions/mean_terminated_length": 127.26666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 13.0, "epoch": 1.507936507936508, "format_failures": 0.0, "grad_norm": 0.015325750224292278, "kl": 0.001977530526346527, "learning_rate": 1e-06, "loss": 0.0, "num_tokens": 105456.0, "reward": 0.0, "reward_std": 0.0, "step": 6 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 121.0, "completions/max_terminated_length": 121.0, "completions/mean_length": 96.8125, "completions/mean_terminated_length": 103.26666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 64.0, "epoch": 1.7619047619047619, "format_failures": 0.0, "grad_norm": 3.887850761413574, "kl": 0.027721889186068438, "learning_rate": 1e-06, "loss": 0.2321, "num_tokens": 115408.0, "reward": 0.3125, "reward_std": 0.4787135720252991, "step": 7 }, { "clip_ratio/high_max": 0.0001169590667511026, "clip_ratio/high_mean": 0.0001169590667511026, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0001169590667511026, "completions/clipped_ratio": 0.0625, "completions/max_length": 252.0, "completions/max_terminated_length": 252.0, "completions/mean_length": 109.3125, "completions/mean_terminated_length": 116.6, "completions/min_length": 0.0, "completions/min_terminated_length": 62.0, "epoch": 2.0, "format_failures": 0.0, "grad_norm": 2.351376533508301, "kl": 0.048536788175503415, "learning_rate": 1e-06, "loss": -0.2345, "num_tokens": 132016.0, "reward": 0.0, "reward_std": 0.0, "step": 8 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 214.0, "completions/max_terminated_length": 214.0, "completions/mean_length": 131.75, "completions/mean_terminated_length": 140.53333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 88.0, "epoch": 2.253968253968254, "format_failures": 0.0, "grad_norm": 0.10571439564228058, "kl": 0.019541691581252962, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 146160.0, "reward": 0.0, "reward_std": 0.0, "step": 9 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 266.0, "completions/max_terminated_length": 266.0, "completions/mean_length": 167.125, "completions/mean_terminated_length": 178.26666666666668, "completions/min_length": 0.0, "completions/min_terminated_length": 13.0, "epoch": 2.507936507936508, "format_failures": 0.0, "grad_norm": 0.6113560795783997, "kl": 0.10436955845216289, "learning_rate": 1e-06, "loss": -0.0099, "num_tokens": 158368.0, "reward": 0.0625, "reward_std": 0.25, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 8.202099706977606e-05, "clip_ratio/low_min": 8.202099706977606e-05, "clip_ratio/region_mean": 8.202099706977606e-05, "completions/clipped_ratio": 0.0625, "completions/max_length": 327.0, "completions/max_terminated_length": 327.0, "completions/mean_length": 106.1875, "completions/mean_terminated_length": 113.26666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 12.0, "epoch": 2.761904761904762, "format_failures": 0.0, "grad_norm": 0.5666631460189819, "kl": 0.008634787111077458, "learning_rate": 1e-06, "loss": 0.0319, "num_tokens": 172384.0, "reward": 0.0, "reward_std": 0.0, "step": 11 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 153.0, "completions/max_terminated_length": 153.0, "completions/mean_length": 111.625, "completions/mean_terminated_length": 119.06666666666666, "completions/min_length": 0.0, "completions/min_terminated_length": 81.0, "epoch": 3.0, "format_failures": 0.0, "grad_norm": 0.034009162336587906, "kl": 0.010358110535889864, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 183056.0, "reward": 0.0, "reward_std": 0.0, "step": 12 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 369.0, "completions/max_terminated_length": 369.0, "completions/mean_length": 210.25, "completions/mean_terminated_length": 224.26666666666668, "completions/min_length": 0.0, "completions/min_terminated_length": 11.0, "epoch": 3.253968253968254, "format_failures": 0.0, "grad_norm": 0.027124596759676933, "kl": 0.00558274841750972, "learning_rate": 1e-06, "loss": 0.0, "num_tokens": 202704.0, "reward": 0.0, "reward_std": 0.0, "step": 13 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 242.0, "completions/max_terminated_length": 242.0, "completions/mean_length": 110.75, "completions/mean_terminated_length": 118.13333333333334, "completions/min_length": 0.0, "completions/min_terminated_length": 58.0, "epoch": 3.507936507936508, "format_failures": 0.0, "grad_norm": 0.04654225707054138, "kl": 0.009354785172035918, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 215360.0, "reward": 0.0, "reward_std": 0.0, "step": 14 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 368.0, "completions/max_terminated_length": 368.0, "completions/mean_length": 187.25, "completions/mean_terminated_length": 199.73333333333332, "completions/min_length": 0.0, "completions/min_terminated_length": 48.0, "epoch": 3.761904761904762, "format_failures": 0.0, "grad_norm": 0.025890277698636055, "kl": 0.006430279521737248, "learning_rate": 1e-06, "loss": 0.0, "num_tokens": 235232.0, "reward": 0.0, "reward_std": 0.0, "step": 15 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 207.0, "completions/max_terminated_length": 207.0, "completions/mean_length": 104.3125, "completions/mean_terminated_length": 111.26666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 25.0, "epoch": 4.0, "format_failures": 0.0, "grad_norm": 17.46446990966797, "kl": 2.1008084091357886, "learning_rate": 1e-06, "loss": 0.0146, "num_tokens": 249392.0, "reward": 0.0, "reward_std": 0.0, "step": 16 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 181.0, "completions/max_terminated_length": 181.0, "completions/mean_length": 91.9375, "completions/mean_terminated_length": 98.06666666666666, "completions/min_length": 0.0, "completions/min_terminated_length": 22.0, "epoch": 4.253968253968254, "format_failures": 0.0, "grad_norm": 1.9208210706710815, "kl": 0.1223481697961688, "learning_rate": 1e-06, "loss": 0.1565, "num_tokens": 263392.0, "reward": 0.1875, "reward_std": 0.40311288833618164, "step": 17 }, { "clip_ratio/high_max": 8.457374497083947e-05, "clip_ratio/high_mean": 8.457374497083947e-05, "clip_ratio/low_mean": 0.006184228113852441, "clip_ratio/low_min": 0.006184228113852441, "clip_ratio/region_mean": 0.006268801858823281, "completions/clipped_ratio": 0.0625, "completions/max_length": 82.0, "completions/max_terminated_length": 82.0, "completions/mean_length": 57.75, "completions/mean_terminated_length": 61.6, "completions/min_length": 0.0, "completions/min_terminated_length": 50.0, "epoch": 4.507936507936508, "format_failures": 0.0, "grad_norm": 34.006935119628906, "kl": 0.015155487519223243, "learning_rate": 1e-06, "loss": -0.0887, "num_tokens": 275856.0, "reward": 0.0, "reward_std": 0.0, "step": 18 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 49.0, "completions/max_terminated_length": 49.0, "completions/mean_length": 35.9375, "completions/mean_terminated_length": 38.333333333333336, "completions/min_length": 0.0, "completions/min_terminated_length": 25.0, "epoch": 4.761904761904762, "format_failures": 0.0, "grad_norm": 1.5219846963882446, "kl": 0.019688607892021537, "learning_rate": 1e-06, "loss": 0.0281, "num_tokens": 284704.0, "reward": 0.25, "reward_std": 0.4472135901451111, "step": 19 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0007362068475534519, "clip_ratio/low_min": 0.0007362068475534519, "clip_ratio/region_mean": 0.0007362068475534519, "completions/clipped_ratio": 0.0625, "completions/max_length": 264.0, "completions/max_terminated_length": 264.0, "completions/mean_length": 135.9375, "completions/mean_terminated_length": 145.0, "completions/min_length": 0.0, "completions/min_terminated_length": 43.0, "epoch": 5.0, "format_failures": 0.0, "grad_norm": 1.0913934707641602, "kl": 0.029944764946897826, "learning_rate": 1e-06, "loss": 0.0151, "num_tokens": 314464.0, "reward": 0.0, "reward_std": 0.0, "step": 20 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 110.0, "completions/max_terminated_length": 110.0, "completions/mean_length": 77.4375, "completions/mean_terminated_length": 82.6, "completions/min_length": 0.0, "completions/min_terminated_length": 59.0, "epoch": 5.253968253968254, "format_failures": 0.0, "grad_norm": 9.293010711669922, "kl": 0.02249111421406269, "learning_rate": 1e-06, "loss": -0.6992, "num_tokens": 327184.0, "reward": 0.4375, "reward_std": 0.5123475193977356, "step": 21 }, { "clip_ratio/high_max": 0.0025167784187942743, "clip_ratio/high_mean": 0.0025167784187942743, "clip_ratio/low_mean": 0.00016538558702450246, "clip_ratio/low_min": 0.00016538558702450246, "clip_ratio/region_mean": 0.002682164005818777, "completions/clipped_ratio": 0.0625, "completions/max_length": 65.0, "completions/max_terminated_length": 65.0, "completions/mean_length": 47.4375, "completions/mean_terminated_length": 50.6, "completions/min_length": 0.0, "completions/min_terminated_length": 35.0, "epoch": 5.507936507936508, "format_failures": 0.0, "grad_norm": 27.128433227539062, "kl": 0.027446542168036103, "learning_rate": 1e-06, "loss": 0.7185, "num_tokens": 336560.0, "reward": 0.625, "reward_std": 0.5, "step": 22 }, { "clip_ratio/high_max": 0.0006745700666215271, "clip_ratio/high_mean": 0.0006745700666215271, "clip_ratio/low_mean": 0.00011241007450735196, "clip_ratio/low_min": 0.00011241007450735196, "clip_ratio/region_mean": 0.000786980141128879, "completions/clipped_ratio": 0.0625, "completions/max_length": 297.0, "completions/max_terminated_length": 297.0, "completions/mean_length": 143.5, "completions/mean_terminated_length": 153.06666666666666, "completions/min_length": 0.0, "completions/min_terminated_length": 73.0, "epoch": 5.761904761904762, "format_failures": 0.0, "grad_norm": 3.3996734619140625, "kl": 0.020090113976038992, "learning_rate": 1e-06, "loss": 0.0766, "num_tokens": 352416.0, "reward": 0.0, "reward_std": 0.0, "step": 23 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 230.0, "completions/max_terminated_length": 230.0, "completions/mean_length": 144.6875, "completions/mean_terminated_length": 154.33333333333334, "completions/min_length": 0.0, "completions/min_terminated_length": 29.0, "epoch": 6.0, "format_failures": 0.0, "grad_norm": 0.08405597507953644, "kl": 0.03500692130376895, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 363024.0, "reward": 0.0, "reward_std": 0.0, "step": 24 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 301.0, "completions/max_terminated_length": 301.0, "completions/mean_length": 153.4375, "completions/mean_terminated_length": 163.66666666666666, "completions/min_length": 0.0, "completions/min_terminated_length": 77.0, "epoch": 6.253968253968254, "format_failures": 0.0, "grad_norm": 0.022021738812327385, "kl": 0.018270340806338936, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 390864.0, "reward": 0.0, "reward_std": 0.0, "step": 25 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 333.0, "completions/max_terminated_length": 333.0, "completions/mean_length": 132.4375, "completions/mean_terminated_length": 141.26666666666668, "completions/min_length": 0.0, "completions/min_terminated_length": 33.0, "epoch": 6.507936507936508, "format_failures": 0.0, "grad_norm": 0.020903538912534714, "kl": 0.012982526037376374, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 418560.0, "reward": 0.0, "reward_std": 0.0, "step": 26 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 83.0, "completions/max_terminated_length": 83.0, "completions/mean_length": 52.1875, "completions/mean_terminated_length": 55.666666666666664, "completions/min_length": 0.0, "completions/min_terminated_length": 38.0, "epoch": 6.761904761904762, "format_failures": 0.0, "grad_norm": 10.148234367370605, "kl": 0.09406626483541913, "learning_rate": 1e-06, "loss": 0.7965, "num_tokens": 427952.0, "reward": 0.125, "reward_std": 0.34156501293182373, "step": 27 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.012265220284461975, "clip_ratio/low_min": 0.012265220284461975, "clip_ratio/region_mean": 0.012265220284461975, "completions/clipped_ratio": 0.0625, "completions/max_length": 464.0, "completions/max_terminated_length": 464.0, "completions/mean_length": 236.0625, "completions/mean_terminated_length": 251.8, "completions/min_length": 0.0, "completions/min_terminated_length": 87.0, "epoch": 7.0, "format_failures": 0.0, "grad_norm": 9.10987377166748, "kl": 0.11148038748651742, "learning_rate": 1e-06, "loss": -0.7463, "num_tokens": 446016.0, "reward": 0.0, "reward_std": 0.0, "step": 28 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 317.0, "completions/max_terminated_length": 317.0, "completions/mean_length": 194.8125, "completions/mean_terminated_length": 207.8, "completions/min_length": 0.0, "completions/min_terminated_length": 131.0, "epoch": 7.253968253968254, "format_failures": 0.0, "grad_norm": 0.05164807662367821, "kl": 0.01807517616543919, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 464752.0, "reward": 0.0, "reward_std": 0.0, "step": 29 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 305.0, "completions/max_terminated_length": 305.0, "completions/mean_length": 157.875, "completions/mean_terminated_length": 168.4, "completions/min_length": 0.0, "completions/min_terminated_length": 79.0, "epoch": 7.507936507936508, "format_failures": 0.0, "grad_norm": 0.13428564369678497, "kl": 0.06917369592702016, "learning_rate": 1e-06, "loss": 0.0003, "num_tokens": 478688.0, "reward": 0.0, "reward_std": 0.0, "step": 30 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 255.0, "completions/max_terminated_length": 255.0, "completions/mean_length": 101.75, "completions/mean_terminated_length": 108.53333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 36.0, "epoch": 7.761904761904762, "format_failures": 0.0, "grad_norm": 0.15431025624275208, "kl": 0.09932309354189783, "learning_rate": 1e-06, "loss": 0.0004, "num_tokens": 501280.0, "reward": 0.0, "reward_std": 0.0, "step": 31 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 171.0, "completions/max_terminated_length": 171.0, "completions/mean_length": 109.25, "completions/mean_terminated_length": 116.53333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 33.0, "epoch": 8.0, "format_failures": 1.0, "grad_norm": 0.021301815286278725, "kl": 0.01325891592229406, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 513984.0, "reward": 0.0, "reward_std": 0.0, "step": 32 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 80.0, "completions/max_terminated_length": 80.0, "completions/mean_length": 47.1875, "completions/mean_terminated_length": 50.333333333333336, "completions/min_length": 0.0, "completions/min_terminated_length": 21.0, "epoch": 8.253968253968253, "format_failures": 0.0, "grad_norm": 4.501058578491211, "kl": 0.017066957632778212, "learning_rate": 1e-06, "loss": -0.3348, "num_tokens": 523024.0, "reward": 0.0625, "reward_std": 0.25, "step": 33 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 114.0, "completions/max_terminated_length": 114.0, "completions/mean_length": 46.875, "completions/mean_terminated_length": 50.0, "completions/min_length": 0.0, "completions/min_terminated_length": 27.0, "epoch": 8.507936507936508, "format_failures": 0.0, "grad_norm": 8.798986434936523, "kl": 0.02613362204283476, "learning_rate": 1e-06, "loss": -0.013, "num_tokens": 531648.0, "reward": 0.0625, "reward_std": 0.25, "step": 34 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0010320087167201564, "clip_ratio/low_min": 0.0010320087167201564, "clip_ratio/region_mean": 0.0010320087167201564, "completions/clipped_ratio": 0.0625, "completions/max_length": 182.0, "completions/max_terminated_length": 182.0, "completions/mean_length": 107.3125, "completions/mean_terminated_length": 114.46666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 8.0, "epoch": 8.761904761904763, "format_failures": 1.0, "grad_norm": 4.402477741241455, "kl": 0.07807486248202622, "learning_rate": 1e-06, "loss": 0.3323, "num_tokens": 547184.0, "reward": 0.0, "reward_std": 0.0, "step": 35 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 461.0, "completions/max_terminated_length": 461.0, "completions/mean_length": 279.9375, "completions/mean_terminated_length": 298.6, "completions/min_length": 0.0, "completions/min_terminated_length": 73.0, "epoch": 9.0, "format_failures": 0.0, "grad_norm": 0.0339028425514698, "kl": 0.023383582755923272, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 566992.0, "reward": 0.0, "reward_std": 0.0, "step": 36 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 244.0, "completions/max_terminated_length": 244.0, "completions/mean_length": 137.3125, "completions/mean_terminated_length": 146.46666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 79.0, "epoch": 9.253968253968253, "format_failures": 0.0, "grad_norm": 0.033171769231557846, "kl": 0.014024579228134826, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 584192.0, "reward": 0.0, "reward_std": 0.0, "step": 37 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 699.0, "completions/max_terminated_length": 699.0, "completions/mean_length": 237.625, "completions/mean_terminated_length": 253.46666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 94.0, "epoch": 9.507936507936508, "format_failures": 1.0, "grad_norm": 0.037671465426683426, "kl": 0.024475683574564755, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 615968.0, "reward": 0.0, "reward_std": 0.0, "step": 38 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 133.0, "completions/max_terminated_length": 133.0, "completions/mean_length": 91.75, "completions/mean_terminated_length": 97.86666666666666, "completions/min_length": 0.0, "completions/min_terminated_length": 63.0, "epoch": 9.761904761904763, "format_failures": 0.0, "grad_norm": 0.05116966739296913, "kl": 0.02751793432980776, "learning_rate": 1e-06, "loss": 0.0002, "num_tokens": 627312.0, "reward": 0.0, "reward_std": 0.0, "step": 39 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 290.0, "completions/max_terminated_length": 290.0, "completions/mean_length": 139.8125, "completions/mean_terminated_length": 149.13333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 56.0, "epoch": 10.0, "format_failures": 0.0, "grad_norm": 0.05719411000609398, "kl": 0.019113542636235555, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 647440.0, "reward": 0.0, "reward_std": 0.0, "step": 40 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 119.0, "completions/max_terminated_length": 119.0, "completions/mean_length": 56.0625, "completions/mean_terminated_length": 59.8, "completions/min_length": 0.0, "completions/min_terminated_length": 24.0, "epoch": 10.253968253968253, "format_failures": 0.0, "grad_norm": 0.18934498727321625, "kl": 0.0771093814400956, "learning_rate": 1e-06, "loss": 0.0006, "num_tokens": 656912.0, "reward": 0.0, "reward_std": 0.0, "step": 41 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 228.0, "completions/max_terminated_length": 228.0, "completions/mean_length": 112.0625, "completions/mean_terminated_length": 119.53333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 63.0, "epoch": 10.507936507936508, "format_failures": 0.0, "grad_norm": 1.5895411968231201, "kl": 0.17962801060639322, "learning_rate": 1e-06, "loss": 0.0015, "num_tokens": 673904.0, "reward": 0.0, "reward_std": 0.0, "step": 42 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 80.0, "completions/max_terminated_length": 80.0, "completions/mean_length": 41.0625, "completions/mean_terminated_length": 43.8, "completions/min_length": 0.0, "completions/min_terminated_length": 26.0, "epoch": 10.761904761904763, "format_failures": 0.0, "grad_norm": 4.509499549865723, "kl": 0.284222204471007, "learning_rate": 1e-06, "loss": 0.0707, "num_tokens": 680624.0, "reward": 0.1875, "reward_std": 0.40311288833618164, "step": 43 }, { "clip_ratio/high_max": 0.0006896200279394786, "clip_ratio/high_mean": 0.0006896200279394786, "clip_ratio/low_mean": 0.003340191673487425, "clip_ratio/low_min": 0.003340191673487425, "clip_ratio/region_mean": 0.004029811701426903, "completions/clipped_ratio": 0.0625, "completions/max_length": 112.0, "completions/max_terminated_length": 112.0, "completions/mean_length": 59.125, "completions/mean_terminated_length": 63.06666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 26.0, "epoch": 11.0, "format_failures": 0.0, "grad_norm": 455.12982177734375, "kl": 0.034990839660167694, "learning_rate": 1e-06, "loss": -0.8143, "num_tokens": 691072.0, "reward": 0.3125, "reward_std": 0.4787135720252991, "step": 44 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 267.0, "completions/max_terminated_length": 267.0, "completions/mean_length": 108.1875, "completions/mean_terminated_length": 115.4, "completions/min_length": 0.0, "completions/min_terminated_length": 10.0, "epoch": 11.253968253968253, "format_failures": 1.0, "grad_norm": 12.396150588989258, "kl": 0.06138791353441775, "learning_rate": 1e-06, "loss": 0.8318, "num_tokens": 704928.0, "reward": 0.0, "reward_std": 0.0, "step": 45 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 153.0, "completions/max_terminated_length": 153.0, "completions/mean_length": 115.0, "completions/mean_terminated_length": 122.66666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 99.0, "epoch": 11.507936507936508, "format_failures": 0.0, "grad_norm": 1.9137173891067505, "kl": 0.056354429107159376, "learning_rate": 1e-06, "loss": -0.1355, "num_tokens": 719024.0, "reward": 0.3125, "reward_std": 0.4787135720252991, "step": 46 }, { "clip_ratio/high_max": 0.004244770854711533, "clip_ratio/high_mean": 0.004244770854711533, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.004244770854711533, "completions/clipped_ratio": 0.0625, "completions/max_length": 210.0, "completions/max_terminated_length": 210.0, "completions/mean_length": 111.0, "completions/mean_terminated_length": 118.4, "completions/min_length": 0.0, "completions/min_terminated_length": 48.0, "epoch": 11.761904761904763, "format_failures": 0.0, "grad_norm": 10.705756187438965, "kl": 0.08992354874499142, "learning_rate": 1e-06, "loss": 0.1795, "num_tokens": 731408.0, "reward": 0.0, "reward_std": 0.0, "step": 47 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 678.0, "completions/max_terminated_length": 678.0, "completions/mean_length": 349.625, "completions/mean_terminated_length": 372.93333333333334, "completions/min_length": 0.0, "completions/min_terminated_length": 12.0, "epoch": 12.0, "format_failures": 0.0, "grad_norm": 0.09272541850805283, "kl": 0.04150041143099467, "learning_rate": 1e-06, "loss": 0.0002, "num_tokens": 758336.0, "reward": 0.0, "reward_std": 0.0, "step": 48 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 194.0, "completions/max_terminated_length": 194.0, "completions/mean_length": 125.1875, "completions/mean_terminated_length": 133.53333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 50.0, "epoch": 12.253968253968253, "format_failures": 0.0, "grad_norm": 0.044424690306186676, "kl": 0.04540446569444612, "learning_rate": 1e-06, "loss": 0.0002, "num_tokens": 769680.0, "reward": 0.0, "reward_std": 0.0, "step": 49 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 261.0, "completions/max_terminated_length": 261.0, "completions/mean_length": 134.8125, "completions/mean_terminated_length": 143.8, "completions/min_length": 0.0, "completions/min_terminated_length": 79.0, "epoch": 12.507936507936508, "format_failures": 1.0, "grad_norm": 0.08100968599319458, "kl": 0.06305814487859607, "learning_rate": 1e-06, "loss": 0.0003, "num_tokens": 782512.0, "reward": 0.0, "reward_std": 0.0, "step": 50 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 338.0, "completions/max_terminated_length": 338.0, "completions/mean_length": 160.5625, "completions/mean_terminated_length": 171.26666666666668, "completions/min_length": 0.0, "completions/min_terminated_length": 8.0, "epoch": 12.761904761904763, "format_failures": 0.0, "grad_norm": 0.16642452776432037, "kl": 0.11695835692808032, "learning_rate": 1e-06, "loss": 0.0006, "num_tokens": 803328.0, "reward": 0.0, "reward_std": 0.0, "step": 51 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 235.0, "completions/max_terminated_length": 235.0, "completions/mean_length": 104.375, "completions/mean_terminated_length": 111.33333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 10.0, "epoch": 13.0, "format_failures": 0.0, "grad_norm": 0.850618302822113, "kl": 0.022090583418806393, "learning_rate": 1e-06, "loss": 0.0922, "num_tokens": 818832.0, "reward": 0.0625, "reward_std": 0.25, "step": 52 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.009608949825633317, "clip_ratio/low_min": 0.009608949825633317, "clip_ratio/region_mean": 0.009608949825633317, "completions/clipped_ratio": 0.0625, "completions/max_length": 130.0, "completions/max_terminated_length": 130.0, "completions/mean_length": 44.375, "completions/mean_terminated_length": 47.333333333333336, "completions/min_length": 0.0, "completions/min_terminated_length": 16.0, "epoch": 13.253968253968253, "format_failures": 0.0, "grad_norm": 11.197678565979004, "kl": 1.2457582973875105, "learning_rate": 1e-06, "loss": 0.4317, "num_tokens": 831808.0, "reward": 0.1875, "reward_std": 0.40311288833618164, "step": 53 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.005604438076261431, "clip_ratio/low_min": 0.005604438076261431, "clip_ratio/region_mean": 0.005604438076261431, "completions/clipped_ratio": 0.0625, "completions/max_length": 288.0, "completions/max_terminated_length": 288.0, "completions/mean_length": 148.125, "completions/mean_terminated_length": 158.0, "completions/min_length": 0.0, "completions/min_terminated_length": 62.0, "epoch": 13.507936507936508, "format_failures": 0.0, "grad_norm": 7.619630813598633, "kl": 0.23112019221298397, "learning_rate": 1e-06, "loss": -0.3716, "num_tokens": 862560.0, "reward": 0.0, "reward_std": 0.0, "step": 54 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 153.0, "completions/max_terminated_length": 153.0, "completions/mean_length": 83.9375, "completions/mean_terminated_length": 89.53333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 47.0, "epoch": 13.761904761904763, "format_failures": 1.0, "grad_norm": 5.286879062652588, "kl": 0.028535732359159738, "learning_rate": 1e-06, "loss": -0.5204, "num_tokens": 875008.0, "reward": 0.375, "reward_std": 0.5, "step": 55 }, { "clip_ratio/high_max": 0.00908001313606898, "clip_ratio/high_mean": 0.00908001313606898, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.00908001313606898, "completions/clipped_ratio": 0.0625, "completions/max_length": 424.0, "completions/max_terminated_length": 424.0, "completions/mean_length": 206.3125, "completions/mean_terminated_length": 220.06666666666666, "completions/min_length": 0.0, "completions/min_terminated_length": 24.0, "epoch": 14.0, "format_failures": 0.0, "grad_norm": 17.0450382232666, "kl": 0.034834427386522294, "learning_rate": 1e-06, "loss": 0.5368, "num_tokens": 893232.0, "reward": 0.0, "reward_std": 0.0, "step": 56 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 96.0, "completions/max_terminated_length": 96.0, "completions/mean_length": 45.5625, "completions/mean_terminated_length": 48.6, "completions/min_length": 0.0, "completions/min_terminated_length": 24.0, "epoch": 14.253968253968253, "format_failures": 0.0, "grad_norm": 0.06872344762086868, "kl": 0.046935660880990326, "learning_rate": 1e-06, "loss": 0.0002, "num_tokens": 901600.0, "reward": 0.0, "reward_std": 0.0, "step": 57 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 340.0, "completions/max_terminated_length": 340.0, "completions/mean_length": 155.875, "completions/mean_terminated_length": 166.26666666666668, "completions/min_length": 0.0, "completions/min_terminated_length": 33.0, "epoch": 14.507936507936508, "format_failures": 2.0, "grad_norm": 0.1746269166469574, "kl": 0.0729390918277204, "learning_rate": 1e-06, "loss": 0.0007, "num_tokens": 921280.0, "reward": 0.0, "reward_std": 0.0, "step": 58 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 170.0, "completions/max_terminated_length": 170.0, "completions/mean_length": 105.5, "completions/mean_terminated_length": 112.53333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 11.0, "epoch": 14.761904761904763, "format_failures": 0.0, "grad_norm": 0.08161845058202744, "kl": 0.044434796436689794, "learning_rate": 1e-06, "loss": 0.0002, "num_tokens": 935568.0, "reward": 0.0, "reward_std": 0.0, "step": 59 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 209.0, "completions/max_terminated_length": 209.0, "completions/mean_length": 121.5, "completions/mean_terminated_length": 129.6, "completions/min_length": 0.0, "completions/min_terminated_length": 64.0, "epoch": 15.0, "format_failures": 0.0, "grad_norm": 0.0943199172616005, "kl": 0.04711759239435196, "learning_rate": 1e-06, "loss": 0.0003, "num_tokens": 951120.0, "reward": 0.0, "reward_std": 0.0, "step": 60 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 139.0, "completions/max_terminated_length": 139.0, "completions/mean_length": 62.375, "completions/mean_terminated_length": 66.53333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 22.0, "epoch": 15.253968253968253, "format_failures": 0.0, "grad_norm": 0.32427987456321716, "kl": 0.06473073433153331, "learning_rate": 1e-06, "loss": 0.0005, "num_tokens": 961216.0, "reward": 0.0, "reward_std": 0.0, "step": 61 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 329.0, "completions/max_terminated_length": 329.0, "completions/mean_length": 168.1875, "completions/mean_terminated_length": 179.4, "completions/min_length": 0.0, "completions/min_terminated_length": 12.0, "epoch": 15.507936507936508, "format_failures": 0.0, "grad_norm": 0.10112172365188599, "kl": 0.05575458041857928, "learning_rate": 1e-06, "loss": 0.0004, "num_tokens": 978320.0, "reward": 0.0, "reward_std": 0.0, "step": 62 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 297.0, "completions/max_terminated_length": 297.0, "completions/mean_length": 129.1875, "completions/mean_terminated_length": 137.8, "completions/min_length": 0.0, "completions/min_terminated_length": 38.0, "epoch": 15.761904761904763, "format_failures": 0.0, "grad_norm": 0.0323491133749485, "kl": 0.02677349653095007, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1001872.0, "reward": 0.0, "reward_std": 0.0, "step": 63 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "epoch": 16.0, "grad_norm": 0.024694204330444336, "kl": 0.01919245710596442, "learning_rate": 1e-06, "loss": 0.0001, "step": 64 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 441.0, "completions/max_terminated_length": 441.0, "completions/mean_length": 131.25, "completions/mean_terminated_length": 140.0, "completions/min_length": 0.0, "completions/min_terminated_length": 8.0, "epoch": 16.253968253968253, "format_failures": 0.0, "grad_norm": 0.024814192205667496, "kl": 0.023557125648949295, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1023648.0, "reward": 0.0, "reward_std": 0.0, "step": 65 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 315.0, "completions/max_terminated_length": 315.0, "completions/mean_length": 146.9375, "completions/mean_terminated_length": 156.73333333333332, "completions/min_length": 0.0, "completions/min_terminated_length": 63.0, "epoch": 16.507936507936506, "format_failures": 0.0, "grad_norm": 0.030441824346780777, "kl": 0.0188595931394957, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1044000.0, "reward": 0.0, "reward_std": 0.0, "step": 66 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 164.0, "completions/max_terminated_length": 164.0, "completions/mean_length": 82.625, "completions/mean_terminated_length": 88.13333333333334, "completions/min_length": 0.0, "completions/min_terminated_length": 22.0, "epoch": 16.761904761904763, "format_failures": 0.0, "grad_norm": 0.04137369245290756, "kl": 0.023274712613783777, "learning_rate": 1e-06, "loss": 0.0002, "num_tokens": 1054944.0, "reward": 0.0, "reward_std": 0.0, "step": 67 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 259.0, "completions/max_terminated_length": 259.0, "completions/mean_length": 171.0, "completions/mean_terminated_length": 182.4, "completions/min_length": 0.0, "completions/min_terminated_length": 10.0, "epoch": 17.0, "format_failures": 0.0, "grad_norm": 0.021638207137584686, "kl": 0.018029342343409856, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1072704.0, "reward": 0.0, "reward_std": 0.0, "step": 68 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 267.0, "completions/max_terminated_length": 267.0, "completions/mean_length": 137.125, "completions/mean_terminated_length": 146.26666666666668, "completions/min_length": 0.0, "completions/min_terminated_length": 102.0, "epoch": 17.253968253968253, "format_failures": 0.0, "grad_norm": 0.03815023973584175, "kl": 0.022808501264080405, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1086768.0, "reward": 0.0, "reward_std": 0.0, "step": 69 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 121.0, "completions/max_terminated_length": 121.0, "completions/mean_length": 65.25, "completions/mean_terminated_length": 69.6, "completions/min_length": 0.0, "completions/min_terminated_length": 35.0, "epoch": 17.507936507936506, "format_failures": 0.0, "grad_norm": 1.4077930450439453, "kl": 0.03731423907447606, "learning_rate": 1e-06, "loss": -0.0271, "num_tokens": 1095808.0, "reward": 0.125, "reward_std": 0.34156501293182373, "step": 70 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 227.0, "completions/max_terminated_length": 227.0, "completions/mean_length": 102.125, "completions/mean_terminated_length": 108.93333333333334, "completions/min_length": 0.0, "completions/min_terminated_length": 11.0, "epoch": 17.761904761904763, "format_failures": 0.0, "grad_norm": 0.7399057149887085, "kl": 0.016716997255571187, "learning_rate": 1e-06, "loss": 0.0678, "num_tokens": 1111680.0, "reward": 0.0, "reward_std": 0.0, "step": 71 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 362.0, "completions/max_terminated_length": 362.0, "completions/mean_length": 181.5625, "completions/mean_terminated_length": 193.66666666666666, "completions/min_length": 0.0, "completions/min_terminated_length": 8.0, "epoch": 18.0, "format_failures": 0.0, "grad_norm": 0.017935721203684807, "kl": 0.011654984951019288, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1132992.0, "reward": 0.0, "reward_std": 0.0, "step": 72 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 118.0, "completions/max_terminated_length": 118.0, "completions/mean_length": 70.5625, "completions/mean_terminated_length": 75.26666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 45.0, "epoch": 18.253968253968253, "format_failures": 0.0, "grad_norm": 0.05795279145240784, "kl": 0.03129841119516641, "learning_rate": 1e-06, "loss": 0.0002, "num_tokens": 1142224.0, "reward": 0.0, "reward_std": 0.0, "step": 73 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.125, "completions/max_length": 243.0, "completions/max_terminated_length": 243.0, "completions/mean_length": 109.9375, "completions/mean_terminated_length": 125.64285714285714, "completions/min_length": 0.0, "completions/min_terminated_length": 13.0, "epoch": 18.507936507936506, "format_failures": 0.0, "grad_norm": 0.025236867368221283, "kl": 0.01687535218661651, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1155536.0, "reward": 0.0, "reward_std": 0.0, "step": 74 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 266.0, "completions/max_terminated_length": 266.0, "completions/mean_length": 151.4375, "completions/mean_terminated_length": 161.53333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 29.0, "epoch": 18.761904761904763, "format_failures": 0.0, "grad_norm": 0.013360901735723019, "kl": 0.015348897024523467, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1170688.0, "reward": 0.0, "reward_std": 0.0, "step": 75 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 301.0, "completions/max_terminated_length": 301.0, "completions/mean_length": 168.0625, "completions/mean_terminated_length": 179.26666666666668, "completions/min_length": 0.0, "completions/min_terminated_length": 8.0, "epoch": 19.0, "format_failures": 0.0, "grad_norm": 0.017593177035450935, "kl": 0.011587109416723251, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1191920.0, "reward": 0.0, "reward_std": 0.0, "step": 76 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 432.0, "completions/max_terminated_length": 432.0, "completions/mean_length": 203.1875, "completions/mean_terminated_length": 216.73333333333332, "completions/min_length": 0.0, "completions/min_terminated_length": 10.0, "epoch": 19.253968253968253, "format_failures": 0.0, "grad_norm": 0.03334131836891174, "kl": 0.03286732570268214, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1210224.0, "reward": 0.0, "reward_std": 0.0, "step": 77 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 202.0, "completions/max_terminated_length": 202.0, "completions/mean_length": 121.4375, "completions/mean_terminated_length": 129.53333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 100.0, "epoch": 19.507936507936506, "format_failures": 0.0, "grad_norm": 2.751804828643799, "kl": 0.033644492097664624, "learning_rate": 1e-06, "loss": 0.3261, "num_tokens": 1225040.0, "reward": 0.0625, "reward_std": 0.25, "step": 78 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.004786398261785507, "clip_ratio/low_min": 0.004786398261785507, "clip_ratio/region_mean": 0.004786398261785507, "completions/clipped_ratio": 0.0625, "completions/max_length": 299.0, "completions/max_terminated_length": 299.0, "completions/mean_length": 137.9375, "completions/mean_terminated_length": 147.13333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 54.0, "epoch": 19.761904761904763, "format_failures": 0.0, "grad_norm": 2.5882668495178223, "kl": 0.021342413616366684, "learning_rate": 1e-06, "loss": -0.0385, "num_tokens": 1239264.0, "reward": 0.0625, "reward_std": 0.25, "step": 79 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.002291099913418293, "clip_ratio/low_min": 0.002291099913418293, "clip_ratio/region_mean": 0.002291099913418293, "completions/clipped_ratio": 0.0625, "completions/max_length": 217.0, "completions/max_terminated_length": 217.0, "completions/mean_length": 113.0, "completions/mean_terminated_length": 120.53333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 11.0, "epoch": 20.0, "format_failures": 0.0, "grad_norm": 2.3769264221191406, "kl": 0.039495166018605234, "learning_rate": 1e-06, "loss": -0.2559, "num_tokens": 1262176.0, "reward": 0.0, "reward_std": 0.0, "step": 80 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 484.0, "completions/max_terminated_length": 484.0, "completions/mean_length": 299.1875, "completions/mean_terminated_length": 319.1333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 16.0, "epoch": 20.253968253968253, "format_failures": 0.0, "grad_norm": 0.3414096236228943, "kl": 0.10734888771548867, "learning_rate": 1e-06, "loss": 0.0003, "num_tokens": 1282320.0, "reward": 0.0, "reward_std": 0.0, "step": 81 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 181.0, "completions/max_terminated_length": 181.0, "completions/mean_length": 127.4375, "completions/mean_terminated_length": 135.93333333333334, "completions/min_length": 0.0, "completions/min_terminated_length": 77.0, "epoch": 20.507936507936506, "format_failures": 0.0, "grad_norm": 1.005712866783142, "kl": 0.03478823974728584, "learning_rate": 1e-06, "loss": -0.0977, "num_tokens": 1294784.0, "reward": 0.0625, "reward_std": 0.25, "step": 82 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 177.0, "completions/max_terminated_length": 177.0, "completions/mean_length": 99.375, "completions/mean_terminated_length": 106.0, "completions/min_length": 0.0, "completions/min_terminated_length": 17.0, "epoch": 20.761904761904763, "format_failures": 0.0, "grad_norm": 1.0968055725097656, "kl": 0.022926218574866652, "learning_rate": 1e-06, "loss": 0.0927, "num_tokens": 1307456.0, "reward": 0.0, "reward_std": 0.0, "step": 83 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 633.0, "completions/max_terminated_length": 633.0, "completions/mean_length": 297.5625, "completions/mean_terminated_length": 317.4, "completions/min_length": 0.0, "completions/min_terminated_length": 174.0, "epoch": 21.0, "format_failures": 0.0, "grad_norm": 0.017600059509277344, "kl": 0.015699794888496398, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1332736.0, "reward": 0.0, "reward_std": 0.0, "step": 84 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 200.0, "completions/max_terminated_length": 200.0, "completions/mean_length": 112.6875, "completions/mean_terminated_length": 120.2, "completions/min_length": 0.0, "completions/min_terminated_length": 65.0, "epoch": 21.253968253968253, "format_failures": 0.0, "grad_norm": 0.027195241302251816, "kl": 0.01462783943861723, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1350224.0, "reward": 0.0, "reward_std": 0.0, "step": 85 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 257.0, "completions/max_terminated_length": 257.0, "completions/mean_length": 160.875, "completions/mean_terminated_length": 171.6, "completions/min_length": 0.0, "completions/min_terminated_length": 100.0, "epoch": 21.507936507936506, "format_failures": 0.0, "grad_norm": 0.026015466079115868, "kl": 0.01569616561755538, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1364448.0, "reward": 0.0, "reward_std": 0.0, "step": 86 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 461.0, "completions/max_terminated_length": 461.0, "completions/mean_length": 234.3125, "completions/mean_terminated_length": 249.93333333333334, "completions/min_length": 0.0, "completions/min_terminated_length": 13.0, "epoch": 21.761904761904763, "format_failures": 0.0, "grad_norm": 0.014802309684455395, "kl": 0.01499083882663399, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1384544.0, "reward": 0.0, "reward_std": 0.0, "step": 87 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 169.0, "completions/max_terminated_length": 169.0, "completions/mean_length": 109.875, "completions/mean_terminated_length": 117.2, "completions/min_length": 0.0, "completions/min_terminated_length": 78.0, "epoch": 22.0, "format_failures": 0.0, "grad_norm": 0.05258629843592644, "kl": 0.03835337174435457, "learning_rate": 1e-06, "loss": 0.0002, "num_tokens": 1397280.0, "reward": 0.0, "reward_std": 0.0, "step": 88 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 310.0, "completions/max_terminated_length": 310.0, "completions/mean_length": 192.625, "completions/mean_terminated_length": 205.46666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 8.0, "epoch": 22.253968253968253, "format_failures": 0.0, "grad_norm": 1.407118797302246, "kl": 0.024589622160419822, "learning_rate": 1e-06, "loss": 0.2583, "num_tokens": 1419584.0, "reward": 0.0625, "reward_std": 0.25, "step": 89 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0036144917248748243, "clip_ratio/low_min": 0.0036144917248748243, "clip_ratio/region_mean": 0.0036144917248748243, "completions/clipped_ratio": 0.0625, "completions/max_length": 155.0, "completions/max_terminated_length": 155.0, "completions/mean_length": 81.4375, "completions/mean_terminated_length": 86.86666666666666, "completions/min_length": 0.0, "completions/min_terminated_length": 35.0, "epoch": 22.507936507936506, "format_failures": 0.0, "grad_norm": 1.4649202823638916, "kl": 0.029447708919178694, "learning_rate": 1e-06, "loss": -0.2713, "num_tokens": 1431184.0, "reward": 0.0, "reward_std": 0.0, "step": 90 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 195.0, "completions/max_terminated_length": 195.0, "completions/mean_length": 86.3125, "completions/mean_terminated_length": 92.06666666666666, "completions/min_length": 0.0, "completions/min_terminated_length": 19.0, "epoch": 22.761904761904763, "format_failures": 0.0, "grad_norm": 0.039906520396471024, "kl": 0.022740327287465334, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1442240.0, "reward": 0.0, "reward_std": 0.0, "step": 91 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 160.0, "completions/max_terminated_length": 160.0, "completions/mean_length": 79.8125, "completions/mean_terminated_length": 85.13333333333334, "completions/min_length": 0.0, "completions/min_terminated_length": 32.0, "epoch": 23.0, "format_failures": 0.0, "grad_norm": 0.04782522842288017, "kl": 0.025651276856660844, "learning_rate": 1e-06, "loss": 0.0002, "num_tokens": 1452576.0, "reward": 0.0, "reward_std": 0.0, "step": 92 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 580.0, "completions/max_terminated_length": 580.0, "completions/mean_length": 339.6875, "completions/mean_terminated_length": 362.3333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 13.0, "epoch": 23.253968253968253, "format_failures": 0.0, "grad_norm": 3.4672188758850098, "kl": 0.19690810795873404, "learning_rate": 1e-06, "loss": 0.0009, "num_tokens": 1480128.0, "reward": 0.0, "reward_std": 0.0, "step": 93 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 274.0, "completions/max_terminated_length": 274.0, "completions/mean_length": 97.9375, "completions/mean_terminated_length": 104.46666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 20.0, "epoch": 23.507936507936506, "format_failures": 1.0, "grad_norm": 0.018354037776589394, "kl": 0.012221178796608001, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1495024.0, "reward": 0.0, "reward_std": 0.0, "step": 94 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 106.0, "completions/max_terminated_length": 106.0, "completions/mean_length": 64.0, "completions/mean_terminated_length": 68.26666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 43.0, "epoch": 23.761904761904763, "format_failures": 0.0, "grad_norm": 1.1196024417877197, "kl": 0.03317461354890838, "learning_rate": 1e-06, "loss": 0.0366, "num_tokens": 1502320.0, "reward": 0.125, "reward_std": 0.34156501293182373, "step": 95 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.006894262135028839, "clip_ratio/low_min": 0.006894262135028839, "clip_ratio/region_mean": 0.006894262135028839, "completions/clipped_ratio": 0.0625, "completions/max_length": 258.0, "completions/max_terminated_length": 258.0, "completions/mean_length": 101.875, "completions/mean_terminated_length": 108.66666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 10.0, "epoch": 24.0, "format_failures": 0.0, "grad_norm": 1.590822696685791, "kl": 0.04858416939775149, "learning_rate": 1e-06, "loss": -0.089, "num_tokens": 1514144.0, "reward": 0.0, "reward_std": 0.0, "step": 96 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 279.0, "completions/max_terminated_length": 279.0, "completions/mean_length": 123.25, "completions/mean_terminated_length": 131.46666666666667, "completions/min_length": 0.0, "completions/min_terminated_length": 54.0, "epoch": 24.253968253968253, "format_failures": 0.0, "grad_norm": 0.026897411793470383, "kl": 0.0264069766853936, "learning_rate": 1e-06, "loss": 0.0002, "num_tokens": 1534096.0, "reward": 0.0, "reward_std": 0.0, "step": 97 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 231.0, "completions/max_terminated_length": 231.0, "completions/mean_length": 133.875, "completions/mean_terminated_length": 142.8, "completions/min_length": 0.0, "completions/min_terminated_length": 67.0, "epoch": 24.507936507936506, "format_failures": 0.0, "grad_norm": 0.020193813368678093, "kl": 0.015494385617785156, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1549216.0, "reward": 0.0, "reward_std": 0.0, "step": 98 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 281.0, "completions/max_terminated_length": 281.0, "completions/mean_length": 141.6875, "completions/mean_terminated_length": 151.13333333333333, "completions/min_length": 0.0, "completions/min_terminated_length": 63.0, "epoch": 24.761904761904763, "format_failures": 0.0, "grad_norm": 0.020761676132678986, "kl": 0.01870611571939662, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1565856.0, "reward": 0.0, "reward_std": 0.0, "step": 99 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 792.0, "completions/max_terminated_length": 792.0, "completions/mean_length": 321.5, "completions/mean_terminated_length": 342.93333333333334, "completions/min_length": 0.0, "completions/min_terminated_length": 108.0, "epoch": 25.0, "format_failures": 0.0, "grad_norm": 0.018244797363877296, "kl": 0.020504545792937277, "learning_rate": 1e-06, "loss": 0.0001, "num_tokens": 1593392.0, "reward": 0.0, "reward_std": 0.0, "step": 100 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 139.0, "completions/max_terminated_length": 139.0, "completions/mean_length": 58.3125, "completions/mean_terminated_length": 62.2, "completions/min_length": 0.0, "completions/min_terminated_length": 24.0, "epoch": 25.253968253968253, "format_failures": 0.0, "grad_norm": 1.994212031364441, "kl": 0.0075978070963174105, "learning_rate": 1e-06, "loss": 0.2332, "num_tokens": 1607504.0, "reward": 0.3125, "reward_std": 0.4787135720252991, "step": 101 } ], "logging_steps": 1, "max_steps": 1000, "num_input_tokens_seen": 1607504, "num_train_epochs": 250, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }