{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9891196834817013, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "completions/clipped_ratio": 0.0, "completions/max_length": 149.0, "completions/max_terminated_length": 149.0, "completions/mean_length": 67.40625, "completions/mean_terminated_length": 67.40625, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.19049232598626986, "epoch": 0.0009891196834817012, "grad_norm": 28.529056549072266, "kl_approx": 0.3928680419921875, "learning_rate": 0.0, "loss": 0.6768, "num_tokens": 22373.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.6535420417785645, "sampling/importance_sampling_ratio/mean": 1.0012898445129395, "sampling/importance_sampling_ratio/min": 0.6950725317001343, "sampling/sampling_logp_difference/max": 0.5029196739196777, "sampling/sampling_logp_difference/mean": 0.011248193681240082, "step": 1 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 86.0, "completions/max_terminated_length": 86.0, "completions/mean_length": 54.59375, "completions/mean_terminated_length": 54.59375, "completions/min_length": 25.0, "completions/min_terminated_length": 25.0, "entropy": 0.17993419412096046, "epoch": 0.0019782393669634025, "grad_norm": 32.43034362792969, "kl_approx": 0.3604269027709961, "learning_rate": 1.9607843137254904e-07, "loss": 0.5903, "num_tokens": 46384.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.957443356513977, "sampling/importance_sampling_ratio/mean": 1.0004465579986572, "sampling/importance_sampling_ratio/min": 0.5866379737854004, "sampling/sampling_logp_difference/max": 0.6716392040252686, "sampling/sampling_logp_difference/mean": 0.012668934650719166, "step": 2 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 216.0, "completions/max_terminated_length": 216.0, "completions/mean_length": 83.3125, "completions/mean_terminated_length": 83.3125, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.2114392985822633, "epoch": 0.002967359050445104, "grad_norm": 22.401935577392578, "kl_approx": 0.2788887023925781, "learning_rate": 3.921568627450981e-07, "loss": 0.3177, "num_tokens": 73674.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.5837955474853516, "sampling/importance_sampling_ratio/mean": 0.9998602867126465, "sampling/importance_sampling_ratio/min": 0.4914727509021759, "sampling/sampling_logp_difference/max": 0.7103487253189087, "sampling/sampling_logp_difference/mean": 0.012666420079767704, "step": 3 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 197.0, "completions/max_terminated_length": 197.0, "completions/mean_length": 67.25, "completions/mean_terminated_length": 67.25, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 0.16613194230012596, "epoch": 0.003956478733926805, "grad_norm": 47.69809341430664, "kl_approx": 0.32745361328125, "learning_rate": 5.882352941176471e-07, "loss": 0.3548, "num_tokens": 96210.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2800475358963013, "sampling/importance_sampling_ratio/mean": 0.9995731711387634, "sampling/importance_sampling_ratio/min": 0.7826456427574158, "sampling/sampling_logp_difference/max": 0.24689722061157227, "sampling/sampling_logp_difference/mean": 0.009745625779032707, "step": 4 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 182.0, "completions/max_terminated_length": 182.0, "completions/mean_length": 87.5625, "completions/mean_terminated_length": 87.5625, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.3289017961360514, "epoch": 0.004945598417408506, "grad_norm": 30.9542293548584, "kl_approx": 0.433685302734375, "learning_rate": 7.843137254901962e-07, "loss": 0.4406, "num_tokens": 124812.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.471364974975586, "sampling/importance_sampling_ratio/mean": 0.9996128082275391, "sampling/importance_sampling_ratio/min": 0.6268442273139954, "sampling/sampling_logp_difference/max": 0.4670572280883789, "sampling/sampling_logp_difference/mean": 0.014928525313735008, "step": 5 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 136.0, "completions/max_terminated_length": 136.0, "completions/mean_length": 52.1875, "completions/mean_terminated_length": 52.1875, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.2653167946264148, "epoch": 0.005934718100890208, "grad_norm": 35.00068283081055, "kl_approx": 0.328765869140625, "learning_rate": 9.80392156862745e-07, "loss": 0.4772, "num_tokens": 149818.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.4770218133926392, "sampling/importance_sampling_ratio/mean": 1.0003488063812256, "sampling/importance_sampling_ratio/min": 0.4372307062149048, "sampling/sampling_logp_difference/max": 0.8272943496704102, "sampling/sampling_logp_difference/mean": 0.015758465975522995, "step": 6 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 132.0, "completions/max_terminated_length": 132.0, "completions/mean_length": 63.46875, "completions/mean_terminated_length": 63.46875, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.20784346293658018, "epoch": 0.006923837784371909, "grad_norm": 27.148252487182617, "kl_approx": 0.32172393798828125, "learning_rate": 1.1764705882352942e-06, "loss": 0.3827, "num_tokens": 167953.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.380575180053711, "sampling/importance_sampling_ratio/mean": 1.0021108388900757, "sampling/importance_sampling_ratio/min": 0.6953052282333374, "sampling/sampling_logp_difference/max": 0.3634042739868164, "sampling/sampling_logp_difference/mean": 0.012451596558094025, "step": 7 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 149.0, "completions/max_terminated_length": 149.0, "completions/mean_length": 63.21875, "completions/mean_terminated_length": 63.21875, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.2678709211759269, "epoch": 0.00791295746785361, "grad_norm": 22.741029739379883, "kl_approx": 0.245819091796875, "learning_rate": 1.3725490196078434e-06, "loss": 0.3534, "num_tokens": 186672.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3052524328231812, "sampling/importance_sampling_ratio/mean": 0.9987507462501526, "sampling/importance_sampling_ratio/min": 0.6951146721839905, "sampling/sampling_logp_difference/max": 0.3636784553527832, "sampling/sampling_logp_difference/mean": 0.014225856401026249, "step": 8 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 125.0, "completions/max_terminated_length": 125.0, "completions/mean_length": 83.90625, "completions/mean_terminated_length": 83.90625, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.2498362367041409, "epoch": 0.008902077151335312, "grad_norm": 15.692536354064941, "kl_approx": 0.2193756103515625, "learning_rate": 1.5686274509803923e-06, "loss": 0.2845, "num_tokens": 212293.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.407726764678955, "sampling/importance_sampling_ratio/mean": 1.0001542568206787, "sampling/importance_sampling_ratio/min": 0.6554859280586243, "sampling/sampling_logp_difference/max": 0.42237842082977295, "sampling/sampling_logp_difference/mean": 0.012924418784677982, "step": 9 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 215.0, "completions/max_terminated_length": 215.0, "completions/mean_length": 69.0, "completions/mean_terminated_length": 69.0, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 0.40094609512016177, "epoch": 0.009891196834817012, "grad_norm": 12.470873832702637, "kl_approx": 0.2755889892578125, "learning_rate": 1.7647058823529414e-06, "loss": 0.249, "num_tokens": 237045.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2497589588165283, "sampling/importance_sampling_ratio/mean": 1.0003273487091064, "sampling/importance_sampling_ratio/min": 0.7366809844970703, "sampling/sampling_logp_difference/max": 0.3056004047393799, "sampling/sampling_logp_difference/mean": 0.015060663223266602, "step": 10 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 249.0, "completions/max_terminated_length": 249.0, "completions/mean_length": 84.5, "completions/mean_terminated_length": 84.5, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.44598684390075505, "epoch": 0.010880316518298714, "grad_norm": 10.184185028076172, "kl_approx": 0.19950103759765625, "learning_rate": 1.96078431372549e-06, "loss": 0.1355, "num_tokens": 261333.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2790429592132568, "sampling/importance_sampling_ratio/mean": 1.0003671646118164, "sampling/importance_sampling_ratio/min": 0.7788791656494141, "sampling/sampling_logp_difference/max": 0.24989932775497437, "sampling/sampling_logp_difference/mean": 0.01756957359611988, "step": 11 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 871.0, "completions/max_terminated_length": 871.0, "completions/mean_length": 263.1875, "completions/mean_terminated_length": 263.1875, "completions/min_length": 122.0, "completions/min_terminated_length": 122.0, "entropy": 0.712527384981513, "epoch": 0.011869436201780416, "grad_norm": 5.928795337677002, "kl_approx": 0.1987152099609375, "learning_rate": 2.1568627450980393e-06, "loss": 0.1364, "num_tokens": 292675.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.7851656675338745, "sampling/importance_sampling_ratio/mean": 1.0001658201217651, "sampling/importance_sampling_ratio/min": 0.5906986594200134, "sampling/sampling_logp_difference/max": 0.5795111656188965, "sampling/sampling_logp_difference/mean": 0.01856686733663082, "step": 12 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 521.0, "completions/max_terminated_length": 521.0, "completions/mean_length": 176.625, "completions/mean_terminated_length": 176.625, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.6713496631709859, "epoch": 0.012858555885262116, "grad_norm": 8.06400203704834, "kl_approx": 0.2364654541015625, "learning_rate": 2.3529411764705885e-06, "loss": 0.1389, "num_tokens": 316655.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.5149643421173096, "sampling/importance_sampling_ratio/mean": 0.9990436434745789, "sampling/importance_sampling_ratio/min": 0.5753442049026489, "sampling/sampling_logp_difference/max": 0.5527868270874023, "sampling/sampling_logp_difference/mean": 0.019171396270394325, "step": 13 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 801.0, "completions/max_terminated_length": 801.0, "completions/mean_length": 230.34375, "completions/mean_terminated_length": 230.34375, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 0.6651557786390185, "epoch": 0.013847675568743818, "grad_norm": 6.31292724609375, "kl_approx": 0.2437744140625, "learning_rate": 2.549019607843137e-06, "loss": 0.1763, "num_tokens": 345250.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3279917240142822, "sampling/importance_sampling_ratio/mean": 0.9989785552024841, "sampling/importance_sampling_ratio/min": 0.40005072951316833, "sampling/sampling_logp_difference/max": 0.9161639213562012, "sampling/sampling_logp_difference/mean": 0.01682412624359131, "step": 14 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 472.0, "completions/mean_length": 197.0, "completions/mean_terminated_length": 170.32257080078125, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.742519180290401, "epoch": 0.01483679525222552, "grad_norm": 6.316934585571289, "kl_approx": 0.2740325927734375, "learning_rate": 2.7450980392156867e-06, "loss": 0.1793, "num_tokens": 376546.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.529558539390564, "sampling/importance_sampling_ratio/mean": 1.000232458114624, "sampling/importance_sampling_ratio/min": 0.7334407567977905, "sampling/sampling_logp_difference/max": 0.42497920989990234, "sampling/sampling_logp_difference/mean": 0.019550925120711327, "step": 15 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 269.0, "completions/max_terminated_length": 269.0, "completions/mean_length": 108.125, "completions/mean_terminated_length": 108.125, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.6516008954495192, "epoch": 0.01582591493570722, "grad_norm": 6.337355136871338, "kl_approx": 0.19483184814453125, "learning_rate": 2.9411764705882355e-06, "loss": 0.1162, "num_tokens": 399158.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.295330286026001, "sampling/importance_sampling_ratio/mean": 1.000090479850769, "sampling/importance_sampling_ratio/min": 0.7236149311065674, "sampling/sampling_logp_difference/max": 0.32349586486816406, "sampling/sampling_logp_difference/mean": 0.01921284943819046, "step": 16 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 239.0, "completions/max_terminated_length": 239.0, "completions/mean_length": 130.125, "completions/mean_terminated_length": 130.125, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.813218005001545, "epoch": 0.016815034619188922, "grad_norm": 6.062085151672363, "kl_approx": 0.288330078125, "learning_rate": 3.1372549019607846e-06, "loss": 0.2161, "num_tokens": 423210.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3300998210906982, "sampling/importance_sampling_ratio/mean": 1.0006861686706543, "sampling/importance_sampling_ratio/min": 0.7610476016998291, "sampling/sampling_logp_difference/max": 0.28525400161743164, "sampling/sampling_logp_difference/mean": 0.019886309280991554, "step": 17 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 268.0, "completions/max_terminated_length": 268.0, "completions/mean_length": 115.4375, "completions/mean_terminated_length": 115.4375, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 0.5778757254593074, "epoch": 0.017804154302670624, "grad_norm": 5.502050876617432, "kl_approx": 0.20848846435546875, "learning_rate": 3.3333333333333333e-06, "loss": 0.1678, "num_tokens": 448760.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.4366071224212646, "sampling/importance_sampling_ratio/mean": 1.0004844665527344, "sampling/importance_sampling_ratio/min": 0.7086447477340698, "sampling/sampling_logp_difference/max": 0.36228418350219727, "sampling/sampling_logp_difference/mean": 0.016118451952934265, "step": 18 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 680.0, "completions/max_terminated_length": 680.0, "completions/mean_length": 130.125, "completions/mean_terminated_length": 130.125, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.543406939599663, "epoch": 0.018793273986152326, "grad_norm": 4.8573198318481445, "kl_approx": 0.188812255859375, "learning_rate": 3.529411764705883e-06, "loss": 0.1383, "num_tokens": 475740.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3149635791778564, "sampling/importance_sampling_ratio/mean": 1.0015828609466553, "sampling/importance_sampling_ratio/min": 0.630437433719635, "sampling/sampling_logp_difference/max": 0.46134138107299805, "sampling/sampling_logp_difference/mean": 0.015716973692178726, "step": 19 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 121.0, "completions/max_terminated_length": 121.0, "completions/mean_length": 77.3125, "completions/mean_terminated_length": 77.3125, "completions/min_length": 10.0, "completions/min_terminated_length": 10.0, "entropy": 0.4479383102734573, "epoch": 0.019782393669634024, "grad_norm": 4.919290542602539, "kl_approx": 0.23265504837036133, "learning_rate": 3.7254901960784316e-06, "loss": 0.1596, "num_tokens": 493678.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2743626832962036, "sampling/importance_sampling_ratio/mean": 0.9999105930328369, "sampling/importance_sampling_ratio/min": 0.6998186111450195, "sampling/sampling_logp_difference/max": 0.3569340705871582, "sampling/sampling_logp_difference/mean": 0.013152539730072021, "step": 20 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 312.0, "completions/max_terminated_length": 312.0, "completions/mean_length": 124.0, "completions/mean_terminated_length": 124.0, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.5678619706304744, "epoch": 0.020771513353115726, "grad_norm": 5.2283101081848145, "kl_approx": 0.23252105712890625, "learning_rate": 3.92156862745098e-06, "loss": 0.1748, "num_tokens": 521166.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2499433755874634, "sampling/importance_sampling_ratio/mean": 0.9997319579124451, "sampling/importance_sampling_ratio/min": 0.7065470814704895, "sampling/sampling_logp_difference/max": 0.3473653793334961, "sampling/sampling_logp_difference/mean": 0.016745995730161667, "step": 21 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 273.0, "completions/max_terminated_length": 273.0, "completions/mean_length": 90.28125, "completions/mean_terminated_length": 90.28125, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.6121624982915819, "epoch": 0.021760633036597428, "grad_norm": 5.407651901245117, "kl_approx": 0.23561859130859375, "learning_rate": 4.11764705882353e-06, "loss": 0.1638, "num_tokens": 539255.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2807447910308838, "sampling/importance_sampling_ratio/mean": 0.9981391429901123, "sampling/importance_sampling_ratio/min": 0.787506639957428, "sampling/sampling_logp_difference/max": 0.24744176864624023, "sampling/sampling_logp_difference/mean": 0.01780509389936924, "step": 22 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 350.0, "completions/max_terminated_length": 350.0, "completions/mean_length": 132.03125, "completions/mean_terminated_length": 132.03125, "completions/min_length": 19.0, "completions/min_terminated_length": 19.0, "entropy": 0.5304539701901376, "epoch": 0.02274975272007913, "grad_norm": 4.16707181930542, "kl_approx": 0.15975189208984375, "learning_rate": 4.313725490196079e-06, "loss": 0.1284, "num_tokens": 562352.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.242124080657959, "sampling/importance_sampling_ratio/mean": 1.0004630088806152, "sampling/importance_sampling_ratio/min": 0.7878240346908569, "sampling/sampling_logp_difference/max": 0.2384805679321289, "sampling/sampling_logp_difference/mean": 0.017122572287917137, "step": 23 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 246.0, "completions/max_terminated_length": 246.0, "completions/mean_length": 113.65625, "completions/mean_terminated_length": 113.65625, "completions/min_length": 13.0, "completions/min_terminated_length": 13.0, "entropy": 0.4428328915964812, "epoch": 0.02373887240356083, "grad_norm": 5.808507919311523, "kl_approx": 0.23372268676757812, "learning_rate": 4.509803921568628e-06, "loss": 0.1636, "num_tokens": 586381.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2541260719299316, "sampling/importance_sampling_ratio/mean": 1.0004154443740845, "sampling/importance_sampling_ratio/min": 0.7925978899002075, "sampling/sampling_logp_difference/max": 0.23243927955627441, "sampling/sampling_logp_difference/mean": 0.013458705507218838, "step": 24 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 589.0, "completions/max_terminated_length": 589.0, "completions/mean_length": 157.53125, "completions/mean_terminated_length": 157.53125, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.4033222822472453, "epoch": 0.024727992087042534, "grad_norm": 3.5725226402282715, "kl_approx": 0.13341522216796875, "learning_rate": 4.705882352941177e-06, "loss": 0.0865, "num_tokens": 609390.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.272744059562683, "sampling/importance_sampling_ratio/mean": 0.9999245405197144, "sampling/importance_sampling_ratio/min": 0.7086235284805298, "sampling/sampling_logp_difference/max": 0.34443092346191406, "sampling/sampling_logp_difference/mean": 0.012822979129850864, "step": 25 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 287.0, "completions/max_terminated_length": 287.0, "completions/mean_length": 148.5625, "completions/mean_terminated_length": 148.5625, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.4659550020005554, "epoch": 0.025717111770524232, "grad_norm": 3.973996639251709, "kl_approx": 0.19349288940429688, "learning_rate": 4.901960784313726e-06, "loss": 0.1312, "num_tokens": 634200.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2952141761779785, "sampling/importance_sampling_ratio/mean": 1.0001169443130493, "sampling/importance_sampling_ratio/min": 0.6906945705413818, "sampling/sampling_logp_difference/max": 0.3700575828552246, "sampling/sampling_logp_difference/mean": 0.014177861623466015, "step": 26 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 361.0, "completions/max_terminated_length": 361.0, "completions/mean_length": 120.90625, "completions/mean_terminated_length": 120.90625, "completions/min_length": 20.0, "completions/min_terminated_length": 20.0, "entropy": 0.5012554116547108, "epoch": 0.026706231454005934, "grad_norm": 5.57405948638916, "kl_approx": 0.2424774169921875, "learning_rate": 5.098039215686274e-06, "loss": 0.1595, "num_tokens": 660749.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2622395753860474, "sampling/importance_sampling_ratio/mean": 1.0014152526855469, "sampling/importance_sampling_ratio/min": 0.7354806661605835, "sampling/sampling_logp_difference/max": 0.307231068611145, "sampling/sampling_logp_difference/mean": 0.01518701296299696, "step": 27 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 433.0, "completions/max_terminated_length": 433.0, "completions/mean_length": 175.65625, "completions/mean_terminated_length": 175.65625, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6228614673018456, "epoch": 0.027695351137487636, "grad_norm": 4.616665363311768, "kl_approx": 0.192138671875, "learning_rate": 5.294117647058824e-06, "loss": 0.1287, "num_tokens": 687338.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2605739831924438, "sampling/importance_sampling_ratio/mean": 1.0005100965499878, "sampling/importance_sampling_ratio/min": 0.7780243158340454, "sampling/sampling_logp_difference/max": 0.25099754333496094, "sampling/sampling_logp_difference/mean": 0.01689489185810089, "step": 28 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 387.0, "completions/max_terminated_length": 387.0, "completions/mean_length": 100.28125, "completions/mean_terminated_length": 100.28125, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.47152079176157713, "epoch": 0.028684470820969338, "grad_norm": 4.3633036613464355, "kl_approx": 0.15057373046875, "learning_rate": 5.4901960784313735e-06, "loss": 0.0866, "num_tokens": 713555.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2824264764785767, "sampling/importance_sampling_ratio/mean": 1.0002281665802002, "sampling/importance_sampling_ratio/min": 0.7465155720710754, "sampling/sampling_logp_difference/max": 0.29233884811401367, "sampling/sampling_logp_difference/mean": 0.014382078312337399, "step": 29 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 798.0, "completions/max_terminated_length": 798.0, "completions/mean_length": 165.6875, "completions/mean_terminated_length": 165.6875, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 0.5833946452476084, "epoch": 0.02967359050445104, "grad_norm": 4.380878925323486, "kl_approx": 0.2080535888671875, "learning_rate": 5.686274509803922e-06, "loss": 0.1481, "num_tokens": 736977.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2449756860733032, "sampling/importance_sampling_ratio/mean": 0.9996135830879211, "sampling/importance_sampling_ratio/min": 0.7551159262657166, "sampling/sampling_logp_difference/max": 0.2808840274810791, "sampling/sampling_logp_difference/mean": 0.014716500416398048, "step": 30 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 368.0, "completions/max_terminated_length": 368.0, "completions/mean_length": 118.34375, "completions/mean_terminated_length": 118.34375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.609582512639463, "epoch": 0.03066271018793274, "grad_norm": 9.437041282653809, "kl_approx": 0.2823333740234375, "learning_rate": 5.882352941176471e-06, "loss": 0.2094, "num_tokens": 760068.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.5377250909805298, "sampling/importance_sampling_ratio/mean": 0.9994555115699768, "sampling/importance_sampling_ratio/min": 0.7325965762138367, "sampling/sampling_logp_difference/max": 0.43030405044555664, "sampling/sampling_logp_difference/mean": 0.017115885391831398, "step": 31 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 211.0, "completions/max_terminated_length": 211.0, "completions/mean_length": 106.3125, "completions/mean_terminated_length": 106.3125, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.44338538870215416, "epoch": 0.03165182987141444, "grad_norm": 4.166123867034912, "kl_approx": 0.1922454833984375, "learning_rate": 6.07843137254902e-06, "loss": 0.1223, "num_tokens": 783790.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2705289125442505, "sampling/importance_sampling_ratio/mean": 1.0000391006469727, "sampling/importance_sampling_ratio/min": 0.7931848764419556, "sampling/sampling_logp_difference/max": 0.23943328857421875, "sampling/sampling_logp_difference/mean": 0.012508069165050983, "step": 32 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 378.0, "completions/max_terminated_length": 378.0, "completions/mean_length": 146.03125, "completions/mean_terminated_length": 146.03125, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.6924732802435756, "epoch": 0.032640949554896145, "grad_norm": 4.595773696899414, "kl_approx": 0.298614501953125, "learning_rate": 6.274509803921569e-06, "loss": 0.1686, "num_tokens": 810639.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2869395017623901, "sampling/importance_sampling_ratio/mean": 0.999365508556366, "sampling/importance_sampling_ratio/min": 0.736172616481781, "sampling/sampling_logp_difference/max": 0.3062906265258789, "sampling/sampling_logp_difference/mean": 0.020145833492279053, "step": 33 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 332.0, "completions/max_terminated_length": 332.0, "completions/mean_length": 136.71875, "completions/mean_terminated_length": 136.71875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.7962839929386973, "epoch": 0.033630069238377844, "grad_norm": 4.532458782196045, "kl_approx": 0.2537841796875, "learning_rate": 6.470588235294119e-06, "loss": 0.1685, "num_tokens": 833222.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2344743013381958, "sampling/importance_sampling_ratio/mean": 1.0008091926574707, "sampling/importance_sampling_ratio/min": 0.696750819683075, "sampling/sampling_logp_difference/max": 0.3613274097442627, "sampling/sampling_logp_difference/mean": 0.019129553809762, "step": 34 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 432.0, "completions/max_terminated_length": 432.0, "completions/mean_length": 101.90625, "completions/mean_terminated_length": 101.90625, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.6338094496168196, "epoch": 0.03461918892185954, "grad_norm": 3.7068588733673096, "kl_approx": 0.21271514892578125, "learning_rate": 6.666666666666667e-06, "loss": 0.1188, "num_tokens": 852627.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2575933933258057, "sampling/importance_sampling_ratio/mean": 0.9996321797370911, "sampling/importance_sampling_ratio/min": 0.6894897222518921, "sampling/sampling_logp_difference/max": 0.37180352210998535, "sampling/sampling_logp_difference/mean": 0.01760854385793209, "step": 35 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 225.0, "completions/max_terminated_length": 225.0, "completions/mean_length": 121.75, "completions/mean_terminated_length": 121.75, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.49393809074535966, "epoch": 0.03560830860534125, "grad_norm": 3.0840585231781006, "kl_approx": 0.1484966278076172, "learning_rate": 6.862745098039216e-06, "loss": 0.1154, "num_tokens": 882491.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.215436339378357, "sampling/importance_sampling_ratio/mean": 0.9996856451034546, "sampling/importance_sampling_ratio/min": 0.7761471271514893, "sampling/sampling_logp_difference/max": 0.25341320037841797, "sampling/sampling_logp_difference/mean": 0.012671963311731815, "step": 36 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 680.0, "completions/max_terminated_length": 680.0, "completions/mean_length": 135.5, "completions/mean_terminated_length": 135.5, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.5945717701688409, "epoch": 0.036597428288822946, "grad_norm": 5.685115337371826, "kl_approx": 0.2591571807861328, "learning_rate": 7.058823529411766e-06, "loss": 0.1462, "num_tokens": 905635.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2564952373504639, "sampling/importance_sampling_ratio/mean": 1.0002124309539795, "sampling/importance_sampling_ratio/min": 0.7755049467086792, "sampling/sampling_logp_difference/max": 0.2542409896850586, "sampling/sampling_logp_difference/mean": 0.015301528386771679, "step": 37 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 611.0, "completions/max_terminated_length": 611.0, "completions/mean_length": 138.4375, "completions/mean_terminated_length": 138.4375, "completions/min_length": 25.0, "completions/min_terminated_length": 25.0, "entropy": 0.6307068914175034, "epoch": 0.03758654797230465, "grad_norm": 4.414489269256592, "kl_approx": 0.276824951171875, "learning_rate": 7.2549019607843145e-06, "loss": 0.1615, "num_tokens": 931681.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3150644302368164, "sampling/importance_sampling_ratio/mean": 0.9999549984931946, "sampling/importance_sampling_ratio/min": 0.7587952017784119, "sampling/sampling_logp_difference/max": 0.27602338790893555, "sampling/sampling_logp_difference/mean": 0.01803310215473175, "step": 38 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 406.0, "completions/max_terminated_length": 406.0, "completions/mean_length": 131.375, "completions/mean_terminated_length": 131.375, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.5818085940554738, "epoch": 0.03857566765578635, "grad_norm": 3.9511404037475586, "kl_approx": 0.2630462646484375, "learning_rate": 7.450980392156863e-06, "loss": 0.1447, "num_tokens": 954197.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.257724404335022, "sampling/importance_sampling_ratio/mean": 0.999701738357544, "sampling/importance_sampling_ratio/min": 0.7506154179573059, "sampling/sampling_logp_difference/max": 0.2868618965148926, "sampling/sampling_logp_difference/mean": 0.014471353031694889, "step": 39 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 500.0, "completions/max_terminated_length": 500.0, "completions/mean_length": 124.28125, "completions/mean_terminated_length": 124.28125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.49119923263788223, "epoch": 0.03956478733926805, "grad_norm": 4.087814807891846, "kl_approx": 0.203094482421875, "learning_rate": 7.647058823529411e-06, "loss": 0.136, "num_tokens": 974838.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2847933769226074, "sampling/importance_sampling_ratio/mean": 0.9999269843101501, "sampling/importance_sampling_ratio/min": 0.7777205109596252, "sampling/sampling_logp_difference/max": 0.2513880729675293, "sampling/sampling_logp_difference/mean": 0.01348426379263401, "step": 40 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 385.0, "completions/max_terminated_length": 385.0, "completions/mean_length": 137.9375, "completions/mean_terminated_length": 137.9375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.5795987108722329, "epoch": 0.040553907022749754, "grad_norm": 3.838060140609741, "kl_approx": 0.2061767578125, "learning_rate": 7.84313725490196e-06, "loss": 0.1217, "num_tokens": 999788.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.373495101928711, "sampling/importance_sampling_ratio/mean": 1.0006526708602905, "sampling/importance_sampling_ratio/min": 0.8049514889717102, "sampling/sampling_logp_difference/max": 0.31735873222351074, "sampling/sampling_logp_difference/mean": 0.015573837794363499, "step": 41 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 355.0, "completions/max_terminated_length": 355.0, "completions/mean_length": 130.59375, "completions/mean_terminated_length": 130.59375, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.4268115006852895, "epoch": 0.04154302670623145, "grad_norm": 3.38944411277771, "kl_approx": 0.185943603515625, "learning_rate": 8.03921568627451e-06, "loss": 0.1044, "num_tokens": 1026591.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.4606575965881348, "sampling/importance_sampling_ratio/mean": 1.000106692314148, "sampling/importance_sampling_ratio/min": 0.8157088756561279, "sampling/sampling_logp_difference/max": 0.37888669967651367, "sampling/sampling_logp_difference/mean": 0.011561281979084015, "step": 42 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 282.0, "completions/max_terminated_length": 282.0, "completions/mean_length": 109.84375, "completions/mean_terminated_length": 109.84375, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.4379591876640916, "epoch": 0.04253214638971316, "grad_norm": 3.84601092338562, "kl_approx": 0.203826904296875, "learning_rate": 8.23529411764706e-06, "loss": 0.0937, "num_tokens": 1051242.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.281457781791687, "sampling/importance_sampling_ratio/mean": 1.000130534172058, "sampling/importance_sampling_ratio/min": 0.766370952129364, "sampling/sampling_logp_difference/max": 0.26608896255493164, "sampling/sampling_logp_difference/mean": 0.013051528483629227, "step": 43 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 369.0, "completions/max_terminated_length": 369.0, "completions/mean_length": 119.6875, "completions/mean_terminated_length": 119.6875, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.4783370946533978, "epoch": 0.043521266073194856, "grad_norm": 4.2641401290893555, "kl_approx": 0.2268524169921875, "learning_rate": 8.43137254901961e-06, "loss": 0.1197, "num_tokens": 1076320.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2634073495864868, "sampling/importance_sampling_ratio/mean": 0.9995564818382263, "sampling/importance_sampling_ratio/min": 0.7962554693222046, "sampling/sampling_logp_difference/max": 0.2338123321533203, "sampling/sampling_logp_difference/mean": 0.013220756314694881, "step": 44 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 328.0, "completions/max_terminated_length": 328.0, "completions/mean_length": 121.0625, "completions/mean_terminated_length": 121.0625, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.500814110506326, "epoch": 0.04451038575667656, "grad_norm": 5.393642902374268, "kl_approx": 0.21185302734375, "learning_rate": 8.627450980392157e-06, "loss": 0.1338, "num_tokens": 1098210.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3016771078109741, "sampling/importance_sampling_ratio/mean": 1.0000889301300049, "sampling/importance_sampling_ratio/min": 0.792271614074707, "sampling/sampling_logp_difference/max": 0.2636535167694092, "sampling/sampling_logp_difference/mean": 0.014255186542868614, "step": 45 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 307.0, "completions/max_terminated_length": 307.0, "completions/mean_length": 111.6875, "completions/mean_terminated_length": 111.6875, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.4824839881621301, "epoch": 0.04549950544015826, "grad_norm": 5.159158706665039, "kl_approx": 0.26015472412109375, "learning_rate": 8.823529411764707e-06, "loss": 0.1726, "num_tokens": 1119824.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2540059089660645, "sampling/importance_sampling_ratio/mean": 1.0001651048660278, "sampling/importance_sampling_ratio/min": 0.8153637647628784, "sampling/sampling_logp_difference/max": 0.22634315490722656, "sampling/sampling_logp_difference/mean": 0.012914080172777176, "step": 46 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 628.0, "completions/max_terminated_length": 628.0, "completions/mean_length": 166.34375, "completions/mean_terminated_length": 166.34375, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.6073106471449137, "epoch": 0.04648862512363996, "grad_norm": 5.110304832458496, "kl_approx": 0.268310546875, "learning_rate": 9.019607843137256e-06, "loss": 0.1865, "num_tokens": 1138043.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.4095134735107422, "sampling/importance_sampling_ratio/mean": 0.9999644160270691, "sampling/importance_sampling_ratio/min": 0.7814053893089294, "sampling/sampling_logp_difference/max": 0.3432445526123047, "sampling/sampling_logp_difference/mean": 0.017521638423204422, "step": 47 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 348.0, "completions/max_terminated_length": 348.0, "completions/mean_length": 166.875, "completions/mean_terminated_length": 166.875, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.6038749944418669, "epoch": 0.04747774480712166, "grad_norm": 3.6243886947631836, "kl_approx": 0.2293853759765625, "learning_rate": 9.215686274509804e-06, "loss": 0.1409, "num_tokens": 1163719.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.330727219581604, "sampling/importance_sampling_ratio/mean": 0.9999634623527527, "sampling/importance_sampling_ratio/min": 0.794928252696991, "sampling/sampling_logp_difference/max": 0.28572559356689453, "sampling/sampling_logp_difference/mean": 0.015606286935508251, "step": 48 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 337.0, "completions/max_terminated_length": 337.0, "completions/mean_length": 100.40625, "completions/mean_terminated_length": 100.40625, "completions/min_length": 22.0, "completions/min_terminated_length": 22.0, "entropy": 0.500477098627016, "epoch": 0.04846686449060336, "grad_norm": 4.582136154174805, "kl_approx": 0.26647186279296875, "learning_rate": 9.411764705882354e-06, "loss": 0.1496, "num_tokens": 1182140.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.292516827583313, "sampling/importance_sampling_ratio/mean": 1.000788688659668, "sampling/importance_sampling_ratio/min": 0.8057621717453003, "sampling/sampling_logp_difference/max": 0.2565913200378418, "sampling/sampling_logp_difference/mean": 0.014075304381549358, "step": 49 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 347.0, "completions/max_terminated_length": 347.0, "completions/mean_length": 144.5625, "completions/mean_terminated_length": 144.5625, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.5469464962370694, "epoch": 0.04945598417408507, "grad_norm": 4.1229681968688965, "kl_approx": 0.22538185119628906, "learning_rate": 9.607843137254903e-06, "loss": 0.1937, "num_tokens": 1207590.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.207270622253418, "sampling/importance_sampling_ratio/mean": 1.0007202625274658, "sampling/importance_sampling_ratio/min": 0.8117063045501709, "sampling/sampling_logp_difference/max": 0.2086167335510254, "sampling/sampling_logp_difference/mean": 0.015022498555481434, "step": 50 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 366.0, "completions/max_terminated_length": 366.0, "completions/mean_length": 132.53125, "completions/mean_terminated_length": 132.53125, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.5224494733847678, "epoch": 0.050445103857566766, "grad_norm": 3.403608798980713, "kl_approx": 0.18885040283203125, "learning_rate": 9.803921568627451e-06, "loss": 0.1213, "num_tokens": 1228623.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2892875671386719, "sampling/importance_sampling_ratio/mean": 0.99994957447052, "sampling/importance_sampling_ratio/min": 0.7977840304374695, "sampling/sampling_logp_difference/max": 0.2540898323059082, "sampling/sampling_logp_difference/mean": 0.012245790101587772, "step": 51 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 424.0, "completions/max_terminated_length": 424.0, "completions/mean_length": 108.25, "completions/mean_terminated_length": 108.25, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.6296374616213143, "epoch": 0.051434223541048464, "grad_norm": 4.969080924987793, "kl_approx": 0.2586669921875, "learning_rate": 1e-05, "loss": 0.1311, "num_tokens": 1252263.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.241348147392273, "sampling/importance_sampling_ratio/mean": 0.9995492100715637, "sampling/importance_sampling_ratio/min": 0.7735205292701721, "sampling/sampling_logp_difference/max": 0.256803035736084, "sampling/sampling_logp_difference/mean": 0.015211866237223148, "step": 52 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 541.0, "completions/max_terminated_length": 541.0, "completions/mean_length": 161.34375, "completions/mean_terminated_length": 161.34375, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.7328842608258128, "epoch": 0.05242334322453017, "grad_norm": 5.320689678192139, "kl_approx": 0.260223388671875, "learning_rate": 1.0196078431372549e-05, "loss": 0.1589, "num_tokens": 1275330.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2876975536346436, "sampling/importance_sampling_ratio/mean": 1.000205636024475, "sampling/importance_sampling_ratio/min": 0.781684160232544, "sampling/sampling_logp_difference/max": 0.2528557777404785, "sampling/sampling_logp_difference/mean": 0.017746655270457268, "step": 53 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 890.0, "completions/max_terminated_length": 890.0, "completions/mean_length": 180.8125, "completions/mean_terminated_length": 180.8125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.6511295037344098, "epoch": 0.05341246290801187, "grad_norm": 5.195742607116699, "kl_approx": 0.25853729248046875, "learning_rate": 1.03921568627451e-05, "loss": 0.1672, "num_tokens": 1300380.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2799780368804932, "sampling/importance_sampling_ratio/mean": 0.9992867708206177, "sampling/importance_sampling_ratio/min": 0.6605044007301331, "sampling/sampling_logp_difference/max": 0.4147515892982483, "sampling/sampling_logp_difference/mean": 0.01718878746032715, "step": 54 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 218.0, "completions/max_terminated_length": 218.0, "completions/mean_length": 118.90625, "completions/mean_terminated_length": 118.90625, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.5597416623495519, "epoch": 0.05440158259149357, "grad_norm": 5.125489711761475, "kl_approx": 0.2502403259277344, "learning_rate": 1.0588235294117648e-05, "loss": 0.157, "num_tokens": 1320841.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2517250776290894, "sampling/importance_sampling_ratio/mean": 1.000245213508606, "sampling/importance_sampling_ratio/min": 0.7895849943161011, "sampling/sampling_logp_difference/max": 0.23624777793884277, "sampling/sampling_logp_difference/mean": 0.013802413828670979, "step": 55 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 166.0, "completions/max_terminated_length": 166.0, "completions/mean_length": 92.3125, "completions/mean_terminated_length": 92.3125, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.4637425309047103, "epoch": 0.05539070227497527, "grad_norm": 3.5693695545196533, "kl_approx": 0.17520523071289062, "learning_rate": 1.0784313725490196e-05, "loss": 0.095, "num_tokens": 1342763.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2677499055862427, "sampling/importance_sampling_ratio/mean": 0.9992490410804749, "sampling/importance_sampling_ratio/min": 0.7959326505661011, "sampling/sampling_logp_difference/max": 0.23724365234375, "sampling/sampling_logp_difference/mean": 0.011262464337050915, "step": 56 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 351.0, "completions/max_terminated_length": 351.0, "completions/mean_length": 140.3125, "completions/mean_terminated_length": 140.3125, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.6376035045832396, "epoch": 0.05637982195845697, "grad_norm": 4.30594539642334, "kl_approx": 0.2780914306640625, "learning_rate": 1.0980392156862747e-05, "loss": 0.1652, "num_tokens": 1365981.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2821263074874878, "sampling/importance_sampling_ratio/mean": 1.0000948905944824, "sampling/importance_sampling_ratio/min": 0.7887351512908936, "sampling/sampling_logp_difference/max": 0.2485198974609375, "sampling/sampling_logp_difference/mean": 0.015333757735788822, "step": 57 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 137.0, "completions/max_terminated_length": 137.0, "completions/mean_length": 70.96875, "completions/mean_terminated_length": 70.96875, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.5017928471788764, "epoch": 0.057368941641938676, "grad_norm": 4.030434608459473, "kl_approx": 0.15564727783203125, "learning_rate": 1.1176470588235295e-05, "loss": 0.1109, "num_tokens": 1388644.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1583945751190186, "sampling/importance_sampling_ratio/mean": 1.0000076293945312, "sampling/importance_sampling_ratio/min": 0.8063974976539612, "sampling/sampling_logp_difference/max": 0.2151784896850586, "sampling/sampling_logp_difference/mean": 0.01196204498410225, "step": 58 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 366.0, "completions/max_terminated_length": 366.0, "completions/mean_length": 99.65625, "completions/mean_terminated_length": 99.65625, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.5088606770150363, "epoch": 0.058358061325420374, "grad_norm": 5.449374675750732, "kl_approx": 0.20304489135742188, "learning_rate": 1.1372549019607844e-05, "loss": 0.1051, "num_tokens": 1409049.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2883384227752686, "sampling/importance_sampling_ratio/mean": 1.0003690719604492, "sampling/importance_sampling_ratio/min": 0.8127831816673279, "sampling/sampling_logp_difference/max": 0.2533533573150635, "sampling/sampling_logp_difference/mean": 0.015136120840907097, "step": 59 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 173.0, "completions/max_terminated_length": 173.0, "completions/mean_length": 87.125, "completions/mean_terminated_length": 87.125, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.2818223061040044, "epoch": 0.05934718100890208, "grad_norm": 3.715052366256714, "kl_approx": 0.16213226318359375, "learning_rate": 1.1568627450980394e-05, "loss": 0.0902, "num_tokens": 1434461.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2972204685211182, "sampling/importance_sampling_ratio/mean": 0.9993278384208679, "sampling/importance_sampling_ratio/min": 0.7910410165786743, "sampling/sampling_logp_difference/max": 0.2602238655090332, "sampling/sampling_logp_difference/mean": 0.0068718609400093555, "step": 60 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 305.0, "completions/max_terminated_length": 305.0, "completions/mean_length": 110.21875, "completions/mean_terminated_length": 110.21875, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.5369161823764443, "epoch": 0.06033630069238378, "grad_norm": 3.9810492992401123, "kl_approx": 0.19330596923828125, "learning_rate": 1.1764705882352942e-05, "loss": 0.1446, "num_tokens": 1456820.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1823234558105469, "sampling/importance_sampling_ratio/mean": 1.0000263452529907, "sampling/importance_sampling_ratio/min": 0.7547599077224731, "sampling/sampling_logp_difference/max": 0.281355619430542, "sampling/sampling_logp_difference/mean": 0.012838956899940968, "step": 61 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 478.0, "completions/max_terminated_length": 478.0, "completions/mean_length": 143.1875, "completions/mean_terminated_length": 143.1875, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.3660207106731832, "epoch": 0.06132542037586548, "grad_norm": 3.04774808883667, "kl_approx": 0.18878936767578125, "learning_rate": 1.1960784313725491e-05, "loss": 0.1077, "num_tokens": 1486658.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2588038444519043, "sampling/importance_sampling_ratio/mean": 1.0000052452087402, "sampling/importance_sampling_ratio/min": 0.8176159262657166, "sampling/sampling_logp_difference/max": 0.2301619052886963, "sampling/sampling_logp_difference/mean": 0.010408961214125156, "step": 62 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 509.0, "completions/max_terminated_length": 509.0, "completions/mean_length": 148.90625, "completions/mean_terminated_length": 148.90625, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.7495590569451451, "epoch": 0.06231454005934718, "grad_norm": 4.467825412750244, "kl_approx": 0.285797119140625, "learning_rate": 1.215686274509804e-05, "loss": 0.2146, "num_tokens": 1508367.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2406947612762451, "sampling/importance_sampling_ratio/mean": 0.9999914169311523, "sampling/importance_sampling_ratio/min": 0.793444037437439, "sampling/sampling_logp_difference/max": 0.23137235641479492, "sampling/sampling_logp_difference/mean": 0.017643310129642487, "step": 63 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 345.0, "completions/max_terminated_length": 345.0, "completions/mean_length": 139.9375, "completions/mean_terminated_length": 139.9375, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.5831932504661381, "epoch": 0.06330365974282888, "grad_norm": 7.5350823402404785, "kl_approx": 0.2658271789550781, "learning_rate": 1.235294117647059e-05, "loss": 0.1766, "num_tokens": 1529909.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2842048406600952, "sampling/importance_sampling_ratio/mean": 1.000518798828125, "sampling/importance_sampling_ratio/min": 0.7359094023704529, "sampling/sampling_logp_difference/max": 0.30664825439453125, "sampling/sampling_logp_difference/mean": 0.015831125900149345, "step": 64 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 292.0, "completions/max_terminated_length": 292.0, "completions/mean_length": 84.71875, "completions/mean_terminated_length": 84.71875, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.5008618012070656, "epoch": 0.06429277942631058, "grad_norm": 4.710756301879883, "kl_approx": 0.27294158935546875, "learning_rate": 1.2549019607843138e-05, "loss": 0.1516, "num_tokens": 1551276.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3586218357086182, "sampling/importance_sampling_ratio/mean": 1.0008198022842407, "sampling/importance_sampling_ratio/min": 0.8010686039924622, "sampling/sampling_logp_difference/max": 0.3064708709716797, "sampling/sampling_logp_difference/mean": 0.013259034603834152, "step": 65 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 328.0, "completions/max_terminated_length": 328.0, "completions/mean_length": 156.5625, "completions/mean_terminated_length": 156.5625, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.6333168176934123, "epoch": 0.06528189910979229, "grad_norm": 4.57286262512207, "kl_approx": 0.258544921875, "learning_rate": 1.2745098039215686e-05, "loss": 0.2034, "num_tokens": 1572078.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.330077052116394, "sampling/importance_sampling_ratio/mean": 1.0002566576004028, "sampling/importance_sampling_ratio/min": 0.7931466698646545, "sampling/sampling_logp_difference/max": 0.28523683547973633, "sampling/sampling_logp_difference/mean": 0.014598055742681026, "step": 66 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 538.0, "completions/max_terminated_length": 538.0, "completions/mean_length": 182.40625, "completions/mean_terminated_length": 182.40625, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.7425875635817647, "epoch": 0.06627101879327399, "grad_norm": 4.569087982177734, "kl_approx": 0.23430633544921875, "learning_rate": 1.2941176470588238e-05, "loss": 0.1771, "num_tokens": 1596371.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3222166299819946, "sampling/importance_sampling_ratio/mean": 1.0001628398895264, "sampling/importance_sampling_ratio/min": 0.7878240346908569, "sampling/sampling_logp_difference/max": 0.27930963039398193, "sampling/sampling_logp_difference/mean": 0.01689918339252472, "step": 67 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 775.0, "completions/max_terminated_length": 775.0, "completions/mean_length": 246.65625, "completions/mean_terminated_length": 246.65625, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.7379114059731364, "epoch": 0.06726013847675569, "grad_norm": 4.0915327072143555, "kl_approx": 0.24199676513671875, "learning_rate": 1.3137254901960785e-05, "loss": 0.1662, "num_tokens": 1622288.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.4416778087615967, "sampling/importance_sampling_ratio/mean": 0.9996952414512634, "sampling/importance_sampling_ratio/min": 0.7524896860122681, "sampling/sampling_logp_difference/max": 0.36580753326416016, "sampling/sampling_logp_difference/mean": 0.01640690304338932, "step": 68 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 178.0, "completions/max_terminated_length": 178.0, "completions/mean_length": 110.59375, "completions/mean_terminated_length": 110.59375, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.5114238555543125, "epoch": 0.06824925816023739, "grad_norm": 3.7289226055145264, "kl_approx": 0.24538516998291016, "learning_rate": 1.3333333333333333e-05, "loss": 0.1315, "num_tokens": 1646963.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2762572765350342, "sampling/importance_sampling_ratio/mean": 0.9999822378158569, "sampling/importance_sampling_ratio/min": 0.8291629552841187, "sampling/sampling_logp_difference/max": 0.24393177032470703, "sampling/sampling_logp_difference/mean": 0.01177594531327486, "step": 69 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 476.0, "completions/max_terminated_length": 476.0, "completions/mean_length": 145.125, "completions/mean_terminated_length": 145.125, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.7065270124003291, "epoch": 0.06923837784371908, "grad_norm": 3.5972189903259277, "kl_approx": 0.2792510986328125, "learning_rate": 1.3529411764705885e-05, "loss": 0.1745, "num_tokens": 1666839.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.212645173072815, "sampling/importance_sampling_ratio/mean": 1.0000544786453247, "sampling/importance_sampling_ratio/min": 0.4468255937099457, "sampling/sampling_logp_difference/max": 0.8055869340896606, "sampling/sampling_logp_difference/mean": 0.018307412043213844, "step": 70 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 611.0, "completions/max_terminated_length": 611.0, "completions/mean_length": 138.53125, "completions/mean_terminated_length": 138.53125, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.7211345219984651, "epoch": 0.0702274975272008, "grad_norm": 5.390006065368652, "kl_approx": 0.393585205078125, "learning_rate": 1.3725490196078432e-05, "loss": 0.2178, "num_tokens": 1686328.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.210097312927246, "sampling/importance_sampling_ratio/mean": 0.9998346567153931, "sampling/importance_sampling_ratio/min": 0.7745994329452515, "sampling/sampling_logp_difference/max": 0.25540924072265625, "sampling/sampling_logp_difference/mean": 0.017397606745362282, "step": 71 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 717.0, "completions/mean_length": 193.09375, "completions/mean_terminated_length": 166.29031372070312, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.7085119737312198, "epoch": 0.0712166172106825, "grad_norm": 4.230503559112549, "kl_approx": 0.2684783935546875, "learning_rate": 1.392156862745098e-05, "loss": 0.1732, "num_tokens": 1716051.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2566486597061157, "sampling/importance_sampling_ratio/mean": 1.0002861022949219, "sampling/importance_sampling_ratio/min": 0.7851418256759644, "sampling/sampling_logp_difference/max": 0.24189090728759766, "sampling/sampling_logp_difference/mean": 0.016826679930090904, "step": 72 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 206.0, "completions/max_terminated_length": 206.0, "completions/mean_length": 82.5625, "completions/mean_terminated_length": 82.5625, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.38565474888309836, "epoch": 0.0722057368941642, "grad_norm": 3.6139774322509766, "kl_approx": 0.16648483276367188, "learning_rate": 1.4117647058823532e-05, "loss": 0.1046, "num_tokens": 1741701.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.159116268157959, "sampling/importance_sampling_ratio/mean": 0.9989307522773743, "sampling/importance_sampling_ratio/min": 0.8333114981651306, "sampling/sampling_logp_difference/max": 0.18234777450561523, "sampling/sampling_logp_difference/mean": 0.009898793883621693, "step": 73 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 574.0, "completions/max_terminated_length": 574.0, "completions/mean_length": 142.40625, "completions/mean_terminated_length": 142.40625, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.6197466151788831, "epoch": 0.07319485657764589, "grad_norm": 4.112690448760986, "kl_approx": 0.2643890380859375, "learning_rate": 1.431372549019608e-05, "loss": 0.1906, "num_tokens": 1760690.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1888421773910522, "sampling/importance_sampling_ratio/mean": 1.0007389783859253, "sampling/importance_sampling_ratio/min": 0.7927209138870239, "sampling/sampling_logp_difference/max": 0.2322840690612793, "sampling/sampling_logp_difference/mean": 0.0161321759223938, "step": 74 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 883.0, "completions/max_terminated_length": 883.0, "completions/mean_length": 162.8125, "completions/mean_terminated_length": 162.8125, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.6469260104931891, "epoch": 0.07418397626112759, "grad_norm": 4.854889869689941, "kl_approx": 0.210357666015625, "learning_rate": 1.4509803921568629e-05, "loss": 0.1751, "num_tokens": 1787468.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2213832139968872, "sampling/importance_sampling_ratio/mean": 0.9998693466186523, "sampling/importance_sampling_ratio/min": 0.7829110622406006, "sampling/sampling_logp_difference/max": 0.2447361946105957, "sampling/sampling_logp_difference/mean": 0.01834258995950222, "step": 75 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 349.0, "completions/max_terminated_length": 349.0, "completions/mean_length": 123.21875, "completions/mean_terminated_length": 123.21875, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.5755073186010122, "epoch": 0.0751730959446093, "grad_norm": 3.652179479598999, "kl_approx": 0.20203399658203125, "learning_rate": 1.4705882352941179e-05, "loss": 0.1461, "num_tokens": 1808715.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2707154750823975, "sampling/importance_sampling_ratio/mean": 0.9996893405914307, "sampling/importance_sampling_ratio/min": 0.7929303646087646, "sampling/sampling_logp_difference/max": 0.2395801544189453, "sampling/sampling_logp_difference/mean": 0.013100972399115562, "step": 76 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 136.0, "completions/max_terminated_length": 136.0, "completions/mean_length": 67.1875, "completions/mean_terminated_length": 67.1875, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.5051397397182882, "epoch": 0.076162215628091, "grad_norm": 5.326716423034668, "kl_approx": 0.20829010009765625, "learning_rate": 1.4901960784313726e-05, "loss": 0.1792, "num_tokens": 1828777.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.136636734008789, "sampling/importance_sampling_ratio/mean": 0.9984632134437561, "sampling/importance_sampling_ratio/min": 0.8360645174980164, "sampling/sampling_logp_difference/max": 0.17904949188232422, "sampling/sampling_logp_difference/mean": 0.011927456595003605, "step": 77 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 340.0, "completions/max_terminated_length": 340.0, "completions/mean_length": 133.40625, "completions/mean_terminated_length": 133.40625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.5220940811559558, "epoch": 0.0771513353115727, "grad_norm": 3.3579773902893066, "kl_approx": 0.2205352783203125, "learning_rate": 1.5098039215686276e-05, "loss": 0.1369, "num_tokens": 1853606.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1806988716125488, "sampling/importance_sampling_ratio/mean": 0.9996694326400757, "sampling/importance_sampling_ratio/min": 0.7869690656661987, "sampling/sampling_logp_difference/max": 0.23956632614135742, "sampling/sampling_logp_difference/mean": 0.012044726870954037, "step": 78 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 262.0, "completions/max_terminated_length": 262.0, "completions/mean_length": 93.1875, "completions/mean_terminated_length": 93.1875, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.4660562495701015, "epoch": 0.0781404549950544, "grad_norm": 4.1132659912109375, "kl_approx": 0.181182861328125, "learning_rate": 1.5294117647058822e-05, "loss": 0.1463, "num_tokens": 1876068.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2498778104782104, "sampling/importance_sampling_ratio/mean": 1.0000693798065186, "sampling/importance_sampling_ratio/min": 0.839215099811554, "sampling/sampling_logp_difference/max": 0.22304582595825195, "sampling/sampling_logp_difference/mean": 0.010969881899654865, "step": 79 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 233.0, "completions/max_terminated_length": 233.0, "completions/mean_length": 98.8125, "completions/mean_terminated_length": 98.8125, "completions/min_length": 23.0, "completions/min_terminated_length": 23.0, "entropy": 0.5295102949021384, "epoch": 0.0791295746785361, "grad_norm": 3.925215721130371, "kl_approx": 0.29920434951782227, "learning_rate": 1.5490196078431373e-05, "loss": 0.1502, "num_tokens": 1897222.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2634944915771484, "sampling/importance_sampling_ratio/mean": 0.9994741678237915, "sampling/importance_sampling_ratio/min": 0.8290769457817078, "sampling/sampling_logp_difference/max": 0.23388123512268066, "sampling/sampling_logp_difference/mean": 0.012161962687969208, "step": 80 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 887.0, "completions/max_terminated_length": 887.0, "completions/mean_length": 145.96875, "completions/mean_terminated_length": 145.96875, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.658632637001574, "epoch": 0.08011869436201781, "grad_norm": 4.738213539123535, "kl_approx": 0.29586029052734375, "learning_rate": 1.568627450980392e-05, "loss": 0.1785, "num_tokens": 1920757.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2729096412658691, "sampling/importance_sampling_ratio/mean": 1.0000708103179932, "sampling/importance_sampling_ratio/min": 0.772980809211731, "sampling/sampling_logp_difference/max": 0.2575010061264038, "sampling/sampling_logp_difference/mean": 0.014527578838169575, "step": 81 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 508.0, "completions/max_terminated_length": 508.0, "completions/mean_length": 143.5, "completions/mean_terminated_length": 143.5, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.7595312488265336, "epoch": 0.08110781404549951, "grad_norm": 4.447983264923096, "kl_approx": 0.279693603515625, "learning_rate": 1.5882352941176473e-05, "loss": 0.2166, "num_tokens": 1945133.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1928465366363525, "sampling/importance_sampling_ratio/mean": 1.0001873970031738, "sampling/importance_sampling_ratio/min": 0.7964349389076233, "sampling/sampling_logp_difference/max": 0.22760987281799316, "sampling/sampling_logp_difference/mean": 0.017735807225108147, "step": 82 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 503.0, "completions/max_terminated_length": 503.0, "completions/mean_length": 146.65625, "completions/mean_terminated_length": 146.65625, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.6563051482662559, "epoch": 0.0820969337289812, "grad_norm": 4.7257304191589355, "kl_approx": 0.24554443359375, "learning_rate": 1.607843137254902e-05, "loss": 0.1841, "num_tokens": 1960418.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2431120872497559, "sampling/importance_sampling_ratio/mean": 1.0000678300857544, "sampling/importance_sampling_ratio/min": 0.7770373821258545, "sampling/sampling_logp_difference/max": 0.25226688385009766, "sampling/sampling_logp_difference/mean": 0.01416561659425497, "step": 83 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 356.0, "completions/max_terminated_length": 356.0, "completions/mean_length": 106.0625, "completions/mean_terminated_length": 106.0625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.4924747720360756, "epoch": 0.0830860534124629, "grad_norm": 3.2110092639923096, "kl_approx": 0.16954803466796875, "learning_rate": 1.627450980392157e-05, "loss": 0.1172, "num_tokens": 1982412.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2176752090454102, "sampling/importance_sampling_ratio/mean": 1.000216007232666, "sampling/importance_sampling_ratio/min": 0.800976037979126, "sampling/sampling_logp_difference/max": 0.2219243049621582, "sampling/sampling_logp_difference/mean": 0.012952733784914017, "step": 84 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 450.0, "completions/mean_length": 159.875, "completions/mean_terminated_length": 132.0, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.6197850131429732, "epoch": 0.0840751730959446, "grad_norm": 4.267870903015137, "kl_approx": 0.3108978271484375, "learning_rate": 1.647058823529412e-05, "loss": 0.1784, "num_tokens": 2010024.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2554748058319092, "sampling/importance_sampling_ratio/mean": 0.9985430240631104, "sampling/importance_sampling_ratio/min": 0.811707079410553, "sampling/sampling_logp_difference/max": 0.22751379013061523, "sampling/sampling_logp_difference/mean": 0.01452487614005804, "step": 85 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 813.0, "completions/max_terminated_length": 813.0, "completions/mean_length": 141.90625, "completions/mean_terminated_length": 141.90625, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.5942427241243422, "epoch": 0.08506429277942631, "grad_norm": 4.358031272888184, "kl_approx": 0.347015380859375, "learning_rate": 1.6666666666666667e-05, "loss": 0.1949, "num_tokens": 2036893.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2746130228042603, "sampling/importance_sampling_ratio/mean": 0.9995061159133911, "sampling/importance_sampling_ratio/min": 0.8187244534492493, "sampling/sampling_logp_difference/max": 0.24264264106750488, "sampling/sampling_logp_difference/mean": 0.014404760673642159, "step": 86 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 483.0, "completions/max_terminated_length": 483.0, "completions/mean_length": 116.28125, "completions/mean_terminated_length": 116.28125, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.5420629633590579, "epoch": 0.08605341246290801, "grad_norm": 4.053826808929443, "kl_approx": 0.23535537719726562, "learning_rate": 1.686274509803922e-05, "loss": 0.16, "num_tokens": 2056062.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3019064664840698, "sampling/importance_sampling_ratio/mean": 1.0003461837768555, "sampling/importance_sampling_ratio/min": 0.7194052934646606, "sampling/sampling_logp_difference/max": 0.3293304443359375, "sampling/sampling_logp_difference/mean": 0.014076776802539825, "step": 87 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 328.0, "completions/max_terminated_length": 328.0, "completions/mean_length": 106.3125, "completions/mean_terminated_length": 106.3125, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.4662083578296006, "epoch": 0.08704253214638971, "grad_norm": 3.5453341007232666, "kl_approx": 0.23992919921875, "learning_rate": 1.7058823529411767e-05, "loss": 0.1495, "num_tokens": 2084784.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2618094682693481, "sampling/importance_sampling_ratio/mean": 0.9999485611915588, "sampling/importance_sampling_ratio/min": 0.7966673970222473, "sampling/sampling_logp_difference/max": 0.23254680633544922, "sampling/sampling_logp_difference/mean": 0.011845567263662815, "step": 88 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 421.0, "completions/max_terminated_length": 421.0, "completions/mean_length": 147.4375, "completions/mean_terminated_length": 147.4375, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.6805998277850449, "epoch": 0.08803165182987141, "grad_norm": 3.4955856800079346, "kl_approx": 0.25186920166015625, "learning_rate": 1.7254901960784314e-05, "loss": 0.1666, "num_tokens": 2110766.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.6132633686065674, "sampling/importance_sampling_ratio/mean": 0.9999154210090637, "sampling/importance_sampling_ratio/min": 0.703249454498291, "sampling/sampling_logp_difference/max": 0.4782590866088867, "sampling/sampling_logp_difference/mean": 0.014171433635056019, "step": 89 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 232.0, "completions/max_terminated_length": 232.0, "completions/mean_length": 92.96875, "completions/mean_terminated_length": 92.96875, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6654437128454447, "epoch": 0.08902077151335312, "grad_norm": 3.8866493701934814, "kl_approx": 0.21889495849609375, "learning_rate": 1.7450980392156866e-05, "loss": 0.1781, "num_tokens": 2133437.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2338017225265503, "sampling/importance_sampling_ratio/mean": 1.0004531145095825, "sampling/importance_sampling_ratio/min": 0.5772315263748169, "sampling/sampling_logp_difference/max": 0.5495117902755737, "sampling/sampling_logp_difference/mean": 0.015423045493662357, "step": 90 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 422.0, "completions/max_terminated_length": 422.0, "completions/mean_length": 106.09375, "completions/mean_terminated_length": 106.09375, "completions/min_length": 19.0, "completions/min_terminated_length": 19.0, "entropy": 0.5722916247323155, "epoch": 0.09000989119683482, "grad_norm": 3.762639045715332, "kl_approx": 0.30530548095703125, "learning_rate": 1.7647058823529414e-05, "loss": 0.1607, "num_tokens": 2154136.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1478874683380127, "sampling/importance_sampling_ratio/mean": 0.9992611408233643, "sampling/importance_sampling_ratio/min": 0.7661829590797424, "sampling/sampling_logp_difference/max": 0.26633429527282715, "sampling/sampling_logp_difference/mean": 0.01384639646857977, "step": 91 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 201.0, "completions/max_terminated_length": 201.0, "completions/mean_length": 87.21875, "completions/mean_terminated_length": 87.21875, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.5211337637156248, "epoch": 0.09099901088031652, "grad_norm": 3.4914159774780273, "kl_approx": 0.21887969970703125, "learning_rate": 1.7843137254901965e-05, "loss": 0.1241, "num_tokens": 2180935.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2110965251922607, "sampling/importance_sampling_ratio/mean": 1.0001884698867798, "sampling/importance_sampling_ratio/min": 0.8818774819374084, "sampling/sampling_logp_difference/max": 0.19152617454528809, "sampling/sampling_logp_difference/mean": 0.011368767358362675, "step": 92 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 230.0, "completions/max_terminated_length": 230.0, "completions/mean_length": 93.5, "completions/mean_terminated_length": 93.5, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.545645251404494, "epoch": 0.09198813056379822, "grad_norm": 4.095757484436035, "kl_approx": 0.27759552001953125, "learning_rate": 1.8039215686274513e-05, "loss": 0.2176, "num_tokens": 2196759.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2412327527999878, "sampling/importance_sampling_ratio/mean": 0.9990619421005249, "sampling/importance_sampling_ratio/min": 0.8541035652160645, "sampling/sampling_logp_difference/max": 0.21610498428344727, "sampling/sampling_logp_difference/mean": 0.012378948740661144, "step": 93 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 982.0, "completions/max_terminated_length": 982.0, "completions/mean_length": 163.28125, "completions/mean_terminated_length": 163.28125, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.7363119008950889, "epoch": 0.09297725024727992, "grad_norm": 3.907405138015747, "kl_approx": 0.373992919921875, "learning_rate": 1.823529411764706e-05, "loss": 0.1871, "num_tokens": 2222552.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1711499691009521, "sampling/importance_sampling_ratio/mean": 1.0000168085098267, "sampling/importance_sampling_ratio/min": 0.7566782236099243, "sampling/sampling_logp_difference/max": 0.27881717681884766, "sampling/sampling_logp_difference/mean": 0.01468683872371912, "step": 94 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 971.0, "completions/max_terminated_length": 971.0, "completions/mean_length": 173.4375, "completions/mean_terminated_length": 173.4375, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.5695787584409118, "epoch": 0.09396636993076163, "grad_norm": 4.660771369934082, "kl_approx": 0.2996368408203125, "learning_rate": 1.843137254901961e-05, "loss": 0.2144, "num_tokens": 2246502.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2650411128997803, "sampling/importance_sampling_ratio/mean": 1.000042200088501, "sampling/importance_sampling_ratio/min": 0.7962116599082947, "sampling/sampling_logp_difference/max": 0.23510456085205078, "sampling/sampling_logp_difference/mean": 0.01371805276721716, "step": 95 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 981.0, "completions/mean_length": 268.5, "completions/mean_terminated_length": 244.1290283203125, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.701228266581893, "epoch": 0.09495548961424333, "grad_norm": 3.1961963176727295, "kl_approx": 0.26605987548828125, "learning_rate": 1.862745098039216e-05, "loss": 0.1678, "num_tokens": 2278286.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2763711214065552, "sampling/importance_sampling_ratio/mean": 1.0001819133758545, "sampling/importance_sampling_ratio/min": 0.7788647413253784, "sampling/sampling_logp_difference/max": 0.24991798400878906, "sampling/sampling_logp_difference/mean": 0.016298644244670868, "step": 96 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 789.0, "completions/max_terminated_length": 789.0, "completions/mean_length": 179.6875, "completions/mean_terminated_length": 179.6875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.5723489276133478, "epoch": 0.09594460929772503, "grad_norm": 4.202455997467041, "kl_approx": 0.280120849609375, "learning_rate": 1.8823529411764708e-05, "loss": 0.1963, "num_tokens": 2303932.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2651300430297852, "sampling/importance_sampling_ratio/mean": 0.999332845211029, "sampling/importance_sampling_ratio/min": 0.7756439447402954, "sampling/sampling_logp_difference/max": 0.2540616989135742, "sampling/sampling_logp_difference/mean": 0.014458324760198593, "step": 97 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 218.0, "completions/max_terminated_length": 218.0, "completions/mean_length": 93.21875, "completions/mean_terminated_length": 93.21875, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.408864579629153, "epoch": 0.09693372898120672, "grad_norm": 3.407325029373169, "kl_approx": 0.19140625, "learning_rate": 1.9019607843137255e-05, "loss": 0.126, "num_tokens": 2327299.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1449666023254395, "sampling/importance_sampling_ratio/mean": 1.0001323223114014, "sampling/importance_sampling_ratio/min": 0.767653226852417, "sampling/sampling_logp_difference/max": 0.2644171714782715, "sampling/sampling_logp_difference/mean": 0.010124210268259048, "step": 98 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 362.0, "completions/max_terminated_length": 362.0, "completions/mean_length": 106.9375, "completions/mean_terminated_length": 106.9375, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.6095218281261623, "epoch": 0.09792284866468842, "grad_norm": 4.767866611480713, "kl_approx": 0.3236122131347656, "learning_rate": 1.9215686274509807e-05, "loss": 0.2244, "num_tokens": 2348033.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.164278507232666, "sampling/importance_sampling_ratio/mean": 1.0005046129226685, "sampling/importance_sampling_ratio/min": 0.7904103994369507, "sampling/sampling_logp_difference/max": 0.23520302772521973, "sampling/sampling_logp_difference/mean": 0.01352311298251152, "step": 99 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 390.0, "completions/max_terminated_length": 390.0, "completions/mean_length": 119.0625, "completions/mean_terminated_length": 119.0625, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.740677310153842, "epoch": 0.09891196834817013, "grad_norm": 4.633357048034668, "kl_approx": 0.379608154296875, "learning_rate": 1.9411764705882355e-05, "loss": 0.2563, "num_tokens": 2373531.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2093089818954468, "sampling/importance_sampling_ratio/mean": 1.0009273290634155, "sampling/importance_sampling_ratio/min": 0.8385035395622253, "sampling/sampling_logp_difference/max": 0.1900491714477539, "sampling/sampling_logp_difference/mean": 0.015810729935765266, "step": 100 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 614.0, "completions/max_terminated_length": 614.0, "completions/mean_length": 164.21875, "completions/mean_terminated_length": 164.21875, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.7902802284806967, "epoch": 0.09990108803165183, "grad_norm": 5.2603840827941895, "kl_approx": 0.45441436767578125, "learning_rate": 1.9607843137254903e-05, "loss": 0.2906, "num_tokens": 2401018.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.258989930152893, "sampling/importance_sampling_ratio/mean": 1.0002994537353516, "sampling/importance_sampling_ratio/min": 0.7966687083244324, "sampling/sampling_logp_difference/max": 0.23030972480773926, "sampling/sampling_logp_difference/mean": 0.01634138822555542, "step": 101 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 330.0, "completions/max_terminated_length": 330.0, "completions/mean_length": 132.15625, "completions/mean_terminated_length": 132.15625, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.7276120446622372, "epoch": 0.10089020771513353, "grad_norm": 3.8905274868011475, "kl_approx": 0.3837432861328125, "learning_rate": 1.9803921568627454e-05, "loss": 0.2333, "num_tokens": 2425047.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2377561330795288, "sampling/importance_sampling_ratio/mean": 0.9996985793113708, "sampling/importance_sampling_ratio/min": 0.8417240977287292, "sampling/sampling_logp_difference/max": 0.21330022811889648, "sampling/sampling_logp_difference/mean": 0.015429042279720306, "step": 102 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 241.0, "completions/max_terminated_length": 241.0, "completions/mean_length": 114.0625, "completions/mean_terminated_length": 114.0625, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.7341065937653184, "epoch": 0.10187932739861523, "grad_norm": 4.386577606201172, "kl_approx": 0.380645751953125, "learning_rate": 2e-05, "loss": 0.2009, "num_tokens": 2449361.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3453978300094604, "sampling/importance_sampling_ratio/mean": 1.0000827312469482, "sampling/importance_sampling_ratio/min": 0.7842176556587219, "sampling/sampling_logp_difference/max": 0.2966897487640381, "sampling/sampling_logp_difference/mean": 0.014964519999921322, "step": 103 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 328.0, "completions/max_terminated_length": 328.0, "completions/mean_length": 123.90625, "completions/mean_terminated_length": 123.90625, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.7485779877752066, "epoch": 0.10286844708209693, "grad_norm": 3.574596881866455, "kl_approx": 0.3981781005859375, "learning_rate": 1.9999940277008807e-05, "loss": 0.2063, "num_tokens": 2474422.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.264679193496704, "sampling/importance_sampling_ratio/mean": 0.9999602437019348, "sampling/importance_sampling_ratio/min": 0.8279533982276917, "sampling/sampling_logp_difference/max": 0.2348184585571289, "sampling/sampling_logp_difference/mean": 0.01481439359486103, "step": 104 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 836.0, "completions/max_terminated_length": 836.0, "completions/mean_length": 180.125, "completions/mean_terminated_length": 180.125, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.8464941820129752, "epoch": 0.10385756676557864, "grad_norm": 5.77216100692749, "kl_approx": 0.47412109375, "learning_rate": 1.99997611087486e-05, "loss": 0.2896, "num_tokens": 2502322.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3012601137161255, "sampling/importance_sampling_ratio/mean": 0.9996833205223083, "sampling/importance_sampling_ratio/min": 0.8167773485183716, "sampling/sampling_logp_difference/max": 0.26333320140838623, "sampling/sampling_logp_difference/mean": 0.01482043694704771, "step": 105 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 934.0, "completions/mean_length": 319.875, "completions/mean_terminated_length": 297.1612854003906, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.7510637398809195, "epoch": 0.10484668644906034, "grad_norm": 3.1025259494781494, "kl_approx": 0.3179473876953125, "learning_rate": 1.9999462497359468e-05, "loss": 0.2132, "num_tokens": 2538238.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2718979120254517, "sampling/importance_sampling_ratio/mean": 0.9991446137428284, "sampling/importance_sampling_ratio/min": 0.8031912446022034, "sampling/sampling_logp_difference/max": 0.2405102252960205, "sampling/sampling_logp_difference/mean": 0.014363830909132957, "step": 106 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 507.0, "completions/max_terminated_length": 507.0, "completions/mean_length": 173.875, "completions/mean_terminated_length": 173.875, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7316669309511781, "epoch": 0.10583580613254204, "grad_norm": 3.9798974990844727, "kl_approx": 0.3847503662109375, "learning_rate": 1.9999044446408203e-05, "loss": 0.2302, "num_tokens": 2562274.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2616320848464966, "sampling/importance_sampling_ratio/mean": 1.0001888275146484, "sampling/importance_sampling_ratio/min": 0.7377116680145264, "sampling/sampling_logp_difference/max": 0.3042023181915283, "sampling/sampling_logp_difference/mean": 0.014552840031683445, "step": 107 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 894.0, "completions/max_terminated_length": 894.0, "completions/mean_length": 197.125, "completions/mean_terminated_length": 197.125, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.8237380003556609, "epoch": 0.10682492581602374, "grad_norm": 3.964432954788208, "kl_approx": 0.30419921875, "learning_rate": 1.9998506960888258e-05, "loss": 0.1923, "num_tokens": 2593718.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2332961559295654, "sampling/importance_sampling_ratio/mean": 1.0005275011062622, "sampling/importance_sampling_ratio/min": 0.773954451084137, "sampling/sampling_logp_difference/max": 0.2562422752380371, "sampling/sampling_logp_difference/mean": 0.015181615017354488, "step": 108 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 405.0, "completions/max_terminated_length": 405.0, "completions/mean_length": 146.875, "completions/mean_terminated_length": 146.875, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.758779913187027, "epoch": 0.10781404549950543, "grad_norm": 4.285181522369385, "kl_approx": 0.3531494140625, "learning_rate": 1.999785004721968e-05, "loss": 0.2097, "num_tokens": 2618434.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.219534158706665, "sampling/importance_sampling_ratio/mean": 0.9998952746391296, "sampling/importance_sampling_ratio/min": 0.7177202105522156, "sampling/sampling_logp_difference/max": 0.33167552947998047, "sampling/sampling_logp_difference/mean": 0.015747712925076485, "step": 109 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 291.0, "completions/max_terminated_length": 291.0, "completions/mean_length": 115.3125, "completions/mean_terminated_length": 115.3125, "completions/min_length": 23.0, "completions/min_terminated_length": 23.0, "entropy": 0.5678953961469233, "epoch": 0.10880316518298715, "grad_norm": 2.912767171859741, "kl_approx": 0.24812889099121094, "learning_rate": 1.999707371324904e-05, "loss": 0.1639, "num_tokens": 2641724.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2738890647888184, "sampling/importance_sampling_ratio/mean": 1.0002368688583374, "sampling/importance_sampling_ratio/min": 0.80885910987854, "sampling/sampling_logp_difference/max": 0.24207448959350586, "sampling/sampling_logp_difference/mean": 0.013785050250589848, "step": 110 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 210.0, "completions/max_terminated_length": 210.0, "completions/mean_length": 72.71875, "completions/mean_terminated_length": 72.71875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.42386614764109254, "epoch": 0.10979228486646884, "grad_norm": 2.873330593109131, "kl_approx": 0.21701812744140625, "learning_rate": 1.9996177968249336e-05, "loss": 0.125, "num_tokens": 2670795.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2316755056381226, "sampling/importance_sampling_ratio/mean": 0.9997743964195251, "sampling/importance_sampling_ratio/min": 0.8671895861625671, "sampling/sampling_logp_difference/max": 0.2083754539489746, "sampling/sampling_logp_difference/mean": 0.009304158389568329, "step": 111 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 181.0, "completions/max_terminated_length": 181.0, "completions/mean_length": 78.65625, "completions/mean_terminated_length": 78.65625, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.5251203184016049, "epoch": 0.11078140454995054, "grad_norm": 4.083740234375, "kl_approx": 0.3099822998046875, "learning_rate": 1.999516282291988e-05, "loss": 0.2088, "num_tokens": 2688560.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1888399124145508, "sampling/importance_sampling_ratio/mean": 0.9998668432235718, "sampling/importance_sampling_ratio/min": 0.7867171168327332, "sampling/sampling_logp_difference/max": 0.23988652229309082, "sampling/sampling_logp_difference/mean": 0.009795577265322208, "step": 112 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 230.0, "completions/max_terminated_length": 230.0, "completions/mean_length": 98.3125, "completions/mean_terminated_length": 98.3125, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.681112757883966, "epoch": 0.11177052423343224, "grad_norm": 5.098729610443115, "kl_approx": 0.3492431640625, "learning_rate": 1.999402828938618e-05, "loss": 0.2723, "num_tokens": 2707826.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.164537787437439, "sampling/importance_sampling_ratio/mean": 0.9997772574424744, "sampling/importance_sampling_ratio/min": 0.7510643601417542, "sampling/sampling_logp_difference/max": 0.28626394271850586, "sampling/sampling_logp_difference/mean": 0.014632935635745525, "step": 113 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 187.0, "completions/max_terminated_length": 187.0, "completions/mean_length": 92.375, "completions/mean_terminated_length": 92.375, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.6517065521329641, "epoch": 0.11275964391691394, "grad_norm": 4.192362308502197, "kl_approx": 0.3641204833984375, "learning_rate": 1.999277438119978e-05, "loss": 0.2464, "num_tokens": 2729990.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1989916563034058, "sampling/importance_sampling_ratio/mean": 1.0002601146697998, "sampling/importance_sampling_ratio/min": 0.7930451035499573, "sampling/sampling_logp_difference/max": 0.23187518119812012, "sampling/sampling_logp_difference/mean": 0.01365387998521328, "step": 114 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 386.0, "completions/max_terminated_length": 386.0, "completions/mean_length": 148.5, "completions/mean_terminated_length": 148.5, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6783338310196996, "epoch": 0.11374876360039565, "grad_norm": 5.984393119812012, "kl_approx": 0.4548492431640625, "learning_rate": 1.9991401113338103e-05, "loss": 0.3117, "num_tokens": 2753750.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.215997576713562, "sampling/importance_sampling_ratio/mean": 1.0003629922866821, "sampling/importance_sampling_ratio/min": 0.795659601688385, "sampling/sampling_logp_difference/max": 0.22858381271362305, "sampling/sampling_logp_difference/mean": 0.013075390830636024, "step": 115 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 165.0, "completions/max_terminated_length": 165.0, "completions/mean_length": 70.71875, "completions/mean_terminated_length": 70.71875, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 0.41725221974775195, "epoch": 0.11473788328387735, "grad_norm": 4.085015773773193, "kl_approx": 0.25689697265625, "learning_rate": 1.9989908502204295e-05, "loss": 0.1716, "num_tokens": 2774245.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2599588632583618, "sampling/importance_sampling_ratio/mean": 1.0001918077468872, "sampling/importance_sampling_ratio/min": 0.8632153272628784, "sampling/sampling_logp_difference/max": 0.2310791015625, "sampling/sampling_logp_difference/mean": 0.008520031347870827, "step": 116 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 436.0, "completions/max_terminated_length": 436.0, "completions/mean_length": 130.34375, "completions/mean_terminated_length": 130.34375, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.7754448829218745, "epoch": 0.11572700296735905, "grad_norm": 4.090041637420654, "kl_approx": 0.4168243408203125, "learning_rate": 1.9988296565626988e-05, "loss": 0.266, "num_tokens": 2795144.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2268414497375488, "sampling/importance_sampling_ratio/mean": 0.9999029636383057, "sampling/importance_sampling_ratio/min": 0.8270318508148193, "sampling/sampling_logp_difference/max": 0.20444297790527344, "sampling/sampling_logp_difference/mean": 0.01447058841586113, "step": 117 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 503.0, "completions/max_terminated_length": 503.0, "completions/mean_length": 137.53125, "completions/mean_terminated_length": 137.53125, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.695324975065887, "epoch": 0.11671612265084075, "grad_norm": 2.9672799110412598, "kl_approx": 0.27996826171875, "learning_rate": 1.9986565322860117e-05, "loss": 0.1866, "num_tokens": 2823585.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2193204164505005, "sampling/importance_sampling_ratio/mean": 0.9997122883796692, "sampling/importance_sampling_ratio/min": 0.8274162411689758, "sampling/sampling_logp_difference/max": 0.19829368591308594, "sampling/sampling_logp_difference/mean": 0.01369547750800848, "step": 118 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 564.0, "completions/max_terminated_length": 564.0, "completions/mean_length": 208.6875, "completions/mean_terminated_length": 208.6875, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 1.0364877041429281, "epoch": 0.11770524233432245, "grad_norm": 3.7812628746032715, "kl_approx": 0.41851806640625, "learning_rate": 1.9984714794582682e-05, "loss": 0.2543, "num_tokens": 2846143.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2559202909469604, "sampling/importance_sampling_ratio/mean": 0.9999114274978638, "sampling/importance_sampling_ratio/min": 0.8150038719177246, "sampling/sampling_logp_difference/max": 0.22786855697631836, "sampling/sampling_logp_difference/mean": 0.017147187143564224, "step": 119 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 437.0, "completions/max_terminated_length": 437.0, "completions/mean_length": 142.59375, "completions/mean_terminated_length": 142.59375, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.9492260534316301, "epoch": 0.11869436201780416, "grad_norm": 3.706278085708618, "kl_approx": 0.42816162109375, "learning_rate": 1.99827450028985e-05, "loss": 0.2319, "num_tokens": 2869554.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.38479483127594, "sampling/importance_sampling_ratio/mean": 1.0000927448272705, "sampling/importance_sampling_ratio/min": 0.8255041241645813, "sampling/sampling_logp_difference/max": 0.32555198669433594, "sampling/sampling_logp_difference/mean": 0.017543373629450798, "step": 120 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 348.0, "completions/max_terminated_length": 348.0, "completions/mean_length": 146.875, "completions/mean_terminated_length": 146.875, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.8445757003501058, "epoch": 0.11968348170128586, "grad_norm": 3.2209582328796387, "kl_approx": 0.3781890869140625, "learning_rate": 1.9980655971335944e-05, "loss": 0.2553, "num_tokens": 2890942.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.573632836341858, "sampling/importance_sampling_ratio/mean": 0.9996671080589294, "sampling/importance_sampling_ratio/min": 0.8194323778152466, "sampling/sampling_logp_difference/max": 0.4533867835998535, "sampling/sampling_logp_difference/mean": 0.01623055338859558, "step": 121 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 994.0, "completions/max_terminated_length": 994.0, "completions/mean_length": 201.25, "completions/mean_terminated_length": 201.25, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.8141225362196565, "epoch": 0.12067260138476756, "grad_norm": 3.3192756175994873, "kl_approx": 0.331939697265625, "learning_rate": 1.9978447724847655e-05, "loss": 0.2015, "num_tokens": 2913166.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2308330535888672, "sampling/importance_sampling_ratio/mean": 1.0001190900802612, "sampling/importance_sampling_ratio/min": 0.795708179473877, "sampling/sampling_logp_difference/max": 0.22852277755737305, "sampling/sampling_logp_difference/mean": 0.017103655263781548, "step": 122 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 534.0, "completions/max_terminated_length": 534.0, "completions/mean_length": 219.375, "completions/mean_terminated_length": 219.375, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 1.0134714087471366, "epoch": 0.12166172106824925, "grad_norm": 3.7369258403778076, "kl_approx": 0.353790283203125, "learning_rate": 1.9976120289810247e-05, "loss": 0.2333, "num_tokens": 2941234.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2188323736190796, "sampling/importance_sampling_ratio/mean": 0.9995399117469788, "sampling/importance_sampling_ratio/min": 0.7955179214477539, "sampling/sampling_logp_difference/max": 0.22876191139221191, "sampling/sampling_logp_difference/mean": 0.018029918894171715, "step": 123 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 1012.0, "completions/max_terminated_length": 1012.0, "completions/mean_length": 175.15625, "completions/mean_terminated_length": 175.15625, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.8084270162507892, "epoch": 0.12265084075173097, "grad_norm": 3.8425707817077637, "kl_approx": 0.3931732177734375, "learning_rate": 1.9973673694024002e-05, "loss": 0.2143, "num_tokens": 2964335.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.4137145280838013, "sampling/importance_sampling_ratio/mean": 1.0000357627868652, "sampling/importance_sampling_ratio/min": 0.7922927141189575, "sampling/sampling_logp_difference/max": 0.3462207317352295, "sampling/sampling_logp_difference/mean": 0.013710507191717625, "step": 124 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 211.0, "completions/max_terminated_length": 211.0, "completions/mean_length": 92.5, "completions/mean_terminated_length": 92.5, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.788776084780693, "epoch": 0.12363996043521266, "grad_norm": 4.461124420166016, "kl_approx": 0.465850830078125, "learning_rate": 1.9971107966712518e-05, "loss": 0.2901, "num_tokens": 2979183.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1524842977523804, "sampling/importance_sampling_ratio/mean": 0.9991501569747925, "sampling/importance_sampling_ratio/min": 0.8436844348907471, "sampling/sampling_logp_difference/max": 0.16997671127319336, "sampling/sampling_logp_difference/mean": 0.014075849205255508, "step": 125 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 574.0, "completions/max_terminated_length": 574.0, "completions/mean_length": 198.8125, "completions/mean_terminated_length": 198.8125, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.7385151144117117, "epoch": 0.12462908011869436, "grad_norm": 3.1229376792907715, "kl_approx": 0.2642364501953125, "learning_rate": 1.9968423138522382e-05, "loss": 0.2085, "num_tokens": 3006497.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1916447877883911, "sampling/importance_sampling_ratio/mean": 1.000024676322937, "sampling/importance_sampling_ratio/min": 0.8050271272659302, "sampling/sampling_logp_difference/max": 0.21687936782836914, "sampling/sampling_logp_difference/mean": 0.013660969212651253, "step": 126 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 318.0, "completions/max_terminated_length": 318.0, "completions/mean_length": 138.59375, "completions/mean_terminated_length": 138.59375, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.7264044368639588, "epoch": 0.12561819980217606, "grad_norm": 3.5425596237182617, "kl_approx": 0.345550537109375, "learning_rate": 1.996561924152278e-05, "loss": 0.2292, "num_tokens": 3027196.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1457940340042114, "sampling/importance_sampling_ratio/mean": 0.9994900226593018, "sampling/importance_sampling_ratio/min": 0.8245117664337158, "sampling/sampling_logp_difference/max": 0.1929638385772705, "sampling/sampling_logp_difference/mean": 0.013796227984130383, "step": 127 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 575.0, "completions/max_terminated_length": 575.0, "completions/mean_length": 100.65625, "completions/mean_terminated_length": 100.65625, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.65774618787691, "epoch": 0.12660731948565776, "grad_norm": 3.4651596546173096, "kl_approx": 0.26280975341796875, "learning_rate": 1.9962696309205146e-05, "loss": 0.2042, "num_tokens": 3049025.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1447635889053345, "sampling/importance_sampling_ratio/mean": 0.9992141723632812, "sampling/importance_sampling_ratio/min": 0.8015051484107971, "sampling/sampling_logp_difference/max": 0.22126388549804688, "sampling/sampling_logp_difference/mean": 0.013278336264193058, "step": 128 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 348.0, "completions/max_terminated_length": 348.0, "completions/mean_length": 90.125, "completions/mean_terminated_length": 90.125, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.673021528404206, "epoch": 0.12759643916913946, "grad_norm": 3.7388739585876465, "kl_approx": 0.348297119140625, "learning_rate": 1.995965437648273e-05, "loss": 0.2312, "num_tokens": 3071413.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1890754699707031, "sampling/importance_sampling_ratio/mean": 1.0004607439041138, "sampling/importance_sampling_ratio/min": 0.7971530556678772, "sampling/sampling_logp_difference/max": 0.22670865058898926, "sampling/sampling_logp_difference/mean": 0.014202319085597992, "step": 129 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 289.0, "completions/max_terminated_length": 289.0, "completions/mean_length": 83.25, "completions/mean_terminated_length": 83.25, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.6157866641879082, "epoch": 0.12858555885262116, "grad_norm": 3.515709400177002, "kl_approx": 0.301788330078125, "learning_rate": 1.995649347969019e-05, "loss": 0.1971, "num_tokens": 3096157.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2816556692123413, "sampling/importance_sampling_ratio/mean": 0.9996862411499023, "sampling/importance_sampling_ratio/min": 0.8433333039283752, "sampling/sampling_logp_difference/max": 0.2481527328491211, "sampling/sampling_logp_difference/mean": 0.012496390379965305, "step": 130 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 534.0, "completions/max_terminated_length": 534.0, "completions/mean_length": 125.9375, "completions/mean_terminated_length": 125.9375, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.7223977474495769, "epoch": 0.12957467853610286, "grad_norm": 3.493124008178711, "kl_approx": 0.334381103515625, "learning_rate": 1.995321365658317e-05, "loss": 0.2321, "num_tokens": 3122715.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.279219627380371, "sampling/importance_sampling_ratio/mean": 1.0001983642578125, "sampling/importance_sampling_ratio/min": 0.779522716999054, "sampling/sampling_logp_difference/max": 0.24907350540161133, "sampling/sampling_logp_difference/mean": 0.013877233490347862, "step": 131 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 396.0, "completions/max_terminated_length": 396.0, "completions/mean_length": 121.4375, "completions/mean_terminated_length": 121.4375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.5878563146106899, "epoch": 0.13056379821958458, "grad_norm": 3.056612014770508, "kl_approx": 0.257598876953125, "learning_rate": 1.994981494633784e-05, "loss": 0.1674, "num_tokens": 3151913.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1949712038040161, "sampling/importance_sampling_ratio/mean": 0.9996578693389893, "sampling/importance_sampling_ratio/min": 0.8144047856330872, "sampling/sampling_logp_difference/max": 0.20529770851135254, "sampling/sampling_logp_difference/mean": 0.012141771614551544, "step": 132 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 628.0, "completions/max_terminated_length": 628.0, "completions/mean_length": 162.59375, "completions/mean_terminated_length": 162.59375, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.8467169459909201, "epoch": 0.13155291790306628, "grad_norm": 3.707963705062866, "kl_approx": 0.359100341796875, "learning_rate": 1.9946297389550433e-05, "loss": 0.2646, "num_tokens": 3175780.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.267918348312378, "sampling/importance_sampling_ratio/mean": 0.9997239708900452, "sampling/importance_sampling_ratio/min": 0.8259754776954651, "sampling/sampling_logp_difference/max": 0.23737645149230957, "sampling/sampling_logp_difference/mean": 0.01623581536114216, "step": 133 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 814.0, "completions/max_terminated_length": 814.0, "completions/mean_length": 146.0625, "completions/mean_terminated_length": 146.0625, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.7495677229017019, "epoch": 0.13254203758654798, "grad_norm": 3.92936635017395, "kl_approx": 0.4515533447265625, "learning_rate": 1.9942661028236746e-05, "loss": 0.3051, "num_tokens": 3202678.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1853837966918945, "sampling/importance_sampling_ratio/mean": 0.9995786547660828, "sampling/importance_sampling_ratio/min": 0.8259376883506775, "sampling/sampling_logp_difference/max": 0.19123601913452148, "sampling/sampling_logp_difference/mean": 0.012967344373464584, "step": 134 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 877.0, "completions/max_terminated_length": 877.0, "completions/mean_length": 305.78125, "completions/mean_terminated_length": 305.78125, "completions/min_length": 82.0, "completions/min_terminated_length": 82.0, "entropy": 1.0335219977423549, "epoch": 0.13353115727002968, "grad_norm": 2.639463424682617, "kl_approx": 0.344879150390625, "learning_rate": 1.9938905905831657e-05, "loss": 0.2526, "num_tokens": 3231591.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2736576795578003, "sampling/importance_sampling_ratio/mean": 1.0002832412719727, "sampling/importance_sampling_ratio/min": 0.772063136100769, "sampling/sampling_logp_difference/max": 0.25868892669677734, "sampling/sampling_logp_difference/mean": 0.017690157517790794, "step": 135 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 827.0, "completions/max_terminated_length": 827.0, "completions/mean_length": 275.21875, "completions/mean_terminated_length": 275.21875, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 1.0136343240737915, "epoch": 0.13452027695351138, "grad_norm": 2.8746609687805176, "kl_approx": 0.364501953125, "learning_rate": 1.993503206718859e-05, "loss": 0.2383, "num_tokens": 3262350.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2130011320114136, "sampling/importance_sampling_ratio/mean": 1.0002808570861816, "sampling/importance_sampling_ratio/min": 0.7758130431175232, "sampling/sampling_logp_difference/max": 0.2538437843322754, "sampling/sampling_logp_difference/mean": 0.016873760148882866, "step": 136 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 703.0, "completions/max_terminated_length": 703.0, "completions/mean_length": 271.90625, "completions/mean_terminated_length": 271.90625, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.7439038986340165, "epoch": 0.13550939663699307, "grad_norm": 2.3194704055786133, "kl_approx": 0.24530029296875, "learning_rate": 1.9931039558578997e-05, "loss": 0.1633, "num_tokens": 3290419.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.8843318223953247, "sampling/importance_sampling_ratio/mean": 1.0003113746643066, "sampling/importance_sampling_ratio/min": 0.8047864437103271, "sampling/sampling_logp_difference/max": 0.6335732936859131, "sampling/sampling_logp_difference/mean": 0.013634921051561832, "step": 137 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 706.0, "completions/max_terminated_length": 706.0, "completions/mean_length": 140.78125, "completions/mean_terminated_length": 140.78125, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.665743570891209, "epoch": 0.13649851632047477, "grad_norm": 2.8517050743103027, "kl_approx": 0.28572845458984375, "learning_rate": 1.9926928427691788e-05, "loss": 0.1952, "num_tokens": 3309324.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2762024402618408, "sampling/importance_sampling_ratio/mean": 0.9995846748352051, "sampling/importance_sampling_ratio/min": 0.8159916996955872, "sampling/sampling_logp_difference/max": 0.24388885498046875, "sampling/sampling_logp_difference/mean": 0.014222693629562855, "step": 138 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 741.0, "completions/max_terminated_length": 741.0, "completions/mean_length": 150.4375, "completions/mean_terminated_length": 150.4375, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.6878425776958466, "epoch": 0.13748763600395647, "grad_norm": 3.4530131816864014, "kl_approx": 0.340484619140625, "learning_rate": 1.992269872363277e-05, "loss": 0.2157, "num_tokens": 3338258.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2046599388122559, "sampling/importance_sampling_ratio/mean": 1.0001176595687866, "sampling/importance_sampling_ratio/min": 0.7968791723251343, "sampling/sampling_logp_difference/max": 0.2270522117614746, "sampling/sampling_logp_difference/mean": 0.012848662212491035, "step": 139 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 887.0, "completions/max_terminated_length": 887.0, "completions/mean_length": 192.15625, "completions/mean_terminated_length": 192.15625, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 1.00134711060673, "epoch": 0.13847675568743817, "grad_norm": 3.532534122467041, "kl_approx": 0.370758056640625, "learning_rate": 1.991835049692405e-05, "loss": 0.2251, "num_tokens": 3361239.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.297330617904663, "sampling/importance_sampling_ratio/mean": 1.0006046295166016, "sampling/importance_sampling_ratio/min": 0.8044227361679077, "sampling/sampling_logp_difference/max": 0.26030874252319336, "sampling/sampling_logp_difference/mean": 0.018435800448060036, "step": 140 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 772.0, "completions/max_terminated_length": 772.0, "completions/mean_length": 214.8125, "completions/mean_terminated_length": 214.8125, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.7120185764506459, "epoch": 0.1394658753709199, "grad_norm": 2.9272654056549072, "kl_approx": 0.3009490966796875, "learning_rate": 1.991388379950346e-05, "loss": 0.1939, "num_tokens": 3390257.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2365518808364868, "sampling/importance_sampling_ratio/mean": 1.0006357431411743, "sampling/importance_sampling_ratio/min": 0.8355432152748108, "sampling/sampling_logp_difference/max": 0.2123267650604248, "sampling/sampling_logp_difference/mean": 0.01206715777516365, "step": 141 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 410.0, "completions/max_terminated_length": 410.0, "completions/mean_length": 133.875, "completions/mean_terminated_length": 133.875, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6778213949874043, "epoch": 0.1404549950544016, "grad_norm": 3.4875831604003906, "kl_approx": 0.3140869140625, "learning_rate": 1.9909298684723905e-05, "loss": 0.1903, "num_tokens": 3413541.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1968603134155273, "sampling/importance_sampling_ratio/mean": 0.9993901252746582, "sampling/importance_sampling_ratio/min": 0.845062255859375, "sampling/sampling_logp_difference/max": 0.1797018051147461, "sampling/sampling_logp_difference/mean": 0.01377237867563963, "step": 142 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 468.0, "completions/max_terminated_length": 468.0, "completions/mean_length": 157.875, "completions/mean_terminated_length": 157.875, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7205053064972162, "epoch": 0.1414441147378833, "grad_norm": 3.157585620880127, "kl_approx": 0.33448028564453125, "learning_rate": 1.9904595207352736e-05, "loss": 0.1991, "num_tokens": 3433289.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2319239377975464, "sampling/importance_sampling_ratio/mean": 1.000170111656189, "sampling/importance_sampling_ratio/min": 0.7970343828201294, "sampling/sampling_logp_difference/max": 0.22685742378234863, "sampling/sampling_logp_difference/mean": 0.014586882665753365, "step": 143 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 518.0, "completions/max_terminated_length": 518.0, "completions/mean_length": 192.4375, "completions/mean_terminated_length": 192.4375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.7360031455755234, "epoch": 0.142433234421365, "grad_norm": 3.2515690326690674, "kl_approx": 0.3509521484375, "learning_rate": 1.9899773423571102e-05, "loss": 0.2009, "num_tokens": 3465903.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2092190980911255, "sampling/importance_sampling_ratio/mean": 1.000055193901062, "sampling/importance_sampling_ratio/min": 0.8104243874549866, "sampling/sampling_logp_difference/max": 0.21019721031188965, "sampling/sampling_logp_difference/mean": 0.014205585233867168, "step": 144 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 288.0, "completions/max_terminated_length": 288.0, "completions/mean_length": 86.96875, "completions/mean_terminated_length": 86.96875, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.47909684432670474, "epoch": 0.1434223541048467, "grad_norm": 3.299182415008545, "kl_approx": 0.2391510009765625, "learning_rate": 1.9894833390973266e-05, "loss": 0.1817, "num_tokens": 3482566.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2213146686553955, "sampling/importance_sampling_ratio/mean": 0.9997127056121826, "sampling/importance_sampling_ratio/min": 0.8729819059371948, "sampling/sampling_logp_difference/max": 0.19992780685424805, "sampling/sampling_logp_difference/mean": 0.011355416849255562, "step": 145 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 821.0, "completions/max_terminated_length": 821.0, "completions/mean_length": 104.15625, "completions/mean_terminated_length": 104.15625, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.6040189173072577, "epoch": 0.1444114737883284, "grad_norm": 2.6128745079040527, "kl_approx": 0.29138946533203125, "learning_rate": 1.9889775168565942e-05, "loss": 0.1523, "num_tokens": 3502923.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2069822549819946, "sampling/importance_sampling_ratio/mean": 1.000307321548462, "sampling/importance_sampling_ratio/min": 0.8034505248069763, "sampling/sampling_logp_difference/max": 0.21883970499038696, "sampling/sampling_logp_difference/mean": 0.01206815242767334, "step": 146 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 517.0, "completions/max_terminated_length": 517.0, "completions/mean_length": 198.1875, "completions/mean_terminated_length": 198.1875, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.7451638225466013, "epoch": 0.14540059347181009, "grad_norm": 3.3588709831237793, "kl_approx": 0.2706146240234375, "learning_rate": 1.9884598816767563e-05, "loss": 0.2074, "num_tokens": 3531977.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2334710359573364, "sampling/importance_sampling_ratio/mean": 1.000329852104187, "sampling/importance_sampling_ratio/min": 0.7879751920700073, "sampling/sampling_logp_difference/max": 0.23828864097595215, "sampling/sampling_logp_difference/mean": 0.014222600497305393, "step": 147 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 428.0, "completions/max_terminated_length": 428.0, "completions/mean_length": 158.875, "completions/mean_terminated_length": 158.875, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.6897634696215391, "epoch": 0.14638971315529178, "grad_norm": 3.2062039375305176, "kl_approx": 0.3004302978515625, "learning_rate": 1.987930439740757e-05, "loss": 0.2006, "num_tokens": 3560021.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2588196992874146, "sampling/importance_sampling_ratio/mean": 0.9999896287918091, "sampling/importance_sampling_ratio/min": 0.8409462571144104, "sampling/sampling_logp_difference/max": 0.23017454147338867, "sampling/sampling_logp_difference/mean": 0.01389367040246725, "step": 148 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 221.0, "completions/max_terminated_length": 221.0, "completions/mean_length": 86.625, "completions/mean_terminated_length": 86.625, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.52367312181741, "epoch": 0.14737883283877348, "grad_norm": 2.776329517364502, "kl_approx": 0.2728729248046875, "learning_rate": 1.9873891973725673e-05, "loss": 0.1638, "num_tokens": 3585089.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1584150791168213, "sampling/importance_sampling_ratio/mean": 1.0003002882003784, "sampling/importance_sampling_ratio/min": 0.8473848700523376, "sampling/sampling_logp_difference/max": 0.16560029983520508, "sampling/sampling_logp_difference/mean": 0.010013856925070286, "step": 149 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 298.0, "completions/max_terminated_length": 298.0, "completions/mean_length": 106.3125, "completions/mean_terminated_length": 106.3125, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.5564784072339535, "epoch": 0.14836795252225518, "grad_norm": 2.86161208152771, "kl_approx": 0.2273406982421875, "learning_rate": 1.98683616103711e-05, "loss": 0.1612, "num_tokens": 3606235.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2571991682052612, "sampling/importance_sampling_ratio/mean": 0.9994977712631226, "sampling/importance_sampling_ratio/min": 0.7923993468284607, "sampling/sampling_logp_difference/max": 0.23268985748291016, "sampling/sampling_logp_difference/mean": 0.012471191585063934, "step": 150 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 458.0, "completions/max_terminated_length": 458.0, "completions/mean_length": 176.5, "completions/mean_terminated_length": 176.5, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.8884472846984863, "epoch": 0.1493570722057369, "grad_norm": 3.5079596042633057, "kl_approx": 0.347076416015625, "learning_rate": 1.986271337340182e-05, "loss": 0.2555, "num_tokens": 3630483.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2813501358032227, "sampling/importance_sampling_ratio/mean": 1.0000793933868408, "sampling/importance_sampling_ratio/min": 0.7779307961463928, "sampling/sampling_logp_difference/max": 0.2511177062988281, "sampling/sampling_logp_difference/mean": 0.015513719990849495, "step": 151 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 1021.0, "completions/mean_length": 221.875, "completions/mean_terminated_length": 196.0, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.8409735849127173, "epoch": 0.1503461918892186, "grad_norm": 2.913163423538208, "kl_approx": 0.304290771484375, "learning_rate": 1.9856947330283752e-05, "loss": 0.2101, "num_tokens": 3657103.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2671051025390625, "sampling/importance_sampling_ratio/mean": 0.9994755983352661, "sampling/importance_sampling_ratio/min": 0.7095960974693298, "sampling/sampling_logp_difference/max": 0.34305936098098755, "sampling/sampling_logp_difference/mean": 0.014956234022974968, "step": 152 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 629.0, "completions/max_terminated_length": 629.0, "completions/mean_length": 198.1875, "completions/mean_terminated_length": 198.1875, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7537503028288484, "epoch": 0.1513353115727003, "grad_norm": 3.0429210662841797, "kl_approx": 0.3447265625, "learning_rate": 1.985106354988997e-05, "loss": 0.259, "num_tokens": 3684909.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1934473514556885, "sampling/importance_sampling_ratio/mean": 0.9998313784599304, "sampling/importance_sampling_ratio/min": 0.8096355199813843, "sampling/sampling_logp_difference/max": 0.21117115020751953, "sampling/sampling_logp_difference/mean": 0.014254819601774216, "step": 153 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 597.0, "completions/max_terminated_length": 597.0, "completions/mean_length": 124.78125, "completions/mean_terminated_length": 124.78125, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6247568116523325, "epoch": 0.152324431256182, "grad_norm": 2.672576427459717, "kl_approx": 0.300811767578125, "learning_rate": 1.984506210249986e-05, "loss": 0.1681, "num_tokens": 3708878.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1651464700698853, "sampling/importance_sampling_ratio/mean": 0.9997557401657104, "sampling/importance_sampling_ratio/min": 0.7907420992851257, "sampling/sampling_logp_difference/max": 0.23478341102600098, "sampling/sampling_logp_difference/mean": 0.012037264183163643, "step": 154 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 979.0, "completions/max_terminated_length": 979.0, "completions/mean_length": 174.0625, "completions/mean_terminated_length": 174.0625, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.5881611919030547, "epoch": 0.1533135509396637, "grad_norm": 3.105463743209839, "kl_approx": 0.23784637451171875, "learning_rate": 1.9838943059798305e-05, "loss": 0.1565, "num_tokens": 3733720.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.195961356163025, "sampling/importance_sampling_ratio/mean": 0.9997238516807556, "sampling/importance_sampling_ratio/min": 0.8026215434074402, "sampling/sampling_logp_difference/max": 0.21987199783325195, "sampling/sampling_logp_difference/mean": 0.011494816280901432, "step": 155 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 293.0, "completions/max_terminated_length": 293.0, "completions/mean_length": 114.78125, "completions/mean_terminated_length": 114.78125, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.7020180281251669, "epoch": 0.1543026706231454, "grad_norm": 3.6018433570861816, "kl_approx": 0.30696868896484375, "learning_rate": 1.9832706494874812e-05, "loss": 0.1799, "num_tokens": 3754737.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2384921312332153, "sampling/importance_sampling_ratio/mean": 1.0007057189941406, "sampling/importance_sampling_ratio/min": 0.8484919667243958, "sampling/sampling_logp_difference/max": 0.21389460563659668, "sampling/sampling_logp_difference/mean": 0.012855030596256256, "step": 156 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 501.0, "completions/max_terminated_length": 501.0, "completions/mean_length": 145.59375, "completions/mean_terminated_length": 145.59375, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.7499087369069457, "epoch": 0.1552917903066271, "grad_norm": 3.3212716579437256, "kl_approx": 0.3294525146484375, "learning_rate": 1.982635248222264e-05, "loss": 0.2113, "num_tokens": 3779452.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2396161556243896, "sampling/importance_sampling_ratio/mean": 1.0000402927398682, "sampling/importance_sampling_ratio/min": 0.7865886688232422, "sampling/sampling_logp_difference/max": 0.2400498390197754, "sampling/sampling_logp_difference/mean": 0.016655726358294487, "step": 157 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 379.0, "completions/max_terminated_length": 379.0, "completions/mean_length": 132.9375, "completions/mean_terminated_length": 132.9375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.6739329663105309, "epoch": 0.1562809099901088, "grad_norm": 2.291365146636963, "kl_approx": 0.23013877868652344, "learning_rate": 1.9819881097737917e-05, "loss": 0.1676, "num_tokens": 3803258.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2654168605804443, "sampling/importance_sampling_ratio/mean": 1.0008260011672974, "sampling/importance_sampling_ratio/min": 0.854902446269989, "sampling/sampling_logp_difference/max": 0.23540163040161133, "sampling/sampling_logp_difference/mean": 0.012866603210568428, "step": 158 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 259.0, "completions/max_terminated_length": 259.0, "completions/mean_length": 89.53125, "completions/mean_terminated_length": 89.53125, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.6572990431450307, "epoch": 0.1572700296735905, "grad_norm": 3.89337158203125, "kl_approx": 0.3024749755859375, "learning_rate": 1.9813292418718734e-05, "loss": 0.2223, "num_tokens": 3828891.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2767776250839233, "sampling/importance_sampling_ratio/mean": 1.0000778436660767, "sampling/importance_sampling_ratio/min": 0.869756281375885, "sampling/sampling_logp_difference/max": 0.2443394660949707, "sampling/sampling_logp_difference/mean": 0.012500524520874023, "step": 159 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 588.0, "completions/max_terminated_length": 588.0, "completions/mean_length": 131.875, "completions/mean_terminated_length": 131.875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6191426855511963, "epoch": 0.1582591493570722, "grad_norm": 4.415280818939209, "kl_approx": 0.421478271484375, "learning_rate": 1.9806586523864212e-05, "loss": 0.3052, "num_tokens": 3855055.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2650364637374878, "sampling/importance_sampling_ratio/mean": 1.0005650520324707, "sampling/importance_sampling_ratio/min": 0.7848238945007324, "sampling/sampling_logp_difference/max": 0.2422959804534912, "sampling/sampling_logp_difference/mean": 0.012121576815843582, "step": 160 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 426.0, "completions/mean_length": 137.875, "completions/mean_terminated_length": 109.29032135009766, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.7634169803932309, "epoch": 0.15924826904055392, "grad_norm": 3.610884189605713, "kl_approx": 0.359588623046875, "learning_rate": 1.9799763493273572e-05, "loss": 0.2192, "num_tokens": 3877203.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2720191478729248, "sampling/importance_sampling_ratio/mean": 1.000068187713623, "sampling/importance_sampling_ratio/min": 0.8429659008979797, "sampling/sampling_logp_difference/max": 0.24060559272766113, "sampling/sampling_logp_difference/mean": 0.012453525327146053, "step": 161 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 853.0, "completions/max_terminated_length": 853.0, "completions/mean_length": 202.71875, "completions/mean_terminated_length": 202.71875, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.8651245888322592, "epoch": 0.16023738872403562, "grad_norm": 2.9442763328552246, "kl_approx": 0.31336212158203125, "learning_rate": 1.9792823408445173e-05, "loss": 0.2007, "num_tokens": 3902882.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.258875846862793, "sampling/importance_sampling_ratio/mean": 1.0000407695770264, "sampling/importance_sampling_ratio/min": 0.7594712376594543, "sampling/sampling_logp_difference/max": 0.2751328945159912, "sampling/sampling_logp_difference/mean": 0.016275566071271896, "step": 162 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 716.0, "completions/max_terminated_length": 716.0, "completions/mean_length": 226.53125, "completions/mean_terminated_length": 226.53125, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.7738486537709832, "epoch": 0.16122650840751732, "grad_norm": 2.517744302749634, "kl_approx": 0.2826194763183594, "learning_rate": 1.978576635227554e-05, "loss": 0.242, "num_tokens": 3930331.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2863456010818481, "sampling/importance_sampling_ratio/mean": 0.9998080134391785, "sampling/importance_sampling_ratio/min": 0.7640848755836487, "sampling/sampling_logp_difference/max": 0.26907646656036377, "sampling/sampling_logp_difference/mean": 0.015387672930955887, "step": 163 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 590.0, "completions/max_terminated_length": 590.0, "completions/mean_length": 193.40625, "completions/mean_terminated_length": 193.40625, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.8344437694177032, "epoch": 0.16221562809099901, "grad_norm": 2.780697822570801, "kl_approx": 0.28790283203125, "learning_rate": 1.9778592409058376e-05, "loss": 0.1961, "num_tokens": 3958688.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1876567602157593, "sampling/importance_sampling_ratio/mean": 0.9996064305305481, "sampling/importance_sampling_ratio/min": 0.7988571524620056, "sampling/sampling_logp_difference/max": 0.22457313537597656, "sampling/sampling_logp_difference/mean": 0.014476037584245205, "step": 164 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 659.0, "completions/max_terminated_length": 659.0, "completions/mean_length": 137.3125, "completions/mean_terminated_length": 137.3125, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.8471739897504449, "epoch": 0.1632047477744807, "grad_norm": 4.318841934204102, "kl_approx": 0.38570404052734375, "learning_rate": 1.9771301664483548e-05, "loss": 0.2909, "num_tokens": 3978818.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3852136135101318, "sampling/importance_sampling_ratio/mean": 0.9999037384986877, "sampling/importance_sampling_ratio/min": 0.8238513469696045, "sampling/sampling_logp_difference/max": 0.3258543014526367, "sampling/sampling_logp_difference/mean": 0.016974125057458878, "step": 165 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 419.0, "completions/max_terminated_length": 419.0, "completions/mean_length": 128.46875, "completions/mean_terminated_length": 128.46875, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.8208950664848089, "epoch": 0.1641938674579624, "grad_norm": 2.9148755073547363, "kl_approx": 0.3923187255859375, "learning_rate": 1.976389420563607e-05, "loss": 0.2515, "num_tokens": 4006073.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3772600889205933, "sampling/importance_sampling_ratio/mean": 1.0003610849380493, "sampling/importance_sampling_ratio/min": 0.736176609992981, "sampling/sampling_logp_difference/max": 0.3200960159301758, "sampling/sampling_logp_difference/mean": 0.014962531626224518, "step": 166 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 609.0, "completions/max_terminated_length": 609.0, "completions/mean_length": 115.375, "completions/mean_terminated_length": 115.375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.7249600132927299, "epoch": 0.1651829871414441, "grad_norm": 3.2919387817382812, "kl_approx": 0.3755035400390625, "learning_rate": 1.975637012099507e-05, "loss": 0.2123, "num_tokens": 4029997.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.183044672012329, "sampling/importance_sampling_ratio/mean": 1.0003975629806519, "sampling/importance_sampling_ratio/min": 0.7889966368675232, "sampling/sampling_logp_difference/max": 0.23699331283569336, "sampling/sampling_logp_difference/mean": 0.012874506413936615, "step": 167 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 376.0, "completions/max_terminated_length": 376.0, "completions/mean_length": 95.46875, "completions/mean_terminated_length": 95.46875, "completions/min_length": 21.0, "completions/min_terminated_length": 21.0, "entropy": 0.7351692164083943, "epoch": 0.1661721068249258, "grad_norm": 3.296281099319458, "kl_approx": 0.3929901123046875, "learning_rate": 1.97487295004327e-05, "loss": 0.2123, "num_tokens": 4051188.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1956899166107178, "sampling/importance_sampling_ratio/mean": 1.0005613565444946, "sampling/importance_sampling_ratio/min": 0.7848471999168396, "sampling/sampling_logp_difference/max": 0.24226617813110352, "sampling/sampling_logp_difference/mean": 0.013580622151494026, "step": 168 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 710.0, "completions/max_terminated_length": 710.0, "completions/mean_length": 184.53125, "completions/mean_terminated_length": 184.53125, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.7059888476505876, "epoch": 0.1671612265084075, "grad_norm": 4.150257110595703, "kl_approx": 0.361114501953125, "learning_rate": 1.9740972435213114e-05, "loss": 0.241, "num_tokens": 4075181.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.4256788492202759, "sampling/importance_sampling_ratio/mean": 0.9996298551559448, "sampling/importance_sampling_ratio/min": 0.8149135708808899, "sampling/sampling_logp_difference/max": 0.3546481132507324, "sampling/sampling_logp_difference/mean": 0.013830306939780712, "step": 169 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 626.0, "completions/max_terminated_length": 626.0, "completions/mean_length": 155.625, "completions/mean_terminated_length": 155.625, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.6838713185861707, "epoch": 0.1681503461918892, "grad_norm": 4.234602928161621, "kl_approx": 0.3809967041015625, "learning_rate": 1.9733099017991342e-05, "loss": 0.2757, "num_tokens": 4095057.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.303252100944519, "sampling/importance_sampling_ratio/mean": 0.9999076724052429, "sampling/importance_sampling_ratio/min": 0.8086825013160706, "sampling/sampling_logp_difference/max": 0.2648627758026123, "sampling/sampling_logp_difference/mean": 0.013494862243533134, "step": 170 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 855.0, "completions/max_terminated_length": 855.0, "completions/mean_length": 243.15625, "completions/mean_terminated_length": 243.15625, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.6644512871280313, "epoch": 0.16913946587537093, "grad_norm": 2.594848871231079, "kl_approx": 0.21328353881835938, "learning_rate": 1.972510934281218e-05, "loss": 0.1656, "num_tokens": 4122542.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2951419353485107, "sampling/importance_sampling_ratio/mean": 1.0000733137130737, "sampling/importance_sampling_ratio/min": 0.7652145028114319, "sampling/sampling_logp_difference/max": 0.26759910583496094, "sampling/sampling_logp_difference/mean": 0.010878982953727245, "step": 171 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 619.0, "completions/mean_length": 252.84375, "completions/mean_terminated_length": 227.9677276611328, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 1.0398688837885857, "epoch": 0.17012858555885263, "grad_norm": 4.199376106262207, "kl_approx": 0.5884552001953125, "learning_rate": 1.9717003505109097e-05, "loss": 0.3295, "num_tokens": 4148985.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.272071123123169, "sampling/importance_sampling_ratio/mean": 0.9997367262840271, "sampling/importance_sampling_ratio/min": 0.796878457069397, "sampling/sampling_logp_difference/max": 0.2406463623046875, "sampling/sampling_logp_difference/mean": 0.016616344451904297, "step": 172 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 715.0, "completions/max_terminated_length": 715.0, "completions/mean_length": 232.9375, "completions/mean_terminated_length": 232.9375, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.7784532429650426, "epoch": 0.17111770524233433, "grad_norm": 2.239717721939087, "kl_approx": 0.2509613037109375, "learning_rate": 1.9708781601703066e-05, "loss": 0.1767, "num_tokens": 4176015.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2318041324615479, "sampling/importance_sampling_ratio/mean": 0.9998577237129211, "sampling/importance_sampling_ratio/min": 0.8284434676170349, "sampling/sampling_logp_difference/max": 0.2084798812866211, "sampling/sampling_logp_difference/mean": 0.013383631594479084, "step": 173 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 481.0, "completions/max_terminated_length": 481.0, "completions/mean_length": 155.78125, "completions/mean_terminated_length": 155.78125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.792903590016067, "epoch": 0.17210682492581603, "grad_norm": 3.1732075214385986, "kl_approx": 0.3128662109375, "learning_rate": 1.9700443730801412e-05, "loss": 0.2143, "num_tokens": 4198488.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1857928037643433, "sampling/importance_sampling_ratio/mean": 0.9998219013214111, "sampling/importance_sampling_ratio/min": 0.8167960047721863, "sampling/sampling_logp_difference/max": 0.20236587524414062, "sampling/sampling_logp_difference/mean": 0.014955122023820877, "step": 174 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 888.0, "completions/max_terminated_length": 888.0, "completions/mean_length": 200.375, "completions/mean_terminated_length": 200.375, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.668834628071636, "epoch": 0.17309594460929772, "grad_norm": 2.112032413482666, "kl_approx": 0.2960700988769531, "learning_rate": 1.9691989991996663e-05, "loss": 0.1635, "num_tokens": 4226844.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.355528712272644, "sampling/importance_sampling_ratio/mean": 1.0006966590881348, "sampling/importance_sampling_ratio/min": 0.8050819635391235, "sampling/sampling_logp_difference/max": 0.30419158935546875, "sampling/sampling_logp_difference/mean": 0.013798365369439125, "step": 175 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 217.0, "completions/max_terminated_length": 217.0, "completions/mean_length": 77.0625, "completions/mean_terminated_length": 77.0625, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.43388065369799733, "epoch": 0.17408506429277942, "grad_norm": 1.8014647960662842, "kl_approx": 0.17783355712890625, "learning_rate": 1.9683420486265328e-05, "loss": 0.0985, "num_tokens": 4245606.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1526026725769043, "sampling/importance_sampling_ratio/mean": 1.0000427961349487, "sampling/importance_sampling_ratio/min": 0.8161384463310242, "sampling/sampling_logp_difference/max": 0.2031712532043457, "sampling/sampling_logp_difference/mean": 0.008749328553676605, "step": 176 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 169.0, "completions/max_terminated_length": 169.0, "completions/mean_length": 66.09375, "completions/mean_terminated_length": 66.09375, "completions/min_length": 29.0, "completions/min_terminated_length": 29.0, "entropy": 0.5946537521667778, "epoch": 0.17507418397626112, "grad_norm": 4.021422386169434, "kl_approx": 0.40715789794921875, "learning_rate": 1.967473531596671e-05, "loss": 0.2421, "num_tokens": 4265769.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1555269956588745, "sampling/importance_sampling_ratio/mean": 0.9993851780891418, "sampling/importance_sampling_ratio/min": 0.8805910348892212, "sampling/sampling_logp_difference/max": 0.14455652236938477, "sampling/sampling_logp_difference/mean": 0.010368101298809052, "step": 177 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 142.0, "completions/max_terminated_length": 142.0, "completions/mean_length": 68.90625, "completions/mean_terminated_length": 68.90625, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.5327342487871647, "epoch": 0.17606330365974282, "grad_norm": 6.317509651184082, "kl_approx": 0.4254322052001953, "learning_rate": 1.966593458484168e-05, "loss": 0.2733, "num_tokens": 4286398.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2253488302230835, "sampling/importance_sampling_ratio/mean": 1.0002055168151855, "sampling/importance_sampling_ratio/min": 0.879186749458313, "sampling/sampling_logp_difference/max": 0.20322561264038086, "sampling/sampling_logp_difference/mean": 0.009690026752650738, "step": 178 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 142.0, "completions/max_terminated_length": 142.0, "completions/mean_length": 81.46875, "completions/mean_terminated_length": 81.46875, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.5916108139790595, "epoch": 0.17705242334322452, "grad_norm": 3.7381250858306885, "kl_approx": 0.3475494384765625, "learning_rate": 1.9657018398011435e-05, "loss": 0.2458, "num_tokens": 4309397.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1364266872406006, "sampling/importance_sampling_ratio/mean": 1.0005912780761719, "sampling/importance_sampling_ratio/min": 0.8377895951271057, "sampling/sampling_logp_difference/max": 0.1769883632659912, "sampling/sampling_logp_difference/mean": 0.009945884346961975, "step": 179 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 160.0, "completions/max_terminated_length": 160.0, "completions/mean_length": 90.0, "completions/mean_terminated_length": 90.0, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.5743699269369245, "epoch": 0.17804154302670624, "grad_norm": 4.380485534667969, "kl_approx": 0.485565185546875, "learning_rate": 1.9647986861976246e-05, "loss": 0.3441, "num_tokens": 4332237.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.150006651878357, "sampling/importance_sampling_ratio/mean": 0.9991024732589722, "sampling/importance_sampling_ratio/min": 0.8479262590408325, "sampling/sampling_logp_difference/max": 0.164961576461792, "sampling/sampling_logp_difference/mean": 0.011140280403196812, "step": 180 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 475.0, "completions/max_terminated_length": 475.0, "completions/mean_length": 134.71875, "completions/mean_terminated_length": 134.71875, "completions/min_length": 26.0, "completions/min_terminated_length": 26.0, "entropy": 0.6700577416922897, "epoch": 0.17903066271018794, "grad_norm": 3.176434278488159, "kl_approx": 0.35842132568359375, "learning_rate": 1.9638840084614182e-05, "loss": 0.2196, "num_tokens": 4362252.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2185258865356445, "sampling/importance_sampling_ratio/mean": 0.9991312623023987, "sampling/importance_sampling_ratio/min": 0.821160614490509, "sampling/sampling_logp_difference/max": 0.19764184951782227, "sampling/sampling_logp_difference/mean": 0.013197019696235657, "step": 181 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 997.0, "completions/max_terminated_length": 997.0, "completions/mean_length": 253.8125, "completions/mean_terminated_length": 253.8125, "completions/min_length": 95.0, "completions/min_terminated_length": 95.0, "entropy": 1.0195479076355696, "epoch": 0.18001978239366964, "grad_norm": 2.866442918777466, "kl_approx": 0.397796630859375, "learning_rate": 1.9629578175179823e-05, "loss": 0.2639, "num_tokens": 4389190.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2505145072937012, "sampling/importance_sampling_ratio/mean": 1.0000097751617432, "sampling/importance_sampling_ratio/min": 0.7541719079017639, "sampling/sampling_logp_difference/max": 0.282135009765625, "sampling/sampling_logp_difference/mean": 0.015476331114768982, "step": 182 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 295.0, "completions/max_terminated_length": 295.0, "completions/mean_length": 106.40625, "completions/mean_terminated_length": 106.40625, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.7956465752795339, "epoch": 0.18100890207715134, "grad_norm": 2.7353873252868652, "kl_approx": 0.35871124267578125, "learning_rate": 1.9620201244302952e-05, "loss": 0.2052, "num_tokens": 4409491.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2233108282089233, "sampling/importance_sampling_ratio/mean": 1.0005443096160889, "sampling/importance_sampling_ratio/min": 0.8413002490997314, "sampling/sampling_logp_difference/max": 0.20156097412109375, "sampling/sampling_logp_difference/mean": 0.014676181599497795, "step": 183 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 747.0, "completions/max_terminated_length": 747.0, "completions/mean_length": 196.90625, "completions/mean_terminated_length": 196.90625, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.8832181142643094, "epoch": 0.18199802176063304, "grad_norm": 2.3406519889831543, "kl_approx": 0.320037841796875, "learning_rate": 1.9610709403987248e-05, "loss": 0.1994, "num_tokens": 4433656.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1645704507827759, "sampling/importance_sampling_ratio/mean": 1.0000042915344238, "sampling/importance_sampling_ratio/min": 0.7931860089302063, "sampling/sampling_logp_difference/max": 0.23169755935668945, "sampling/sampling_logp_difference/mean": 0.014447847381234169, "step": 184 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 369.0, "completions/max_terminated_length": 369.0, "completions/mean_length": 141.1875, "completions/mean_terminated_length": 141.1875, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.8309785891324282, "epoch": 0.18298714144411474, "grad_norm": 3.316915988922119, "kl_approx": 0.369415283203125, "learning_rate": 1.9601102767608924e-05, "loss": 0.2373, "num_tokens": 4459342.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1812007427215576, "sampling/importance_sampling_ratio/mean": 1.000186562538147, "sampling/importance_sampling_ratio/min": 0.7918558120727539, "sampling/sampling_logp_difference/max": 0.23337602615356445, "sampling/sampling_logp_difference/mean": 0.013928555883467197, "step": 185 }, { "completions/clipped_ratio": 0.09375, "completions/max_length": 1024.0, "completions/max_terminated_length": 352.0, "completions/mean_length": 208.65625, "completions/mean_terminated_length": 124.31034088134766, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.8102191786165349, "epoch": 0.18397626112759644, "grad_norm": 3.627206563949585, "kl_approx": 0.3878021240234375, "learning_rate": 1.95913814499154e-05, "loss": 0.2484, "num_tokens": 4484379.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2079881429672241, "sampling/importance_sampling_ratio/mean": 0.9997969269752502, "sampling/importance_sampling_ratio/min": 0.7932904362678528, "sampling/sampling_logp_difference/max": 0.2315659523010254, "sampling/sampling_logp_difference/mean": 0.009880214929580688, "step": 186 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 358.0, "completions/max_terminated_length": 358.0, "completions/mean_length": 115.0625, "completions/mean_terminated_length": 115.0625, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.8650742191821337, "epoch": 0.18496538081107813, "grad_norm": 3.8704757690429688, "kl_approx": 0.44366455078125, "learning_rate": 1.95815455670239e-05, "loss": 0.3256, "num_tokens": 4503637.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1381938457489014, "sampling/importance_sampling_ratio/mean": 1.000834584236145, "sampling/importance_sampling_ratio/min": 0.8320397138595581, "sampling/sampling_logp_difference/max": 0.18387508392333984, "sampling/sampling_logp_difference/mean": 0.014146720990538597, "step": 187 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 544.0, "completions/max_terminated_length": 544.0, "completions/mean_length": 147.03125, "completions/mean_terminated_length": 147.03125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.7689765151590109, "epoch": 0.18595450049455983, "grad_norm": 3.563326120376587, "kl_approx": 0.3994140625, "learning_rate": 1.9571595236420103e-05, "loss": 0.2779, "num_tokens": 4524022.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1522051095962524, "sampling/importance_sampling_ratio/mean": 1.0002191066741943, "sampling/importance_sampling_ratio/min": 0.8480837941169739, "sampling/sampling_logp_difference/max": 0.16477584838867188, "sampling/sampling_logp_difference/mean": 0.013784163631498814, "step": 188 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 535.0, "completions/max_terminated_length": 535.0, "completions/mean_length": 177.0625, "completions/mean_terminated_length": 177.0625, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 1.0105805043131113, "epoch": 0.18694362017804153, "grad_norm": 3.023618698120117, "kl_approx": 0.341705322265625, "learning_rate": 1.9561530576956703e-05, "loss": 0.2472, "num_tokens": 4548872.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2522778511047363, "sampling/importance_sampling_ratio/mean": 1.000182867050171, "sampling/importance_sampling_ratio/min": 0.8739991188049316, "sampling/sampling_logp_difference/max": 0.22496414184570312, "sampling/sampling_logp_difference/mean": 0.01618615910410881, "step": 189 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 776.0, "completions/max_terminated_length": 776.0, "completions/mean_length": 251.125, "completions/mean_terminated_length": 251.125, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.9955198168754578, "epoch": 0.18793273986152326, "grad_norm": 3.141435146331787, "kl_approx": 0.37359619140625, "learning_rate": 1.955135170885202e-05, "loss": 0.2296, "num_tokens": 4571380.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.196488380432129, "sampling/importance_sampling_ratio/mean": 1.001082181930542, "sampling/importance_sampling_ratio/min": 0.7715004682540894, "sampling/sampling_logp_difference/max": 0.2594180107116699, "sampling/sampling_logp_difference/mean": 0.015606801956892014, "step": 190 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 375.0, "completions/max_terminated_length": 375.0, "completions/mean_length": 119.0625, "completions/mean_terminated_length": 119.0625, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.7149736005812883, "epoch": 0.18892185954500496, "grad_norm": 2.953836679458618, "kl_approx": 0.2916107177734375, "learning_rate": 1.9541058753688538e-05, "loss": 0.1574, "num_tokens": 4598206.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1896014213562012, "sampling/importance_sampling_ratio/mean": 1.0003082752227783, "sampling/importance_sampling_ratio/min": 0.8298519849777222, "sampling/sampling_logp_difference/max": 0.1865079402923584, "sampling/sampling_logp_difference/mean": 0.013138935901224613, "step": 191 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 432.0, "completions/max_terminated_length": 432.0, "completions/mean_length": 129.75, "completions/mean_terminated_length": 129.75, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.8066576132550836, "epoch": 0.18991097922848665, "grad_norm": 2.5305604934692383, "kl_approx": 0.371826171875, "learning_rate": 1.9530651834411477e-05, "loss": 0.1943, "num_tokens": 4624694.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1441923379898071, "sampling/importance_sampling_ratio/mean": 0.9994572997093201, "sampling/importance_sampling_ratio/min": 0.8220016360282898, "sampling/sampling_logp_difference/max": 0.19601285457611084, "sampling/sampling_logp_difference/mean": 0.014570243656635284, "step": 192 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 477.0, "completions/max_terminated_length": 477.0, "completions/mean_length": 159.21875, "completions/mean_terminated_length": 159.21875, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.9491471033543348, "epoch": 0.19090009891196835, "grad_norm": 2.8296799659729004, "kl_approx": 0.3559112548828125, "learning_rate": 1.95201310753273e-05, "loss": 0.2463, "num_tokens": 4654013.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2658840417861938, "sampling/importance_sampling_ratio/mean": 1.0003011226654053, "sampling/importance_sampling_ratio/min": 0.8553217053413391, "sampling/sampling_logp_difference/max": 0.23577070236206055, "sampling/sampling_logp_difference/mean": 0.016150332987308502, "step": 193 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 389.0, "completions/max_terminated_length": 389.0, "completions/mean_length": 102.28125, "completions/mean_terminated_length": 102.28125, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.8161912616342306, "epoch": 0.19188921859545005, "grad_norm": 3.4798426628112793, "kl_approx": 0.3473243713378906, "learning_rate": 1.9509496602102253e-05, "loss": 0.214, "num_tokens": 4680094.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2022815942764282, "sampling/importance_sampling_ratio/mean": 0.9997754693031311, "sampling/importance_sampling_ratio/min": 0.8727205395698547, "sampling/sampling_logp_difference/max": 0.1842210292816162, "sampling/sampling_logp_difference/mean": 0.01524446438997984, "step": 194 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 177.0, "completions/max_terminated_length": 177.0, "completions/mean_length": 93.5625, "completions/mean_terminated_length": 93.5625, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6369808427989483, "epoch": 0.19287833827893175, "grad_norm": 3.127537965774536, "kl_approx": 0.2580108642578125, "learning_rate": 1.9498748541760845e-05, "loss": 0.2354, "num_tokens": 4702680.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2261836528778076, "sampling/importance_sampling_ratio/mean": 1.0004708766937256, "sampling/importance_sampling_ratio/min": 0.8368150591850281, "sampling/sampling_logp_difference/max": 0.20390665531158447, "sampling/sampling_logp_difference/mean": 0.011521467007696629, "step": 195 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 159.0, "completions/max_terminated_length": 159.0, "completions/mean_length": 92.21875, "completions/mean_terminated_length": 92.21875, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.6702957535162568, "epoch": 0.19386745796241345, "grad_norm": 2.4470937252044678, "kl_approx": 0.28216552734375, "learning_rate": 1.9487887022684336e-05, "loss": 0.1685, "num_tokens": 4721303.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2678173780441284, "sampling/importance_sampling_ratio/mean": 0.9994837641716003, "sampling/importance_sampling_ratio/min": 0.8375304937362671, "sampling/sampling_logp_difference/max": 0.23729681968688965, "sampling/sampling_logp_difference/mean": 0.011245638132095337, "step": 196 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 173.0, "completions/max_terminated_length": 173.0, "completions/mean_length": 86.125, "completions/mean_terminated_length": 86.125, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.5091623235493898, "epoch": 0.19485657764589515, "grad_norm": 2.0916755199432373, "kl_approx": 0.2183971405029297, "learning_rate": 1.947691217460921e-05, "loss": 0.1276, "num_tokens": 4742603.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1455672979354858, "sampling/importance_sampling_ratio/mean": 0.9997662901878357, "sampling/importance_sampling_ratio/min": 0.8272221684455872, "sampling/sampling_logp_difference/max": 0.1896820068359375, "sampling/sampling_logp_difference/mean": 0.01040777750313282, "step": 197 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 687.0, "completions/max_terminated_length": 687.0, "completions/mean_length": 191.78125, "completions/mean_terminated_length": 191.78125, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.8770013572648168, "epoch": 0.19584569732937684, "grad_norm": 3.199310064315796, "kl_approx": 0.3926849365234375, "learning_rate": 1.946582412862562e-05, "loss": 0.2737, "num_tokens": 4765476.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3287382125854492, "sampling/importance_sampling_ratio/mean": 0.9993873238563538, "sampling/importance_sampling_ratio/min": 0.7851613163948059, "sampling/sampling_logp_difference/max": 0.28422975540161133, "sampling/sampling_logp_difference/mean": 0.0156437736004591, "step": 198 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 589.0, "completions/max_terminated_length": 589.0, "completions/mean_length": 171.4375, "completions/mean_terminated_length": 171.4375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.7275398671627045, "epoch": 0.19683481701285854, "grad_norm": 2.7614235877990723, "kl_approx": 0.272003173828125, "learning_rate": 1.9454623017175814e-05, "loss": 0.2234, "num_tokens": 4792330.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1939396858215332, "sampling/importance_sampling_ratio/mean": 0.9999340176582336, "sampling/importance_sampling_ratio/min": 0.7815227508544922, "sampling/sampling_logp_difference/max": 0.24651098251342773, "sampling/sampling_logp_difference/mean": 0.013386149890720844, "step": 199 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 259.0, "completions/max_terminated_length": 259.0, "completions/mean_length": 77.8125, "completions/mean_terminated_length": 77.8125, "completions/min_length": 17.0, "completions/min_terminated_length": 17.0, "entropy": 0.5949868741445243, "epoch": 0.19782393669634027, "grad_norm": 3.8966453075408936, "kl_approx": 0.30572509765625, "learning_rate": 1.9443308974052574e-05, "loss": 0.2292, "num_tokens": 4809532.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1457360982894897, "sampling/importance_sampling_ratio/mean": 0.9992508292198181, "sampling/importance_sampling_ratio/min": 0.7327111959457397, "sampling/sampling_logp_difference/max": 0.3110036849975586, "sampling/sampling_logp_difference/mean": 0.011897114105522633, "step": 200 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 413.0, "completions/max_terminated_length": 413.0, "completions/mean_length": 92.4375, "completions/mean_terminated_length": 92.4375, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.5635983040556312, "epoch": 0.19881305637982197, "grad_norm": 5.359744548797607, "kl_approx": 0.34445953369140625, "learning_rate": 1.9431882134397596e-05, "loss": 0.2546, "num_tokens": 4827146.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1715437173843384, "sampling/importance_sampling_ratio/mean": 1.0001041889190674, "sampling/importance_sampling_ratio/min": 0.8740832209587097, "sampling/sampling_logp_difference/max": 0.15832233428955078, "sampling/sampling_logp_difference/mean": 0.011723761446774006, "step": 201 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 654.0, "completions/max_terminated_length": 654.0, "completions/mean_length": 155.875, "completions/mean_terminated_length": 155.875, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 0.7137188259512186, "epoch": 0.19980217606330367, "grad_norm": 3.809016466140747, "kl_approx": 0.458099365234375, "learning_rate": 1.9420342634699893e-05, "loss": 0.2864, "num_tokens": 4854150.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2270963191986084, "sampling/importance_sampling_ratio/mean": 0.9997861981391907, "sampling/importance_sampling_ratio/min": 0.8192124366760254, "sampling/sampling_logp_difference/max": 0.2046506404876709, "sampling/sampling_logp_difference/mean": 0.014872337691485882, "step": 202 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 664.0, "completions/mean_length": 239.53125, "completions/mean_terminated_length": 214.22579956054688, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.7787833148613572, "epoch": 0.20079129574678536, "grad_norm": 3.1124439239501953, "kl_approx": 0.321380615234375, "learning_rate": 1.9408690612794146e-05, "loss": 0.2715, "num_tokens": 4889903.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3740170001983643, "sampling/importance_sampling_ratio/mean": 1.0001214742660522, "sampling/importance_sampling_ratio/min": 0.7406344413757324, "sampling/sampling_logp_difference/max": 0.31773853302001953, "sampling/sampling_logp_difference/mean": 0.013337602838873863, "step": 203 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 721.0, "completions/max_terminated_length": 721.0, "completions/mean_length": 210.875, "completions/mean_terminated_length": 210.875, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.7800484076142311, "epoch": 0.20178041543026706, "grad_norm": 3.4030117988586426, "kl_approx": 0.412445068359375, "learning_rate": 1.9396926207859085e-05, "loss": 0.2629, "num_tokens": 4919331.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2188256978988647, "sampling/importance_sampling_ratio/mean": 1.0005685091018677, "sampling/importance_sampling_ratio/min": 0.8302646279335022, "sampling/sampling_logp_difference/max": 0.19788789749145508, "sampling/sampling_logp_difference/mean": 0.014459380879998207, "step": 204 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 896.0, "completions/max_terminated_length": 896.0, "completions/mean_length": 251.1875, "completions/mean_terminated_length": 251.1875, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.892274959012866, "epoch": 0.20276953511374876, "grad_norm": 2.918339252471924, "kl_approx": 0.353759765625, "learning_rate": 1.9385049560415794e-05, "loss": 0.2188, "num_tokens": 4949625.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2151859998703003, "sampling/importance_sampling_ratio/mean": 1.0001851320266724, "sampling/importance_sampling_ratio/min": 0.7375075221061707, "sampling/sampling_logp_difference/max": 0.3044790029525757, "sampling/sampling_logp_difference/mean": 0.014378399588167667, "step": 205 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 351.0, "completions/max_terminated_length": 351.0, "completions/mean_length": 140.375, "completions/mean_terminated_length": 140.375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.7373186573386192, "epoch": 0.20375865479723046, "grad_norm": 2.4946844577789307, "kl_approx": 0.3034515380859375, "learning_rate": 1.9373060812326053e-05, "loss": 0.1599, "num_tokens": 4973933.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2447043657302856, "sampling/importance_sampling_ratio/mean": 1.0001064538955688, "sampling/importance_sampling_ratio/min": 0.8452403545379639, "sampling/sampling_logp_difference/max": 0.21889805793762207, "sampling/sampling_logp_difference/mean": 0.013263982720673084, "step": 206 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 474.0, "completions/max_terminated_length": 474.0, "completions/mean_length": 185.59375, "completions/mean_terminated_length": 185.59375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 1.1881454810500145, "epoch": 0.20474777448071216, "grad_norm": 3.8895764350891113, "kl_approx": 0.4849853515625, "learning_rate": 1.9360960106790645e-05, "loss": 0.3703, "num_tokens": 4994240.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2132391929626465, "sampling/importance_sampling_ratio/mean": 1.0001754760742188, "sampling/importance_sampling_ratio/min": 0.7871976494789124, "sampling/sampling_logp_difference/max": 0.23927593231201172, "sampling/sampling_logp_difference/mean": 0.018709952011704445, "step": 207 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 606.0, "completions/max_terminated_length": 606.0, "completions/mean_length": 160.375, "completions/mean_terminated_length": 160.375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.7769688349217176, "epoch": 0.20573689416419386, "grad_norm": 2.359301805496216, "kl_approx": 0.27413177490234375, "learning_rate": 1.9348747588347637e-05, "loss": 0.1788, "num_tokens": 5015228.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2356021404266357, "sampling/importance_sampling_ratio/mean": 1.0001152753829956, "sampling/importance_sampling_ratio/min": 0.8298988938331604, "sampling/sampling_logp_difference/max": 0.21155834197998047, "sampling/sampling_logp_difference/mean": 0.01686965487897396, "step": 208 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 462.0, "completions/max_terminated_length": 462.0, "completions/mean_length": 113.75, "completions/mean_terminated_length": 113.75, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.7697482267394662, "epoch": 0.20672601384767555, "grad_norm": 2.464195489883423, "kl_approx": 0.2992095947265625, "learning_rate": 1.9336423402870655e-05, "loss": 0.1803, "num_tokens": 5037452.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1645135879516602, "sampling/importance_sampling_ratio/mean": 1.000540018081665, "sampling/importance_sampling_ratio/min": 0.8467459082603455, "sampling/sampling_logp_difference/max": 0.16635465621948242, "sampling/sampling_logp_difference/mean": 0.012847894802689552, "step": 209 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 190.0, "completions/max_terminated_length": 190.0, "completions/mean_length": 77.75, "completions/mean_terminated_length": 77.75, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.6320470701903105, "epoch": 0.20771513353115728, "grad_norm": 3.374441146850586, "kl_approx": 0.3346385955810547, "learning_rate": 1.932398769756714e-05, "loss": 0.2166, "num_tokens": 5058676.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1435011625289917, "sampling/importance_sampling_ratio/mean": 0.9997200965881348, "sampling/importance_sampling_ratio/min": 0.8282894492149353, "sampling/sampling_logp_difference/max": 0.18839263916015625, "sampling/sampling_logp_difference/mean": 0.010547553189098835, "step": 210 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 416.0, "completions/max_terminated_length": 416.0, "completions/mean_length": 123.5, "completions/mean_terminated_length": 123.5, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7704211338423193, "epoch": 0.20870425321463898, "grad_norm": 2.5807645320892334, "kl_approx": 0.29001617431640625, "learning_rate": 1.9311440620976597e-05, "loss": 0.1891, "num_tokens": 5085948.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1862140893936157, "sampling/importance_sampling_ratio/mean": 0.9999226927757263, "sampling/importance_sampling_ratio/min": 0.8195359110832214, "sampling/sampling_logp_difference/max": 0.19901704788208008, "sampling/sampling_logp_difference/mean": 0.014977291226387024, "step": 211 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 848.0, "completions/max_terminated_length": 848.0, "completions/mean_length": 257.5625, "completions/mean_terminated_length": 257.5625, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.9993455754593015, "epoch": 0.20969337289812068, "grad_norm": 3.080603837966919, "kl_approx": 0.40655517578125, "learning_rate": 1.9298782322968817e-05, "loss": 0.2901, "num_tokens": 5116694.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.245516300201416, "sampling/importance_sampling_ratio/mean": 0.9999556541442871, "sampling/importance_sampling_ratio/min": 0.7899016737937927, "sampling/sampling_logp_difference/max": 0.23584675788879395, "sampling/sampling_logp_difference/mean": 0.015802502632141113, "step": 212 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 740.0, "completions/max_terminated_length": 740.0, "completions/mean_length": 188.25, "completions/mean_terminated_length": 188.25, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.7308742143213749, "epoch": 0.21068249258160238, "grad_norm": 2.7129364013671875, "kl_approx": 0.3378143310546875, "learning_rate": 1.9286012954742078e-05, "loss": 0.2051, "num_tokens": 5143694.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2486017942428589, "sampling/importance_sampling_ratio/mean": 1.000115990638733, "sampling/importance_sampling_ratio/min": 0.7331138253211975, "sampling/sampling_logp_difference/max": 0.3104543685913086, "sampling/sampling_logp_difference/mean": 0.012803388759493828, "step": 213 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 423.0, "completions/max_terminated_length": 423.0, "completions/mean_length": 130.15625, "completions/mean_terminated_length": 130.15625, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.7911368329077959, "epoch": 0.21167161226508407, "grad_norm": 2.9650793075561523, "kl_approx": 0.36651611328125, "learning_rate": 1.9273132668821363e-05, "loss": 0.2241, "num_tokens": 5166619.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1962522268295288, "sampling/importance_sampling_ratio/mean": 0.9995303750038147, "sampling/importance_sampling_ratio/min": 0.8319612145423889, "sampling/sampling_logp_difference/max": 0.18396949768066406, "sampling/sampling_logp_difference/mean": 0.013538091443479061, "step": 214 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 332.0, "completions/max_terminated_length": 332.0, "completions/mean_length": 103.0625, "completions/mean_terminated_length": 103.0625, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.6631857696920633, "epoch": 0.21266073194856577, "grad_norm": 4.841701507568359, "kl_approx": 0.40521240234375, "learning_rate": 1.9260141619056507e-05, "loss": 0.2922, "num_tokens": 5187493.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.196144938468933, "sampling/importance_sampling_ratio/mean": 1.0002715587615967, "sampling/importance_sampling_ratio/min": 0.822303056716919, "sampling/sampling_logp_difference/max": 0.1956462860107422, "sampling/sampling_logp_difference/mean": 0.01218469813466072, "step": 215 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 263.0, "completions/max_terminated_length": 263.0, "completions/mean_length": 90.25, "completions/mean_terminated_length": 90.25, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.5698326015844941, "epoch": 0.21364985163204747, "grad_norm": 3.1044483184814453, "kl_approx": 0.26737213134765625, "learning_rate": 1.924703996062038e-05, "loss": 0.1826, "num_tokens": 5209101.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2458637952804565, "sampling/importance_sampling_ratio/mean": 0.9994869828224182, "sampling/importance_sampling_ratio/min": 0.8788732290267944, "sampling/sampling_logp_difference/max": 0.21982908248901367, "sampling/sampling_logp_difference/mean": 0.0105671975761652, "step": 216 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 457.0, "completions/max_terminated_length": 457.0, "completions/mean_length": 155.0, "completions/mean_terminated_length": 155.0, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.8520530294626951, "epoch": 0.21463897131552917, "grad_norm": 2.76305890083313, "kl_approx": 0.377349853515625, "learning_rate": 1.9233827850007028e-05, "loss": 0.2426, "num_tokens": 5234229.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1866172552108765, "sampling/importance_sampling_ratio/mean": 0.9993882775306702, "sampling/importance_sampling_ratio/min": 0.8335623741149902, "sampling/sampling_logp_difference/max": 0.1820467710494995, "sampling/sampling_logp_difference/mean": 0.014644963666796684, "step": 217 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 919.0, "completions/max_terminated_length": 919.0, "completions/mean_length": 235.8125, "completions/mean_terminated_length": 235.8125, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.8813197785057127, "epoch": 0.21562809099901087, "grad_norm": 2.8763091564178467, "kl_approx": 0.3265724182128906, "learning_rate": 1.9220505445029803e-05, "loss": 0.2413, "num_tokens": 5261023.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2905473709106445, "sampling/importance_sampling_ratio/mean": 1.0000096559524536, "sampling/importance_sampling_ratio/min": 0.6972465515136719, "sampling/sampling_logp_difference/max": 0.36061620712280273, "sampling/sampling_logp_difference/mean": 0.014830242842435837, "step": 218 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 500.0, "completions/max_terminated_length": 500.0, "completions/mean_length": 144.15625, "completions/mean_terminated_length": 144.15625, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.7217067535966635, "epoch": 0.2166172106824926, "grad_norm": 3.456519365310669, "kl_approx": 0.322509765625, "learning_rate": 1.9207072904819484e-05, "loss": 0.2156, "num_tokens": 5289956.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3540971279144287, "sampling/importance_sampling_ratio/mean": 1.0006392002105713, "sampling/importance_sampling_ratio/min": 0.8137744069099426, "sampling/sampling_logp_difference/max": 0.3031349182128906, "sampling/sampling_logp_difference/mean": 0.011853271164000034, "step": 219 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 471.0, "completions/max_terminated_length": 471.0, "completions/mean_length": 187.625, "completions/mean_terminated_length": 187.625, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.7304103774949908, "epoch": 0.2176063303659743, "grad_norm": 2.696822166442871, "kl_approx": 0.313201904296875, "learning_rate": 1.9193530389822364e-05, "loss": 0.2273, "num_tokens": 5315472.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1479991674423218, "sampling/importance_sampling_ratio/mean": 0.9998998045921326, "sampling/importance_sampling_ratio/min": 0.8383550047874451, "sampling/sampling_logp_difference/max": 0.1763136386871338, "sampling/sampling_logp_difference/mean": 0.01179458200931549, "step": 220 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 164.0, "completions/max_terminated_length": 164.0, "completions/mean_length": 75.46875, "completions/mean_terminated_length": 75.46875, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.5871479194611311, "epoch": 0.218595450049456, "grad_norm": 2.9542453289031982, "kl_approx": 0.2622222900390625, "learning_rate": 1.9179878061798347e-05, "loss": 0.1563, "num_tokens": 5336255.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1370563507080078, "sampling/importance_sampling_ratio/mean": 0.9996902346611023, "sampling/importance_sampling_ratio/min": 0.7966554164886475, "sampling/sampling_logp_difference/max": 0.22733306884765625, "sampling/sampling_logp_difference/mean": 0.010305657051503658, "step": 221 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 712.0, "completions/max_terminated_length": 712.0, "completions/mean_length": 146.65625, "completions/mean_terminated_length": 146.65625, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.9522844757884741, "epoch": 0.2195845697329377, "grad_norm": 2.627192735671997, "kl_approx": 0.40423583984375, "learning_rate": 1.9166116083819002e-05, "loss": 0.2683, "num_tokens": 5359988.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1700776815414429, "sampling/importance_sampling_ratio/mean": 1.0001568794250488, "sampling/importance_sampling_ratio/min": 0.8344256281852722, "sampling/sampling_logp_difference/max": 0.18101167678833008, "sampling/sampling_logp_difference/mean": 0.016865020617842674, "step": 222 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 377.0, "completions/max_terminated_length": 377.0, "completions/mean_length": 143.65625, "completions/mean_terminated_length": 143.65625, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.7796209808439016, "epoch": 0.2205736894164194, "grad_norm": 2.666339874267578, "kl_approx": 0.34142303466796875, "learning_rate": 1.915224462026563e-05, "loss": 0.2159, "num_tokens": 5383921.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.182591199874878, "sampling/importance_sampling_ratio/mean": 1.0003803968429565, "sampling/importance_sampling_ratio/min": 0.8004521727561951, "sampling/sampling_logp_difference/max": 0.2225785255432129, "sampling/sampling_logp_difference/mean": 0.013402228243649006, "step": 223 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 569.0, "completions/max_terminated_length": 569.0, "completions/mean_length": 179.8125, "completions/mean_terminated_length": 179.8125, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.8673951933160424, "epoch": 0.2215628090999011, "grad_norm": 2.7892537117004395, "kl_approx": 0.36529541015625, "learning_rate": 1.913826383682729e-05, "loss": 0.2501, "num_tokens": 5408003.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.18012535572052, "sampling/importance_sampling_ratio/mean": 1.0003184080123901, "sampling/importance_sampling_ratio/min": 0.8448547720909119, "sampling/sampling_logp_difference/max": 0.16859054565429688, "sampling/sampling_logp_difference/mean": 0.013767481781542301, "step": 224 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 220.0, "completions/mean_length": 118.21875, "completions/mean_terminated_length": 89.0, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.5930796023458242, "epoch": 0.22255192878338279, "grad_norm": 2.3983278274536133, "kl_approx": 0.2525482177734375, "learning_rate": 1.912417390049882e-05, "loss": 0.1595, "num_tokens": 5427994.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2002683877944946, "sampling/importance_sampling_ratio/mean": 0.9999665021896362, "sampling/importance_sampling_ratio/min": 0.7997391223907471, "sampling/sampling_logp_difference/max": 0.22346973419189453, "sampling/sampling_logp_difference/mean": 0.011154585517942905, "step": 225 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 365.0, "completions/max_terminated_length": 365.0, "completions/mean_length": 89.875, "completions/mean_terminated_length": 89.875, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7915005348622799, "epoch": 0.22354104846686448, "grad_norm": 4.020339012145996, "kl_approx": 0.456451416015625, "learning_rate": 1.9109974979578852e-05, "loss": 0.2336, "num_tokens": 5448518.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2413122653961182, "sampling/importance_sampling_ratio/mean": 1.0008007287979126, "sampling/importance_sampling_ratio/min": 0.8584089875221252, "sampling/sampling_logp_difference/max": 0.21616911888122559, "sampling/sampling_logp_difference/mean": 0.013304656371474266, "step": 226 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 625.0, "completions/max_terminated_length": 625.0, "completions/mean_length": 99.3125, "completions/mean_terminated_length": 99.3125, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.5809233691543341, "epoch": 0.22453016815034618, "grad_norm": 2.259439706802368, "kl_approx": 0.219329833984375, "learning_rate": 1.909566724366779e-05, "loss": 0.1398, "num_tokens": 5466576.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1431745290756226, "sampling/importance_sampling_ratio/mean": 0.999667763710022, "sampling/importance_sampling_ratio/min": 0.8343027234077454, "sampling/sampling_logp_difference/max": 0.18115901947021484, "sampling/sampling_logp_difference/mean": 0.01166341919451952, "step": 227 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 769.0, "completions/mean_length": 201.40625, "completions/mean_terminated_length": 174.87095642089844, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.5947200027294457, "epoch": 0.22551928783382788, "grad_norm": 3.1953752040863037, "kl_approx": 0.25662994384765625, "learning_rate": 1.9081250863665794e-05, "loss": 0.1925, "num_tokens": 5491141.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.288362741470337, "sampling/importance_sampling_ratio/mean": 1.0006479024887085, "sampling/importance_sampling_ratio/min": 0.8294237852096558, "sampling/sampling_logp_difference/max": 0.2533721923828125, "sampling/sampling_logp_difference/mean": 0.012894628569483757, "step": 228 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 775.0, "completions/max_terminated_length": 775.0, "completions/mean_length": 200.0, "completions/mean_terminated_length": 200.0, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7009008713066578, "epoch": 0.2265084075173096, "grad_norm": 2.094667911529541, "kl_approx": 0.23578262329101562, "learning_rate": 1.9066726011770725e-05, "loss": 0.1923, "num_tokens": 5517933.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.21649968624115, "sampling/importance_sampling_ratio/mean": 0.999966561794281, "sampling/importance_sampling_ratio/min": 0.8073489665985107, "sampling/sampling_logp_difference/max": 0.21399927139282227, "sampling/sampling_logp_difference/mean": 0.01398975308984518, "step": 229 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 649.0, "completions/max_terminated_length": 649.0, "completions/mean_length": 205.875, "completions/mean_terminated_length": 205.875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.6458039940334857, "epoch": 0.2274975272007913, "grad_norm": 1.9702178239822388, "kl_approx": 0.2554359436035156, "learning_rate": 1.905209286147611e-05, "loss": 0.1765, "num_tokens": 5544073.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3105998039245605, "sampling/importance_sampling_ratio/mean": 0.999586820602417, "sampling/importance_sampling_ratio/min": 0.7754350304603577, "sampling/sampling_logp_difference/max": 0.27048492431640625, "sampling/sampling_logp_difference/mean": 0.01276719756424427, "step": 230 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 874.0, "completions/max_terminated_length": 874.0, "completions/mean_length": 284.59375, "completions/mean_terminated_length": 284.59375, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6856138175353408, "epoch": 0.228486646884273, "grad_norm": 2.3308005332946777, "kl_approx": 0.2988739013671875, "learning_rate": 1.903735158756905e-05, "loss": 0.2188, "num_tokens": 5570516.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2148922681808472, "sampling/importance_sampling_ratio/mean": 1.0006022453308105, "sampling/importance_sampling_ratio/min": 0.8102623820304871, "sampling/sampling_logp_difference/max": 0.21039724349975586, "sampling/sampling_logp_difference/mean": 0.012063105590641499, "step": 231 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 860.0, "completions/max_terminated_length": 860.0, "completions/mean_length": 229.90625, "completions/mean_terminated_length": 229.90625, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.8164218720048666, "epoch": 0.2294757665677547, "grad_norm": 2.1481070518493652, "kl_approx": 0.331634521484375, "learning_rate": 1.9022502366128136e-05, "loss": 0.2188, "num_tokens": 5597193.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2343577146530151, "sampling/importance_sampling_ratio/mean": 0.9999073147773743, "sampling/importance_sampling_ratio/min": 0.7946333885192871, "sampling/sampling_logp_difference/max": 0.2298743724822998, "sampling/sampling_logp_difference/mean": 0.012741408310830593, "step": 232 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 252.0, "completions/max_terminated_length": 252.0, "completions/mean_length": 98.25, "completions/mean_terminated_length": 98.25, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.528086791280657, "epoch": 0.2304648862512364, "grad_norm": 3.4126057624816895, "kl_approx": 0.2632617950439453, "learning_rate": 1.9007545374521354e-05, "loss": 0.1583, "num_tokens": 5622449.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1884492635726929, "sampling/importance_sampling_ratio/mean": 1.0001106262207031, "sampling/importance_sampling_ratio/min": 0.8104504942893982, "sampling/sampling_logp_difference/max": 0.21016502380371094, "sampling/sampling_logp_difference/mean": 0.009452199563384056, "step": 233 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 181.0, "completions/max_terminated_length": 181.0, "completions/mean_length": 69.6875, "completions/mean_terminated_length": 69.6875, "completions/min_length": 10.0, "completions/min_terminated_length": 10.0, "entropy": 0.5038614354562014, "epoch": 0.2314540059347181, "grad_norm": 3.4858715534210205, "kl_approx": 0.243865966796875, "learning_rate": 1.8992480791403957e-05, "loss": 0.2044, "num_tokens": 5643543.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1353437900543213, "sampling/importance_sampling_ratio/mean": 0.9996883869171143, "sampling/importance_sampling_ratio/min": 0.8652843236923218, "sampling/sampling_logp_difference/max": 0.1446971893310547, "sampling/sampling_logp_difference/mean": 0.009055567905306816, "step": 234 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 327.0, "completions/max_terminated_length": 327.0, "completions/mean_length": 111.75, "completions/mean_terminated_length": 111.75, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.6546653714030981, "epoch": 0.2324431256181998, "grad_norm": 3.8027219772338867, "kl_approx": 0.2834320068359375, "learning_rate": 1.897730879671634e-05, "loss": 0.1741, "num_tokens": 5668935.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.184888482093811, "sampling/importance_sampling_ratio/mean": 0.9995028376579285, "sampling/importance_sampling_ratio/min": 0.8584259152412415, "sampling/sampling_logp_difference/max": 0.1696486473083496, "sampling/sampling_logp_difference/mean": 0.011030866764485836, "step": 235 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 434.0, "completions/max_terminated_length": 434.0, "completions/mean_length": 101.5, "completions/mean_terminated_length": 101.5, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.7878697253763676, "epoch": 0.2334322453016815, "grad_norm": 2.6981778144836426, "kl_approx": 0.2628021240234375, "learning_rate": 1.8962029571681887e-05, "loss": 0.1891, "num_tokens": 5689815.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2150640487670898, "sampling/importance_sampling_ratio/mean": 1.000068187713623, "sampling/importance_sampling_ratio/min": 0.46216318011283875, "sampling/sampling_logp_difference/max": 0.7718372344970703, "sampling/sampling_logp_difference/mean": 0.01477569155395031, "step": 236 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 300.0, "completions/max_terminated_length": 300.0, "completions/mean_length": 113.6875, "completions/mean_terminated_length": 113.6875, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.6975641055032611, "epoch": 0.2344213649851632, "grad_norm": 2.8937313556671143, "kl_approx": 0.3151702880859375, "learning_rate": 1.8946643298804794e-05, "loss": 0.2132, "num_tokens": 5708613.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1440235376358032, "sampling/importance_sampling_ratio/mean": 1.000037431716919, "sampling/importance_sampling_ratio/min": 0.8411276936531067, "sampling/sampling_logp_difference/max": 0.17301177978515625, "sampling/sampling_logp_difference/mean": 0.011513817124068737, "step": 237 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 167.0, "completions/max_terminated_length": 167.0, "completions/mean_length": 91.59375, "completions/mean_terminated_length": 91.59375, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.708747148513794, "epoch": 0.2354104846686449, "grad_norm": 2.9254322052001953, "kl_approx": 0.27355194091796875, "learning_rate": 1.8931150161867917e-05, "loss": 0.1669, "num_tokens": 5730800.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1886290311813354, "sampling/importance_sampling_ratio/mean": 1.000718116760254, "sampling/importance_sampling_ratio/min": 0.8469982743263245, "sampling/sampling_logp_difference/max": 0.17280054092407227, "sampling/sampling_logp_difference/mean": 0.011884743347764015, "step": 238 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 182.0, "completions/max_terminated_length": 182.0, "completions/mean_length": 79.8125, "completions/mean_terminated_length": 79.8125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6106561003252864, "epoch": 0.23639960435212662, "grad_norm": 2.5883443355560303, "kl_approx": 0.31252288818359375, "learning_rate": 1.891555034593055e-05, "loss": 0.1829, "num_tokens": 5748074.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.178993821144104, "sampling/importance_sampling_ratio/mean": 1.0005333423614502, "sampling/importance_sampling_ratio/min": 0.7861150503158569, "sampling/sampling_logp_difference/max": 0.24065208435058594, "sampling/sampling_logp_difference/mean": 0.011805953457951546, "step": 239 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 330.0, "completions/max_terminated_length": 330.0, "completions/mean_length": 137.15625, "completions/mean_terminated_length": 137.15625, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.8554209163412452, "epoch": 0.23738872403560832, "grad_norm": 2.745689868927002, "kl_approx": 0.3905029296875, "learning_rate": 1.8899844037326227e-05, "loss": 0.2393, "num_tokens": 5775855.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1931133270263672, "sampling/importance_sampling_ratio/mean": 0.9999681711196899, "sampling/importance_sampling_ratio/min": 0.8318423628807068, "sampling/sampling_logp_difference/max": 0.1841123104095459, "sampling/sampling_logp_difference/mean": 0.013768631964921951, "step": 240 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 547.0, "completions/max_terminated_length": 547.0, "completions/mean_length": 142.0625, "completions/mean_terminated_length": 142.0625, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.5729648259002715, "epoch": 0.23837784371909002, "grad_norm": 2.084716558456421, "kl_approx": 0.17239665985107422, "learning_rate": 1.8884031423660492e-05, "loss": 0.1379, "num_tokens": 5795225.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2653734683990479, "sampling/importance_sampling_ratio/mean": 0.9999136328697205, "sampling/importance_sampling_ratio/min": 0.8735803365707397, "sampling/sampling_logp_difference/max": 0.2353672981262207, "sampling/sampling_logp_difference/mean": 0.010552264750003815, "step": 241 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 533.0, "completions/max_terminated_length": 533.0, "completions/mean_length": 136.84375, "completions/mean_terminated_length": 136.84375, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.736097046174109, "epoch": 0.23936696340257171, "grad_norm": 2.923643112182617, "kl_approx": 0.2623291015625, "learning_rate": 1.8868112693808664e-05, "loss": 0.2281, "num_tokens": 5818588.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.253665804862976, "sampling/importance_sampling_ratio/mean": 0.9993937611579895, "sampling/importance_sampling_ratio/min": 0.8383716344833374, "sampling/sampling_logp_difference/max": 0.22607183456420898, "sampling/sampling_logp_difference/mean": 0.012744957581162453, "step": 242 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 772.0, "completions/max_terminated_length": 772.0, "completions/mean_length": 249.15625, "completions/mean_terminated_length": 249.15625, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7830150690861046, "epoch": 0.2403560830860534, "grad_norm": 2.332535982131958, "kl_approx": 0.26373291015625, "learning_rate": 1.8852088037913577e-05, "loss": 0.1922, "num_tokens": 5846961.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1901663541793823, "sampling/importance_sampling_ratio/mean": 1.0005383491516113, "sampling/importance_sampling_ratio/min": 0.8108292818069458, "sampling/sampling_logp_difference/max": 0.20969772338867188, "sampling/sampling_logp_difference/mean": 0.01449556089937687, "step": 243 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 445.0, "completions/max_terminated_length": 445.0, "completions/mean_length": 127.5, "completions/mean_terminated_length": 127.5, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.7224850584752858, "epoch": 0.2413452027695351, "grad_norm": 2.4544849395751953, "kl_approx": 0.2571220397949219, "learning_rate": 1.8835957647383304e-05, "loss": 0.175, "num_tokens": 5872689.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2584421634674072, "sampling/importance_sampling_ratio/mean": 1.0000208616256714, "sampling/importance_sampling_ratio/min": 0.8083779215812683, "sampling/sampling_logp_difference/max": 0.2298746109008789, "sampling/sampling_logp_difference/mean": 0.015055437572300434, "step": 244 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 299.0, "completions/max_terminated_length": 299.0, "completions/mean_length": 113.5, "completions/mean_terminated_length": 113.5, "completions/min_length": 18.0, "completions/min_terminated_length": 18.0, "entropy": 0.6309742857702076, "epoch": 0.2423343224530168, "grad_norm": 3.1405208110809326, "kl_approx": 0.30637454986572266, "learning_rate": 1.8819721714888878e-05, "loss": 0.2624, "num_tokens": 5897081.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1957024335861206, "sampling/importance_sampling_ratio/mean": 1.000077724456787, "sampling/importance_sampling_ratio/min": 0.8335638046264648, "sampling/sampling_logp_difference/max": 0.18204498291015625, "sampling/sampling_logp_difference/mean": 0.011632377281785011, "step": 245 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 479.0, "completions/max_terminated_length": 479.0, "completions/mean_length": 109.25, "completions/mean_terminated_length": 109.25, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.5707564014010131, "epoch": 0.2433234421364985, "grad_norm": 2.7850465774536133, "kl_approx": 0.2675743103027344, "learning_rate": 1.8803380434362e-05, "loss": 0.1802, "num_tokens": 5914281.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1616880893707275, "sampling/importance_sampling_ratio/mean": 1.0002697706222534, "sampling/importance_sampling_ratio/min": 0.8415634036064148, "sampling/sampling_logp_difference/max": 0.17249393463134766, "sampling/sampling_logp_difference/mean": 0.010010476224124432, "step": 246 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 386.0, "completions/max_terminated_length": 386.0, "completions/mean_length": 118.90625, "completions/mean_terminated_length": 118.90625, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.6378051619976759, "epoch": 0.2443125618199802, "grad_norm": 2.910785675048828, "kl_approx": 0.2985076904296875, "learning_rate": 1.878693400099269e-05, "loss": 0.1761, "num_tokens": 5936782.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1438119411468506, "sampling/importance_sampling_ratio/mean": 1.0003470182418823, "sampling/importance_sampling_ratio/min": 0.8807020783424377, "sampling/sampling_logp_difference/max": 0.13436651229858398, "sampling/sampling_logp_difference/mean": 0.01189448032528162, "step": 247 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 705.0, "completions/max_terminated_length": 705.0, "completions/mean_length": 202.84375, "completions/mean_terminated_length": 202.84375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.8097506552003324, "epoch": 0.24530168150346193, "grad_norm": 3.200960874557495, "kl_approx": 0.3280487060546875, "learning_rate": 1.877038261122699e-05, "loss": 0.2236, "num_tokens": 5962041.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2076621055603027, "sampling/importance_sampling_ratio/mean": 0.999841570854187, "sampling/importance_sampling_ratio/min": 0.8294474482536316, "sampling/sampling_logp_difference/max": 0.18868637084960938, "sampling/sampling_logp_difference/mean": 0.015314118005335331, "step": 248 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 251.0, "completions/max_terminated_length": 251.0, "completions/mean_length": 77.75, "completions/mean_terminated_length": 77.75, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.5310401674360037, "epoch": 0.24629080118694363, "grad_norm": 3.114018201828003, "kl_approx": 0.25604248046875, "learning_rate": 1.87537264627646e-05, "loss": 0.1655, "num_tokens": 5984201.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.135076880455017, "sampling/importance_sampling_ratio/mean": 1.0014406442642212, "sampling/importance_sampling_ratio/min": 0.8749927282333374, "sampling/sampling_logp_difference/max": 0.13353967666625977, "sampling/sampling_logp_difference/mean": 0.00955023430287838, "step": 249 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 414.0, "completions/max_terminated_length": 414.0, "completions/mean_length": 165.59375, "completions/mean_terminated_length": 165.59375, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.9683704702183604, "epoch": 0.24727992087042533, "grad_norm": 2.9160985946655273, "kl_approx": 0.34423828125, "learning_rate": 1.8736965754556527e-05, "loss": 0.2257, "num_tokens": 6008380.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1938070058822632, "sampling/importance_sampling_ratio/mean": 0.9996144771575928, "sampling/importance_sampling_ratio/min": 0.8227328658103943, "sampling/sampling_logp_difference/max": 0.19512367248535156, "sampling/sampling_logp_difference/mean": 0.015261182561516762, "step": 250 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 696.0, "completions/max_terminated_length": 696.0, "completions/mean_length": 206.53125, "completions/mean_terminated_length": 206.53125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.734200544655323, "epoch": 0.24826904055390703, "grad_norm": 2.265373945236206, "kl_approx": 0.2452392578125, "learning_rate": 1.8720100686802693e-05, "loss": 0.173, "num_tokens": 6043661.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2176592350006104, "sampling/importance_sampling_ratio/mean": 0.9999580383300781, "sampling/importance_sampling_ratio/min": 0.7978817820549011, "sampling/sampling_logp_difference/max": 0.22579479217529297, "sampling/sampling_logp_difference/mean": 0.011789221316576004, "step": 251 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 488.0, "completions/max_terminated_length": 488.0, "completions/mean_length": 116.71875, "completions/mean_terminated_length": 116.71875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.8170098252594471, "epoch": 0.24925816023738873, "grad_norm": 3.788538694381714, "kl_approx": 0.35205078125, "learning_rate": 1.8703131460949555e-05, "loss": 0.2262, "num_tokens": 6069884.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2335857152938843, "sampling/importance_sampling_ratio/mean": 1.0003721714019775, "sampling/importance_sampling_ratio/min": 0.8483299612998962, "sampling/sampling_logp_difference/max": 0.20992517471313477, "sampling/sampling_logp_difference/mean": 0.013158032670617104, "step": 252 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 361.0, "completions/max_terminated_length": 361.0, "completions/mean_length": 124.15625, "completions/mean_terminated_length": 124.15625, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.6976150772534311, "epoch": 0.2502472799208704, "grad_norm": 2.345968723297119, "kl_approx": 0.29544830322265625, "learning_rate": 1.86860582796877e-05, "loss": 0.1778, "num_tokens": 6094665.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1928038597106934, "sampling/importance_sampling_ratio/mean": 1.0006217956542969, "sampling/importance_sampling_ratio/min": 0.8621042370796204, "sampling/sampling_logp_difference/max": 0.17630672454833984, "sampling/sampling_logp_difference/mean": 0.012578437104821205, "step": 253 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 987.0, "completions/max_terminated_length": 987.0, "completions/mean_length": 207.8125, "completions/mean_terminated_length": 207.8125, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.6181977167725563, "epoch": 0.2512363996043521, "grad_norm": 2.2176454067230225, "kl_approx": 0.26081085205078125, "learning_rate": 1.866888134694942e-05, "loss": 0.1735, "num_tokens": 6122067.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1774410009384155, "sampling/importance_sampling_ratio/mean": 0.999228298664093, "sampling/importance_sampling_ratio/min": 0.8295028209686279, "sampling/sampling_logp_difference/max": 0.18692874908447266, "sampling/sampling_logp_difference/mean": 0.011136235669255257, "step": 254 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 802.0, "completions/max_terminated_length": 802.0, "completions/mean_length": 166.5625, "completions/mean_terminated_length": 166.5625, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.7053878409788013, "epoch": 0.2522255192878338, "grad_norm": 2.4710538387298584, "kl_approx": 0.3014373779296875, "learning_rate": 1.865160086790627e-05, "loss": 0.1963, "num_tokens": 6143221.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2361165285110474, "sampling/importance_sampling_ratio/mean": 1.0000426769256592, "sampling/importance_sampling_ratio/min": 0.850463330745697, "sampling/sampling_logp_difference/max": 0.2119746208190918, "sampling/sampling_logp_difference/mean": 0.014212892390787601, "step": 255 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 1018.0, "completions/max_terminated_length": 1018.0, "completions/mean_length": 219.5, "completions/mean_terminated_length": 219.5, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.7651667045429349, "epoch": 0.2532146389713155, "grad_norm": 2.52970027923584, "kl_approx": 0.285430908203125, "learning_rate": 1.8634217048966638e-05, "loss": 0.208, "num_tokens": 6168901.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1996407508850098, "sampling/importance_sampling_ratio/mean": 1.0000035762786865, "sampling/importance_sampling_ratio/min": 0.7754191160202026, "sampling/sampling_logp_difference/max": 0.2543516159057617, "sampling/sampling_logp_difference/mean": 0.011865036562085152, "step": 256 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 749.0, "completions/max_terminated_length": 749.0, "completions/mean_length": 248.4375, "completions/mean_terminated_length": 248.4375, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.8611204288899899, "epoch": 0.2542037586547972, "grad_norm": 3.3415417671203613, "kl_approx": 0.3981170654296875, "learning_rate": 1.861673009777325e-05, "loss": 0.2339, "num_tokens": 6198211.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.27825129032135, "sampling/importance_sampling_ratio/mean": 0.9999289512634277, "sampling/importance_sampling_ratio/min": 0.8141903281211853, "sampling/sampling_logp_difference/max": 0.24549293518066406, "sampling/sampling_logp_difference/mean": 0.013347550295293331, "step": 257 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 1003.0, "completions/max_terminated_length": 1003.0, "completions/mean_length": 315.1875, "completions/mean_terminated_length": 315.1875, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.9514345768839121, "epoch": 0.2551928783382789, "grad_norm": 3.32955265045166, "kl_approx": 0.31549072265625, "learning_rate": 1.8599140223200716e-05, "loss": 0.2785, "num_tokens": 6228697.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2381187677383423, "sampling/importance_sampling_ratio/mean": 0.9999781250953674, "sampling/importance_sampling_ratio/min": 0.789922833442688, "sampling/sampling_logp_difference/max": 0.23582005500793457, "sampling/sampling_logp_difference/mean": 0.014978324994444847, "step": 258 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 414.0, "completions/max_terminated_length": 414.0, "completions/mean_length": 118.5625, "completions/mean_terminated_length": 118.5625, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.6374960239045322, "epoch": 0.2561819980217606, "grad_norm": 2.5630977153778076, "kl_approx": 0.21505355834960938, "learning_rate": 1.858144763535302e-05, "loss": 0.1644, "num_tokens": 6254027.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1675320863723755, "sampling/importance_sampling_ratio/mean": 1.000195860862732, "sampling/importance_sampling_ratio/min": 0.8264777660369873, "sampling/sampling_logp_difference/max": 0.190582275390625, "sampling/sampling_logp_difference/mean": 0.012435130774974823, "step": 259 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 746.0, "completions/max_terminated_length": 746.0, "completions/mean_length": 232.03125, "completions/mean_terminated_length": 232.03125, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.8175475019961596, "epoch": 0.2571711177052423, "grad_norm": 3.6637983322143555, "kl_approx": 0.39014434814453125, "learning_rate": 1.8563652545561014e-05, "loss": 0.2757, "num_tokens": 6278756.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.194381594657898, "sampling/importance_sampling_ratio/mean": 1.0003455877304077, "sampling/importance_sampling_ratio/min": 0.8545555472373962, "sampling/sampling_logp_difference/max": 0.1776285171508789, "sampling/sampling_logp_difference/mean": 0.01306745782494545, "step": 260 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 875.0, "completions/max_terminated_length": 875.0, "completions/mean_length": 229.84375, "completions/mean_terminated_length": 229.84375, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.6362983407452703, "epoch": 0.258160237388724, "grad_norm": 2.0252318382263184, "kl_approx": 0.20578742027282715, "learning_rate": 1.8545755166379898e-05, "loss": 0.1786, "num_tokens": 6307399.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.255062460899353, "sampling/importance_sampling_ratio/mean": 1.000187873840332, "sampling/importance_sampling_ratio/min": 0.7375921010971069, "sampling/sampling_logp_difference/max": 0.30436432361602783, "sampling/sampling_logp_difference/mean": 0.01274816133081913, "step": 261 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 954.0, "completions/max_terminated_length": 954.0, "completions/mean_length": 267.46875, "completions/mean_terminated_length": 267.46875, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.8469747696071863, "epoch": 0.2591493570722057, "grad_norm": 2.2046382427215576, "kl_approx": 0.3128204345703125, "learning_rate": 1.852775571158668e-05, "loss": 0.1908, "num_tokens": 6335310.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2168724536895752, "sampling/importance_sampling_ratio/mean": 0.999741792678833, "sampling/importance_sampling_ratio/min": 0.8333194255828857, "sampling/sampling_logp_difference/max": 0.19628405570983887, "sampling/sampling_logp_difference/mean": 0.013291655108332634, "step": 262 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 523.0, "completions/max_terminated_length": 523.0, "completions/mean_length": 170.375, "completions/mean_terminated_length": 170.375, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.837700417265296, "epoch": 0.26013847675568746, "grad_norm": 2.7334036827087402, "kl_approx": 0.349151611328125, "learning_rate": 1.850965439617761e-05, "loss": 0.2329, "num_tokens": 6357842.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1958190202713013, "sampling/importance_sampling_ratio/mean": 1.0001704692840576, "sampling/importance_sampling_ratio/min": 0.8276202082633972, "sampling/sampling_logp_difference/max": 0.18920087814331055, "sampling/sampling_logp_difference/mean": 0.01420552097260952, "step": 263 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 624.0, "completions/max_terminated_length": 624.0, "completions/mean_length": 151.75, "completions/mean_terminated_length": 151.75, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.9040473736822605, "epoch": 0.26112759643916916, "grad_norm": 3.7835257053375244, "kl_approx": 0.4090423583984375, "learning_rate": 1.8491451436365628e-05, "loss": 0.2823, "num_tokens": 6380514.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.171353816986084, "sampling/importance_sampling_ratio/mean": 0.9996326565742493, "sampling/importance_sampling_ratio/min": 0.8048141002655029, "sampling/sampling_logp_difference/max": 0.21714401245117188, "sampling/sampling_logp_difference/mean": 0.014794974587857723, "step": 264 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 285.0, "completions/max_terminated_length": 285.0, "completions/mean_length": 101.6875, "completions/mean_terminated_length": 101.6875, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.7273328183218837, "epoch": 0.26211671612265086, "grad_norm": 2.64215350151062, "kl_approx": 0.283447265625, "learning_rate": 1.8473147049577777e-05, "loss": 0.1988, "num_tokens": 6399712.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1332677602767944, "sampling/importance_sampling_ratio/mean": 0.9994909167289734, "sampling/importance_sampling_ratio/min": 0.8055465817451477, "sampling/sampling_logp_difference/max": 0.2162342071533203, "sampling/sampling_logp_difference/mean": 0.01294513139873743, "step": 265 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 695.0, "completions/max_terminated_length": 695.0, "completions/mean_length": 179.46875, "completions/mean_terminated_length": 179.46875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.7899589100852609, "epoch": 0.26310583580613256, "grad_norm": 2.4730005264282227, "kl_approx": 0.2939167022705078, "learning_rate": 1.8454741454452604e-05, "loss": 0.2065, "num_tokens": 6428239.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1971691846847534, "sampling/importance_sampling_ratio/mean": 1.0003697872161865, "sampling/importance_sampling_ratio/min": 0.8207126259803772, "sampling/sampling_logp_difference/max": 0.19758224487304688, "sampling/sampling_logp_difference/mean": 0.014770924113690853, "step": 266 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 345.0, "completions/max_terminated_length": 345.0, "completions/mean_length": 117.78125, "completions/mean_terminated_length": 117.78125, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7121186791919172, "epoch": 0.26409495548961426, "grad_norm": 2.5290145874023438, "kl_approx": 0.2938804626464844, "learning_rate": 1.843623487083755e-05, "loss": 0.2051, "num_tokens": 6445832.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2087434530258179, "sampling/importance_sampling_ratio/mean": 1.0003143548965454, "sampling/importance_sampling_ratio/min": 0.8200746178627014, "sampling/sampling_logp_difference/max": 0.19835996627807617, "sampling/sampling_logp_difference/mean": 0.013039608485996723, "step": 267 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 335.0, "completions/max_terminated_length": 335.0, "completions/mean_length": 131.71875, "completions/mean_terminated_length": 131.71875, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.7606870573945343, "epoch": 0.26508407517309596, "grad_norm": 2.677860736846924, "kl_approx": 0.3374805450439453, "learning_rate": 1.8417627519786317e-05, "loss": 0.2237, "num_tokens": 6469295.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2280875444412231, "sampling/importance_sampling_ratio/mean": 0.9997721314430237, "sampling/importance_sampling_ratio/min": 0.8464064002037048, "sampling/sampling_logp_difference/max": 0.2054581642150879, "sampling/sampling_logp_difference/mean": 0.013750326819717884, "step": 268 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 206.0, "completions/max_terminated_length": 206.0, "completions/mean_length": 89.25, "completions/mean_terminated_length": 89.25, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6565246256068349, "epoch": 0.26607319485657766, "grad_norm": 3.0166139602661133, "kl_approx": 0.35611724853515625, "learning_rate": 1.839891962355624e-05, "loss": 0.2312, "num_tokens": 6489311.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1516737937927246, "sampling/importance_sampling_ratio/mean": 1.0002615451812744, "sampling/importance_sampling_ratio/min": 0.8777641654014587, "sampling/sampling_logp_difference/max": 0.14121627807617188, "sampling/sampling_logp_difference/mean": 0.012450135312974453, "step": 269 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 618.0, "completions/max_terminated_length": 618.0, "completions/mean_length": 153.65625, "completions/mean_terminated_length": 153.65625, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.5829455158673227, "epoch": 0.26706231454005935, "grad_norm": 1.89301335811615, "kl_approx": 0.17298126220703125, "learning_rate": 1.838011140560562e-05, "loss": 0.136, "num_tokens": 6510988.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2037020921707153, "sampling/importance_sampling_ratio/mean": 1.0001550912857056, "sampling/importance_sampling_ratio/min": 0.7927284836769104, "sampling/sampling_logp_difference/max": 0.23227453231811523, "sampling/sampling_logp_difference/mean": 0.012998693622648716, "step": 270 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 545.0, "completions/max_terminated_length": 545.0, "completions/mean_length": 163.6875, "completions/mean_terminated_length": 163.6875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.7352368859574199, "epoch": 0.26805143422354105, "grad_norm": 2.6686573028564453, "kl_approx": 0.23332977294921875, "learning_rate": 1.836120309059107e-05, "loss": 0.1802, "num_tokens": 6533562.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2149933576583862, "sampling/importance_sampling_ratio/mean": 1.0000017881393433, "sampling/importance_sampling_ratio/min": 0.8244803547859192, "sampling/sampling_logp_difference/max": 0.19473862648010254, "sampling/sampling_logp_difference/mean": 0.013422228395938873, "step": 271 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 816.0, "completions/max_terminated_length": 816.0, "completions/mean_length": 172.53125, "completions/mean_terminated_length": 172.53125, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.7640396486967802, "epoch": 0.26904055390702275, "grad_norm": 2.455402374267578, "kl_approx": 0.291748046875, "learning_rate": 1.8342194904364815e-05, "loss": 0.1728, "num_tokens": 6556835.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.15168035030365, "sampling/importance_sampling_ratio/mean": 0.9995319843292236, "sampling/importance_sampling_ratio/min": 0.7965874075889587, "sampling/sampling_logp_difference/max": 0.2274184226989746, "sampling/sampling_logp_difference/mean": 0.014608344994485378, "step": 272 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 949.0, "completions/max_terminated_length": 949.0, "completions/mean_length": 203.09375, "completions/mean_terminated_length": 203.09375, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.9471575552597642, "epoch": 0.27002967359050445, "grad_norm": 2.6995186805725098, "kl_approx": 0.363067626953125, "learning_rate": 1.8323087073971996e-05, "loss": 0.2283, "num_tokens": 6582102.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2342381477355957, "sampling/importance_sampling_ratio/mean": 1.0002514123916626, "sampling/importance_sampling_ratio/min": 0.8057738542556763, "sampling/sampling_logp_difference/max": 0.21595215797424316, "sampling/sampling_logp_difference/mean": 0.014374662190675735, "step": 273 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 546.0, "completions/max_terminated_length": 546.0, "completions/mean_length": 152.34375, "completions/mean_terminated_length": 152.34375, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.7210090886801481, "epoch": 0.27101879327398615, "grad_norm": 2.835953950881958, "kl_approx": 0.293792724609375, "learning_rate": 1.8303879827647977e-05, "loss": 0.2646, "num_tokens": 6612553.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.529760718345642, "sampling/importance_sampling_ratio/mean": 0.9997280836105347, "sampling/importance_sampling_ratio/min": 0.8696050643920898, "sampling/sampling_logp_difference/max": 0.4251112937927246, "sampling/sampling_logp_difference/mean": 0.011369016952812672, "step": 274 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 694.0, "completions/max_terminated_length": 694.0, "completions/mean_length": 128.53125, "completions/mean_terminated_length": 128.53125, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.8139790697023273, "epoch": 0.27200791295746785, "grad_norm": 2.8997466564178467, "kl_approx": 0.33301544189453125, "learning_rate": 1.8284573394815596e-05, "loss": 0.2046, "num_tokens": 6635178.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1900774240493774, "sampling/importance_sampling_ratio/mean": 0.9996291399002075, "sampling/importance_sampling_ratio/min": 0.8119118809700012, "sampling/sampling_logp_difference/max": 0.20836353302001953, "sampling/sampling_logp_difference/mean": 0.014103001914918423, "step": 275 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 146.0, "completions/max_terminated_length": 146.0, "completions/mean_length": 78.46875, "completions/mean_terminated_length": 78.46875, "completions/min_length": 17.0, "completions/min_terminated_length": 17.0, "entropy": 0.6132251652888954, "epoch": 0.27299703264094954, "grad_norm": 3.064506769180298, "kl_approx": 0.28894805908203125, "learning_rate": 1.826516800608244e-05, "loss": 0.1735, "num_tokens": 6655881.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2053059339523315, "sampling/importance_sampling_ratio/mean": 1.0005022287368774, "sampling/importance_sampling_ratio/min": 0.8730798363685608, "sampling/sampling_logp_difference/max": 0.18673348426818848, "sampling/sampling_logp_difference/mean": 0.010536580346524715, "step": 276 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 379.0, "completions/max_terminated_length": 379.0, "completions/mean_length": 110.34375, "completions/mean_terminated_length": 110.34375, "completions/min_length": 19.0, "completions/min_terminated_length": 19.0, "entropy": 0.6002367818728089, "epoch": 0.27398615232443124, "grad_norm": 2.6671674251556396, "kl_approx": 0.21013832092285156, "learning_rate": 1.8245663893238075e-05, "loss": 0.1583, "num_tokens": 6678148.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1797600984573364, "sampling/importance_sampling_ratio/mean": 1.0004637241363525, "sampling/importance_sampling_ratio/min": 0.828397274017334, "sampling/sampling_logp_difference/max": 0.1882624626159668, "sampling/sampling_logp_difference/mean": 0.012014534324407578, "step": 277 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 464.0, "completions/max_terminated_length": 464.0, "completions/mean_length": 140.0625, "completions/mean_terminated_length": 140.0625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.7178203221410513, "epoch": 0.27497527200791294, "grad_norm": 2.621427059173584, "kl_approx": 0.30187225341796875, "learning_rate": 1.8226061289251297e-05, "loss": 0.1901, "num_tokens": 6701358.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1766642332077026, "sampling/importance_sampling_ratio/mean": 0.9992976188659668, "sampling/importance_sampling_ratio/min": 0.8742595911026001, "sampling/sampling_logp_difference/max": 0.16268348693847656, "sampling/sampling_logp_difference/mean": 0.01123831793665886, "step": 278 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 278.0, "completions/max_terminated_length": 278.0, "completions/mean_length": 124.71875, "completions/mean_terminated_length": 124.71875, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7544533615000546, "epoch": 0.27596439169139464, "grad_norm": 2.844728946685791, "kl_approx": 0.29319000244140625, "learning_rate": 1.8206360428267332e-05, "loss": 0.2182, "num_tokens": 6723125.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1419024467468262, "sampling/importance_sampling_ratio/mean": 0.9990918636322021, "sampling/importance_sampling_ratio/min": 0.8635880947113037, "sampling/sampling_logp_difference/max": 0.14665937423706055, "sampling/sampling_logp_difference/mean": 0.012254110537469387, "step": 279 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 609.0, "completions/max_terminated_length": 609.0, "completions/mean_length": 246.40625, "completions/mean_terminated_length": 246.40625, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.9971765512600541, "epoch": 0.27695351137487634, "grad_norm": 2.899927854537964, "kl_approx": 0.36212158203125, "learning_rate": 1.8186561545605055e-05, "loss": 0.2412, "num_tokens": 6750634.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1603909730911255, "sampling/importance_sampling_ratio/mean": 0.999725878238678, "sampling/importance_sampling_ratio/min": 0.8646631240844727, "sampling/sampling_logp_difference/max": 0.1487569808959961, "sampling/sampling_logp_difference/mean": 0.01443057507276535, "step": 280 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 398.0, "completions/max_terminated_length": 398.0, "completions/mean_length": 173.6875, "completions/mean_terminated_length": 173.6875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.8997823763638735, "epoch": 0.27794263105835804, "grad_norm": 2.642136812210083, "kl_approx": 0.3118133544921875, "learning_rate": 1.816666487775416e-05, "loss": 0.2171, "num_tokens": 6775848.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2122026681900024, "sampling/importance_sampling_ratio/mean": 0.999157190322876, "sampling/importance_sampling_ratio/min": 0.7813576459884644, "sampling/sampling_logp_difference/max": 0.24672222137451172, "sampling/sampling_logp_difference/mean": 0.015035804361104965, "step": 281 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 408.0, "completions/max_terminated_length": 408.0, "completions/mean_length": 137.96875, "completions/mean_terminated_length": 137.96875, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.6917269062250853, "epoch": 0.2789317507418398, "grad_norm": 1.9701180458068848, "kl_approx": 0.2175750732421875, "learning_rate": 1.8146670662372353e-05, "loss": 0.1549, "num_tokens": 6795791.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1528571844100952, "sampling/importance_sampling_ratio/mean": 1.0004239082336426, "sampling/importance_sampling_ratio/min": 0.8303714990615845, "sampling/sampling_logp_difference/max": 0.1858820915222168, "sampling/sampling_logp_difference/mean": 0.013751442544162273, "step": 282 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 596.0, "completions/max_terminated_length": 596.0, "completions/mean_length": 205.8125, "completions/mean_terminated_length": 205.8125, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.9559988332912326, "epoch": 0.2799208704253215, "grad_norm": 2.5761358737945557, "kl_approx": 0.343414306640625, "learning_rate": 1.8126579138282502e-05, "loss": 0.2287, "num_tokens": 6828121.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2181378602981567, "sampling/importance_sampling_ratio/mean": 0.9998427033424377, "sampling/importance_sampling_ratio/min": 0.8122193217277527, "sampling/sampling_logp_difference/max": 0.20798492431640625, "sampling/sampling_logp_difference/mean": 0.016082478687167168, "step": 283 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 461.0, "completions/max_terminated_length": 461.0, "completions/mean_length": 170.59375, "completions/mean_terminated_length": 170.59375, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.7337540173903108, "epoch": 0.2809099901088032, "grad_norm": 2.3644371032714844, "kl_approx": 0.244873046875, "learning_rate": 1.8106390545469797e-05, "loss": 0.203, "num_tokens": 6855796.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2447283267974854, "sampling/importance_sampling_ratio/mean": 1.0003597736358643, "sampling/importance_sampling_ratio/min": 0.8401584029197693, "sampling/sampling_logp_difference/max": 0.2189173698425293, "sampling/sampling_logp_difference/mean": 0.012584760785102844, "step": 284 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 638.0, "completions/max_terminated_length": 638.0, "completions/mean_length": 185.0, "completions/mean_terminated_length": 185.0, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.769881590269506, "epoch": 0.2818991097922849, "grad_norm": 2.6485514640808105, "kl_approx": 0.316741943359375, "learning_rate": 1.8086105125078858e-05, "loss": 0.2133, "num_tokens": 6883068.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2408983707427979, "sampling/importance_sampling_ratio/mean": 1.00046706199646, "sampling/importance_sampling_ratio/min": 0.7734773755073547, "sampling/sampling_logp_difference/max": 0.25685882568359375, "sampling/sampling_logp_difference/mean": 0.013372906483709812, "step": 285 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 857.0, "completions/max_terminated_length": 857.0, "completions/mean_length": 188.40625, "completions/mean_terminated_length": 188.40625, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.6370646376162767, "epoch": 0.2828882294757666, "grad_norm": 2.3806402683258057, "kl_approx": 0.2541618347167969, "learning_rate": 1.8065723119410885e-05, "loss": 0.1784, "num_tokens": 6915793.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2556909322738647, "sampling/importance_sampling_ratio/mean": 1.0005565881729126, "sampling/importance_sampling_ratio/min": 0.7984816431999207, "sampling/sampling_logp_difference/max": 0.22768592834472656, "sampling/sampling_logp_difference/mean": 0.011392634361982346, "step": 286 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 297.0, "completions/max_terminated_length": 297.0, "completions/mean_length": 115.46875, "completions/mean_terminated_length": 115.46875, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.6798480600118637, "epoch": 0.2838773491592483, "grad_norm": 3.0986886024475098, "kl_approx": 0.2765960693359375, "learning_rate": 1.804524477192075e-05, "loss": 0.2277, "num_tokens": 6933992.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1889050006866455, "sampling/importance_sampling_ratio/mean": 1.0004689693450928, "sampling/importance_sampling_ratio/min": 0.8637964725494385, "sampling/sampling_logp_difference/max": 0.1730327606201172, "sampling/sampling_logp_difference/mean": 0.01372337993234396, "step": 287 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 304.0, "completions/max_terminated_length": 304.0, "completions/mean_length": 135.84375, "completions/mean_terminated_length": 135.84375, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.7850636513903737, "epoch": 0.28486646884273, "grad_norm": 3.6997897624969482, "kl_approx": 0.384735107421875, "learning_rate": 1.8024670327214084e-05, "loss": 0.2873, "num_tokens": 6955331.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1435002088546753, "sampling/importance_sampling_ratio/mean": 0.9999605417251587, "sampling/importance_sampling_ratio/min": 0.8320849537849426, "sampling/sampling_logp_difference/max": 0.1838207244873047, "sampling/sampling_logp_difference/mean": 0.013304715976119041, "step": 288 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 301.0, "completions/max_terminated_length": 301.0, "completions/mean_length": 128.125, "completions/mean_terminated_length": 128.125, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7551005519926548, "epoch": 0.2858555885262117, "grad_norm": 2.53135085105896, "kl_approx": 0.28559112548828125, "learning_rate": 1.8004000031044363e-05, "loss": 0.1794, "num_tokens": 6983119.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1393771171569824, "sampling/importance_sampling_ratio/mean": 0.999236524105072, "sampling/importance_sampling_ratio/min": 0.8413154482841492, "sampling/sampling_logp_difference/max": 0.1727886199951172, "sampling/sampling_logp_difference/mean": 0.011013248935341835, "step": 289 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 396.0, "completions/max_terminated_length": 396.0, "completions/mean_length": 144.0625, "completions/mean_terminated_length": 144.0625, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.7586485026404262, "epoch": 0.2868447082096934, "grad_norm": 2.2351346015930176, "kl_approx": 0.29018402099609375, "learning_rate": 1.798323413030997e-05, "loss": 0.1841, "num_tokens": 7005489.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1876126527786255, "sampling/importance_sampling_ratio/mean": 1.0005043745040894, "sampling/importance_sampling_ratio/min": 0.8623186349868774, "sampling/sampling_logp_difference/max": 0.17194509506225586, "sampling/sampling_logp_difference/mean": 0.014061874710023403, "step": 290 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 514.0, "completions/max_terminated_length": 514.0, "completions/mean_length": 163.84375, "completions/mean_terminated_length": 163.84375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.8267401978373528, "epoch": 0.2878338278931751, "grad_norm": 2.4321110248565674, "kl_approx": 0.3395042419433594, "learning_rate": 1.796237287305125e-05, "loss": 0.2321, "num_tokens": 7029076.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1893455982208252, "sampling/importance_sampling_ratio/mean": 1.0011012554168701, "sampling/importance_sampling_ratio/min": 0.8425796627998352, "sampling/sampling_logp_difference/max": 0.17340326309204102, "sampling/sampling_logp_difference/mean": 0.01425518561154604, "step": 291 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 452.0, "completions/max_terminated_length": 452.0, "completions/mean_length": 138.0625, "completions/mean_terminated_length": 138.0625, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.79865199374035, "epoch": 0.2888229475766568, "grad_norm": 2.358048439025879, "kl_approx": 0.28905487060546875, "learning_rate": 1.7941416508447537e-05, "loss": 0.2169, "num_tokens": 7053126.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2217631340026855, "sampling/importance_sampling_ratio/mean": 1.0000317096710205, "sampling/importance_sampling_ratio/min": 0.8115402460098267, "sampling/sampling_logp_difference/max": 0.20882129669189453, "sampling/sampling_logp_difference/mean": 0.013350498862564564, "step": 292 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 821.0, "completions/max_terminated_length": 821.0, "completions/mean_length": 249.90625, "completions/mean_terminated_length": 249.90625, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.9886434320360422, "epoch": 0.2898120672601385, "grad_norm": 3.1051204204559326, "kl_approx": 0.32391357421875, "learning_rate": 1.792036528681418e-05, "loss": 0.247, "num_tokens": 7077731.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2592612504959106, "sampling/importance_sampling_ratio/mean": 0.999854326248169, "sampling/importance_sampling_ratio/min": 0.775351881980896, "sampling/sampling_logp_difference/max": 0.2544384002685547, "sampling/sampling_logp_difference/mean": 0.014785322360694408, "step": 293 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 508.0, "completions/max_terminated_length": 508.0, "completions/mean_length": 135.3125, "completions/mean_terminated_length": 135.3125, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.9014694644138217, "epoch": 0.29080118694362017, "grad_norm": 3.2792179584503174, "kl_approx": 0.36553955078125, "learning_rate": 1.789921945959958e-05, "loss": 0.2509, "num_tokens": 7097925.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.180361270904541, "sampling/importance_sampling_ratio/mean": 1.0005325078964233, "sampling/importance_sampling_ratio/min": 0.8205909729003906, "sampling/sampling_logp_difference/max": 0.19773054122924805, "sampling/sampling_logp_difference/mean": 0.014601066708564758, "step": 294 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 789.0, "completions/max_terminated_length": 789.0, "completions/mean_length": 262.75, "completions/mean_terminated_length": 262.75, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.7073164647445083, "epoch": 0.29179030662710187, "grad_norm": 1.7222764492034912, "kl_approx": 0.22618865966796875, "learning_rate": 1.7877979279382135e-05, "loss": 0.1689, "num_tokens": 7128677.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1963460445404053, "sampling/importance_sampling_ratio/mean": 0.9996522068977356, "sampling/importance_sampling_ratio/min": 0.7813910245895386, "sampling/sampling_logp_difference/max": 0.24667954444885254, "sampling/sampling_logp_difference/mean": 0.012343580834567547, "step": 295 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 581.0, "completions/max_terminated_length": 581.0, "completions/mean_length": 153.71875, "completions/mean_terminated_length": 153.71875, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.7062114709988236, "epoch": 0.29277942631058357, "grad_norm": 2.4552528858184814, "kl_approx": 0.26074981689453125, "learning_rate": 1.7856644999867264e-05, "loss": 0.1951, "num_tokens": 7152228.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.308112382888794, "sampling/importance_sampling_ratio/mean": 1.0005593299865723, "sampling/importance_sampling_ratio/min": 0.8344243764877319, "sampling/sampling_logp_difference/max": 0.268585205078125, "sampling/sampling_logp_difference/mean": 0.012547975406050682, "step": 296 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 178.0, "completions/max_terminated_length": 178.0, "completions/mean_length": 87.34375, "completions/mean_terminated_length": 87.34375, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6183590926229954, "epoch": 0.29376854599406527, "grad_norm": 1.9936422109603882, "kl_approx": 0.21903157234191895, "learning_rate": 1.783521687588437e-05, "loss": 0.1514, "num_tokens": 7170575.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1669435501098633, "sampling/importance_sampling_ratio/mean": 1.0008279085159302, "sampling/importance_sampling_ratio/min": 0.8506006002426147, "sampling/sampling_logp_difference/max": 0.16181254386901855, "sampling/sampling_logp_difference/mean": 0.011522624641656876, "step": 297 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 300.0, "completions/max_terminated_length": 300.0, "completions/mean_length": 126.78125, "completions/mean_terminated_length": 126.78125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6006322121247649, "epoch": 0.29475766567754697, "grad_norm": 2.3153836727142334, "kl_approx": 0.24176025390625, "learning_rate": 1.781369516338378e-05, "loss": 0.1633, "num_tokens": 7193752.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1500394344329834, "sampling/importance_sampling_ratio/mean": 1.0003947019577026, "sampling/importance_sampling_ratio/min": 0.7957252264022827, "sampling/sampling_logp_difference/max": 0.2285013198852539, "sampling/sampling_logp_difference/mean": 0.010313395410776138, "step": 298 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 604.0, "completions/max_terminated_length": 604.0, "completions/mean_length": 165.5, "completions/mean_terminated_length": 165.5, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7353044738993049, "epoch": 0.29574678536102866, "grad_norm": 2.7496542930603027, "kl_approx": 0.3392333984375, "learning_rate": 1.779208011943371e-05, "loss": 0.2359, "num_tokens": 7213720.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1633710861206055, "sampling/importance_sampling_ratio/mean": 0.9998388290405273, "sampling/importance_sampling_ratio/min": 0.8292375206947327, "sampling/sampling_logp_difference/max": 0.18724870681762695, "sampling/sampling_logp_difference/mean": 0.013257890939712524, "step": 299 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 275.0, "completions/max_terminated_length": 275.0, "completions/mean_length": 118.625, "completions/mean_terminated_length": 118.625, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.7141266879625618, "epoch": 0.29673590504451036, "grad_norm": 2.838669538497925, "kl_approx": 0.309112548828125, "learning_rate": 1.777037200221717e-05, "loss": 0.2379, "num_tokens": 7238452.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2296544313430786, "sampling/importance_sampling_ratio/mean": 1.0002495050430298, "sampling/importance_sampling_ratio/min": 0.8321012258529663, "sampling/sampling_logp_difference/max": 0.20673322677612305, "sampling/sampling_logp_difference/mean": 0.011981537565588951, "step": 300 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 508.0, "completions/max_terminated_length": 508.0, "completions/mean_length": 113.6875, "completions/mean_terminated_length": 113.6875, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.7095110211521387, "epoch": 0.29772502472799206, "grad_norm": 2.6985971927642822, "kl_approx": 0.291595458984375, "learning_rate": 1.77485710710289e-05, "loss": 0.1773, "num_tokens": 7262042.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1687511205673218, "sampling/importance_sampling_ratio/mean": 1.0000685453414917, "sampling/importance_sampling_ratio/min": 0.8543300032615662, "sampling/sampling_logp_difference/max": 0.15743780136108398, "sampling/sampling_logp_difference/mean": 0.013693314045667648, "step": 301 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 292.0, "completions/max_terminated_length": 292.0, "completions/mean_length": 113.3125, "completions/mean_terminated_length": 113.3125, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.7567874817177653, "epoch": 0.2987141444114738, "grad_norm": 2.950988531112671, "kl_approx": 0.38045501708984375, "learning_rate": 1.7726677586272263e-05, "loss": 0.257, "num_tokens": 7286220.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2035075426101685, "sampling/importance_sampling_ratio/mean": 0.999890923500061, "sampling/importance_sampling_ratio/min": 0.812684953212738, "sampling/sampling_logp_difference/max": 0.2074117660522461, "sampling/sampling_logp_difference/mean": 0.012761159799993038, "step": 302 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 672.0, "completions/max_terminated_length": 672.0, "completions/mean_length": 185.5, "completions/mean_terminated_length": 185.5, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.5831036274321377, "epoch": 0.2997032640949555, "grad_norm": 2.4150466918945312, "kl_approx": 0.24143218994140625, "learning_rate": 1.7704691809456142e-05, "loss": 0.1821, "num_tokens": 7311620.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.5507961511611938, "sampling/importance_sampling_ratio/mean": 1.0000437498092651, "sampling/importance_sampling_ratio/min": 0.8100433349609375, "sampling/sampling_logp_difference/max": 0.4387683868408203, "sampling/sampling_logp_difference/mean": 0.010963356122374535, "step": 303 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 776.0, "completions/max_terminated_length": 776.0, "completions/mean_length": 172.875, "completions/mean_terminated_length": 172.875, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.7722360463812947, "epoch": 0.3006923837784372, "grad_norm": 2.2434005737304688, "kl_approx": 0.29010009765625, "learning_rate": 1.7682614003191807e-05, "loss": 0.2088, "num_tokens": 7332672.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1927436590194702, "sampling/importance_sampling_ratio/mean": 1.000109076499939, "sampling/importance_sampling_ratio/min": 0.7187306880950928, "sampling/sampling_logp_difference/max": 0.33026862144470215, "sampling/sampling_logp_difference/mean": 0.01385170966386795, "step": 304 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 749.0, "completions/max_terminated_length": 749.0, "completions/mean_length": 266.3125, "completions/mean_terminated_length": 266.3125, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.8784914426505566, "epoch": 0.3016815034619189, "grad_norm": 2.5032622814178467, "kl_approx": 0.33319091796875, "learning_rate": 1.766044443118978e-05, "loss": 0.2532, "num_tokens": 7362874.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2380260229110718, "sampling/importance_sampling_ratio/mean": 1.0003330707550049, "sampling/importance_sampling_ratio/min": 0.8043450713157654, "sampling/sampling_logp_difference/max": 0.2177269458770752, "sampling/sampling_logp_difference/mean": 0.014404799789190292, "step": 305 }, { "completions/clipped_ratio": 0.125, "completions/max_length": 1024.0, "completions/max_terminated_length": 848.0, "completions/mean_length": 331.75, "completions/mean_terminated_length": 232.85714721679688, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.9333799220621586, "epoch": 0.3026706231454006, "grad_norm": 1.9041674137115479, "kl_approx": 0.265899658203125, "learning_rate": 1.76381833582567e-05, "loss": 0.1712, "num_tokens": 7400154.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2089046239852905, "sampling/importance_sampling_ratio/mean": 1.000046730041504, "sampling/importance_sampling_ratio/min": 0.7312637567520142, "sampling/sampling_logp_difference/max": 0.31298112869262695, "sampling/sampling_logp_difference/mean": 0.014311689883470535, "step": 306 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 352.0, "completions/max_terminated_length": 352.0, "completions/mean_length": 124.5, "completions/mean_terminated_length": 124.5, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.8359832325950265, "epoch": 0.3036597428288823, "grad_norm": 2.4830639362335205, "kl_approx": 0.333831787109375, "learning_rate": 1.761583105029213e-05, "loss": 0.2109, "num_tokens": 7423450.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.185927391052246, "sampling/importance_sampling_ratio/mean": 1.000803828239441, "sampling/importance_sampling_ratio/min": 0.8344119191169739, "sampling/sampling_logp_difference/max": 0.18102812767028809, "sampling/sampling_logp_difference/mean": 0.013677140697836876, "step": 307 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 745.0, "completions/max_terminated_length": 745.0, "completions/mean_length": 150.15625, "completions/mean_terminated_length": 150.15625, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.9037802591919899, "epoch": 0.304648862512364, "grad_norm": 3.295927047729492, "kl_approx": 0.34511566162109375, "learning_rate": 1.7593387774285412e-05, "loss": 0.2455, "num_tokens": 7445503.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.29276704788208, "sampling/importance_sampling_ratio/mean": 1.000915765762329, "sampling/importance_sampling_ratio/min": 0.8182945847511292, "sampling/sampling_logp_difference/max": 0.25678491592407227, "sampling/sampling_logp_difference/mean": 0.01416583452373743, "step": 308 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 775.0, "completions/max_terminated_length": 775.0, "completions/mean_length": 204.28125, "completions/mean_terminated_length": 204.28125, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.9801548514515162, "epoch": 0.3056379821958457, "grad_norm": 2.721508502960205, "kl_approx": 0.3337554931640625, "learning_rate": 1.7570853798312462e-05, "loss": 0.2328, "num_tokens": 7472768.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2582334280014038, "sampling/importance_sampling_ratio/mean": 0.9999727010726929, "sampling/importance_sampling_ratio/min": 0.7821531891822815, "sampling/sampling_logp_difference/max": 0.24570465087890625, "sampling/sampling_logp_difference/mean": 0.015173878520727158, "step": 309 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 573.0, "completions/max_terminated_length": 573.0, "completions/mean_length": 160.75, "completions/mean_terminated_length": 160.75, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.811941085383296, "epoch": 0.3066271018793274, "grad_norm": 3.168898582458496, "kl_approx": 0.3369140625, "learning_rate": 1.7548229391532572e-05, "loss": 0.1955, "num_tokens": 7496200.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.179616928100586, "sampling/importance_sampling_ratio/mean": 1.0002747774124146, "sampling/importance_sampling_ratio/min": 0.8288637399673462, "sampling/sampling_logp_difference/max": 0.187699556350708, "sampling/sampling_logp_difference/mean": 0.011781209148466587, "step": 310 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 558.0, "completions/max_terminated_length": 558.0, "completions/mean_length": 142.5, "completions/mean_terminated_length": 142.5, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.7952607600018382, "epoch": 0.3076162215628091, "grad_norm": 2.547868251800537, "kl_approx": 0.3126983642578125, "learning_rate": 1.7525514824185187e-05, "loss": 0.2062, "num_tokens": 7521456.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1848186254501343, "sampling/importance_sampling_ratio/mean": 0.9998703598976135, "sampling/importance_sampling_ratio/min": 0.8693347573280334, "sampling/sampling_logp_difference/max": 0.16958975791931152, "sampling/sampling_logp_difference/mean": 0.01422309409826994, "step": 311 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 622.0, "completions/max_terminated_length": 622.0, "completions/mean_length": 188.75, "completions/mean_terminated_length": 188.75, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.9201382072642446, "epoch": 0.3086053412462908, "grad_norm": 2.5949835777282715, "kl_approx": 0.305145263671875, "learning_rate": 1.750271036758669e-05, "loss": 0.2291, "num_tokens": 7544608.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.243618369102478, "sampling/importance_sampling_ratio/mean": 1.000194787979126, "sampling/importance_sampling_ratio/min": 0.8223516941070557, "sampling/sampling_logp_difference/max": 0.21802520751953125, "sampling/sampling_logp_difference/mean": 0.014224348589777946, "step": 312 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 294.0, "completions/max_terminated_length": 294.0, "completions/mean_length": 66.78125, "completions/mean_terminated_length": 66.78125, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.4123487868346274, "epoch": 0.3095944609297725, "grad_norm": 2.082361936569214, "kl_approx": 0.15377044677734375, "learning_rate": 1.747981629412715e-05, "loss": 0.1249, "num_tokens": 7559497.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1596769094467163, "sampling/importance_sampling_ratio/mean": 0.998990535736084, "sampling/importance_sampling_ratio/min": 0.8791318535804749, "sampling/sampling_logp_difference/max": 0.14814138412475586, "sampling/sampling_logp_difference/mean": 0.00934837106615305, "step": 313 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 851.0, "completions/max_terminated_length": 851.0, "completions/mean_length": 226.5, "completions/mean_terminated_length": 226.5, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.6805483684875071, "epoch": 0.3105835806132542, "grad_norm": 2.3783607482910156, "kl_approx": 0.27045440673828125, "learning_rate": 1.7456832877267083e-05, "loss": 0.1623, "num_tokens": 7588977.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2857998609542847, "sampling/importance_sampling_ratio/mean": 0.9996693134307861, "sampling/importance_sampling_ratio/min": 0.8160499334335327, "sampling/sampling_logp_difference/max": 0.25138092041015625, "sampling/sampling_logp_difference/mean": 0.013767233118414879, "step": 314 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 655.0, "completions/max_terminated_length": 655.0, "completions/mean_length": 213.875, "completions/mean_terminated_length": 213.875, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 1.061541692353785, "epoch": 0.3115727002967359, "grad_norm": 2.9245636463165283, "kl_approx": 0.339569091796875, "learning_rate": 1.7433760391534166e-05, "loss": 0.2708, "num_tokens": 7610517.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2627816200256348, "sampling/importance_sampling_ratio/mean": 1.0001723766326904, "sampling/importance_sampling_ratio/min": 0.8057682514190674, "sampling/sampling_logp_difference/max": 0.23331689834594727, "sampling/sampling_logp_difference/mean": 0.01707172766327858, "step": 315 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 368.0, "completions/max_terminated_length": 368.0, "completions/mean_length": 176.4375, "completions/mean_terminated_length": 176.4375, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.7591512352228165, "epoch": 0.3125618199802176, "grad_norm": 2.69907283782959, "kl_approx": 0.30389404296875, "learning_rate": 1.741059911251997e-05, "loss": 0.2101, "num_tokens": 7638563.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1901832818984985, "sampling/importance_sampling_ratio/mean": 0.9997280836105347, "sampling/importance_sampling_ratio/min": 0.8279536366462708, "sampling/sampling_logp_difference/max": 0.188798189163208, "sampling/sampling_logp_difference/mean": 0.012978103011846542, "step": 316 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 250.0, "completions/max_terminated_length": 250.0, "completions/mean_length": 114.625, "completions/mean_terminated_length": 114.625, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.7344440892338753, "epoch": 0.3135509396636993, "grad_norm": 2.5733983516693115, "kl_approx": 0.2907562255859375, "learning_rate": 1.7387349316876668e-05, "loss": 0.1854, "num_tokens": 7663679.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1945958137512207, "sampling/importance_sampling_ratio/mean": 0.9997657537460327, "sampling/importance_sampling_ratio/min": 0.8389726281166077, "sampling/sampling_logp_difference/max": 0.17780792713165283, "sampling/sampling_logp_difference/mean": 0.012271163985133171, "step": 317 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 975.0, "completions/max_terminated_length": 975.0, "completions/mean_length": 188.625, "completions/mean_terminated_length": 188.625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6078087952919304, "epoch": 0.314540059347181, "grad_norm": 4.636024475097656, "kl_approx": 0.27092742919921875, "learning_rate": 1.7364011282313732e-05, "loss": 0.2253, "num_tokens": 7685579.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.413045048713684, "sampling/importance_sampling_ratio/mean": 1.0004764795303345, "sampling/importance_sampling_ratio/min": 0.6871237754821777, "sampling/sampling_logp_difference/max": 0.3752408027648926, "sampling/sampling_logp_difference/mean": 0.01063003484159708, "step": 318 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 353.0, "completions/max_terminated_length": 353.0, "completions/mean_length": 117.6875, "completions/mean_terminated_length": 117.6875, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.538060920778662, "epoch": 0.3155291790306627, "grad_norm": 2.4417264461517334, "kl_approx": 0.22021102905273438, "learning_rate": 1.7340585287594605e-05, "loss": 0.1708, "num_tokens": 7710905.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1498738527297974, "sampling/importance_sampling_ratio/mean": 1.0002936124801636, "sampling/importance_sampling_ratio/min": 0.8082682490348816, "sampling/sampling_logp_difference/max": 0.2128612995147705, "sampling/sampling_logp_difference/mean": 0.010301164351403713, "step": 319 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 703.0, "completions/max_terminated_length": 703.0, "completions/mean_length": 197.25, "completions/mean_terminated_length": 197.25, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7277012141421437, "epoch": 0.3165182987141444, "grad_norm": 1.8807249069213867, "kl_approx": 0.2105560302734375, "learning_rate": 1.731707161253338e-05, "loss": 0.1725, "num_tokens": 7737369.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2102413177490234, "sampling/importance_sampling_ratio/mean": 1.0001676082611084, "sampling/importance_sampling_ratio/min": 0.7940690517425537, "sampling/sampling_logp_difference/max": 0.23058485984802246, "sampling/sampling_logp_difference/mean": 0.01430986262857914, "step": 320 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 441.0, "completions/max_terminated_length": 441.0, "completions/mean_length": 125.3125, "completions/mean_terminated_length": 125.3125, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.734582195058465, "epoch": 0.31750741839762614, "grad_norm": 2.896090507507324, "kl_approx": 0.3123779296875, "learning_rate": 1.7293470537991463e-05, "loss": 0.2412, "num_tokens": 7762707.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1922818422317505, "sampling/importance_sampling_ratio/mean": 1.0006396770477295, "sampling/importance_sampling_ratio/min": 0.7879047989845276, "sampling/sampling_logp_difference/max": 0.23837804794311523, "sampling/sampling_logp_difference/mean": 0.013731887564063072, "step": 321 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 602.0, "completions/max_terminated_length": 602.0, "completions/mean_length": 144.59375, "completions/mean_terminated_length": 144.59375, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.8370183417573571, "epoch": 0.31849653808110784, "grad_norm": 2.4357006549835205, "kl_approx": 0.278076171875, "learning_rate": 1.7269782345874204e-05, "loss": 0.1784, "num_tokens": 7787902.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1571754217147827, "sampling/importance_sampling_ratio/mean": 0.9991551637649536, "sampling/importance_sampling_ratio/min": 0.8420906662940979, "sampling/sampling_logp_difference/max": 0.17186760902404785, "sampling/sampling_logp_difference/mean": 0.014920658431947231, "step": 322 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 480.0, "completions/max_terminated_length": 480.0, "completions/mean_length": 117.0, "completions/mean_terminated_length": 117.0, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.7496029892936349, "epoch": 0.31948565776458954, "grad_norm": 3.4023690223693848, "kl_approx": 0.296173095703125, "learning_rate": 1.7246007319127547e-05, "loss": 0.1955, "num_tokens": 7811558.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1666719913482666, "sampling/importance_sampling_ratio/mean": 1.000491976737976, "sampling/importance_sampling_ratio/min": 0.8648551106452942, "sampling/sampling_logp_difference/max": 0.15415525436401367, "sampling/sampling_logp_difference/mean": 0.013773888349533081, "step": 323 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 557.0, "completions/max_terminated_length": 557.0, "completions/mean_length": 159.28125, "completions/mean_terminated_length": 159.28125, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.6421801568940282, "epoch": 0.32047477744807124, "grad_norm": 2.133829116821289, "kl_approx": 0.2075653076171875, "learning_rate": 1.7222145741734625e-05, "loss": 0.1409, "num_tokens": 7832951.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1435959339141846, "sampling/importance_sampling_ratio/mean": 1.0000251531600952, "sampling/importance_sampling_ratio/min": 0.8439325094223022, "sampling/sampling_logp_difference/max": 0.16968274116516113, "sampling/sampling_logp_difference/mean": 0.010992590337991714, "step": 324 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 258.0, "completions/max_terminated_length": 258.0, "completions/mean_length": 111.71875, "completions/mean_terminated_length": 111.71875, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.5186840426176786, "epoch": 0.32146389713155293, "grad_norm": 2.301877021789551, "kl_approx": 0.17468643188476562, "learning_rate": 1.7198197898712402e-05, "loss": 0.1228, "num_tokens": 7854902.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.152989149093628, "sampling/importance_sampling_ratio/mean": 1.0004150867462158, "sampling/importance_sampling_ratio/min": 0.8422931432723999, "sampling/sampling_logp_difference/max": 0.17162716388702393, "sampling/sampling_logp_difference/mean": 0.00966770201921463, "step": 325 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 485.0, "completions/max_terminated_length": 485.0, "completions/mean_length": 132.34375, "completions/mean_terminated_length": 132.34375, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.7781155416741967, "epoch": 0.32245301681503463, "grad_norm": 2.694973945617676, "kl_approx": 0.320892333984375, "learning_rate": 1.717416407610824e-05, "loss": 0.2261, "num_tokens": 7876761.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2620285749435425, "sampling/importance_sampling_ratio/mean": 1.0005673170089722, "sampling/importance_sampling_ratio/min": 0.7546735405921936, "sampling/sampling_logp_difference/max": 0.28147006034851074, "sampling/sampling_logp_difference/mean": 0.013519820757210255, "step": 326 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 267.0, "completions/max_terminated_length": 267.0, "completions/mean_length": 98.0625, "completions/mean_terminated_length": 98.0625, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.639696694444865, "epoch": 0.32344213649851633, "grad_norm": 2.9873499870300293, "kl_approx": 0.3207893371582031, "learning_rate": 1.7150044560996488e-05, "loss": 0.2431, "num_tokens": 7899611.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2218170166015625, "sampling/importance_sampling_ratio/mean": 0.9997280836105347, "sampling/importance_sampling_ratio/min": 0.8298965096473694, "sampling/sampling_logp_difference/max": 0.20033907890319824, "sampling/sampling_logp_difference/mean": 0.011493654921650887, "step": 327 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 432.0, "completions/max_terminated_length": 432.0, "completions/mean_length": 150.65625, "completions/mean_terminated_length": 150.65625, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.9651678632944822, "epoch": 0.32443125618199803, "grad_norm": 3.117753028869629, "kl_approx": 0.324951171875, "learning_rate": 1.7125839641475074e-05, "loss": 0.2387, "num_tokens": 7924992.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2002174854278564, "sampling/importance_sampling_ratio/mean": 1.0000826120376587, "sampling/importance_sampling_ratio/min": 0.8420368432998657, "sampling/sampling_logp_difference/max": 0.18250274658203125, "sampling/sampling_logp_difference/mean": 0.015069739893078804, "step": 328 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 583.0, "completions/max_terminated_length": 583.0, "completions/mean_length": 211.78125, "completions/mean_terminated_length": 211.78125, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.8704281989485025, "epoch": 0.3254203758654797, "grad_norm": 2.6333398818969727, "kl_approx": 0.411834716796875, "learning_rate": 1.7101549606662025e-05, "loss": 0.2627, "num_tokens": 7957913.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.202318549156189, "sampling/importance_sampling_ratio/mean": 1.0005874633789062, "sampling/importance_sampling_ratio/min": 0.8206818699836731, "sampling/sampling_logp_difference/max": 0.19761979579925537, "sampling/sampling_logp_difference/mean": 0.014082243666052818, "step": 329 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 295.0, "completions/max_terminated_length": 295.0, "completions/mean_length": 121.90625, "completions/mean_terminated_length": 121.90625, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7842995952814817, "epoch": 0.3264094955489614, "grad_norm": 2.698920249938965, "kl_approx": 0.32391357421875, "learning_rate": 1.7077174746692054e-05, "loss": 0.1895, "num_tokens": 7981846.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1493991613388062, "sampling/importance_sampling_ratio/mean": 1.0004703998565674, "sampling/importance_sampling_ratio/min": 0.7930014729499817, "sampling/sampling_logp_difference/max": 0.23193025588989258, "sampling/sampling_logp_difference/mean": 0.013386135920882225, "step": 330 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 446.0, "completions/max_terminated_length": 446.0, "completions/mean_length": 118.40625, "completions/mean_terminated_length": 118.40625, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6225263751111925, "epoch": 0.3273986152324431, "grad_norm": 2.9460132122039795, "kl_approx": 0.2357025146484375, "learning_rate": 1.7052715352713076e-05, "loss": 0.1615, "num_tokens": 8006019.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2382031679153442, "sampling/importance_sampling_ratio/mean": 0.9998303055763245, "sampling/importance_sampling_ratio/min": 0.7931509613990784, "sampling/sampling_logp_difference/max": 0.2317417860031128, "sampling/sampling_logp_difference/mean": 0.013472470454871655, "step": 331 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 458.0, "completions/max_terminated_length": 458.0, "completions/mean_length": 138.1875, "completions/mean_terminated_length": 138.1875, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.6855741366744041, "epoch": 0.3283877349159248, "grad_norm": 3.0839734077453613, "kl_approx": 0.281585693359375, "learning_rate": 1.7028171716882714e-05, "loss": 0.2259, "num_tokens": 8026849.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2909655570983887, "sampling/importance_sampling_ratio/mean": 1.0004098415374756, "sampling/importance_sampling_ratio/min": 0.7945570945739746, "sampling/sampling_logp_difference/max": 0.2553904056549072, "sampling/sampling_logp_difference/mean": 0.012955369427800179, "step": 332 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 331.0, "completions/max_terminated_length": 331.0, "completions/mean_length": 96.8125, "completions/mean_terminated_length": 96.8125, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.5918765431270003, "epoch": 0.3293768545994065, "grad_norm": 2.312124013900757, "kl_approx": 0.20192718505859375, "learning_rate": 1.7003544132364847e-05, "loss": 0.1528, "num_tokens": 8050707.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2106544971466064, "sampling/importance_sampling_ratio/mean": 0.9998504519462585, "sampling/importance_sampling_ratio/min": 0.8512711524963379, "sampling/sampling_logp_difference/max": 0.1911611557006836, "sampling/sampling_logp_difference/mean": 0.011819862760603428, "step": 333 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 735.0, "completions/max_terminated_length": 735.0, "completions/mean_length": 185.15625, "completions/mean_terminated_length": 185.15625, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.8883398249745369, "epoch": 0.3303659742828882, "grad_norm": 2.7629902362823486, "kl_approx": 0.32049560546875, "learning_rate": 1.6978832893326074e-05, "loss": 0.2088, "num_tokens": 8074592.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.186069369316101, "sampling/importance_sampling_ratio/mean": 0.9999062418937683, "sampling/importance_sampling_ratio/min": 0.6885431408882141, "sampling/sampling_logp_difference/max": 0.37317728996276855, "sampling/sampling_logp_difference/mean": 0.01694898121058941, "step": 334 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 560.0, "completions/max_terminated_length": 560.0, "completions/mean_length": 216.21875, "completions/mean_terminated_length": 216.21875, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.9462208957411349, "epoch": 0.3313550939663699, "grad_norm": 2.465144634246826, "kl_approx": 0.3285369873046875, "learning_rate": 1.6954038294932215e-05, "loss": 0.2229, "num_tokens": 8106047.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1920123100280762, "sampling/importance_sampling_ratio/mean": 0.999750018119812, "sampling/importance_sampling_ratio/min": 0.7935164570808411, "sampling/sampling_logp_difference/max": 0.23128104209899902, "sampling/sampling_logp_difference/mean": 0.015693508088588715, "step": 335 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 993.0, "completions/mean_length": 271.53125, "completions/mean_terminated_length": 247.258056640625, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.735797509085387, "epoch": 0.3323442136498516, "grad_norm": 2.240936517715454, "kl_approx": 0.20676040649414062, "learning_rate": 1.692916063334479e-05, "loss": 0.1582, "num_tokens": 8138712.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.178946614265442, "sampling/importance_sampling_ratio/mean": 1.0002467632293701, "sampling/importance_sampling_ratio/min": 0.8015815615653992, "sampling/sampling_logp_difference/max": 0.22116851806640625, "sampling/sampling_logp_difference/mean": 0.013347666710615158, "step": 336 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 791.0, "completions/max_terminated_length": 791.0, "completions/mean_length": 213.0625, "completions/mean_terminated_length": 213.0625, "completions/min_length": 16.0, "completions/min_terminated_length": 16.0, "entropy": 0.9242281476035714, "epoch": 0.3333333333333333, "grad_norm": 2.6171796321868896, "kl_approx": 0.34039306640625, "learning_rate": 1.690420020571747e-05, "loss": 0.2334, "num_tokens": 8163234.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1770601272583008, "sampling/importance_sampling_ratio/mean": 0.9999088644981384, "sampling/importance_sampling_ratio/min": 0.8223693370819092, "sampling/sampling_logp_difference/max": 0.19556570053100586, "sampling/sampling_logp_difference/mean": 0.015630025416612625, "step": 337 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 544.0, "completions/max_terminated_length": 544.0, "completions/mean_length": 254.65625, "completions/mean_terminated_length": 254.65625, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.7351608574390411, "epoch": 0.334322453016815, "grad_norm": 2.166008949279785, "kl_approx": 0.27698516845703125, "learning_rate": 1.6879157310192537e-05, "loss": 0.2154, "num_tokens": 8195903.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2003525495529175, "sampling/importance_sampling_ratio/mean": 1.0004019737243652, "sampling/importance_sampling_ratio/min": 0.8317449688911438, "sampling/sampling_logp_difference/max": 0.18422937393188477, "sampling/sampling_logp_difference/mean": 0.012019136920571327, "step": 338 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 300.0, "completions/max_terminated_length": 300.0, "completions/mean_length": 138.0, "completions/mean_terminated_length": 138.0, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.681645249016583, "epoch": 0.3353115727002967, "grad_norm": 2.7927026748657227, "kl_approx": 0.2854576110839844, "learning_rate": 1.685403224589731e-05, "loss": 0.1845, "num_tokens": 8218079.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1737463474273682, "sampling/importance_sampling_ratio/mean": 0.9995397329330444, "sampling/importance_sampling_ratio/min": 0.8553330898284912, "sampling/sampling_logp_difference/max": 0.1602005958557129, "sampling/sampling_logp_difference/mean": 0.012534228153526783, "step": 339 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 522.0, "completions/max_terminated_length": 522.0, "completions/mean_length": 145.375, "completions/mean_terminated_length": 145.375, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 0.6974824108183384, "epoch": 0.3363006923837784, "grad_norm": 7.834415435791016, "kl_approx": 0.2658843994140625, "learning_rate": 1.6828825312940594e-05, "loss": 0.1807, "num_tokens": 8245331.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1552565097808838, "sampling/importance_sampling_ratio/mean": 1.0003085136413574, "sampling/importance_sampling_ratio/min": 0.8286535143852234, "sampling/sampling_logp_difference/max": 0.18795323371887207, "sampling/sampling_logp_difference/mean": 0.011320590041577816, "step": 340 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 254.0, "completions/max_terminated_length": 254.0, "completions/mean_length": 96.78125, "completions/mean_terminated_length": 96.78125, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6893311282619834, "epoch": 0.33728981206726016, "grad_norm": 2.5862979888916016, "kl_approx": 0.3193511962890625, "learning_rate": 1.6803536812409077e-05, "loss": 0.1912, "num_tokens": 8267524.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1379252672195435, "sampling/importance_sampling_ratio/mean": 0.9997590184211731, "sampling/importance_sampling_ratio/min": 0.8460214138031006, "sampling/sampling_logp_difference/max": 0.16721057891845703, "sampling/sampling_logp_difference/mean": 0.011431217193603516, "step": 341 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 401.0, "completions/max_terminated_length": 401.0, "completions/mean_length": 142.125, "completions/mean_terminated_length": 142.125, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.642220621695742, "epoch": 0.33827893175074186, "grad_norm": 2.7381465435028076, "kl_approx": 0.23992156982421875, "learning_rate": 1.6778167046363735e-05, "loss": 0.1889, "num_tokens": 8294360.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.267491340637207, "sampling/importance_sampling_ratio/mean": 1.0000215768814087, "sampling/importance_sampling_ratio/min": 0.8366511464118958, "sampling/sampling_logp_difference/max": 0.23703956604003906, "sampling/sampling_logp_difference/mean": 0.012712901458144188, "step": 342 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 354.0, "completions/max_terminated_length": 354.0, "completions/mean_length": 121.59375, "completions/mean_terminated_length": 121.59375, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.8493235902860761, "epoch": 0.33926805143422356, "grad_norm": 2.7640316486358643, "kl_approx": 0.32525634765625, "learning_rate": 1.675271631783623e-05, "loss": 0.2215, "num_tokens": 8319907.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.203780174255371, "sampling/importance_sampling_ratio/mean": 1.0004667043685913, "sampling/importance_sampling_ratio/min": 0.781249463558197, "sampling/sampling_logp_difference/max": 0.24686074256896973, "sampling/sampling_logp_difference/mean": 0.013187232427299023, "step": 343 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 126.0, "completions/max_terminated_length": 126.0, "completions/mean_length": 69.0625, "completions/mean_terminated_length": 69.0625, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.449458361370489, "epoch": 0.34025717111770526, "grad_norm": 2.7708165645599365, "kl_approx": 0.21734619140625, "learning_rate": 1.672718493082529e-05, "loss": 0.1339, "num_tokens": 8338093.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1871144771575928, "sampling/importance_sampling_ratio/mean": 0.9998024702072144, "sampling/importance_sampling_ratio/min": 0.7909983396530151, "sampling/sampling_logp_difference/max": 0.23445940017700195, "sampling/sampling_logp_difference/mean": 0.008594024926424026, "step": 344 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 120.0, "completions/max_terminated_length": 120.0, "completions/mean_length": 72.4375, "completions/mean_terminated_length": 72.4375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.5927004376426339, "epoch": 0.34124629080118696, "grad_norm": 3.043832302093506, "kl_approx": 0.28568267822265625, "learning_rate": 1.6701573190293076e-05, "loss": 0.1649, "num_tokens": 8356003.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1451889276504517, "sampling/importance_sampling_ratio/mean": 0.9995126724243164, "sampling/importance_sampling_ratio/min": 0.3746478259563446, "sampling/sampling_logp_difference/max": 0.9817688465118408, "sampling/sampling_logp_difference/mean": 0.011849264614284039, "step": 345 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 366.0, "completions/max_terminated_length": 366.0, "completions/mean_length": 115.71875, "completions/mean_terminated_length": 115.71875, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.5215674787759781, "epoch": 0.34223541048466866, "grad_norm": 5.8786845207214355, "kl_approx": 0.2333230972290039, "learning_rate": 1.667588140216154e-05, "loss": 0.1512, "num_tokens": 8385234.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2515674829483032, "sampling/importance_sampling_ratio/mean": 0.9995107054710388, "sampling/importance_sampling_ratio/min": 0.4951493740081787, "sampling/sampling_logp_difference/max": 0.7028958201408386, "sampling/sampling_logp_difference/mean": 0.010219091549515724, "step": 346 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 372.0, "completions/max_terminated_length": 372.0, "completions/mean_length": 184.15625, "completions/mean_terminated_length": 184.15625, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.9323503030464053, "epoch": 0.34322453016815035, "grad_norm": 2.77953839302063, "kl_approx": 0.354583740234375, "learning_rate": 1.6650109873308763e-05, "loss": 0.2593, "num_tokens": 8412191.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3314311504364014, "sampling/importance_sampling_ratio/mean": 1.0003751516342163, "sampling/importance_sampling_ratio/min": 0.8249359130859375, "sampling/sampling_logp_difference/max": 0.2862544059753418, "sampling/sampling_logp_difference/mean": 0.014484494924545288, "step": 347 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 784.0, "completions/max_terminated_length": 784.0, "completions/mean_length": 160.3125, "completions/mean_terminated_length": 160.3125, "completions/min_length": 21.0, "completions/min_terminated_length": 21.0, "entropy": 0.8016514405608177, "epoch": 0.34421364985163205, "grad_norm": 3.0054924488067627, "kl_approx": 0.4635162353515625, "learning_rate": 1.6624258911565312e-05, "loss": 0.251, "num_tokens": 8437329.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2469606399536133, "sampling/importance_sampling_ratio/mean": 0.9995077848434448, "sampling/importance_sampling_ratio/min": 0.7698357701301575, "sampling/sampling_logp_difference/max": 0.2615780830383301, "sampling/sampling_logp_difference/mean": 0.014198815450072289, "step": 348 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 435.0, "completions/max_terminated_length": 435.0, "completions/mean_length": 137.6875, "completions/mean_terminated_length": 137.6875, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.6603802088648081, "epoch": 0.34520276953511375, "grad_norm": 2.484124183654785, "kl_approx": 0.2418975830078125, "learning_rate": 1.6598328825710536e-05, "loss": 0.1786, "num_tokens": 8457511.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.143612265586853, "sampling/importance_sampling_ratio/mean": 0.9998595118522644, "sampling/importance_sampling_ratio/min": 0.8481531739234924, "sampling/sampling_logp_difference/max": 0.16469407081604004, "sampling/sampling_logp_difference/mean": 0.012545258738100529, "step": 349 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 652.0, "completions/mean_length": 373.15625, "completions/mean_terminated_length": 352.1612854003906, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 1.0246247667819262, "epoch": 0.34619188921859545, "grad_norm": 2.636146068572998, "kl_approx": 0.34759521484375, "learning_rate": 1.6572319925468892e-05, "loss": 0.2268, "num_tokens": 8490700.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2696646451950073, "sampling/importance_sampling_ratio/mean": 1.0000004768371582, "sampling/importance_sampling_ratio/min": 0.8414121866226196, "sampling/sampling_logp_difference/max": 0.2387528419494629, "sampling/sampling_logp_difference/mean": 0.01419394463300705, "step": 350 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 711.0, "completions/max_terminated_length": 711.0, "completions/mean_length": 202.3125, "completions/mean_terminated_length": 202.3125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.8651395379565656, "epoch": 0.34718100890207715, "grad_norm": 2.050278663635254, "kl_approx": 0.28633880615234375, "learning_rate": 1.654623252150624e-05, "loss": 0.1871, "num_tokens": 8514446.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2784003019332886, "sampling/importance_sampling_ratio/mean": 1.0002435445785522, "sampling/importance_sampling_ratio/min": 0.8417696952819824, "sampling/sampling_logp_difference/max": 0.24560952186584473, "sampling/sampling_logp_difference/mean": 0.013517262414097786, "step": 351 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 515.0, "completions/max_terminated_length": 515.0, "completions/mean_length": 121.625, "completions/mean_terminated_length": 121.625, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.6628641174174845, "epoch": 0.34817012858555885, "grad_norm": 2.132230758666992, "kl_approx": 0.2456207275390625, "learning_rate": 1.6520066925426146e-05, "loss": 0.1358, "num_tokens": 8539658.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1653947830200195, "sampling/importance_sampling_ratio/mean": 0.9997344613075256, "sampling/importance_sampling_ratio/min": 0.8472093343734741, "sampling/sampling_logp_difference/max": 0.16580748558044434, "sampling/sampling_logp_difference/mean": 0.012784886173903942, "step": 352 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 729.0, "completions/max_terminated_length": 729.0, "completions/mean_length": 203.75, "completions/mean_terminated_length": 203.75, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.8103084731847048, "epoch": 0.34915924826904055, "grad_norm": 1.8776968717575073, "kl_approx": 0.2314300537109375, "learning_rate": 1.6493823449766137e-05, "loss": 0.1697, "num_tokens": 8564722.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2023262977600098, "sampling/importance_sampling_ratio/mean": 1.0000507831573486, "sampling/importance_sampling_ratio/min": 0.8180822134017944, "sampling/sampling_logp_difference/max": 0.20079243183135986, "sampling/sampling_logp_difference/mean": 0.014451484195888042, "step": 353 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 420.0, "completions/max_terminated_length": 420.0, "completions/mean_length": 160.84375, "completions/mean_terminated_length": 160.84375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.9071384118869901, "epoch": 0.35014836795252224, "grad_norm": 2.7739357948303223, "kl_approx": 0.319610595703125, "learning_rate": 1.6467502407993995e-05, "loss": 0.2192, "num_tokens": 8587109.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.18180251121521, "sampling/importance_sampling_ratio/mean": 1.0002802610397339, "sampling/importance_sampling_ratio/min": 0.8440707325935364, "sampling/sampling_logp_difference/max": 0.16951894760131836, "sampling/sampling_logp_difference/mean": 0.01523625198751688, "step": 354 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 591.0, "completions/max_terminated_length": 591.0, "completions/mean_length": 158.65625, "completions/mean_terminated_length": 158.65625, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.683738776948303, "epoch": 0.35113748763600394, "grad_norm": 1.9370007514953613, "kl_approx": 0.2371063232421875, "learning_rate": 1.644110411450398e-05, "loss": 0.1695, "num_tokens": 8608258.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.201197624206543, "sampling/importance_sampling_ratio/mean": 1.0001832246780396, "sampling/importance_sampling_ratio/min": 0.8108100295066833, "sampling/sampling_logp_difference/max": 0.20972156524658203, "sampling/sampling_logp_difference/mean": 0.012913151644170284, "step": 355 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 293.0, "completions/max_terminated_length": 293.0, "completions/mean_length": 115.9375, "completions/mean_terminated_length": 115.9375, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.5942155963275582, "epoch": 0.35212660731948564, "grad_norm": 5.682674884796143, "kl_approx": 0.261138916015625, "learning_rate": 1.6414628884613106e-05, "loss": 0.1502, "num_tokens": 8631088.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1730141639709473, "sampling/importance_sampling_ratio/mean": 1.0002061128616333, "sampling/importance_sampling_ratio/min": 0.694856584072113, "sampling/sampling_logp_difference/max": 0.3640497922897339, "sampling/sampling_logp_difference/mean": 0.012141243554651737, "step": 356 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 753.0, "completions/max_terminated_length": 753.0, "completions/mean_length": 151.03125, "completions/mean_terminated_length": 151.03125, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.620893164537847, "epoch": 0.35311572700296734, "grad_norm": 2.415186882019043, "kl_approx": 0.22493362426757812, "learning_rate": 1.6388077034557355e-05, "loss": 0.1905, "num_tokens": 8662361.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2184079885482788, "sampling/importance_sampling_ratio/mean": 0.9998778104782104, "sampling/importance_sampling_ratio/min": 0.8003460764884949, "sampling/sampling_logp_difference/max": 0.22271108627319336, "sampling/sampling_logp_difference/mean": 0.011820074170827866, "step": 357 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 223.0, "completions/max_terminated_length": 223.0, "completions/mean_length": 74.78125, "completions/mean_terminated_length": 74.78125, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.3338526857551187, "epoch": 0.35410484668644904, "grad_norm": 2.7763822078704834, "kl_approx": 0.16136932373046875, "learning_rate": 1.6361448881487913e-05, "loss": 0.0984, "num_tokens": 8684290.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1372718811035156, "sampling/importance_sampling_ratio/mean": 0.9997091889381409, "sampling/importance_sampling_ratio/min": 0.8464376926422119, "sampling/sampling_logp_difference/max": 0.1667187213897705, "sampling/sampling_logp_difference/mean": 0.007359681185334921, "step": 358 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 193.0, "completions/max_terminated_length": 193.0, "completions/mean_length": 91.34375, "completions/mean_terminated_length": 91.34375, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.3891828968189657, "epoch": 0.35509396636993074, "grad_norm": 1.951055884361267, "kl_approx": 0.20671463012695312, "learning_rate": 1.6334744743467366e-05, "loss": 0.1032, "num_tokens": 8706949.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1983528137207031, "sampling/importance_sampling_ratio/mean": 0.9994255304336548, "sampling/importance_sampling_ratio/min": 0.8256502151489258, "sampling/sampling_logp_difference/max": 0.19158411026000977, "sampling/sampling_logp_difference/mean": 0.008102335967123508, "step": 359 }, { "completions/clipped_ratio": 0.0625, "completions/max_length": 1024.0, "completions/max_terminated_length": 869.0, "completions/mean_length": 280.21875, "completions/mean_terminated_length": 230.6333465576172, "completions/min_length": 84.0, "completions/min_terminated_length": 84.0, "entropy": 0.6012633121572435, "epoch": 0.3560830860534125, "grad_norm": 1.8356751203536987, "kl_approx": 0.24257278442382812, "learning_rate": 1.6307964939465914e-05, "loss": 0.1798, "num_tokens": 8737716.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1807500123977661, "sampling/importance_sampling_ratio/mean": 0.9999646544456482, "sampling/importance_sampling_ratio/min": 0.7804945707321167, "sampling/sampling_logp_difference/max": 0.24782752990722656, "sampling/sampling_logp_difference/mean": 0.010727438144385815, "step": 360 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 536.0, "completions/max_terminated_length": 536.0, "completions/mean_length": 188.6875, "completions/mean_terminated_length": 188.6875, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.8121414370834827, "epoch": 0.3570722057368942, "grad_norm": 6.7955827713012695, "kl_approx": 0.338165283203125, "learning_rate": 1.628110978935756e-05, "loss": 0.2335, "num_tokens": 8764346.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3206875324249268, "sampling/importance_sampling_ratio/mean": 1.0007163286209106, "sampling/importance_sampling_ratio/min": 0.8089335560798645, "sampling/sampling_logp_difference/max": 0.2781524658203125, "sampling/sampling_logp_difference/mean": 0.012952751480042934, "step": 361 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 506.0, "completions/max_terminated_length": 506.0, "completions/mean_length": 190.6875, "completions/mean_terminated_length": 190.6875, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.781624068506062, "epoch": 0.3580613254203759, "grad_norm": 2.255150318145752, "kl_approx": 0.277740478515625, "learning_rate": 1.625417961391628e-05, "loss": 0.2026, "num_tokens": 8791160.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2455625534057617, "sampling/importance_sampling_ratio/mean": 1.0005948543548584, "sampling/importance_sampling_ratio/min": 0.792005717754364, "sampling/sampling_logp_difference/max": 0.2331867218017578, "sampling/sampling_logp_difference/mean": 0.01357511430978775, "step": 362 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 714.0, "completions/max_terminated_length": 714.0, "completions/mean_length": 161.375, "completions/mean_terminated_length": 161.375, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.7261916175484657, "epoch": 0.3590504451038576, "grad_norm": 2.2667558193206787, "kl_approx": 0.300811767578125, "learning_rate": 1.62271747348122e-05, "loss": 0.2104, "num_tokens": 8809700.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3577779531478882, "sampling/importance_sampling_ratio/mean": 1.000759243965149, "sampling/importance_sampling_ratio/min": 0.8300924301147461, "sampling/sampling_logp_difference/max": 0.305849552154541, "sampling/sampling_logp_difference/mean": 0.011888876557350159, "step": 363 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 718.0, "completions/max_terminated_length": 718.0, "completions/mean_length": 173.15625, "completions/mean_terminated_length": 173.15625, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.4828813658095896, "epoch": 0.3600395647873393, "grad_norm": 1.7517290115356445, "kl_approx": 0.14997100830078125, "learning_rate": 1.6200095474607753e-05, "loss": 0.1149, "num_tokens": 8835841.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.229462742805481, "sampling/importance_sampling_ratio/mean": 0.9999154210090637, "sampling/importance_sampling_ratio/min": 0.837244987487793, "sampling/sampling_logp_difference/max": 0.20657730102539062, "sampling/sampling_logp_difference/mean": 0.008864673785865307, "step": 364 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 685.0, "completions/mean_length": 236.78125, "completions/mean_terminated_length": 211.3870849609375, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.8053218652494252, "epoch": 0.361028684470821, "grad_norm": 2.0709829330444336, "kl_approx": 0.23779964447021484, "learning_rate": 1.6172942156753822e-05, "loss": 0.1859, "num_tokens": 8861034.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.187152624130249, "sampling/importance_sampling_ratio/mean": 1.0002837181091309, "sampling/importance_sampling_ratio/min": 0.831664502620697, "sampling/sampling_logp_difference/max": 0.184326171875, "sampling/sampling_logp_difference/mean": 0.014402704313397408, "step": 365 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 530.0, "completions/max_terminated_length": 530.0, "completions/mean_length": 129.40625, "completions/mean_terminated_length": 129.40625, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.5976112964563072, "epoch": 0.3620178041543027, "grad_norm": 2.368210792541504, "kl_approx": 0.240325927734375, "learning_rate": 1.614571510558588e-05, "loss": 0.1495, "num_tokens": 8882807.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2851083278656006, "sampling/importance_sampling_ratio/mean": 0.9999275803565979, "sampling/importance_sampling_ratio/min": 0.8389502763748169, "sampling/sampling_logp_difference/max": 0.2508430480957031, "sampling/sampling_logp_difference/mean": 0.011203138157725334, "step": 366 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 877.0, "completions/max_terminated_length": 877.0, "completions/mean_length": 132.875, "completions/mean_terminated_length": 132.875, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.6403806004673243, "epoch": 0.3630069238377844, "grad_norm": 2.9379289150238037, "kl_approx": 0.25250244140625, "learning_rate": 1.6118414646320115e-05, "loss": 0.1924, "num_tokens": 8904643.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.199820876121521, "sampling/importance_sampling_ratio/mean": 0.999147891998291, "sampling/importance_sampling_ratio/min": 0.7935819029808044, "sampling/sampling_logp_difference/max": 0.23119854927062988, "sampling/sampling_logp_difference/mean": 0.013297569938004017, "step": 367 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 365.0, "completions/max_terminated_length": 365.0, "completions/mean_length": 119.28125, "completions/mean_terminated_length": 119.28125, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.7997883390635252, "epoch": 0.3639960435212661, "grad_norm": 2.318758249282837, "kl_approx": 0.2836151123046875, "learning_rate": 1.6091041105049542e-05, "loss": 0.166, "num_tokens": 8924444.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1700506210327148, "sampling/importance_sampling_ratio/mean": 0.9996182322502136, "sampling/importance_sampling_ratio/min": 0.8777026534080505, "sampling/sampling_logp_difference/max": 0.15704703330993652, "sampling/sampling_logp_difference/mean": 0.01342426985502243, "step": 368 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 332.0, "completions/max_terminated_length": 332.0, "completions/mean_length": 102.9375, "completions/mean_terminated_length": 102.9375, "completions/min_length": 31.0, "completions/min_terminated_length": 31.0, "entropy": 0.5861324635334313, "epoch": 0.3649851632047478, "grad_norm": 2.1033666133880615, "kl_approx": 0.24227523803710938, "learning_rate": 1.6063594808740112e-05, "loss": 0.1381, "num_tokens": 8950930.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.144827961921692, "sampling/importance_sampling_ratio/mean": 0.9999030232429504, "sampling/importance_sampling_ratio/min": 0.839012861251831, "sampling/sampling_logp_difference/max": 0.17552924156188965, "sampling/sampling_logp_difference/mean": 0.011686254292726517, "step": 369 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 645.0, "completions/max_terminated_length": 645.0, "completions/mean_length": 188.84375, "completions/mean_terminated_length": 188.84375, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.581179931294173, "epoch": 0.3659742828882295, "grad_norm": 2.0337040424346924, "kl_approx": 0.24546051025390625, "learning_rate": 1.6036076085226813e-05, "loss": 0.1844, "num_tokens": 8975365.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2810795307159424, "sampling/importance_sampling_ratio/mean": 1.0002517700195312, "sampling/importance_sampling_ratio/min": 0.814808189868927, "sampling/sampling_logp_difference/max": 0.24770307540893555, "sampling/sampling_logp_difference/mean": 0.008068220689892769, "step": 370 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 631.0, "completions/max_terminated_length": 631.0, "completions/mean_length": 184.53125, "completions/mean_terminated_length": 184.53125, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.9399522272869945, "epoch": 0.3669634025717112, "grad_norm": 3.404837131500244, "kl_approx": 0.3153228759765625, "learning_rate": 1.6008485263209742e-05, "loss": 0.2106, "num_tokens": 8999518.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2140047550201416, "sampling/importance_sampling_ratio/mean": 0.999363899230957, "sampling/importance_sampling_ratio/min": 0.7802701592445374, "sampling/sampling_logp_difference/max": 0.24811506271362305, "sampling/sampling_logp_difference/mean": 0.014915591105818748, "step": 371 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 664.0, "completions/max_terminated_length": 664.0, "completions/mean_length": 160.34375, "completions/mean_terminated_length": 160.34375, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.6273523410782218, "epoch": 0.36795252225519287, "grad_norm": 1.9187628030776978, "kl_approx": 0.21495819091796875, "learning_rate": 1.598082267225018e-05, "loss": 0.1576, "num_tokens": 9019545.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2169606685638428, "sampling/importance_sampling_ratio/mean": 1.0002495050430298, "sampling/importance_sampling_ratio/min": 0.8490124344825745, "sampling/sampling_logp_difference/max": 0.19635653495788574, "sampling/sampling_logp_difference/mean": 0.012951545417308807, "step": 372 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 745.0, "completions/max_terminated_length": 745.0, "completions/mean_length": 129.0625, "completions/mean_terminated_length": 129.0625, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.5108460397459567, "epoch": 0.36894164193867457, "grad_norm": 1.8111895322799683, "kl_approx": 0.16696548461914062, "learning_rate": 1.595308864276666e-05, "loss": 0.1019, "num_tokens": 9042443.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2525469064712524, "sampling/importance_sampling_ratio/mean": 1.0001943111419678, "sampling/importance_sampling_ratio/min": 0.8316817283630371, "sampling/sampling_logp_difference/max": 0.22517895698547363, "sampling/sampling_logp_difference/mean": 0.01172676682472229, "step": 373 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 635.0, "completions/max_terminated_length": 635.0, "completions/mean_length": 128.3125, "completions/mean_terminated_length": 128.3125, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.8318022666499019, "epoch": 0.36993076162215627, "grad_norm": 2.2463698387145996, "kl_approx": 0.22014617919921875, "learning_rate": 1.592528350603103e-05, "loss": 0.174, "num_tokens": 9062837.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1957305669784546, "sampling/importance_sampling_ratio/mean": 0.99953693151474, "sampling/importance_sampling_ratio/min": 0.8314329385757446, "sampling/sampling_logp_difference/max": 0.18460464477539062, "sampling/sampling_logp_difference/mean": 0.01514038722962141, "step": 374 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 861.0, "completions/max_terminated_length": 861.0, "completions/mean_length": 285.09375, "completions/mean_terminated_length": 285.09375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 1.0577433137223125, "epoch": 0.37091988130563797, "grad_norm": 2.101933479309082, "kl_approx": 0.275665283203125, "learning_rate": 1.5897407594164468e-05, "loss": 0.2014, "num_tokens": 9088552.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.208816647529602, "sampling/importance_sampling_ratio/mean": 1.0002485513687134, "sampling/importance_sampling_ratio/min": 0.8247970938682556, "sampling/sampling_logp_difference/max": 0.19261789321899414, "sampling/sampling_logp_difference/mean": 0.0155795868486166, "step": 375 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 538.0, "completions/max_terminated_length": 538.0, "completions/mean_length": 129.84375, "completions/mean_terminated_length": 129.84375, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.6944182328879833, "epoch": 0.37190900098911966, "grad_norm": 2.2824857234954834, "kl_approx": 0.25750732421875, "learning_rate": 1.586946124013354e-05, "loss": 0.1888, "num_tokens": 9110787.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.295641303062439, "sampling/importance_sampling_ratio/mean": 1.0001964569091797, "sampling/importance_sampling_ratio/min": 0.8404685854911804, "sampling/sampling_logp_difference/max": 0.2590057849884033, "sampling/sampling_logp_difference/mean": 0.013446149416267872, "step": 376 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 398.0, "completions/max_terminated_length": 398.0, "completions/mean_length": 138.0625, "completions/mean_terminated_length": 138.0625, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.7542224321514368, "epoch": 0.37289812067260136, "grad_norm": 2.739356756210327, "kl_approx": 0.3043975830078125, "learning_rate": 1.5841444777746232e-05, "loss": 0.2464, "num_tokens": 9134509.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1727577447891235, "sampling/importance_sampling_ratio/mean": 0.9995575547218323, "sampling/importance_sampling_ratio/min": 0.8480107188224792, "sampling/sampling_logp_difference/max": 0.1648620367050171, "sampling/sampling_logp_difference/mean": 0.012854214757680893, "step": 377 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 551.0, "completions/max_terminated_length": 551.0, "completions/mean_length": 164.4375, "completions/mean_terminated_length": 164.4375, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.8976317401975393, "epoch": 0.37388724035608306, "grad_norm": 2.6244962215423584, "kl_approx": 0.2871246337890625, "learning_rate": 1.5813358541647915e-05, "loss": 0.2266, "num_tokens": 9156251.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2180379629135132, "sampling/importance_sampling_ratio/mean": 1.0011508464813232, "sampling/importance_sampling_ratio/min": 0.8355380296707153, "sampling/sampling_logp_difference/max": 0.19724130630493164, "sampling/sampling_logp_difference/mean": 0.014126446098089218, "step": 378 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 815.0, "completions/max_terminated_length": 815.0, "completions/mean_length": 135.875, "completions/mean_terminated_length": 135.875, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.7467193491756916, "epoch": 0.37487636003956476, "grad_norm": 3.120851516723633, "kl_approx": 0.3340606689453125, "learning_rate": 1.578520286731741e-05, "loss": 0.239, "num_tokens": 9179791.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.189101219177246, "sampling/importance_sampling_ratio/mean": 0.9994665384292603, "sampling/importance_sampling_ratio/min": 0.8026962280273438, "sampling/sampling_logp_difference/max": 0.21977901458740234, "sampling/sampling_logp_difference/mean": 0.01388273574411869, "step": 379 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 852.0, "completions/mean_length": 298.09375, "completions/mean_terminated_length": 274.6773986816406, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.8252547108568251, "epoch": 0.3758654797230465, "grad_norm": 2.0605688095092773, "kl_approx": 0.2386627197265625, "learning_rate": 1.575697809106292e-05, "loss": 0.2061, "num_tokens": 9209314.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1771339178085327, "sampling/importance_sampling_ratio/mean": 0.9999204277992249, "sampling/importance_sampling_ratio/min": 0.7959311008453369, "sampling/sampling_logp_difference/max": 0.2282426357269287, "sampling/sampling_logp_difference/mean": 0.013232769444584846, "step": 380 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 473.0, "completions/max_terminated_length": 473.0, "completions/mean_length": 181.6875, "completions/mean_terminated_length": 181.6875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.8465917864814401, "epoch": 0.3768545994065282, "grad_norm": 2.4323086738586426, "kl_approx": 0.27507781982421875, "learning_rate": 1.5728684550018066e-05, "loss": 0.1975, "num_tokens": 9234760.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2688701152801514, "sampling/importance_sampling_ratio/mean": 0.9999415874481201, "sampling/importance_sampling_ratio/min": 0.8298973441123962, "sampling/sampling_logp_difference/max": 0.2381267547607422, "sampling/sampling_logp_difference/mean": 0.014800166711211205, "step": 381 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 421.0, "completions/max_terminated_length": 421.0, "completions/mean_length": 133.5, "completions/mean_terminated_length": 133.5, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.7986752595752478, "epoch": 0.3778437190900099, "grad_norm": 3.27736496925354, "kl_approx": 0.384521484375, "learning_rate": 1.570032258213783e-05, "loss": 0.2563, "num_tokens": 9258696.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1461498737335205, "sampling/importance_sampling_ratio/mean": 0.9991601705551147, "sampling/importance_sampling_ratio/min": 0.8503790497779846, "sampling/sampling_logp_difference/max": 0.16207313537597656, "sampling/sampling_logp_difference/mean": 0.013560895808041096, "step": 382 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 163.0, "completions/max_terminated_length": 163.0, "completions/mean_length": 82.96875, "completions/mean_terminated_length": 82.96875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.6561488835141063, "epoch": 0.3788328387734916, "grad_norm": 5.923593521118164, "kl_approx": 0.296844482421875, "learning_rate": 1.5671892526194515e-05, "loss": 0.202, "num_tokens": 9280183.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1768373250961304, "sampling/importance_sampling_ratio/mean": 1.0004161596298218, "sampling/importance_sampling_ratio/min": 0.8592154383659363, "sampling/sampling_logp_difference/max": 0.16283059120178223, "sampling/sampling_logp_difference/mean": 0.012121755629777908, "step": 383 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 762.0, "completions/max_terminated_length": 762.0, "completions/mean_length": 120.125, "completions/mean_terminated_length": 120.125, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.5308083277195692, "epoch": 0.3798219584569733, "grad_norm": 3.1105942726135254, "kl_approx": 0.2258453369140625, "learning_rate": 1.564339472177373e-05, "loss": 0.1476, "num_tokens": 9300907.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1908764839172363, "sampling/importance_sampling_ratio/mean": 0.9999884963035583, "sampling/importance_sampling_ratio/min": 0.8166634440422058, "sampling/sampling_logp_difference/max": 0.2025282382965088, "sampling/sampling_logp_difference/mean": 0.010241501033306122, "step": 384 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 528.0, "completions/max_terminated_length": 528.0, "completions/mean_length": 136.15625, "completions/mean_terminated_length": 136.15625, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.6417626738548279, "epoch": 0.380811078140455, "grad_norm": 2.15088152885437, "kl_approx": 0.19831085205078125, "learning_rate": 1.561482950927029e-05, "loss": 0.1404, "num_tokens": 9326216.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1713711023330688, "sampling/importance_sampling_ratio/mean": 1.0000646114349365, "sampling/importance_sampling_ratio/min": 0.8562986254692078, "sampling/sampling_logp_difference/max": 0.15817499160766602, "sampling/sampling_logp_difference/mean": 0.011397141963243484, "step": 385 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 362.0, "completions/max_terminated_length": 362.0, "completions/mean_length": 115.0, "completions/mean_terminated_length": 115.0, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.80773267429322, "epoch": 0.3818001978239367, "grad_norm": 2.1561625003814697, "kl_approx": 0.268707275390625, "learning_rate": 1.5586197229884185e-05, "loss": 0.1743, "num_tokens": 9347240.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1532036066055298, "sampling/importance_sampling_ratio/mean": 1.000807523727417, "sampling/importance_sampling_ratio/min": 0.8788111805915833, "sampling/sampling_logp_difference/max": 0.14254379272460938, "sampling/sampling_logp_difference/mean": 0.01283793430775404, "step": 386 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 537.0, "completions/max_terminated_length": 537.0, "completions/mean_length": 156.625, "completions/mean_terminated_length": 156.625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.7017519646324217, "epoch": 0.3827893175074184, "grad_norm": 2.0136001110076904, "kl_approx": 0.23560333251953125, "learning_rate": 1.5557498225616488e-05, "loss": 0.1532, "num_tokens": 9374556.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1784998178482056, "sampling/importance_sampling_ratio/mean": 0.999943196773529, "sampling/importance_sampling_ratio/min": 0.8654402494430542, "sampling/sampling_logp_difference/max": 0.16424226760864258, "sampling/sampling_logp_difference/mean": 0.01358980406075716, "step": 387 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 345.0, "completions/max_terminated_length": 345.0, "completions/mean_length": 140.6875, "completions/mean_terminated_length": 140.6875, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.7591469082981348, "epoch": 0.3837784371909001, "grad_norm": 2.4345834255218506, "kl_approx": 0.3016510009765625, "learning_rate": 1.5528732839265272e-05, "loss": 0.2035, "num_tokens": 9397754.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1635252237319946, "sampling/importance_sampling_ratio/mean": 0.9998807311058044, "sampling/importance_sampling_ratio/min": 0.8415124416351318, "sampling/sampling_logp_difference/max": 0.17255449295043945, "sampling/sampling_logp_difference/mean": 0.013161800801753998, "step": 388 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 863.0, "completions/max_terminated_length": 863.0, "completions/mean_length": 219.5625, "completions/mean_terminated_length": 219.5625, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.6951826056465507, "epoch": 0.3847675568743818, "grad_norm": 1.8261902332305908, "kl_approx": 0.21053504943847656, "learning_rate": 1.549990141442153e-05, "loss": 0.1308, "num_tokens": 9423876.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1618504524230957, "sampling/importance_sampling_ratio/mean": 0.9996642470359802, "sampling/importance_sampling_ratio/min": 0.739203691482544, "sampling/sampling_logp_difference/max": 0.3021817207336426, "sampling/sampling_logp_difference/mean": 0.011931492015719414, "step": 389 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 571.0, "completions/max_terminated_length": 571.0, "completions/mean_length": 204.1875, "completions/mean_terminated_length": 204.1875, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.7856100546196103, "epoch": 0.3857566765578635, "grad_norm": 2.470937728881836, "kl_approx": 0.25396728515625, "learning_rate": 1.5471004295465034e-05, "loss": 0.1992, "num_tokens": 9447730.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1737536191940308, "sampling/importance_sampling_ratio/mean": 0.9996646046638489, "sampling/importance_sampling_ratio/min": 0.8353384733200073, "sampling/sampling_logp_difference/max": 0.1799182891845703, "sampling/sampling_logp_difference/mean": 0.013104341924190521, "step": 390 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 598.0, "completions/max_terminated_length": 598.0, "completions/mean_length": 162.59375, "completions/mean_terminated_length": 162.59375, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.7058191308751702, "epoch": 0.3867457962413452, "grad_norm": 2.589174747467041, "kl_approx": 0.25220489501953125, "learning_rate": 1.5442041827560274e-05, "loss": 0.1762, "num_tokens": 9471261.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2235606908798218, "sampling/importance_sampling_ratio/mean": 0.9999344944953918, "sampling/importance_sampling_ratio/min": 0.8511485457420349, "sampling/sampling_logp_difference/max": 0.20176517963409424, "sampling/sampling_logp_difference/mean": 0.01232069730758667, "step": 391 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 749.0, "completions/max_terminated_length": 749.0, "completions/mean_length": 163.09375, "completions/mean_terminated_length": 163.09375, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.7082721563056111, "epoch": 0.3877349159248269, "grad_norm": 3.146322250366211, "kl_approx": 0.4079132080078125, "learning_rate": 1.5413014356652287e-05, "loss": 0.2618, "num_tokens": 9500744.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2651423215866089, "sampling/importance_sampling_ratio/mean": 0.9999623894691467, "sampling/importance_sampling_ratio/min": 0.7710256576538086, "sampling/sampling_logp_difference/max": 0.26003360748291016, "sampling/sampling_logp_difference/mean": 0.012805013917386532, "step": 392 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 714.0, "completions/max_terminated_length": 714.0, "completions/mean_length": 213.46875, "completions/mean_terminated_length": 213.46875, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.6826157849282026, "epoch": 0.3887240356083086, "grad_norm": 1.7774665355682373, "kl_approx": 0.20732879638671875, "learning_rate": 1.538392222946255e-05, "loss": 0.1532, "num_tokens": 9525527.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1476131677627563, "sampling/importance_sampling_ratio/mean": 0.9997501373291016, "sampling/importance_sampling_ratio/min": 0.833834171295166, "sampling/sampling_logp_difference/max": 0.18172073364257812, "sampling/sampling_logp_difference/mean": 0.010913715697824955, "step": 393 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 641.0, "completions/mean_length": 209.9375, "completions/mean_terminated_length": 183.6774139404297, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.7142486907541752, "epoch": 0.3897131552917903, "grad_norm": 3.1309561729431152, "kl_approx": 0.3763885498046875, "learning_rate": 1.5354765793484834e-05, "loss": 0.2582, "num_tokens": 9551133.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2187414169311523, "sampling/importance_sampling_ratio/mean": 0.9996961951255798, "sampling/importance_sampling_ratio/min": 0.7896600961685181, "sampling/sampling_logp_difference/max": 0.23615264892578125, "sampling/sampling_logp_difference/mean": 0.011643128469586372, "step": 394 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 862.0, "completions/max_terminated_length": 862.0, "completions/mean_length": 123.4375, "completions/mean_terminated_length": 123.4375, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6525642424821854, "epoch": 0.390702274975272, "grad_norm": 2.606126308441162, "kl_approx": 0.25640869140625, "learning_rate": 1.5325545396981053e-05, "loss": 0.1638, "num_tokens": 9571747.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2033898830413818, "sampling/importance_sampling_ratio/mean": 0.9994295239448547, "sampling/importance_sampling_ratio/min": 0.7732419371604919, "sampling/sampling_logp_difference/max": 0.25716328620910645, "sampling/sampling_logp_difference/mean": 0.011888217180967331, "step": 395 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 559.0, "completions/max_terminated_length": 559.0, "completions/mean_length": 170.0625, "completions/mean_terminated_length": 170.0625, "completions/min_length": 16.0, "completions/min_terminated_length": 16.0, "entropy": 0.6335577010177076, "epoch": 0.3916913946587537, "grad_norm": 1.9306553602218628, "kl_approx": 0.189788818359375, "learning_rate": 1.5296261388977107e-05, "loss": 0.1605, "num_tokens": 9591941.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.192777395248413, "sampling/importance_sampling_ratio/mean": 1.0005309581756592, "sampling/importance_sampling_ratio/min": 0.8286999464035034, "sampling/sampling_logp_difference/max": 0.1878972053527832, "sampling/sampling_logp_difference/mean": 0.01298566348850727, "step": 396 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 1008.0, "completions/mean_length": 253.90625, "completions/mean_terminated_length": 229.06451416015625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7864647079259157, "epoch": 0.3926805143422354, "grad_norm": 2.409792423248291, "kl_approx": 0.23056793212890625, "learning_rate": 1.52669141192587e-05, "loss": 0.1709, "num_tokens": 9623842.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.174325704574585, "sampling/importance_sampling_ratio/mean": 0.9997132420539856, "sampling/importance_sampling_ratio/min": 0.8205747008323669, "sampling/sampling_logp_difference/max": 0.19775032997131348, "sampling/sampling_logp_difference/mean": 0.01377257239073515, "step": 397 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 781.0, "completions/max_terminated_length": 781.0, "completions/mean_length": 156.0, "completions/mean_terminated_length": 156.0, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.5018252991139889, "epoch": 0.3936696340257171, "grad_norm": 1.9581407308578491, "kl_approx": 0.15090179443359375, "learning_rate": 1.5237503938367186e-05, "loss": 0.1215, "num_tokens": 9647722.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1466683149337769, "sampling/importance_sampling_ratio/mean": 1.0001895427703857, "sampling/importance_sampling_ratio/min": 0.8531631827354431, "sampling/sampling_logp_difference/max": 0.15880447626113892, "sampling/sampling_logp_difference/mean": 0.009894904680550098, "step": 398 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 310.0, "completions/max_terminated_length": 310.0, "completions/mean_length": 133.375, "completions/mean_terminated_length": 133.375, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.6371352691203356, "epoch": 0.39465875370919884, "grad_norm": 1.943426489830017, "kl_approx": 0.19311904907226562, "learning_rate": 1.5208031197595357e-05, "loss": 0.1583, "num_tokens": 9672902.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1892338991165161, "sampling/importance_sampling_ratio/mean": 0.9997968077659607, "sampling/importance_sampling_ratio/min": 0.823902428150177, "sampling/sampling_logp_difference/max": 0.19370317459106445, "sampling/sampling_logp_difference/mean": 0.010704712010920048, "step": 399 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 882.0, "completions/max_terminated_length": 882.0, "completions/mean_length": 232.1875, "completions/mean_terminated_length": 232.1875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.8602967103943229, "epoch": 0.39564787339268054, "grad_norm": 2.228437662124634, "kl_approx": 0.2644805908203125, "learning_rate": 1.5178496248983254e-05, "loss": 0.2105, "num_tokens": 9701420.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2045495510101318, "sampling/importance_sampling_ratio/mean": 1.000301718711853, "sampling/importance_sampling_ratio/min": 0.7740485072135925, "sampling/sampling_logp_difference/max": 0.2561206817626953, "sampling/sampling_logp_difference/mean": 0.01424815971404314, "step": 400 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 560.0, "completions/max_terminated_length": 560.0, "completions/mean_length": 259.375, "completions/mean_terminated_length": 259.375, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.8958146786317229, "epoch": 0.39663699307616224, "grad_norm": 2.850405216217041, "kl_approx": 0.316009521484375, "learning_rate": 1.5148899445313983e-05, "loss": 0.2606, "num_tokens": 9731272.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1960750818252563, "sampling/importance_sampling_ratio/mean": 1.0001049041748047, "sampling/importance_sampling_ratio/min": 0.8320932984352112, "sampling/sampling_logp_difference/max": 0.18381071090698242, "sampling/sampling_logp_difference/mean": 0.013530397787690163, "step": 401 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 547.0, "completions/max_terminated_length": 547.0, "completions/mean_length": 126.9375, "completions/mean_terminated_length": 126.9375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.4661471312865615, "epoch": 0.39762611275964393, "grad_norm": 1.797017216682434, "kl_approx": 0.18061065673828125, "learning_rate": 1.5119241140109466e-05, "loss": 0.1241, "num_tokens": 9753550.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2871315479278564, "sampling/importance_sampling_ratio/mean": 1.0001171827316284, "sampling/importance_sampling_ratio/min": 0.8492063283920288, "sampling/sampling_logp_difference/max": 0.25241613388061523, "sampling/sampling_logp_difference/mean": 0.00857393629848957, "step": 402 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 931.0, "completions/max_terminated_length": 931.0, "completions/mean_length": 186.59375, "completions/mean_terminated_length": 186.59375, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.5799659886397421, "epoch": 0.39861523244312563, "grad_norm": 2.1738173961639404, "kl_approx": 0.178863525390625, "learning_rate": 1.5089521687626243e-05, "loss": 0.1369, "num_tokens": 9783505.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1538058519363403, "sampling/importance_sampling_ratio/mean": 1.0003151893615723, "sampling/importance_sampling_ratio/min": 0.8509653210639954, "sampling/sampling_logp_difference/max": 0.16138386726379395, "sampling/sampling_logp_difference/mean": 0.010703648440539837, "step": 403 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 702.0, "completions/max_terminated_length": 702.0, "completions/mean_length": 190.1875, "completions/mean_terminated_length": 190.1875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.6970642493106425, "epoch": 0.39960435212660733, "grad_norm": 1.986329197883606, "kl_approx": 0.24048423767089844, "learning_rate": 1.505974144285124e-05, "loss": 0.1709, "num_tokens": 9810919.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.178593635559082, "sampling/importance_sampling_ratio/mean": 0.9998169541358948, "sampling/importance_sampling_ratio/min": 0.7872682213783264, "sampling/sampling_logp_difference/max": 0.23918628692626953, "sampling/sampling_logp_difference/mean": 0.01232286635786295, "step": 404 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 668.0, "completions/mean_length": 214.40625, "completions/mean_terminated_length": 188.29031372070312, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.7580571742728353, "epoch": 0.40059347181008903, "grad_norm": 1.838085651397705, "kl_approx": 0.2387847900390625, "learning_rate": 1.5029900761497507e-05, "loss": 0.1561, "num_tokens": 9834580.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1745810508728027, "sampling/importance_sampling_ratio/mean": 1.000613808631897, "sampling/importance_sampling_ratio/min": 0.8262981176376343, "sampling/sampling_logp_difference/max": 0.19079971313476562, "sampling/sampling_logp_difference/mean": 0.01240936666727066, "step": 405 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 393.0, "completions/max_terminated_length": 393.0, "completions/mean_length": 124.28125, "completions/mean_terminated_length": 124.28125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.7001026626676321, "epoch": 0.40158259149357073, "grad_norm": 3.696960687637329, "kl_approx": 0.3108673095703125, "learning_rate": 1.5000000000000002e-05, "loss": 0.2052, "num_tokens": 9854949.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.148455262184143, "sampling/importance_sampling_ratio/mean": 0.9999491572380066, "sampling/importance_sampling_ratio/min": 0.7777572870254517, "sampling/sampling_logp_difference/max": 0.2513408660888672, "sampling/sampling_logp_difference/mean": 0.012445068918168545, "step": 406 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 345.0, "completions/max_terminated_length": 345.0, "completions/mean_length": 115.15625, "completions/mean_terminated_length": 115.15625, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.5648595583625138, "epoch": 0.4025717111770524, "grad_norm": 2.515108346939087, "kl_approx": 0.21609115600585938, "learning_rate": 1.4970039515511303e-05, "loss": 0.1715, "num_tokens": 9876058.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1465418338775635, "sampling/importance_sampling_ratio/mean": 0.9998286962509155, "sampling/importance_sampling_ratio/min": 0.8125092387199402, "sampling/sampling_logp_difference/max": 0.2076280117034912, "sampling/sampling_logp_difference/mean": 0.01014826912432909, "step": 407 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 862.0, "completions/mean_length": 247.0, "completions/mean_terminated_length": 221.9354705810547, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.7472594594582915, "epoch": 0.4035608308605341, "grad_norm": 1.828620433807373, "kl_approx": 0.2005767822265625, "learning_rate": 1.4940019665897363e-05, "loss": 0.1467, "num_tokens": 9902402.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1846122741699219, "sampling/importance_sampling_ratio/mean": 1.0000313520431519, "sampling/importance_sampling_ratio/min": 0.838872492313385, "sampling/sampling_logp_difference/max": 0.17569661140441895, "sampling/sampling_logp_difference/mean": 0.013147593475878239, "step": 408 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 822.0, "completions/max_terminated_length": 822.0, "completions/mean_length": 175.84375, "completions/mean_terminated_length": 175.84375, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.7327764891088009, "epoch": 0.4045499505440158, "grad_norm": 2.0549323558807373, "kl_approx": 0.24148941040039062, "learning_rate": 1.4909940809733223e-05, "loss": 0.1724, "num_tokens": 9927693.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.201348900794983, "sampling/importance_sampling_ratio/mean": 0.9997072219848633, "sampling/importance_sampling_ratio/min": 0.819867730140686, "sampling/sampling_logp_difference/max": 0.19861221313476562, "sampling/sampling_logp_difference/mean": 0.01236987765878439, "step": 409 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 825.0, "completions/max_terminated_length": 825.0, "completions/mean_length": 218.75, "completions/mean_terminated_length": 218.75, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.7852396033704281, "epoch": 0.4055390702274975, "grad_norm": 2.282972574234009, "kl_approx": 0.2613677978515625, "learning_rate": 1.4879803306298736e-05, "loss": 0.1649, "num_tokens": 9952621.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.282002568244934, "sampling/importance_sampling_ratio/mean": 0.9999159574508667, "sampling/importance_sampling_ratio/min": 0.7992762923240662, "sampling/sampling_logp_difference/max": 0.24842333793640137, "sampling/sampling_logp_difference/mean": 0.01271405816078186, "step": 410 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 735.0, "completions/max_terminated_length": 735.0, "completions/mean_length": 206.28125, "completions/mean_terminated_length": 206.28125, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 1.0225384011864662, "epoch": 0.4065281899109792, "grad_norm": 3.413764715194702, "kl_approx": 0.406463623046875, "learning_rate": 1.4849607515574276e-05, "loss": 0.3085, "num_tokens": 9976654.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.247846245765686, "sampling/importance_sampling_ratio/mean": 1.000036597251892, "sampling/importance_sampling_ratio/min": 0.7738365530967712, "sampling/sampling_logp_difference/max": 0.256394624710083, "sampling/sampling_logp_difference/mean": 0.01549473311752081, "step": 411 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 511.0, "completions/max_terminated_length": 511.0, "completions/mean_length": 208.25, "completions/mean_terminated_length": 208.25, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.6727368105202913, "epoch": 0.4075173095944609, "grad_norm": 1.784251093864441, "kl_approx": 0.2214970588684082, "learning_rate": 1.4819353798236427e-05, "loss": 0.1471, "num_tokens": 10001878.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.207257866859436, "sampling/importance_sampling_ratio/mean": 1.0001230239868164, "sampling/importance_sampling_ratio/min": 0.791114330291748, "sampling/sampling_logp_difference/max": 0.2343127727508545, "sampling/sampling_logp_difference/mean": 0.012490909546613693, "step": 412 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 565.0, "completions/max_terminated_length": 565.0, "completions/mean_length": 292.53125, "completions/mean_terminated_length": 292.53125, "completions/min_length": 86.0, "completions/min_terminated_length": 86.0, "entropy": 0.9103491883724928, "epoch": 0.4085064292779426, "grad_norm": 1.797842025756836, "kl_approx": 0.2393951416015625, "learning_rate": 1.4789042515653687e-05, "loss": 0.1798, "num_tokens": 10030767.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2526308298110962, "sampling/importance_sampling_ratio/mean": 1.0000653266906738, "sampling/importance_sampling_ratio/min": 0.7809215188026428, "sampling/sampling_logp_difference/max": 0.24728059768676758, "sampling/sampling_logp_difference/mean": 0.013946976512670517, "step": 413 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 118.0, "completions/max_terminated_length": 118.0, "completions/mean_length": 77.71875, "completions/mean_terminated_length": 77.71875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.38683662097901106, "epoch": 0.4094955489614243, "grad_norm": 1.8569974899291992, "kl_approx": 0.15532493591308594, "learning_rate": 1.4758674029882152e-05, "loss": 0.0983, "num_tokens": 10051726.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1648186445236206, "sampling/importance_sampling_ratio/mean": 1.0007319450378418, "sampling/importance_sampling_ratio/min": 0.7047126889228821, "sampling/sampling_logp_difference/max": 0.34996509552001953, "sampling/sampling_logp_difference/mean": 0.008102844469249249, "step": 414 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 322.0, "completions/max_terminated_length": 322.0, "completions/mean_length": 135.1875, "completions/mean_terminated_length": 135.1875, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.9526198096573353, "epoch": 0.410484668644906, "grad_norm": 3.1279797554016113, "kl_approx": 0.3349456787109375, "learning_rate": 1.4728248703661183e-05, "loss": 0.2624, "num_tokens": 10070980.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2428596019744873, "sampling/importance_sampling_ratio/mean": 1.0003477334976196, "sampling/importance_sampling_ratio/min": 0.8098134994506836, "sampling/sampling_logp_difference/max": 0.21741485595703125, "sampling/sampling_logp_difference/mean": 0.015584887936711311, "step": 415 }, { "completions/clipped_ratio": 0.09375, "completions/max_length": 1024.0, "completions/max_terminated_length": 891.0, "completions/mean_length": 289.375, "completions/mean_terminated_length": 213.37930297851562, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.8081987481564283, "epoch": 0.4114737883283877, "grad_norm": 2.789330244064331, "kl_approx": 0.419952392578125, "learning_rate": 1.4697766900409076e-05, "loss": 0.2734, "num_tokens": 10097976.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2642933130264282, "sampling/importance_sampling_ratio/mean": 0.99960857629776, "sampling/importance_sampling_ratio/min": 0.8279955983161926, "sampling/sampling_logp_difference/max": 0.2345132827758789, "sampling/sampling_logp_difference/mean": 0.009159679524600506, "step": 416 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 297.0, "completions/max_terminated_length": 297.0, "completions/mean_length": 138.84375, "completions/mean_terminated_length": 138.84375, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.5861032605171204, "epoch": 0.4124629080118694, "grad_norm": 1.795448899269104, "kl_approx": 0.22263622283935547, "learning_rate": 1.466722898421873e-05, "loss": 0.1443, "num_tokens": 10122675.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2515933513641357, "sampling/importance_sampling_ratio/mean": 1.000282645225525, "sampling/importance_sampling_ratio/min": 0.7999763488769531, "sampling/sampling_logp_difference/max": 0.22441744804382324, "sampling/sampling_logp_difference/mean": 0.010261825285851955, "step": 417 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 294.0, "completions/max_terminated_length": 294.0, "completions/mean_length": 110.28125, "completions/mean_terminated_length": 110.28125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.5667687263339758, "epoch": 0.4134520276953511, "grad_norm": 2.427342414855957, "kl_approx": 0.1839141845703125, "learning_rate": 1.4636635319853274e-05, "loss": 0.1456, "num_tokens": 10148164.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.171076774597168, "sampling/importance_sampling_ratio/mean": 1.0003315210342407, "sampling/importance_sampling_ratio/min": 0.8402531743049622, "sampling/sampling_logp_difference/max": 0.17405200004577637, "sampling/sampling_logp_difference/mean": 0.011623511090874672, "step": 418 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 820.0, "completions/mean_length": 182.1875, "completions/mean_terminated_length": 155.03225708007812, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.7423754243645817, "epoch": 0.41444114737883286, "grad_norm": 2.6472716331481934, "kl_approx": 0.33123779296875, "learning_rate": 1.4605986272741748e-05, "loss": 0.228, "num_tokens": 10175114.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1684446334838867, "sampling/importance_sampling_ratio/mean": 0.9997559189796448, "sampling/importance_sampling_ratio/min": 0.7782911658287048, "sampling/sampling_logp_difference/max": 0.25065457820892334, "sampling/sampling_logp_difference/mean": 0.010024414397776127, "step": 419 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 595.0, "completions/max_terminated_length": 595.0, "completions/mean_length": 130.4375, "completions/mean_terminated_length": 130.4375, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.6037063812837005, "epoch": 0.41543026706231456, "grad_norm": 2.3735883235931396, "kl_approx": 0.21587562561035156, "learning_rate": 1.4575282208974704e-05, "loss": 0.1831, "num_tokens": 10199128.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2332051992416382, "sampling/importance_sampling_ratio/mean": 1.0006314516067505, "sampling/importance_sampling_ratio/min": 0.8152356743812561, "sampling/sampling_logp_difference/max": 0.20961666107177734, "sampling/sampling_logp_difference/mean": 0.010954044759273529, "step": 420 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 755.0, "completions/mean_length": 334.65625, "completions/mean_terminated_length": 312.4193420410156, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.8394250441342592, "epoch": 0.41641938674579626, "grad_norm": 2.0003793239593506, "kl_approx": 0.26641082763671875, "learning_rate": 1.4544523495299843e-05, "loss": 0.2098, "num_tokens": 10226117.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2539407014846802, "sampling/importance_sampling_ratio/mean": 1.0001174211502075, "sampling/importance_sampling_ratio/min": 0.7879077792167664, "sampling/sampling_logp_difference/max": 0.2383742332458496, "sampling/sampling_logp_difference/mean": 0.01330611016601324, "step": 421 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 456.0, "completions/max_terminated_length": 456.0, "completions/mean_length": 142.84375, "completions/mean_terminated_length": 142.84375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.5355891045182943, "epoch": 0.41740850642927796, "grad_norm": 2.0156631469726562, "kl_approx": 0.15036773681640625, "learning_rate": 1.4513710499117648e-05, "loss": 0.1335, "num_tokens": 10248784.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2268203496932983, "sampling/importance_sampling_ratio/mean": 1.0007879734039307, "sampling/importance_sampling_ratio/min": 0.870358407497406, "sampling/sampling_logp_difference/max": 0.20442569255828857, "sampling/sampling_logp_difference/mean": 0.010103926993906498, "step": 422 }, { "completions/clipped_ratio": 0.09375, "completions/max_length": 1024.0, "completions/max_terminated_length": 1024.0, "completions/mean_length": 543.96875, "completions/mean_terminated_length": 494.3103332519531, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 1.1422934401780367, "epoch": 0.41839762611275966, "grad_norm": 1.9891338348388672, "kl_approx": 0.27825927734375, "learning_rate": 1.4482843588476976e-05, "loss": 0.2162, "num_tokens": 10286895.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2725588083267212, "sampling/importance_sampling_ratio/mean": 1.000341534614563, "sampling/importance_sampling_ratio/min": 0.7888126373291016, "sampling/sampling_logp_difference/max": 0.2410297393798828, "sampling/sampling_logp_difference/mean": 0.015212803147733212, "step": 423 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 490.0, "completions/max_terminated_length": 490.0, "completions/mean_length": 130.34375, "completions/mean_terminated_length": 130.34375, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.6274658804759383, "epoch": 0.41938674579624136, "grad_norm": 1.5267982482910156, "kl_approx": 0.18843841552734375, "learning_rate": 1.445192313207067e-05, "loss": 0.1236, "num_tokens": 10307354.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1618711948394775, "sampling/importance_sampling_ratio/mean": 0.9996773600578308, "sampling/importance_sampling_ratio/min": 0.8292856216430664, "sampling/sampling_logp_difference/max": 0.18719065189361572, "sampling/sampling_logp_difference/mean": 0.011906720697879791, "step": 424 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 585.0, "completions/max_terminated_length": 585.0, "completions/mean_length": 213.25, "completions/mean_terminated_length": 213.25, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 1.048172704409808, "epoch": 0.42037586547972305, "grad_norm": 2.697206974029541, "kl_approx": 0.3176994323730469, "learning_rate": 1.4420949499231172e-05, "loss": 0.2101, "num_tokens": 10329202.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.177248477935791, "sampling/importance_sampling_ratio/mean": 1.00067138671875, "sampling/importance_sampling_ratio/min": 0.8080549240112305, "sampling/sampling_logp_difference/max": 0.21312522888183594, "sampling/sampling_logp_difference/mean": 0.015028057619929314, "step": 425 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 224.0, "completions/max_terminated_length": 224.0, "completions/mean_length": 115.75, "completions/mean_terminated_length": 115.75, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.8116722442209721, "epoch": 0.42136498516320475, "grad_norm": 2.4862565994262695, "kl_approx": 0.3095550537109375, "learning_rate": 1.4389923059926064e-05, "loss": 0.191, "num_tokens": 10355282.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1744455099105835, "sampling/importance_sampling_ratio/mean": 1.0001773834228516, "sampling/importance_sampling_ratio/min": 0.7823508977890015, "sampling/sampling_logp_difference/max": 0.2454519271850586, "sampling/sampling_logp_difference/mean": 0.012216521427035332, "step": 426 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 481.0, "completions/max_terminated_length": 481.0, "completions/mean_length": 150.0625, "completions/mean_terminated_length": 150.0625, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.8720698775723577, "epoch": 0.42235410484668645, "grad_norm": 2.6128621101379395, "kl_approx": 0.384033203125, "learning_rate": 1.4358844184753713e-05, "loss": 0.2624, "num_tokens": 10381884.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1672489643096924, "sampling/importance_sampling_ratio/mean": 1.0000091791152954, "sampling/importance_sampling_ratio/min": 0.8416657447814941, "sampling/sampling_logp_difference/max": 0.17237234115600586, "sampling/sampling_logp_difference/mean": 0.013363141566514969, "step": 427 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 266.0, "completions/max_terminated_length": 266.0, "completions/mean_length": 124.1875, "completions/mean_terminated_length": 124.1875, "completions/min_length": 24.0, "completions/min_terminated_length": 24.0, "entropy": 0.8193246035370976, "epoch": 0.42334322453016815, "grad_norm": 2.7532172203063965, "kl_approx": 0.24336624145507812, "learning_rate": 1.432771324493879e-05, "loss": 0.1969, "num_tokens": 10405530.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1685165166854858, "sampling/importance_sampling_ratio/mean": 1.000200867652893, "sampling/importance_sampling_ratio/min": 0.8514599204063416, "sampling/sampling_logp_difference/max": 0.16080284118652344, "sampling/sampling_logp_difference/mean": 0.012755663134157658, "step": 428 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 222.0, "completions/max_terminated_length": 222.0, "completions/mean_length": 69.53125, "completions/mean_terminated_length": 69.53125, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.6063183732330799, "epoch": 0.42433234421364985, "grad_norm": 2.8950212001800537, "kl_approx": 0.244720458984375, "learning_rate": 1.4296530612327864e-05, "loss": 0.185, "num_tokens": 10424931.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1307861804962158, "sampling/importance_sampling_ratio/mean": 0.998809814453125, "sampling/importance_sampling_ratio/min": 0.8573989272117615, "sampling/sampling_logp_difference/max": 0.15385198593139648, "sampling/sampling_logp_difference/mean": 0.011029234156012535, "step": 429 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 536.0, "completions/max_terminated_length": 536.0, "completions/mean_length": 283.0625, "completions/mean_terminated_length": 283.0625, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.8413619012571871, "epoch": 0.42532146389713155, "grad_norm": 2.098175525665283, "kl_approx": 0.323089599609375, "learning_rate": 1.4265296659384956e-05, "loss": 0.2402, "num_tokens": 10464301.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1940232515335083, "sampling/importance_sampling_ratio/mean": 1.0003180503845215, "sampling/importance_sampling_ratio/min": 0.7959275245666504, "sampling/sampling_logp_difference/max": 0.22824716567993164, "sampling/sampling_logp_difference/mean": 0.014019021764397621, "step": 430 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 577.0, "completions/max_terminated_length": 577.0, "completions/mean_length": 228.25, "completions/mean_terminated_length": 228.25, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.8269143206998706, "epoch": 0.42631058358061324, "grad_norm": 2.79227352142334, "kl_approx": 0.321014404296875, "learning_rate": 1.4234011759187084e-05, "loss": 0.2377, "num_tokens": 10494109.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2043548822402954, "sampling/importance_sampling_ratio/mean": 1.0003063678741455, "sampling/importance_sampling_ratio/min": 0.8563384413719177, "sampling/sampling_logp_difference/max": 0.1859440803527832, "sampling/sampling_logp_difference/mean": 0.011634720489382744, "step": 431 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 966.0, "completions/max_terminated_length": 966.0, "completions/mean_length": 239.84375, "completions/mean_terminated_length": 239.84375, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.9133125371299684, "epoch": 0.42729970326409494, "grad_norm": 2.547746419906616, "kl_approx": 0.29204559326171875, "learning_rate": 1.4202676285419811e-05, "loss": 0.2208, "num_tokens": 10522752.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2970812320709229, "sampling/importance_sampling_ratio/mean": 0.9995838403701782, "sampling/importance_sampling_ratio/min": 0.7917814254760742, "sampling/sampling_logp_difference/max": 0.2601165771484375, "sampling/sampling_logp_difference/mean": 0.01590675301849842, "step": 432 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 701.0, "completions/max_terminated_length": 701.0, "completions/mean_length": 234.125, "completions/mean_terminated_length": 234.125, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.9608934838324785, "epoch": 0.42828882294757664, "grad_norm": 2.2070624828338623, "kl_approx": 0.3504638671875, "learning_rate": 1.4171290612372781e-05, "loss": 0.2114, "num_tokens": 10547780.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2283060550689697, "sampling/importance_sampling_ratio/mean": 0.9999334216117859, "sampling/importance_sampling_ratio/min": 0.7851354479789734, "sampling/sampling_logp_difference/max": 0.2418990135192871, "sampling/sampling_logp_difference/mean": 0.013597025536000729, "step": 433 }, { "completions/clipped_ratio": 0.0625, "completions/max_length": 1024.0, "completions/max_terminated_length": 769.0, "completions/mean_length": 260.03125, "completions/mean_terminated_length": 209.10000610351562, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.7172732157632709, "epoch": 0.42927794263105834, "grad_norm": 2.1858584880828857, "kl_approx": 0.26299285888671875, "learning_rate": 1.4139855114935253e-05, "loss": 0.172, "num_tokens": 10572061.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2241374254226685, "sampling/importance_sampling_ratio/mean": 1.0001678466796875, "sampling/importance_sampling_ratio/min": 0.8507840037345886, "sampling/sampling_logp_difference/max": 0.20223641395568848, "sampling/sampling_logp_difference/mean": 0.011488842777907848, "step": 434 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 918.0, "completions/max_terminated_length": 918.0, "completions/mean_length": 254.25, "completions/mean_terminated_length": 254.25, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.8913100650534034, "epoch": 0.43026706231454004, "grad_norm": 1.8769135475158691, "kl_approx": 0.2570953369140625, "learning_rate": 1.410837016859161e-05, "loss": 0.1821, "num_tokens": 10599701.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2566993236541748, "sampling/importance_sampling_ratio/mean": 1.0000289678573608, "sampling/importance_sampling_ratio/min": 0.8390302658081055, "sampling/sampling_logp_difference/max": 0.22848868370056152, "sampling/sampling_logp_difference/mean": 0.014163628220558167, "step": 435 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 519.0, "completions/max_terminated_length": 519.0, "completions/mean_length": 135.125, "completions/mean_terminated_length": 135.125, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.5990018108859658, "epoch": 0.43125618199802174, "grad_norm": 3.175136089324951, "kl_approx": 0.29001617431640625, "learning_rate": 1.4076836149416889e-05, "loss": 0.1778, "num_tokens": 10620617.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1907376050949097, "sampling/importance_sampling_ratio/mean": 1.00002121925354, "sampling/importance_sampling_ratio/min": 0.8414803743362427, "sampling/sampling_logp_difference/max": 0.17457294464111328, "sampling/sampling_logp_difference/mean": 0.011556191369891167, "step": 436 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 272.0, "completions/max_terminated_length": 272.0, "completions/mean_length": 118.15625, "completions/mean_terminated_length": 118.15625, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.5853319873567671, "epoch": 0.43224530168150344, "grad_norm": 1.436872124671936, "kl_approx": 0.19085693359375, "learning_rate": 1.4045253434072278e-05, "loss": 0.1426, "num_tokens": 10640206.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1775728464126587, "sampling/importance_sampling_ratio/mean": 1.0003482103347778, "sampling/importance_sampling_ratio/min": 0.7989246249198914, "sampling/sampling_logp_difference/max": 0.2244887351989746, "sampling/sampling_logp_difference/mean": 0.011066270992159843, "step": 437 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 478.0, "completions/max_terminated_length": 478.0, "completions/mean_length": 171.875, "completions/mean_terminated_length": 171.875, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.7858288595452905, "epoch": 0.4332344213649852, "grad_norm": 1.8243718147277832, "kl_approx": 0.2732734680175781, "learning_rate": 1.4013622399800628e-05, "loss": 0.1694, "num_tokens": 10663170.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2143808603286743, "sampling/importance_sampling_ratio/mean": 1.0000754594802856, "sampling/importance_sampling_ratio/min": 0.8548662066459656, "sampling/sampling_logp_difference/max": 0.19423437118530273, "sampling/sampling_logp_difference/mean": 0.013706199824810028, "step": 438 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 441.0, "completions/max_terminated_length": 441.0, "completions/mean_length": 188.4375, "completions/mean_terminated_length": 188.4375, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.957683946006, "epoch": 0.4342235410484669, "grad_norm": 2.3517653942108154, "kl_approx": 0.3646240234375, "learning_rate": 1.3981943424421932e-05, "loss": 0.2298, "num_tokens": 10690952.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2285321950912476, "sampling/importance_sampling_ratio/mean": 1.0000789165496826, "sampling/importance_sampling_ratio/min": 0.8124501705169678, "sampling/sampling_logp_difference/max": 0.2077007293701172, "sampling/sampling_logp_difference/mean": 0.014723558910191059, "step": 439 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 204.0, "completions/max_terminated_length": 204.0, "completions/mean_length": 75.625, "completions/mean_terminated_length": 75.625, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.8382937801070511, "epoch": 0.4352126607319486, "grad_norm": 2.968046188354492, "kl_approx": 0.3498268127441406, "learning_rate": 1.3950216886328818e-05, "loss": 0.2499, "num_tokens": 10708012.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1478471755981445, "sampling/importance_sampling_ratio/mean": 0.9996378421783447, "sampling/importance_sampling_ratio/min": 0.8433035612106323, "sampling/sampling_logp_difference/max": 0.17042827606201172, "sampling/sampling_logp_difference/mean": 0.012701774016022682, "step": 440 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 712.0, "completions/max_terminated_length": 712.0, "completions/mean_length": 174.21875, "completions/mean_terminated_length": 174.21875, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.6459402348846197, "epoch": 0.4362017804154303, "grad_norm": 1.7896957397460938, "kl_approx": 0.2440032958984375, "learning_rate": 1.3918443164482048e-05, "loss": 0.1699, "num_tokens": 10734611.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2285526990890503, "sampling/importance_sampling_ratio/mean": 1.0002892017364502, "sampling/importance_sampling_ratio/min": 0.8232662081718445, "sampling/sampling_logp_difference/max": 0.20583677291870117, "sampling/sampling_logp_difference/mean": 0.011180225759744644, "step": 441 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 206.0, "completions/max_terminated_length": 206.0, "completions/mean_length": 93.34375, "completions/mean_terminated_length": 93.34375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6592550585046411, "epoch": 0.437190900098912, "grad_norm": 3.6106059551239014, "kl_approx": 0.30599212646484375, "learning_rate": 1.3886622638405953e-05, "loss": 0.1581, "num_tokens": 10752830.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1801083087921143, "sampling/importance_sampling_ratio/mean": 0.9996253252029419, "sampling/importance_sampling_ratio/min": 0.8364880084991455, "sampling/sampling_logp_difference/max": 0.1785430908203125, "sampling/sampling_logp_difference/mean": 0.012111054733395576, "step": 442 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 837.0, "completions/max_terminated_length": 837.0, "completions/mean_length": 168.09375, "completions/mean_terminated_length": 168.09375, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.7008769188541919, "epoch": 0.4381800197823937, "grad_norm": 2.7330315113067627, "kl_approx": 0.267852783203125, "learning_rate": 1.3854755688183941e-05, "loss": 0.215, "num_tokens": 10779953.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.137294888496399, "sampling/importance_sampling_ratio/mean": 0.9997431635856628, "sampling/importance_sampling_ratio/min": 0.8365859389305115, "sampling/sampling_logp_difference/max": 0.17842602729797363, "sampling/sampling_logp_difference/mean": 0.012099947780370712, "step": 443 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 381.0, "completions/max_terminated_length": 381.0, "completions/mean_length": 130.25, "completions/mean_terminated_length": 130.25, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.6923719309270382, "epoch": 0.4391691394658754, "grad_norm": 2.802429676055908, "kl_approx": 0.266998291015625, "learning_rate": 1.3822842694453923e-05, "loss": 0.2075, "num_tokens": 10803057.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1690638065338135, "sampling/importance_sampling_ratio/mean": 0.9999849796295166, "sampling/importance_sampling_ratio/min": 0.8633647561073303, "sampling/sampling_logp_difference/max": 0.1562032699584961, "sampling/sampling_logp_difference/mean": 0.011390564031898975, "step": 444 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 463.0, "completions/max_terminated_length": 463.0, "completions/mean_length": 163.59375, "completions/mean_terminated_length": 163.59375, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6962140612304211, "epoch": 0.4401582591493571, "grad_norm": 2.224177837371826, "kl_approx": 0.22264862060546875, "learning_rate": 1.3790884038403796e-05, "loss": 0.1609, "num_tokens": 10828684.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.185563564300537, "sampling/importance_sampling_ratio/mean": 1.0006740093231201, "sampling/importance_sampling_ratio/min": 0.8579866290092468, "sampling/sampling_logp_difference/max": 0.17021822929382324, "sampling/sampling_logp_difference/mean": 0.012132667936384678, "step": 445 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 587.0, "completions/max_terminated_length": 587.0, "completions/mean_length": 145.125, "completions/mean_terminated_length": 145.125, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.6982352994382381, "epoch": 0.4411473788328388, "grad_norm": 2.1662960052490234, "kl_approx": 0.24022674560546875, "learning_rate": 1.375888010176686e-05, "loss": 0.1637, "num_tokens": 10850120.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1913082599639893, "sampling/importance_sampling_ratio/mean": 0.9996627569198608, "sampling/importance_sampling_ratio/min": 0.8493221998214722, "sampling/sampling_logp_difference/max": 0.17505216598510742, "sampling/sampling_logp_difference/mean": 0.012605649419128895, "step": 446 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 193.0, "completions/max_terminated_length": 193.0, "completions/mean_length": 111.34375, "completions/mean_terminated_length": 111.34375, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.6036932924762368, "epoch": 0.4421364985163205, "grad_norm": 2.35903263092041, "kl_approx": 0.37683868408203125, "learning_rate": 1.3726831266817278e-05, "loss": 0.1535, "num_tokens": 10872555.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1809746026992798, "sampling/importance_sampling_ratio/mean": 1.0001943111419678, "sampling/importance_sampling_ratio/min": 0.8346695303916931, "sampling/sampling_logp_difference/max": 0.18071937561035156, "sampling/sampling_logp_difference/mean": 0.01046761590987444, "step": 447 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 266.0, "completions/max_terminated_length": 266.0, "completions/mean_length": 111.59375, "completions/mean_terminated_length": 111.59375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.6462713307701051, "epoch": 0.4431256181998022, "grad_norm": 2.366849422454834, "kl_approx": 0.2693634033203125, "learning_rate": 1.3694737916365517e-05, "loss": 0.1838, "num_tokens": 10894158.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1402004957199097, "sampling/importance_sampling_ratio/mean": 1.0008755922317505, "sampling/importance_sampling_ratio/min": 0.8557877540588379, "sampling/sampling_logp_difference/max": 0.1557328701019287, "sampling/sampling_logp_difference/mean": 0.011302848346531391, "step": 448 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 342.0, "completions/max_terminated_length": 342.0, "completions/mean_length": 114.34375, "completions/mean_terminated_length": 114.34375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.6947909612208605, "epoch": 0.44411473788328387, "grad_norm": 2.5716261863708496, "kl_approx": 0.2924041748046875, "learning_rate": 1.3662600433753746e-05, "loss": 0.2039, "num_tokens": 10914097.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1955112218856812, "sampling/importance_sampling_ratio/mean": 0.9991871118545532, "sampling/importance_sampling_ratio/min": 0.8204547762870789, "sampling/sampling_logp_difference/max": 0.19789648056030273, "sampling/sampling_logp_difference/mean": 0.012468691915273666, "step": 449 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 486.0, "completions/max_terminated_length": 486.0, "completions/mean_length": 133.625, "completions/mean_terminated_length": 133.625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.6553917685523629, "epoch": 0.44510385756676557, "grad_norm": 2.4385063648223877, "kl_approx": 0.2361297607421875, "learning_rate": 1.3630419202851287e-05, "loss": 0.1622, "num_tokens": 10939357.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2854565382003784, "sampling/importance_sampling_ratio/mean": 1.0006252527236938, "sampling/importance_sampling_ratio/min": 0.788213312625885, "sampling/sampling_logp_difference/max": 0.2511138916015625, "sampling/sampling_logp_difference/mean": 0.012939208187162876, "step": 450 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 716.0, "completions/max_terminated_length": 716.0, "completions/mean_length": 194.46875, "completions/mean_terminated_length": 194.46875, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7774124406278133, "epoch": 0.44609297725024727, "grad_norm": 2.8990373611450195, "kl_approx": 0.33634185791015625, "learning_rate": 1.3598194608050011e-05, "loss": 0.2052, "num_tokens": 10962540.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1835042238235474, "sampling/importance_sampling_ratio/mean": 1.0004820823669434, "sampling/importance_sampling_ratio/min": 0.800331175327301, "sampling/sampling_logp_difference/max": 0.22272968292236328, "sampling/sampling_logp_difference/mean": 0.0138300945982337, "step": 451 }, { "completions/clipped_ratio": 0.0625, "completions/max_length": 1024.0, "completions/max_terminated_length": 646.0, "completions/mean_length": 220.53125, "completions/mean_terminated_length": 166.9666748046875, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6123757963068783, "epoch": 0.44708209693372897, "grad_norm": 1.6247053146362305, "kl_approx": 0.18654632568359375, "learning_rate": 1.3565927034259757e-05, "loss": 0.1242, "num_tokens": 10988773.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1931644678115845, "sampling/importance_sampling_ratio/mean": 0.9995180368423462, "sampling/importance_sampling_ratio/min": 0.7986994981765747, "sampling/sampling_logp_difference/max": 0.22477054595947266, "sampling/sampling_logp_difference/mean": 0.0119318887591362, "step": 452 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 886.0, "completions/max_terminated_length": 886.0, "completions/mean_length": 237.375, "completions/mean_terminated_length": 237.375, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.9288825951516628, "epoch": 0.44807121661721067, "grad_norm": 2.551544666290283, "kl_approx": 0.3261566162109375, "learning_rate": 1.3533616866903736e-05, "loss": 0.2105, "num_tokens": 11010929.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1393961906433105, "sampling/importance_sampling_ratio/mean": 0.9995306134223938, "sampling/importance_sampling_ratio/min": 0.7764973044395447, "sampling/sampling_logp_difference/max": 0.2529621124267578, "sampling/sampling_logp_difference/mean": 0.015297374688088894, "step": 453 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 608.0, "completions/max_terminated_length": 608.0, "completions/mean_length": 162.9375, "completions/mean_terminated_length": 162.9375, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.8495964938774705, "epoch": 0.44906033630069236, "grad_norm": 2.8641245365142822, "kl_approx": 0.31903076171875, "learning_rate": 1.3501264491913909e-05, "loss": 0.2421, "num_tokens": 11031519.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2627003192901611, "sampling/importance_sampling_ratio/mean": 0.999864399433136, "sampling/importance_sampling_ratio/min": 0.8030319213867188, "sampling/sampling_logp_difference/max": 0.23325252532958984, "sampling/sampling_logp_difference/mean": 0.01469552330672741, "step": 454 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 348.0, "completions/max_terminated_length": 348.0, "completions/mean_length": 126.09375, "completions/mean_terminated_length": 126.09375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.5899194260127842, "epoch": 0.45004945598417406, "grad_norm": 2.2761552333831787, "kl_approx": 0.20597457885742188, "learning_rate": 1.3468870295726399e-05, "loss": 0.1608, "num_tokens": 11050930.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1726016998291016, "sampling/importance_sampling_ratio/mean": 0.9999621510505676, "sampling/importance_sampling_ratio/min": 0.8078721761703491, "sampling/sampling_logp_difference/max": 0.21335148811340332, "sampling/sampling_logp_difference/mean": 0.01090420875698328, "step": 455 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 252.0, "completions/max_terminated_length": 252.0, "completions/mean_length": 81.71875, "completions/mean_terminated_length": 81.71875, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.5787721467204392, "epoch": 0.45103857566765576, "grad_norm": 3.142003059387207, "kl_approx": 0.31827545166015625, "learning_rate": 1.3436434665276865e-05, "loss": 0.2118, "num_tokens": 11071633.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.145704984664917, "sampling/importance_sampling_ratio/mean": 0.9994970560073853, "sampling/importance_sampling_ratio/min": 0.8417870998382568, "sampling/sampling_logp_difference/max": 0.17222809791564941, "sampling/sampling_logp_difference/mean": 0.011770239099860191, "step": 456 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 701.0, "completions/max_terminated_length": 701.0, "completions/mean_length": 103.9375, "completions/mean_terminated_length": 103.9375, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.5081651173532009, "epoch": 0.4520276953511375, "grad_norm": 1.936497449874878, "kl_approx": 0.19176483154296875, "learning_rate": 1.3403957987995884e-05, "loss": 0.1295, "num_tokens": 11096007.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1957263946533203, "sampling/importance_sampling_ratio/mean": 1.0001825094223022, "sampling/importance_sampling_ratio/min": 0.809363842010498, "sampling/sampling_logp_difference/max": 0.21150678396224976, "sampling/sampling_logp_difference/mean": 0.009641105309128761, "step": 457 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 401.0, "completions/max_terminated_length": 401.0, "completions/mean_length": 106.6875, "completions/mean_terminated_length": 106.6875, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.731113210786134, "epoch": 0.4530168150346192, "grad_norm": 2.4408631324768066, "kl_approx": 0.21547889709472656, "learning_rate": 1.3371440651804313e-05, "loss": 0.196, "num_tokens": 11116269.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1772613525390625, "sampling/importance_sampling_ratio/mean": 0.9994161128997803, "sampling/importance_sampling_ratio/min": 0.8066644072532654, "sampling/sampling_logp_difference/max": 0.21484756469726562, "sampling/sampling_logp_difference/mean": 0.014548573642969131, "step": 458 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 614.0, "completions/max_terminated_length": 614.0, "completions/mean_length": 156.71875, "completions/mean_terminated_length": 156.71875, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.6149857258424163, "epoch": 0.4540059347181009, "grad_norm": 2.0258076190948486, "kl_approx": 0.23973464965820312, "learning_rate": 1.3338883045108674e-05, "loss": 0.1688, "num_tokens": 11137828.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2402020692825317, "sampling/importance_sampling_ratio/mean": 0.9998037219047546, "sampling/importance_sampling_ratio/min": 0.8189778327941895, "sampling/sampling_logp_difference/max": 0.21527433395385742, "sampling/sampling_logp_difference/mean": 0.012687510810792446, "step": 459 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 428.0, "completions/max_terminated_length": 428.0, "completions/mean_length": 136.8125, "completions/mean_terminated_length": 136.8125, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.6863998915068805, "epoch": 0.4549950544015826, "grad_norm": 1.7654136419296265, "kl_approx": 0.22562026977539062, "learning_rate": 1.3306285556796494e-05, "loss": 0.1611, "num_tokens": 11164574.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.209354281425476, "sampling/importance_sampling_ratio/mean": 0.9999751448631287, "sampling/importance_sampling_ratio/min": 0.8398892283439636, "sampling/sampling_logp_difference/max": 0.19008660316467285, "sampling/sampling_logp_difference/mean": 0.012644147500395775, "step": 460 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 407.0, "completions/max_terminated_length": 407.0, "completions/mean_length": 204.71875, "completions/mean_terminated_length": 204.71875, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.7525018788874149, "epoch": 0.4559841740850643, "grad_norm": 1.884036898612976, "kl_approx": 0.2676544189453125, "learning_rate": 1.327364857623168e-05, "loss": 0.1898, "num_tokens": 11194053.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1789178848266602, "sampling/importance_sampling_ratio/mean": 0.9993595480918884, "sampling/importance_sampling_ratio/min": 0.8195738792419434, "sampling/sampling_logp_difference/max": 0.19897079467773438, "sampling/sampling_logp_difference/mean": 0.012982690706849098, "step": 461 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 457.0, "completions/max_terminated_length": 457.0, "completions/mean_length": 154.28125, "completions/mean_terminated_length": 154.28125, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.556359363719821, "epoch": 0.456973293768546, "grad_norm": 2.1670050621032715, "kl_approx": 0.2472076416015625, "learning_rate": 1.3240972493249846e-05, "loss": 0.1944, "num_tokens": 11219070.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2631676197052002, "sampling/importance_sampling_ratio/mean": 0.9995999932289124, "sampling/importance_sampling_ratio/min": 0.8328924179077148, "sampling/sampling_logp_difference/max": 0.23362255096435547, "sampling/sampling_logp_difference/mean": 0.011417048051953316, "step": 462 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 430.0, "completions/max_terminated_length": 430.0, "completions/mean_length": 167.40625, "completions/mean_terminated_length": 167.40625, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.7544656461104751, "epoch": 0.4579624134520277, "grad_norm": 3.716649055480957, "kl_approx": 0.3824462890625, "learning_rate": 1.3208257698153677e-05, "loss": 0.2544, "num_tokens": 11240483.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.259324312210083, "sampling/importance_sampling_ratio/mean": 1.0005813837051392, "sampling/importance_sampling_ratio/min": 0.8473703861236572, "sampling/sampling_logp_difference/max": 0.2305753231048584, "sampling/sampling_logp_difference/mean": 0.011791358701884747, "step": 463 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 983.0, "completions/max_terminated_length": 983.0, "completions/mean_length": 159.21875, "completions/mean_terminated_length": 159.21875, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.593248697463423, "epoch": 0.4589515331355094, "grad_norm": 1.6913824081420898, "kl_approx": 0.2818422317504883, "learning_rate": 1.3175504581708261e-05, "loss": 0.1569, "num_tokens": 11266282.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2083141803741455, "sampling/importance_sampling_ratio/mean": 1.0000348091125488, "sampling/importance_sampling_ratio/min": 0.7837619185447693, "sampling/sampling_logp_difference/max": 0.24364995956420898, "sampling/sampling_logp_difference/mean": 0.010677502490580082, "step": 464 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 1019.0, "completions/max_terminated_length": 1019.0, "completions/mean_length": 284.59375, "completions/mean_terminated_length": 284.59375, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.8388537829741836, "epoch": 0.4599406528189911, "grad_norm": 1.914202332496643, "kl_approx": 0.2504730224609375, "learning_rate": 1.3142713535136413e-05, "loss": 0.1726, "num_tokens": 11295557.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1587873697280884, "sampling/importance_sampling_ratio/mean": 1.0004538297653198, "sampling/importance_sampling_ratio/min": 0.8434970378875732, "sampling/sampling_logp_difference/max": 0.17019891738891602, "sampling/sampling_logp_difference/mean": 0.011869501322507858, "step": 465 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 268.0, "completions/max_terminated_length": 268.0, "completions/mean_length": 117.75, "completions/mean_terminated_length": 117.75, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.7833300530910492, "epoch": 0.4609297725024728, "grad_norm": 2.747499704360962, "kl_approx": 0.3580322265625, "learning_rate": 1.3109884950114007e-05, "loss": 0.228, "num_tokens": 11323253.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1690434217453003, "sampling/importance_sampling_ratio/mean": 0.9996206164360046, "sampling/importance_sampling_ratio/min": 0.8131005167961121, "sampling/sampling_logp_difference/max": 0.20690059661865234, "sampling/sampling_logp_difference/mean": 0.012182450853288174, "step": 466 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 913.0, "completions/max_terminated_length": 913.0, "completions/mean_length": 230.9375, "completions/mean_terminated_length": 230.9375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.8726679338142276, "epoch": 0.4619188921859545, "grad_norm": 2.4785563945770264, "kl_approx": 0.2891845703125, "learning_rate": 1.3077019218765306e-05, "loss": 0.2122, "num_tokens": 11350891.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2477930784225464, "sampling/importance_sampling_ratio/mean": 0.9998090267181396, "sampling/importance_sampling_ratio/min": 0.8466213941574097, "sampling/sampling_logp_difference/max": 0.2213764190673828, "sampling/sampling_logp_difference/mean": 0.01285143569111824, "step": 467 }, { "completions/clipped_ratio": 0.0625, "completions/max_length": 1024.0, "completions/max_terminated_length": 917.0, "completions/mean_length": 329.0625, "completions/mean_terminated_length": 282.73333740234375, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.9258915521204472, "epoch": 0.4629080118694362, "grad_norm": 2.1290476322174072, "kl_approx": 0.2992706298828125, "learning_rate": 1.3044116733658261e-05, "loss": 0.206, "num_tokens": 11384429.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3671208620071411, "sampling/importance_sampling_ratio/mean": 1.0005242824554443, "sampling/importance_sampling_ratio/min": 0.6949817538261414, "sampling/sampling_logp_difference/max": 0.36386966705322266, "sampling/sampling_logp_difference/mean": 0.014502009376883507, "step": 468 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 815.0, "completions/max_terminated_length": 815.0, "completions/mean_length": 301.0, "completions/mean_terminated_length": 301.0, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.9743550876155496, "epoch": 0.4638971315529179, "grad_norm": 1.9190489053726196, "kl_approx": 0.26988983154296875, "learning_rate": 1.3011177887799846e-05, "loss": 0.1831, "num_tokens": 11420189.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2770546674728394, "sampling/importance_sampling_ratio/mean": 0.9998185038566589, "sampling/importance_sampling_ratio/min": 0.7298970818519592, "sampling/sampling_logp_difference/max": 0.3148517608642578, "sampling/sampling_logp_difference/mean": 0.014383594505488873, "step": 469 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 786.0, "completions/max_terminated_length": 786.0, "completions/mean_length": 297.0625, "completions/mean_terminated_length": 297.0625, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 1.1723716156557202, "epoch": 0.4648862512363996, "grad_norm": 2.399261474609375, "kl_approx": 0.3595123291015625, "learning_rate": 1.2978203074631335e-05, "loss": 0.298, "num_tokens": 11449927.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2520335912704468, "sampling/importance_sampling_ratio/mean": 1.0002574920654297, "sampling/importance_sampling_ratio/min": 0.6720503568649292, "sampling/sampling_logp_difference/max": 0.39742207527160645, "sampling/sampling_logp_difference/mean": 0.016483867540955544, "step": 470 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 528.0, "completions/max_terminated_length": 528.0, "completions/mean_length": 221.90625, "completions/mean_terminated_length": 221.90625, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 1.058704799041152, "epoch": 0.4658753709198813, "grad_norm": 2.3523080348968506, "kl_approx": 0.341949462890625, "learning_rate": 1.2945192688023625e-05, "loss": 0.2513, "num_tokens": 11476108.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1835942268371582, "sampling/importance_sampling_ratio/mean": 0.9999915957450867, "sampling/importance_sampling_ratio/min": 0.8191711902618408, "sampling/sampling_logp_difference/max": 0.1994621753692627, "sampling/sampling_logp_difference/mean": 0.01522766426205635, "step": 471 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 631.0, "completions/max_terminated_length": 631.0, "completions/mean_length": 257.28125, "completions/mean_terminated_length": 257.28125, "completions/min_length": 91.0, "completions/min_terminated_length": 91.0, "entropy": 1.0115352272987366, "epoch": 0.466864490603363, "grad_norm": 1.9415582418441772, "kl_approx": 0.273223876953125, "learning_rate": 1.2912147122272523e-05, "loss": 0.2005, "num_tokens": 11499261.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.240911602973938, "sampling/importance_sampling_ratio/mean": 1.000236988067627, "sampling/importance_sampling_ratio/min": 0.8207588195800781, "sampling/sampling_logp_difference/max": 0.21584630012512207, "sampling/sampling_logp_difference/mean": 0.013938797637820244, "step": 472 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 565.0, "completions/max_terminated_length": 565.0, "completions/mean_length": 200.625, "completions/mean_terminated_length": 200.625, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 1.0170786557719111, "epoch": 0.4678536102868447, "grad_norm": 2.610623359680176, "kl_approx": 0.342742919921875, "learning_rate": 1.287906677209403e-05, "loss": 0.26, "num_tokens": 11524337.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2086273431777954, "sampling/importance_sampling_ratio/mean": 1.000275731086731, "sampling/importance_sampling_ratio/min": 0.8513085246086121, "sampling/sampling_logp_difference/max": 0.1894853115081787, "sampling/sampling_logp_difference/mean": 0.0159895122051239, "step": 473 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 514.0, "completions/max_terminated_length": 514.0, "completions/mean_length": 196.0625, "completions/mean_terminated_length": 196.0625, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.9287227895110846, "epoch": 0.4688427299703264, "grad_norm": 2.0768189430236816, "kl_approx": 0.27630615234375, "learning_rate": 1.2845952032619651e-05, "loss": 0.2141, "num_tokens": 11552291.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1837248802185059, "sampling/importance_sampling_ratio/mean": 1.0006721019744873, "sampling/importance_sampling_ratio/min": 0.8101620674133301, "sampling/sampling_logp_difference/max": 0.21052098274230957, "sampling/sampling_logp_difference/mean": 0.014184501022100449, "step": 474 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 473.0, "completions/max_terminated_length": 473.0, "completions/mean_length": 154.34375, "completions/mean_terminated_length": 154.34375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.5960145220160484, "epoch": 0.4698318496538081, "grad_norm": 2.405538558959961, "kl_approx": 0.24200439453125, "learning_rate": 1.2812803299391629e-05, "loss": 0.1552, "num_tokens": 11575646.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.173933506011963, "sampling/importance_sampling_ratio/mean": 0.9996460676193237, "sampling/importance_sampling_ratio/min": 0.8500842452049255, "sampling/sampling_logp_difference/max": 0.16241979598999023, "sampling/sampling_logp_difference/mean": 0.010098632425069809, "step": 475 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 731.0, "completions/max_terminated_length": 731.0, "completions/mean_length": 284.0625, "completions/mean_terminated_length": 284.0625, "completions/min_length": 77.0, "completions/min_terminated_length": 77.0, "entropy": 0.8923814930021763, "epoch": 0.4708209693372898, "grad_norm": 2.4786641597747803, "kl_approx": 0.2541351318359375, "learning_rate": 1.2779620968358276e-05, "loss": 0.2448, "num_tokens": 11601456.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.389927625656128, "sampling/importance_sampling_ratio/mean": 0.9998123049736023, "sampling/importance_sampling_ratio/min": 0.8127833604812622, "sampling/sampling_logp_difference/max": 0.329251766204834, "sampling/sampling_logp_difference/mean": 0.014493205584585667, "step": 476 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 278.0, "completions/max_terminated_length": 278.0, "completions/mean_length": 103.75, "completions/mean_terminated_length": 103.75, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6844446090981364, "epoch": 0.47181008902077154, "grad_norm": 3.1034717559814453, "kl_approx": 0.2649688720703125, "learning_rate": 1.2746405435869198e-05, "loss": 0.1733, "num_tokens": 11623688.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.147152066230774, "sampling/importance_sampling_ratio/mean": 1.0002505779266357, "sampling/importance_sampling_ratio/min": 0.8449169993400574, "sampling/sampling_logp_difference/max": 0.1685168743133545, "sampling/sampling_logp_difference/mean": 0.012079378589987755, "step": 477 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 548.0, "completions/max_terminated_length": 548.0, "completions/mean_length": 206.53125, "completions/mean_terminated_length": 206.53125, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.867539007216692, "epoch": 0.47279920870425324, "grad_norm": 1.8537647724151611, "kl_approx": 0.22707366943359375, "learning_rate": 1.271315709867059e-05, "loss": 0.1742, "num_tokens": 11648929.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1656577587127686, "sampling/importance_sampling_ratio/mean": 0.9996382594108582, "sampling/importance_sampling_ratio/min": 0.8352197408676147, "sampling/sampling_logp_difference/max": 0.18006038665771484, "sampling/sampling_logp_difference/mean": 0.015431249514222145, "step": 478 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 216.0, "completions/max_terminated_length": 216.0, "completions/mean_length": 102.625, "completions/mean_terminated_length": 102.625, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.5393805997446179, "epoch": 0.47378832838773494, "grad_norm": 1.8273577690124512, "kl_approx": 0.207305908203125, "learning_rate": 1.2679876353900482e-05, "loss": 0.1217, "num_tokens": 11674437.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2150174379348755, "sampling/importance_sampling_ratio/mean": 1.0004057884216309, "sampling/importance_sampling_ratio/min": 0.8671087026596069, "sampling/sampling_logp_difference/max": 0.19475841522216797, "sampling/sampling_logp_difference/mean": 0.009880248457193375, "step": 479 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 470.0, "completions/max_terminated_length": 470.0, "completions/mean_length": 162.0, "completions/mean_terminated_length": 162.0, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.641499396879226, "epoch": 0.47477744807121663, "grad_norm": 2.1873738765716553, "kl_approx": 0.173187255859375, "learning_rate": 1.2646563599083997e-05, "loss": 0.1508, "num_tokens": 11699709.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2142940759658813, "sampling/importance_sampling_ratio/mean": 0.9998086094856262, "sampling/importance_sampling_ratio/min": 0.7806858420372009, "sampling/sampling_logp_difference/max": 0.24758243560791016, "sampling/sampling_logp_difference/mean": 0.012686457484960556, "step": 480 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 423.0, "completions/max_terminated_length": 423.0, "completions/mean_length": 124.90625, "completions/mean_terminated_length": 124.90625, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.6375618986785412, "epoch": 0.47576656775469833, "grad_norm": 1.991029143333435, "kl_approx": 0.3487110137939453, "learning_rate": 1.2613219232128608e-05, "loss": 0.1519, "num_tokens": 11720626.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2525970935821533, "sampling/importance_sampling_ratio/mean": 0.9995721578598022, "sampling/importance_sampling_ratio/min": 0.8370346426963806, "sampling/sampling_logp_difference/max": 0.2252190113067627, "sampling/sampling_logp_difference/mean": 0.013242901302874088, "step": 481 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 529.0, "completions/max_terminated_length": 529.0, "completions/mean_length": 188.5, "completions/mean_terminated_length": 188.5, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.7571300938725471, "epoch": 0.47675568743818003, "grad_norm": 1.9700815677642822, "kl_approx": 0.2279052734375, "learning_rate": 1.2579843651319382e-05, "loss": 0.1597, "num_tokens": 11742706.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1672333478927612, "sampling/importance_sampling_ratio/mean": 0.9999986886978149, "sampling/importance_sampling_ratio/min": 0.844140350818634, "sampling/sampling_logp_difference/max": 0.16943645477294922, "sampling/sampling_logp_difference/mean": 0.013009791262447834, "step": 482 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 236.0, "completions/max_terminated_length": 236.0, "completions/mean_length": 86.96875, "completions/mean_terminated_length": 86.96875, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.5653703091666102, "epoch": 0.47774480712166173, "grad_norm": 1.9537395238876343, "kl_approx": 0.18749618530273438, "learning_rate": 1.2546437255314223e-05, "loss": 0.1427, "num_tokens": 11761137.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2213099002838135, "sampling/importance_sampling_ratio/mean": 1.0002068281173706, "sampling/importance_sampling_ratio/min": 0.8096879124641418, "sampling/sampling_logp_difference/max": 0.21110641956329346, "sampling/sampling_logp_difference/mean": 0.010407056659460068, "step": 483 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 457.0, "completions/max_terminated_length": 457.0, "completions/mean_length": 114.5625, "completions/mean_terminated_length": 114.5625, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7385221105068922, "epoch": 0.47873392680514343, "grad_norm": 2.7418100833892822, "kl_approx": 0.37860107421875, "learning_rate": 1.2513000443139112e-05, "loss": 0.2, "num_tokens": 11784979.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2152578830718994, "sampling/importance_sampling_ratio/mean": 0.9999341368675232, "sampling/importance_sampling_ratio/min": 0.8198615312576294, "sampling/sampling_logp_difference/max": 0.19861984252929688, "sampling/sampling_logp_difference/mean": 0.013457990251481533, "step": 484 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 384.0, "completions/max_terminated_length": 384.0, "completions/mean_length": 103.125, "completions/mean_terminated_length": 103.125, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.7550612296909094, "epoch": 0.4797230464886251, "grad_norm": 2.702779769897461, "kl_approx": 0.2510528564453125, "learning_rate": 1.2479533614183334e-05, "loss": 0.169, "num_tokens": 11806167.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.184620976448059, "sampling/importance_sampling_ratio/mean": 1.0001789331436157, "sampling/importance_sampling_ratio/min": 0.7854878306388855, "sampling/sampling_logp_difference/max": 0.24145030975341797, "sampling/sampling_logp_difference/mean": 0.013083217665553093, "step": 485 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 375.0, "completions/max_terminated_length": 375.0, "completions/mean_length": 186.40625, "completions/mean_terminated_length": 186.40625, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.7565377843566239, "epoch": 0.4807121661721068, "grad_norm": 2.0746119022369385, "kl_approx": 0.23390579223632812, "learning_rate": 1.2446037168194716e-05, "loss": 0.149, "num_tokens": 11834380.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1413025856018066, "sampling/importance_sampling_ratio/mean": 0.9998683929443359, "sampling/importance_sampling_ratio/min": 0.8281897306442261, "sampling/sampling_logp_difference/max": 0.18851304054260254, "sampling/sampling_logp_difference/mean": 0.013516796752810478, "step": 486 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 783.0, "completions/max_terminated_length": 783.0, "completions/mean_length": 250.6875, "completions/mean_terminated_length": 250.6875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.795373011380434, "epoch": 0.4817012858555885, "grad_norm": 1.946982741355896, "kl_approx": 0.2684326171875, "learning_rate": 1.2412511505274845e-05, "loss": 0.2064, "num_tokens": 11863418.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.290208339691162, "sampling/importance_sampling_ratio/mean": 1.0001815557479858, "sampling/importance_sampling_ratio/min": 0.8337192535400391, "sampling/sampling_logp_difference/max": 0.2548036575317383, "sampling/sampling_logp_difference/mean": 0.013046098873019218, "step": 487 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 761.0, "completions/max_terminated_length": 761.0, "completions/mean_length": 327.78125, "completions/mean_terminated_length": 327.78125, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.9246969036757946, "epoch": 0.4826904055390702, "grad_norm": 1.993284821510315, "kl_approx": 0.2831382751464844, "learning_rate": 1.23789570258743e-05, "loss": 0.203, "num_tokens": 11891115.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.259200930595398, "sampling/importance_sampling_ratio/mean": 0.9997266530990601, "sampling/importance_sampling_ratio/min": 0.7979229688644409, "sampling/sampling_logp_difference/max": 0.23047733306884766, "sampling/sampling_logp_difference/mean": 0.016424424946308136, "step": 488 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 376.0, "completions/max_terminated_length": 376.0, "completions/mean_length": 187.53125, "completions/mean_terminated_length": 187.53125, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.7516654576174915, "epoch": 0.4836795252225519, "grad_norm": 2.3468098640441895, "kl_approx": 0.306793212890625, "learning_rate": 1.2345374130787855e-05, "loss": 0.1983, "num_tokens": 11917428.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1881496906280518, "sampling/importance_sampling_ratio/mean": 0.9992873668670654, "sampling/importance_sampling_ratio/min": 0.833147406578064, "sampling/sampling_logp_difference/max": 0.18254470825195312, "sampling/sampling_logp_difference/mean": 0.01187797449529171, "step": 489 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 835.0, "completions/max_terminated_length": 835.0, "completions/mean_length": 210.875, "completions/mean_terminated_length": 210.875, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.8039605999365449, "epoch": 0.4846686449060336, "grad_norm": 1.8116700649261475, "kl_approx": 0.20766067504882812, "learning_rate": 1.23117632211497e-05, "loss": 0.1663, "num_tokens": 11941448.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2310689687728882, "sampling/importance_sampling_ratio/mean": 1.0005028247833252, "sampling/importance_sampling_ratio/min": 0.7902961373329163, "sampling/sampling_logp_difference/max": 0.23534750938415527, "sampling/sampling_logp_difference/mean": 0.014252194203436375, "step": 490 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 703.0, "completions/mean_length": 284.28125, "completions/mean_terminated_length": 260.4193420410156, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7177077056840062, "epoch": 0.4856577645895153, "grad_norm": 1.5928541421890259, "kl_approx": 0.18956756591796875, "learning_rate": 1.2278124698428643e-05, "loss": 0.1552, "num_tokens": 11969305.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.176121711730957, "sampling/importance_sampling_ratio/mean": 1.0003793239593506, "sampling/importance_sampling_ratio/min": 0.7980958223342896, "sampling/sampling_logp_difference/max": 0.2255265712738037, "sampling/sampling_logp_difference/mean": 0.013843419961631298, "step": 491 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 734.0, "completions/max_terminated_length": 734.0, "completions/mean_length": 167.5, "completions/mean_terminated_length": 167.5, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.5301191550679505, "epoch": 0.486646884272997, "grad_norm": 1.716185212135315, "kl_approx": 0.1527252197265625, "learning_rate": 1.2244458964423328e-05, "loss": 0.1308, "num_tokens": 11993353.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2706210613250732, "sampling/importance_sampling_ratio/mean": 1.0002002716064453, "sampling/importance_sampling_ratio/min": 0.8496166467666626, "sampling/sampling_logp_difference/max": 0.23950588703155518, "sampling/sampling_logp_difference/mean": 0.012016410008072853, "step": 492 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 598.0, "completions/max_terminated_length": 598.0, "completions/mean_length": 162.5, "completions/mean_terminated_length": 162.5, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.766733250580728, "epoch": 0.4876360039564787, "grad_norm": 2.936771869659424, "kl_approx": 0.297393798828125, "learning_rate": 1.221076642125742e-05, "loss": 0.2651, "num_tokens": 12021017.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1707618236541748, "sampling/importance_sampling_ratio/mean": 0.9995536208152771, "sampling/importance_sampling_ratio/min": 0.7615652680397034, "sampling/sampling_logp_difference/max": 0.27237939834594727, "sampling/sampling_logp_difference/mean": 0.014001007191836834, "step": 493 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 890.0, "completions/max_terminated_length": 890.0, "completions/mean_length": 159.9375, "completions/mean_terminated_length": 159.9375, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.8229209017008543, "epoch": 0.4886251236399604, "grad_norm": 2.2849819660186768, "kl_approx": 0.26708984375, "learning_rate": 1.2177047471374808e-05, "loss": 0.1958, "num_tokens": 12047095.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1882816553115845, "sampling/importance_sampling_ratio/mean": 0.9993811249732971, "sampling/importance_sampling_ratio/min": 0.7835231423377991, "sampling/sampling_logp_difference/max": 0.24395465850830078, "sampling/sampling_logp_difference/mean": 0.01476895809173584, "step": 494 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 244.0, "completions/max_terminated_length": 244.0, "completions/mean_length": 134.59375, "completions/mean_terminated_length": 134.59375, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 0.6516125584021211, "epoch": 0.4896142433234421, "grad_norm": 2.6090188026428223, "kl_approx": 0.22177886962890625, "learning_rate": 1.214330251753481e-05, "loss": 0.1983, "num_tokens": 12069746.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1276214122772217, "sampling/importance_sampling_ratio/mean": 1.000030755996704, "sampling/importance_sampling_ratio/min": 0.8397313356399536, "sampling/sampling_logp_difference/max": 0.17467331886291504, "sampling/sampling_logp_difference/mean": 0.011198428459465504, "step": 495 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 560.0, "completions/max_terminated_length": 560.0, "completions/mean_length": 123.3125, "completions/mean_terminated_length": 123.3125, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.5543941901996732, "epoch": 0.49060336300692386, "grad_norm": 2.0006585121154785, "kl_approx": 0.19879150390625, "learning_rate": 1.2109531962807333e-05, "loss": 0.1298, "num_tokens": 12095980.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2733358144760132, "sampling/importance_sampling_ratio/mean": 0.9993589520454407, "sampling/importance_sampling_ratio/min": 0.8468822240829468, "sampling/sampling_logp_difference/max": 0.2416400909423828, "sampling/sampling_logp_difference/mean": 0.009931275621056557, "step": 496 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 832.0, "completions/mean_length": 237.125, "completions/mean_terminated_length": 211.74192810058594, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7027344154193997, "epoch": 0.49159248269040556, "grad_norm": 2.0627801418304443, "kl_approx": 0.16815948486328125, "learning_rate": 1.207573621056809e-05, "loss": 0.1524, "num_tokens": 12127776.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2553985118865967, "sampling/importance_sampling_ratio/mean": 0.9999781847000122, "sampling/importance_sampling_ratio/min": 0.8344643712043762, "sampling/sampling_logp_difference/max": 0.22745299339294434, "sampling/sampling_logp_difference/mean": 0.012677371501922607, "step": 497 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 372.0, "completions/max_terminated_length": 372.0, "completions/mean_length": 146.59375, "completions/mean_terminated_length": 146.59375, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.8622906133532524, "epoch": 0.49258160237388726, "grad_norm": 2.1845884323120117, "kl_approx": 0.2854156494140625, "learning_rate": 1.2041915664493763e-05, "loss": 0.2025, "num_tokens": 12149899.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1864584684371948, "sampling/importance_sampling_ratio/mean": 0.9993171691894531, "sampling/importance_sampling_ratio/min": 0.8455798029899597, "sampling/sampling_logp_difference/max": 0.1709728240966797, "sampling/sampling_logp_difference/mean": 0.013321835547685623, "step": 498 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 558.0, "completions/max_terminated_length": 558.0, "completions/mean_length": 157.40625, "completions/mean_terminated_length": 157.40625, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.7148921834304929, "epoch": 0.49357072205736896, "grad_norm": 2.4677913188934326, "kl_approx": 0.3090972900390625, "learning_rate": 1.2008070728557186e-05, "loss": 0.1744, "num_tokens": 12173048.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1716009378433228, "sampling/importance_sampling_ratio/mean": 1.0003960132598877, "sampling/importance_sampling_ratio/min": 0.8321740627288818, "sampling/sampling_logp_difference/max": 0.18371367454528809, "sampling/sampling_logp_difference/mean": 0.013453003950417042, "step": 499 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 710.0, "completions/max_terminated_length": 710.0, "completions/mean_length": 168.9375, "completions/mean_terminated_length": 168.9375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.7653989251703024, "epoch": 0.49455984174085066, "grad_norm": 2.139798879623413, "kl_approx": 0.2093353271484375, "learning_rate": 1.1974201807022525e-05, "loss": 0.1591, "num_tokens": 12200654.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.209825873374939, "sampling/importance_sampling_ratio/mean": 1.000151515007019, "sampling/importance_sampling_ratio/min": 0.8317741751670837, "sampling/sampling_logp_difference/max": 0.1904764175415039, "sampling/sampling_logp_difference/mean": 0.01350538618862629, "step": 500 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 475.0, "completions/max_terminated_length": 475.0, "completions/mean_length": 190.09375, "completions/mean_terminated_length": 190.09375, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 0.8672705022618175, "epoch": 0.49554896142433236, "grad_norm": 2.0413637161254883, "kl_approx": 0.263885498046875, "learning_rate": 1.1940309304440434e-05, "loss": 0.2042, "num_tokens": 12224833.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.143117070198059, "sampling/importance_sampling_ratio/mean": 0.9998054504394531, "sampling/importance_sampling_ratio/min": 0.7595160603523254, "sampling/sampling_logp_difference/max": 0.275073766708374, "sampling/sampling_logp_difference/mean": 0.014240683987736702, "step": 501 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 374.0, "completions/max_terminated_length": 374.0, "completions/mean_length": 121.03125, "completions/mean_terminated_length": 121.03125, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.90035006031394, "epoch": 0.49653808110781406, "grad_norm": 2.7943289279937744, "kl_approx": 0.299713134765625, "learning_rate": 1.1906393625643244e-05, "loss": 0.2104, "num_tokens": 12250466.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1474802494049072, "sampling/importance_sampling_ratio/mean": 1.000826358795166, "sampling/importance_sampling_ratio/min": 0.8717498183250427, "sampling/sampling_logp_difference/max": 0.13756847381591797, "sampling/sampling_logp_difference/mean": 0.01417754776775837, "step": 502 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 824.0, "completions/mean_length": 311.46875, "completions/mean_terminated_length": 288.4838562011719, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.8034968329593539, "epoch": 0.49752720079129575, "grad_norm": 1.9588907957077026, "kl_approx": 0.2674713134765625, "learning_rate": 1.1872455175740111e-05, "loss": 0.1772, "num_tokens": 12278497.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.17023503780365, "sampling/importance_sampling_ratio/mean": 1.000229001045227, "sampling/importance_sampling_ratio/min": 0.7114703059196472, "sampling/sampling_logp_difference/max": 0.3404216766357422, "sampling/sampling_logp_difference/mean": 0.013028856366872787, "step": 503 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 352.0, "completions/max_terminated_length": 352.0, "completions/mean_length": 89.90625, "completions/mean_terminated_length": 89.90625, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.6363198435865343, "epoch": 0.49851632047477745, "grad_norm": 2.45992112159729, "kl_approx": 0.22910308837890625, "learning_rate": 1.1838494360112185e-05, "loss": 0.168, "num_tokens": 12301950.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1776524782180786, "sampling/importance_sampling_ratio/mean": 1.0003217458724976, "sampling/importance_sampling_ratio/min": 0.8736282587051392, "sampling/sampling_logp_difference/max": 0.16352295875549316, "sampling/sampling_logp_difference/mean": 0.011361422948539257, "step": 504 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 417.0, "completions/max_terminated_length": 417.0, "completions/mean_length": 194.40625, "completions/mean_terminated_length": 194.40625, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.704430004581809, "epoch": 0.49950544015825915, "grad_norm": 2.708407163619995, "kl_approx": 0.2728118896484375, "learning_rate": 1.1804511584407763e-05, "loss": 0.1621, "num_tokens": 12326683.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.160367727279663, "sampling/importance_sampling_ratio/mean": 0.9995272159576416, "sampling/importance_sampling_ratio/min": 0.7814803123474121, "sampling/sampling_logp_difference/max": 0.2465653419494629, "sampling/sampling_logp_difference/mean": 0.01235090009868145, "step": 505 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 680.0, "completions/max_terminated_length": 680.0, "completions/mean_length": 160.15625, "completions/mean_terminated_length": 160.15625, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.5817251987755299, "epoch": 0.5004945598417408, "grad_norm": 2.0164031982421875, "kl_approx": 0.18311309814453125, "learning_rate": 1.1770507254537454e-05, "loss": 0.1566, "num_tokens": 12355912.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1521092653274536, "sampling/importance_sampling_ratio/mean": 0.9999361634254456, "sampling/importance_sampling_ratio/min": 0.8316425085067749, "sampling/sampling_logp_difference/max": 0.18435263633728027, "sampling/sampling_logp_difference/mean": 0.010950235649943352, "step": 506 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 408.0, "completions/max_terminated_length": 408.0, "completions/mean_length": 113.15625, "completions/mean_terminated_length": 113.15625, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.6107124397531152, "epoch": 0.5014836795252225, "grad_norm": 2.747464895248413, "kl_approx": 0.3100128173828125, "learning_rate": 1.1736481776669307e-05, "loss": 0.218, "num_tokens": 12380949.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1997750997543335, "sampling/importance_sampling_ratio/mean": 0.9996851086616516, "sampling/importance_sampling_ratio/min": 0.8100695610046387, "sampling/sampling_logp_difference/max": 0.21063518524169922, "sampling/sampling_logp_difference/mean": 0.01077351812273264, "step": 507 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 278.0, "completions/max_terminated_length": 278.0, "completions/mean_length": 133.1875, "completions/mean_terminated_length": 133.1875, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.7342452825978398, "epoch": 0.5024727992087042, "grad_norm": 1.8328968286514282, "kl_approx": 0.21248626708984375, "learning_rate": 1.1702435557223988e-05, "loss": 0.1581, "num_tokens": 12400339.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1910291910171509, "sampling/importance_sampling_ratio/mean": 0.998977541923523, "sampling/importance_sampling_ratio/min": 0.8032358288764954, "sampling/sampling_logp_difference/max": 0.21910691261291504, "sampling/sampling_logp_difference/mean": 0.012057073414325714, "step": 508 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 586.0, "completions/max_terminated_length": 586.0, "completions/mean_length": 157.53125, "completions/mean_terminated_length": 157.53125, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.9037866126745939, "epoch": 0.503461918892186, "grad_norm": 2.9430649280548096, "kl_approx": 0.380340576171875, "learning_rate": 1.1668369002869912e-05, "loss": 0.2479, "num_tokens": 12424388.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1598294973373413, "sampling/importance_sampling_ratio/mean": 0.9996340274810791, "sampling/importance_sampling_ratio/min": 0.8519041538238525, "sampling/sampling_logp_difference/max": 0.16028118133544922, "sampling/sampling_logp_difference/mean": 0.01412997767329216, "step": 509 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 557.0, "completions/max_terminated_length": 557.0, "completions/mean_length": 133.875, "completions/mean_terminated_length": 133.875, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.8118986450135708, "epoch": 0.5044510385756676, "grad_norm": 2.5637435913085938, "kl_approx": 0.2989654541015625, "learning_rate": 1.1634282520518382e-05, "loss": 0.1868, "num_tokens": 12450672.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.219810128211975, "sampling/importance_sampling_ratio/mean": 1.0000405311584473, "sampling/importance_sampling_ratio/min": 0.8243248462677002, "sampling/sampling_logp_difference/max": 0.19869518280029297, "sampling/sampling_logp_difference/mean": 0.014685528352856636, "step": 510 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 211.0, "completions/max_terminated_length": 211.0, "completions/mean_length": 78.6875, "completions/mean_terminated_length": 78.6875, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.6592349060811102, "epoch": 0.5054401582591493, "grad_norm": 2.48930025100708, "kl_approx": 0.25049591064453125, "learning_rate": 1.1600176517318742e-05, "loss": 0.1691, "num_tokens": 12468270.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.147716999053955, "sampling/importance_sampling_ratio/mean": 1.0001978874206543, "sampling/importance_sampling_ratio/min": 0.8280651569366455, "sampling/sampling_logp_difference/max": 0.18866348266601562, "sampling/sampling_logp_difference/mean": 0.011942204087972641, "step": 511 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 882.0, "completions/mean_length": 283.59375, "completions/mean_terminated_length": 259.70965576171875, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "entropy": 0.9356537871062756, "epoch": 0.506429277942631, "grad_norm": 2.7184126377105713, "kl_approx": 0.3289794921875, "learning_rate": 1.1566051400653486e-05, "loss": 0.2645, "num_tokens": 12495305.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2749394178390503, "sampling/importance_sampling_ratio/mean": 0.9996834993362427, "sampling/importance_sampling_ratio/min": 0.79697585105896, "sampling/sampling_logp_difference/max": 0.24289870262145996, "sampling/sampling_logp_difference/mean": 0.013683128170669079, "step": 512 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 192.0, "completions/max_terminated_length": 192.0, "completions/mean_length": 109.40625, "completions/mean_terminated_length": 109.40625, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7161548342555761, "epoch": 0.5074183976261127, "grad_norm": 3.0182697772979736, "kl_approx": 0.27059173583984375, "learning_rate": 1.153190757813343e-05, "loss": 0.2047, "num_tokens": 12515662.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.161309838294983, "sampling/importance_sampling_ratio/mean": 0.9998782277107239, "sampling/importance_sampling_ratio/min": 0.8189831376075745, "sampling/sampling_logp_difference/max": 0.1996917724609375, "sampling/sampling_logp_difference/mean": 0.012084068730473518, "step": 513 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 388.0, "completions/max_terminated_length": 388.0, "completions/mean_length": 100.09375, "completions/mean_terminated_length": 100.09375, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.5308846342377365, "epoch": 0.5084075173095944, "grad_norm": 2.447960138320923, "kl_approx": 0.18387794494628906, "learning_rate": 1.1497745457592817e-05, "loss": 0.1568, "num_tokens": 12534681.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.216435432434082, "sampling/importance_sampling_ratio/mean": 0.999959409236908, "sampling/importance_sampling_ratio/min": 0.8455092310905457, "sampling/sampling_logp_difference/max": 0.1959247589111328, "sampling/sampling_logp_difference/mean": 0.012862658128142357, "step": 514 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 196.0, "completions/max_terminated_length": 196.0, "completions/mean_length": 85.1875, "completions/mean_terminated_length": 85.1875, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.4533740635961294, "epoch": 0.5093966369930761, "grad_norm": 1.9144502878189087, "kl_approx": 0.16045761108398438, "learning_rate": 1.1463565447084446e-05, "loss": 0.1138, "num_tokens": 12559199.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.137015700340271, "sampling/importance_sampling_ratio/mean": 0.9999536275863647, "sampling/importance_sampling_ratio/min": 0.8335487246513367, "sampling/sampling_logp_difference/max": 0.18206310272216797, "sampling/sampling_logp_difference/mean": 0.008772806264460087, "step": 515 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 421.0, "completions/max_terminated_length": 421.0, "completions/mean_length": 158.75, "completions/mean_terminated_length": 158.75, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.6816507941111922, "epoch": 0.5103857566765578, "grad_norm": 2.5376627445220947, "kl_approx": 0.2677764892578125, "learning_rate": 1.142936795487482e-05, "loss": 0.1879, "num_tokens": 12582015.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1776033639907837, "sampling/importance_sampling_ratio/mean": 0.9999154210090637, "sampling/importance_sampling_ratio/min": 0.8420298099517822, "sampling/sampling_logp_difference/max": 0.17193984985351562, "sampling/sampling_logp_difference/mean": 0.012688749469816685, "step": 516 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 917.0, "completions/max_terminated_length": 917.0, "completions/mean_length": 228.15625, "completions/mean_terminated_length": 228.15625, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.9691324178129435, "epoch": 0.5113748763600395, "grad_norm": 2.973435878753662, "kl_approx": 0.307891845703125, "learning_rate": 1.1395153389439232e-05, "loss": 0.2255, "num_tokens": 12610388.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1938644647598267, "sampling/importance_sampling_ratio/mean": 1.0005204677581787, "sampling/importance_sampling_ratio/min": 0.7905229330062866, "sampling/sampling_logp_difference/max": 0.2350606918334961, "sampling/sampling_logp_difference/mean": 0.014579618349671364, "step": 517 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 779.0, "completions/max_terminated_length": 779.0, "completions/mean_length": 134.03125, "completions/mean_terminated_length": 134.03125, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7840595333836973, "epoch": 0.5123639960435212, "grad_norm": 2.4768569469451904, "kl_approx": 0.2955169677734375, "learning_rate": 1.1360922159456929e-05, "loss": 0.1818, "num_tokens": 12633093.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2627761363983154, "sampling/importance_sampling_ratio/mean": 0.9999808669090271, "sampling/importance_sampling_ratio/min": 0.8477106690406799, "sampling/sampling_logp_difference/max": 0.23331260681152344, "sampling/sampling_logp_difference/mean": 0.01378414873033762, "step": 518 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 729.0, "completions/max_terminated_length": 729.0, "completions/mean_length": 149.65625, "completions/mean_terminated_length": 149.65625, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.6159323621541262, "epoch": 0.5133531157270029, "grad_norm": 2.5741939544677734, "kl_approx": 0.24555206298828125, "learning_rate": 1.1326674673806195e-05, "loss": 0.1722, "num_tokens": 12659050.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1771801710128784, "sampling/importance_sampling_ratio/mean": 0.9996636509895325, "sampling/importance_sampling_ratio/min": 0.8007664084434509, "sampling/sampling_logp_difference/max": 0.22218608856201172, "sampling/sampling_logp_difference/mean": 0.012063074856996536, "step": 519 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 674.0, "completions/max_terminated_length": 674.0, "completions/mean_length": 243.09375, "completions/mean_terminated_length": 243.09375, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 1.2118691969662905, "epoch": 0.5143422354104846, "grad_norm": 2.476936101913452, "kl_approx": 0.36834716796875, "learning_rate": 1.129241134155949e-05, "loss": 0.2583, "num_tokens": 12685357.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1948634386062622, "sampling/importance_sampling_ratio/mean": 0.9998326301574707, "sampling/importance_sampling_ratio/min": 0.8201776742935181, "sampling/sampling_logp_difference/max": 0.19823431968688965, "sampling/sampling_logp_difference/mean": 0.018054174259305, "step": 520 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 996.0, "completions/max_terminated_length": 996.0, "completions/mean_length": 299.5625, "completions/mean_terminated_length": 299.5625, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.7339970853645355, "epoch": 0.5153313550939663, "grad_norm": 1.9377232789993286, "kl_approx": 0.19956207275390625, "learning_rate": 1.1258132571978555e-05, "loss": 0.1438, "num_tokens": 12712471.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2195934057235718, "sampling/importance_sampling_ratio/mean": 1.0001786947250366, "sampling/importance_sampling_ratio/min": 0.8313595056533813, "sampling/sampling_logp_difference/max": 0.1985175609588623, "sampling/sampling_logp_difference/mean": 0.012365547940135002, "step": 521 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 719.0, "completions/max_terminated_length": 719.0, "completions/mean_length": 217.0, "completions/mean_terminated_length": 217.0, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.897117973305285, "epoch": 0.516320474777448, "grad_norm": 3.042849540710449, "kl_approx": 0.27941131591796875, "learning_rate": 1.1223838774509515e-05, "loss": 0.2592, "num_tokens": 12741135.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1974363327026367, "sampling/importance_sampling_ratio/mean": 0.9999440908432007, "sampling/importance_sampling_ratio/min": 0.8141491413116455, "sampling/sampling_logp_difference/max": 0.2056117057800293, "sampling/sampling_logp_difference/mean": 0.015433569438755512, "step": 522 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 380.0, "completions/max_terminated_length": 380.0, "completions/mean_length": 149.25, "completions/mean_terminated_length": 149.25, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.607160754268989, "epoch": 0.5173095944609297, "grad_norm": 1.9953347444534302, "kl_approx": 0.216705322265625, "learning_rate": 1.1189530358778005e-05, "loss": 0.1674, "num_tokens": 12769999.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.424963355064392, "sampling/importance_sampling_ratio/mean": 1.0006740093231201, "sampling/importance_sampling_ratio/min": 0.8469498157501221, "sampling/sampling_logp_difference/max": 0.35414600372314453, "sampling/sampling_logp_difference/mean": 0.011775365099310875, "step": 523 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 561.0, "completions/max_terminated_length": 561.0, "completions/mean_length": 238.84375, "completions/mean_terminated_length": 238.84375, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.9253643583506346, "epoch": 0.5182987141444114, "grad_norm": 2.350925922393799, "kl_approx": 0.2970123291015625, "learning_rate": 1.1155207734584264e-05, "loss": 0.2326, "num_tokens": 12797370.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.264960765838623, "sampling/importance_sampling_ratio/mean": 0.9999508261680603, "sampling/importance_sampling_ratio/min": 0.8018354177474976, "sampling/sampling_logp_difference/max": 0.23504114151000977, "sampling/sampling_logp_difference/mean": 0.014885930344462395, "step": 524 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 853.0, "completions/max_terminated_length": 853.0, "completions/mean_length": 208.15625, "completions/mean_terminated_length": 208.15625, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.6011252603493631, "epoch": 0.5192878338278932, "grad_norm": 2.1081831455230713, "kl_approx": 0.2074565887451172, "learning_rate": 1.1120871311898254e-05, "loss": 0.1569, "num_tokens": 12828183.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2956650257110596, "sampling/importance_sampling_ratio/mean": 0.9994739890098572, "sampling/importance_sampling_ratio/min": 0.7993049025535583, "sampling/sampling_logp_difference/max": 0.25902414321899414, "sampling/sampling_logp_difference/mean": 0.011467074044048786, "step": 525 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 487.0, "completions/max_terminated_length": 487.0, "completions/mean_length": 184.25, "completions/mean_terminated_length": 184.25, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.8990917131304741, "epoch": 0.5202769535113749, "grad_norm": 4.79525899887085, "kl_approx": 0.2791290283203125, "learning_rate": 1.1086521500854746e-05, "loss": 0.2274, "num_tokens": 12852223.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.211777925491333, "sampling/importance_sampling_ratio/mean": 0.9997694492340088, "sampling/importance_sampling_ratio/min": 0.8363015651702881, "sampling/sampling_logp_difference/max": 0.19208860397338867, "sampling/sampling_logp_difference/mean": 0.013204740360379219, "step": 526 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 339.0, "completions/max_terminated_length": 339.0, "completions/mean_length": 127.25, "completions/mean_terminated_length": 127.25, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.7359980153851211, "epoch": 0.5212660731948566, "grad_norm": 3.008983612060547, "kl_approx": 0.2646331787109375, "learning_rate": 1.1052158711748435e-05, "loss": 0.1911, "num_tokens": 12877351.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1988524198532104, "sampling/importance_sampling_ratio/mean": 1.0001829862594604, "sampling/importance_sampling_ratio/min": 0.8280225396156311, "sampling/sampling_logp_difference/max": 0.18871498107910156, "sampling/sampling_logp_difference/mean": 0.012002941220998764, "step": 527 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 558.0, "completions/max_terminated_length": 558.0, "completions/mean_length": 145.375, "completions/mean_terminated_length": 145.375, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.7454347386956215, "epoch": 0.5222551928783383, "grad_norm": 1.8878477811813354, "kl_approx": 0.1988983154296875, "learning_rate": 1.1017783355029027e-05, "loss": 0.1477, "num_tokens": 12900211.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1521844863891602, "sampling/importance_sampling_ratio/mean": 1.0003618001937866, "sampling/importance_sampling_ratio/min": 0.7598314881324768, "sampling/sampling_logp_difference/max": 0.27465856075286865, "sampling/sampling_logp_difference/mean": 0.012439663521945477, "step": 528 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 434.0, "completions/max_terminated_length": 434.0, "completions/mean_length": 108.9375, "completions/mean_terminated_length": 108.9375, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.8261841339990497, "epoch": 0.52324431256182, "grad_norm": 2.46884822845459, "kl_approx": 0.31139373779296875, "learning_rate": 1.0983395841296349e-05, "loss": 0.1932, "num_tokens": 12920489.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1546142101287842, "sampling/importance_sampling_ratio/mean": 0.9999147653579712, "sampling/importance_sampling_ratio/min": 0.7865462899208069, "sampling/sampling_logp_difference/max": 0.24010372161865234, "sampling/sampling_logp_difference/mean": 0.014193383045494556, "step": 529 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 883.0, "completions/max_terminated_length": 883.0, "completions/mean_length": 270.03125, "completions/mean_terminated_length": 270.03125, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.8456284645944834, "epoch": 0.5242334322453017, "grad_norm": 1.7483576536178589, "kl_approx": 0.2501220703125, "learning_rate": 1.0948996581295437e-05, "loss": 0.1617, "num_tokens": 12953962.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.210300087928772, "sampling/importance_sampling_ratio/mean": 0.9996737241744995, "sampling/importance_sampling_ratio/min": 0.7761437892913818, "sampling/sampling_logp_difference/max": 0.2534174919128418, "sampling/sampling_logp_difference/mean": 0.014064054004848003, "step": 530 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 989.0, "completions/max_terminated_length": 989.0, "completions/mean_length": 220.375, "completions/mean_terminated_length": 220.375, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.784599837847054, "epoch": 0.5252225519287834, "grad_norm": 1.8482197523117065, "kl_approx": 0.25189208984375, "learning_rate": 1.0914585985911632e-05, "loss": 0.1679, "num_tokens": 12977038.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3099368810653687, "sampling/importance_sampling_ratio/mean": 1.0004547834396362, "sampling/importance_sampling_ratio/min": 0.6934783458709717, "sampling/sampling_logp_difference/max": 0.36603522300720215, "sampling/sampling_logp_difference/mean": 0.012107820250093937, "step": 531 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 753.0, "completions/max_terminated_length": 753.0, "completions/mean_length": 190.15625, "completions/mean_terminated_length": 190.15625, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.9207656439393759, "epoch": 0.5262116716122651, "grad_norm": 2.719179153442383, "kl_approx": 0.366943359375, "learning_rate": 1.0880164466165675e-05, "loss": 0.2622, "num_tokens": 13004507.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1760858297348022, "sampling/importance_sampling_ratio/mean": 1.0004504919052124, "sampling/importance_sampling_ratio/min": 0.8107442855834961, "sampling/sampling_logp_difference/max": 0.20980262756347656, "sampling/sampling_logp_difference/mean": 0.013713744468986988, "step": 532 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 245.0, "completions/max_terminated_length": 245.0, "completions/mean_length": 104.15625, "completions/mean_terminated_length": 104.15625, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.6546806134283543, "epoch": 0.5272007912957468, "grad_norm": 2.146021842956543, "kl_approx": 0.250732421875, "learning_rate": 1.084573243320878e-05, "loss": 0.1849, "num_tokens": 13022312.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2024013996124268, "sampling/importance_sampling_ratio/mean": 1.0007328987121582, "sampling/importance_sampling_ratio/min": 0.8877179026603699, "sampling/sampling_logp_difference/max": 0.18432068824768066, "sampling/sampling_logp_difference/mean": 0.011911842040717602, "step": 533 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 723.0, "completions/max_terminated_length": 723.0, "completions/mean_length": 175.5, "completions/mean_terminated_length": 175.5, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.8138238973915577, "epoch": 0.5281899109792285, "grad_norm": 2.4160804748535156, "kl_approx": 0.290985107421875, "learning_rate": 1.0811290298317755e-05, "loss": 0.1874, "num_tokens": 13046712.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1957446336746216, "sampling/importance_sampling_ratio/mean": 1.000277042388916, "sampling/importance_sampling_ratio/min": 0.8616725206375122, "sampling/sampling_logp_difference/max": 0.17876911163330078, "sampling/sampling_logp_difference/mean": 0.013558941893279552, "step": 534 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 393.0, "completions/max_terminated_length": 393.0, "completions/mean_length": 104.65625, "completions/mean_terminated_length": 104.65625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6136966240592301, "epoch": 0.5291790306627102, "grad_norm": 2.569730281829834, "kl_approx": 0.267120361328125, "learning_rate": 1.0776838472890065e-05, "loss": 0.1695, "num_tokens": 13073765.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2006375789642334, "sampling/importance_sampling_ratio/mean": 0.999291718006134, "sampling/importance_sampling_ratio/min": 0.8765637874603271, "sampling/sampling_logp_difference/max": 0.18285274505615234, "sampling/sampling_logp_difference/mean": 0.010639000684022903, "step": 535 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 321.0, "completions/max_terminated_length": 321.0, "completions/mean_length": 113.25, "completions/mean_terminated_length": 113.25, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.5336812366731465, "epoch": 0.5301681503461919, "grad_norm": 2.468287944793701, "kl_approx": 0.2460184097290039, "learning_rate": 1.0742377368438915e-05, "loss": 0.1608, "num_tokens": 13094261.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.157801628112793, "sampling/importance_sampling_ratio/mean": 0.9998342990875244, "sampling/importance_sampling_ratio/min": 0.7919701933860779, "sampling/sampling_logp_difference/max": 0.2332315444946289, "sampling/sampling_logp_difference/mean": 0.00952450092881918, "step": 536 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 687.0, "completions/max_terminated_length": 687.0, "completions/mean_length": 198.25, "completions/mean_terminated_length": 198.25, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.6416675809305161, "epoch": 0.5311572700296736, "grad_norm": 1.5023856163024902, "kl_approx": 0.19754600524902344, "learning_rate": 1.0707907396588362e-05, "loss": 0.1177, "num_tokens": 13123941.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1569699048995972, "sampling/importance_sampling_ratio/mean": 0.9997815489768982, "sampling/importance_sampling_ratio/min": 0.8081605434417725, "sampling/sampling_logp_difference/max": 0.21299457550048828, "sampling/sampling_logp_difference/mean": 0.011573621071875095, "step": 537 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 763.0, "completions/max_terminated_length": 763.0, "completions/mean_length": 181.34375, "completions/mean_terminated_length": 181.34375, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.6683570267632604, "epoch": 0.5321463897131553, "grad_norm": 1.9734994173049927, "kl_approx": 0.24599838256835938, "learning_rate": 1.0673428969068365e-05, "loss": 0.1479, "num_tokens": 13149832.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1960986852645874, "sampling/importance_sampling_ratio/mean": 0.9999009966850281, "sampling/importance_sampling_ratio/min": 0.7970805764198303, "sampling/sampling_logp_difference/max": 0.22679948806762695, "sampling/sampling_logp_difference/mean": 0.011178126558661461, "step": 538 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 836.0, "completions/max_terminated_length": 836.0, "completions/mean_length": 190.71875, "completions/mean_terminated_length": 190.71875, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.6605275929905474, "epoch": 0.533135509396637, "grad_norm": 2.0571987628936768, "kl_approx": 0.23212432861328125, "learning_rate": 1.063894249770989e-05, "loss": 0.1823, "num_tokens": 13171007.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.20941162109375, "sampling/importance_sampling_ratio/mean": 0.9997227787971497, "sampling/importance_sampling_ratio/min": 0.7948904037475586, "sampling/sampling_logp_difference/max": 0.22955107688903809, "sampling/sampling_logp_difference/mean": 0.01257468480616808, "step": 539 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 601.0, "completions/max_terminated_length": 601.0, "completions/mean_length": 148.65625, "completions/mean_terminated_length": 148.65625, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.8141849329695106, "epoch": 0.5341246290801187, "grad_norm": 2.5650322437286377, "kl_approx": 0.311309814453125, "learning_rate": 1.0604448394439983e-05, "loss": 0.2137, "num_tokens": 13199276.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1433823108673096, "sampling/importance_sampling_ratio/mean": 1.0002450942993164, "sampling/importance_sampling_ratio/min": 0.8214309215545654, "sampling/sampling_logp_difference/max": 0.19670748710632324, "sampling/sampling_logp_difference/mean": 0.012662006542086601, "step": 540 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 754.0, "completions/max_terminated_length": 754.0, "completions/mean_length": 135.96875, "completions/mean_terminated_length": 135.96875, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.6275505926460028, "epoch": 0.5351137487636004, "grad_norm": 1.919782280921936, "kl_approx": 0.19045257568359375, "learning_rate": 1.0569947071276847e-05, "loss": 0.1359, "num_tokens": 13219603.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1975704431533813, "sampling/importance_sampling_ratio/mean": 1.0000134706497192, "sampling/importance_sampling_ratio/min": 0.8565528392791748, "sampling/sampling_logp_difference/max": 0.18029487133026123, "sampling/sampling_logp_difference/mean": 0.010607928968966007, "step": 541 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 617.0, "completions/max_terminated_length": 617.0, "completions/mean_length": 229.46875, "completions/mean_terminated_length": 229.46875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.7088351622223854, "epoch": 0.5361028684470821, "grad_norm": 2.401744842529297, "kl_approx": 0.24138641357421875, "learning_rate": 1.053543894032493e-05, "loss": 0.1555, "num_tokens": 13247106.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2131625413894653, "sampling/importance_sampling_ratio/mean": 1.0000585317611694, "sampling/importance_sampling_ratio/min": 0.6056843996047974, "sampling/sampling_logp_difference/max": 0.5013961791992188, "sampling/sampling_logp_difference/mean": 0.012305930256843567, "step": 542 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 286.0, "completions/max_terminated_length": 286.0, "completions/mean_length": 85.875, "completions/mean_terminated_length": 85.875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6054016347043216, "epoch": 0.5370919881305638, "grad_norm": 2.0726077556610107, "kl_approx": 0.21767044067382812, "learning_rate": 1.0500924413769988e-05, "loss": 0.145, "num_tokens": 13272694.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.401321530342102, "sampling/importance_sampling_ratio/mean": 0.999510645866394, "sampling/importance_sampling_ratio/min": 0.8379195928573608, "sampling/sampling_logp_difference/max": 0.3374156951904297, "sampling/sampling_logp_difference/mean": 0.010525867342948914, "step": 543 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 397.0, "completions/max_terminated_length": 397.0, "completions/mean_length": 115.90625, "completions/mean_terminated_length": 115.90625, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.6335243210196495, "epoch": 0.5380811078140455, "grad_norm": 2.823331356048584, "kl_approx": 0.25815582275390625, "learning_rate": 1.0466403903874176e-05, "loss": 0.1935, "num_tokens": 13295283.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.214028000831604, "sampling/importance_sampling_ratio/mean": 0.9996069669723511, "sampling/importance_sampling_ratio/min": 0.8283621668815613, "sampling/sampling_logp_difference/max": 0.19394373893737793, "sampling/sampling_logp_difference/mean": 0.011104457080364227, "step": 544 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 592.0, "completions/max_terminated_length": 592.0, "completions/mean_length": 225.8125, "completions/mean_terminated_length": 225.8125, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.8708654092624784, "epoch": 0.5390702274975272, "grad_norm": 2.0751147270202637, "kl_approx": 0.3016815185546875, "learning_rate": 1.0431877822971118e-05, "loss": 0.2018, "num_tokens": 13319197.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.241080641746521, "sampling/importance_sampling_ratio/mean": 0.9996857643127441, "sampling/importance_sampling_ratio/min": 0.841336727142334, "sampling/sampling_logp_difference/max": 0.21598243713378906, "sampling/sampling_logp_difference/mean": 0.014206042513251305, "step": 545 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 655.0, "completions/mean_length": 274.5625, "completions/mean_terminated_length": 250.3870849609375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.5997446840628982, "epoch": 0.5400593471810089, "grad_norm": 1.788106083869934, "kl_approx": 0.2322978973388672, "learning_rate": 1.0397346583460972e-05, "loss": 0.1509, "num_tokens": 13348639.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2175791263580322, "sampling/importance_sampling_ratio/mean": 0.9997416734695435, "sampling/importance_sampling_ratio/min": 0.7925688028335571, "sampling/sampling_logp_difference/max": 0.23247599601745605, "sampling/sampling_logp_difference/mean": 0.010569741949439049, "step": 546 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 775.0, "completions/max_terminated_length": 775.0, "completions/mean_length": 273.71875, "completions/mean_terminated_length": 273.71875, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.8644923474639654, "epoch": 0.5410484668644906, "grad_norm": 1.7865458726882935, "kl_approx": 0.243255615234375, "learning_rate": 1.0362810597805526e-05, "loss": 0.1686, "num_tokens": 13379006.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2158172130584717, "sampling/importance_sampling_ratio/mean": 0.9994689226150513, "sampling/importance_sampling_ratio/min": 0.8082884550094604, "sampling/sampling_logp_difference/max": 0.21283626556396484, "sampling/sampling_logp_difference/mean": 0.013766334392130375, "step": 547 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 654.0, "completions/max_terminated_length": 654.0, "completions/mean_length": 133.15625, "completions/mean_terminated_length": 133.15625, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.8283205274492502, "epoch": 0.5420375865479723, "grad_norm": 3.7182350158691406, "kl_approx": 0.3259735107421875, "learning_rate": 1.0328270278523256e-05, "loss": 0.2668, "num_tokens": 13403419.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2158206701278687, "sampling/importance_sampling_ratio/mean": 1.0003284215927124, "sampling/importance_sampling_ratio/min": 0.7851002216339111, "sampling/sampling_logp_difference/max": 0.2419438362121582, "sampling/sampling_logp_difference/mean": 0.013040314428508282, "step": 548 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 451.0, "completions/max_terminated_length": 451.0, "completions/mean_length": 119.625, "completions/mean_terminated_length": 119.625, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.6369516151025891, "epoch": 0.543026706231454, "grad_norm": 2.802205801010132, "kl_approx": 0.3096199035644531, "learning_rate": 1.0293726038184393e-05, "loss": 0.1631, "num_tokens": 13428239.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1779037714004517, "sampling/importance_sampling_ratio/mean": 0.9998703002929688, "sampling/importance_sampling_ratio/min": 0.8283510804176331, "sampling/sampling_logp_difference/max": 0.18831825256347656, "sampling/sampling_logp_difference/mean": 0.012148821726441383, "step": 549 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 369.0, "completions/max_terminated_length": 369.0, "completions/mean_length": 127.96875, "completions/mean_terminated_length": 127.96875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6454756995663047, "epoch": 0.5440158259149357, "grad_norm": 3.1012582778930664, "kl_approx": 0.2578887939453125, "learning_rate": 1.0259178289406011e-05, "loss": 0.2063, "num_tokens": 13449958.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1590629816055298, "sampling/importance_sampling_ratio/mean": 1.0001226663589478, "sampling/importance_sampling_ratio/min": 0.8165966272354126, "sampling/sampling_logp_difference/max": 0.20261001586914062, "sampling/sampling_logp_difference/mean": 0.012168978340923786, "step": 550 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 422.0, "completions/max_terminated_length": 422.0, "completions/mean_length": 152.03125, "completions/mean_terminated_length": 152.03125, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.868612689897418, "epoch": 0.5450049455984174, "grad_norm": 2.3995816707611084, "kl_approx": 0.31829071044921875, "learning_rate": 1.022462744484709e-05, "loss": 0.2483, "num_tokens": 13475815.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1502256393432617, "sampling/importance_sampling_ratio/mean": 1.0003679990768433, "sampling/importance_sampling_ratio/min": 0.8377214670181274, "sampling/sampling_logp_difference/max": 0.17706966400146484, "sampling/sampling_logp_difference/mean": 0.01581818051636219, "step": 551 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 343.0, "completions/max_terminated_length": 343.0, "completions/mean_length": 120.6875, "completions/mean_terminated_length": 120.6875, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.6159464968368411, "epoch": 0.5459940652818991, "grad_norm": 1.9189927577972412, "kl_approx": 0.18660783767700195, "learning_rate": 1.019007391720359e-05, "loss": 0.1295, "num_tokens": 13494781.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1974093914031982, "sampling/importance_sampling_ratio/mean": 1.0000790357589722, "sampling/importance_sampling_ratio/min": 0.8152811527252197, "sampling/sampling_logp_difference/max": 0.2042222023010254, "sampling/sampling_logp_difference/mean": 0.011646861210465431, "step": 552 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 270.0, "completions/max_terminated_length": 270.0, "completions/mean_length": 106.96875, "completions/mean_terminated_length": 106.96875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.6926449676975608, "epoch": 0.5469831849653808, "grad_norm": 1.953474521636963, "kl_approx": 0.18581390380859375, "learning_rate": 1.0155518119203511e-05, "loss": 0.1553, "num_tokens": 13509716.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1456905603408813, "sampling/importance_sampling_ratio/mean": 1.0003317594528198, "sampling/importance_sampling_ratio/min": 0.8305702805519104, "sampling/sampling_logp_difference/max": 0.18564271926879883, "sampling/sampling_logp_difference/mean": 0.012060423381626606, "step": 553 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 752.0, "completions/max_terminated_length": 752.0, "completions/mean_length": 205.71875, "completions/mean_terminated_length": 205.71875, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.9005204602144659, "epoch": 0.5479723046488625, "grad_norm": 1.7741397619247437, "kl_approx": 0.22491455078125, "learning_rate": 1.0120960463601977e-05, "loss": 0.1811, "num_tokens": 13532419.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2212650775909424, "sampling/importance_sampling_ratio/mean": 1.000502109527588, "sampling/importance_sampling_ratio/min": 0.8692787885665894, "sampling/sampling_logp_difference/max": 0.19988727569580078, "sampling/sampling_logp_difference/mean": 0.015173102729022503, "step": 554 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 596.0, "completions/max_terminated_length": 596.0, "completions/mean_length": 216.8125, "completions/mean_terminated_length": 216.8125, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.8543767658993602, "epoch": 0.5489614243323442, "grad_norm": 2.688417673110962, "kl_approx": 0.2736663818359375, "learning_rate": 1.0086401363176306e-05, "loss": 0.1614, "num_tokens": 13561149.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2702866792678833, "sampling/importance_sampling_ratio/mean": 1.000032901763916, "sampling/importance_sampling_ratio/min": 0.8204344511032104, "sampling/sampling_logp_difference/max": 0.2392425537109375, "sampling/sampling_logp_difference/mean": 0.014095819555222988, "step": 555 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 458.0, "completions/max_terminated_length": 458.0, "completions/mean_length": 171.21875, "completions/mean_terminated_length": 171.21875, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.923456615768373, "epoch": 0.5499505440158259, "grad_norm": 2.537172317504883, "kl_approx": 0.2747955322265625, "learning_rate": 1.0051841230721065e-05, "loss": 0.2019, "num_tokens": 13585204.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1474788188934326, "sampling/importance_sampling_ratio/mean": 1.0003242492675781, "sampling/importance_sampling_ratio/min": 0.8231080174446106, "sampling/sampling_logp_difference/max": 0.19466781616210938, "sampling/sampling_logp_difference/mean": 0.013980982825160027, "step": 556 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 1008.0, "completions/max_terminated_length": 1008.0, "completions/mean_length": 276.84375, "completions/mean_terminated_length": 276.84375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.939146138727665, "epoch": 0.5509396636993076, "grad_norm": 2.6079609394073486, "kl_approx": 0.29965972900390625, "learning_rate": 1.0017280479043148e-05, "loss": 0.2236, "num_tokens": 13612023.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.5346375703811646, "sampling/importance_sampling_ratio/mean": 0.9997570514678955, "sampling/importance_sampling_ratio/min": 0.7705449461936951, "sampling/sampling_logp_difference/max": 0.42829418182373047, "sampling/sampling_logp_difference/mean": 0.0160658061504364, "step": 557 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 982.0, "completions/max_terminated_length": 982.0, "completions/mean_length": 343.96875, "completions/mean_terminated_length": 343.96875, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.9694831175729632, "epoch": 0.5519287833827893, "grad_norm": 2.454521417617798, "kl_approx": 0.30999755859375, "learning_rate": 9.982719520956856e-06, "loss": 0.2311, "num_tokens": 13650094.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.22684907913208, "sampling/importance_sampling_ratio/mean": 0.9998013973236084, "sampling/importance_sampling_ratio/min": 0.7781987190246582, "sampling/sampling_logp_difference/max": 0.25077342987060547, "sampling/sampling_logp_difference/mean": 0.013767809607088566, "step": 558 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 736.0, "completions/max_terminated_length": 736.0, "completions/mean_length": 158.84375, "completions/mean_terminated_length": 158.84375, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7368582393974066, "epoch": 0.552917903066271, "grad_norm": 2.5576822757720947, "kl_approx": 0.2505683898925781, "learning_rate": 9.948158769278939e-06, "loss": 0.1861, "num_tokens": 13675921.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1952998638153076, "sampling/importance_sampling_ratio/mean": 1.000278115272522, "sampling/importance_sampling_ratio/min": 0.8316518068313599, "sampling/sampling_logp_difference/max": 0.1843414306640625, "sampling/sampling_logp_difference/mean": 0.011753794737160206, "step": 559 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 239.0, "completions/max_terminated_length": 239.0, "completions/mean_length": 82.34375, "completions/mean_terminated_length": 82.34375, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.5959591753780842, "epoch": 0.5539070227497527, "grad_norm": 2.3575446605682373, "kl_approx": 0.24103546142578125, "learning_rate": 9.913598636823694e-06, "loss": 0.1582, "num_tokens": 13699796.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1310738325119019, "sampling/importance_sampling_ratio/mean": 1.000821828842163, "sampling/importance_sampling_ratio/min": 0.8746911883354187, "sampling/sampling_logp_difference/max": 0.13388442993164062, "sampling/sampling_logp_difference/mean": 0.010298928245902061, "step": 560 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 556.0, "completions/max_terminated_length": 556.0, "completions/mean_length": 122.125, "completions/mean_terminated_length": 122.125, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.5916219959035516, "epoch": 0.5548961424332344, "grad_norm": 2.039127826690674, "kl_approx": 0.19291305541992188, "learning_rate": 9.879039536398023e-06, "loss": 0.1381, "num_tokens": 13721504.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1846457719802856, "sampling/importance_sampling_ratio/mean": 0.9994524717330933, "sampling/importance_sampling_ratio/min": 0.8248910903930664, "sampling/sampling_logp_difference/max": 0.1925039291381836, "sampling/sampling_logp_difference/mean": 0.011657710187137127, "step": 561 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 663.0, "completions/max_terminated_length": 663.0, "completions/mean_length": 188.5, "completions/mean_terminated_length": 188.5, "completions/min_length": 29.0, "completions/min_terminated_length": 29.0, "entropy": 0.7313458528369665, "epoch": 0.5558852621167161, "grad_norm": 2.1180808544158936, "kl_approx": 0.27692413330078125, "learning_rate": 9.844481880796492e-06, "loss": 0.1925, "num_tokens": 13746712.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2408548593521118, "sampling/importance_sampling_ratio/mean": 0.999958872795105, "sampling/importance_sampling_ratio/min": 0.8569334149360657, "sampling/sampling_logp_difference/max": 0.21580052375793457, "sampling/sampling_logp_difference/mean": 0.012899751774966717, "step": 562 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 363.0, "completions/max_terminated_length": 363.0, "completions/mean_length": 178.8125, "completions/mean_terminated_length": 178.8125, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.70441566221416, "epoch": 0.5568743818001978, "grad_norm": 2.0940163135528564, "kl_approx": 0.2711944580078125, "learning_rate": 9.809926082796415e-06, "loss": 0.1793, "num_tokens": 13775482.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1977062225341797, "sampling/importance_sampling_ratio/mean": 0.9999896287918091, "sampling/importance_sampling_ratio/min": 0.7922054529190063, "sampling/sampling_logp_difference/max": 0.23293447494506836, "sampling/sampling_logp_difference/mean": 0.012182281352579594, "step": 563 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 339.0, "completions/max_terminated_length": 339.0, "completions/mean_length": 134.6875, "completions/mean_terminated_length": 134.6875, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.6279165195301175, "epoch": 0.5578635014836796, "grad_norm": 2.255629777908325, "kl_approx": 0.23474884033203125, "learning_rate": 9.775372555152912e-06, "loss": 0.1784, "num_tokens": 13799792.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1461809873580933, "sampling/importance_sampling_ratio/mean": 0.9997854232788086, "sampling/importance_sampling_ratio/min": 0.8234056234359741, "sampling/sampling_logp_difference/max": 0.1943063735961914, "sampling/sampling_logp_difference/mean": 0.011648024432361126, "step": 564 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 604.0, "completions/max_terminated_length": 604.0, "completions/mean_length": 180.96875, "completions/mean_terminated_length": 180.96875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6675196294672787, "epoch": 0.5588526211671613, "grad_norm": 1.6395410299301147, "kl_approx": 0.26698875427246094, "learning_rate": 9.740821710593989e-06, "loss": 0.1613, "num_tokens": 13826375.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2310372591018677, "sampling/importance_sampling_ratio/mean": 0.999835729598999, "sampling/importance_sampling_ratio/min": 0.7832280397415161, "sampling/sampling_logp_difference/max": 0.24433135986328125, "sampling/sampling_logp_difference/mean": 0.01229651365429163, "step": 565 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 516.0, "completions/max_terminated_length": 516.0, "completions/mean_length": 213.5625, "completions/mean_terminated_length": 213.5625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.8487128792330623, "epoch": 0.559841740850643, "grad_norm": 2.0102553367614746, "kl_approx": 0.24184417724609375, "learning_rate": 9.70627396181561e-06, "loss": 0.1805, "num_tokens": 13858065.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2190152406692505, "sampling/importance_sampling_ratio/mean": 0.9997076988220215, "sampling/importance_sampling_ratio/min": 0.8291231989860535, "sampling/sampling_logp_difference/max": 0.1980433464050293, "sampling/sampling_logp_difference/mean": 0.014840351417660713, "step": 566 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 493.0, "completions/max_terminated_length": 493.0, "completions/mean_length": 170.6875, "completions/mean_terminated_length": 170.6875, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.8684700690209866, "epoch": 0.5608308605341247, "grad_norm": 2.4111123085021973, "kl_approx": 0.32224273681640625, "learning_rate": 9.671729721476747e-06, "loss": 0.2219, "num_tokens": 13885559.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2122315168380737, "sampling/importance_sampling_ratio/mean": 1.000387191772461, "sampling/importance_sampling_ratio/min": 0.835743248462677, "sampling/sampling_logp_difference/max": 0.19246292114257812, "sampling/sampling_logp_difference/mean": 0.014755576848983765, "step": 567 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 749.0, "completions/max_terminated_length": 749.0, "completions/mean_length": 195.65625, "completions/mean_terminated_length": 195.65625, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.6492679119110107, "epoch": 0.5618199802176064, "grad_norm": 1.3202608823776245, "kl_approx": 0.15317630767822266, "learning_rate": 9.637189402194477e-06, "loss": 0.1118, "num_tokens": 13912308.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2419852018356323, "sampling/importance_sampling_ratio/mean": 1.0000921487808228, "sampling/importance_sampling_ratio/min": 0.8110466599464417, "sampling/sampling_logp_difference/max": 0.21671104431152344, "sampling/sampling_logp_difference/mean": 0.013141728937625885, "step": 568 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 636.0, "completions/max_terminated_length": 636.0, "completions/mean_length": 162.53125, "completions/mean_terminated_length": 162.53125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6293529318645597, "epoch": 0.5628090999010881, "grad_norm": 1.903863787651062, "kl_approx": 0.19988632202148438, "learning_rate": 9.602653416539031e-06, "loss": 0.1495, "num_tokens": 13937861.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3347750902175903, "sampling/importance_sampling_ratio/mean": 1.000080943107605, "sampling/importance_sampling_ratio/min": 0.8435951471328735, "sampling/sampling_logp_difference/max": 0.28876280784606934, "sampling/sampling_logp_difference/mean": 0.011708738282322884, "step": 569 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 796.0, "completions/max_terminated_length": 796.0, "completions/mean_length": 279.625, "completions/mean_terminated_length": 279.625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7295168992131948, "epoch": 0.5637982195845698, "grad_norm": 2.0887937545776367, "kl_approx": 0.2439422607421875, "learning_rate": 9.568122177028884e-06, "loss": 0.1707, "num_tokens": 13968081.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.164908766746521, "sampling/importance_sampling_ratio/mean": 1.000138759613037, "sampling/importance_sampling_ratio/min": 0.7963119745254517, "sampling/sampling_logp_difference/max": 0.22776424884796143, "sampling/sampling_logp_difference/mean": 0.011534630320966244, "step": 570 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 254.0, "completions/max_terminated_length": 254.0, "completions/mean_length": 124.625, "completions/mean_terminated_length": 124.625, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.7340157087892294, "epoch": 0.5647873392680515, "grad_norm": 2.008805990219116, "kl_approx": 0.2329559326171875, "learning_rate": 9.533596096125826e-06, "loss": 0.1597, "num_tokens": 13988133.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.182772159576416, "sampling/importance_sampling_ratio/mean": 0.9996166229248047, "sampling/importance_sampling_ratio/min": 0.8459413647651672, "sampling/sampling_logp_difference/max": 0.1678609848022461, "sampling/sampling_logp_difference/mean": 0.01225473452359438, "step": 571 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 814.0, "completions/max_terminated_length": 814.0, "completions/mean_length": 208.1875, "completions/mean_terminated_length": 208.1875, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.7644084366038442, "epoch": 0.5657764589515332, "grad_norm": 3.0648844242095947, "kl_approx": 0.2898712158203125, "learning_rate": 9.499075586230014e-06, "loss": 0.1981, "num_tokens": 14011187.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2678614854812622, "sampling/importance_sampling_ratio/mean": 1.0004961490631104, "sampling/importance_sampling_ratio/min": 0.8255045413970947, "sampling/sampling_logp_difference/max": 0.23733162879943848, "sampling/sampling_logp_difference/mean": 0.012658596970140934, "step": 572 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 457.0, "completions/max_terminated_length": 457.0, "completions/mean_length": 130.90625, "completions/mean_terminated_length": 130.90625, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.7406389387324452, "epoch": 0.5667655786350149, "grad_norm": 2.1986899375915527, "kl_approx": 0.26068115234375, "learning_rate": 9.464561059675073e-06, "loss": 0.1821, "num_tokens": 14036008.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1408073902130127, "sampling/importance_sampling_ratio/mean": 0.9998288750648499, "sampling/importance_sampling_ratio/min": 0.7885711789131165, "sampling/sampling_logp_difference/max": 0.2375326156616211, "sampling/sampling_logp_difference/mean": 0.012342671863734722, "step": 573 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 310.0, "completions/max_terminated_length": 310.0, "completions/mean_length": 116.96875, "completions/mean_terminated_length": 116.96875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6195411588996649, "epoch": 0.5677546983184966, "grad_norm": 1.9059017896652222, "kl_approx": 0.18611907958984375, "learning_rate": 9.430052928723153e-06, "loss": 0.1241, "num_tokens": 14064559.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1570549011230469, "sampling/importance_sampling_ratio/mean": 0.9998661279678345, "sampling/importance_sampling_ratio/min": 0.8128127455711365, "sampling/sampling_logp_difference/max": 0.2072545289993286, "sampling/sampling_logp_difference/mean": 0.01100755576044321, "step": 574 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 816.0, "completions/max_terminated_length": 816.0, "completions/mean_length": 131.8125, "completions/mean_terminated_length": 131.8125, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 0.5594670814462006, "epoch": 0.5687438180019783, "grad_norm": 2.1889467239379883, "kl_approx": 0.1875, "learning_rate": 9.395551605560018e-06, "loss": 0.1428, "num_tokens": 14087161.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1768076419830322, "sampling/importance_sampling_ratio/mean": 1.0001590251922607, "sampling/importance_sampling_ratio/min": 0.7927188277244568, "sampling/sampling_logp_difference/max": 0.23228669166564941, "sampling/sampling_logp_difference/mean": 0.011780045926570892, "step": 575 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 820.0, "completions/max_terminated_length": 820.0, "completions/mean_length": 146.0625, "completions/mean_terminated_length": 146.0625, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.5485462676733732, "epoch": 0.56973293768546, "grad_norm": 1.6483031511306763, "kl_approx": 0.20196533203125, "learning_rate": 9.361057502290112e-06, "loss": 0.1311, "num_tokens": 14110843.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1993513107299805, "sampling/importance_sampling_ratio/mean": 1.0000066757202148, "sampling/importance_sampling_ratio/min": 0.8318940997123718, "sampling/sampling_logp_difference/max": 0.1840500831604004, "sampling/sampling_logp_difference/mean": 0.00945326592773199, "step": 576 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 522.0, "completions/max_terminated_length": 522.0, "completions/mean_length": 195.5, "completions/mean_terminated_length": 195.5, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.9740767367184162, "epoch": 0.5707220573689417, "grad_norm": 3.5474014282226562, "kl_approx": 0.41021728515625, "learning_rate": 9.326571030931636e-06, "loss": 0.3187, "num_tokens": 14132739.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2443616390228271, "sampling/importance_sampling_ratio/mean": 0.9999082088470459, "sampling/importance_sampling_ratio/min": 0.7952123880386353, "sampling/sampling_logp_difference/max": 0.22914600372314453, "sampling/sampling_logp_difference/mean": 0.014275682158768177, "step": 577 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 437.0, "completions/max_terminated_length": 437.0, "completions/mean_length": 154.0, "completions/mean_terminated_length": 154.0, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.6834780909121037, "epoch": 0.5717111770524234, "grad_norm": 1.7955055236816406, "kl_approx": 0.20635986328125, "learning_rate": 9.292092603411642e-06, "loss": 0.1444, "num_tokens": 14154619.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.185611367225647, "sampling/importance_sampling_ratio/mean": 1.000687599182129, "sampling/importance_sampling_ratio/min": 0.8705950379371643, "sampling/sampling_logp_difference/max": 0.1702585220336914, "sampling/sampling_logp_difference/mean": 0.011378559283912182, "step": 578 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 728.0, "completions/max_terminated_length": 728.0, "completions/mean_length": 256.84375, "completions/mean_terminated_length": 256.84375, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.8415523264557123, "epoch": 0.5727002967359051, "grad_norm": 1.52953040599823, "kl_approx": 0.1864490509033203, "learning_rate": 9.257622631561085e-06, "loss": 0.1552, "num_tokens": 14183078.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1615127325057983, "sampling/importance_sampling_ratio/mean": 0.9997406601905823, "sampling/importance_sampling_ratio/min": 0.7907800078392029, "sampling/sampling_logp_difference/max": 0.23473548889160156, "sampling/sampling_logp_difference/mean": 0.014283680357038975, "step": 579 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 408.0, "completions/max_terminated_length": 408.0, "completions/mean_length": 110.0, "completions/mean_terminated_length": 110.0, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.6279474515467882, "epoch": 0.5736894164193868, "grad_norm": 2.178569793701172, "kl_approx": 0.22751617431640625, "learning_rate": 9.223161527109938e-06, "loss": 0.1581, "num_tokens": 14203358.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2548457384109497, "sampling/importance_sampling_ratio/mean": 1.0004453659057617, "sampling/importance_sampling_ratio/min": 0.8375840783119202, "sampling/sampling_logp_difference/max": 0.22701263427734375, "sampling/sampling_logp_difference/mean": 0.01244357693940401, "step": 580 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 971.0, "completions/max_terminated_length": 971.0, "completions/mean_length": 411.09375, "completions/mean_terminated_length": 411.09375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.9773619640618563, "epoch": 0.5746785361028685, "grad_norm": 2.36759090423584, "kl_approx": 0.32073974609375, "learning_rate": 9.188709701682246e-06, "loss": 0.2377, "num_tokens": 14237657.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2579460144042969, "sampling/importance_sampling_ratio/mean": 1.000120759010315, "sampling/importance_sampling_ratio/min": 0.8358125686645508, "sampling/sampling_logp_difference/max": 0.22948026657104492, "sampling/sampling_logp_difference/mean": 0.013895380310714245, "step": 581 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 492.0, "completions/max_terminated_length": 492.0, "completions/mean_length": 190.59375, "completions/mean_terminated_length": 190.59375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.6788607058115304, "epoch": 0.5756676557863502, "grad_norm": 2.066896438598633, "kl_approx": 0.2556800842285156, "learning_rate": 9.154267566791224e-06, "loss": 0.1812, "num_tokens": 14261908.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1837228536605835, "sampling/importance_sampling_ratio/mean": 0.9997403025627136, "sampling/importance_sampling_ratio/min": 0.8121945261955261, "sampling/sampling_logp_difference/max": 0.20801544189453125, "sampling/sampling_logp_difference/mean": 0.010571017861366272, "step": 582 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 706.0, "completions/max_terminated_length": 706.0, "completions/mean_length": 277.21875, "completions/mean_terminated_length": 277.21875, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.9353879438713193, "epoch": 0.5766567754698319, "grad_norm": 2.920464038848877, "kl_approx": 0.3106689453125, "learning_rate": 9.119835533834332e-06, "loss": 0.2255, "num_tokens": 14293955.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2175390720367432, "sampling/importance_sampling_ratio/mean": 1.0000933408737183, "sampling/importance_sampling_ratio/min": 0.7119351625442505, "sampling/sampling_logp_difference/max": 0.3397684097290039, "sampling/sampling_logp_difference/mean": 0.013959464617073536, "step": 583 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 827.0, "completions/max_terminated_length": 827.0, "completions/mean_length": 265.4375, "completions/mean_terminated_length": 265.4375, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.951990868896246, "epoch": 0.5776458951533135, "grad_norm": 3.2958993911743164, "kl_approx": 0.314849853515625, "learning_rate": 9.085414014088368e-06, "loss": 0.2068, "num_tokens": 14321945.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2039992809295654, "sampling/importance_sampling_ratio/mean": 0.9997043013572693, "sampling/importance_sampling_ratio/min": 0.8357508182525635, "sampling/sampling_logp_difference/max": 0.18564867973327637, "sampling/sampling_logp_difference/mean": 0.014534994959831238, "step": 584 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 840.0, "completions/max_terminated_length": 840.0, "completions/mean_length": 246.75, "completions/mean_terminated_length": 246.75, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.6757081677205861, "epoch": 0.5786350148367952, "grad_norm": 1.5287569761276245, "kl_approx": 0.19875144958496094, "learning_rate": 9.051003418704566e-06, "loss": 0.1381, "num_tokens": 14349393.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1445811986923218, "sampling/importance_sampling_ratio/mean": 1.0002588033676147, "sampling/importance_sampling_ratio/min": 0.8205715417861938, "sampling/sampling_logp_difference/max": 0.19775426387786865, "sampling/sampling_logp_difference/mean": 0.011683434247970581, "step": 585 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 814.0, "completions/max_terminated_length": 814.0, "completions/mean_length": 289.5625, "completions/mean_terminated_length": 289.5625, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 1.0120856147259474, "epoch": 0.579624134520277, "grad_norm": 1.611749529838562, "kl_approx": 0.2400970458984375, "learning_rate": 9.016604158703654e-06, "loss": 0.2149, "num_tokens": 14376571.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2763984203338623, "sampling/importance_sampling_ratio/mean": 1.000374674797058, "sampling/importance_sampling_ratio/min": 0.843463659286499, "sampling/sampling_logp_difference/max": 0.24404239654541016, "sampling/sampling_logp_difference/mean": 0.01578001119196415, "step": 586 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 482.0, "completions/max_terminated_length": 482.0, "completions/mean_length": 230.875, "completions/mean_terminated_length": 230.875, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.8151862733066082, "epoch": 0.5806132542037586, "grad_norm": 2.035264253616333, "kl_approx": 0.2705078125, "learning_rate": 8.982216644970978e-06, "loss": 0.2066, "num_tokens": 14403567.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.214165210723877, "sampling/importance_sampling_ratio/mean": 0.999904990196228, "sampling/importance_sampling_ratio/min": 0.7835829257965088, "sampling/sampling_logp_difference/max": 0.24387836456298828, "sampling/sampling_logp_difference/mean": 0.012304753065109253, "step": 587 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 453.0, "completions/max_terminated_length": 453.0, "completions/mean_length": 143.65625, "completions/mean_terminated_length": 143.65625, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.6678358325734735, "epoch": 0.5816023738872403, "grad_norm": 2.040701150894165, "kl_approx": 0.2165985107421875, "learning_rate": 8.947841288251568e-06, "loss": 0.1537, "num_tokens": 14430644.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1489328145980835, "sampling/importance_sampling_ratio/mean": 1.0000303983688354, "sampling/importance_sampling_ratio/min": 0.8200456500053406, "sampling/sampling_logp_difference/max": 0.1983952522277832, "sampling/sampling_logp_difference/mean": 0.011469523422420025, "step": 588 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 398.0, "completions/max_terminated_length": 398.0, "completions/mean_length": 132.96875, "completions/mean_terminated_length": 132.96875, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.5691248886287212, "epoch": 0.582591493570722, "grad_norm": 1.669455885887146, "kl_approx": 0.13684463500976562, "learning_rate": 8.913478499145255e-06, "loss": 0.1261, "num_tokens": 14449323.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1485804319381714, "sampling/importance_sampling_ratio/mean": 1.0002822875976562, "sampling/importance_sampling_ratio/min": 0.8400086164474487, "sampling/sampling_logp_difference/max": 0.17434310913085938, "sampling/sampling_logp_difference/mean": 0.01109970174729824, "step": 589 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 747.0, "completions/max_terminated_length": 747.0, "completions/mean_length": 185.71875, "completions/mean_terminated_length": 185.71875, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.7059805495664477, "epoch": 0.5835806132542037, "grad_norm": 2.028337240219116, "kl_approx": 0.2504425048828125, "learning_rate": 8.879128688101749e-06, "loss": 0.1524, "num_tokens": 14474426.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.163759708404541, "sampling/importance_sampling_ratio/mean": 1.0001474618911743, "sampling/importance_sampling_ratio/min": 0.7962972521781921, "sampling/sampling_logp_difference/max": 0.2277827262878418, "sampling/sampling_logp_difference/mean": 0.013358908705413342, "step": 590 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 738.0, "completions/max_terminated_length": 738.0, "completions/mean_length": 206.75, "completions/mean_terminated_length": 206.75, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.7705703251995146, "epoch": 0.5845697329376854, "grad_norm": 1.5027016401290894, "kl_approx": 0.18592071533203125, "learning_rate": 8.844792265415738e-06, "loss": 0.1523, "num_tokens": 14501122.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.170798659324646, "sampling/importance_sampling_ratio/mean": 0.9997641444206238, "sampling/importance_sampling_ratio/min": 0.8417995572090149, "sampling/sampling_logp_difference/max": 0.17221331596374512, "sampling/sampling_logp_difference/mean": 0.01250071357935667, "step": 591 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 587.0, "completions/max_terminated_length": 587.0, "completions/mean_length": 181.59375, "completions/mean_terminated_length": 181.59375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.8286331007257104, "epoch": 0.5855588526211671, "grad_norm": 1.9967825412750244, "kl_approx": 0.21935272216796875, "learning_rate": 8.810469641222001e-06, "loss": 0.1713, "num_tokens": 14526677.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1928670406341553, "sampling/importance_sampling_ratio/mean": 0.9999676942825317, "sampling/importance_sampling_ratio/min": 0.8471214771270752, "sampling/sampling_logp_difference/max": 0.1763596534729004, "sampling/sampling_logp_difference/mean": 0.014488635584712029, "step": 592 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 728.0, "completions/max_terminated_length": 728.0, "completions/mean_length": 200.84375, "completions/mean_terminated_length": 200.84375, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.5576069293310866, "epoch": 0.5865479723046488, "grad_norm": 1.8071155548095703, "kl_approx": 0.19341278076171875, "learning_rate": 8.776161225490488e-06, "loss": 0.1368, "num_tokens": 14554408.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1536320447921753, "sampling/importance_sampling_ratio/mean": 0.9998191595077515, "sampling/importance_sampling_ratio/min": 0.6843225955963135, "sampling/sampling_logp_difference/max": 0.37932586669921875, "sampling/sampling_logp_difference/mean": 0.009851556271314621, "step": 593 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 734.0, "completions/mean_length": 169.5625, "completions/mean_terminated_length": 142.0, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.7981443917378783, "epoch": 0.5875370919881305, "grad_norm": 2.605543613433838, "kl_approx": 0.2599639892578125, "learning_rate": 8.741867428021447e-06, "loss": 0.1796, "num_tokens": 14578346.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1867884397506714, "sampling/importance_sampling_ratio/mean": 0.9995306134223938, "sampling/importance_sampling_ratio/min": 0.8017332553863525, "sampling/sampling_logp_difference/max": 0.22097933292388916, "sampling/sampling_logp_difference/mean": 0.014312634244561195, "step": 594 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 725.0, "completions/max_terminated_length": 725.0, "completions/mean_length": 146.03125, "completions/mean_terminated_length": 146.03125, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.5782944527454674, "epoch": 0.5885262116716122, "grad_norm": 1.5760407447814941, "kl_approx": 0.14417266845703125, "learning_rate": 8.707588658440511e-06, "loss": 0.1089, "num_tokens": 14604971.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.183398962020874, "sampling/importance_sampling_ratio/mean": 1.0002706050872803, "sampling/importance_sampling_ratio/min": 0.8459106683731079, "sampling/sampling_logp_difference/max": 0.16839075088500977, "sampling/sampling_logp_difference/mean": 0.012773859314620495, "step": 595 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 516.0, "completions/max_terminated_length": 516.0, "completions/mean_length": 179.53125, "completions/mean_terminated_length": 179.53125, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.7207717560231686, "epoch": 0.5895153313550939, "grad_norm": 2.695880889892578, "kl_approx": 0.326507568359375, "learning_rate": 8.673325326193806e-06, "loss": 0.1794, "num_tokens": 14632020.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2431607246398926, "sampling/importance_sampling_ratio/mean": 0.9996240139007568, "sampling/importance_sampling_ratio/min": 0.8361522555351257, "sampling/sampling_logp_difference/max": 0.21765708923339844, "sampling/sampling_logp_difference/mean": 0.012681987136602402, "step": 596 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 557.0, "completions/max_terminated_length": 557.0, "completions/mean_length": 159.5, "completions/mean_terminated_length": 159.5, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.7477700281888247, "epoch": 0.5905044510385756, "grad_norm": 2.423964500427246, "kl_approx": 0.4090576171875, "learning_rate": 8.639077840543078e-06, "loss": 0.1852, "num_tokens": 14660692.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2349269390106201, "sampling/importance_sampling_ratio/mean": 0.9993705153465271, "sampling/importance_sampling_ratio/min": 0.8120876550674438, "sampling/sampling_logp_difference/max": 0.2110118865966797, "sampling/sampling_logp_difference/mean": 0.012897556647658348, "step": 597 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 755.0, "completions/max_terminated_length": 755.0, "completions/mean_length": 289.3125, "completions/mean_terminated_length": 289.3125, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.9351605651900172, "epoch": 0.5914935707220573, "grad_norm": 1.8352752923965454, "kl_approx": 0.25653076171875, "learning_rate": 8.604846610560771e-06, "loss": 0.1934, "num_tokens": 14691918.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2079377174377441, "sampling/importance_sampling_ratio/mean": 1.000104546546936, "sampling/importance_sampling_ratio/min": 0.7955926656723022, "sampling/sampling_logp_difference/max": 0.2286679744720459, "sampling/sampling_logp_difference/mean": 0.014869512058794498, "step": 598 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 473.0, "completions/max_terminated_length": 473.0, "completions/mean_length": 137.09375, "completions/mean_terminated_length": 137.09375, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.8705287147313356, "epoch": 0.592482690405539, "grad_norm": 3.140615463256836, "kl_approx": 0.3723297119140625, "learning_rate": 8.570632045125185e-06, "loss": 0.2234, "num_tokens": 14713681.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2139580249786377, "sampling/importance_sampling_ratio/mean": 1.0001188516616821, "sampling/importance_sampling_ratio/min": 0.851703941822052, "sampling/sampling_logp_difference/max": 0.1938861608505249, "sampling/sampling_logp_difference/mean": 0.014600108377635479, "step": 599 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 536.0, "completions/max_terminated_length": 536.0, "completions/mean_length": 178.96875, "completions/mean_terminated_length": 178.96875, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.8695685910061002, "epoch": 0.5934718100890207, "grad_norm": 2.2011160850524902, "kl_approx": 0.25698089599609375, "learning_rate": 8.536434552915555e-06, "loss": 0.1941, "num_tokens": 14740936.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.218953013420105, "sampling/importance_sampling_ratio/mean": 0.999721884727478, "sampling/importance_sampling_ratio/min": 0.7977047562599182, "sampling/sampling_logp_difference/max": 0.22601675987243652, "sampling/sampling_logp_difference/mean": 0.015602254308760166, "step": 600 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 721.0, "completions/max_terminated_length": 721.0, "completions/mean_length": 172.78125, "completions/mean_terminated_length": 172.78125, "completions/min_length": 31.0, "completions/min_terminated_length": 31.0, "entropy": 0.6688546277582645, "epoch": 0.5944609297725024, "grad_norm": 1.9896490573883057, "kl_approx": 0.18251800537109375, "learning_rate": 8.502254542407186e-06, "loss": 0.136, "num_tokens": 14765737.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2403576374053955, "sampling/importance_sampling_ratio/mean": 0.9995337128639221, "sampling/importance_sampling_ratio/min": 0.8046246767044067, "sampling/sampling_logp_difference/max": 0.21737933158874512, "sampling/sampling_logp_difference/mean": 0.013249975629150867, "step": 601 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 461.0, "completions/max_terminated_length": 461.0, "completions/mean_length": 86.34375, "completions/mean_terminated_length": 86.34375, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.43391871312633157, "epoch": 0.5954500494559841, "grad_norm": 2.0114455223083496, "kl_approx": 0.14516067504882812, "learning_rate": 8.468092421866575e-06, "loss": 0.1133, "num_tokens": 14789700.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1374667882919312, "sampling/importance_sampling_ratio/mean": 0.9990959167480469, "sampling/importance_sampling_ratio/min": 0.7968935966491699, "sampling/sampling_logp_difference/max": 0.2270340919494629, "sampling/sampling_logp_difference/mean": 0.008765392936766148, "step": 602 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 536.0, "completions/max_terminated_length": 536.0, "completions/mean_length": 186.6875, "completions/mean_terminated_length": 186.6875, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.6701985178515315, "epoch": 0.5964391691394659, "grad_norm": 2.3540446758270264, "kl_approx": 0.23486709594726562, "learning_rate": 8.433948599346516e-06, "loss": 0.1587, "num_tokens": 14810146.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2078008651733398, "sampling/importance_sampling_ratio/mean": 1.0001829862594604, "sampling/importance_sampling_ratio/min": 0.8239150047302246, "sampling/sampling_logp_difference/max": 0.19368791580200195, "sampling/sampling_logp_difference/mean": 0.011357990093529224, "step": 603 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 392.0, "completions/max_terminated_length": 392.0, "completions/mean_length": 129.53125, "completions/mean_terminated_length": 129.53125, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.6707613095641136, "epoch": 0.5974282888229476, "grad_norm": 2.3441147804260254, "kl_approx": 0.2734527587890625, "learning_rate": 8.399823482681263e-06, "loss": 0.1986, "num_tokens": 14833155.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.182799220085144, "sampling/importance_sampling_ratio/mean": 1.0001147985458374, "sampling/importance_sampling_ratio/min": 0.8629973530769348, "sampling/sampling_logp_difference/max": 0.16788387298583984, "sampling/sampling_logp_difference/mean": 0.01183376181870699, "step": 604 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 292.0, "completions/max_terminated_length": 292.0, "completions/mean_length": 102.6875, "completions/mean_terminated_length": 102.6875, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.6256112800911069, "epoch": 0.5984174085064293, "grad_norm": 2.8831186294555664, "kl_approx": 0.22283172607421875, "learning_rate": 8.36571747948162e-06, "loss": 0.1882, "num_tokens": 14854737.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1522128582000732, "sampling/importance_sampling_ratio/mean": 1.0000351667404175, "sampling/importance_sampling_ratio/min": 0.8471440672874451, "sampling/sampling_logp_difference/max": 0.16588449478149414, "sampling/sampling_logp_difference/mean": 0.011234361678361893, "step": 605 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 266.0, "completions/max_terminated_length": 266.0, "completions/mean_length": 130.34375, "completions/mean_terminated_length": 130.34375, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7890455797314644, "epoch": 0.599406528189911, "grad_norm": 2.210353136062622, "kl_approx": 0.26627349853515625, "learning_rate": 8.331630997130091e-06, "loss": 0.2117, "num_tokens": 14874740.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2117936611175537, "sampling/importance_sampling_ratio/mean": 0.9991394877433777, "sampling/importance_sampling_ratio/min": 0.836648166179657, "sampling/sampling_logp_difference/max": 0.1921015977859497, "sampling/sampling_logp_difference/mean": 0.014605955220758915, "step": 606 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 138.0, "completions/max_terminated_length": 138.0, "completions/mean_length": 80.90625, "completions/mean_terminated_length": 80.90625, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.41660131560638547, "epoch": 0.6003956478733927, "grad_norm": 1.724359393119812, "kl_approx": 0.1334075927734375, "learning_rate": 8.297564442776014e-06, "loss": 0.0987, "num_tokens": 14897641.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1360087394714355, "sampling/importance_sampling_ratio/mean": 0.9998670220375061, "sampling/importance_sampling_ratio/min": 0.884139895439148, "sampling/sampling_logp_difference/max": 0.12752103805541992, "sampling/sampling_logp_difference/mean": 0.008615626953542233, "step": 607 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 563.0, "completions/max_terminated_length": 563.0, "completions/mean_length": 233.5625, "completions/mean_terminated_length": 233.5625, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "entropy": 0.703035949729383, "epoch": 0.6013847675568744, "grad_norm": 2.480321168899536, "kl_approx": 0.24495887756347656, "learning_rate": 8.263518223330698e-06, "loss": 0.2019, "num_tokens": 14923267.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2868258953094482, "sampling/importance_sampling_ratio/mean": 1.000340461730957, "sampling/importance_sampling_ratio/min": 0.7171485424041748, "sampling/sampling_logp_difference/max": 0.3324723243713379, "sampling/sampling_logp_difference/mean": 0.012616925872862339, "step": 608 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 333.0, "completions/max_terminated_length": 333.0, "completions/mean_length": 138.75, "completions/mean_terminated_length": 138.75, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.747943258844316, "epoch": 0.6023738872403561, "grad_norm": 3.466078042984009, "kl_approx": 0.3057212829589844, "learning_rate": 8.229492745462551e-06, "loss": 0.2282, "num_tokens": 14942955.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2242804765701294, "sampling/importance_sampling_ratio/mean": 1.0001500844955444, "sampling/importance_sampling_ratio/min": 0.8684120178222656, "sampling/sampling_logp_difference/max": 0.20235323905944824, "sampling/sampling_logp_difference/mean": 0.013241213746368885, "step": 609 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 548.0, "completions/max_terminated_length": 548.0, "completions/mean_length": 152.40625, "completions/mean_terminated_length": 152.40625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.6837544655427337, "epoch": 0.6033630069238378, "grad_norm": 1.836683750152588, "kl_approx": 0.148101806640625, "learning_rate": 8.195488415592238e-06, "loss": 0.1108, "num_tokens": 14970072.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1672747135162354, "sampling/importance_sampling_ratio/mean": 0.9997825026512146, "sampling/importance_sampling_ratio/min": 0.8239749073982239, "sampling/sampling_logp_difference/max": 0.19361519813537598, "sampling/sampling_logp_difference/mean": 0.013036217540502548, "step": 610 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 450.0, "completions/max_terminated_length": 450.0, "completions/mean_length": 166.09375, "completions/mean_terminated_length": 166.09375, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.7604801687411964, "epoch": 0.6043521266073195, "grad_norm": 2.0230512619018555, "kl_approx": 0.25215721130371094, "learning_rate": 8.161505639887818e-06, "loss": 0.1663, "num_tokens": 14989307.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2387961149215698, "sampling/importance_sampling_ratio/mean": 0.9995195865631104, "sampling/importance_sampling_ratio/min": 0.6878170967102051, "sampling/sampling_logp_difference/max": 0.37423229217529297, "sampling/sampling_logp_difference/mean": 0.013610833324491978, "step": 611 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 666.0, "completions/max_terminated_length": 666.0, "completions/mean_length": 266.3125, "completions/mean_terminated_length": 266.3125, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "entropy": 0.7950935419648886, "epoch": 0.6053412462908012, "grad_norm": 1.681810736656189, "kl_approx": 0.23992919921875, "learning_rate": 8.12754482425989e-06, "loss": 0.1661, "num_tokens": 15018045.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1971932649612427, "sampling/importance_sampling_ratio/mean": 0.9999061822891235, "sampling/importance_sampling_ratio/min": 0.772814929485321, "sampling/sampling_logp_difference/max": 0.25771570205688477, "sampling/sampling_logp_difference/mean": 0.013015832751989365, "step": 612 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 605.0, "completions/max_terminated_length": 605.0, "completions/mean_length": 148.6875, "completions/mean_terminated_length": 148.6875, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.5282100313343108, "epoch": 0.6063303659742829, "grad_norm": 1.6223429441452026, "kl_approx": 0.15988540649414062, "learning_rate": 8.09360637435676e-06, "loss": 0.1094, "num_tokens": 15047003.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1515616178512573, "sampling/importance_sampling_ratio/mean": 0.9998177289962769, "sampling/importance_sampling_ratio/min": 0.811357855796814, "sampling/sampling_logp_difference/max": 0.2090461254119873, "sampling/sampling_logp_difference/mean": 0.010153459385037422, "step": 613 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 619.0, "completions/max_terminated_length": 619.0, "completions/mean_length": 192.09375, "completions/mean_terminated_length": 192.09375, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.8003333164379001, "epoch": 0.6073194856577646, "grad_norm": 2.066592216491699, "kl_approx": 0.2234649658203125, "learning_rate": 8.05969069555957e-06, "loss": 0.1846, "num_tokens": 15069214.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.227891445159912, "sampling/importance_sampling_ratio/mean": 1.0002069473266602, "sampling/importance_sampling_ratio/min": 0.8441603183746338, "sampling/sampling_logp_difference/max": 0.20529842376708984, "sampling/sampling_logp_difference/mean": 0.014230254106223583, "step": 614 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 316.0, "completions/max_terminated_length": 316.0, "completions/mean_length": 106.375, "completions/mean_terminated_length": 106.375, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.5347771416418254, "epoch": 0.6083086053412463, "grad_norm": 2.5822677612304688, "kl_approx": 0.25128173828125, "learning_rate": 8.025798192977482e-06, "loss": 0.1999, "num_tokens": 15093842.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2098220586776733, "sampling/importance_sampling_ratio/mean": 1.0004093647003174, "sampling/importance_sampling_ratio/min": 0.8480750918388367, "sampling/sampling_logp_difference/max": 0.19047331809997559, "sampling/sampling_logp_difference/mean": 0.009841482155025005, "step": 615 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 709.0, "completions/max_terminated_length": 709.0, "completions/mean_length": 208.25, "completions/mean_terminated_length": 208.25, "completions/min_length": 80.0, "completions/min_terminated_length": 80.0, "entropy": 0.8450790457427502, "epoch": 0.609297725024728, "grad_norm": 2.012883424758911, "kl_approx": 0.255218505859375, "learning_rate": 7.991929271442817e-06, "loss": 0.1919, "num_tokens": 15122074.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1662439107894897, "sampling/importance_sampling_ratio/mean": 0.9997763633728027, "sampling/importance_sampling_ratio/min": 0.8165592551231384, "sampling/sampling_logp_difference/max": 0.20265579223632812, "sampling/sampling_logp_difference/mean": 0.012757617980241776, "step": 616 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 125.0, "completions/max_terminated_length": 125.0, "completions/mean_length": 68.6875, "completions/mean_terminated_length": 68.6875, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.40083213057368994, "epoch": 0.6102868447082097, "grad_norm": 1.537691354751587, "kl_approx": 0.11963272094726562, "learning_rate": 7.958084335506239e-06, "loss": 0.0792, "num_tokens": 15140520.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1318955421447754, "sampling/importance_sampling_ratio/mean": 1.0001626014709473, "sampling/importance_sampling_ratio/min": 0.8542957305908203, "sampling/sampling_logp_difference/max": 0.15747785568237305, "sampling/sampling_logp_difference/mean": 0.007562182378023863, "step": 617 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 723.0, "completions/max_terminated_length": 723.0, "completions/mean_length": 192.28125, "completions/mean_terminated_length": 192.28125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.7726500919088721, "epoch": 0.6112759643916914, "grad_norm": 1.990212321281433, "kl_approx": 0.23101043701171875, "learning_rate": 7.924263789431913e-06, "loss": 0.1711, "num_tokens": 15164825.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2609872817993164, "sampling/importance_sampling_ratio/mean": 1.0000793933868408, "sampling/importance_sampling_ratio/min": 0.7410615086555481, "sampling/sampling_logp_difference/max": 0.29967164993286133, "sampling/sampling_logp_difference/mean": 0.012178683653473854, "step": 618 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 272.0, "completions/max_terminated_length": 272.0, "completions/mean_length": 90.1875, "completions/mean_terminated_length": 90.1875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.569795009214431, "epoch": 0.6122650840751731, "grad_norm": 2.8073432445526123, "kl_approx": 0.21855926513671875, "learning_rate": 7.89046803719267e-06, "loss": 0.1474, "num_tokens": 15179935.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1356313228607178, "sampling/importance_sampling_ratio/mean": 1.0006545782089233, "sampling/importance_sampling_ratio/min": 0.8650804758071899, "sampling/sampling_logp_difference/max": 0.14493274688720703, "sampling/sampling_logp_difference/mean": 0.009858466684818268, "step": 619 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 805.0, "completions/max_terminated_length": 805.0, "completions/mean_length": 198.28125, "completions/mean_terminated_length": 198.28125, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.6789735932834446, "epoch": 0.6132542037586548, "grad_norm": 2.514277696609497, "kl_approx": 0.19661903381347656, "learning_rate": 7.856697482465195e-06, "loss": 0.1586, "num_tokens": 15206336.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2437405586242676, "sampling/importance_sampling_ratio/mean": 0.9999963045120239, "sampling/importance_sampling_ratio/min": 0.7891002297401428, "sampling/sampling_logp_difference/max": 0.2368619441986084, "sampling/sampling_logp_difference/mean": 0.012246308848261833, "step": 620 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 788.0, "completions/max_terminated_length": 788.0, "completions/mean_length": 261.78125, "completions/mean_terminated_length": 261.78125, "completions/min_length": 89.0, "completions/min_terminated_length": 89.0, "entropy": 0.9781762268394232, "epoch": 0.6142433234421365, "grad_norm": 2.16706919670105, "kl_approx": 0.2884521484375, "learning_rate": 7.822952528625192e-06, "loss": 0.1866, "num_tokens": 15233169.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2450203895568848, "sampling/importance_sampling_ratio/mean": 1.0001654624938965, "sampling/importance_sampling_ratio/min": 0.8422852158546448, "sampling/sampling_logp_difference/max": 0.21915197372436523, "sampling/sampling_logp_difference/mean": 0.01478812750428915, "step": 621 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 463.0, "completions/max_terminated_length": 463.0, "completions/mean_length": 207.4375, "completions/mean_terminated_length": 207.4375, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.9582718349993229, "epoch": 0.6152324431256182, "grad_norm": 2.0711846351623535, "kl_approx": 0.2846527099609375, "learning_rate": 7.789233578742583e-06, "loss": 0.2103, "num_tokens": 15259183.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1789836883544922, "sampling/importance_sampling_ratio/mean": 1.0001877546310425, "sampling/importance_sampling_ratio/min": 0.7457310557365417, "sampling/sampling_logp_difference/max": 0.29339027404785156, "sampling/sampling_logp_difference/mean": 0.015369508415460587, "step": 622 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 553.0, "completions/max_terminated_length": 553.0, "completions/mean_length": 159.09375, "completions/mean_terminated_length": 159.09375, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.8827053522691131, "epoch": 0.6162215628090999, "grad_norm": 3.054382801055908, "kl_approx": 0.30753326416015625, "learning_rate": 7.755541035576677e-06, "loss": 0.2562, "num_tokens": 15283330.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1605863571166992, "sampling/importance_sampling_ratio/mean": 0.999731183052063, "sampling/importance_sampling_ratio/min": 0.8275725245475769, "sampling/sampling_logp_difference/max": 0.18925857543945312, "sampling/sampling_logp_difference/mean": 0.015494883060455322, "step": 623 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 457.0, "completions/max_terminated_length": 457.0, "completions/mean_length": 165.375, "completions/mean_terminated_length": 165.375, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.7575342142954469, "epoch": 0.6172106824925816, "grad_norm": 2.2499167919158936, "kl_approx": 0.24236297607421875, "learning_rate": 7.721875301571359e-06, "loss": 0.1816, "num_tokens": 15308718.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.184907078742981, "sampling/importance_sampling_ratio/mean": 1.0002063512802124, "sampling/importance_sampling_ratio/min": 0.8507139682769775, "sampling/sampling_logp_difference/max": 0.1696643829345703, "sampling/sampling_logp_difference/mean": 0.013103378936648369, "step": 624 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 526.0, "completions/max_terminated_length": 526.0, "completions/mean_length": 133.90625, "completions/mean_terminated_length": 133.90625, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.6609551957808435, "epoch": 0.6181998021760633, "grad_norm": 3.645611524581909, "kl_approx": 0.27492523193359375, "learning_rate": 7.688236778850307e-06, "loss": 0.2045, "num_tokens": 15329051.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1877593994140625, "sampling/importance_sampling_ratio/mean": 1.000052809715271, "sampling/importance_sampling_ratio/min": 0.8158209323883057, "sampling/sampling_logp_difference/max": 0.20356035232543945, "sampling/sampling_logp_difference/mean": 0.013015098869800568, "step": 625 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 236.0, "completions/max_terminated_length": 236.0, "completions/mean_length": 90.46875, "completions/mean_terminated_length": 90.46875, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.5437556859105825, "epoch": 0.619188921859545, "grad_norm": 1.9455057382583618, "kl_approx": 0.2138843536376953, "learning_rate": 7.654625869212147e-06, "loss": 0.1249, "num_tokens": 15347130.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.167655110359192, "sampling/importance_sampling_ratio/mean": 1.0000663995742798, "sampling/importance_sampling_ratio/min": 0.880313515663147, "sampling/sampling_logp_difference/max": 0.1549975872039795, "sampling/sampling_logp_difference/mean": 0.009895924478769302, "step": 626 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 824.0, "completions/max_terminated_length": 824.0, "completions/mean_length": 192.65625, "completions/mean_terminated_length": 192.65625, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.7700870130211115, "epoch": 0.6201780415430267, "grad_norm": 2.2437760829925537, "kl_approx": 0.2387542724609375, "learning_rate": 7.621042974125701e-06, "loss": 0.1676, "num_tokens": 15367815.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1913213729858398, "sampling/importance_sampling_ratio/mean": 1.000348687171936, "sampling/importance_sampling_ratio/min": 0.8278388977050781, "sampling/sampling_logp_difference/max": 0.18893671035766602, "sampling/sampling_logp_difference/mean": 0.01390533335506916, "step": 627 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 718.0, "completions/max_terminated_length": 718.0, "completions/mean_length": 274.59375, "completions/mean_terminated_length": 274.59375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.6963287983089685, "epoch": 0.6211671612265084, "grad_norm": 2.2905075550079346, "kl_approx": 0.2591552734375, "learning_rate": 7.587488494725157e-06, "loss": 0.1945, "num_tokens": 15399018.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1908838748931885, "sampling/importance_sampling_ratio/mean": 0.9994577765464783, "sampling/importance_sampling_ratio/min": 0.8042367696762085, "sampling/sampling_logp_difference/max": 0.21786153316497803, "sampling/sampling_logp_difference/mean": 0.012922143563628197, "step": 628 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 301.0, "completions/max_terminated_length": 301.0, "completions/mean_length": 101.375, "completions/mean_terminated_length": 101.375, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.47114049457013607, "epoch": 0.6221562809099901, "grad_norm": 2.2404110431671143, "kl_approx": 0.17537689208984375, "learning_rate": 7.553962831805291e-06, "loss": 0.1641, "num_tokens": 15421302.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.140470266342163, "sampling/importance_sampling_ratio/mean": 0.999660313129425, "sampling/importance_sampling_ratio/min": 0.8254667520523071, "sampling/sampling_logp_difference/max": 0.19180631637573242, "sampling/sampling_logp_difference/mean": 0.009952511638402939, "step": 629 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 901.0, "completions/max_terminated_length": 901.0, "completions/mean_length": 179.5625, "completions/mean_terminated_length": 179.5625, "completions/min_length": 28.0, "completions/min_terminated_length": 28.0, "entropy": 0.5174165009520948, "epoch": 0.6231454005934718, "grad_norm": 2.1012661457061768, "kl_approx": 0.15752792358398438, "learning_rate": 7.520466385816672e-06, "loss": 0.1599, "num_tokens": 15449304.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1925095319747925, "sampling/importance_sampling_ratio/mean": 1.0000686645507812, "sampling/importance_sampling_ratio/min": 0.8148705363273621, "sampling/sampling_logp_difference/max": 0.204725980758667, "sampling/sampling_logp_difference/mean": 0.009643856436014175, "step": 630 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 633.0, "completions/max_terminated_length": 633.0, "completions/mean_length": 228.21875, "completions/mean_terminated_length": 228.21875, "completions/min_length": 78.0, "completions/min_terminated_length": 78.0, "entropy": 0.7484529567882419, "epoch": 0.6241345202769535, "grad_norm": 1.8473544120788574, "kl_approx": 0.2353668212890625, "learning_rate": 7.48699955686089e-06, "loss": 0.1653, "num_tokens": 15477199.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2498046159744263, "sampling/importance_sampling_ratio/mean": 0.999622106552124, "sampling/importance_sampling_ratio/min": 0.8383392095565796, "sampling/sampling_logp_difference/max": 0.22298717498779297, "sampling/sampling_logp_difference/mean": 0.012383101508021355, "step": 631 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 751.0, "completions/max_terminated_length": 751.0, "completions/mean_length": 198.6875, "completions/mean_terminated_length": 198.6875, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.7777397618629038, "epoch": 0.6251236399604352, "grad_norm": 2.229924440383911, "kl_approx": 0.2472991943359375, "learning_rate": 7.453562744685779e-06, "loss": 0.1554, "num_tokens": 15498701.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1600165367126465, "sampling/importance_sampling_ratio/mean": 1.0003907680511475, "sampling/importance_sampling_ratio/min": 0.8619762659072876, "sampling/sampling_logp_difference/max": 0.14852756261825562, "sampling/sampling_logp_difference/mean": 0.014112827368080616, "step": 632 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 692.0, "completions/max_terminated_length": 692.0, "completions/mean_length": 248.09375, "completions/mean_terminated_length": 248.09375, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.7672647023573518, "epoch": 0.6261127596439169, "grad_norm": 4.6184282302856445, "kl_approx": 0.38660430908203125, "learning_rate": 7.420156348680621e-06, "loss": 0.2193, "num_tokens": 15529160.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2068365812301636, "sampling/importance_sampling_ratio/mean": 0.9997172355651855, "sampling/importance_sampling_ratio/min": 0.7921475172042847, "sampling/sampling_logp_difference/max": 0.23300766944885254, "sampling/sampling_logp_difference/mean": 0.012950201518833637, "step": 633 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 264.0, "completions/max_terminated_length": 264.0, "completions/mean_length": 76.0, "completions/mean_terminated_length": 76.0, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.5394823364913464, "epoch": 0.6271018793273986, "grad_norm": 2.268430471420288, "kl_approx": 0.181060791015625, "learning_rate": 7.3867807678713965e-06, "loss": 0.1305, "num_tokens": 15551632.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.127423882484436, "sampling/importance_sampling_ratio/mean": 0.9990328550338745, "sampling/importance_sampling_ratio/min": 0.8374994993209839, "sampling/sampling_logp_difference/max": 0.17733466625213623, "sampling/sampling_logp_difference/mean": 0.01038716547191143, "step": 634 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 593.0, "completions/max_terminated_length": 593.0, "completions/mean_length": 124.09375, "completions/mean_terminated_length": 124.09375, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.6627146359533072, "epoch": 0.6280909990108803, "grad_norm": 1.9783543348312378, "kl_approx": 0.22044086456298828, "learning_rate": 7.353436400916006e-06, "loss": 0.1595, "num_tokens": 15575099.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1618287563323975, "sampling/importance_sampling_ratio/mean": 0.9997456669807434, "sampling/importance_sampling_ratio/min": 0.7889917492866516, "sampling/sampling_logp_difference/max": 0.23699951171875, "sampling/sampling_logp_difference/mean": 0.01209681760519743, "step": 635 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 521.0, "completions/max_terminated_length": 521.0, "completions/mean_length": 194.65625, "completions/mean_terminated_length": 194.65625, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.8071187241002917, "epoch": 0.629080118694362, "grad_norm": 2.630678653717041, "kl_approx": 0.316986083984375, "learning_rate": 7.32012364609952e-06, "loss": 0.2151, "num_tokens": 15598544.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1679290533065796, "sampling/importance_sampling_ratio/mean": 1.0000572204589844, "sampling/importance_sampling_ratio/min": 0.8395177125930786, "sampling/sampling_logp_difference/max": 0.1749277114868164, "sampling/sampling_logp_difference/mean": 0.012917662039399147, "step": 636 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 571.0, "completions/mean_length": 155.6875, "completions/mean_terminated_length": 127.67741394042969, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7019531419500709, "epoch": 0.6300692383778437, "grad_norm": 2.1762354373931885, "kl_approx": 0.2523956298828125, "learning_rate": 7.286842901329413e-06, "loss": 0.1414, "num_tokens": 15627222.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2084821462631226, "sampling/importance_sampling_ratio/mean": 0.9998836517333984, "sampling/importance_sampling_ratio/min": 0.8328065872192383, "sampling/sampling_logp_difference/max": 0.18936514854431152, "sampling/sampling_logp_difference/mean": 0.012523609213531017, "step": 637 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 702.0, "completions/max_terminated_length": 702.0, "completions/mean_length": 225.78125, "completions/mean_terminated_length": 225.78125, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.7258114339783788, "epoch": 0.6310583580613254, "grad_norm": 1.5527549982070923, "kl_approx": 0.16802978515625, "learning_rate": 7.253594564130804e-06, "loss": 0.1217, "num_tokens": 15653631.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1422302722930908, "sampling/importance_sampling_ratio/mean": 0.9998003244400024, "sampling/importance_sampling_ratio/min": 0.7955418229103088, "sampling/sampling_logp_difference/max": 0.22873187065124512, "sampling/sampling_logp_difference/mean": 0.012548492290079594, "step": 638 }, { "completions/clipped_ratio": 0.0625, "completions/max_length": 1024.0, "completions/max_terminated_length": 431.0, "completions/mean_length": 217.1875, "completions/mean_terminated_length": 163.40000915527344, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.5882573300041258, "epoch": 0.6320474777448071, "grad_norm": 1.6164889335632324, "kl_approx": 0.1867523193359375, "learning_rate": 7.22037903164173e-06, "loss": 0.1187, "num_tokens": 15679477.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2505264282226562, "sampling/importance_sampling_ratio/mean": 1.0003427267074585, "sampling/importance_sampling_ratio/min": 0.831638514995575, "sampling/sampling_logp_difference/max": 0.22356462478637695, "sampling/sampling_logp_difference/mean": 0.009675591252744198, "step": 639 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 784.0, "completions/max_terminated_length": 784.0, "completions/mean_length": 222.0, "completions/mean_terminated_length": 222.0, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.901147891767323, "epoch": 0.6330365974282888, "grad_norm": 2.2240142822265625, "kl_approx": 0.261749267578125, "learning_rate": 7.187196700608373e-06, "loss": 0.196, "num_tokens": 15705037.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1597062349319458, "sampling/importance_sampling_ratio/mean": 0.9998379945755005, "sampling/importance_sampling_ratio/min": 0.8325580358505249, "sampling/sampling_logp_difference/max": 0.18325233459472656, "sampling/sampling_logp_difference/mean": 0.012891811318695545, "step": 640 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 333.0, "completions/max_terminated_length": 333.0, "completions/mean_length": 130.09375, "completions/mean_terminated_length": 130.09375, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.6879884297959507, "epoch": 0.6340257171117705, "grad_norm": 2.3893299102783203, "kl_approx": 0.2635955810546875, "learning_rate": 7.154047967380353e-06, "loss": 0.1558, "num_tokens": 15728424.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1448209285736084, "sampling/importance_sampling_ratio/mean": 0.9995421171188354, "sampling/importance_sampling_ratio/min": 0.8048420548439026, "sampling/sampling_logp_difference/max": 0.21710920333862305, "sampling/sampling_logp_difference/mean": 0.011402375064790249, "step": 641 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 573.0, "completions/max_terminated_length": 573.0, "completions/mean_length": 185.3125, "completions/mean_terminated_length": 185.3125, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.7755086980760098, "epoch": 0.6350148367952523, "grad_norm": 1.7588156461715698, "kl_approx": 0.217620849609375, "learning_rate": 7.120933227905971e-06, "loss": 0.1621, "num_tokens": 15755962.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2022204399108887, "sampling/importance_sampling_ratio/mean": 1.0005110502243042, "sampling/importance_sampling_ratio/min": 0.8383490443229675, "sampling/sampling_logp_difference/max": 0.18417024612426758, "sampling/sampling_logp_difference/mean": 0.012576586566865444, "step": 642 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 886.0, "completions/max_terminated_length": 886.0, "completions/mean_length": 283.25, "completions/mean_terminated_length": 283.25, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.9388721119612455, "epoch": 0.636003956478734, "grad_norm": 2.3089001178741455, "kl_approx": 0.3255615234375, "learning_rate": 7.0878528777274814e-06, "loss": 0.2269, "num_tokens": 15784338.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2269203662872314, "sampling/importance_sampling_ratio/mean": 1.0000643730163574, "sampling/importance_sampling_ratio/min": 0.7914941310882568, "sampling/sampling_logp_difference/max": 0.23383283615112305, "sampling/sampling_logp_difference/mean": 0.012838397175073624, "step": 643 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 698.0, "completions/max_terminated_length": 698.0, "completions/mean_length": 170.625, "completions/mean_terminated_length": 170.625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.6110611706972122, "epoch": 0.6369930761622157, "grad_norm": 1.9851492643356323, "kl_approx": 0.17280960083007812, "learning_rate": 7.05480731197638e-06, "loss": 0.1768, "num_tokens": 15811878.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.142660140991211, "sampling/importance_sampling_ratio/mean": 0.999782145023346, "sampling/importance_sampling_ratio/min": 0.8095329999923706, "sampling/sampling_logp_difference/max": 0.21129775047302246, "sampling/sampling_logp_difference/mean": 0.01113706175237894, "step": 644 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 684.0, "completions/max_terminated_length": 684.0, "completions/mean_length": 156.09375, "completions/mean_terminated_length": 156.09375, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.6056187124922872, "epoch": 0.6379821958456974, "grad_norm": 1.897892713546753, "kl_approx": 0.17324447631835938, "learning_rate": 7.021796925368667e-06, "loss": 0.1442, "num_tokens": 15836249.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.279207468032837, "sampling/importance_sampling_ratio/mean": 0.9998666644096375, "sampling/importance_sampling_ratio/min": 0.8579257130622864, "sampling/sampling_logp_difference/max": 0.24624061584472656, "sampling/sampling_logp_difference/mean": 0.01161828450858593, "step": 645 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 602.0, "completions/max_terminated_length": 602.0, "completions/mean_length": 160.875, "completions/mean_terminated_length": 160.875, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.6442452864721417, "epoch": 0.6389713155291791, "grad_norm": 1.5865906476974487, "kl_approx": 0.16205978393554688, "learning_rate": 6.988822112200157e-06, "loss": 0.1211, "num_tokens": 15858861.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1549502611160278, "sampling/importance_sampling_ratio/mean": 1.000089406967163, "sampling/importance_sampling_ratio/min": 0.8526095151901245, "sampling/sampling_logp_difference/max": 0.1594536304473877, "sampling/sampling_logp_difference/mean": 0.013659929856657982, "step": 646 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 448.0, "completions/max_terminated_length": 448.0, "completions/mean_length": 109.59375, "completions/mean_terminated_length": 109.59375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.6200515534728765, "epoch": 0.6399604352126608, "grad_norm": 4.2072906494140625, "kl_approx": 0.32865142822265625, "learning_rate": 6.955883266341741e-06, "loss": 0.2168, "num_tokens": 15878768.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1549590826034546, "sampling/importance_sampling_ratio/mean": 0.9997337460517883, "sampling/importance_sampling_ratio/min": 0.8218267560005188, "sampling/sampling_logp_difference/max": 0.19622564315795898, "sampling/sampling_logp_difference/mean": 0.011357633396983147, "step": 647 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 611.0, "completions/max_terminated_length": 611.0, "completions/mean_length": 130.71875, "completions/mean_terminated_length": 130.71875, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.6258649337105453, "epoch": 0.6409495548961425, "grad_norm": 2.509195566177368, "kl_approx": 0.2386322021484375, "learning_rate": 6.9229807812346985e-06, "loss": 0.1748, "num_tokens": 15901039.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2174142599105835, "sampling/importance_sampling_ratio/mean": 1.0012444257736206, "sampling/importance_sampling_ratio/min": 0.8470548391342163, "sampling/sampling_logp_difference/max": 0.19672918319702148, "sampling/sampling_logp_difference/mean": 0.01189382839947939, "step": 648 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 892.0, "completions/max_terminated_length": 892.0, "completions/mean_length": 308.53125, "completions/mean_terminated_length": 308.53125, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.9972798796370625, "epoch": 0.6419386745796242, "grad_norm": 1.964637279510498, "kl_approx": 0.2167806625366211, "learning_rate": 6.890115049885995e-06, "loss": 0.1676, "num_tokens": 15926496.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2115670442581177, "sampling/importance_sampling_ratio/mean": 0.9998757839202881, "sampling/importance_sampling_ratio/min": 0.7956290245056152, "sampling/sampling_logp_difference/max": 0.2286221981048584, "sampling/sampling_logp_difference/mean": 0.016789259389042854, "step": 649 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 429.0, "completions/max_terminated_length": 429.0, "completions/mean_length": 131.84375, "completions/mean_terminated_length": 131.84375, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.5418639220297337, "epoch": 0.6429277942631059, "grad_norm": 1.5432546138763428, "kl_approx": 0.12742233276367188, "learning_rate": 6.85728646486359e-06, "loss": 0.102, "num_tokens": 15951347.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1296306848526, "sampling/importance_sampling_ratio/mean": 0.9996090531349182, "sampling/importance_sampling_ratio/min": 0.8664709329605103, "sampling/sampling_logp_difference/max": 0.1433267593383789, "sampling/sampling_logp_difference/mean": 0.009775093756616116, "step": 650 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 471.0, "completions/max_terminated_length": 471.0, "completions/mean_length": 161.5, "completions/mean_terminated_length": 161.5, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.7964565558359027, "epoch": 0.6439169139465876, "grad_norm": 2.0201094150543213, "kl_approx": 0.24346923828125, "learning_rate": 6.824495418291741e-06, "loss": 0.1934, "num_tokens": 15978107.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2065564393997192, "sampling/importance_sampling_ratio/mean": 0.9999898672103882, "sampling/importance_sampling_ratio/min": 0.836685836315155, "sampling/sampling_logp_difference/max": 0.18777036666870117, "sampling/sampling_logp_difference/mean": 0.01360243372619152, "step": 651 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 482.0, "completions/max_terminated_length": 482.0, "completions/mean_length": 207.375, "completions/mean_terminated_length": 207.375, "completions/min_length": 95.0, "completions/min_terminated_length": 95.0, "entropy": 0.7333090072497725, "epoch": 0.6449060336300693, "grad_norm": 2.1460556983947754, "kl_approx": 0.271148681640625, "learning_rate": 6.791742301846325e-06, "loss": 0.2044, "num_tokens": 16004615.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2303056716918945, "sampling/importance_sampling_ratio/mean": 1.000614047050476, "sampling/importance_sampling_ratio/min": 0.8372134566307068, "sampling/sampling_logp_difference/max": 0.20726263523101807, "sampling/sampling_logp_difference/mean": 0.012207819148898125, "step": 652 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 947.0, "completions/max_terminated_length": 947.0, "completions/mean_length": 251.28125, "completions/mean_terminated_length": 251.28125, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.8379035471007228, "epoch": 0.645895153313551, "grad_norm": 3.100879192352295, "kl_approx": 0.3185577392578125, "learning_rate": 6.759027506750159e-06, "loss": 0.301, "num_tokens": 16032088.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2558789253234863, "sampling/importance_sampling_ratio/mean": 0.999736487865448, "sampling/importance_sampling_ratio/min": 0.8254403471946716, "sampling/sampling_logp_difference/max": 0.22783565521240234, "sampling/sampling_logp_difference/mean": 0.013171770609915257, "step": 653 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 454.0, "completions/max_terminated_length": 454.0, "completions/mean_length": 174.125, "completions/mean_terminated_length": 174.125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.597307953517884, "epoch": 0.6468842729970327, "grad_norm": 1.5065608024597168, "kl_approx": 0.1439971923828125, "learning_rate": 6.726351423768323e-06, "loss": 0.1285, "num_tokens": 16059692.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1700927019119263, "sampling/importance_sampling_ratio/mean": 1.0003399848937988, "sampling/importance_sampling_ratio/min": 0.8503222465515137, "sampling/sampling_logp_difference/max": 0.162139892578125, "sampling/sampling_logp_difference/mean": 0.010787849314510822, "step": 654 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 648.0, "completions/max_terminated_length": 648.0, "completions/mean_length": 225.5, "completions/mean_terminated_length": 225.5, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.7377875717356801, "epoch": 0.6478733926805144, "grad_norm": 2.072943925857544, "kl_approx": 0.2168731689453125, "learning_rate": 6.693714443203507e-06, "loss": 0.1877, "num_tokens": 16086644.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1849851608276367, "sampling/importance_sampling_ratio/mean": 1.0002585649490356, "sampling/importance_sampling_ratio/min": 0.8598591089248657, "sampling/sampling_logp_difference/max": 0.16973018646240234, "sampling/sampling_logp_difference/mean": 0.01091102696955204, "step": 655 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 763.0, "completions/mean_length": 236.53125, "completions/mean_terminated_length": 211.1290283203125, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.8413883647881448, "epoch": 0.6488625123639961, "grad_norm": 2.15675950050354, "kl_approx": 0.2840728759765625, "learning_rate": 6.661116954891329e-06, "loss": 0.1843, "num_tokens": 16116525.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.215958595275879, "sampling/importance_sampling_ratio/mean": 1.0003724098205566, "sampling/importance_sampling_ratio/min": 0.7918376922607422, "sampling/sampling_logp_difference/max": 0.2333989143371582, "sampling/sampling_logp_difference/mean": 0.014399784617125988, "step": 656 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 562.0, "completions/max_terminated_length": 562.0, "completions/mean_length": 143.8125, "completions/mean_terminated_length": 143.8125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6416964530944824, "epoch": 0.6498516320474778, "grad_norm": 1.8081210851669312, "kl_approx": 0.245758056640625, "learning_rate": 6.62855934819569e-06, "loss": 0.1405, "num_tokens": 16143583.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.179263710975647, "sampling/importance_sampling_ratio/mean": 0.9998356103897095, "sampling/importance_sampling_ratio/min": 0.8487025499343872, "sampling/sampling_logp_difference/max": 0.16489028930664062, "sampling/sampling_logp_difference/mean": 0.011724667623639107, "step": 657 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 748.0, "completions/max_terminated_length": 748.0, "completions/mean_length": 258.4375, "completions/mean_terminated_length": 258.4375, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.8257346376776695, "epoch": 0.6508407517309595, "grad_norm": 1.8513532876968384, "kl_approx": 0.2386322021484375, "learning_rate": 6.59604201200412e-06, "loss": 0.1747, "num_tokens": 16171445.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1798486709594727, "sampling/importance_sampling_ratio/mean": 1.0002458095550537, "sampling/importance_sampling_ratio/min": 0.8793408870697021, "sampling/sampling_logp_difference/max": 0.16538619995117188, "sampling/sampling_logp_difference/mean": 0.01271883212029934, "step": 658 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 821.0, "completions/max_terminated_length": 821.0, "completions/mean_length": 238.0, "completions/mean_terminated_length": 238.0, "completions/min_length": 27.0, "completions/min_terminated_length": 27.0, "entropy": 0.9720107633620501, "epoch": 0.6518298714144412, "grad_norm": 3.6394031047821045, "kl_approx": 0.3328571319580078, "learning_rate": 6.563565334723134e-06, "loss": 0.2446, "num_tokens": 16199797.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.243587851524353, "sampling/importance_sampling_ratio/mean": 1.0000886917114258, "sampling/importance_sampling_ratio/min": 0.8605039119720459, "sampling/sampling_logp_difference/max": 0.2180006504058838, "sampling/sampling_logp_difference/mean": 0.014547761529684067, "step": 659 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 717.0, "completions/max_terminated_length": 717.0, "completions/mean_length": 121.46875, "completions/mean_terminated_length": 121.46875, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.697448190767318, "epoch": 0.6528189910979229, "grad_norm": 1.810437560081482, "kl_approx": 0.2376556396484375, "learning_rate": 6.5311297042736046e-06, "loss": 0.1624, "num_tokens": 16222868.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.198509693145752, "sampling/importance_sampling_ratio/mean": 0.9992061257362366, "sampling/importance_sampling_ratio/min": 0.781260073184967, "sampling/sampling_logp_difference/max": 0.24684715270996094, "sampling/sampling_logp_difference/mean": 0.011594805866479874, "step": 660 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 287.0, "completions/max_terminated_length": 287.0, "completions/mean_length": 99.03125, "completions/mean_terminated_length": 99.03125, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.6001575314439833, "epoch": 0.6538081107814046, "grad_norm": 2.182196855545044, "kl_approx": 0.18725204467773438, "learning_rate": 6.498735508086094e-06, "loss": 0.1214, "num_tokens": 16243493.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1983182430267334, "sampling/importance_sampling_ratio/mean": 1.0002326965332031, "sampling/importance_sampling_ratio/min": 0.8552079200744629, "sampling/sampling_logp_difference/max": 0.18091917037963867, "sampling/sampling_logp_difference/mean": 0.01050076074898243, "step": 661 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 317.0, "completions/max_terminated_length": 317.0, "completions/mean_length": 111.125, "completions/mean_terminated_length": 111.125, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.6315350527875125, "epoch": 0.6547972304648862, "grad_norm": 1.7004626989364624, "kl_approx": 0.1863422393798828, "learning_rate": 6.466383133096268e-06, "loss": 0.1405, "num_tokens": 16267977.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1437056064605713, "sampling/importance_sampling_ratio/mean": 0.9996813535690308, "sampling/importance_sampling_ratio/min": 0.8598636984825134, "sampling/sampling_logp_difference/max": 0.15098142623901367, "sampling/sampling_logp_difference/mean": 0.011454214341938496, "step": 662 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 747.0, "completions/max_terminated_length": 747.0, "completions/mean_length": 135.65625, "completions/mean_terminated_length": 135.65625, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.5300156660377979, "epoch": 0.655786350148368, "grad_norm": 1.7368031740188599, "kl_approx": 0.1645050048828125, "learning_rate": 6.4340729657402424e-06, "loss": 0.1135, "num_tokens": 16288270.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1585923433303833, "sampling/importance_sampling_ratio/mean": 1.0000848770141602, "sampling/importance_sampling_ratio/min": 0.8204588890075684, "sampling/sampling_logp_difference/max": 0.1978914737701416, "sampling/sampling_logp_difference/mean": 0.010393654927611351, "step": 663 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 867.0, "completions/max_terminated_length": 867.0, "completions/mean_length": 212.375, "completions/mean_terminated_length": 212.375, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.7630083784461021, "epoch": 0.6567754698318496, "grad_norm": 1.9503540992736816, "kl_approx": 0.24407958984375, "learning_rate": 6.40180539194999e-06, "loss": 0.1692, "num_tokens": 16316394.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2565909624099731, "sampling/importance_sampling_ratio/mean": 1.000244379043579, "sampling/importance_sampling_ratio/min": 0.7996771335601807, "sampling/sampling_logp_difference/max": 0.22840237617492676, "sampling/sampling_logp_difference/mean": 0.012520347721874714, "step": 664 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 130.0, "completions/max_terminated_length": 130.0, "completions/mean_length": 82.21875, "completions/mean_terminated_length": 82.21875, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.4507416835986078, "epoch": 0.6577645895153313, "grad_norm": 1.7299779653549194, "kl_approx": 0.13961410522460938, "learning_rate": 6.3695807971487175e-06, "loss": 0.0982, "num_tokens": 16339537.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1368650197982788, "sampling/importance_sampling_ratio/mean": 0.999998927116394, "sampling/importance_sampling_ratio/min": 0.8743762969970703, "sampling/sampling_logp_difference/max": 0.13424444198608398, "sampling/sampling_logp_difference/mean": 0.008559789508581161, "step": 665 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 516.0, "completions/max_terminated_length": 516.0, "completions/mean_length": 133.71875, "completions/mean_terminated_length": 133.71875, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.8744213725440204, "epoch": 0.658753709198813, "grad_norm": 2.934335231781006, "kl_approx": 0.31048583984375, "learning_rate": 6.337399566246257e-06, "loss": 0.2562, "num_tokens": 16362416.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1952286958694458, "sampling/importance_sampling_ratio/mean": 0.9998270273208618, "sampling/importance_sampling_ratio/min": 0.8684553503990173, "sampling/sampling_logp_difference/max": 0.17833757400512695, "sampling/sampling_logp_difference/mean": 0.013648797757923603, "step": 666 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 252.0, "completions/max_terminated_length": 252.0, "completions/mean_length": 124.78125, "completions/mean_terminated_length": 124.78125, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.742201098240912, "epoch": 0.6597428288822947, "grad_norm": 3.431886672973633, "kl_approx": 0.2724456787109375, "learning_rate": 6.305262083634488e-06, "loss": 0.2302, "num_tokens": 16381265.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1986229419708252, "sampling/importance_sampling_ratio/mean": 0.9997463226318359, "sampling/importance_sampling_ratio/min": 0.8676732778549194, "sampling/sampling_logp_difference/max": 0.18117332458496094, "sampling/sampling_logp_difference/mean": 0.011365112848579884, "step": 667 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 658.0, "completions/max_terminated_length": 658.0, "completions/mean_length": 174.625, "completions/mean_terminated_length": 174.625, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.7519194353371859, "epoch": 0.6607319485657764, "grad_norm": 3.294677734375, "kl_approx": 0.28632354736328125, "learning_rate": 6.2731687331827214e-06, "loss": 0.2085, "num_tokens": 16405661.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1837395429611206, "sampling/importance_sampling_ratio/mean": 0.999992311000824, "sampling/importance_sampling_ratio/min": 0.8354623913764954, "sampling/sampling_logp_difference/max": 0.17976999282836914, "sampling/sampling_logp_difference/mean": 0.012620596215128899, "step": 668 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 615.0, "completions/max_terminated_length": 615.0, "completions/mean_length": 195.65625, "completions/mean_terminated_length": 195.65625, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.7019930323585868, "epoch": 0.6617210682492581, "grad_norm": 2.154927968978882, "kl_approx": 0.24155426025390625, "learning_rate": 6.2411198982331435e-06, "loss": 0.1838, "num_tokens": 16427882.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1980926990509033, "sampling/importance_sampling_ratio/mean": 0.9999521374702454, "sampling/importance_sampling_ratio/min": 0.8553062081336975, "sampling/sampling_logp_difference/max": 0.18073081970214844, "sampling/sampling_logp_difference/mean": 0.012059693224728107, "step": 669 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 959.0, "completions/max_terminated_length": 959.0, "completions/mean_length": 261.75, "completions/mean_terminated_length": 261.75, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.6750096492469311, "epoch": 0.6627101879327398, "grad_norm": 1.870595932006836, "kl_approx": 0.22088623046875, "learning_rate": 6.209115961596208e-06, "loss": 0.1564, "num_tokens": 16452170.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1746572256088257, "sampling/importance_sampling_ratio/mean": 0.9997072219848633, "sampling/importance_sampling_ratio/min": 0.7792959809303284, "sampling/sampling_logp_difference/max": 0.24936437606811523, "sampling/sampling_logp_difference/mean": 0.010762332007288933, "step": 670 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 656.0, "completions/max_terminated_length": 656.0, "completions/mean_length": 232.59375, "completions/mean_terminated_length": 232.59375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6972714886069298, "epoch": 0.6636993076162215, "grad_norm": 2.5327088832855225, "kl_approx": 0.22210693359375, "learning_rate": 6.177157305546077e-06, "loss": 0.1665, "num_tokens": 16483517.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1988061666488647, "sampling/importance_sampling_ratio/mean": 1.000016689300537, "sampling/importance_sampling_ratio/min": 0.7921888828277588, "sampling/sampling_logp_difference/max": 0.2329554557800293, "sampling/sampling_logp_difference/mean": 0.011699660681188107, "step": 671 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 870.0, "completions/max_terminated_length": 870.0, "completions/mean_length": 346.0, "completions/mean_terminated_length": 346.0, "completions/min_length": 99.0, "completions/min_terminated_length": 99.0, "entropy": 0.985559425316751, "epoch": 0.6646884272997032, "grad_norm": 1.6169816255569458, "kl_approx": 0.2523040771484375, "learning_rate": 6.145244311816063e-06, "loss": 0.1891, "num_tokens": 16520645.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2041912078857422, "sampling/importance_sampling_ratio/mean": 0.9999783039093018, "sampling/importance_sampling_ratio/min": 0.8131352066993713, "sampling/sampling_logp_difference/max": 0.20685791969299316, "sampling/sampling_logp_difference/mean": 0.013155071064829826, "step": 672 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 407.0, "completions/max_terminated_length": 407.0, "completions/mean_length": 121.6875, "completions/mean_terminated_length": 121.6875, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.6703711310401559, "epoch": 0.6656775469831849, "grad_norm": 1.8550522327423096, "kl_approx": 0.22939109802246094, "learning_rate": 6.113377361594048e-06, "loss": 0.1684, "num_tokens": 16537763.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.145963430404663, "sampling/importance_sampling_ratio/mean": 1.0007998943328857, "sampling/importance_sampling_ratio/min": 0.8365666270256042, "sampling/sampling_logp_difference/max": 0.17844915390014648, "sampling/sampling_logp_difference/mean": 0.012082815170288086, "step": 673 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 774.0, "completions/max_terminated_length": 774.0, "completions/mean_length": 295.8125, "completions/mean_terminated_length": 295.8125, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.9278810694813728, "epoch": 0.6666666666666666, "grad_norm": 2.482938289642334, "kl_approx": 0.292755126953125, "learning_rate": 6.081556835517955e-06, "loss": 0.2573, "num_tokens": 16570189.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2654168605804443, "sampling/importance_sampling_ratio/mean": 0.9996436834335327, "sampling/importance_sampling_ratio/min": 0.7990086078643799, "sampling/sampling_logp_difference/max": 0.23540163040161133, "sampling/sampling_logp_difference/mean": 0.015031658113002777, "step": 674 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 650.0, "completions/max_terminated_length": 650.0, "completions/mean_length": 225.03125, "completions/mean_terminated_length": 225.03125, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.7513796188868582, "epoch": 0.6676557863501483, "grad_norm": 1.4848910570144653, "kl_approx": 0.200775146484375, "learning_rate": 6.049783113671184e-06, "loss": 0.1467, "num_tokens": 16594246.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1989006996154785, "sampling/importance_sampling_ratio/mean": 0.9999608993530273, "sampling/importance_sampling_ratio/min": 0.8261046409606934, "sampling/sampling_logp_difference/max": 0.19103384017944336, "sampling/sampling_logp_difference/mean": 0.012400860898196697, "step": 675 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 933.0, "completions/max_terminated_length": 933.0, "completions/mean_length": 338.34375, "completions/mean_terminated_length": 338.34375, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.8521588742733002, "epoch": 0.66864490603363, "grad_norm": 1.6712559461593628, "kl_approx": 0.1952056884765625, "learning_rate": 6.018056575578075e-06, "loss": 0.1492, "num_tokens": 16628873.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1950995922088623, "sampling/importance_sampling_ratio/mean": 0.9999462366104126, "sampling/importance_sampling_ratio/min": 0.8042207956314087, "sampling/sampling_logp_difference/max": 0.217881441116333, "sampling/sampling_logp_difference/mean": 0.014322958886623383, "step": 676 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 556.0, "completions/max_terminated_length": 556.0, "completions/mean_length": 235.96875, "completions/mean_terminated_length": 235.96875, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.977389620617032, "epoch": 0.6696340257171117, "grad_norm": 2.052370548248291, "kl_approx": 0.265869140625, "learning_rate": 5.986377600199371e-06, "loss": 0.2, "num_tokens": 16652144.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1720871925354004, "sampling/importance_sampling_ratio/mean": 0.9993172287940979, "sampling/importance_sampling_ratio/min": 0.8372893333435059, "sampling/sampling_logp_difference/max": 0.17758560180664062, "sampling/sampling_logp_difference/mean": 0.013881448656320572, "step": 677 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 746.0, "completions/max_terminated_length": 746.0, "completions/mean_length": 252.5, "completions/mean_terminated_length": 252.5, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.5531669370830059, "epoch": 0.6706231454005934, "grad_norm": 1.6137312650680542, "kl_approx": 0.15290260314941406, "learning_rate": 5.9547465659277215e-06, "loss": 0.1155, "num_tokens": 16682928.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2601896524429321, "sampling/importance_sampling_ratio/mean": 0.9999955296516418, "sampling/importance_sampling_ratio/min": 0.8337145447731018, "sampling/sampling_logp_difference/max": 0.23126220703125, "sampling/sampling_logp_difference/mean": 0.009610115550458431, "step": 678 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 298.0, "completions/max_terminated_length": 298.0, "completions/mean_length": 150.84375, "completions/mean_terminated_length": 150.84375, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.8061395278200507, "epoch": 0.6716122650840751, "grad_norm": 1.9131525754928589, "kl_approx": 0.2916259765625, "learning_rate": 5.923163850583114e-06, "loss": 0.1841, "num_tokens": 16707107.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2328027486801147, "sampling/importance_sampling_ratio/mean": 0.9999573826789856, "sampling/importance_sampling_ratio/min": 0.8503806591033936, "sampling/sampling_logp_difference/max": 0.2092902660369873, "sampling/sampling_logp_difference/mean": 0.013578150421380997, "step": 679 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 524.0, "completions/max_terminated_length": 524.0, "completions/mean_length": 138.59375, "completions/mean_terminated_length": 138.59375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.893072041682899, "epoch": 0.6726013847675568, "grad_norm": 2.0414795875549316, "kl_approx": 0.2912139892578125, "learning_rate": 5.891629831408392e-06, "loss": 0.2169, "num_tokens": 16728182.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1665488481521606, "sampling/importance_sampling_ratio/mean": 1.0001707077026367, "sampling/importance_sampling_ratio/min": 0.8152920603752136, "sampling/sampling_logp_difference/max": 0.2042088508605957, "sampling/sampling_logp_difference/mean": 0.014089570380747318, "step": 680 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 371.0, "completions/max_terminated_length": 371.0, "completions/mean_length": 128.875, "completions/mean_terminated_length": 128.875, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.6966472892090678, "epoch": 0.6735905044510386, "grad_norm": 2.655102491378784, "kl_approx": 0.23685455322265625, "learning_rate": 5.8601448850647515e-06, "loss": 0.1956, "num_tokens": 16751906.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2010555267333984, "sampling/importance_sampling_ratio/mean": 0.999443531036377, "sampling/importance_sampling_ratio/min": 0.8050841689109802, "sampling/sampling_logp_difference/max": 0.21680843830108643, "sampling/sampling_logp_difference/mean": 0.011995331384241581, "step": 681 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 364.0, "completions/max_terminated_length": 364.0, "completions/mean_length": 146.15625, "completions/mean_terminated_length": 146.15625, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.699067298322916, "epoch": 0.6745796241345203, "grad_norm": 4.282808303833008, "kl_approx": 0.3572845458984375, "learning_rate": 5.828709387627219e-06, "loss": 0.2367, "num_tokens": 16780239.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2913297414779663, "sampling/importance_sampling_ratio/mean": 1.000136137008667, "sampling/importance_sampling_ratio/min": 0.8549571633338928, "sampling/sampling_logp_difference/max": 0.2556724548339844, "sampling/sampling_logp_difference/mean": 0.013168604113161564, "step": 682 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 404.0, "completions/max_terminated_length": 404.0, "completions/mean_length": 161.78125, "completions/mean_terminated_length": 161.78125, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.6467228839173913, "epoch": 0.675568743818002, "grad_norm": 1.7977911233901978, "kl_approx": 0.17315292358398438, "learning_rate": 5.797323714580192e-06, "loss": 0.1669, "num_tokens": 16807984.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.212809443473816, "sampling/importance_sampling_ratio/mean": 1.0004347562789917, "sampling/importance_sampling_ratio/min": 0.847221851348877, "sampling/sampling_logp_difference/max": 0.19293951988220215, "sampling/sampling_logp_difference/mean": 0.011398005299270153, "step": 683 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 417.0, "completions/max_terminated_length": 417.0, "completions/mean_length": 180.90625, "completions/mean_terminated_length": 180.90625, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 1.0131343454122543, "epoch": 0.6765578635014837, "grad_norm": 2.5040535926818848, "kl_approx": 0.298614501953125, "learning_rate": 5.7659882408129204e-06, "loss": 0.2515, "num_tokens": 16833813.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1798731088638306, "sampling/importance_sampling_ratio/mean": 0.9999813437461853, "sampling/importance_sampling_ratio/min": 0.8238321542739868, "sampling/sampling_logp_difference/max": 0.1937885284423828, "sampling/sampling_logp_difference/mean": 0.01569077931344509, "step": 684 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 454.0, "completions/max_terminated_length": 454.0, "completions/mean_length": 123.3125, "completions/mean_terminated_length": 123.3125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.7326708505861461, "epoch": 0.6775469831849654, "grad_norm": 2.048633575439453, "kl_approx": 0.20919036865234375, "learning_rate": 5.7347033406150494e-06, "loss": 0.1651, "num_tokens": 16854583.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1396355628967285, "sampling/importance_sampling_ratio/mean": 1.0005024671554565, "sampling/importance_sampling_ratio/min": 0.8401199579238892, "sampling/sampling_logp_difference/max": 0.1742105484008789, "sampling/sampling_logp_difference/mean": 0.01363490242511034, "step": 685 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 500.0, "completions/max_terminated_length": 500.0, "completions/mean_length": 143.4375, "completions/mean_terminated_length": 143.4375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.6245870748534799, "epoch": 0.6785361028684471, "grad_norm": 1.850450038909912, "kl_approx": 0.20447540283203125, "learning_rate": 5.703469387672138e-06, "loss": 0.1459, "num_tokens": 16878981.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1676069498062134, "sampling/importance_sampling_ratio/mean": 0.9999544024467468, "sampling/importance_sampling_ratio/min": 0.8015357255935669, "sampling/sampling_logp_difference/max": 0.22122573852539062, "sampling/sampling_logp_difference/mean": 0.011332322843372822, "step": 686 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 659.0, "completions/max_terminated_length": 659.0, "completions/mean_length": 252.53125, "completions/mean_terminated_length": 252.53125, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.8220858331769705, "epoch": 0.6795252225519288, "grad_norm": 2.1670217514038086, "kl_approx": 0.24298095703125, "learning_rate": 5.672286755061212e-06, "loss": 0.2111, "num_tokens": 16907574.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.4043596982955933, "sampling/importance_sampling_ratio/mean": 1.0000468492507935, "sampling/importance_sampling_ratio/min": 0.8283004760742188, "sampling/sampling_logp_difference/max": 0.3395814895629883, "sampling/sampling_logp_difference/mean": 0.013959219679236412, "step": 687 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 864.0, "completions/max_terminated_length": 864.0, "completions/mean_length": 257.5625, "completions/mean_terminated_length": 257.5625, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.908999371342361, "epoch": 0.6805143422354105, "grad_norm": 1.9998031854629517, "kl_approx": 0.2582244873046875, "learning_rate": 5.64115581524629e-06, "loss": 0.1867, "num_tokens": 16931880.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2089821100234985, "sampling/importance_sampling_ratio/mean": 0.9997066259384155, "sampling/importance_sampling_ratio/min": 0.8097984790802002, "sampling/sampling_logp_difference/max": 0.2109699249267578, "sampling/sampling_logp_difference/mean": 0.014306875877082348, "step": 688 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 766.0, "completions/max_terminated_length": 766.0, "completions/mean_length": 248.78125, "completions/mean_terminated_length": 248.78125, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7392207747325301, "epoch": 0.6815034619188922, "grad_norm": 2.639265537261963, "kl_approx": 0.20278167724609375, "learning_rate": 5.610076940073939e-06, "loss": 0.1547, "num_tokens": 16962161.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2400693893432617, "sampling/importance_sampling_ratio/mean": 1.0001662969589233, "sampling/importance_sampling_ratio/min": 0.7904531359672546, "sampling/sampling_logp_difference/max": 0.23514890670776367, "sampling/sampling_logp_difference/mean": 0.012279963120818138, "step": 689 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 404.0, "completions/max_terminated_length": 404.0, "completions/mean_length": 95.0, "completions/mean_terminated_length": 95.0, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.49650940485298634, "epoch": 0.6824925816023739, "grad_norm": 2.586862802505493, "kl_approx": 0.17627334594726562, "learning_rate": 5.579050500768837e-06, "loss": 0.1871, "num_tokens": 16981985.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1882588863372803, "sampling/importance_sampling_ratio/mean": 1.001003384590149, "sampling/importance_sampling_ratio/min": 0.8635891675949097, "sampling/sampling_logp_difference/max": 0.17248916625976562, "sampling/sampling_logp_difference/mean": 0.010161474347114563, "step": 690 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 473.0, "completions/max_terminated_length": 473.0, "completions/mean_length": 142.71875, "completions/mean_terminated_length": 142.71875, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.6273368513211608, "epoch": 0.6834817012858556, "grad_norm": 2.0213265419006348, "kl_approx": 0.18071746826171875, "learning_rate": 5.548076867929331e-06, "loss": 0.1266, "num_tokens": 17006808.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2206013202667236, "sampling/importance_sampling_ratio/mean": 1.0003831386566162, "sampling/importance_sampling_ratio/min": 0.872924268245697, "sampling/sampling_logp_difference/max": 0.19934368133544922, "sampling/sampling_logp_difference/mean": 0.011572515591979027, "step": 691 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 697.0, "completions/max_terminated_length": 697.0, "completions/mean_length": 198.0625, "completions/mean_terminated_length": 198.0625, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.8198657957836986, "epoch": 0.6844708209693373, "grad_norm": 1.6920475959777832, "kl_approx": 0.25177764892578125, "learning_rate": 5.517156411523026e-06, "loss": 0.1535, "num_tokens": 17034490.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1799997091293335, "sampling/importance_sampling_ratio/mean": 0.9997847080230713, "sampling/importance_sampling_ratio/min": 0.7651422619819641, "sampling/sampling_logp_difference/max": 0.26769351959228516, "sampling/sampling_logp_difference/mean": 0.01438207644969225, "step": 692 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 775.0, "completions/max_terminated_length": 775.0, "completions/mean_length": 144.5625, "completions/mean_terminated_length": 144.5625, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.5664798924699426, "epoch": 0.685459940652819, "grad_norm": 1.6384161710739136, "kl_approx": 0.14039325714111328, "learning_rate": 5.486289500882355e-06, "loss": 0.1101, "num_tokens": 17055492.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1811422109603882, "sampling/importance_sampling_ratio/mean": 0.9996535778045654, "sampling/importance_sampling_ratio/min": 0.8439462184906006, "sampling/sampling_logp_difference/max": 0.16966652870178223, "sampling/sampling_logp_difference/mean": 0.0111918356269598, "step": 693 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 703.0, "completions/max_terminated_length": 703.0, "completions/mean_length": 220.125, "completions/mean_terminated_length": 220.125, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.9930025357753038, "epoch": 0.6864490603363007, "grad_norm": 2.412123441696167, "kl_approx": 0.3406524658203125, "learning_rate": 5.455476504700161e-06, "loss": 0.2504, "num_tokens": 17083488.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2214339971542358, "sampling/importance_sampling_ratio/mean": 1.0001219511032104, "sampling/importance_sampling_ratio/min": 0.7032812237739563, "sampling/sampling_logp_difference/max": 0.3519984483718872, "sampling/sampling_logp_difference/mean": 0.012874433770775795, "step": 694 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 411.0, "completions/max_terminated_length": 411.0, "completions/mean_length": 161.5625, "completions/mean_terminated_length": 161.5625, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.7766533298417926, "epoch": 0.6874381800197824, "grad_norm": 2.337846279144287, "kl_approx": 0.274566650390625, "learning_rate": 5.424717791025302e-06, "loss": 0.2198, "num_tokens": 17105122.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1454657316207886, "sampling/importance_sampling_ratio/mean": 1.0005782842636108, "sampling/importance_sampling_ratio/min": 0.860297679901123, "sampling/sampling_logp_difference/max": 0.15047681331634521, "sampling/sampling_logp_difference/mean": 0.0133687574416399, "step": 695 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 600.0, "completions/max_terminated_length": 600.0, "completions/mean_length": 187.4375, "completions/mean_terminated_length": 187.4375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.6425126185640693, "epoch": 0.6884272997032641, "grad_norm": 1.7324891090393066, "kl_approx": 0.20236968994140625, "learning_rate": 5.3940137272582534e-06, "loss": 0.1372, "num_tokens": 17131584.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1743192672729492, "sampling/importance_sampling_ratio/mean": 0.9999248385429382, "sampling/importance_sampling_ratio/min": 0.8291975259780884, "sampling/sampling_logp_difference/max": 0.18729686737060547, "sampling/sampling_logp_difference/mean": 0.01064116507768631, "step": 696 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 273.0, "completions/max_terminated_length": 273.0, "completions/mean_length": 115.6875, "completions/mean_terminated_length": 115.6875, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.5514995553530753, "epoch": 0.6894164193867458, "grad_norm": 2.105938673019409, "kl_approx": 0.20313262939453125, "learning_rate": 5.3633646801467255e-06, "loss": 0.1341, "num_tokens": 17156566.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2537693977355957, "sampling/importance_sampling_ratio/mean": 0.9999144077301025, "sampling/importance_sampling_ratio/min": 0.8477326035499573, "sampling/sampling_logp_difference/max": 0.22615456581115723, "sampling/sampling_logp_difference/mean": 0.009097455069422722, "step": 697 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 342.0, "completions/max_terminated_length": 342.0, "completions/mean_length": 109.28125, "completions/mean_terminated_length": 109.28125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.5524155776947737, "epoch": 0.6904055390702275, "grad_norm": 1.8628588914871216, "kl_approx": 0.21455764770507812, "learning_rate": 5.332771015781275e-06, "loss": 0.1457, "num_tokens": 17173879.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1661877632141113, "sampling/importance_sampling_ratio/mean": 1.0002129077911377, "sampling/importance_sampling_ratio/min": 0.838773787021637, "sampling/sampling_logp_difference/max": 0.17581427097320557, "sampling/sampling_logp_difference/mean": 0.010252139531075954, "step": 698 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 605.0, "completions/max_terminated_length": 605.0, "completions/mean_length": 283.46875, "completions/mean_terminated_length": 283.46875, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.7026379415765405, "epoch": 0.6913946587537092, "grad_norm": 1.7159472703933716, "kl_approx": 0.2202301025390625, "learning_rate": 5.302233099590928e-06, "loss": 0.1592, "num_tokens": 17203070.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2635583877563477, "sampling/importance_sampling_ratio/mean": 1.0000941753387451, "sampling/importance_sampling_ratio/min": 0.8079586029052734, "sampling/sampling_logp_difference/max": 0.2339317798614502, "sampling/sampling_logp_difference/mean": 0.01164521835744381, "step": 699 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 457.0, "completions/max_terminated_length": 457.0, "completions/mean_length": 164.53125, "completions/mean_terminated_length": 164.53125, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.6590499868616462, "epoch": 0.6923837784371909, "grad_norm": 2.0870885848999023, "kl_approx": 0.23033523559570312, "learning_rate": 5.271751296338823e-06, "loss": 0.196, "num_tokens": 17224367.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1630685329437256, "sampling/importance_sampling_ratio/mean": 1.0000333786010742, "sampling/importance_sampling_ratio/min": 0.8070629835128784, "sampling/sampling_logp_difference/max": 0.2143535614013672, "sampling/sampling_logp_difference/mean": 0.0121611962094903, "step": 700 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 760.0, "completions/max_terminated_length": 760.0, "completions/mean_length": 229.40625, "completions/mean_terminated_length": 229.40625, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.8094455217942595, "epoch": 0.6933728981206726, "grad_norm": 2.7117695808410645, "kl_approx": 0.304656982421875, "learning_rate": 5.241325970117851e-06, "loss": 0.2246, "num_tokens": 17249844.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.221415400505066, "sampling/importance_sampling_ratio/mean": 0.9999625086784363, "sampling/importance_sampling_ratio/min": 0.8136202096939087, "sampling/sampling_logp_difference/max": 0.20626163482666016, "sampling/sampling_logp_difference/mean": 0.01404689159244299, "step": 701 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 481.0, "completions/max_terminated_length": 481.0, "completions/mean_length": 192.6875, "completions/mean_terminated_length": 192.6875, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6370523474179208, "epoch": 0.6943620178041543, "grad_norm": 1.5727230310440063, "kl_approx": 0.18073654174804688, "learning_rate": 5.210957484346314e-06, "loss": 0.1356, "num_tokens": 17269370.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1778773069381714, "sampling/importance_sampling_ratio/mean": 1.0000337362289429, "sampling/importance_sampling_ratio/min": 0.8284472227096558, "sampling/sampling_logp_difference/max": 0.1882021427154541, "sampling/sampling_logp_difference/mean": 0.012226586230099201, "step": 702 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 793.0, "completions/max_terminated_length": 793.0, "completions/mean_length": 227.5, "completions/mean_terminated_length": 227.5, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.7645169934257865, "epoch": 0.695351137487636, "grad_norm": 2.1061806678771973, "kl_approx": 0.23754501342773438, "learning_rate": 5.1806462017635775e-06, "loss": 0.1736, "num_tokens": 17298330.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2279335260391235, "sampling/importance_sampling_ratio/mean": 1.0000475645065308, "sampling/importance_sampling_ratio/min": 0.7963141798973083, "sampling/sampling_logp_difference/max": 0.22776150703430176, "sampling/sampling_logp_difference/mean": 0.012935889884829521, "step": 703 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 456.0, "completions/max_terminated_length": 456.0, "completions/mean_length": 177.90625, "completions/mean_terminated_length": 177.90625, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "entropy": 0.8073965013027191, "epoch": 0.6963402571711177, "grad_norm": 1.8220946788787842, "kl_approx": 0.2387542724609375, "learning_rate": 5.150392484425728e-06, "loss": 0.1817, "num_tokens": 17324655.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.184914469718933, "sampling/importance_sampling_ratio/mean": 0.9992700815200806, "sampling/importance_sampling_ratio/min": 0.7976313233375549, "sampling/sampling_logp_difference/max": 0.22610878944396973, "sampling/sampling_logp_difference/mean": 0.01344248466193676, "step": 704 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 441.0, "completions/max_terminated_length": 441.0, "completions/mean_length": 226.90625, "completions/mean_terminated_length": 226.90625, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.8414818067103624, "epoch": 0.6973293768545994, "grad_norm": 1.5232235193252563, "kl_approx": 0.220611572265625, "learning_rate": 5.120196693701267e-06, "loss": 0.1594, "num_tokens": 17350604.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1737972497940063, "sampling/importance_sampling_ratio/mean": 0.9997393488883972, "sampling/importance_sampling_ratio/min": 0.8006067276000977, "sampling/sampling_logp_difference/max": 0.22238540649414062, "sampling/sampling_logp_difference/mean": 0.013630114495754242, "step": 705 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 765.0, "completions/max_terminated_length": 765.0, "completions/mean_length": 233.28125, "completions/mean_terminated_length": 233.28125, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.699917302466929, "epoch": 0.6983184965380811, "grad_norm": 1.4595619440078735, "kl_approx": 0.1967926025390625, "learning_rate": 5.090059190266779e-06, "loss": 0.139, "num_tokens": 17381021.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2881587743759155, "sampling/importance_sampling_ratio/mean": 0.999841034412384, "sampling/importance_sampling_ratio/min": 0.808856725692749, "sampling/sampling_logp_difference/max": 0.25321388244628906, "sampling/sampling_logp_difference/mean": 0.011971939355134964, "step": 706 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 510.0, "completions/max_terminated_length": 510.0, "completions/mean_length": 164.65625, "completions/mean_terminated_length": 164.65625, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.737330405972898, "epoch": 0.6993076162215628, "grad_norm": 1.8753713369369507, "kl_approx": 0.212371826171875, "learning_rate": 5.059980334102637e-06, "loss": 0.1631, "num_tokens": 17406554.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.203424334526062, "sampling/importance_sampling_ratio/mean": 1.000246524810791, "sampling/importance_sampling_ratio/min": 0.8438887000083923, "sampling/sampling_logp_difference/max": 0.18517112731933594, "sampling/sampling_logp_difference/mean": 0.01186387799680233, "step": 707 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 516.0, "completions/max_terminated_length": 516.0, "completions/mean_length": 176.0625, "completions/mean_terminated_length": 176.0625, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.6548954271711409, "epoch": 0.7002967359050445, "grad_norm": 1.5158522129058838, "kl_approx": 0.20325851440429688, "learning_rate": 5.0299604844886985e-06, "loss": 0.1303, "num_tokens": 17437004.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.163467288017273, "sampling/importance_sampling_ratio/mean": 0.9999485015869141, "sampling/importance_sampling_ratio/min": 0.797893226146698, "sampling/sampling_logp_difference/max": 0.22578048706054688, "sampling/sampling_logp_difference/mean": 0.013093885034322739, "step": 708 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 682.0, "completions/max_terminated_length": 682.0, "completions/mean_length": 168.6875, "completions/mean_terminated_length": 168.6875, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6456555621698499, "epoch": 0.7012858555885262, "grad_norm": 1.5738083124160767, "kl_approx": 0.17386627197265625, "learning_rate": 5.000000000000003e-06, "loss": 0.149, "num_tokens": 17459114.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2293487787246704, "sampling/importance_sampling_ratio/mean": 1.000348448753357, "sampling/importance_sampling_ratio/min": 0.8355607390403748, "sampling/sampling_logp_difference/max": 0.20648455619812012, "sampling/sampling_logp_difference/mean": 0.011419551447033882, "step": 709 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 727.0, "completions/max_terminated_length": 727.0, "completions/mean_length": 230.09375, "completions/mean_terminated_length": 230.09375, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 0.9678070228546858, "epoch": 0.7022749752720079, "grad_norm": 1.7277486324310303, "kl_approx": 0.253021240234375, "learning_rate": 4.970099238502494e-06, "loss": 0.1968, "num_tokens": 17483069.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1569980382919312, "sampling/importance_sampling_ratio/mean": 0.9999547600746155, "sampling/importance_sampling_ratio/min": 0.6697465181350708, "sampling/sampling_logp_difference/max": 0.40085601806640625, "sampling/sampling_logp_difference/mean": 0.015317621640861034, "step": 710 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 652.0, "completions/max_terminated_length": 652.0, "completions/mean_length": 320.0, "completions/mean_terminated_length": 320.0, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.948563264682889, "epoch": 0.7032640949554896, "grad_norm": 2.1169207096099854, "kl_approx": 0.22998046875, "learning_rate": 4.940258557148765e-06, "loss": 0.2066, "num_tokens": 17507989.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.267783522605896, "sampling/importance_sampling_ratio/mean": 1.0000876188278198, "sampling/importance_sampling_ratio/min": 0.7904531359672546, "sampling/sampling_logp_difference/max": 0.23727011680603027, "sampling/sampling_logp_difference/mean": 0.014285891316831112, "step": 711 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 660.0, "completions/max_terminated_length": 660.0, "completions/mean_length": 218.5, "completions/mean_terminated_length": 218.5, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.5729656154289842, "epoch": 0.7042532146389713, "grad_norm": 1.5186506509780884, "kl_approx": 0.138336181640625, "learning_rate": 4.910478312373757e-06, "loss": 0.1042, "num_tokens": 17536701.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2360584735870361, "sampling/importance_sampling_ratio/mean": 1.0000859498977661, "sampling/importance_sampling_ratio/min": 0.8156856894493103, "sampling/sampling_logp_difference/max": 0.2119276523590088, "sampling/sampling_logp_difference/mean": 0.011587286368012428, "step": 712 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 625.0, "completions/max_terminated_length": 625.0, "completions/mean_length": 140.34375, "completions/mean_terminated_length": 140.34375, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.48895900463685393, "epoch": 0.705242334322453, "grad_norm": 2.1022837162017822, "kl_approx": 0.15654754638671875, "learning_rate": 4.8807588598905364e-06, "loss": 0.1471, "num_tokens": 17559160.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1620275974273682, "sampling/importance_sampling_ratio/mean": 0.999748706817627, "sampling/importance_sampling_ratio/min": 0.859999418258667, "sampling/sampling_logp_difference/max": 0.15082359313964844, "sampling/sampling_logp_difference/mean": 0.010068962350487709, "step": 713 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 389.0, "completions/max_terminated_length": 389.0, "completions/mean_length": 121.53125, "completions/mean_terminated_length": 121.53125, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.5389311439357698, "epoch": 0.7062314540059347, "grad_norm": 1.8456141948699951, "kl_approx": 0.15723037719726562, "learning_rate": 4.8511005546860214e-06, "loss": 0.1178, "num_tokens": 17584665.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1327643394470215, "sampling/importance_sampling_ratio/mean": 0.9999019503593445, "sampling/importance_sampling_ratio/min": 0.8453379273414612, "sampling/sampling_logp_difference/max": 0.16801881790161133, "sampling/sampling_logp_difference/mean": 0.010423300787806511, "step": 714 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 483.0, "completions/max_terminated_length": 483.0, "completions/mean_length": 220.90625, "completions/mean_terminated_length": 220.90625, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.7663214658387005, "epoch": 0.7072205736894164, "grad_norm": 1.6466747522354126, "kl_approx": 0.214080810546875, "learning_rate": 4.821503751016746e-06, "loss": 0.1607, "num_tokens": 17614374.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1888964176177979, "sampling/importance_sampling_ratio/mean": 1.0004572868347168, "sampling/importance_sampling_ratio/min": 0.7955611944198608, "sampling/sampling_logp_difference/max": 0.22870755195617676, "sampling/sampling_logp_difference/mean": 0.014037556946277618, "step": 715 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 959.0, "completions/max_terminated_length": 959.0, "completions/mean_length": 149.53125, "completions/mean_terminated_length": 149.53125, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.5265183309093118, "epoch": 0.7082096933728981, "grad_norm": 1.685228943824768, "kl_approx": 0.1712360382080078, "learning_rate": 4.791968802404648e-06, "loss": 0.1163, "num_tokens": 17635119.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1845753192901611, "sampling/importance_sampling_ratio/mean": 0.9994645714759827, "sampling/importance_sampling_ratio/min": 0.8425592184066772, "sampling/sampling_logp_difference/max": 0.1713113784790039, "sampling/sampling_logp_difference/mean": 0.009882703423500061, "step": 716 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 298.0, "completions/max_terminated_length": 298.0, "completions/mean_length": 109.21875, "completions/mean_terminated_length": 109.21875, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.49123777355998755, "epoch": 0.7091988130563798, "grad_norm": 2.352886438369751, "kl_approx": 0.22857666015625, "learning_rate": 4.762496061632814e-06, "loss": 0.1458, "num_tokens": 17656222.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.16831374168396, "sampling/importance_sampling_ratio/mean": 0.9997101426124573, "sampling/importance_sampling_ratio/min": 0.8515194058418274, "sampling/sampling_logp_difference/max": 0.16073298454284668, "sampling/sampling_logp_difference/mean": 0.008548786863684654, "step": 717 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 448.0, "completions/max_terminated_length": 448.0, "completions/mean_length": 203.8125, "completions/mean_terminated_length": 203.8125, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.6678677322342992, "epoch": 0.7101879327398615, "grad_norm": 1.9818692207336426, "kl_approx": 0.271087646484375, "learning_rate": 4.733085880741301e-06, "loss": 0.1685, "num_tokens": 17686192.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1468522548675537, "sampling/importance_sampling_ratio/mean": 1.0001845359802246, "sampling/importance_sampling_ratio/min": 0.8311527371406555, "sampling/sampling_logp_difference/max": 0.18494164943695068, "sampling/sampling_logp_difference/mean": 0.010603660717606544, "step": 718 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 458.0, "completions/max_terminated_length": 458.0, "completions/mean_length": 194.875, "completions/mean_terminated_length": 194.875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.8212852077558637, "epoch": 0.7111770524233432, "grad_norm": 2.00606107711792, "kl_approx": 0.18991851806640625, "learning_rate": 4.703738611022899e-06, "loss": 0.1536, "num_tokens": 17709684.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2420822381973267, "sampling/importance_sampling_ratio/mean": 0.9998752474784851, "sampling/importance_sampling_ratio/min": 0.811434268951416, "sampling/sampling_logp_difference/max": 0.21678924560546875, "sampling/sampling_logp_difference/mean": 0.013117128051817417, "step": 719 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 433.0, "completions/max_terminated_length": 433.0, "completions/mean_length": 168.84375, "completions/mean_terminated_length": 168.84375, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.6925176247023046, "epoch": 0.712166172106825, "grad_norm": 2.0466580390930176, "kl_approx": 0.245208740234375, "learning_rate": 4.674454603018949e-06, "loss": 0.1767, "num_tokens": 17735287.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1724096536636353, "sampling/importance_sampling_ratio/mean": 0.9996753931045532, "sampling/importance_sampling_ratio/min": 0.8437741994857788, "sampling/sampling_logp_difference/max": 0.16987037658691406, "sampling/sampling_logp_difference/mean": 0.011743372306227684, "step": 720 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 678.0, "completions/max_terminated_length": 678.0, "completions/mean_length": 231.15625, "completions/mean_terminated_length": 231.15625, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.8137618498876691, "epoch": 0.7131552917903067, "grad_norm": 3.0349340438842773, "kl_approx": 0.227691650390625, "learning_rate": 4.645234206515171e-06, "loss": 0.17, "num_tokens": 17766644.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2204031944274902, "sampling/importance_sampling_ratio/mean": 1.0002540349960327, "sampling/importance_sampling_ratio/min": 0.8272221684455872, "sampling/sampling_logp_difference/max": 0.19918131828308105, "sampling/sampling_logp_difference/mean": 0.014134869910776615, "step": 721 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 329.0, "completions/max_terminated_length": 329.0, "completions/mean_length": 130.75, "completions/mean_terminated_length": 130.75, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.7011388130486012, "epoch": 0.7141444114737884, "grad_norm": 1.964548110961914, "kl_approx": 0.2252197265625, "learning_rate": 4.616077770537453e-06, "loss": 0.1463, "num_tokens": 17790372.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2965012788772583, "sampling/importance_sampling_ratio/mean": 0.9999880790710449, "sampling/importance_sampling_ratio/min": 0.8731593489646912, "sampling/sampling_logp_difference/max": 0.25966930389404297, "sampling/sampling_logp_difference/mean": 0.012304319068789482, "step": 722 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 560.0, "completions/max_terminated_length": 560.0, "completions/mean_length": 197.34375, "completions/mean_terminated_length": 197.34375, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.6990051278844476, "epoch": 0.7151335311572701, "grad_norm": 2.770803928375244, "kl_approx": 0.3218536376953125, "learning_rate": 4.586985643347716e-06, "loss": 0.2276, "num_tokens": 17813247.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2569074630737305, "sampling/importance_sampling_ratio/mean": 1.0006672143936157, "sampling/importance_sampling_ratio/min": 0.8197575211524963, "sampling/sampling_logp_difference/max": 0.2286543846130371, "sampling/sampling_logp_difference/mean": 0.013319458812475204, "step": 723 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 406.0, "completions/max_terminated_length": 406.0, "completions/mean_length": 144.03125, "completions/mean_terminated_length": 144.03125, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.6278553423471749, "epoch": 0.7161226508407518, "grad_norm": 2.100076913833618, "kl_approx": 0.20140838623046875, "learning_rate": 4.557958172439726e-06, "loss": 0.1586, "num_tokens": 17838808.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1707496643066406, "sampling/importance_sampling_ratio/mean": 0.9998959302902222, "sampling/importance_sampling_ratio/min": 0.8135724663734436, "sampling/sampling_logp_difference/max": 0.20632028579711914, "sampling/sampling_logp_difference/mean": 0.011210230179131031, "step": 724 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 596.0, "completions/mean_length": 232.1875, "completions/mean_terminated_length": 206.64515686035156, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.8469684654846787, "epoch": 0.7171117705242335, "grad_norm": 2.7285993099212646, "kl_approx": 0.2515411376953125, "learning_rate": 4.5289957045349655e-06, "loss": 0.2165, "num_tokens": 17864638.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2153348922729492, "sampling/importance_sampling_ratio/mean": 1.0003057718276978, "sampling/importance_sampling_ratio/min": 0.8344747424125671, "sampling/sampling_logp_difference/max": 0.19501972198486328, "sampling/sampling_logp_difference/mean": 0.013435416854918003, "step": 725 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 493.0, "completions/mean_length": 189.1875, "completions/mean_terminated_length": 162.258056640625, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.6437777183018625, "epoch": 0.7181008902077152, "grad_norm": 1.8480826616287231, "kl_approx": 0.19211578369140625, "learning_rate": 4.500098585578475e-06, "loss": 0.1548, "num_tokens": 17894164.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.273382544517517, "sampling/importance_sampling_ratio/mean": 1.0005061626434326, "sampling/importance_sampling_ratio/min": 0.8315581679344177, "sampling/sampling_logp_difference/max": 0.24167680740356445, "sampling/sampling_logp_difference/mean": 0.011444884352385998, "step": 726 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 615.0, "completions/max_terminated_length": 615.0, "completions/mean_length": 163.15625, "completions/mean_terminated_length": 163.15625, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.6412182203494012, "epoch": 0.7190900098911969, "grad_norm": 1.6898143291473389, "kl_approx": 0.14781761169433594, "learning_rate": 4.471267160734731e-06, "loss": 0.118, "num_tokens": 17917929.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1478530168533325, "sampling/importance_sampling_ratio/mean": 0.9993718862533569, "sampling/importance_sampling_ratio/min": 0.8758255243301392, "sampling/sampling_logp_difference/max": 0.1378931999206543, "sampling/sampling_logp_difference/mean": 0.011791921220719814, "step": 727 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 393.0, "completions/max_terminated_length": 393.0, "completions/mean_length": 168.03125, "completions/mean_terminated_length": 168.03125, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.9844850804656744, "epoch": 0.7200791295746786, "grad_norm": 2.154000997543335, "kl_approx": 0.31048583984375, "learning_rate": 4.4425017743835155e-06, "loss": 0.218, "num_tokens": 17942378.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2187334299087524, "sampling/importance_sampling_ratio/mean": 0.9999105334281921, "sampling/importance_sampling_ratio/min": 0.8137028813362122, "sampling/sampling_logp_difference/max": 0.2061600685119629, "sampling/sampling_logp_difference/mean": 0.014998598955571651, "step": 728 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 315.0, "completions/max_terminated_length": 315.0, "completions/mean_length": 127.65625, "completions/mean_terminated_length": 127.65625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.6418769117444754, "epoch": 0.7210682492581603, "grad_norm": 2.360063076019287, "kl_approx": 0.2035369873046875, "learning_rate": 4.413802770115816e-06, "loss": 0.14, "num_tokens": 17963519.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1930829286575317, "sampling/importance_sampling_ratio/mean": 1.00049889087677, "sampling/importance_sampling_ratio/min": 0.850300133228302, "sampling/sampling_logp_difference/max": 0.17654061317443848, "sampling/sampling_logp_difference/mean": 0.011384337209165096, "step": 729 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 572.0, "completions/max_terminated_length": 572.0, "completions/mean_length": 194.71875, "completions/mean_terminated_length": 194.71875, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.9331769226118922, "epoch": 0.722057368941642, "grad_norm": 2.705308675765991, "kl_approx": 0.3458251953125, "learning_rate": 4.385170490729712e-06, "loss": 0.2267, "num_tokens": 17989590.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2839457988739014, "sampling/importance_sampling_ratio/mean": 1.0001715421676636, "sampling/importance_sampling_ratio/min": 0.825412392616272, "sampling/sampling_logp_difference/max": 0.2499380111694336, "sampling/sampling_logp_difference/mean": 0.01575096882879734, "step": 730 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 534.0, "completions/max_terminated_length": 534.0, "completions/mean_length": 143.25, "completions/mean_terminated_length": 143.25, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.775684105232358, "epoch": 0.7230464886251237, "grad_norm": 2.5426011085510254, "kl_approx": 0.2600221633911133, "learning_rate": 4.356605278226274e-06, "loss": 0.1925, "num_tokens": 18007950.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1682602167129517, "sampling/importance_sampling_ratio/mean": 1.0008366107940674, "sampling/importance_sampling_ratio/min": 0.8702865242958069, "sampling/sampling_logp_difference/max": 0.1555156707763672, "sampling/sampling_logp_difference/mean": 0.013184097595512867, "step": 731 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 661.0, "completions/max_terminated_length": 661.0, "completions/mean_length": 180.09375, "completions/mean_terminated_length": 180.09375, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.9089353363960981, "epoch": 0.7240356083086054, "grad_norm": 1.9327317476272583, "kl_approx": 0.2559814453125, "learning_rate": 4.328107473805487e-06, "loss": 0.1671, "num_tokens": 18029025.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2234506607055664, "sampling/importance_sampling_ratio/mean": 1.000006079673767, "sampling/importance_sampling_ratio/min": 0.8507674932479858, "sampling/sampling_logp_difference/max": 0.2016751766204834, "sampling/sampling_logp_difference/mean": 0.015628783032298088, "step": 732 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 529.0, "completions/max_terminated_length": 529.0, "completions/mean_length": 164.125, "completions/mean_terminated_length": 164.125, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.691059647127986, "epoch": 0.7250247279920871, "grad_norm": 1.9737212657928467, "kl_approx": 0.2177886962890625, "learning_rate": 4.299677417862174e-06, "loss": 0.149, "num_tokens": 18058765.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1561427116394043, "sampling/importance_sampling_ratio/mean": 1.0000251531600952, "sampling/importance_sampling_ratio/min": 0.7477208971977234, "sampling/sampling_logp_difference/max": 0.2907254695892334, "sampling/sampling_logp_difference/mean": 0.012402988970279694, "step": 733 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 718.0, "completions/max_terminated_length": 718.0, "completions/mean_length": 230.78125, "completions/mean_terminated_length": 230.78125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.827793057076633, "epoch": 0.7260138476755688, "grad_norm": 1.7064924240112305, "kl_approx": 0.1866455078125, "learning_rate": 4.2713154499819345e-06, "loss": 0.1614, "num_tokens": 18085766.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2967380285263062, "sampling/importance_sampling_ratio/mean": 0.9996660351753235, "sampling/importance_sampling_ratio/min": 0.8361271023750305, "sampling/sampling_logp_difference/max": 0.25985193252563477, "sampling/sampling_logp_difference/mean": 0.013141050934791565, "step": 734 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 555.0, "completions/max_terminated_length": 555.0, "completions/mean_length": 165.125, "completions/mean_terminated_length": 165.125, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.6696948120370507, "epoch": 0.7270029673590505, "grad_norm": 1.5293443202972412, "kl_approx": 0.13494014739990234, "learning_rate": 4.243021908937083e-06, "loss": 0.1082, "num_tokens": 18106682.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2327642440795898, "sampling/importance_sampling_ratio/mean": 1.0001575946807861, "sampling/importance_sampling_ratio/min": 0.8621203303337097, "sampling/sampling_logp_difference/max": 0.209259033203125, "sampling/sampling_logp_difference/mean": 0.01325501874089241, "step": 735 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 608.0, "completions/max_terminated_length": 608.0, "completions/mean_length": 126.28125, "completions/mean_terminated_length": 126.28125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6552506405860186, "epoch": 0.7279920870425322, "grad_norm": 1.5868455171585083, "kl_approx": 0.17816925048828125, "learning_rate": 4.214797132682597e-06, "loss": 0.1237, "num_tokens": 18132427.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.169370412826538, "sampling/importance_sampling_ratio/mean": 0.9995803833007812, "sampling/importance_sampling_ratio/min": 0.834650456905365, "sampling/sampling_logp_difference/max": 0.1807422637939453, "sampling/sampling_logp_difference/mean": 0.01297867950052023, "step": 736 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 269.0, "completions/max_terminated_length": 269.0, "completions/mean_length": 94.4375, "completions/mean_terminated_length": 94.4375, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.675287090241909, "epoch": 0.7289812067260139, "grad_norm": 2.9326212406158447, "kl_approx": 0.2565269470214844, "learning_rate": 4.186641458352088e-06, "loss": 0.1897, "num_tokens": 18149417.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.182690978050232, "sampling/importance_sampling_ratio/mean": 0.9995467066764832, "sampling/importance_sampling_ratio/min": 0.6738252639770508, "sampling/sampling_logp_difference/max": 0.39478445053100586, "sampling/sampling_logp_difference/mean": 0.011530457995831966, "step": 737 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 726.0, "completions/max_terminated_length": 726.0, "completions/mean_length": 286.84375, "completions/mean_terminated_length": 286.84375, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.8449942339211702, "epoch": 0.7299703264094956, "grad_norm": 2.1809611320495605, "kl_approx": 0.2819366455078125, "learning_rate": 4.158555222253772e-06, "loss": 0.202, "num_tokens": 18173668.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2447532415390015, "sampling/importance_sampling_ratio/mean": 1.0003917217254639, "sampling/importance_sampling_ratio/min": 0.8304638266563416, "sampling/sampling_logp_difference/max": 0.21893739700317383, "sampling/sampling_logp_difference/mean": 0.012486306019127369, "step": 738 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 696.0, "completions/max_terminated_length": 696.0, "completions/mean_length": 192.8125, "completions/mean_terminated_length": 192.8125, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.6206599147990346, "epoch": 0.7309594460929772, "grad_norm": 2.110464096069336, "kl_approx": 0.2113037109375, "learning_rate": 4.130538759866457e-06, "loss": 0.188, "num_tokens": 18195350.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1894301176071167, "sampling/importance_sampling_ratio/mean": 1.0005006790161133, "sampling/importance_sampling_ratio/min": 0.8327876925468445, "sampling/sampling_logp_difference/max": 0.18297648429870605, "sampling/sampling_logp_difference/mean": 0.012534210458397865, "step": 739 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 528.0, "completions/max_terminated_length": 528.0, "completions/mean_length": 118.125, "completions/mean_terminated_length": 118.125, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.41617966210469604, "epoch": 0.731948565776459, "grad_norm": 1.6880968809127808, "kl_approx": 0.15094494819641113, "learning_rate": 4.102592405835536e-06, "loss": 0.1242, "num_tokens": 18227562.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.140725016593933, "sampling/importance_sampling_ratio/mean": 1.000070333480835, "sampling/importance_sampling_ratio/min": 0.8799240589141846, "sampling/sampling_logp_difference/max": 0.13166403770446777, "sampling/sampling_logp_difference/mean": 0.00900157168507576, "step": 740 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 447.0, "completions/max_terminated_length": 447.0, "completions/mean_length": 178.71875, "completions/mean_terminated_length": 178.71875, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.7296636658720672, "epoch": 0.7329376854599406, "grad_norm": 2.3411643505096436, "kl_approx": 0.267120361328125, "learning_rate": 4.074716493968976e-06, "loss": 0.2018, "num_tokens": 18257473.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2254295349121094, "sampling/importance_sampling_ratio/mean": 1.000654935836792, "sampling/importance_sampling_ratio/min": 0.8066490292549133, "sampling/sampling_logp_difference/max": 0.21486663818359375, "sampling/sampling_logp_difference/mean": 0.01295706257224083, "step": 741 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 781.0, "completions/max_terminated_length": 781.0, "completions/mean_length": 160.40625, "completions/mean_terminated_length": 160.40625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.432065958622843, "epoch": 0.7339268051434223, "grad_norm": 1.8060057163238525, "kl_approx": 0.16995620727539062, "learning_rate": 4.046911357233343e-06, "loss": 0.1082, "num_tokens": 18283150.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2560274600982666, "sampling/importance_sampling_ratio/mean": 0.9995504021644592, "sampling/importance_sampling_ratio/min": 0.8351182341575623, "sampling/sampling_logp_difference/max": 0.22795391082763672, "sampling/sampling_logp_difference/mean": 0.008517901413142681, "step": 742 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 817.0, "completions/max_terminated_length": 817.0, "completions/mean_length": 243.03125, "completions/mean_terminated_length": 243.03125, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7411478692665696, "epoch": 0.734915924826904, "grad_norm": 3.3154239654541016, "kl_approx": 0.3158416748046875, "learning_rate": 4.019177327749822e-06, "loss": 0.245, "num_tokens": 18308527.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1839094161987305, "sampling/importance_sampling_ratio/mean": 1.0001822710037231, "sampling/importance_sampling_ratio/min": 0.7981700897216797, "sampling/sampling_logp_difference/max": 0.2254335880279541, "sampling/sampling_logp_difference/mean": 0.012844223529100418, "step": 743 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 380.0, "completions/max_terminated_length": 380.0, "completions/mean_length": 167.5, "completions/mean_terminated_length": 167.5, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.7816494796425104, "epoch": 0.7359050445103857, "grad_norm": 1.9001083374023438, "kl_approx": 0.20230865478515625, "learning_rate": 3.991514736790259e-06, "loss": 0.1711, "num_tokens": 18333911.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3804659843444824, "sampling/importance_sampling_ratio/mean": 0.9999703168869019, "sampling/importance_sampling_ratio/min": 0.7950524091720581, "sampling/sampling_logp_difference/max": 0.3224210739135742, "sampling/sampling_logp_difference/mean": 0.013397879898548126, "step": 744 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 305.0, "completions/max_terminated_length": 305.0, "completions/mean_length": 136.21875, "completions/mean_terminated_length": 136.21875, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.7890783199109137, "epoch": 0.7368941641938674, "grad_norm": 1.8274949789047241, "kl_approx": 0.2354412078857422, "learning_rate": 3.9639239147731865e-06, "loss": 0.1633, "num_tokens": 18358014.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2464632987976074, "sampling/importance_sampling_ratio/mean": 1.0000025033950806, "sampling/importance_sampling_ratio/min": 0.8537388443946838, "sampling/sampling_logp_difference/max": 0.22031021118164062, "sampling/sampling_logp_difference/mean": 0.01359168253839016, "step": 745 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 328.0, "completions/max_terminated_length": 328.0, "completions/mean_length": 106.625, "completions/mean_terminated_length": 106.625, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.6716867433860898, "epoch": 0.7378832838773491, "grad_norm": 1.9572480916976929, "kl_approx": 0.24805450439453125, "learning_rate": 3.936405191259891e-06, "loss": 0.1692, "num_tokens": 18374274.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2126106023788452, "sampling/importance_sampling_ratio/mean": 1.0006641149520874, "sampling/importance_sampling_ratio/min": 0.8371591567993164, "sampling/sampling_logp_difference/max": 0.19277548789978027, "sampling/sampling_logp_difference/mean": 0.012998148798942566, "step": 746 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 939.0, "completions/max_terminated_length": 939.0, "completions/mean_length": 224.65625, "completions/mean_terminated_length": 224.65625, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.7162048937752843, "epoch": 0.7388724035608308, "grad_norm": 2.3886539936065674, "kl_approx": 0.4613494873046875, "learning_rate": 3.908958894950465e-06, "loss": 0.1608, "num_tokens": 18401487.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.407838225364685, "sampling/importance_sampling_ratio/mean": 0.999886691570282, "sampling/importance_sampling_ratio/min": 0.7567241787910461, "sampling/sampling_logp_difference/max": 0.3420553207397461, "sampling/sampling_logp_difference/mean": 0.01268045138567686, "step": 747 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 298.0, "completions/max_terminated_length": 298.0, "completions/mean_length": 89.53125, "completions/mean_terminated_length": 89.53125, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.552664234302938, "epoch": 0.7398615232443125, "grad_norm": 2.2233786582946777, "kl_approx": 0.16641998291015625, "learning_rate": 3.881585353679891e-06, "loss": 0.1264, "num_tokens": 18419560.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1369351148605347, "sampling/importance_sampling_ratio/mean": 1.0003160238265991, "sampling/importance_sampling_ratio/min": 0.8695698380470276, "sampling/sampling_logp_difference/max": 0.1397566795349121, "sampling/sampling_logp_difference/mean": 0.011607345193624496, "step": 748 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 256.0, "completions/max_terminated_length": 256.0, "completions/mean_length": 105.125, "completions/mean_terminated_length": 105.125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.685340098105371, "epoch": 0.7408506429277942, "grad_norm": 2.0351662635803223, "kl_approx": 0.25331878662109375, "learning_rate": 3.854284894414122e-06, "loss": 0.1642, "num_tokens": 18437468.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1453019380569458, "sampling/importance_sampling_ratio/mean": 1.000411868095398, "sampling/importance_sampling_ratio/min": 0.8645596504211426, "sampling/sampling_logp_difference/max": 0.14553499221801758, "sampling/sampling_logp_difference/mean": 0.011627660132944584, "step": 749 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 532.0, "completions/max_terminated_length": 532.0, "completions/mean_length": 247.75, "completions/mean_terminated_length": 247.75, "completions/min_length": 109.0, "completions/min_terminated_length": 109.0, "entropy": 0.9127334738150239, "epoch": 0.7418397626112759, "grad_norm": 1.9531681537628174, "kl_approx": 0.2753448486328125, "learning_rate": 3.827057843246181e-06, "loss": 0.1953, "num_tokens": 18464668.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1649284362792969, "sampling/importance_sampling_ratio/mean": 0.9996983408927917, "sampling/importance_sampling_ratio/min": 0.8302491903305054, "sampling/sampling_logp_difference/max": 0.18602943420410156, "sampling/sampling_logp_difference/mean": 0.014002948999404907, "step": 750 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 980.0, "completions/max_terminated_length": 980.0, "completions/mean_length": 258.0625, "completions/mean_terminated_length": 258.0625, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.7895174324512482, "epoch": 0.7428288822947576, "grad_norm": 2.1674458980560303, "kl_approx": 0.296112060546875, "learning_rate": 3.799904525392251e-06, "loss": 0.2054, "num_tokens": 18495430.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 2.0, "sampling/importance_sampling_ratio/mean": 1.0003197193145752, "sampling/importance_sampling_ratio/min": 0.24518384039402008, "sampling/sampling_logp_difference/max": 1.4057470560073853, "sampling/sampling_logp_difference/mean": 0.012357005849480629, "step": 751 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 533.0, "completions/max_terminated_length": 533.0, "completions/mean_length": 179.59375, "completions/mean_terminated_length": 179.59375, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.7025545849464834, "epoch": 0.7438180019782393, "grad_norm": 1.8219610452651978, "kl_approx": 0.2104206085205078, "learning_rate": 3.7728252651878018e-06, "loss": 0.1408, "num_tokens": 18520137.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1633566617965698, "sampling/importance_sampling_ratio/mean": 1.0003172159194946, "sampling/importance_sampling_ratio/min": 0.8210762739181519, "sampling/sampling_logp_difference/max": 0.19713926315307617, "sampling/sampling_logp_difference/mean": 0.013313082046806812, "step": 752 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 896.0, "completions/max_terminated_length": 896.0, "completions/mean_length": 239.71875, "completions/mean_terminated_length": 239.71875, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7465778877958655, "epoch": 0.744807121661721, "grad_norm": 1.3636194467544556, "kl_approx": 0.15126800537109375, "learning_rate": 3.745820386083724e-06, "loss": 0.1173, "num_tokens": 18543240.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1826424598693848, "sampling/importance_sampling_ratio/mean": 1.0002340078353882, "sampling/importance_sampling_ratio/min": 0.8268632888793945, "sampling/sampling_logp_difference/max": 0.19011592864990234, "sampling/sampling_logp_difference/mean": 0.014081642031669617, "step": 753 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 344.0, "completions/max_terminated_length": 344.0, "completions/mean_length": 96.0625, "completions/mean_terminated_length": 96.0625, "completions/min_length": 29.0, "completions/min_terminated_length": 29.0, "entropy": 0.6368826203979552, "epoch": 0.7457962413452027, "grad_norm": 1.8921583890914917, "kl_approx": 0.20755386352539062, "learning_rate": 3.718890210642442e-06, "loss": 0.1234, "num_tokens": 18569578.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1457267999649048, "sampling/importance_sampling_ratio/mean": 1.0003843307495117, "sampling/importance_sampling_ratio/min": 0.8272095322608948, "sampling/sampling_logp_difference/max": 0.189697265625, "sampling/sampling_logp_difference/mean": 0.01161241251975298, "step": 754 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 663.0, "completions/max_terminated_length": 663.0, "completions/mean_length": 255.625, "completions/mean_terminated_length": 255.625, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.6975227654911578, "epoch": 0.7467853610286844, "grad_norm": 1.7193843126296997, "kl_approx": 0.19468307495117188, "learning_rate": 3.6920350605340883e-06, "loss": 0.1542, "num_tokens": 18596726.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1750959157943726, "sampling/importance_sampling_ratio/mean": 0.9999240636825562, "sampling/importance_sampling_ratio/min": 0.82701176404953, "sampling/sampling_logp_difference/max": 0.18993639945983887, "sampling/sampling_logp_difference/mean": 0.011781087145209312, "step": 755 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 382.0, "completions/max_terminated_length": 382.0, "completions/mean_length": 110.6875, "completions/mean_terminated_length": 110.6875, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.6093201180920005, "epoch": 0.7477744807121661, "grad_norm": 2.438821792602539, "kl_approx": 0.21743392944335938, "learning_rate": 3.6652552565326382e-06, "loss": 0.1399, "num_tokens": 18618388.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1325466632843018, "sampling/importance_sampling_ratio/mean": 1.0002824068069458, "sampling/importance_sampling_ratio/min": 0.8656585812568665, "sampling/sampling_logp_difference/max": 0.14426469802856445, "sampling/sampling_logp_difference/mean": 0.01252963487058878, "step": 756 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 577.0, "completions/max_terminated_length": 577.0, "completions/mean_length": 150.0625, "completions/mean_terminated_length": 150.0625, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.5462100775912404, "epoch": 0.7487636003956478, "grad_norm": 1.914589762687683, "kl_approx": 0.171051025390625, "learning_rate": 3.638551118512089e-06, "loss": 0.1551, "num_tokens": 18645734.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2603230476379395, "sampling/importance_sampling_ratio/mean": 1.0002657175064087, "sampling/importance_sampling_ratio/min": 0.861635148525238, "sampling/sampling_logp_difference/max": 0.2313680648803711, "sampling/sampling_logp_difference/mean": 0.008987007662653923, "step": 757 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 967.0, "completions/max_terminated_length": 967.0, "completions/mean_length": 174.53125, "completions/mean_terminated_length": 174.53125, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7931330753490329, "epoch": 0.7497527200791295, "grad_norm": 2.4672248363494873, "kl_approx": 0.28804779052734375, "learning_rate": 3.611922965442648e-06, "loss": 0.2241, "num_tokens": 18671119.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1863865852355957, "sampling/importance_sampling_ratio/mean": 1.0000700950622559, "sampling/importance_sampling_ratio/min": 0.8640202283859253, "sampling/sampling_logp_difference/max": 0.1709122657775879, "sampling/sampling_logp_difference/mean": 0.013299352489411831, "step": 758 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 254.0, "completions/max_terminated_length": 254.0, "completions/mean_length": 114.5, "completions/mean_terminated_length": 114.5, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.5301418020389974, "epoch": 0.7507418397626113, "grad_norm": 1.598932147026062, "kl_approx": 0.15627288818359375, "learning_rate": 3.5853711153868962e-06, "loss": 0.138, "num_tokens": 18694799.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2136613130569458, "sampling/importance_sampling_ratio/mean": 1.0002063512802124, "sampling/importance_sampling_ratio/min": 0.8691523671150208, "sampling/sampling_logp_difference/max": 0.19364166259765625, "sampling/sampling_logp_difference/mean": 0.010492241941392422, "step": 759 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 635.0, "completions/max_terminated_length": 635.0, "completions/mean_length": 210.125, "completions/mean_terminated_length": 210.125, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7596020055934787, "epoch": 0.751730959446093, "grad_norm": 2.4042301177978516, "kl_approx": 0.21300506591796875, "learning_rate": 3.558895885496023e-06, "loss": 0.1971, "num_tokens": 18719323.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2402499914169312, "sampling/importance_sampling_ratio/mean": 1.0001085996627808, "sampling/importance_sampling_ratio/min": 0.8347664475440979, "sampling/sampling_logp_difference/max": 0.21531295776367188, "sampling/sampling_logp_difference/mean": 0.013151587918400764, "step": 760 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 633.0, "completions/max_terminated_length": 633.0, "completions/mean_length": 205.75, "completions/mean_terminated_length": 205.75, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.646051739808172, "epoch": 0.7527200791295747, "grad_norm": 1.6891670227050781, "kl_approx": 0.20781707763671875, "learning_rate": 3.53249759200601e-06, "loss": 0.1754, "num_tokens": 18749723.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1758610010147095, "sampling/importance_sampling_ratio/mean": 1.000101089477539, "sampling/importance_sampling_ratio/min": 0.8145788908004761, "sampling/sampling_logp_difference/max": 0.205083966255188, "sampling/sampling_logp_difference/mean": 0.012027316726744175, "step": 761 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 311.0, "completions/max_terminated_length": 311.0, "completions/mean_length": 127.90625, "completions/mean_terminated_length": 127.90625, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.6191699355840683, "epoch": 0.7537091988130564, "grad_norm": 2.107037305831909, "kl_approx": 0.27768707275390625, "learning_rate": 3.506176550233863e-06, "loss": 0.1883, "num_tokens": 18775552.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2003813982009888, "sampling/importance_sampling_ratio/mean": 0.9993715882301331, "sampling/importance_sampling_ratio/min": 0.8528404235839844, "sampling/sampling_logp_difference/max": 0.18263936042785645, "sampling/sampling_logp_difference/mean": 0.011053435504436493, "step": 762 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 1001.0, "completions/mean_length": 488.0625, "completions/mean_terminated_length": 470.774169921875, "completions/min_length": 94.0, "completions/min_terminated_length": 94.0, "entropy": 1.1207417249679565, "epoch": 0.7546983184965381, "grad_norm": 1.5490599870681763, "kl_approx": 0.2765960693359375, "learning_rate": 3.479933074573858e-06, "loss": 0.1898, "num_tokens": 18809066.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2754782438278198, "sampling/importance_sampling_ratio/mean": 1.0002193450927734, "sampling/importance_sampling_ratio/min": 0.7740544676780701, "sampling/sampling_logp_difference/max": 0.25611305236816406, "sampling/sampling_logp_difference/mean": 0.014872231520712376, "step": 763 }, { "completions/clipped_ratio": 0.0625, "completions/max_length": 1024.0, "completions/max_terminated_length": 967.0, "completions/mean_length": 401.78125, "completions/mean_terminated_length": 360.3000183105469, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.973311023786664, "epoch": 0.7556874381800198, "grad_norm": 3.8010356426239014, "kl_approx": 0.358551025390625, "learning_rate": 3.453767478493761e-06, "loss": 0.2289, "num_tokens": 18840091.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2327371835708618, "sampling/importance_sampling_ratio/mean": 1.0000475645065308, "sampling/importance_sampling_ratio/min": 0.7447587847709656, "sampling/sampling_logp_difference/max": 0.2946949005126953, "sampling/sampling_logp_difference/mean": 0.014737233519554138, "step": 764 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 622.0, "completions/max_terminated_length": 622.0, "completions/mean_length": 208.09375, "completions/mean_terminated_length": 208.09375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.8596416814252734, "epoch": 0.7566765578635015, "grad_norm": 1.6311949491500854, "kl_approx": 0.2530975341796875, "learning_rate": 3.4276800745311135e-06, "loss": 0.1729, "num_tokens": 18868070.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2013001441955566, "sampling/importance_sampling_ratio/mean": 0.9996911287307739, "sampling/importance_sampling_ratio/min": 0.7864751815795898, "sampling/sampling_logp_difference/max": 0.24019408226013184, "sampling/sampling_logp_difference/mean": 0.014808334410190582, "step": 765 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 621.0, "completions/max_terminated_length": 621.0, "completions/mean_length": 142.9375, "completions/mean_terminated_length": 142.9375, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.7676951801404357, "epoch": 0.7576656775469832, "grad_norm": 2.466844320297241, "kl_approx": 0.27947998046875, "learning_rate": 3.401671174289469e-06, "loss": 0.1786, "num_tokens": 18893988.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2366451025009155, "sampling/importance_sampling_ratio/mean": 0.9996635317802429, "sampling/importance_sampling_ratio/min": 0.7903359532356262, "sampling/sampling_logp_difference/max": 0.23529720306396484, "sampling/sampling_logp_difference/mean": 0.013206785544753075, "step": 766 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 572.0, "completions/max_terminated_length": 572.0, "completions/mean_length": 182.46875, "completions/mean_terminated_length": 182.46875, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.6226079347543418, "epoch": 0.7586547972304649, "grad_norm": 1.2765007019042969, "kl_approx": 0.16524505615234375, "learning_rate": 3.37574108843469e-06, "loss": 0.1072, "num_tokens": 18917899.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.184149146080017, "sampling/importance_sampling_ratio/mean": 0.9998183846473694, "sampling/importance_sampling_ratio/min": 0.8358498811721802, "sampling/sampling_logp_difference/max": 0.1793062686920166, "sampling/sampling_logp_difference/mean": 0.011249442584812641, "step": 767 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 497.0, "completions/max_terminated_length": 497.0, "completions/mean_length": 159.15625, "completions/mean_terminated_length": 159.15625, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.6482147905044258, "epoch": 0.7596439169139466, "grad_norm": 2.4368436336517334, "kl_approx": 0.23307037353515625, "learning_rate": 3.3498901266912397e-06, "loss": 0.1512, "num_tokens": 18940552.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2050293684005737, "sampling/importance_sampling_ratio/mean": 1.0003063678741455, "sampling/importance_sampling_ratio/min": 0.8416644930839539, "sampling/sampling_logp_difference/max": 0.18650388717651367, "sampling/sampling_logp_difference/mean": 0.01115968357771635, "step": 768 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 367.0, "completions/max_terminated_length": 367.0, "completions/mean_length": 89.625, "completions/mean_terminated_length": 89.625, "completions/min_length": 20.0, "completions/min_terminated_length": 20.0, "entropy": 0.4954094407148659, "epoch": 0.7606330365974283, "grad_norm": 2.5308876037597656, "kl_approx": 0.18539810180664062, "learning_rate": 3.3241185978384636e-06, "loss": 0.1192, "num_tokens": 18961100.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1503419876098633, "sampling/importance_sampling_ratio/mean": 0.9994767904281616, "sampling/importance_sampling_ratio/min": 0.8605351448059082, "sampling/sampling_logp_difference/max": 0.15020084381103516, "sampling/sampling_logp_difference/mean": 0.009010582230985165, "step": 769 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 217.0, "completions/max_terminated_length": 217.0, "completions/mean_length": 95.03125, "completions/mean_terminated_length": 95.03125, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.62249955534935, "epoch": 0.76162215628091, "grad_norm": 2.4176981449127197, "kl_approx": 0.25577354431152344, "learning_rate": 3.2984268097069284e-06, "loss": 0.2165, "num_tokens": 18980621.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1322804689407349, "sampling/importance_sampling_ratio/mean": 0.9999942183494568, "sampling/importance_sampling_ratio/min": 0.8757904171943665, "sampling/sampling_logp_difference/max": 0.1326284408569336, "sampling/sampling_logp_difference/mean": 0.011198222637176514, "step": 770 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 165.0, "completions/max_terminated_length": 165.0, "completions/mean_length": 95.84375, "completions/mean_terminated_length": 95.84375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6548079466447234, "epoch": 0.7626112759643917, "grad_norm": 2.683769464492798, "kl_approx": 0.3103790283203125, "learning_rate": 3.2728150691747117e-06, "loss": 0.197, "num_tokens": 19002696.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2054075002670288, "sampling/importance_sampling_ratio/mean": 1.0001250505447388, "sampling/importance_sampling_ratio/min": 0.8829165697097778, "sampling/sampling_logp_difference/max": 0.18681764602661133, "sampling/sampling_logp_difference/mean": 0.010434011928737164, "step": 771 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 571.0, "completions/max_terminated_length": 571.0, "completions/mean_length": 156.34375, "completions/mean_terminated_length": 156.34375, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.6931787598878145, "epoch": 0.7636003956478734, "grad_norm": 2.2102861404418945, "kl_approx": 0.18294906616210938, "learning_rate": 3.2472836821637744e-06, "loss": 0.1425, "num_tokens": 19027651.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2120553255081177, "sampling/importance_sampling_ratio/mean": 0.9999188184738159, "sampling/importance_sampling_ratio/min": 0.7866107225418091, "sampling/sampling_logp_difference/max": 0.24002182483673096, "sampling/sampling_logp_difference/mean": 0.011650352738797665, "step": 772 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 341.0, "completions/max_terminated_length": 341.0, "completions/mean_length": 139.75, "completions/mean_terminated_length": 139.75, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.6216411152854562, "epoch": 0.7645895153313551, "grad_norm": 1.8011620044708252, "kl_approx": 0.1953277587890625, "learning_rate": 3.22183295363627e-06, "loss": 0.142, "num_tokens": 19053651.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2004886865615845, "sampling/importance_sampling_ratio/mean": 0.9993080496788025, "sampling/importance_sampling_ratio/min": 0.8253172039985657, "sampling/sampling_logp_difference/max": 0.1919875144958496, "sampling/sampling_logp_difference/mean": 0.010747946798801422, "step": 773 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 314.0, "completions/max_terminated_length": 314.0, "completions/mean_length": 147.59375, "completions/mean_terminated_length": 147.59375, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.6841325252316892, "epoch": 0.7655786350148368, "grad_norm": 1.9847886562347412, "kl_approx": 0.1888427734375, "learning_rate": 3.196463187590929e-06, "loss": 0.1612, "num_tokens": 19072782.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.15668523311615, "sampling/importance_sampling_ratio/mean": 0.9991439580917358, "sampling/importance_sampling_ratio/min": 0.8552164435386658, "sampling/sampling_logp_difference/max": 0.1564006805419922, "sampling/sampling_logp_difference/mean": 0.01117499265819788, "step": 774 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 295.0, "completions/max_terminated_length": 295.0, "completions/mean_length": 119.28125, "completions/mean_terminated_length": 119.28125, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.5167607686016709, "epoch": 0.7665677546983185, "grad_norm": 1.6187173128128052, "kl_approx": 0.17361831665039062, "learning_rate": 3.1711746870594083e-06, "loss": 0.1365, "num_tokens": 19097183.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.165476679801941, "sampling/importance_sampling_ratio/mean": 1.0001012086868286, "sampling/importance_sampling_ratio/min": 0.8785051703453064, "sampling/sampling_logp_difference/max": 0.1531301736831665, "sampling/sampling_logp_difference/mean": 0.008856191299855709, "step": 775 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 614.0, "completions/max_terminated_length": 614.0, "completions/mean_length": 164.125, "completions/mean_terminated_length": 164.125, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.4961907071992755, "epoch": 0.7675568743818002, "grad_norm": 1.4157016277313232, "kl_approx": 0.16005325317382812, "learning_rate": 3.145967754102691e-06, "loss": 0.1113, "num_tokens": 19116555.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1317501068115234, "sampling/importance_sampling_ratio/mean": 1.000247836112976, "sampling/importance_sampling_ratio/min": 0.8175615668296814, "sampling/sampling_logp_difference/max": 0.20142912864685059, "sampling/sampling_logp_difference/mean": 0.010455544106662273, "step": 776 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 530.0, "completions/max_terminated_length": 530.0, "completions/mean_length": 190.1875, "completions/mean_terminated_length": 190.1875, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.8113136664032936, "epoch": 0.7685459940652819, "grad_norm": 2.2390105724334717, "kl_approx": 0.24354934692382812, "learning_rate": 3.1208426898074685e-06, "loss": 0.1964, "num_tokens": 19136945.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.210966944694519, "sampling/importance_sampling_ratio/mean": 1.0008158683776855, "sampling/importance_sampling_ratio/min": 0.8346094489097595, "sampling/sampling_logp_difference/max": 0.19141912460327148, "sampling/sampling_logp_difference/mean": 0.01205452624708414, "step": 777 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 566.0, "completions/max_terminated_length": 566.0, "completions/mean_length": 214.90625, "completions/mean_terminated_length": 214.90625, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.7593429991975427, "epoch": 0.7695351137487636, "grad_norm": 1.9375416040420532, "kl_approx": 0.20037841796875, "learning_rate": 3.0957997942825337e-06, "loss": 0.1719, "num_tokens": 19160846.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.183301329612732, "sampling/importance_sampling_ratio/mean": 0.99984210729599, "sampling/importance_sampling_ratio/min": 0.8623234033584595, "sampling/sampling_logp_difference/max": 0.16830825805664062, "sampling/sampling_logp_difference/mean": 0.011953229084610939, "step": 778 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 653.0, "completions/max_terminated_length": 653.0, "completions/mean_length": 262.84375, "completions/mean_terminated_length": 262.84375, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.8204573271796107, "epoch": 0.7705242334322453, "grad_norm": 1.8674826622009277, "kl_approx": 0.1760101318359375, "learning_rate": 3.070839366655215e-06, "loss": 0.1544, "num_tokens": 19188089.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1717618703842163, "sampling/importance_sampling_ratio/mean": 1.0002899169921875, "sampling/importance_sampling_ratio/min": 0.809440553188324, "sampling/sampling_logp_difference/max": 0.2114119529724121, "sampling/sampling_logp_difference/mean": 0.01262176688760519, "step": 779 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 704.0, "completions/max_terminated_length": 704.0, "completions/mean_length": 328.375, "completions/mean_terminated_length": 328.375, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.9087381018325686, "epoch": 0.771513353115727, "grad_norm": 1.7885541915893555, "kl_approx": 0.2420654296875, "learning_rate": 3.045961705067787e-06, "loss": 0.1794, "num_tokens": 19220981.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.301561951637268, "sampling/importance_sampling_ratio/mean": 0.9999999403953552, "sampling/importance_sampling_ratio/min": 0.8384387493133545, "sampling/sampling_logp_difference/max": 0.2635650634765625, "sampling/sampling_logp_difference/mean": 0.013223295100033283, "step": 780 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 429.0, "completions/max_terminated_length": 429.0, "completions/mean_length": 166.75, "completions/mean_terminated_length": 166.75, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.734044911339879, "epoch": 0.7725024727992087, "grad_norm": 1.8635265827178955, "kl_approx": 0.30612945556640625, "learning_rate": 3.021167106673928e-06, "loss": 0.1442, "num_tokens": 19246461.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.218836784362793, "sampling/importance_sampling_ratio/mean": 0.9999629855155945, "sampling/importance_sampling_ratio/min": 0.855048418045044, "sampling/sampling_logp_difference/max": 0.19789695739746094, "sampling/sampling_logp_difference/mean": 0.012059440836310387, "step": 781 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 277.0, "completions/max_terminated_length": 277.0, "completions/mean_length": 100.03125, "completions/mean_terminated_length": 100.03125, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7458344120532274, "epoch": 0.7734915924826904, "grad_norm": 2.418163299560547, "kl_approx": 0.2835102081298828, "learning_rate": 2.996455867635155e-06, "loss": 0.1712, "num_tokens": 19270614.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1749311685562134, "sampling/importance_sampling_ratio/mean": 1.0003546476364136, "sampling/importance_sampling_ratio/min": 0.8906407356262207, "sampling/sampling_logp_difference/max": 0.1612095832824707, "sampling/sampling_logp_difference/mean": 0.011670821346342564, "step": 782 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 514.0, "completions/max_terminated_length": 514.0, "completions/mean_length": 199.3125, "completions/mean_terminated_length": 199.3125, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.6923285452648997, "epoch": 0.7744807121661721, "grad_norm": 1.814054250717163, "kl_approx": 0.2374267578125, "learning_rate": 2.9718282831172885e-06, "loss": 0.1999, "num_tokens": 19297552.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.212210774421692, "sampling/importance_sampling_ratio/mean": 1.0003459453582764, "sampling/importance_sampling_ratio/min": 0.7937924861907959, "sampling/sampling_logp_difference/max": 0.23093318939208984, "sampling/sampling_logp_difference/mean": 0.010286676697432995, "step": 783 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 728.0, "completions/max_terminated_length": 728.0, "completions/mean_length": 205.59375, "completions/mean_terminated_length": 205.59375, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.768333493731916, "epoch": 0.7754698318496538, "grad_norm": 1.70387864112854, "kl_approx": 0.20894622802734375, "learning_rate": 2.94728464728693e-06, "loss": 0.1455, "num_tokens": 19327203.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.147918701171875, "sampling/importance_sampling_ratio/mean": 1.0000582933425903, "sampling/importance_sampling_ratio/min": 0.7854490876197815, "sampling/sampling_logp_difference/max": 0.241499662399292, "sampling/sampling_logp_difference/mean": 0.012056756764650345, "step": 784 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 539.0, "completions/max_terminated_length": 539.0, "completions/mean_length": 103.65625, "completions/mean_terminated_length": 103.65625, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.6047010589390993, "epoch": 0.7764589515331355, "grad_norm": 1.7982234954833984, "kl_approx": 0.20172882080078125, "learning_rate": 2.922825253307947e-06, "loss": 0.1454, "num_tokens": 19347840.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2060801982879639, "sampling/importance_sampling_ratio/mean": 1.0001922845840454, "sampling/importance_sampling_ratio/min": 0.7795014977455139, "sampling/sampling_logp_difference/max": 0.2491006851196289, "sampling/sampling_logp_difference/mean": 0.010520679876208305, "step": 785 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 504.0, "completions/max_terminated_length": 504.0, "completions/mean_length": 165.1875, "completions/mean_terminated_length": 165.1875, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.7859575487673283, "epoch": 0.7774480712166172, "grad_norm": 1.672959327697754, "kl_approx": 0.2245330810546875, "learning_rate": 2.898450393337977e-06, "loss": 0.1594, "num_tokens": 19372806.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1692349910736084, "sampling/importance_sampling_ratio/mean": 1.00032639503479, "sampling/importance_sampling_ratio/min": 0.8037509918212891, "sampling/sampling_logp_difference/max": 0.21846580505371094, "sampling/sampling_logp_difference/mean": 0.012245331890881062, "step": 786 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 264.0, "completions/max_terminated_length": 264.0, "completions/mean_length": 121.125, "completions/mean_terminated_length": 121.125, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.6494180117733777, "epoch": 0.7784371909000989, "grad_norm": 1.5652109384536743, "kl_approx": 0.1780242919921875, "learning_rate": 2.8741603585249312e-06, "loss": 0.1261, "num_tokens": 19395570.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.13481605052948, "sampling/importance_sampling_ratio/mean": 1.0004664659500122, "sampling/importance_sampling_ratio/min": 0.8422775864601135, "sampling/sampling_logp_difference/max": 0.1716456413269043, "sampling/sampling_logp_difference/mean": 0.01091289147734642, "step": 787 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 484.0, "completions/max_terminated_length": 484.0, "completions/mean_length": 182.90625, "completions/mean_terminated_length": 182.90625, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.8040411714464426, "epoch": 0.7794263105835806, "grad_norm": 2.2525360584259033, "kl_approx": 0.2740478515625, "learning_rate": 2.8499554390035144e-06, "loss": 0.2257, "num_tokens": 19418959.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2012258768081665, "sampling/importance_sampling_ratio/mean": 1.000215768814087, "sampling/importance_sampling_ratio/min": 0.8284616470336914, "sampling/sampling_logp_difference/max": 0.1881847381591797, "sampling/sampling_logp_difference/mean": 0.012648558244109154, "step": 788 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 516.0, "completions/max_terminated_length": 516.0, "completions/mean_length": 127.65625, "completions/mean_terminated_length": 127.65625, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.5847553880885243, "epoch": 0.7804154302670623, "grad_norm": 1.7269750833511353, "kl_approx": 0.179962158203125, "learning_rate": 2.8258359238917665e-06, "loss": 0.1242, "num_tokens": 19445428.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1826272010803223, "sampling/importance_sampling_ratio/mean": 0.9999560713768005, "sampling/importance_sampling_ratio/min": 0.8662846088409424, "sampling/sampling_logp_difference/max": 0.1677384376525879, "sampling/sampling_logp_difference/mean": 0.010186756029725075, "step": 789 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 609.0, "completions/max_terminated_length": 609.0, "completions/mean_length": 202.1875, "completions/mean_terminated_length": 202.1875, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.6673253723420203, "epoch": 0.781404549950544, "grad_norm": 3.402299642562866, "kl_approx": 0.2313690185546875, "learning_rate": 2.8018021012875994e-06, "loss": 0.1731, "num_tokens": 19473954.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3374247550964355, "sampling/importance_sampling_ratio/mean": 1.000119924545288, "sampling/importance_sampling_ratio/min": 0.7900175452232361, "sampling/sampling_logp_difference/max": 0.29074597358703613, "sampling/sampling_logp_difference/mean": 0.012018057517707348, "step": 790 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 749.0, "completions/max_terminated_length": 749.0, "completions/mean_length": 244.84375, "completions/mean_terminated_length": 244.84375, "completions/min_length": 74.0, "completions/min_terminated_length": 74.0, "entropy": 0.8286750735715032, "epoch": 0.7823936696340257, "grad_norm": 1.8432503938674927, "kl_approx": 0.235870361328125, "learning_rate": 2.7778542582653746e-06, "loss": 0.1903, "num_tokens": 19501197.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2024431228637695, "sampling/importance_sampling_ratio/mean": 0.9997339248657227, "sampling/importance_sampling_ratio/min": 0.8598173260688782, "sampling/sampling_logp_difference/max": 0.18435537815093994, "sampling/sampling_logp_difference/mean": 0.012581577524542809, "step": 791 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 760.0, "completions/max_terminated_length": 760.0, "completions/mean_length": 147.46875, "completions/mean_terminated_length": 147.46875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.5673684719949961, "epoch": 0.7833827893175074, "grad_norm": 2.1812283992767334, "kl_approx": 0.16191864013671875, "learning_rate": 2.753992680872457e-06, "loss": 0.1527, "num_tokens": 19527996.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1420871019363403, "sampling/importance_sampling_ratio/mean": 0.9999213218688965, "sampling/importance_sampling_ratio/min": 0.8776031136512756, "sampling/sampling_logp_difference/max": 0.1328573226928711, "sampling/sampling_logp_difference/mean": 0.010056587867438793, "step": 792 }, { "completions/clipped_ratio": 0.125, "completions/max_length": 1024.0, "completions/max_terminated_length": 861.0, "completions/mean_length": 271.4375, "completions/mean_terminated_length": 163.92857360839844, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.739608864299953, "epoch": 0.7843719090009891, "grad_norm": 2.263432264328003, "kl_approx": 0.259765625, "learning_rate": 2.7302176541257984e-06, "loss": 0.2073, "num_tokens": 19552690.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.290856957435608, "sampling/importance_sampling_ratio/mean": 1.0007665157318115, "sampling/importance_sampling_ratio/min": 0.8326441645622253, "sampling/sampling_logp_difference/max": 0.2553062438964844, "sampling/sampling_logp_difference/mean": 0.012727594003081322, "step": 793 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 501.0, "completions/max_terminated_length": 501.0, "completions/mean_length": 115.0625, "completions/mean_terminated_length": 115.0625, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.5804184242151678, "epoch": 0.7853610286844708, "grad_norm": 1.8792141675949097, "kl_approx": 0.17885971069335938, "learning_rate": 2.7065294620085425e-06, "loss": 0.1267, "num_tokens": 19580020.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.194462537765503, "sampling/importance_sampling_ratio/mean": 0.999908983707428, "sampling/importance_sampling_ratio/min": 0.8299452066421509, "sampling/sampling_logp_difference/max": 0.18639564514160156, "sampling/sampling_logp_difference/mean": 0.01124973502010107, "step": 794 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 673.0, "completions/max_terminated_length": 673.0, "completions/mean_length": 292.75, "completions/mean_terminated_length": 292.75, "completions/min_length": 76.0, "completions/min_terminated_length": 76.0, "entropy": 0.7511837314814329, "epoch": 0.7863501483679525, "grad_norm": 1.611304759979248, "kl_approx": 0.212158203125, "learning_rate": 2.6829283874666236e-06, "loss": 0.1404, "num_tokens": 19604732.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1655000448226929, "sampling/importance_sampling_ratio/mean": 0.9998471736907959, "sampling/importance_sampling_ratio/min": 0.8277806639671326, "sampling/sampling_logp_difference/max": 0.18900704383850098, "sampling/sampling_logp_difference/mean": 0.01167008001357317, "step": 795 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 639.0, "completions/max_terminated_length": 639.0, "completions/mean_length": 180.4375, "completions/mean_terminated_length": 180.4375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6936269570142031, "epoch": 0.7873392680514342, "grad_norm": 1.8359471559524536, "kl_approx": 0.190948486328125, "learning_rate": 2.6594147124053983e-06, "loss": 0.1476, "num_tokens": 19630282.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2173316478729248, "sampling/importance_sampling_ratio/mean": 1.000004529953003, "sampling/importance_sampling_ratio/min": 0.8375920057296753, "sampling/sampling_logp_difference/max": 0.19666123390197754, "sampling/sampling_logp_difference/mean": 0.011846049688756466, "step": 796 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 649.0, "completions/max_terminated_length": 649.0, "completions/mean_length": 271.625, "completions/mean_terminated_length": 271.625, "completions/min_length": 88.0, "completions/min_terminated_length": 88.0, "entropy": 0.956151551567018, "epoch": 0.7883283877349159, "grad_norm": 1.8727681636810303, "kl_approx": 0.2298736572265625, "learning_rate": 2.635988717686272e-06, "loss": 0.1853, "num_tokens": 19655030.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2140085697174072, "sampling/importance_sampling_ratio/mean": 1.0002492666244507, "sampling/importance_sampling_ratio/min": 0.8354037404060364, "sampling/sampling_logp_difference/max": 0.19392776489257812, "sampling/sampling_logp_difference/mean": 0.013510995544493198, "step": 797 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 834.0, "completions/mean_length": 231.25, "completions/mean_terminated_length": 205.6774139404297, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.7508184444159269, "epoch": 0.7893175074183977, "grad_norm": 2.312122106552124, "kl_approx": 0.234283447265625, "learning_rate": 2.6126506831233343e-06, "loss": 0.1727, "num_tokens": 19682590.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1700561046600342, "sampling/importance_sampling_ratio/mean": 0.9993911385536194, "sampling/importance_sampling_ratio/min": 0.7891371250152588, "sampling/sampling_logp_difference/max": 0.2368152141571045, "sampling/sampling_logp_difference/mean": 0.012311440892517567, "step": 798 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 544.0, "completions/max_terminated_length": 544.0, "completions/mean_length": 118.5, "completions/mean_terminated_length": 118.5, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.6987221278250217, "epoch": 0.7903066271018794, "grad_norm": 2.8240151405334473, "kl_approx": 0.2165679931640625, "learning_rate": 2.5894008874800323e-06, "loss": 0.1749, "num_tokens": 19705422.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2080330848693848, "sampling/importance_sampling_ratio/mean": 0.9999110102653503, "sampling/importance_sampling_ratio/min": 0.7751796841621399, "sampling/sampling_logp_difference/max": 0.2546604871749878, "sampling/sampling_logp_difference/mean": 0.011324385181069374, "step": 799 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 429.0, "completions/max_terminated_length": 429.0, "completions/mean_length": 190.0, "completions/mean_terminated_length": 190.0, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 1.1288280803710222, "epoch": 0.7912957467853611, "grad_norm": 2.593553304672241, "kl_approx": 0.328033447265625, "learning_rate": 2.5662396084658383e-06, "loss": 0.2461, "num_tokens": 19733838.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1339941024780273, "sampling/importance_sampling_ratio/mean": 0.9997237920761108, "sampling/importance_sampling_ratio/min": 0.808586061000824, "sampling/sampling_logp_difference/max": 0.21246814727783203, "sampling/sampling_logp_difference/mean": 0.015138117596507072, "step": 800 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 525.0, "completions/max_terminated_length": 525.0, "completions/mean_length": 244.0, "completions/mean_terminated_length": 244.0, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.8756250599399209, "epoch": 0.7922848664688428, "grad_norm": 1.8016654253005981, "kl_approx": 0.2222900390625, "learning_rate": 2.543167122732918e-06, "loss": 0.1705, "num_tokens": 19757046.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2998756170272827, "sampling/importance_sampling_ratio/mean": 0.9998582005500793, "sampling/importance_sampling_ratio/min": 0.8319144248962402, "sampling/sampling_logp_difference/max": 0.2622685432434082, "sampling/sampling_logp_difference/mean": 0.012075956910848618, "step": 801 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 399.0, "completions/max_terminated_length": 399.0, "completions/mean_length": 184.6875, "completions/mean_terminated_length": 184.6875, "completions/min_length": 77.0, "completions/min_terminated_length": 77.0, "entropy": 0.6322923507541418, "epoch": 0.7932739861523245, "grad_norm": 1.6143535375595093, "kl_approx": 0.18915557861328125, "learning_rate": 2.5201837058728506e-06, "loss": 0.1292, "num_tokens": 19787044.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.14322030544281, "sampling/importance_sampling_ratio/mean": 1.000381588935852, "sampling/importance_sampling_ratio/min": 0.8024382591247559, "sampling/sampling_logp_difference/max": 0.22010040283203125, "sampling/sampling_logp_difference/mean": 0.009702524170279503, "step": 802 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 298.0, "completions/max_terminated_length": 298.0, "completions/mean_length": 137.90625, "completions/mean_terminated_length": 137.90625, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.6932982010766864, "epoch": 0.7942631058358062, "grad_norm": 2.782600164413452, "kl_approx": 0.299957275390625, "learning_rate": 2.4972896324133143e-06, "loss": 0.2124, "num_tokens": 19809121.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.316989779472351, "sampling/importance_sampling_ratio/mean": 1.0000075101852417, "sampling/importance_sampling_ratio/min": 0.8712806701660156, "sampling/sampling_logp_difference/max": 0.2753486633300781, "sampling/sampling_logp_difference/mean": 0.01079451572149992, "step": 803 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 464.0, "completions/max_terminated_length": 464.0, "completions/mean_length": 185.40625, "completions/mean_terminated_length": 185.40625, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.8069083066657186, "epoch": 0.7952522255192879, "grad_norm": 1.5389788150787354, "kl_approx": 0.2188720703125, "learning_rate": 2.474485175814816e-06, "loss": 0.1664, "num_tokens": 19832486.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1922311782836914, "sampling/importance_sampling_ratio/mean": 1.0003334283828735, "sampling/importance_sampling_ratio/min": 0.846866250038147, "sampling/sampling_logp_difference/max": 0.1758265495300293, "sampling/sampling_logp_difference/mean": 0.013382320292294025, "step": 804 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 532.0, "completions/max_terminated_length": 532.0, "completions/mean_length": 177.0, "completions/mean_terminated_length": 177.0, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.8922103838995099, "epoch": 0.7962413452027696, "grad_norm": 2.207656145095825, "kl_approx": 0.31317138671875, "learning_rate": 2.451770608467432e-06, "loss": 0.2514, "num_tokens": 19857958.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1611270904541016, "sampling/importance_sampling_ratio/mean": 1.000306248664856, "sampling/importance_sampling_ratio/min": 0.8402814269065857, "sampling/sampling_logp_difference/max": 0.17401838302612305, "sampling/sampling_logp_difference/mean": 0.01336952019482851, "step": 805 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 513.0, "completions/max_terminated_length": 513.0, "completions/mean_length": 220.34375, "completions/mean_terminated_length": 220.34375, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.7702844543382525, "epoch": 0.7972304648862513, "grad_norm": 1.7542359828948975, "kl_approx": 0.2388458251953125, "learning_rate": 2.429146201687538e-06, "loss": 0.1748, "num_tokens": 19884081.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1619513034820557, "sampling/importance_sampling_ratio/mean": 0.9998541474342346, "sampling/importance_sampling_ratio/min": 0.8195187449455261, "sampling/sampling_logp_difference/max": 0.19903802871704102, "sampling/sampling_logp_difference/mean": 0.010800033807754517, "step": 806 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 588.0, "completions/max_terminated_length": 588.0, "completions/mean_length": 202.96875, "completions/mean_terminated_length": 202.96875, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.90824194252491, "epoch": 0.798219584569733, "grad_norm": 2.094484567642212, "kl_approx": 0.264373779296875, "learning_rate": 2.4066122257145898e-06, "loss": 0.2023, "num_tokens": 19906080.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1559348106384277, "sampling/importance_sampling_ratio/mean": 1.0001879930496216, "sampling/importance_sampling_ratio/min": 0.8361203074455261, "sampling/sampling_logp_difference/max": 0.17898273468017578, "sampling/sampling_logp_difference/mean": 0.01387878693640232, "step": 807 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 772.0, "completions/mean_length": 260.8125, "completions/mean_terminated_length": 236.19354248046875, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.7681874502450228, "epoch": 0.7992087042532147, "grad_norm": 1.5902607440948486, "kl_approx": 0.20803070068359375, "learning_rate": 2.3841689497078746e-06, "loss": 0.156, "num_tokens": 19931074.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.245582103729248, "sampling/importance_sampling_ratio/mean": 1.0000616312026978, "sampling/importance_sampling_ratio/min": 0.7930017709732056, "sampling/sampling_logp_difference/max": 0.23192977905273438, "sampling/sampling_logp_difference/mean": 0.010684972628951073, "step": 808 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 955.0, "completions/max_terminated_length": 955.0, "completions/mean_length": 251.1875, "completions/mean_terminated_length": 251.1875, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.6807626164518297, "epoch": 0.8001978239366964, "grad_norm": 1.440772294998169, "kl_approx": 0.18917083740234375, "learning_rate": 2.361816641743303e-06, "loss": 0.1356, "num_tokens": 19960296.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2227247953414917, "sampling/importance_sampling_ratio/mean": 0.999534010887146, "sampling/importance_sampling_ratio/min": 0.8380526900291443, "sampling/sampling_logp_difference/max": 0.2010817527770996, "sampling/sampling_logp_difference/mean": 0.011579541489481926, "step": 809 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 643.0, "completions/max_terminated_length": 643.0, "completions/mean_length": 242.25, "completions/mean_terminated_length": 242.25, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.799334654584527, "epoch": 0.8011869436201781, "grad_norm": 2.026036024093628, "kl_approx": 0.23323822021484375, "learning_rate": 2.339555568810221e-06, "loss": 0.1671, "num_tokens": 19988256.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.212986707687378, "sampling/importance_sampling_ratio/mean": 0.9996810555458069, "sampling/importance_sampling_ratio/min": 0.7976768016815186, "sampling/sampling_logp_difference/max": 0.22605180740356445, "sampling/sampling_logp_difference/mean": 0.011828187853097916, "step": 810 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 852.0, "completions/max_terminated_length": 852.0, "completions/mean_length": 191.6875, "completions/mean_terminated_length": 191.6875, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.5353603768162429, "epoch": 0.8021760633036598, "grad_norm": 1.5578076839447021, "kl_approx": 0.1275482177734375, "learning_rate": 2.317385996808195e-06, "loss": 0.1087, "num_tokens": 20016182.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2017338275909424, "sampling/importance_sampling_ratio/mean": 1.0001285076141357, "sampling/importance_sampling_ratio/min": 0.7422970533370972, "sampling/sampling_logp_difference/max": 0.2980057895183563, "sampling/sampling_logp_difference/mean": 0.009700559079647064, "step": 811 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 984.0, "completions/max_terminated_length": 984.0, "completions/mean_length": 322.25, "completions/mean_terminated_length": 322.25, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.9206033954396844, "epoch": 0.8031651829871415, "grad_norm": 2.1160755157470703, "kl_approx": 0.2827186584472656, "learning_rate": 2.295308190543859e-06, "loss": 0.2241, "num_tokens": 20047422.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2038806676864624, "sampling/importance_sampling_ratio/mean": 1.0001498460769653, "sampling/importance_sampling_ratio/min": 0.8053768873214722, "sampling/sampling_logp_difference/max": 0.2164449691772461, "sampling/sampling_logp_difference/mean": 0.01308587845414877, "step": 812 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 710.0, "completions/max_terminated_length": 710.0, "completions/mean_length": 176.9375, "completions/mean_terminated_length": 176.9375, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.7126810541376472, "epoch": 0.8041543026706232, "grad_norm": 1.7519960403442383, "kl_approx": 0.224578857421875, "learning_rate": 2.2733224137277366e-06, "loss": 0.1272, "num_tokens": 20072836.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1799893379211426, "sampling/importance_sampling_ratio/mean": 0.9992063045501709, "sampling/importance_sampling_ratio/min": 0.8395549654960632, "sampling/sampling_logp_difference/max": 0.17488336563110352, "sampling/sampling_logp_difference/mean": 0.012527667917311192, "step": 813 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 618.0, "completions/max_terminated_length": 618.0, "completions/mean_length": 171.84375, "completions/mean_terminated_length": 171.84375, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.7151664244011045, "epoch": 0.8051434223541049, "grad_norm": 1.7764426469802856, "kl_approx": 0.16549301147460938, "learning_rate": 2.251428928971102e-06, "loss": 0.1205, "num_tokens": 20093927.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1933130025863647, "sampling/importance_sampling_ratio/mean": 0.9997105002403259, "sampling/importance_sampling_ratio/min": 0.8045356869697571, "sampling/sampling_logp_difference/max": 0.21748995780944824, "sampling/sampling_logp_difference/mean": 0.013012830168008804, "step": 814 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 401.0, "completions/max_terminated_length": 401.0, "completions/mean_length": 86.9375, "completions/mean_terminated_length": 86.9375, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.47396235074847937, "epoch": 0.8061325420375866, "grad_norm": 1.7884405851364136, "kl_approx": 0.17401885986328125, "learning_rate": 2.229627997782834e-06, "loss": 0.1045, "num_tokens": 20114069.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1385494470596313, "sampling/importance_sampling_ratio/mean": 0.9995148777961731, "sampling/importance_sampling_ratio/min": 0.8778520822525024, "sampling/sampling_logp_difference/max": 0.13027715682983398, "sampling/sampling_logp_difference/mean": 0.009039539843797684, "step": 815 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 419.0, "completions/max_terminated_length": 419.0, "completions/mean_length": 121.875, "completions/mean_terminated_length": 121.875, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.54599186219275, "epoch": 0.8071216617210683, "grad_norm": 2.6294963359832764, "kl_approx": 0.1708850860595703, "learning_rate": 2.2079198805662917e-06, "loss": 0.1439, "num_tokens": 20132489.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2647111415863037, "sampling/importance_sampling_ratio/mean": 0.9997193813323975, "sampling/importance_sampling_ratio/min": 0.7633368372917175, "sampling/sampling_logp_difference/max": 0.270055890083313, "sampling/sampling_logp_difference/mean": 0.011348331347107887, "step": 816 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 432.0, "completions/max_terminated_length": 432.0, "completions/mean_length": 142.84375, "completions/mean_terminated_length": 142.84375, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.7448115963488817, "epoch": 0.80811078140455, "grad_norm": 2.0077178478240967, "kl_approx": 0.228912353515625, "learning_rate": 2.186304836616221e-06, "loss": 0.1899, "num_tokens": 20156332.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1915041208267212, "sampling/importance_sampling_ratio/mean": 1.0005381107330322, "sampling/importance_sampling_ratio/min": 0.8750109672546387, "sampling/sampling_logp_difference/max": 0.1752164363861084, "sampling/sampling_logp_difference/mean": 0.011856595054268837, "step": 817 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 283.0, "completions/max_terminated_length": 283.0, "completions/mean_length": 103.1875, "completions/mean_terminated_length": 103.1875, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.6449734289199114, "epoch": 0.8090999010880316, "grad_norm": 2.7135064601898193, "kl_approx": 0.22261619567871094, "learning_rate": 2.1647831241156304e-06, "loss": 0.2051, "num_tokens": 20178818.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1330225467681885, "sampling/importance_sampling_ratio/mean": 1.000312089920044, "sampling/importance_sampling_ratio/min": 0.8481324315071106, "sampling/sampling_logp_difference/max": 0.16471850872039795, "sampling/sampling_logp_difference/mean": 0.011256621219217777, "step": 818 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 259.0, "completions/max_terminated_length": 259.0, "completions/mean_length": 150.25, "completions/mean_terminated_length": 150.25, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 0.7287493972107768, "epoch": 0.8100890207715133, "grad_norm": 2.3316335678100586, "kl_approx": 0.26146697998046875, "learning_rate": 2.1433550001327376e-06, "loss": 0.1793, "num_tokens": 20210130.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2650108337402344, "sampling/importance_sampling_ratio/mean": 1.0001651048660278, "sampling/importance_sampling_ratio/min": 0.8515626192092896, "sampling/sampling_logp_difference/max": 0.23508071899414062, "sampling/sampling_logp_difference/mean": 0.011669864878058434, "step": 819 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 669.0, "completions/max_terminated_length": 669.0, "completions/mean_length": 229.65625, "completions/mean_terminated_length": 229.65625, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.6289154421538115, "epoch": 0.811078140454995, "grad_norm": 1.8571513891220093, "kl_approx": 0.19363021850585938, "learning_rate": 2.122020720617869e-06, "loss": 0.155, "num_tokens": 20238311.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.17811119556427, "sampling/importance_sampling_ratio/mean": 1.0002878904342651, "sampling/importance_sampling_ratio/min": 0.8429961800575256, "sampling/sampling_logp_difference/max": 0.170792818069458, "sampling/sampling_logp_difference/mean": 0.011247818358242512, "step": 820 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 636.0, "completions/max_terminated_length": 636.0, "completions/mean_length": 183.15625, "completions/mean_terminated_length": 183.15625, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.5567439370788634, "epoch": 0.8120672601384767, "grad_norm": 1.461815357208252, "kl_approx": 0.12855911254882812, "learning_rate": 2.1007805404004247e-06, "loss": 0.1091, "num_tokens": 20259348.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1768467426300049, "sampling/importance_sampling_ratio/mean": 0.9999234080314636, "sampling/importance_sampling_ratio/min": 0.8640590906143188, "sampling/sampling_logp_difference/max": 0.16283857822418213, "sampling/sampling_logp_difference/mean": 0.01059647649526596, "step": 821 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 734.0, "completions/max_terminated_length": 734.0, "completions/mean_length": 375.9375, "completions/mean_terminated_length": 375.9375, "completions/min_length": 72.0, "completions/min_terminated_length": 72.0, "entropy": 1.0968899093568325, "epoch": 0.8130563798219584, "grad_norm": 1.940603494644165, "kl_approx": 0.2564849853515625, "learning_rate": 2.0796347131858187e-06, "loss": 0.2087, "num_tokens": 20288994.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2632631063461304, "sampling/importance_sampling_ratio/mean": 1.0000470876693726, "sampling/importance_sampling_ratio/min": 0.7999026775360107, "sampling/sampling_logp_difference/max": 0.23369812965393066, "sampling/sampling_logp_difference/mean": 0.014559764415025711, "step": 822 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 783.0, "completions/max_terminated_length": 783.0, "completions/mean_length": 236.40625, "completions/mean_terminated_length": 236.40625, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.6580306785181165, "epoch": 0.8140454995054401, "grad_norm": 1.8498451709747314, "kl_approx": 0.2645301818847656, "learning_rate": 2.058583491552465e-06, "loss": 0.1439, "num_tokens": 20318647.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3455438613891602, "sampling/importance_sampling_ratio/mean": 1.0001001358032227, "sampling/importance_sampling_ratio/min": 0.8475660681724548, "sampling/sampling_logp_difference/max": 0.2967982292175293, "sampling/sampling_logp_difference/mean": 0.012376741506159306, "step": 823 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 1012.0, "completions/max_terminated_length": 1012.0, "completions/mean_length": 349.5, "completions/mean_terminated_length": 349.5, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.817100421525538, "epoch": 0.8150346191889218, "grad_norm": 2.4465389251708984, "kl_approx": 0.2211151123046875, "learning_rate": 2.037627126948751e-06, "loss": 0.1774, "num_tokens": 20346327.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2441844940185547, "sampling/importance_sampling_ratio/mean": 0.9998636245727539, "sampling/importance_sampling_ratio/min": 0.8063498139381409, "sampling/sampling_logp_difference/max": 0.21848034858703613, "sampling/sampling_logp_difference/mean": 0.012954936362802982, "step": 824 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 784.0, "completions/max_terminated_length": 784.0, "completions/mean_length": 188.875, "completions/mean_terminated_length": 188.875, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.7864376734942198, "epoch": 0.8160237388724035, "grad_norm": 2.006314754486084, "kl_approx": 0.2301654815673828, "learning_rate": 2.0167658696900317e-06, "loss": 0.1972, "num_tokens": 20365803.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1875463724136353, "sampling/importance_sampling_ratio/mean": 0.999885082244873, "sampling/importance_sampling_ratio/min": 0.8405110836029053, "sampling/sampling_logp_difference/max": 0.17374515533447266, "sampling/sampling_logp_difference/mean": 0.013703472912311554, "step": 825 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 480.0, "completions/max_terminated_length": 480.0, "completions/mean_length": 161.53125, "completions/mean_terminated_length": 161.53125, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.8727089278399944, "epoch": 0.8170128585558852, "grad_norm": 2.710186243057251, "kl_approx": 0.3091583251953125, "learning_rate": 1.9959999689556407e-06, "loss": 0.2148, "num_tokens": 20389068.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1556895971298218, "sampling/importance_sampling_ratio/mean": 1.0010799169540405, "sampling/importance_sampling_ratio/min": 0.8432978987693787, "sampling/sampling_logp_difference/max": 0.17043495178222656, "sampling/sampling_logp_difference/mean": 0.01302342675626278, "step": 826 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 876.0, "completions/max_terminated_length": 876.0, "completions/mean_length": 313.71875, "completions/mean_terminated_length": 313.71875, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.8115420443937182, "epoch": 0.8180019782393669, "grad_norm": 2.0440943241119385, "kl_approx": 0.2524089813232422, "learning_rate": 1.9753296727859195e-06, "loss": 0.2124, "num_tokens": 20421771.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2773525714874268, "sampling/importance_sampling_ratio/mean": 1.000308871269226, "sampling/importance_sampling_ratio/min": 0.7871443033218384, "sampling/sampling_logp_difference/max": 0.24478960037231445, "sampling/sampling_logp_difference/mean": 0.01310045924037695, "step": 827 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 548.0, "completions/max_terminated_length": 548.0, "completions/mean_length": 227.375, "completions/mean_terminated_length": 227.375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.9245072463527322, "epoch": 0.8189910979228486, "grad_norm": 1.9513134956359863, "kl_approx": 0.2391815185546875, "learning_rate": 1.9547552280792528e-06, "loss": 0.1715, "num_tokens": 20448199.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1468971967697144, "sampling/importance_sampling_ratio/mean": 0.9995499849319458, "sampling/importance_sampling_ratio/min": 0.8506080508232117, "sampling/sampling_logp_difference/max": 0.16180384159088135, "sampling/sampling_logp_difference/mean": 0.014054795727133751, "step": 828 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 517.0, "completions/max_terminated_length": 517.0, "completions/mean_length": 231.78125, "completions/mean_terminated_length": 231.78125, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.7623970070853829, "epoch": 0.8199802176063303, "grad_norm": 1.8615443706512451, "kl_approx": 0.2051544189453125, "learning_rate": 1.9342768805891176e-06, "loss": 0.1522, "num_tokens": 20476624.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1732714176177979, "sampling/importance_sampling_ratio/mean": 1.0002026557922363, "sampling/importance_sampling_ratio/min": 0.7755718231201172, "sampling/sampling_logp_difference/max": 0.25415468215942383, "sampling/sampling_logp_difference/mean": 0.01251946110278368, "step": 829 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 650.0, "completions/max_terminated_length": 650.0, "completions/mean_length": 184.1875, "completions/mean_terminated_length": 184.1875, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.7133133998140693, "epoch": 0.820969337289812, "grad_norm": 1.8496155738830566, "kl_approx": 0.21076583862304688, "learning_rate": 1.9138948749211473e-06, "loss": 0.1554, "num_tokens": 20503278.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1776959896087646, "sampling/importance_sampling_ratio/mean": 0.9994922876358032, "sampling/importance_sampling_ratio/min": 0.7960987091064453, "sampling/sampling_logp_difference/max": 0.22803211212158203, "sampling/sampling_logp_difference/mean": 0.012616042047739029, "step": 830 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 671.0, "completions/max_terminated_length": 671.0, "completions/mean_length": 192.96875, "completions/mean_terminated_length": 192.96875, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7184406016021967, "epoch": 0.8219584569732937, "grad_norm": 4.907298564910889, "kl_approx": 0.25978660583496094, "learning_rate": 1.8936094545302098e-06, "loss": 0.1809, "num_tokens": 20524981.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2129230499267578, "sampling/importance_sampling_ratio/mean": 1.000052809715271, "sampling/importance_sampling_ratio/min": 0.8330878019332886, "sampling/sampling_logp_difference/max": 0.19303321838378906, "sampling/sampling_logp_difference/mean": 0.01220610924065113, "step": 831 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 472.0, "completions/max_terminated_length": 472.0, "completions/mean_length": 180.8125, "completions/mean_terminated_length": 180.8125, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.6639349646866322, "epoch": 0.8229475766567754, "grad_norm": 2.132385730743408, "kl_approx": 0.23682785034179688, "learning_rate": 1.8734208617174986e-06, "loss": 0.1684, "num_tokens": 20547663.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1941019296646118, "sampling/importance_sampling_ratio/mean": 0.9999690651893616, "sampling/importance_sampling_ratio/min": 0.7864207029342651, "sampling/sampling_logp_difference/max": 0.2402634620666504, "sampling/sampling_logp_difference/mean": 0.011153270490467548, "step": 832 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 272.0, "completions/max_terminated_length": 272.0, "completions/mean_length": 114.0625, "completions/mean_terminated_length": 114.0625, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.5359345502220094, "epoch": 0.8239366963402571, "grad_norm": 2.768261194229126, "kl_approx": 0.21677398681640625, "learning_rate": 1.8533293376276473e-06, "loss": 0.1492, "num_tokens": 20572913.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.207924723625183, "sampling/importance_sampling_ratio/mean": 0.9999871850013733, "sampling/importance_sampling_ratio/min": 0.8273909687995911, "sampling/sampling_logp_difference/max": 0.18947792053222656, "sampling/sampling_logp_difference/mean": 0.010471354238688946, "step": 833 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 728.0, "completions/mean_length": 192.90625, "completions/mean_terminated_length": 166.09677124023438, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.8490594010800123, "epoch": 0.8249258160237388, "grad_norm": 1.648935317993164, "kl_approx": 0.2189178466796875, "learning_rate": 1.8333351222458407e-06, "loss": 0.1794, "num_tokens": 20602262.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2054206132888794, "sampling/importance_sampling_ratio/mean": 1.0003396272659302, "sampling/importance_sampling_ratio/min": 0.7986541390419006, "sampling/sampling_logp_difference/max": 0.22482728958129883, "sampling/sampling_logp_difference/mean": 0.013403374701738358, "step": 834 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 386.0, "completions/max_terminated_length": 386.0, "completions/mean_length": 218.09375, "completions/mean_terminated_length": 218.09375, "completions/min_length": 109.0, "completions/min_terminated_length": 109.0, "entropy": 0.8250770168378949, "epoch": 0.8259149357072205, "grad_norm": 2.7915542125701904, "kl_approx": 0.302398681640625, "learning_rate": 1.813438454394948e-06, "loss": 0.2259, "num_tokens": 20636497.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.230188250541687, "sampling/importance_sampling_ratio/mean": 1.0000112056732178, "sampling/importance_sampling_ratio/min": 0.8047833442687988, "sampling/sampling_logp_difference/max": 0.21718215942382812, "sampling/sampling_logp_difference/mean": 0.011639026924967766, "step": 835 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 419.0, "completions/max_terminated_length": 419.0, "completions/mean_length": 134.375, "completions/mean_terminated_length": 134.375, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7089011920616031, "epoch": 0.8269040553907022, "grad_norm": 2.2507059574127197, "kl_approx": 0.21770477294921875, "learning_rate": 1.7936395717326705e-06, "loss": 0.1577, "num_tokens": 20656253.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.163831353187561, "sampling/importance_sampling_ratio/mean": 1.0003005266189575, "sampling/importance_sampling_ratio/min": 0.8772572875022888, "sampling/sampling_logp_difference/max": 0.1517174243927002, "sampling/sampling_logp_difference/mean": 0.010651462711393833, "step": 836 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 493.0, "completions/max_terminated_length": 493.0, "completions/mean_length": 203.15625, "completions/mean_terminated_length": 203.15625, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 0.6261175060644746, "epoch": 0.827893175074184, "grad_norm": 1.4257014989852905, "kl_approx": 0.2004852294921875, "learning_rate": 1.773938710748706e-06, "loss": 0.114, "num_tokens": 20679266.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2066669464111328, "sampling/importance_sampling_ratio/mean": 0.9997817277908325, "sampling/importance_sampling_ratio/min": 0.7337743639945984, "sampling/sampling_logp_difference/max": 0.30955374240875244, "sampling/sampling_logp_difference/mean": 0.011319441720843315, "step": 837 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 494.0, "completions/max_terminated_length": 494.0, "completions/mean_length": 168.5, "completions/mean_terminated_length": 168.5, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.7401110138744116, "epoch": 0.8288822947576657, "grad_norm": 2.0186948776245117, "kl_approx": 0.20096397399902344, "learning_rate": 1.7543361067619269e-06, "loss": 0.1504, "num_tokens": 20700282.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1784443855285645, "sampling/importance_sampling_ratio/mean": 1.0001091957092285, "sampling/importance_sampling_ratio/min": 0.8215665817260742, "sampling/sampling_logp_difference/max": 0.19654226303100586, "sampling/sampling_logp_difference/mean": 0.0116438502445817, "step": 838 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 464.0, "completions/max_terminated_length": 464.0, "completions/mean_length": 153.9375, "completions/mean_terminated_length": 153.9375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6445421478711069, "epoch": 0.8298714144411474, "grad_norm": 1.7069659233093262, "kl_approx": 0.223175048828125, "learning_rate": 1.734831993917564e-06, "loss": 0.1217, "num_tokens": 20724216.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.6190963983535767, "sampling/importance_sampling_ratio/mean": 1.0002397298812866, "sampling/importance_sampling_ratio/min": 0.850501537322998, "sampling/sampling_logp_difference/max": 0.48186826705932617, "sampling/sampling_logp_difference/mean": 0.012204690836369991, "step": 839 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 405.0, "completions/max_terminated_length": 405.0, "completions/mean_length": 117.34375, "completions/mean_terminated_length": 117.34375, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.6815959895029664, "epoch": 0.8308605341246291, "grad_norm": 3.1425936222076416, "kl_approx": 0.22593307495117188, "learning_rate": 1.715426605184407e-06, "loss": 0.1501, "num_tokens": 20739035.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2372386455535889, "sampling/importance_sampling_ratio/mean": 1.000622034072876, "sampling/importance_sampling_ratio/min": 0.839032769203186, "sampling/sampling_logp_difference/max": 0.21288204193115234, "sampling/sampling_logp_difference/mean": 0.01193180587142706, "step": 840 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 634.0, "completions/max_terminated_length": 634.0, "completions/mean_length": 200.0, "completions/mean_terminated_length": 200.0, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.7954215705394745, "epoch": 0.8318496538081108, "grad_norm": 1.5092633962631226, "kl_approx": 0.23439407348632812, "learning_rate": 1.6961201723520248e-06, "loss": 0.1592, "num_tokens": 20764387.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1467615365982056, "sampling/importance_sampling_ratio/mean": 1.000292181968689, "sampling/importance_sampling_ratio/min": 0.7987450361251831, "sampling/sampling_logp_difference/max": 0.22471356391906738, "sampling/sampling_logp_difference/mean": 0.013224415481090546, "step": 841 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 337.0, "completions/max_terminated_length": 337.0, "completions/mean_length": 87.75, "completions/mean_terminated_length": 87.75, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.5212134253233671, "epoch": 0.8328387734915925, "grad_norm": 2.4316389560699463, "kl_approx": 0.1818256378173828, "learning_rate": 1.676912926028007e-06, "loss": 0.1299, "num_tokens": 20784899.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.256247878074646, "sampling/importance_sampling_ratio/mean": 0.9999768733978271, "sampling/importance_sampling_ratio/min": 0.8599178194999695, "sampling/sampling_logp_difference/max": 0.22812938690185547, "sampling/sampling_logp_difference/mean": 0.010654388926923275, "step": 842 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 157.0, "completions/max_terminated_length": 157.0, "completions/mean_length": 68.28125, "completions/mean_terminated_length": 68.28125, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.4554406814277172, "epoch": 0.8338278931750742, "grad_norm": 1.8141101598739624, "kl_approx": 0.17968368530273438, "learning_rate": 1.6578050956351887e-06, "loss": 0.0987, "num_tokens": 20801804.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1784719228744507, "sampling/importance_sampling_ratio/mean": 1.0000882148742676, "sampling/importance_sampling_ratio/min": 0.8565269112586975, "sampling/sampling_logp_difference/max": 0.16421866416931152, "sampling/sampling_logp_difference/mean": 0.008645191788673401, "step": 843 }, { "completions/clipped_ratio": 0.0625, "completions/max_length": 1024.0, "completions/max_terminated_length": 298.0, "completions/mean_length": 178.28125, "completions/mean_terminated_length": 121.90000915527344, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6112854685634375, "epoch": 0.8348170128585559, "grad_norm": 2.481079339981079, "kl_approx": 0.21007156372070312, "learning_rate": 1.6387969094089318e-06, "loss": 0.182, "num_tokens": 20825221.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.233145833015442, "sampling/importance_sampling_ratio/mean": 0.9999181628227234, "sampling/importance_sampling_ratio/min": 0.8303113579750061, "sampling/sampling_logp_difference/max": 0.20956850051879883, "sampling/sampling_logp_difference/mean": 0.010586237534880638, "step": 844 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 439.0, "completions/max_terminated_length": 439.0, "completions/mean_length": 171.59375, "completions/mean_terminated_length": 171.59375, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.5482752448879182, "epoch": 0.8358061325420376, "grad_norm": 1.3415976762771606, "kl_approx": 0.15362930297851562, "learning_rate": 1.619888594394382e-06, "loss": 0.1135, "num_tokens": 20848464.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2234150171279907, "sampling/importance_sampling_ratio/mean": 0.9997643232345581, "sampling/importance_sampling_ratio/min": 0.755743682384491, "sampling/sampling_logp_difference/max": 0.2800530195236206, "sampling/sampling_logp_difference/mean": 0.0090418616309762, "step": 845 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 507.0, "completions/max_terminated_length": 507.0, "completions/mean_length": 193.6875, "completions/mean_terminated_length": 193.6875, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.740804058033973, "epoch": 0.8367952522255193, "grad_norm": 2.5532968044281006, "kl_approx": 0.27423095703125, "learning_rate": 1.6010803764437633e-06, "loss": 0.2141, "num_tokens": 20874494.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2521963119506836, "sampling/importance_sampling_ratio/mean": 1.0001436471939087, "sampling/importance_sampling_ratio/min": 0.8138056397438049, "sampling/sampling_logp_difference/max": 0.2248990535736084, "sampling/sampling_logp_difference/mean": 0.013364393264055252, "step": 846 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 576.0, "completions/max_terminated_length": 576.0, "completions/mean_length": 156.28125, "completions/mean_terminated_length": 156.28125, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.6573626939207315, "epoch": 0.837784371909001, "grad_norm": 1.8061906099319458, "kl_approx": 0.21539306640625, "learning_rate": 1.5823724802136863e-06, "loss": 0.1575, "num_tokens": 20898407.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1708489656448364, "sampling/importance_sampling_ratio/mean": 0.9997046589851379, "sampling/importance_sampling_ratio/min": 0.8053953051567078, "sampling/sampling_logp_difference/max": 0.21642208099365234, "sampling/sampling_logp_difference/mean": 0.014280743896961212, "step": 847 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 607.0, "completions/max_terminated_length": 607.0, "completions/mean_length": 225.1875, "completions/mean_terminated_length": 225.1875, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.9347022175788879, "epoch": 0.8387734915924827, "grad_norm": 2.3451077938079834, "kl_approx": 0.27093505859375, "learning_rate": 1.5637651291624522e-06, "loss": 0.2388, "num_tokens": 20925013.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2076714038848877, "sampling/importance_sampling_ratio/mean": 1.00005304813385, "sampling/importance_sampling_ratio/min": 0.7822175621986389, "sampling/sampling_logp_difference/max": 0.2456223964691162, "sampling/sampling_logp_difference/mean": 0.014396576210856438, "step": 848 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 858.0, "completions/max_terminated_length": 858.0, "completions/mean_length": 326.6875, "completions/mean_terminated_length": 326.6875, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.7803532937541604, "epoch": 0.8397626112759644, "grad_norm": 1.6501487493515015, "kl_approx": 0.234832763671875, "learning_rate": 1.545258545547398e-06, "loss": 0.1649, "num_tokens": 20956907.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.284583330154419, "sampling/importance_sampling_ratio/mean": 0.9999118447303772, "sampling/importance_sampling_ratio/min": 0.8162310719490051, "sampling/sampling_logp_difference/max": 0.25043439865112305, "sampling/sampling_logp_difference/mean": 0.011882905848324299, "step": 849 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 759.0, "completions/max_terminated_length": 759.0, "completions/mean_length": 212.0625, "completions/mean_terminated_length": 212.0625, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6175416028127074, "epoch": 0.8407517309594461, "grad_norm": 2.191399574279785, "kl_approx": 0.20505523681640625, "learning_rate": 1.5268529504222262e-06, "loss": 0.1263, "num_tokens": 20979061.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.176632285118103, "sampling/importance_sampling_ratio/mean": 0.9996866583824158, "sampling/importance_sampling_ratio/min": 0.8389522433280945, "sampling/sampling_logp_difference/max": 0.17560148239135742, "sampling/sampling_logp_difference/mean": 0.01148871798068285, "step": 850 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 495.0, "completions/max_terminated_length": 495.0, "completions/mean_length": 142.40625, "completions/mean_terminated_length": 142.40625, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.8054220881313086, "epoch": 0.8417408506429278, "grad_norm": 1.822456955909729, "kl_approx": 0.2179718017578125, "learning_rate": 1.5085485636343755e-06, "loss": 0.1523, "num_tokens": 20997978.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1995195150375366, "sampling/importance_sampling_ratio/mean": 0.9995214939117432, "sampling/importance_sampling_ratio/min": 0.829023003578186, "sampling/sampling_logp_difference/max": 0.18750739097595215, "sampling/sampling_logp_difference/mean": 0.01296360045671463, "step": 851 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 463.0, "completions/max_terminated_length": 463.0, "completions/mean_length": 180.5, "completions/mean_terminated_length": 180.5, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.7270481586456299, "epoch": 0.8427299703264095, "grad_norm": 1.8621207475662231, "kl_approx": 0.19521331787109375, "learning_rate": 1.4903456038223941e-06, "loss": 0.1454, "num_tokens": 21021490.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2389174699783325, "sampling/importance_sampling_ratio/mean": 1.000577688217163, "sampling/importance_sampling_ratio/min": 0.8289809823036194, "sampling/sampling_logp_difference/max": 0.21423792839050293, "sampling/sampling_logp_difference/mean": 0.012442229315638542, "step": 852 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 698.0, "completions/max_terminated_length": 698.0, "completions/mean_length": 224.59375, "completions/mean_terminated_length": 224.59375, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.8210647413507104, "epoch": 0.8437190900098912, "grad_norm": 1.6753973960876465, "kl_approx": 0.234832763671875, "learning_rate": 1.4722442884133214e-06, "loss": 0.1942, "num_tokens": 21047293.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1782739162445068, "sampling/importance_sampling_ratio/mean": 0.9996474385261536, "sampling/importance_sampling_ratio/min": 0.8009993433952332, "sampling/sampling_logp_difference/max": 0.2218952178955078, "sampling/sampling_logp_difference/mean": 0.012058698572218418, "step": 853 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 620.0, "completions/max_terminated_length": 620.0, "completions/mean_length": 195.6875, "completions/mean_terminated_length": 195.6875, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.7029381822794676, "epoch": 0.8447082096933729, "grad_norm": 1.695449948310852, "kl_approx": 0.20562744140625, "learning_rate": 1.4542448336201021e-06, "loss": 0.1566, "num_tokens": 21078387.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.184118628501892, "sampling/importance_sampling_ratio/mean": 1.0000206232070923, "sampling/importance_sampling_ratio/min": 0.8741347193717957, "sampling/sampling_logp_difference/max": 0.16899871826171875, "sampling/sampling_logp_difference/mean": 0.010243641212582588, "step": 854 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 728.0, "completions/max_terminated_length": 728.0, "completions/mean_length": 358.3125, "completions/mean_terminated_length": 358.3125, "completions/min_length": 84.0, "completions/min_terminated_length": 84.0, "entropy": 0.9769021607935429, "epoch": 0.8456973293768546, "grad_norm": 1.6071277856826782, "kl_approx": 0.2570343017578125, "learning_rate": 1.4363474544389876e-06, "loss": 0.2084, "num_tokens": 21111037.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2526891231536865, "sampling/importance_sampling_ratio/mean": 0.9998522400856018, "sampling/importance_sampling_ratio/min": 0.6887867450714111, "sampling/sampling_logp_difference/max": 0.3728235960006714, "sampling/sampling_logp_difference/mean": 0.014446815475821495, "step": 855 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 429.0, "completions/max_terminated_length": 429.0, "completions/mean_length": 123.4375, "completions/mean_terminated_length": 123.4375, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.5980360358953476, "epoch": 0.8466864490603363, "grad_norm": 1.9721345901489258, "kl_approx": 0.16869354248046875, "learning_rate": 1.4185523646469822e-06, "loss": 0.1262, "num_tokens": 21130843.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1948047876358032, "sampling/importance_sampling_ratio/mean": 1.0005669593811035, "sampling/importance_sampling_ratio/min": 0.867784321308136, "sampling/sampling_logp_difference/max": 0.17798280715942383, "sampling/sampling_logp_difference/mean": 0.01128359604626894, "step": 856 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 576.0, "completions/max_terminated_length": 576.0, "completions/mean_length": 146.625, "completions/mean_terminated_length": 146.625, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.6593683622777462, "epoch": 0.847675568743818, "grad_norm": 2.2662510871887207, "kl_approx": 0.2286529541015625, "learning_rate": 1.4008597767992872e-06, "loss": 0.1646, "num_tokens": 21153919.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1342706680297852, "sampling/importance_sampling_ratio/mean": 1.0003328323364258, "sampling/importance_sampling_ratio/min": 0.8430365920066833, "sampling/sampling_logp_difference/max": 0.1707448959350586, "sampling/sampling_logp_difference/mean": 0.01124135684221983, "step": 857 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 432.0, "completions/max_terminated_length": 432.0, "completions/mean_length": 154.25, "completions/mean_terminated_length": 154.25, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.6073929169215262, "epoch": 0.8486646884272997, "grad_norm": 2.0579335689544678, "kl_approx": 0.162841796875, "learning_rate": 1.3832699022267516e-06, "loss": 0.1367, "num_tokens": 21179599.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1520169973373413, "sampling/importance_sampling_ratio/mean": 0.9988042116165161, "sampling/importance_sampling_ratio/min": 0.8724808692932129, "sampling/sampling_logp_difference/max": 0.14151430130004883, "sampling/sampling_logp_difference/mean": 0.010720555670559406, "step": 858 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 909.0, "completions/max_terminated_length": 909.0, "completions/mean_length": 226.21875, "completions/mean_terminated_length": 226.21875, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6779766655527055, "epoch": 0.8496538081107814, "grad_norm": 1.7533283233642578, "kl_approx": 0.2331085205078125, "learning_rate": 1.3657829510333653e-06, "loss": 0.1804, "num_tokens": 21210782.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2925519943237305, "sampling/importance_sampling_ratio/mean": 0.9995476007461548, "sampling/importance_sampling_ratio/min": 0.766670286655426, "sampling/sampling_logp_difference/max": 0.2656984329223633, "sampling/sampling_logp_difference/mean": 0.011489762924611568, "step": 859 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 158.0, "completions/max_terminated_length": 158.0, "completions/mean_length": 73.75, "completions/mean_terminated_length": 73.75, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.49326886888593435, "epoch": 0.8506429277942631, "grad_norm": 1.6089316606521606, "kl_approx": 0.1462860107421875, "learning_rate": 1.3483991320937307e-06, "loss": 0.0949, "num_tokens": 21233774.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2925595045089722, "sampling/importance_sampling_ratio/mean": 1.0003122091293335, "sampling/importance_sampling_ratio/min": 0.8454608917236328, "sampling/sampling_logp_difference/max": 0.25662434101104736, "sampling/sampling_logp_difference/mean": 0.010283226147294044, "step": 860 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 591.0, "completions/max_terminated_length": 591.0, "completions/mean_length": 141.71875, "completions/mean_terminated_length": 141.71875, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.6290076738223433, "epoch": 0.8516320474777448, "grad_norm": 1.6384648084640503, "kl_approx": 0.20224571228027344, "learning_rate": 1.3311186530505838e-06, "loss": 0.1481, "num_tokens": 21258565.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1435458660125732, "sampling/importance_sampling_ratio/mean": 0.9996142387390137, "sampling/importance_sampling_ratio/min": 0.8691824078559875, "sampling/sampling_logp_difference/max": 0.14020228385925293, "sampling/sampling_logp_difference/mean": 0.012351704761385918, "step": 861 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 815.0, "completions/max_terminated_length": 815.0, "completions/mean_length": 291.5625, "completions/mean_terminated_length": 291.5625, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.847983855754137, "epoch": 0.8526211671612265, "grad_norm": 1.6129695177078247, "kl_approx": 0.2156829833984375, "learning_rate": 1.313941720312303e-06, "loss": 0.1487, "num_tokens": 21285095.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2216646671295166, "sampling/importance_sampling_ratio/mean": 0.9998401403427124, "sampling/importance_sampling_ratio/min": 0.8228300213813782, "sampling/sampling_logp_difference/max": 0.20021438598632812, "sampling/sampling_logp_difference/mean": 0.01523190550506115, "step": 862 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 542.0, "completions/max_terminated_length": 542.0, "completions/mean_length": 171.5625, "completions/mean_terminated_length": 171.5625, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.6582205286249518, "epoch": 0.8536102868447082, "grad_norm": 1.9632899761199951, "kl_approx": 0.17475128173828125, "learning_rate": 1.2968685390504465e-06, "loss": 0.1418, "num_tokens": 21313345.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.240782380104065, "sampling/importance_sampling_ratio/mean": 1.0001144409179688, "sampling/importance_sampling_ratio/min": 0.8210563063621521, "sampling/sampling_logp_difference/max": 0.2157421112060547, "sampling/sampling_logp_difference/mean": 0.011292461305856705, "step": 863 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 778.0, "completions/max_terminated_length": 778.0, "completions/mean_length": 266.125, "completions/mean_terminated_length": 266.125, "completions/min_length": 65.0, "completions/min_terminated_length": 65.0, "entropy": 0.8411129834130406, "epoch": 0.8545994065281899, "grad_norm": 1.870794653892517, "kl_approx": 0.2215728759765625, "learning_rate": 1.2798993131973093e-06, "loss": 0.1768, "num_tokens": 21344773.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3062013387680054, "sampling/importance_sampling_ratio/mean": 1.0002915859222412, "sampling/importance_sampling_ratio/min": 0.8573087453842163, "sampling/sampling_logp_difference/max": 0.2671232223510742, "sampling/sampling_logp_difference/mean": 0.013436621986329556, "step": 864 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 981.0, "completions/mean_length": 314.4375, "completions/mean_terminated_length": 291.5483703613281, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.9119151569902897, "epoch": 0.8555885262116716, "grad_norm": 2.3034961223602295, "kl_approx": 0.2752685546875, "learning_rate": 1.263034245443473e-06, "loss": 0.2004, "num_tokens": 21373467.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2120662927627563, "sampling/importance_sampling_ratio/mean": 1.000043511390686, "sampling/importance_sampling_ratio/min": 0.7871696949005127, "sampling/sampling_logp_difference/max": 0.23931145668029785, "sampling/sampling_logp_difference/mean": 0.012652715668082237, "step": 865 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 330.0, "completions/max_terminated_length": 330.0, "completions/mean_length": 77.03125, "completions/mean_terminated_length": 77.03125, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.4916822840459645, "epoch": 0.8565776458951533, "grad_norm": 2.2449116706848145, "kl_approx": 0.17335128784179688, "learning_rate": 1.2462735372353996e-06, "loss": 0.1212, "num_tokens": 21391444.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1625220775604248, "sampling/importance_sampling_ratio/mean": 0.9997206926345825, "sampling/importance_sampling_ratio/min": 0.8845996260643005, "sampling/sampling_logp_difference/max": 0.15059185028076172, "sampling/sampling_logp_difference/mean": 0.009404227137565613, "step": 866 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 557.0, "completions/max_terminated_length": 557.0, "completions/mean_length": 150.21875, "completions/mean_terminated_length": 150.21875, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.7369968527927995, "epoch": 0.857566765578635, "grad_norm": 2.237894058227539, "kl_approx": 0.2524871826171875, "learning_rate": 1.2296173887730122e-06, "loss": 0.1906, "num_tokens": 21417083.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2021236419677734, "sampling/importance_sampling_ratio/mean": 1.0002347230911255, "sampling/importance_sampling_ratio/min": 0.8416468501091003, "sampling/sampling_logp_difference/max": 0.18408966064453125, "sampling/sampling_logp_difference/mean": 0.012811128981411457, "step": 867 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 550.0, "completions/max_terminated_length": 550.0, "completions/mean_length": 155.625, "completions/mean_terminated_length": 155.625, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.7578306589275599, "epoch": 0.8585558852621167, "grad_norm": 2.2913239002227783, "kl_approx": 0.2659454345703125, "learning_rate": 1.2130659990073146e-06, "loss": 0.1722, "num_tokens": 21443047.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1289615631103516, "sampling/importance_sampling_ratio/mean": 0.999557614326477, "sampling/importance_sampling_ratio/min": 0.8853609561920166, "sampling/sampling_logp_difference/max": 0.12175989151000977, "sampling/sampling_logp_difference/mean": 0.013630186207592487, "step": 868 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 774.0, "completions/max_terminated_length": 774.0, "completions/mean_length": 219.53125, "completions/mean_terminated_length": 219.53125, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6842115339823067, "epoch": 0.8595450049455984, "grad_norm": 1.44623601436615, "kl_approx": 0.1729450225830078, "learning_rate": 1.196619565638003e-06, "loss": 0.1282, "num_tokens": 21468872.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1769683361053467, "sampling/importance_sampling_ratio/mean": 1.000616431236267, "sampling/importance_sampling_ratio/min": 0.8657683730125427, "sampling/sampling_logp_difference/max": 0.16294193267822266, "sampling/sampling_logp_difference/mean": 0.011852935887873173, "step": 869 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 498.0, "completions/max_terminated_length": 498.0, "completions/mean_length": 166.625, "completions/mean_terminated_length": 166.625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.7568729259073734, "epoch": 0.8605341246290801, "grad_norm": 2.042956829071045, "kl_approx": 0.24786376953125, "learning_rate": 1.1802782851111206e-06, "loss": 0.1749, "num_tokens": 21490548.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1420778036117554, "sampling/importance_sampling_ratio/mean": 0.9999597072601318, "sampling/importance_sampling_ratio/min": 0.8278712034225464, "sampling/sampling_logp_difference/max": 0.1888977289199829, "sampling/sampling_logp_difference/mean": 0.012535554356873035, "step": 870 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 447.0, "completions/max_terminated_length": 447.0, "completions/mean_length": 118.59375, "completions/mean_terminated_length": 118.59375, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.6551972250454128, "epoch": 0.8615232443125618, "grad_norm": 2.0375969409942627, "kl_approx": 0.25431060791015625, "learning_rate": 1.1640423526166987e-06, "loss": 0.1475, "num_tokens": 21514471.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.354432225227356, "sampling/importance_sampling_ratio/mean": 1.000187873840332, "sampling/importance_sampling_ratio/min": 0.7986968159675598, "sampling/sampling_logp_difference/max": 0.30338239669799805, "sampling/sampling_logp_difference/mean": 0.012997601181268692, "step": 871 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 322.0, "completions/max_terminated_length": 322.0, "completions/mean_length": 143.03125, "completions/mean_terminated_length": 143.03125, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.6325701624155045, "epoch": 0.8625123639960435, "grad_norm": 1.8030873537063599, "kl_approx": 0.169769287109375, "learning_rate": 1.1479119620864277e-06, "loss": 0.1353, "num_tokens": 21542784.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1539026498794556, "sampling/importance_sampling_ratio/mean": 0.9991243481636047, "sampling/importance_sampling_ratio/min": 0.8609429597854614, "sampling/sampling_logp_difference/max": 0.1497269868850708, "sampling/sampling_logp_difference/mean": 0.01011192798614502, "step": 872 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 463.0, "completions/max_terminated_length": 463.0, "completions/mean_length": 149.46875, "completions/mean_terminated_length": 149.46875, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.6568826385773718, "epoch": 0.8635014836795252, "grad_norm": 1.8022645711898804, "kl_approx": 0.18701934814453125, "learning_rate": 1.1318873061913405e-06, "loss": 0.1604, "num_tokens": 21565975.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2085694074630737, "sampling/importance_sampling_ratio/mean": 1.000618577003479, "sampling/importance_sampling_ratio/min": 0.8707876205444336, "sampling/sampling_logp_difference/max": 0.1894373893737793, "sampling/sampling_logp_difference/mean": 0.013658261857926846, "step": 873 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 250.0, "completions/max_terminated_length": 250.0, "completions/mean_length": 111.875, "completions/mean_terminated_length": 111.875, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.6381340743973851, "epoch": 0.8644906033630069, "grad_norm": 1.6989130973815918, "kl_approx": 0.21213531494140625, "learning_rate": 1.1159685763395113e-06, "loss": 0.1419, "num_tokens": 21585987.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.135483980178833, "sampling/importance_sampling_ratio/mean": 1.0000232458114624, "sampling/importance_sampling_ratio/min": 0.8513681888580322, "sampling/sampling_logp_difference/max": 0.16091060638427734, "sampling/sampling_logp_difference/mean": 0.01132410392165184, "step": 874 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 457.0, "completions/max_terminated_length": 457.0, "completions/mean_length": 164.21875, "completions/mean_terminated_length": 164.21875, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.6294187381863594, "epoch": 0.8654797230464887, "grad_norm": 1.698083758354187, "kl_approx": 0.20859146118164062, "learning_rate": 1.1001559626737757e-06, "loss": 0.1415, "num_tokens": 21613410.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1660151481628418, "sampling/importance_sampling_ratio/mean": 0.9997454881668091, "sampling/importance_sampling_ratio/min": 0.8426648378372192, "sampling/sampling_logp_difference/max": 0.17118597030639648, "sampling/sampling_logp_difference/mean": 0.010470137931406498, "step": 875 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 674.0, "completions/max_terminated_length": 674.0, "completions/mean_length": 285.0625, "completions/mean_terminated_length": 285.0625, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.9560783193446696, "epoch": 0.8664688427299704, "grad_norm": 2.305255889892578, "kl_approx": 0.2801971435546875, "learning_rate": 1.0844496540694515e-06, "loss": 0.2266, "num_tokens": 21643356.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2398159503936768, "sampling/importance_sampling_ratio/mean": 0.9998606443405151, "sampling/importance_sampling_ratio/min": 0.8156615495681763, "sampling/sampling_logp_difference/max": 0.21496295928955078, "sampling/sampling_logp_difference/mean": 0.015241001732647419, "step": 876 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 473.0, "completions/max_terminated_length": 473.0, "completions/mean_length": 121.40625, "completions/mean_terminated_length": 121.40625, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.5747184751089662, "epoch": 0.8674579624134521, "grad_norm": 1.975102186203003, "kl_approx": 0.1884002685546875, "learning_rate": 1.0688498381320855e-06, "loss": 0.1341, "num_tokens": 21670665.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.127424716949463, "sampling/importance_sampling_ratio/mean": 0.9997353553771973, "sampling/importance_sampling_ratio/min": 0.821757435798645, "sampling/sampling_logp_difference/max": 0.19631004333496094, "sampling/sampling_logp_difference/mean": 0.009872972965240479, "step": 877 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 636.0, "completions/max_terminated_length": 636.0, "completions/mean_length": 192.09375, "completions/mean_terminated_length": 192.09375, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.6892016436904669, "epoch": 0.8684470820969338, "grad_norm": 1.9563798904418945, "kl_approx": 0.2219390869140625, "learning_rate": 1.0533567011952094e-06, "loss": 0.1621, "num_tokens": 21697756.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1485910415649414, "sampling/importance_sampling_ratio/mean": 0.9998952150344849, "sampling/importance_sampling_ratio/min": 0.8269563317298889, "sampling/sampling_logp_difference/max": 0.1900033950805664, "sampling/sampling_logp_difference/mean": 0.011363630183041096, "step": 878 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 603.0, "completions/max_terminated_length": 603.0, "completions/mean_length": 253.78125, "completions/mean_terminated_length": 253.78125, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 1.0656207278370857, "epoch": 0.8694362017804155, "grad_norm": 2.5641446113586426, "kl_approx": 0.339080810546875, "learning_rate": 1.037970428318118e-06, "loss": 0.2337, "num_tokens": 21723141.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1899267435073853, "sampling/importance_sampling_ratio/mean": 0.9999558925628662, "sampling/importance_sampling_ratio/min": 0.8714261651039124, "sampling/sampling_logp_difference/max": 0.17389178276062012, "sampling/sampling_logp_difference/mean": 0.01596691459417343, "step": 879 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 716.0, "completions/max_terminated_length": 716.0, "completions/mean_length": 199.21875, "completions/mean_terminated_length": 199.21875, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.7877497356384993, "epoch": 0.8704253214638972, "grad_norm": 1.667815923690796, "kl_approx": 0.23183441162109375, "learning_rate": 1.022691203283661e-06, "loss": 0.1515, "num_tokens": 21754612.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.171123743057251, "sampling/importance_sampling_ratio/mean": 1.000005841255188, "sampling/importance_sampling_ratio/min": 0.8434280157089233, "sampling/sampling_logp_difference/max": 0.17028069496154785, "sampling/sampling_logp_difference/mean": 0.013170835562050343, "step": 880 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 864.0, "completions/mean_length": 288.3125, "completions/mean_terminated_length": 264.58062744140625, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.7153364969417453, "epoch": 0.8714144411473789, "grad_norm": 1.5063906908035278, "kl_approx": 0.173065185546875, "learning_rate": 1.0075192085960451e-06, "loss": 0.1322, "num_tokens": 21783590.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.243036150932312, "sampling/importance_sampling_ratio/mean": 1.0002737045288086, "sampling/importance_sampling_ratio/min": 0.7778647541999817, "sampling/sampling_logp_difference/max": 0.25120264291763306, "sampling/sampling_logp_difference/mean": 0.010951037518680096, "step": 881 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 707.0, "completions/max_terminated_length": 707.0, "completions/mean_length": 228.34375, "completions/mean_terminated_length": 228.34375, "completions/min_length": 70.0, "completions/min_terminated_length": 70.0, "entropy": 0.6022754912264645, "epoch": 0.8724035608308606, "grad_norm": 1.682082176208496, "kl_approx": 0.21469879150390625, "learning_rate": 9.924546254786493e-07, "loss": 0.1535, "num_tokens": 21808745.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2351908683776855, "sampling/importance_sampling_ratio/mean": 1.0002124309539795, "sampling/importance_sampling_ratio/min": 0.7754483222961426, "sampling/sampling_logp_difference/max": 0.25431394577026367, "sampling/sampling_logp_difference/mean": 0.011558931320905685, "step": 882 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 719.0, "completions/max_terminated_length": 719.0, "completions/mean_length": 255.4375, "completions/mean_terminated_length": 255.4375, "completions/min_length": 85.0, "completions/min_terminated_length": 85.0, "entropy": 0.8062317036092281, "epoch": 0.8733926805143423, "grad_norm": 2.282636880874634, "kl_approx": 0.267974853515625, "learning_rate": 9.77497633871868e-07, "loss": 0.1704, "num_tokens": 21838807.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2051585912704468, "sampling/importance_sampling_ratio/mean": 1.000168800354004, "sampling/importance_sampling_ratio/min": 0.8028209805488586, "sampling/sampling_logp_difference/max": 0.21962356567382812, "sampling/sampling_logp_difference/mean": 0.013083451427519321, "step": 883 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 544.0, "completions/max_terminated_length": 544.0, "completions/mean_length": 185.5625, "completions/mean_terminated_length": 185.5625, "completions/min_length": 64.0, "completions/min_terminated_length": 64.0, "entropy": 0.62929149530828, "epoch": 0.874381800197824, "grad_norm": 1.5080280303955078, "kl_approx": 0.16402053833007812, "learning_rate": 9.62648412430951e-07, "loss": 0.1217, "num_tokens": 21864641.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2277965545654297, "sampling/importance_sampling_ratio/mean": 1.0004022121429443, "sampling/importance_sampling_ratio/min": 0.7720749378204346, "sampling/sampling_logp_difference/max": 0.25867366790771484, "sampling/sampling_logp_difference/mean": 0.011485512368381023, "step": 884 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 503.0, "completions/max_terminated_length": 503.0, "completions/mean_length": 222.03125, "completions/mean_terminated_length": 222.03125, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.6677332809194922, "epoch": 0.8753709198813057, "grad_norm": 1.5937578678131104, "kl_approx": 0.17424774169921875, "learning_rate": 9.479071385238892e-07, "loss": 0.1222, "num_tokens": 21892034.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1832945346832275, "sampling/importance_sampling_ratio/mean": 1.0001972913742065, "sampling/importance_sampling_ratio/min": 0.8701573014259338, "sampling/sampling_logp_difference/max": 0.1683025360107422, "sampling/sampling_logp_difference/mean": 0.010617129504680634, "step": 885 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 766.0, "completions/max_terminated_length": 766.0, "completions/mean_length": 177.21875, "completions/mean_terminated_length": 177.21875, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.5761293838731945, "epoch": 0.8763600395647874, "grad_norm": 1.553174376487732, "kl_approx": 0.185760498046875, "learning_rate": 9.332739882292752e-07, "loss": 0.1302, "num_tokens": 21917385.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1984697580337524, "sampling/importance_sampling_ratio/mean": 1.0004057884216309, "sampling/importance_sampling_ratio/min": 0.7556746006011963, "sampling/sampling_logp_difference/max": 0.28014445304870605, "sampling/sampling_logp_difference/mean": 0.009138698689639568, "step": 886 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 550.0, "completions/max_terminated_length": 550.0, "completions/mean_length": 176.40625, "completions/mean_terminated_length": 176.40625, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.7263211775571108, "epoch": 0.8773491592482691, "grad_norm": 1.4715238809585571, "kl_approx": 0.18840789794921875, "learning_rate": 9.187491363342094e-07, "loss": 0.151, "num_tokens": 21940918.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1512168645858765, "sampling/importance_sampling_ratio/mean": 0.9995941519737244, "sampling/importance_sampling_ratio/min": 0.8171879053115845, "sampling/sampling_logp_difference/max": 0.20188617706298828, "sampling/sampling_logp_difference/mean": 0.012181825004518032, "step": 887 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 371.0, "completions/max_terminated_length": 371.0, "completions/mean_length": 136.1875, "completions/mean_terminated_length": 136.1875, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.5934420581907034, "epoch": 0.8783382789317508, "grad_norm": 1.8265479803085327, "kl_approx": 0.1686553955078125, "learning_rate": 9.043327563322113e-07, "loss": 0.142, "num_tokens": 21964852.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1825311183929443, "sampling/importance_sampling_ratio/mean": 1.0000851154327393, "sampling/importance_sampling_ratio/min": 0.8683652281761169, "sampling/sampling_logp_difference/max": 0.16765713691711426, "sampling/sampling_logp_difference/mean": 0.011219511739909649, "step": 888 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 859.0, "completions/max_terminated_length": 859.0, "completions/mean_length": 338.84375, "completions/mean_terminated_length": 338.84375, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.8389075696468353, "epoch": 0.8793273986152325, "grad_norm": 1.3198376893997192, "kl_approx": 0.17417144775390625, "learning_rate": 8.900250204211513e-07, "loss": 0.1618, "num_tokens": 21997959.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.312565565109253, "sampling/importance_sampling_ratio/mean": 0.9998396635055542, "sampling/importance_sampling_ratio/min": 0.7880823612213135, "sampling/sampling_logp_difference/max": 0.27198362350463867, "sampling/sampling_logp_difference/mean": 0.012246099300682545, "step": 889 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 630.0, "completions/max_terminated_length": 630.0, "completions/mean_length": 178.3125, "completions/mean_terminated_length": 178.3125, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.6958602080121636, "epoch": 0.8803165182987142, "grad_norm": 3.868798017501831, "kl_approx": 0.26593780517578125, "learning_rate": 8.758260995011825e-07, "loss": 0.2051, "num_tokens": 22021097.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.271609902381897, "sampling/importance_sampling_ratio/mean": 1.0002802610397339, "sampling/importance_sampling_ratio/min": 0.745483934879303, "sampling/sampling_logp_difference/max": 0.29372167587280273, "sampling/sampling_logp_difference/mean": 0.012822630815207958, "step": 890 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 515.0, "completions/max_terminated_length": 515.0, "completions/mean_length": 210.28125, "completions/mean_terminated_length": 210.28125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.7241191929206252, "epoch": 0.8813056379821959, "grad_norm": 1.8363189697265625, "kl_approx": 0.3094158172607422, "learning_rate": 8.617361631727139e-07, "loss": 0.1602, "num_tokens": 22049066.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2354726791381836, "sampling/importance_sampling_ratio/mean": 0.9998766779899597, "sampling/importance_sampling_ratio/min": 0.781411349773407, "sampling/sampling_logp_difference/max": 0.24665355682373047, "sampling/sampling_logp_difference/mean": 0.011827385984361172, "step": 891 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 783.0, "completions/mean_length": 311.875, "completions/mean_terminated_length": 288.9032287597656, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "entropy": 0.6974000623449683, "epoch": 0.8822947576656776, "grad_norm": 1.6965609788894653, "kl_approx": 0.2256317138671875, "learning_rate": 8.477553797343729e-07, "loss": 0.1767, "num_tokens": 22084606.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2025914192199707, "sampling/importance_sampling_ratio/mean": 1.0000048875808716, "sampling/importance_sampling_ratio/min": 0.8246094584465027, "sampling/sampling_logp_difference/max": 0.19284534454345703, "sampling/sampling_logp_difference/mean": 0.010971788316965103, "step": 892 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 392.0, "completions/max_terminated_length": 392.0, "completions/mean_length": 155.09375, "completions/mean_terminated_length": 155.09375, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.6303185163997114, "epoch": 0.8832838773491593, "grad_norm": 2.123450994491577, "kl_approx": 0.2299041748046875, "learning_rate": 8.338839161809997e-07, "loss": 0.188, "num_tokens": 22113721.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1778000593185425, "sampling/importance_sampling_ratio/mean": 0.9999285340309143, "sampling/importance_sampling_ratio/min": 0.794104814529419, "sampling/sampling_logp_difference/max": 0.23053979873657227, "sampling/sampling_logp_difference/mean": 0.011530820280313492, "step": 893 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 395.0, "completions/max_terminated_length": 395.0, "completions/mean_length": 222.59375, "completions/mean_terminated_length": 222.59375, "completions/min_length": 67.0, "completions/min_terminated_length": 67.0, "entropy": 0.8357502082362771, "epoch": 0.884272997032641, "grad_norm": 1.5916590690612793, "kl_approx": 0.203369140625, "learning_rate": 8.201219382016556e-07, "loss": 0.1575, "num_tokens": 22136980.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1965792179107666, "sampling/importance_sampling_ratio/mean": 0.999977707862854, "sampling/importance_sampling_ratio/min": 0.7783249020576477, "sampling/sampling_logp_difference/max": 0.2506113052368164, "sampling/sampling_logp_difference/mean": 0.012289289385080338, "step": 894 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 491.0, "completions/max_terminated_length": 491.0, "completions/mean_length": 305.84375, "completions/mean_terminated_length": 305.84375, "completions/min_length": 97.0, "completions/min_terminated_length": 97.0, "entropy": 1.0188902486115694, "epoch": 0.8852621167161226, "grad_norm": 2.0892632007598877, "kl_approx": 0.308563232421875, "learning_rate": 8.06469610177636e-07, "loss": 0.2067, "num_tokens": 22164015.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2653003931045532, "sampling/importance_sampling_ratio/mean": 0.9999451637268066, "sampling/importance_sampling_ratio/min": 0.8061432242393494, "sampling/sampling_logp_difference/max": 0.23530960083007812, "sampling/sampling_logp_difference/mean": 0.014843806624412537, "step": 895 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 518.0, "completions/max_terminated_length": 518.0, "completions/mean_length": 177.4375, "completions/mean_terminated_length": 177.4375, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 1.0012478725984693, "epoch": 0.8862512363996043, "grad_norm": 2.223721742630005, "kl_approx": 0.2528839111328125, "learning_rate": 7.92927095180518e-07, "loss": 0.1758, "num_tokens": 22191237.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1821101903915405, "sampling/importance_sampling_ratio/mean": 0.9999262094497681, "sampling/importance_sampling_ratio/min": 0.8773420453071594, "sampling/sampling_logp_difference/max": 0.16730117797851562, "sampling/sampling_logp_difference/mean": 0.01577700488269329, "step": 896 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 476.0, "completions/max_terminated_length": 476.0, "completions/mean_length": 120.96875, "completions/mean_terminated_length": 120.96875, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.6523679541423917, "epoch": 0.887240356083086, "grad_norm": 1.7782800197601318, "kl_approx": 0.19891357421875, "learning_rate": 7.794945549701993e-07, "loss": 0.1293, "num_tokens": 22213468.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2090996503829956, "sampling/importance_sampling_ratio/mean": 0.9996601939201355, "sampling/importance_sampling_ratio/min": 0.8362219929695129, "sampling/sampling_logp_difference/max": 0.18987607955932617, "sampling/sampling_logp_difference/mean": 0.012034744024276733, "step": 897 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 653.0, "completions/max_terminated_length": 653.0, "completions/mean_length": 184.5625, "completions/mean_terminated_length": 184.5625, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 1.0524780917912722, "epoch": 0.8882294757665677, "grad_norm": 1.9889229536056519, "kl_approx": 0.316131591796875, "learning_rate": 7.661721499929753e-07, "loss": 0.1984, "num_tokens": 22239254.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2069597244262695, "sampling/importance_sampling_ratio/mean": 1.0005980730056763, "sampling/importance_sampling_ratio/min": 0.8241971731185913, "sampling/sampling_logp_difference/max": 0.1933455467224121, "sampling/sampling_logp_difference/mean": 0.014287013560533524, "step": 898 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 354.0, "completions/max_terminated_length": 354.0, "completions/mean_length": 150.40625, "completions/mean_terminated_length": 150.40625, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.8622461748309433, "epoch": 0.8892185954500494, "grad_norm": 1.8262187242507935, "kl_approx": 0.276702880859375, "learning_rate": 7.529600393796232e-07, "loss": 0.1865, "num_tokens": 22265355.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1578755378723145, "sampling/importance_sampling_ratio/mean": 1.0000975131988525, "sampling/importance_sampling_ratio/min": 0.8431845307350159, "sampling/sampling_logp_difference/max": 0.17056941986083984, "sampling/sampling_logp_difference/mean": 0.01336515974253416, "step": 899 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 731.0, "completions/max_terminated_length": 731.0, "completions/mean_length": 241.40625, "completions/mean_terminated_length": 241.40625, "completions/min_length": 60.0, "completions/min_terminated_length": 60.0, "entropy": 0.7919985326007009, "epoch": 0.8902077151335311, "grad_norm": 1.8003402948379517, "kl_approx": 0.20302963256835938, "learning_rate": 7.398583809434944e-07, "loss": 0.1717, "num_tokens": 22298264.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1856870651245117, "sampling/importance_sampling_ratio/mean": 0.999390721321106, "sampling/importance_sampling_ratio/min": 0.8383554220199585, "sampling/sampling_logp_difference/max": 0.17631316184997559, "sampling/sampling_logp_difference/mean": 0.012419392354786396, "step": 900 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 509.0, "completions/max_terminated_length": 509.0, "completions/mean_length": 197.09375, "completions/mean_terminated_length": 197.09375, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.6396058201789856, "epoch": 0.8911968348170128, "grad_norm": 2.218729019165039, "kl_approx": 0.2746124267578125, "learning_rate": 7.268673311786378e-07, "loss": 0.2772, "num_tokens": 22322419.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1644983291625977, "sampling/importance_sampling_ratio/mean": 0.9999355673789978, "sampling/importance_sampling_ratio/min": 0.8359341621398926, "sampling/sampling_logp_difference/max": 0.17920541763305664, "sampling/sampling_logp_difference/mean": 0.011550482362508774, "step": 901 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 691.0, "completions/max_terminated_length": 691.0, "completions/mean_length": 154.34375, "completions/mean_terminated_length": 154.34375, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.7542231315746903, "epoch": 0.8921859545004945, "grad_norm": 2.5212366580963135, "kl_approx": 0.24239349365234375, "learning_rate": 7.1398704525792e-07, "loss": 0.2088, "num_tokens": 22344446.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2342044115066528, "sampling/importance_sampling_ratio/mean": 0.999775230884552, "sampling/importance_sampling_ratio/min": 0.8383532166481018, "sampling/sampling_logp_difference/max": 0.21042656898498535, "sampling/sampling_logp_difference/mean": 0.012812447734177113, "step": 902 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 617.0, "completions/max_terminated_length": 617.0, "completions/mean_length": 196.34375, "completions/mean_terminated_length": 196.34375, "completions/min_length": 35.0, "completions/min_terminated_length": 35.0, "entropy": 0.9054730124771595, "epoch": 0.8931750741839762, "grad_norm": 6.876465320587158, "kl_approx": 0.462554931640625, "learning_rate": 7.012176770311863e-07, "loss": 0.3469, "num_tokens": 22364825.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1979678869247437, "sampling/importance_sampling_ratio/mean": 1.0005583763122559, "sampling/importance_sampling_ratio/min": 0.8325647711753845, "sampling/sampling_logp_difference/max": 0.1832442283630371, "sampling/sampling_logp_difference/mean": 0.013813852332532406, "step": 903 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 377.0, "completions/max_terminated_length": 377.0, "completions/mean_length": 140.6875, "completions/mean_terminated_length": 140.6875, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.8138372236862779, "epoch": 0.8941641938674579, "grad_norm": 2.460618019104004, "kl_approx": 0.267822265625, "learning_rate": 6.885593790234057e-07, "loss": 0.187, "num_tokens": 22386287.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1838724613189697, "sampling/importance_sampling_ratio/mean": 0.9996182322502136, "sampling/importance_sampling_ratio/min": 0.8498066663742065, "sampling/sampling_logp_difference/max": 0.1687908172607422, "sampling/sampling_logp_difference/mean": 0.012908536940813065, "step": 904 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 821.0, "completions/max_terminated_length": 821.0, "completions/mean_length": 185.375, "completions/mean_terminated_length": 185.375, "completions/min_length": 68.0, "completions/min_terminated_length": 68.0, "entropy": 0.8158699758350849, "epoch": 0.8951533135509396, "grad_norm": 1.986329436302185, "kl_approx": 0.2821807861328125, "learning_rate": 6.760123024328624e-07, "loss": 0.1937, "num_tokens": 22417715.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.223329782485962, "sampling/importance_sampling_ratio/mean": 1.0000814199447632, "sampling/importance_sampling_ratio/min": 0.8343965411186218, "sampling/sampling_logp_difference/max": 0.20157647132873535, "sampling/sampling_logp_difference/mean": 0.013101092539727688, "step": 905 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 402.0, "completions/max_terminated_length": 402.0, "completions/mean_length": 158.3125, "completions/mean_terminated_length": 158.3125, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.7694898871704936, "epoch": 0.8961424332344213, "grad_norm": 2.096156358718872, "kl_approx": 0.24832916259765625, "learning_rate": 6.635765971293484e-07, "loss": 0.1822, "num_tokens": 22438997.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1996006965637207, "sampling/importance_sampling_ratio/mean": 1.0002882480621338, "sampling/importance_sampling_ratio/min": 0.8219106793403625, "sampling/sampling_logp_difference/max": 0.19612360000610352, "sampling/sampling_logp_difference/mean": 0.012907842174172401, "step": 906 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 433.0, "completions/max_terminated_length": 433.0, "completions/mean_length": 173.1875, "completions/mean_terminated_length": 173.1875, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.8274210542440414, "epoch": 0.897131552917903, "grad_norm": 2.00650954246521, "kl_approx": 0.23857879638671875, "learning_rate": 6.512524116523633e-07, "loss": 0.1685, "num_tokens": 22461139.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2105531692504883, "sampling/importance_sampling_ratio/mean": 1.0003453493118286, "sampling/importance_sampling_ratio/min": 0.8612346053123474, "sampling/sampling_logp_difference/max": 0.19107747077941895, "sampling/sampling_logp_difference/mean": 0.012596787884831429, "step": 907 }, { "completions/clipped_ratio": 0.0625, "completions/max_length": 1024.0, "completions/max_terminated_length": 975.0, "completions/mean_length": 281.59375, "completions/mean_terminated_length": 232.10000610351562, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.7477365615777671, "epoch": 0.8981206726013847, "grad_norm": 1.6909908056259155, "kl_approx": 0.1963043212890625, "learning_rate": 6.390398932093555e-07, "loss": 0.1363, "num_tokens": 22492254.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3266862630844116, "sampling/importance_sampling_ratio/mean": 0.9998542070388794, "sampling/importance_sampling_ratio/min": 0.8373371958732605, "sampling/sampling_logp_difference/max": 0.282684326171875, "sampling/sampling_logp_difference/mean": 0.013228194788098335, "step": 908 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 588.0, "completions/max_terminated_length": 588.0, "completions/mean_length": 272.71875, "completions/mean_terminated_length": 272.71875, "completions/min_length": 82.0, "completions/min_terminated_length": 82.0, "entropy": 0.8550957879051566, "epoch": 0.8991097922848664, "grad_norm": 1.5984022617340088, "kl_approx": 0.2276611328125, "learning_rate": 6.269391876739494e-07, "loss": 0.1704, "num_tokens": 22522613.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2052111625671387, "sampling/importance_sampling_ratio/mean": 1.0000606775283813, "sampling/importance_sampling_ratio/min": 0.8375049829483032, "sampling/sampling_logp_difference/max": 0.18665480613708496, "sampling/sampling_logp_difference/mean": 0.012414987199008465, "step": 909 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 579.0, "completions/max_terminated_length": 579.0, "completions/mean_length": 239.96875, "completions/mean_terminated_length": 239.96875, "completions/min_length": 69.0, "completions/min_terminated_length": 69.0, "entropy": 0.9979591686278582, "epoch": 0.9000989119683481, "grad_norm": 2.060096025466919, "kl_approx": 0.273651123046875, "learning_rate": 6.149504395842087e-07, "loss": 0.2043, "num_tokens": 22549676.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2009358406066895, "sampling/importance_sampling_ratio/mean": 1.0002295970916748, "sampling/importance_sampling_ratio/min": 0.8334605097770691, "sampling/sampling_logp_difference/max": 0.18310117721557617, "sampling/sampling_logp_difference/mean": 0.014672153629362583, "step": 910 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 975.0, "completions/max_terminated_length": 975.0, "completions/mean_length": 299.0625, "completions/mean_terminated_length": 299.0625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6581535907462239, "epoch": 0.9010880316518298, "grad_norm": 1.3141674995422363, "kl_approx": 0.15781402587890625, "learning_rate": 6.030737921409169e-07, "loss": 0.115, "num_tokens": 22583758.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.225461721420288, "sampling/importance_sampling_ratio/mean": 1.0001325607299805, "sampling/importance_sampling_ratio/min": 0.7020633816719055, "sampling/sampling_logp_difference/max": 0.353731632232666, "sampling/sampling_logp_difference/mean": 0.009928449988365173, "step": 911 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 626.0, "completions/max_terminated_length": 626.0, "completions/mean_length": 226.8125, "completions/mean_terminated_length": 226.8125, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.7680179439485073, "epoch": 0.9020771513353115, "grad_norm": 1.893993854522705, "kl_approx": 0.2071075439453125, "learning_rate": 5.913093872058528e-07, "loss": 0.1405, "num_tokens": 22607448.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2013030052185059, "sampling/importance_sampling_ratio/mean": 0.9997047781944275, "sampling/importance_sampling_ratio/min": 0.8557979464530945, "sampling/sampling_logp_difference/max": 0.18340682983398438, "sampling/sampling_logp_difference/mean": 0.012365613132715225, "step": 912 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 570.0, "completions/max_terminated_length": 570.0, "completions/mean_length": 210.5625, "completions/mean_terminated_length": 210.5625, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7439170116558671, "epoch": 0.9030662710187932, "grad_norm": 1.5787358283996582, "kl_approx": 0.22782135009765625, "learning_rate": 5.796573653001091e-07, "loss": 0.1535, "num_tokens": 22631690.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2917053699493408, "sampling/importance_sampling_ratio/mean": 1.000085711479187, "sampling/importance_sampling_ratio/min": 0.8159248232841492, "sampling/sampling_logp_difference/max": 0.2559633255004883, "sampling/sampling_logp_difference/mean": 0.012056508101522923, "step": 913 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 486.0, "completions/max_terminated_length": 486.0, "completions/mean_length": 208.3125, "completions/mean_terminated_length": 208.3125, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.6613291352987289, "epoch": 0.904055390702275, "grad_norm": 1.949863076210022, "kl_approx": 0.205902099609375, "learning_rate": 5.681178656024055e-07, "loss": 0.1552, "num_tokens": 22659820.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.149350881576538, "sampling/importance_sampling_ratio/mean": 1.0001766681671143, "sampling/importance_sampling_ratio/min": 0.7097594141960144, "sampling/sampling_logp_difference/max": 0.34282922744750977, "sampling/sampling_logp_difference/mean": 0.009899897500872612, "step": 914 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 721.0, "completions/max_terminated_length": 721.0, "completions/mean_length": 237.53125, "completions/mean_terminated_length": 237.53125, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6507612494751811, "epoch": 0.9050445103857567, "grad_norm": 1.1809837818145752, "kl_approx": 0.12398529052734375, "learning_rate": 5.56691025947429e-07, "loss": 0.1023, "num_tokens": 22689173.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2685171365737915, "sampling/importance_sampling_ratio/mean": 1.0002769231796265, "sampling/importance_sampling_ratio/min": 0.8548789024353027, "sampling/sampling_logp_difference/max": 0.23784852027893066, "sampling/sampling_logp_difference/mean": 0.011208221316337585, "step": 915 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 532.0, "completions/max_terminated_length": 532.0, "completions/mean_length": 133.59375, "completions/mean_terminated_length": 133.59375, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.6260295412503183, "epoch": 0.9060336300692384, "grad_norm": 2.8506007194519043, "kl_approx": 0.16858291625976562, "learning_rate": 5.453769828241872e-07, "loss": 0.1838, "num_tokens": 22715608.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1537550687789917, "sampling/importance_sampling_ratio/mean": 1.0002347230911255, "sampling/importance_sampling_ratio/min": 0.7932915091514587, "sampling/sampling_logp_difference/max": 0.23156452178955078, "sampling/sampling_logp_difference/mean": 0.01163764763623476, "step": 916 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 429.0, "completions/max_terminated_length": 429.0, "completions/mean_length": 105.6875, "completions/mean_terminated_length": 105.6875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.5094965919852257, "epoch": 0.9070227497527201, "grad_norm": 1.576282262802124, "kl_approx": 0.2953014373779297, "learning_rate": 5.341758713743828e-07, "loss": 0.1316, "num_tokens": 22741862.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1511759757995605, "sampling/importance_sampling_ratio/mean": 0.9997318387031555, "sampling/importance_sampling_ratio/min": 0.779964029788971, "sampling/sampling_logp_difference/max": 0.24850749969482422, "sampling/sampling_logp_difference/mean": 0.010456189513206482, "step": 917 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 451.0, "completions/max_terminated_length": 451.0, "completions/mean_length": 156.4375, "completions/mean_terminated_length": 156.4375, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.6460975538939238, "epoch": 0.9080118694362018, "grad_norm": 1.7412753105163574, "kl_approx": 0.22848129272460938, "learning_rate": 5.230878253907911e-07, "loss": 0.1507, "num_tokens": 22765676.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2756798267364502, "sampling/importance_sampling_ratio/mean": 1.0001229047775269, "sampling/importance_sampling_ratio/min": 0.802056074142456, "sampling/sampling_logp_difference/max": 0.24347925186157227, "sampling/sampling_logp_difference/mean": 0.011142137460410595, "step": 918 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 445.0, "completions/max_terminated_length": 445.0, "completions/mean_length": 126.375, "completions/mean_terminated_length": 126.375, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.7052512411028147, "epoch": 0.9090009891196835, "grad_norm": 1.5290298461914062, "kl_approx": 0.18408966064453125, "learning_rate": 5.121129773156663e-07, "loss": 0.141, "num_tokens": 22786528.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.158127784729004, "sampling/importance_sampling_ratio/mean": 1.0010249614715576, "sampling/importance_sampling_ratio/min": 0.8270903825759888, "sampling/sampling_logp_difference/max": 0.18984127044677734, "sampling/sampling_logp_difference/mean": 0.01246012095361948, "step": 919 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 474.0, "completions/max_terminated_length": 474.0, "completions/mean_length": 128.4375, "completions/mean_terminated_length": 128.4375, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.5498200017027557, "epoch": 0.9099901088031652, "grad_norm": 1.9337193965911865, "kl_approx": 0.12711715698242188, "learning_rate": 5.012514582391592e-07, "loss": 0.1208, "num_tokens": 22811558.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1929116249084473, "sampling/importance_sampling_ratio/mean": 0.9995390176773071, "sampling/importance_sampling_ratio/min": 0.8481070399284363, "sampling/sampling_logp_difference/max": 0.17639708518981934, "sampling/sampling_logp_difference/mean": 0.009919321164488792, "step": 920 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 817.0, "completions/max_terminated_length": 817.0, "completions/mean_length": 225.75, "completions/mean_terminated_length": 225.75, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6132006496191025, "epoch": 0.9109792284866469, "grad_norm": 1.5091079473495483, "kl_approx": 0.16408252716064453, "learning_rate": 4.905033978977492e-07, "loss": 0.1252, "num_tokens": 22841038.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1982603073120117, "sampling/importance_sampling_ratio/mean": 1.0002497434616089, "sampling/importance_sampling_ratio/min": 0.8454044461250305, "sampling/sampling_logp_difference/max": 0.18087077140808105, "sampling/sampling_logp_difference/mean": 0.011596649885177612, "step": 921 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 464.0, "completions/max_terminated_length": 464.0, "completions/mean_length": 126.6875, "completions/mean_terminated_length": 126.6875, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.5959279760718346, "epoch": 0.9119683481701286, "grad_norm": 2.1800334453582764, "kl_approx": 0.21048545837402344, "learning_rate": 4.798689246727006e-07, "loss": 0.1509, "num_tokens": 22863372.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1349691152572632, "sampling/importance_sampling_ratio/mean": 1.0001115798950195, "sampling/importance_sampling_ratio/min": 0.8165403604507446, "sampling/sampling_logp_difference/max": 0.20267891883850098, "sampling/sampling_logp_difference/mean": 0.010530105791985989, "step": 922 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 466.0, "completions/max_terminated_length": 466.0, "completions/mean_length": 145.25, "completions/mean_terminated_length": 145.25, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.7162386509589851, "epoch": 0.9129574678536103, "grad_norm": 1.6309341192245483, "kl_approx": 0.2008819580078125, "learning_rate": 4.693481655885257e-07, "loss": 0.1298, "num_tokens": 22886036.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.293114185333252, "sampling/importance_sampling_ratio/mean": 1.000004768371582, "sampling/importance_sampling_ratio/min": 0.8556584715843201, "sampling/sampling_logp_difference/max": 0.2570533752441406, "sampling/sampling_logp_difference/mean": 0.01316145434975624, "step": 923 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 795.0, "completions/max_terminated_length": 795.0, "completions/mean_length": 250.53125, "completions/mean_terminated_length": 250.53125, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.6742102121934295, "epoch": 0.913946587537092, "grad_norm": 2.1678717136383057, "kl_approx": 0.20184326171875, "learning_rate": 4.58941246311464e-07, "loss": 0.17, "num_tokens": 22911661.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1768912076950073, "sampling/importance_sampling_ratio/mean": 0.9999265074729919, "sampling/importance_sampling_ratio/min": 0.753877580165863, "sampling/sampling_logp_difference/max": 0.28252530097961426, "sampling/sampling_logp_difference/mean": 0.011269696056842804, "step": 924 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 945.0, "completions/max_terminated_length": 945.0, "completions/mean_length": 239.21875, "completions/mean_terminated_length": 239.21875, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6409902120940387, "epoch": 0.9149357072205737, "grad_norm": 1.1151752471923828, "kl_approx": 0.14501190185546875, "learning_rate": 4.4864829114798394e-07, "loss": 0.1013, "num_tokens": 22939004.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.4188376665115356, "sampling/importance_sampling_ratio/mean": 1.000002145767212, "sampling/importance_sampling_ratio/min": 0.8574901223182678, "sampling/sampling_logp_difference/max": 0.3498380184173584, "sampling/sampling_logp_difference/mean": 0.011786401271820068, "step": 925 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 523.0, "completions/max_terminated_length": 523.0, "completions/mean_length": 161.84375, "completions/mean_terminated_length": 161.84375, "completions/min_length": 79.0, "completions/min_terminated_length": 79.0, "entropy": 0.5221229684539139, "epoch": 0.9159248269040554, "grad_norm": 2.116652488708496, "kl_approx": 0.1573467254638672, "learning_rate": 4.384694230432984e-07, "loss": 0.1433, "num_tokens": 22962327.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3005717992782593, "sampling/importance_sampling_ratio/mean": 0.9997113347053528, "sampling/importance_sampling_ratio/min": 0.8187393546104431, "sampling/sampling_logp_difference/max": 0.2628040313720703, "sampling/sampling_logp_difference/mean": 0.01043662428855896, "step": 926 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 653.0, "completions/max_terminated_length": 653.0, "completions/mean_length": 151.53125, "completions/mean_terminated_length": 151.53125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.7581659303978086, "epoch": 0.9169139465875371, "grad_norm": 1.9401352405548096, "kl_approx": 0.3012504577636719, "learning_rate": 4.2840476357989825e-07, "loss": 0.1786, "num_tokens": 22988280.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1943354606628418, "sampling/importance_sampling_ratio/mean": 1.000303864479065, "sampling/importance_sampling_ratio/min": 0.8810519576072693, "sampling/sampling_logp_difference/max": 0.17758989334106445, "sampling/sampling_logp_difference/mean": 0.011561373248696327, "step": 927 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 502.0, "completions/max_terminated_length": 502.0, "completions/mean_length": 177.28125, "completions/mean_terminated_length": 177.28125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6101956870406866, "epoch": 0.9179030662710188, "grad_norm": 1.8513600826263428, "kl_approx": 0.2039642333984375, "learning_rate": 4.184544329761009e-07, "loss": 0.1493, "num_tokens": 23014097.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2025781869888306, "sampling/importance_sampling_ratio/mean": 1.000109076499939, "sampling/importance_sampling_ratio/min": 0.8689517974853516, "sampling/sampling_logp_difference/max": 0.18446779251098633, "sampling/sampling_logp_difference/mean": 0.010721328668296337, "step": 928 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 718.0, "completions/max_terminated_length": 718.0, "completions/mean_length": 215.25, "completions/mean_terminated_length": 215.25, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.7385302064940333, "epoch": 0.9188921859545005, "grad_norm": 2.298673152923584, "kl_approx": 0.2324676513671875, "learning_rate": 4.0861855008460403e-07, "loss": 0.1675, "num_tokens": 23040409.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1745589971542358, "sampling/importance_sampling_ratio/mean": 1.0004067420959473, "sampling/importance_sampling_ratio/min": 0.7443650364875793, "sampling/sampling_logp_difference/max": 0.2952237129211426, "sampling/sampling_logp_difference/mean": 0.01356808003038168, "step": 929 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 509.0, "completions/max_terminated_length": 509.0, "completions/mean_length": 192.28125, "completions/mean_terminated_length": 192.28125, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.713115107268095, "epoch": 0.9198813056379822, "grad_norm": 1.9953854084014893, "kl_approx": 0.1737370491027832, "learning_rate": 3.988972323910778e-07, "loss": 0.1626, "num_tokens": 23059850.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1744309663772583, "sampling/importance_sampling_ratio/mean": 1.0006884336471558, "sampling/importance_sampling_ratio/min": 0.8735074400901794, "sampling/sampling_logp_difference/max": 0.1607837677001953, "sampling/sampling_logp_difference/mean": 0.013840671628713608, "step": 930 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 595.0, "completions/max_terminated_length": 595.0, "completions/mean_length": 227.84375, "completions/mean_terminated_length": 227.84375, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.8270336245186627, "epoch": 0.9208704253214639, "grad_norm": 2.008772850036621, "kl_approx": 0.23043441772460938, "learning_rate": 3.8929059601275463e-07, "loss": 0.1702, "num_tokens": 23087581.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2137579917907715, "sampling/importance_sampling_ratio/mean": 1.0004228353500366, "sampling/importance_sampling_ratio/min": 0.8302134871482849, "sampling/sampling_logp_difference/max": 0.19372129440307617, "sampling/sampling_logp_difference/mean": 0.014416192658245564, "step": 931 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 692.0, "completions/max_terminated_length": 692.0, "completions/mean_length": 129.6875, "completions/mean_terminated_length": 129.6875, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.5810375409200788, "epoch": 0.9218595450049456, "grad_norm": 1.9511221647262573, "kl_approx": 0.1610260009765625, "learning_rate": 3.797987556970495e-07, "loss": 0.1834, "num_tokens": 23108547.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2049068212509155, "sampling/importance_sampling_ratio/mean": 1.0000848770141602, "sampling/importance_sampling_ratio/min": 0.8812767267227173, "sampling/sampling_logp_difference/max": 0.1864023208618164, "sampling/sampling_logp_difference/mean": 0.010929306037724018, "step": 932 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 595.0, "completions/max_terminated_length": 595.0, "completions/mean_length": 220.8125, "completions/mean_terminated_length": 220.8125, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.896718087606132, "epoch": 0.9228486646884273, "grad_norm": 2.0181455612182617, "kl_approx": 0.2214508056640625, "learning_rate": 3.7042182482018074e-07, "loss": 0.1853, "num_tokens": 23130429.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2046300172805786, "sampling/importance_sampling_ratio/mean": 0.999866247177124, "sampling/importance_sampling_ratio/min": 0.8333730697631836, "sampling/sampling_logp_difference/max": 0.1861724853515625, "sampling/sampling_logp_difference/mean": 0.014269708655774593, "step": 933 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 693.0, "completions/max_terminated_length": 693.0, "completions/mean_length": 144.34375, "completions/mean_terminated_length": 144.34375, "completions/min_length": 40.0, "completions/min_terminated_length": 40.0, "entropy": 0.6945392517372966, "epoch": 0.923837784371909, "grad_norm": 1.7381864786148071, "kl_approx": 0.177581787109375, "learning_rate": 3.611599153858214e-07, "loss": 0.133, "num_tokens": 23157144.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.232814073562622, "sampling/importance_sampling_ratio/mean": 0.9998500943183899, "sampling/importance_sampling_ratio/min": 0.8512178063392639, "sampling/sampling_logp_difference/max": 0.20929944515228271, "sampling/sampling_logp_difference/mean": 0.012542340904474258, "step": 934 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 221.0, "completions/max_terminated_length": 221.0, "completions/mean_length": 112.4375, "completions/mean_terminated_length": 112.4375, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.6300154253840446, "epoch": 0.9248269040553907, "grad_norm": 2.3033740520477295, "kl_approx": 0.1961669921875, "learning_rate": 3.520131380237546e-07, "loss": 0.1497, "num_tokens": 23179310.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2463362216949463, "sampling/importance_sampling_ratio/mean": 1.0003783702850342, "sampling/importance_sampling_ratio/min": 0.8419800400733948, "sampling/sampling_logp_difference/max": 0.22020816802978516, "sampling/sampling_logp_difference/mean": 0.011140502989292145, "step": 935 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 379.0, "completions/max_terminated_length": 379.0, "completions/mean_length": 146.78125, "completions/mean_terminated_length": 146.78125, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.8073467668145895, "epoch": 0.9258160237388724, "grad_norm": 2.170850992202759, "kl_approx": 0.23941421508789062, "learning_rate": 3.429816019885657e-07, "loss": 0.1717, "num_tokens": 23204223.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2430685758590698, "sampling/importance_sampling_ratio/mean": 0.9997056126594543, "sampling/importance_sampling_ratio/min": 0.7804122567176819, "sampling/sampling_logp_difference/max": 0.24793291091918945, "sampling/sampling_logp_difference/mean": 0.0127346096560359, "step": 936 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 561.0, "completions/max_terminated_length": 561.0, "completions/mean_length": 158.1875, "completions/mean_terminated_length": 158.1875, "completions/min_length": 56.0, "completions/min_terminated_length": 56.0, "entropy": 0.6047965995967388, "epoch": 0.9268051434223541, "grad_norm": 1.3165454864501953, "kl_approx": 0.15633201599121094, "learning_rate": 3.3406541515832e-07, "loss": 0.1058, "num_tokens": 23229069.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1416133642196655, "sampling/importance_sampling_ratio/mean": 0.9999668002128601, "sampling/importance_sampling_ratio/min": 0.7951479554176331, "sampling/sampling_logp_difference/max": 0.22922706604003906, "sampling/sampling_logp_difference/mean": 0.010691514238715172, "step": 937 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 360.0, "completions/max_terminated_length": 360.0, "completions/mean_length": 136.28125, "completions/mean_terminated_length": 136.28125, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.7632424859330058, "epoch": 0.9277942631058358, "grad_norm": 2.1583898067474365, "kl_approx": 0.2339324951171875, "learning_rate": 3.252646840332918e-07, "loss": 0.1792, "num_tokens": 23262798.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.176235556602478, "sampling/importance_sampling_ratio/mean": 1.0001634359359741, "sampling/importance_sampling_ratio/min": 0.8303719162940979, "sampling/sampling_logp_difference/max": 0.1858816146850586, "sampling/sampling_logp_difference/mean": 0.012494831345975399, "step": 938 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 801.0, "completions/max_terminated_length": 801.0, "completions/mean_length": 212.4375, "completions/mean_terminated_length": 212.4375, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.6948607196100056, "epoch": 0.9287833827893175, "grad_norm": 1.6890428066253662, "kl_approx": 0.2135009765625, "learning_rate": 3.16579513734675e-07, "loss": 0.142, "num_tokens": 23288740.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.161704182624817, "sampling/importance_sampling_ratio/mean": 0.9997780323028564, "sampling/importance_sampling_ratio/min": 0.8269516229629517, "sampling/sampling_logp_difference/max": 0.19000911712646484, "sampling/sampling_logp_difference/mean": 0.012074396014213562, "step": 939 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 626.0, "completions/max_terminated_length": 626.0, "completions/mean_length": 160.09375, "completions/mean_terminated_length": 160.09375, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.5166701516136527, "epoch": 0.9297725024727992, "grad_norm": 1.7039308547973633, "kl_approx": 0.13799667358398438, "learning_rate": 3.080100080033388e-07, "loss": 0.1473, "num_tokens": 23311359.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2092663049697876, "sampling/importance_sampling_ratio/mean": 1.0004020929336548, "sampling/importance_sampling_ratio/min": 0.792396605014801, "sampling/sampling_logp_difference/max": 0.23269319534301758, "sampling/sampling_logp_difference/mean": 0.010275518521666527, "step": 940 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 437.0, "completions/max_terminated_length": 437.0, "completions/mean_length": 175.34375, "completions/mean_terminated_length": 175.34375, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.5716675901785493, "epoch": 0.9307616221562809, "grad_norm": 1.470426321029663, "kl_approx": 0.15673065185546875, "learning_rate": 2.995562691985898e-07, "loss": 0.1073, "num_tokens": 23332994.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1859327554702759, "sampling/importance_sampling_ratio/mean": 0.9996892213821411, "sampling/importance_sampling_ratio/min": 0.8074321746826172, "sampling/sampling_logp_difference/max": 0.2138962745666504, "sampling/sampling_logp_difference/mean": 0.010752402245998383, "step": 941 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 781.0, "completions/max_terminated_length": 781.0, "completions/mean_length": 336.03125, "completions/mean_terminated_length": 336.03125, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.7624018741771579, "epoch": 0.9317507418397626, "grad_norm": 2.4400782585144043, "kl_approx": 0.3235321044921875, "learning_rate": 2.9121839829693857e-07, "loss": 0.1889, "num_tokens": 23358211.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1443214416503906, "sampling/importance_sampling_ratio/mean": 1.0001558065414429, "sampling/importance_sampling_ratio/min": 0.8100035190582275, "sampling/sampling_logp_difference/max": 0.21071672439575195, "sampling/sampling_logp_difference/mean": 0.010019581764936447, "step": 942 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 581.0, "completions/max_terminated_length": 581.0, "completions/mean_length": 226.0625, "completions/mean_terminated_length": 226.0625, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.678395876660943, "epoch": 0.9327398615232443, "grad_norm": 1.3982230424880981, "kl_approx": 0.15578842163085938, "learning_rate": 2.829964948909048e-07, "loss": 0.1129, "num_tokens": 23386477.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.202258586883545, "sampling/importance_sampling_ratio/mean": 0.9998548626899719, "sampling/importance_sampling_ratio/min": 0.8437582850456238, "sampling/sampling_logp_difference/max": 0.18420195579528809, "sampling/sampling_logp_difference/mean": 0.011794526129961014, "step": 943 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 468.0, "completions/max_terminated_length": 468.0, "completions/mean_length": 177.71875, "completions/mean_terminated_length": 177.71875, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.7295422032475471, "epoch": 0.933728981206726, "grad_norm": 1.6988331079483032, "kl_approx": 0.219512939453125, "learning_rate": 2.748906571878207e-07, "loss": 0.1548, "num_tokens": 23415564.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.147016167640686, "sampling/importance_sampling_ratio/mean": 0.9998202323913574, "sampling/importance_sampling_ratio/min": 0.8290809392929077, "sampling/sampling_logp_difference/max": 0.1874375343322754, "sampling/sampling_logp_difference/mean": 0.011210720986127853, "step": 944 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 770.0, "completions/max_terminated_length": 770.0, "completions/mean_length": 192.40625, "completions/mean_terminated_length": 192.40625, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.8181379986926913, "epoch": 0.9347181008902077, "grad_norm": 2.9533233642578125, "kl_approx": 0.25460052490234375, "learning_rate": 2.6690098200866097e-07, "loss": 0.207, "num_tokens": 23436417.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2009352445602417, "sampling/importance_sampling_ratio/mean": 1.0005091428756714, "sampling/importance_sampling_ratio/min": 0.811750590801239, "sampling/sampling_logp_difference/max": 0.20856213569641113, "sampling/sampling_logp_difference/mean": 0.013912945054471493, "step": 945 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 610.0, "completions/max_terminated_length": 610.0, "completions/mean_length": 160.125, "completions/mean_terminated_length": 160.125, "completions/min_length": 30.0, "completions/min_terminated_length": 30.0, "entropy": 0.7389853438362479, "epoch": 0.9357072205736894, "grad_norm": 1.8638039827346802, "kl_approx": 0.20721435546875, "learning_rate": 2.5902756478688674e-07, "loss": 0.1646, "num_tokens": 23463181.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2548481225967407, "sampling/importance_sampling_ratio/mean": 0.9998177886009216, "sampling/importance_sampling_ratio/min": 0.8808161020278931, "sampling/sampling_logp_difference/max": 0.22701454162597656, "sampling/sampling_logp_difference/mean": 0.012262266129255295, "step": 946 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 439.0, "completions/max_terminated_length": 439.0, "completions/mean_length": 182.4375, "completions/mean_terminated_length": 182.4375, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.8116632993333042, "epoch": 0.9366963402571711, "grad_norm": 1.6705427169799805, "kl_approx": 0.22158962488174438, "learning_rate": 2.5127049956730207e-07, "loss": 0.1682, "num_tokens": 23482219.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2001081705093384, "sampling/importance_sampling_ratio/mean": 0.9997972846031189, "sampling/importance_sampling_ratio/min": 0.8356325030326843, "sampling/sampling_logp_difference/max": 0.18241167068481445, "sampling/sampling_logp_difference/mean": 0.014462525956332684, "step": 947 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 673.0, "completions/max_terminated_length": 673.0, "completions/mean_length": 183.03125, "completions/mean_terminated_length": 183.03125, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.6204490712843835, "epoch": 0.9376854599406528, "grad_norm": 1.576183795928955, "kl_approx": 0.19057846069335938, "learning_rate": 2.436298790049363e-07, "loss": 0.1312, "num_tokens": 23506124.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1718477010726929, "sampling/importance_sampling_ratio/mean": 0.9993624091148376, "sampling/importance_sampling_ratio/min": 0.8405288457870483, "sampling/sampling_logp_difference/max": 0.17372393608093262, "sampling/sampling_logp_difference/mean": 0.010013558901846409, "step": 948 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 295.0, "completions/max_terminated_length": 295.0, "completions/mean_length": 100.5625, "completions/mean_terminated_length": 100.5625, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.6189532005228102, "epoch": 0.9386745796241345, "grad_norm": 1.7550420761108398, "kl_approx": 0.1527862548828125, "learning_rate": 2.3610579436392999e-07, "loss": 0.1097, "num_tokens": 23527734.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1614959239959717, "sampling/importance_sampling_ratio/mean": 0.9997895956039429, "sampling/importance_sampling_ratio/min": 0.8289046287536621, "sampling/sampling_logp_difference/max": 0.18765020370483398, "sampling/sampling_logp_difference/mean": 0.012355138547718525, "step": 949 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 202.0, "completions/max_terminated_length": 202.0, "completions/mean_length": 77.375, "completions/mean_terminated_length": 77.375, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.44893082650378346, "epoch": 0.9396636993076162, "grad_norm": 1.666785478591919, "kl_approx": 0.15949812531471252, "learning_rate": 2.2869833551645293e-07, "loss": 0.1003, "num_tokens": 23548426.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1324772834777832, "sampling/importance_sampling_ratio/mean": 1.000374674797058, "sampling/importance_sampling_ratio/min": 0.8905827403068542, "sampling/sampling_logp_difference/max": 0.12440752983093262, "sampling/sampling_logp_difference/mean": 0.008126888424158096, "step": 950 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 576.0, "completions/max_terminated_length": 576.0, "completions/mean_length": 126.28125, "completions/mean_terminated_length": 126.28125, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.48123070457950234, "epoch": 0.9406528189910979, "grad_norm": 2.030900001525879, "kl_approx": 0.16823387145996094, "learning_rate": 2.2140759094162468e-07, "loss": 0.1192, "num_tokens": 23578867.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2084213495254517, "sampling/importance_sampling_ratio/mean": 1.0000064373016357, "sampling/importance_sampling_ratio/min": 0.8697884678840637, "sampling/sampling_logp_difference/max": 0.1893148422241211, "sampling/sampling_logp_difference/mean": 0.00813357438892126, "step": 951 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 643.0, "completions/max_terminated_length": 643.0, "completions/mean_length": 221.6875, "completions/mean_terminated_length": 221.6875, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.801166164688766, "epoch": 0.9416419386745796, "grad_norm": 2.3626527786254883, "kl_approx": 0.2656707763671875, "learning_rate": 2.1423364772445886e-07, "loss": 0.1894, "num_tokens": 23605177.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1976333856582642, "sampling/importance_sampling_ratio/mean": 1.0001087188720703, "sampling/importance_sampling_ratio/min": 0.8423380255699158, "sampling/sampling_logp_difference/max": 0.18034744262695312, "sampling/sampling_logp_difference/mean": 0.012558991089463234, "step": 952 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 298.0, "completions/max_terminated_length": 298.0, "completions/mean_length": 111.125, "completions/mean_terminated_length": 111.125, "completions/min_length": 32.0, "completions/min_terminated_length": 32.0, "entropy": 0.6124854912050068, "epoch": 0.9426310583580614, "grad_norm": 1.6418765783309937, "kl_approx": 0.18467330932617188, "learning_rate": 2.071765915548274e-07, "loss": 0.1409, "num_tokens": 23627893.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2435176372528076, "sampling/importance_sampling_ratio/mean": 0.9998628497123718, "sampling/importance_sampling_ratio/min": 0.8756910562515259, "sampling/sampling_logp_difference/max": 0.21794414520263672, "sampling/sampling_logp_difference/mean": 0.010795723646879196, "step": 953 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 611.0, "completions/max_terminated_length": 611.0, "completions/mean_length": 185.875, "completions/mean_terminated_length": 185.875, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.724804506637156, "epoch": 0.9436201780415431, "grad_norm": 1.8208023309707642, "kl_approx": 0.233856201171875, "learning_rate": 2.002365067264289e-07, "loss": 0.1718, "num_tokens": 23658225.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1396235227584839, "sampling/importance_sampling_ratio/mean": 0.9996122717857361, "sampling/importance_sampling_ratio/min": 0.7973471283912659, "sampling/sampling_logp_difference/max": 0.22646522521972656, "sampling/sampling_logp_difference/mean": 0.011838111095130444, "step": 954 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 621.0, "completions/max_terminated_length": 621.0, "completions/mean_length": 185.0, "completions/mean_terminated_length": 185.0, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.6490145344287157, "epoch": 0.9446092977250248, "grad_norm": 1.5305683612823486, "kl_approx": 0.14900779724121094, "learning_rate": 1.9341347613579086e-07, "loss": 0.1092, "num_tokens": 23686889.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2100692987442017, "sampling/importance_sampling_ratio/mean": 1.0001901388168335, "sampling/importance_sampling_ratio/min": 0.8535242080688477, "sampling/sampling_logp_difference/max": 0.19067764282226562, "sampling/sampling_logp_difference/mean": 0.011687963269650936, "step": 955 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 577.0, "completions/max_terminated_length": 577.0, "completions/mean_length": 179.0, "completions/mean_terminated_length": 179.0, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.6552641969174147, "epoch": 0.9455984174085065, "grad_norm": 1.7861980199813843, "kl_approx": 0.1722564697265625, "learning_rate": 1.867075812812691e-07, "loss": 0.153, "num_tokens": 23709217.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1773594617843628, "sampling/importance_sampling_ratio/mean": 1.0005379915237427, "sampling/importance_sampling_ratio/min": 0.685562014579773, "sampling/sampling_logp_difference/max": 0.3775162696838379, "sampling/sampling_logp_difference/mean": 0.01177027728408575, "step": 956 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 386.0, "completions/max_terminated_length": 386.0, "completions/mean_length": 123.0625, "completions/mean_terminated_length": 123.0625, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.5520146647468209, "epoch": 0.9465875370919882, "grad_norm": 2.1820321083068848, "kl_approx": 0.16864395141601562, "learning_rate": 1.8011890226208527e-07, "loss": 0.1761, "num_tokens": 23729387.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1982911825180054, "sampling/importance_sampling_ratio/mean": 1.0000988245010376, "sampling/importance_sampling_ratio/min": 0.8101352453231812, "sampling/sampling_logp_difference/max": 0.2105541229248047, "sampling/sampling_logp_difference/mean": 0.010537056252360344, "step": 957 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 401.0, "completions/max_terminated_length": 401.0, "completions/mean_length": 147.4375, "completions/mean_terminated_length": 147.4375, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.6500881081447005, "epoch": 0.9475766567754699, "grad_norm": 2.046440362930298, "kl_approx": 0.17687606811523438, "learning_rate": 1.7364751777736334e-07, "loss": 0.1244, "num_tokens": 23754841.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2488380670547485, "sampling/importance_sampling_ratio/mean": 1.000267744064331, "sampling/importance_sampling_ratio/min": 0.7931005358695984, "sampling/sampling_logp_difference/max": 0.23180532455444336, "sampling/sampling_logp_difference/mean": 0.01310916431248188, "step": 958 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 496.0, "completions/max_terminated_length": 496.0, "completions/mean_length": 156.75, "completions/mean_terminated_length": 156.75, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.5416479506529868, "epoch": 0.9485657764589516, "grad_norm": 2.2713351249694824, "kl_approx": 0.1999225616455078, "learning_rate": 1.6729350512519006e-07, "loss": 0.1258, "num_tokens": 23780889.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.142945647239685, "sampling/importance_sampling_ratio/mean": 0.9997896552085876, "sampling/importance_sampling_ratio/min": 0.8270063996315002, "sampling/sampling_logp_difference/max": 0.1899428367614746, "sampling/sampling_logp_difference/mean": 0.010421632789075375, "step": 959 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 535.0, "completions/max_terminated_length": 535.0, "completions/mean_length": 192.1875, "completions/mean_terminated_length": 192.1875, "completions/min_length": 62.0, "completions/min_terminated_length": 62.0, "entropy": 0.6519944071769714, "epoch": 0.9495548961424333, "grad_norm": 2.016873598098755, "kl_approx": 0.23065185546875, "learning_rate": 1.6105694020169594e-07, "loss": 0.1927, "num_tokens": 23804247.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1972062587738037, "sampling/importance_sampling_ratio/mean": 1.0003575086593628, "sampling/importance_sampling_ratio/min": 0.7808578610420227, "sampling/sampling_logp_difference/max": 0.2473621368408203, "sampling/sampling_logp_difference/mean": 0.010798938572406769, "step": 960 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 621.0, "completions/max_terminated_length": 621.0, "completions/mean_length": 203.03125, "completions/mean_terminated_length": 203.03125, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.6945741823874414, "epoch": 0.950544015825915, "grad_norm": 2.1283788681030273, "kl_approx": 0.22741317749023438, "learning_rate": 1.5493789750014032e-07, "loss": 0.1705, "num_tokens": 23833152.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2697182893753052, "sampling/importance_sampling_ratio/mean": 0.9999306201934814, "sampling/importance_sampling_ratio/min": 0.818627655506134, "sampling/sampling_logp_difference/max": 0.23879504203796387, "sampling/sampling_logp_difference/mean": 0.011559694074094296, "step": 961 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 751.0, "completions/max_terminated_length": 751.0, "completions/mean_length": 187.5625, "completions/mean_terminated_length": 187.5625, "completions/min_length": 52.0, "completions/min_terminated_length": 52.0, "entropy": 0.566045262850821, "epoch": 0.9515331355093967, "grad_norm": 1.7238746881484985, "kl_approx": 0.17074012756347656, "learning_rate": 1.489364501100332e-07, "loss": 0.1218, "num_tokens": 23860818.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1862667798995972, "sampling/importance_sampling_ratio/mean": 0.9999316930770874, "sampling/importance_sampling_ratio/min": 0.8465646505355835, "sampling/sampling_logp_difference/max": 0.17081117630004883, "sampling/sampling_logp_difference/mean": 0.011428901925683022, "step": 962 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 721.0, "completions/max_terminated_length": 721.0, "completions/mean_length": 168.0, "completions/mean_terminated_length": 168.0, "completions/min_length": 33.0, "completions/min_terminated_length": 33.0, "entropy": 0.5849769855849445, "epoch": 0.9525222551928784, "grad_norm": 1.5398428440093994, "kl_approx": 0.16490840911865234, "learning_rate": 1.430526697162482e-07, "loss": 0.1613, "num_tokens": 23881410.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1631975173950195, "sampling/importance_sampling_ratio/mean": 1.0001734495162964, "sampling/importance_sampling_ratio/min": 0.8299371004104614, "sampling/sampling_logp_difference/max": 0.18640542030334473, "sampling/sampling_logp_difference/mean": 0.009928787127137184, "step": 963 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 1008.0, "completions/mean_length": 375.71875, "completions/mean_terminated_length": 354.8064270019531, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.704491512849927, "epoch": 0.9535113748763601, "grad_norm": 2.8365321159362793, "kl_approx": 0.2080516815185547, "learning_rate": 1.3728662659818205e-07, "loss": 0.1762, "num_tokens": 23912049.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.287678599357605, "sampling/importance_sampling_ratio/mean": 1.000015377998352, "sampling/importance_sampling_ratio/min": 0.8319222927093506, "sampling/sampling_logp_difference/max": 0.2528409957885742, "sampling/sampling_logp_difference/mean": 0.010897595435380936, "step": 964 }, { "completions/clipped_ratio": 0.0625, "completions/max_length": 1024.0, "completions/max_terminated_length": 754.0, "completions/mean_length": 358.71875, "completions/mean_terminated_length": 314.3666687011719, "completions/min_length": 73.0, "completions/min_terminated_length": 73.0, "entropy": 0.8935646540485322, "epoch": 0.9545004945598418, "grad_norm": 1.7923932075500488, "kl_approx": 0.261322021484375, "learning_rate": 1.3163838962890196e-07, "loss": 0.1792, "num_tokens": 23943696.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1955060958862305, "sampling/importance_sampling_ratio/mean": 0.9996753334999084, "sampling/importance_sampling_ratio/min": 0.652955949306488, "sampling/sampling_logp_difference/max": 0.42624568939208984, "sampling/sampling_logp_difference/mean": 0.013546744361519814, "step": 965 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 715.0, "completions/max_terminated_length": 715.0, "completions/mean_length": 245.9375, "completions/mean_terminated_length": 245.9375, "completions/min_length": 55.0, "completions/min_terminated_length": 55.0, "entropy": 0.6741948029957712, "epoch": 0.9554896142433235, "grad_norm": 1.6324172019958496, "kl_approx": 0.20082473754882812, "learning_rate": 1.2610802627432972e-07, "loss": 0.1229, "num_tokens": 23975758.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2010350227355957, "sampling/importance_sampling_ratio/mean": 1.000095009803772, "sampling/importance_sampling_ratio/min": 0.8148669004440308, "sampling/sampling_logp_difference/max": 0.20473051071166992, "sampling/sampling_logp_difference/mean": 0.011028263717889786, "step": 966 }, { "completions/clipped_ratio": 0.09375, "completions/max_length": 1024.0, "completions/max_terminated_length": 806.0, "completions/mean_length": 350.8125, "completions/mean_terminated_length": 281.17242431640625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.975496634375304, "epoch": 0.9564787339268052, "grad_norm": 1.8319061994552612, "kl_approx": 0.22360992431640625, "learning_rate": 1.206956025924333e-07, "loss": 0.2025, "num_tokens": 24002624.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2230664491653442, "sampling/importance_sampling_ratio/mean": 0.9998801350593567, "sampling/importance_sampling_ratio/min": 0.8449810743331909, "sampling/sampling_logp_difference/max": 0.20136117935180664, "sampling/sampling_logp_difference/mean": 0.014242571778595448, "step": 967 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 954.0, "completions/mean_length": 194.03125, "completions/mean_terminated_length": 167.258056640625, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.7399760680273175, "epoch": 0.9574678536102869, "grad_norm": 2.6257619857788086, "kl_approx": 0.25008392333984375, "learning_rate": 1.1540118323243866e-07, "loss": 0.2021, "num_tokens": 24026617.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.184919834136963, "sampling/importance_sampling_ratio/mean": 0.9999158978462219, "sampling/importance_sampling_ratio/min": 0.7857549786567688, "sampling/sampling_logp_difference/max": 0.24111032485961914, "sampling/sampling_logp_difference/mean": 0.011258159764111042, "step": 968 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 545.0, "completions/max_terminated_length": 545.0, "completions/mean_length": 166.90625, "completions/mean_terminated_length": 166.90625, "completions/min_length": 51.0, "completions/min_terminated_length": 51.0, "entropy": 0.7166020167060196, "epoch": 0.9584569732937686, "grad_norm": 1.4835071563720703, "kl_approx": 0.231781005859375, "learning_rate": 1.1022483143405705e-07, "loss": 0.1564, "num_tokens": 24054054.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1833401918411255, "sampling/importance_sampling_ratio/mean": 1.0003535747528076, "sampling/importance_sampling_ratio/min": 0.8659509420394897, "sampling/sampling_logp_difference/max": 0.16834115982055664, "sampling/sampling_logp_difference/mean": 0.011526208370923996, "step": 969 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 827.0, "completions/max_terminated_length": 827.0, "completions/mean_length": 235.46875, "completions/mean_terminated_length": 235.46875, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.8770882128737867, "epoch": 0.9594460929772503, "grad_norm": 2.8742053508758545, "kl_approx": 0.2322063446044922, "learning_rate": 1.0516660902673448e-07, "loss": 0.1551, "num_tokens": 24081565.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2034496068954468, "sampling/importance_sampling_ratio/mean": 1.0001764297485352, "sampling/importance_sampling_ratio/min": 0.863926887512207, "sampling/sampling_logp_difference/max": 0.18519210815429688, "sampling/sampling_logp_difference/mean": 0.014272237196564674, "step": 970 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 573.0, "completions/max_terminated_length": 573.0, "completions/mean_length": 172.90625, "completions/mean_terminated_length": 172.90625, "completions/min_length": 47.0, "completions/min_terminated_length": 47.0, "entropy": 0.6862538391724229, "epoch": 0.960435212660732, "grad_norm": 1.460560917854309, "kl_approx": 0.181182861328125, "learning_rate": 1.0022657642890232e-07, "loss": 0.1585, "num_tokens": 24109426.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1666808128356934, "sampling/importance_sampling_ratio/mean": 1.0000468492507935, "sampling/importance_sampling_ratio/min": 0.818161129951477, "sampling/sampling_logp_difference/max": 0.20069599151611328, "sampling/sampling_logp_difference/mean": 0.011428498663008213, "step": 971 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 283.0, "completions/max_terminated_length": 283.0, "completions/mean_length": 125.5625, "completions/mean_terminated_length": 125.5625, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.6845240416005254, "epoch": 0.9614243323442137, "grad_norm": 2.100619316101074, "kl_approx": 0.27032470703125, "learning_rate": 9.540479264726676e-08, "loss": 0.1797, "num_tokens": 24133684.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1751723289489746, "sampling/importance_sampling_ratio/mean": 0.9996352791786194, "sampling/importance_sampling_ratio/min": 0.8628101348876953, "sampling/sampling_logp_difference/max": 0.16141486167907715, "sampling/sampling_logp_difference/mean": 0.012015280313789845, "step": 972 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 550.0, "completions/max_terminated_length": 550.0, "completions/mean_length": 254.5, "completions/mean_terminated_length": 254.5, "completions/min_length": 54.0, "completions/min_terminated_length": 54.0, "entropy": 0.9366502584889531, "epoch": 0.9624134520276953, "grad_norm": 2.1559953689575195, "kl_approx": 0.2807159423828125, "learning_rate": 9.070131527609604e-08, "loss": 0.2293, "num_tokens": 24162572.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.200055480003357, "sampling/importance_sampling_ratio/mean": 0.9996441602706909, "sampling/importance_sampling_ratio/min": 0.8209091424942017, "sampling/sampling_logp_difference/max": 0.1973428726196289, "sampling/sampling_logp_difference/mean": 0.013508064672350883, "step": 973 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 579.0, "completions/max_terminated_length": 579.0, "completions/mean_length": 186.8125, "completions/mean_terminated_length": 186.8125, "completions/min_length": 63.0, "completions/min_terminated_length": 63.0, "entropy": 0.6646601571701467, "epoch": 0.963402571711177, "grad_norm": 1.545967936515808, "kl_approx": 0.20665359497070312, "learning_rate": 8.61162004965388e-08, "loss": 0.1283, "num_tokens": 24196574.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2174569368362427, "sampling/importance_sampling_ratio/mean": 0.9994106292724609, "sampling/importance_sampling_ratio/min": 0.7773083448410034, "sampling/sampling_logp_difference/max": 0.2519181966781616, "sampling/sampling_logp_difference/mean": 0.011186047457158566, "step": 974 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 356.0, "completions/max_terminated_length": 356.0, "completions/mean_length": 166.5625, "completions/mean_terminated_length": 166.5625, "completions/min_length": 59.0, "completions/min_terminated_length": 59.0, "entropy": 0.7995424391701818, "epoch": 0.9643916913946587, "grad_norm": 1.803691029548645, "kl_approx": 0.27672576904296875, "learning_rate": 8.16495030759501e-08, "loss": 0.1892, "num_tokens": 24216800.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1679277420043945, "sampling/importance_sampling_ratio/mean": 0.9990597367286682, "sampling/importance_sampling_ratio/min": 0.8129252195358276, "sampling/sampling_logp_difference/max": 0.20711612701416016, "sampling/sampling_logp_difference/mean": 0.012230121530592442, "step": 975 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 599.0, "completions/max_terminated_length": 599.0, "completions/mean_length": 187.0625, "completions/mean_terminated_length": 187.0625, "completions/min_length": 36.0, "completions/min_terminated_length": 36.0, "entropy": 0.8262205263599753, "epoch": 0.9653808110781404, "grad_norm": 2.1195411682128906, "kl_approx": 0.24197006225585938, "learning_rate": 7.730127636723539e-08, "loss": 0.1795, "num_tokens": 24247186.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2515885829925537, "sampling/importance_sampling_ratio/mean": 1.0001142024993896, "sampling/importance_sampling_ratio/min": 0.7756698131561279, "sampling/sampling_logp_difference/max": 0.2540283203125, "sampling/sampling_logp_difference/mean": 0.013037126511335373, "step": 976 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 366.0, "completions/max_terminated_length": 366.0, "completions/mean_length": 143.84375, "completions/mean_terminated_length": 143.84375, "completions/min_length": 37.0, "completions/min_terminated_length": 37.0, "entropy": 0.693372602108866, "epoch": 0.9663699307616221, "grad_norm": 2.0046935081481934, "kl_approx": 0.20873260498046875, "learning_rate": 7.307157230821426e-08, "loss": 0.1727, "num_tokens": 24277157.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.278741478919983, "sampling/importance_sampling_ratio/mean": 0.9996760487556458, "sampling/importance_sampling_ratio/min": 0.8507634401321411, "sampling/sampling_logp_difference/max": 0.24587631225585938, "sampling/sampling_logp_difference/mean": 0.012500425800681114, "step": 977 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 809.0, "completions/max_terminated_length": 809.0, "completions/mean_length": 307.5, "completions/mean_terminated_length": 307.5, "completions/min_length": 50.0, "completions/min_terminated_length": 50.0, "entropy": 0.792204505763948, "epoch": 0.9673590504451038, "grad_norm": 1.4335241317749023, "kl_approx": 0.193450927734375, "learning_rate": 6.896044142100433e-08, "loss": 0.1537, "num_tokens": 24305861.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2065719366073608, "sampling/importance_sampling_ratio/mean": 1.0000433921813965, "sampling/importance_sampling_ratio/min": 0.8389890789985657, "sampling/sampling_logp_difference/max": 0.18778324127197266, "sampling/sampling_logp_difference/mean": 0.012583655305206776, "step": 978 }, { "completions/clipped_ratio": 0.03125, "completions/max_length": 1024.0, "completions/max_terminated_length": 668.0, "completions/mean_length": 383.34375, "completions/mean_terminated_length": 362.6773986816406, "completions/min_length": 105.0, "completions/min_terminated_length": 105.0, "entropy": 0.899545818567276, "epoch": 0.9683481701285855, "grad_norm": 1.6787108182907104, "kl_approx": 0.23577880859375, "learning_rate": 6.496793281141056e-08, "loss": 0.192, "num_tokens": 24338080.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2023844718933105, "sampling/importance_sampling_ratio/mean": 0.9997720122337341, "sampling/importance_sampling_ratio/min": 0.7521405816078186, "sampling/sampling_logp_difference/max": 0.2848320007324219, "sampling/sampling_logp_difference/mean": 0.012607418932020664, "step": 979 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 817.0, "completions/max_terminated_length": 817.0, "completions/mean_length": 285.78125, "completions/mean_terminated_length": 285.78125, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7933946270495653, "epoch": 0.9693372898120672, "grad_norm": 1.1821986436843872, "kl_approx": 0.15660858154296875, "learning_rate": 6.109409416834689e-08, "loss": 0.1224, "num_tokens": 24366425.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1970655918121338, "sampling/importance_sampling_ratio/mean": 1.0001840591430664, "sampling/importance_sampling_ratio/min": 0.7747645974159241, "sampling/sampling_logp_difference/max": 0.25519609451293945, "sampling/sampling_logp_difference/mean": 0.012859487906098366, "step": 980 }, { "completions/clipped_ratio": 0.0625, "completions/max_length": 1024.0, "completions/max_terminated_length": 1004.0, "completions/mean_length": 403.03125, "completions/mean_terminated_length": 361.63336181640625, "completions/min_length": 46.0, "completions/min_terminated_length": 46.0, "entropy": 0.8006639881059527, "epoch": 0.9703264094955489, "grad_norm": 1.5542579889297485, "kl_approx": 0.18871307373046875, "learning_rate": 5.7338971763256646e-08, "loss": 0.1568, "num_tokens": 24401842.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.191032886505127, "sampling/importance_sampling_ratio/mean": 0.999828577041626, "sampling/importance_sampling_ratio/min": 0.6852510571479797, "sampling/sampling_logp_difference/max": 0.37796998023986816, "sampling/sampling_logp_difference/mean": 0.01109092403203249, "step": 981 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 847.0, "completions/max_terminated_length": 847.0, "completions/mean_length": 344.5, "completions/mean_terminated_length": 344.5, "completions/min_length": 66.0, "completions/min_terminated_length": 66.0, "entropy": 0.8156723426654935, "epoch": 0.9713155291790306, "grad_norm": 1.4763805866241455, "kl_approx": 0.19103240966796875, "learning_rate": 5.37026104495697e-08, "loss": 0.1491, "num_tokens": 24433778.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2072659730911255, "sampling/importance_sampling_ratio/mean": 1.0002778768539429, "sampling/importance_sampling_ratio/min": 0.8424476385116577, "sampling/sampling_logp_difference/max": 0.18835830688476562, "sampling/sampling_logp_difference/mean": 0.012737740762531757, "step": 982 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 593.0, "completions/max_terminated_length": 593.0, "completions/mean_length": 189.25, "completions/mean_terminated_length": 189.25, "completions/min_length": 34.0, "completions/min_terminated_length": 34.0, "entropy": 0.6301774522289634, "epoch": 0.9723046488625123, "grad_norm": 2.627502679824829, "kl_approx": 0.23514556884765625, "learning_rate": 5.0185053662161756e-08, "loss": 0.1485, "num_tokens": 24456802.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.3230648040771484, "sampling/importance_sampling_ratio/mean": 1.0002883672714233, "sampling/importance_sampling_ratio/min": 0.8712531924247742, "sampling/sampling_logp_difference/max": 0.2799508571624756, "sampling/sampling_logp_difference/mean": 0.00963970273733139, "step": 983 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 807.0, "completions/max_terminated_length": 807.0, "completions/mean_length": 329.03125, "completions/mean_terminated_length": 329.03125, "completions/min_length": 58.0, "completions/min_terminated_length": 58.0, "entropy": 0.798469330649823, "epoch": 0.973293768545994, "grad_norm": 1.4469627141952515, "kl_approx": 0.21180343627929688, "learning_rate": 4.678634341683252e-08, "loss": 0.1708, "num_tokens": 24490539.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.269195556640625, "sampling/importance_sampling_ratio/mean": 1.0002142190933228, "sampling/importance_sampling_ratio/min": 0.7963486909866333, "sampling/sampling_logp_difference/max": 0.23838329315185547, "sampling/sampling_logp_difference/mean": 0.012370534241199493, "step": 984 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 511.0, "completions/max_terminated_length": 511.0, "completions/mean_length": 121.03125, "completions/mean_terminated_length": 121.03125, "completions/min_length": 42.0, "completions/min_terminated_length": 42.0, "entropy": 0.5885020401328802, "epoch": 0.9742828882294757, "grad_norm": 1.7140529155731201, "kl_approx": 0.1922149658203125, "learning_rate": 4.350652030981395e-08, "loss": 0.1439, "num_tokens": 24514204.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1609399318695068, "sampling/importance_sampling_ratio/mean": 1.0000945329666138, "sampling/importance_sampling_ratio/min": 0.8734341859817505, "sampling/sampling_logp_difference/max": 0.1492300033569336, "sampling/sampling_logp_difference/mean": 0.010811242274940014, "step": 985 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 422.0, "completions/max_terminated_length": 422.0, "completions/mean_length": 153.0, "completions/mean_terminated_length": 153.0, "completions/min_length": 71.0, "completions/min_terminated_length": 71.0, "entropy": 0.6563833756372333, "epoch": 0.9752720079129574, "grad_norm": 1.8417514562606812, "kl_approx": 0.22173690795898438, "learning_rate": 4.0345623517273894e-08, "loss": 0.1534, "num_tokens": 24542348.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2046340703964233, "sampling/importance_sampling_ratio/mean": 1.000075340270996, "sampling/importance_sampling_ratio/min": 0.8435268402099609, "sampling/sampling_logp_difference/max": 0.18617582321166992, "sampling/sampling_logp_difference/mean": 0.010524800978600979, "step": 986 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 493.0, "completions/max_terminated_length": 493.0, "completions/mean_length": 152.84375, "completions/mean_terminated_length": 152.84375, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.6364880530163646, "epoch": 0.9762611275964391, "grad_norm": 1.7201272249221802, "kl_approx": 0.173797607421875, "learning_rate": 3.7303690794854296e-08, "loss": 0.1195, "num_tokens": 24567271.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1898436546325684, "sampling/importance_sampling_ratio/mean": 0.999168336391449, "sampling/importance_sampling_ratio/min": 0.7966865301132202, "sampling/sampling_logp_difference/max": 0.2272939682006836, "sampling/sampling_logp_difference/mean": 0.011349533684551716, "step": 987 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 917.0, "completions/max_terminated_length": 917.0, "completions/mean_length": 252.0, "completions/mean_terminated_length": 252.0, "completions/min_length": 43.0, "completions/min_terminated_length": 43.0, "entropy": 0.6994048487395048, "epoch": 0.9772502472799208, "grad_norm": 1.7688238620758057, "kl_approx": 0.1878204345703125, "learning_rate": 3.438075847721933e-08, "loss": 0.1479, "num_tokens": 24591775.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2834646701812744, "sampling/importance_sampling_ratio/mean": 0.9999334812164307, "sampling/importance_sampling_ratio/min": 0.5614374876022339, "sampling/sampling_logp_difference/max": 0.5772548913955688, "sampling/sampling_logp_difference/mean": 0.010489544831216335, "step": 988 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 754.0, "completions/max_terminated_length": 754.0, "completions/mean_length": 234.46875, "completions/mean_terminated_length": 234.46875, "completions/min_length": 39.0, "completions/min_terminated_length": 39.0, "entropy": 0.5919672972522676, "epoch": 0.9782393669634025, "grad_norm": 1.537602186203003, "kl_approx": 0.16361236572265625, "learning_rate": 3.157686147762129e-08, "loss": 0.1252, "num_tokens": 24619206.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1493691205978394, "sampling/importance_sampling_ratio/mean": 0.9995216131210327, "sampling/importance_sampling_ratio/min": 0.7898876070976257, "sampling/sampling_logp_difference/max": 0.23586463928222656, "sampling/sampling_logp_difference/mean": 0.010408682748675346, "step": 989 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 953.0, "completions/max_terminated_length": 953.0, "completions/mean_length": 345.4375, "completions/mean_terminated_length": 345.4375, "completions/min_length": 133.0, "completions/min_terminated_length": 133.0, "entropy": 0.784648378379643, "epoch": 0.9792284866468842, "grad_norm": 1.6112598180770874, "kl_approx": 0.213592529296875, "learning_rate": 2.8892033287484245e-08, "loss": 0.1703, "num_tokens": 24649780.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1742395162582397, "sampling/importance_sampling_ratio/mean": 1.0002145767211914, "sampling/importance_sampling_ratio/min": 0.8252758383750916, "sampling/sampling_logp_difference/max": 0.19203758239746094, "sampling/sampling_logp_difference/mean": 0.012265671975910664, "step": 990 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 976.0, "completions/max_terminated_length": 976.0, "completions/mean_length": 264.0, "completions/mean_terminated_length": 264.0, "completions/min_length": 53.0, "completions/min_terminated_length": 53.0, "entropy": 0.7298152628354728, "epoch": 0.9802176063303659, "grad_norm": 1.8394131660461426, "kl_approx": 0.19173526763916016, "learning_rate": 2.6326305976001054e-08, "loss": 0.1431, "num_tokens": 24676444.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.201982021331787, "sampling/importance_sampling_ratio/mean": 1.0004396438598633, "sampling/importance_sampling_ratio/min": 0.8177673816680908, "sampling/sampling_logp_difference/max": 0.20117735862731934, "sampling/sampling_logp_difference/mean": 0.012242424301803112, "step": 991 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 622.0, "completions/max_terminated_length": 622.0, "completions/mean_length": 144.5, "completions/mean_terminated_length": 144.5, "completions/min_length": 48.0, "completions/min_terminated_length": 48.0, "entropy": 0.5722819902002811, "epoch": 0.9812067260138477, "grad_norm": 1.8028360605239868, "kl_approx": 0.17533493041992188, "learning_rate": 2.3879710189753657e-08, "loss": 0.1508, "num_tokens": 24702604.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1357208490371704, "sampling/importance_sampling_ratio/mean": 1.000217318534851, "sampling/importance_sampling_ratio/min": 0.8187824487686157, "sampling/sampling_logp_difference/max": 0.1999368667602539, "sampling/sampling_logp_difference/mean": 0.01066446490585804, "step": 992 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 458.0, "completions/max_terminated_length": 458.0, "completions/mean_length": 124.4375, "completions/mean_terminated_length": 124.4375, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.513925117906183, "epoch": 0.9821958456973294, "grad_norm": 2.1855881214141846, "kl_approx": 0.2623615264892578, "learning_rate": 2.1552275152346702e-08, "loss": 0.1179, "num_tokens": 24725522.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2607429027557373, "sampling/importance_sampling_ratio/mean": 1.0000072717666626, "sampling/importance_sampling_ratio/min": 0.8815239071846008, "sampling/sampling_logp_difference/max": 0.23170113563537598, "sampling/sampling_logp_difference/mean": 0.011145664379000664, "step": 993 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 409.0, "completions/max_terminated_length": 409.0, "completions/mean_length": 133.78125, "completions/mean_terminated_length": 133.78125, "completions/min_length": 61.0, "completions/min_terminated_length": 61.0, "entropy": 0.6583010009489954, "epoch": 0.9831849653808111, "grad_norm": 1.7632204294204712, "kl_approx": 0.1971282958984375, "learning_rate": 1.9344028664056715e-08, "loss": 0.1674, "num_tokens": 24752475.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1986687183380127, "sampling/importance_sampling_ratio/mean": 1.0004584789276123, "sampling/importance_sampling_ratio/min": 0.8595471978187561, "sampling/sampling_logp_difference/max": 0.1812114715576172, "sampling/sampling_logp_difference/mean": 0.010937416926026344, "step": 994 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 573.0, "completions/max_terminated_length": 573.0, "completions/mean_length": 218.0, "completions/mean_terminated_length": 218.0, "completions/min_length": 49.0, "completions/min_terminated_length": 49.0, "entropy": 0.7270508240908384, "epoch": 0.9841740850642928, "grad_norm": 1.53498375415802, "kl_approx": 0.17218780517578125, "learning_rate": 1.7254997101500137e-08, "loss": 0.1426, "num_tokens": 24778235.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1720354557037354, "sampling/importance_sampling_ratio/mean": 1.0001806020736694, "sampling/importance_sampling_ratio/min": 0.8518308997154236, "sampling/sampling_logp_difference/max": 0.16036725044250488, "sampling/sampling_logp_difference/mean": 0.012480583973228931, "step": 995 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 347.0, "completions/max_terminated_length": 347.0, "completions/mean_length": 118.40625, "completions/mean_terminated_length": 118.40625, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "entropy": 0.6511252350173891, "epoch": 0.9851632047477745, "grad_norm": 2.7405636310577393, "kl_approx": 0.2095203399658203, "learning_rate": 1.528520541731915e-08, "loss": 0.1726, "num_tokens": 24803672.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1789509057998657, "sampling/importance_sampling_ratio/mean": 0.9996357560157776, "sampling/importance_sampling_ratio/min": 0.844638466835022, "sampling/sampling_logp_difference/max": 0.16884660720825195, "sampling/sampling_logp_difference/mean": 0.011962532997131348, "step": 996 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 581.0, "completions/max_terminated_length": 581.0, "completions/mean_length": 230.6875, "completions/mean_terminated_length": 230.6875, "completions/min_length": 41.0, "completions/min_terminated_length": 41.0, "entropy": 0.9609584482386708, "epoch": 0.9861523244312562, "grad_norm": 1.9516595602035522, "kl_approx": 0.2140979766845703, "learning_rate": 1.3434677139885222e-08, "loss": 0.1887, "num_tokens": 24831542.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.2001813650131226, "sampling/importance_sampling_ratio/mean": 1.0000234842300415, "sampling/importance_sampling_ratio/min": 0.8389122486114502, "sampling/sampling_logp_difference/max": 0.18247270584106445, "sampling/sampling_logp_difference/mean": 0.015241241082549095, "step": 997 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 285.0, "completions/max_terminated_length": 285.0, "completions/mean_length": 123.375, "completions/mean_terminated_length": 123.375, "completions/min_length": 45.0, "completions/min_terminated_length": 45.0, "entropy": 0.7467370196245611, "epoch": 0.9871414441147379, "grad_norm": 1.8612608909606934, "kl_approx": 0.2292957305908203, "learning_rate": 1.170343437301491e-08, "loss": 0.1364, "num_tokens": 24853730.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1901915073394775, "sampling/importance_sampling_ratio/mean": 1.0002012252807617, "sampling/importance_sampling_ratio/min": 0.8882694244384766, "sampling/sampling_logp_difference/max": 0.17411422729492188, "sampling/sampling_logp_difference/mean": 0.012248518876731396, "step": 998 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 668.0, "completions/max_terminated_length": 668.0, "completions/mean_length": 293.1875, "completions/mean_terminated_length": 293.1875, "completions/min_length": 57.0, "completions/min_terminated_length": 57.0, "entropy": 0.9635864850133657, "epoch": 0.9881305637982196, "grad_norm": 1.6463755369186401, "kl_approx": 0.22088623046875, "learning_rate": 1.0091497795706728e-08, "loss": 0.171, "num_tokens": 24883760.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1962952613830566, "sampling/importance_sampling_ratio/mean": 1.0001121759414673, "sampling/importance_sampling_ratio/min": 0.8354349136352539, "sampling/sampling_logp_difference/max": 0.17980289459228516, "sampling/sampling_logp_difference/mean": 0.01303613930940628, "step": 999 }, { "completions/clipped_ratio": 0.0, "completions/max_length": 356.0, "completions/max_terminated_length": 356.0, "completions/mean_length": 150.4375, "completions/mean_terminated_length": 150.4375, "completions/min_length": 38.0, "completions/min_terminated_length": 38.0, "entropy": 0.5809380612336099, "epoch": 0.9891196834817013, "grad_norm": 1.3724782466888428, "kl_approx": 0.14629840850830078, "learning_rate": 8.59888666189579e-09, "loss": 0.1175, "num_tokens": 24908526.0, "rewards": 0.0, "sampling/importance_sampling_ratio/max": 1.1404168605804443, "sampling/importance_sampling_ratio/mean": 1.0001344680786133, "sampling/importance_sampling_ratio/min": 0.8559908866882324, "sampling/sampling_logp_difference/max": 0.1554955244064331, "sampling/sampling_logp_difference/mean": 0.009567873552441597, "step": 1000 } ], "logging_steps": 1, "max_steps": 1011, "num_input_tokens_seen": 24908526, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }